Nogales, AlbertoSánchez Velázquez, Jose M.Cai, MingboConey, AndrewGarcía-Tejedor, Álvaro J.2026-09-302026-09-302026-10Nogales, A, Sánchez Velázquez, J M, Cai, M, Coney, A & García-Tejedor, Á J 2026, 'Lightweight hybrid spatiotemporal deep learning models for video frame prediction : A comparative study across dataset complexities', Image and Vision Computing, vol. 174, 106116. https://doi.org/10.1016/j.imavis.2026.1061160262-8856https://hdl.handle.net/10641/8382Publisher Copyright: © 2026 The Authors. Published by Elsevier B.V. This is an open access article under the CC BY-NC-ND license. http://creativecommons.org/licenses/by-nc-nd/4.0/En los últimos años, los avances en inteligencia artificial han impactado significativamente la visión por computador, permitiendo soluciones a tareas complejas como la predicción de fotogramas de vídeo. Esta tarea tiene aplicaciones críticas en ámbitos como los vehículos autónomos, la predicción meteorológica y la compresión de vídeo. Aunque el aprendizaje profundo ha demostrado ser eficaz en la modelización espaciotemporal, las arquitecturas actuales a menudo enfrentan compromisos entre la precisión de la predicción y la eficiencia computacional. Para abordar este desafío, este estudio evalúa modelos híbridos ligeros de aprendizaje profundo que operan a nivel del mapa de características, utilizando autoencoders para la codificación espacial y el modelado de secuencias temporales mediante memoria a corto-largo plazo convolucional (ConvLSTM; Convolutional Long Short-Term Memory), redes neuronales convolucionales 3D (CNN 3D; 3D Convolutional Neural Networks) y arquitecturas temporales relacionadas. Las soluciones propuestas se prueban en términos de rendimiento, latencia y consumo energético en tres conjuntos de datos de complejidad variable, que abarcan escenas sintéticas y del mundo real, así como imágenes en escala de grises y a color. Los resultados muestran que las arquitecturas basadas en CNN 3D y ConvLSTM superan a otros enfoques en conjuntos de datos del mundo real de baja complejidad. Además, los modelos propuestos reducen significativamente el tiempo de inferencia y el consumo energético, ventajas clave para su despliegue práctico en escenarios como la transmisión de vídeo o los sistemas de visión embebida. [Traducción automática al español; idioma original: inglés.]In recent years, advances in Artificial Intelligence have significantly impacted computer vision, enabling solutions to complex tasks such as video frame prediction. This task has critical applications in domains like autonomous cars, weather forecasting, and video compression. While Deep Learning has proven effective in spatiotemporal modeling, current architectures often face trade-offs between prediction accuracy and computational efficiency. To address this challenge, this study evaluates lightweight hybrid deep learning models that operate at the feature-map level, using autoencoders for spatial encoding and temporal sequence modeling through Convolutional Long Short-Term Memory (ConvLSTM), 3D Convolutional Neural Networks (3D CNNs), and related temporal architectures. The proposed solutions are tested in terms of performance, latency and energy consumption on three datasets of varying complexity, encompassing synthetic and real-world scenes, as well as grayscale and color imagery. Results show that architectures based on 3D CNNs and ConvLSTMs outperform other approaches on low-complexity real-world datasets. Moreover, the proposed models significantly reduce inference time and energy consumption, key advantages for practical deployment in scenarios such as video streaming or embedded vision systems.111691697enghttp://creativecommons.org/licenses/by-nc-nd/4.0/Artificial intelligenceComputer visionDeep learningFeature extractionTemporal sequence analysisVideo frame predictionSignal ProcessingComputer Vision and Pattern RecognitionSDG 7 - Affordable and Clean EnergyYesLightweight hybrid spatiotemporal deep learning models for video frame prediction : A comparative study across dataset complexitiesModelos de aprendizaje profundo espaciotemporales híbridos ligeros para la predicción de fotogramas de vídeoUn estudio comparativo entre complejidades de conjuntos de datosjournal articleopen access10.1016/j.imavis.2026.106116https://www.scopus.com/pages/publications/105044184475https://www.scopus.com/pages/publications/105044184475#tab=citedBy