Con la llegada de Gemini Omni 1.1 Flash Google da un paso adelante en la generación de vídeo con inteligencia artificial, permitiendo estirar las escenas hasta los 40 segundos sin que se pierda la coherencia visual. La nueva versión suma además control por fotogramas clave y escalado a 4K, dos funciones que amplían bastante el margen de trabajo para quienes producen contenido audiovisual apoyándose en estas herramientas.
Durante mucho tiempo la generación de vídeo con IA chocaba siempre contra el mismo muro. La memoria del modelo apenas llegaba para recordar el último segundo de metraje, así que cualquier continuación terminaba rompiendo la iluminación, el movimiento o la identidad de los personajes en pantalla. Con Omni 1.1 Flash la cosa cambia. Google amplía esa ventana de análisis a los diez segundos previos del vídeo original, frente al único segundo que procesaba la versión anterior. Ese salto es lo que permite mantener la física de una escena y su consistencia visual al generar el siguiente tramo, en lugar de improvisar sobre un fotograma suelto.
Extensión de escenas en bloques de diez segundos
El modelo puede levantar secuencias de hasta 40 segundos, pero no lo hace todo de golpe. Omni 1.1 Flash genera el vídeo en fragmentos de diez segundos que se van encadenando, y cada bloque nuevo toma como referencia el tramo justo anterior. Este método escalonado tiene una ventaja clara. Deja margen para revisar el resultado antes de seguir generando y evita que un error de un fragmento se arrastre por el resto de la secuencia.
A esa mejora se le añade la interpolación de fotograma inicial y final. Basta con subir una imagen que marque el arranque del plano y otra que marque el cierre para que el modelo calcule el movimiento intermedio entre las dos. Google plantea usos como órbitas de cámara, zooms, transiciones entre planos o bucles que deben encajar con un punto de partida y otro de llegada concretos. El sistema conserva también la edición conversacional de versiones anteriores, así que se pueden pedir cambios sobre un clip ya generado sin arrancar el proceso desde cero.
Escalado a 4K y precios por segundo de vídeo
La resolución por defecto sigue siendo 720p, con 360p disponible para pruebas rápidas. Tanto 1080p como 4K se consiguen mediante upscaling a partir de esa base, según recoge la documentación de la API de Gemini. El modelo no genera esos píxeles de forma nativa, los amplía después. Conviene tener presente este matiz antes de valorar la nitidez real del resultado que se va a obtener.
Google ha fijado un precio distinto para cada resolución, lo que permite ajustar el gasto según la fase del proyecto y la calidad final que se necesite en cada momento.
Fuente
Imagen: softzone.es
