JOURNAL / 2026.08.28
Gemini Omni 1.1 Flash lleva el vídeo generativo editable a una API estable
Google convierte su modelo de vídeo conversacional en un componente programable con extensión, interpolación y varias resoluciones; el cambio abre flujos nuevos, aunque la evidencia pública aún no permite medir su fiabilidad.
En mayo, Google presentó Gemini Omni Flash como un modelo capaz de recibir texto, imágenes, audio o vídeo y devolver vídeo con sonido. Pero el acceso inicial estaba concentrado en Gemini, Flow y YouTube. El 27 de agosto llegó el cambio que más importa para quien construye: Gemini Omni 1.1 Flash ya tiene un identificador estable en la API de Gemini, documentación de integración y controles que permiten tratar la generación como una secuencia, no sólo como una petición que produce un clip.
La novedad no consiste simplemente en más resolución. Omni 1.1 puede continuar una escena en tramos de diez segundos hasta alcanzar cuarenta, interpolar el movimiento entre una imagen inicial y otra final, usar fragmentos de vídeo como referencia y conservar el estado entre ediciones mediante el identificador de la interacción anterior. El modelo genera clips de tres a diez segundos a 24 fotogramas por segundo. Admite 360p y 720p, mientras que las salidas de 1080p y 4K son reescaladas: “4K” describe el archivo entregado, no prueba que el modelo sintetice detalle nativo a esa resolución.
El producto nuevo es el bucle
La primera versión ya permitía editar por conversación. Lo material de 1.1 es que esa idea aparece ahora como una superficie de desarrollo reproducible. Una aplicación puede generar un borrador, conservar su estado, pedir un cambio y encadenar otra escena sin volver a subir el vídeo anterior. Puede también fijar los dos extremos de un plano y dejar que el modelo construya el recorrido intermedio. No sustituye a una línea de tiempo de edición: la extensión sólo se añade al final y cada turno vuelve a generar vídeo. Sí ofrece piezas con las que crear un editor, un generador de anuncios con variantes, una herramienta de previsualización o un sistema de storyboards.
Ese último caso explica mejor la opción de 360p. Según Google, generar a esa resolución alcanza hasta un 60% más de velocidad de sistema y cuesta un tercio que hacerlo a 720p. Es una medición interna y no dice cuántos intentos necesita una escena buena, pero convierte la resolución en una decisión del proceso: explorar barato, comparar variantes y pagar por el reescalado sólo después de escoger. La reducción útil de coste no está necesariamente en que cada píxel sea más barato, sino en descartar antes las direcciones que no funcionan.
La extensión también intenta atacar un fallo estructural del vídeo generado. Google dice que Omni 1.1 examina hasta diez segundos del contexto previo, frente al último segundo que tomaban modelos anteriores, para mantener mejor personajes y narrativa. Más contexto puede ayudar, pero cuarenta segundos siguen siendo cuatro generaciones enlazadas. Cada transición es otra oportunidad para que cambien un rostro, un objeto, la geometría o el ritmo. La longitud máxima es una capacidad del flujo; no es una medición de coherencia durante cuarenta segundos.
Una API estable con evidencia todavía de demostración
La documentación de la API clasifica gemini-omni-1.1-flash como versión estable y anuncia la retirada del endpoint preliminar el 30 de septiembre. La superficie equivalente en Gemini Enterprise Agent Platform figura por separado como preview. No es una contradicción sobre el modelo: son canales con compromisos de producto distintos. Para un equipo, la consecuencia práctica es comprobar el canal exacto, la región y las garantías operativas antes de confundir “estable” con disponibilidad idéntica en todo Google Cloud.
La estabilidad tampoco certifica la calidad. El anuncio contiene ejemplos seleccionados por Google y testimonios de integradores, pero no publica una evaluación comparativa de 1.1, tasas de éxito para extensión o edición, ni variación entre intentos. La tarjeta del modelo enumera evaluación humana, pruebas automatizadas y red teaming sin mostrar conjuntos, resultados o diferencias entre la versión de mayo y la de agosto. Reconoce dificultades persistentes con el movimiento complejo, la consistencia a través de ediciones y el texto exacto. Eso es suficiente para saber qué probar; no para estimar cuántas generaciones fallarán en un producto concreto.
También hay límites que importan más que una demostración vistosa. La API no permite editar voces ni cargar referencias de audio, ignora el sonido de los vídeos usados como referencia y sólo ha evaluado formalmente el inglés. En el Espacio Económico Europeo, Suiza y Reino Unido se puede extender vídeo generado por el propio modelo, pero no editar o prolongar vídeo subido por el usuario. Las entradas para edición o extensión se limitan normalmente a diez segundos, y no se puede insertar material al principio o en medio de un clip.
Todos los vídeos generados incluyen la marca invisible SynthID y pasan por filtros de entrada y salida. Es una capa útil de procedencia dentro del ecosistema de Google, no una garantía de que la marca sobreviva a cualquier transcodificación ni una defensa completa frente a usos engañosos. La propia tarjeta afirma que el modelo puede cambiar el habla de una persona, pero que Google restringe esa capacidad mientras la estudia. En este caso, la ausencia de una opción en la API es parte del diseño de seguridad, no sólo una función pendiente.
Mi lectura es que Omni 1.1 importa porque mueve el vídeo generativo desde el escaparate hacia la composición de software. La interpolación, el estado conversacional, los borradores baratos y la extensión son interfaces de control; juntas permiten que un desarrollador organice búsqueda, revisión y selección alrededor del modelo. Ese cambio suele ser más fértil que otra mejora no verificable de “calidad cinematográfica”.
Pero también traslada la responsabilidad. Quien integre Omni necesita una colección propia de escenas difíciles, medir conservación de identidad y de objetos entre turnos, registrar cuántos intentos se descartan y decidir cuándo el reescalado aporta valor real. Necesita además conservar la procedencia fuera del primer archivo generado. Google ha publicado una herramienta con la que ya se pueden construir flujos nuevos. Lo que no ha publicado es la evidencia para asumir que esos flujos serán fiables sin una capa editorial y de evaluación alrededor.
Fuentes
- Google, Gemini Omni 1.1 Flash lets you build with more control, 27 de agosto de 2026.
- Google AI for Developers, documentación para generar y editar vídeo con Gemini Omni Flash y ficha del endpoint estable, actualizadas el 27 de agosto de 2026.
- Google DeepMind, tarjeta de modelo de Gemini Omni Flash y Omni 1.1 Flash, actualizada en agosto de 2026.
- Google, Introducing Gemini Omni, mayo de 2026.
- Google AI for Developers, notas de versión de la API de Gemini, 27 de agosto de 2026.