Gemini Omni 1.1 Flash llega a la API: videos 4K, interpolación y extensión de escenas

Gemini Omni 1.1 Flash ya está disponible como modelo de producción en la API de Gemini para crear flujos de video generativo con controles explícitos de resolución, interpolación, edición y extensión de escenas.

Esa es la parte que importa.

No “el video con IA mejoró”. Ese titular es demasiado amplio para ser útil.

El cambio relevante es que los desarrolladores ahora pueden apuntar a un modelo con nombre, gemini-omni-1.1-flash, y construir sobre comportamientos concretos de API: generar borradores en 360p, producir salidas finales en 1080p o 4K mediante upscaling, interpolar entre un primer y un último frame, continuar una escena desde un clip existente y editar videos generados a través de turnos.

Google anunció el lanzamiento el 27 de agosto de 2026 con esta frase: “Today, we’re introducing Gemini Omni 1.1 Flash”. Las notas de lanzamiento de la API de Gemini lo describen como un modelo generalmente disponible, no solo como una versión preliminar, y confirman que el endpoint anterior gemini-omni-flash-preview está programado para quedar obsoleto el 30 de septiembre de 2026.

Para desarrolladores en Iberoamerica que están construyendo herramientas creativas, flujos internos de medios, generadores de piezas de producto, sistemas de storyboard, asistentes de edición o prototipos audiovisuales, la señal es clara: el video generativo empieza a parecerse menos a una caja de demos y más a una tubería programable.

¿Qué es Gemini Omni 1.1 Flash?

Gemini Omni 1.1 Flash es el modelo rápido de Google para generación y edición conversacional de video desde la API de Gemini, disponible con el ID gemini-omni-1.1-flash.

El modelo acepta texto, imágenes y video como entrada, y devuelve video como salida. La página de modelo de Google lista soporte para videos de salida de 3 a 10 segundos, 24 FPS y resoluciones de 360p, 720p, 1080p y 4K. Esa misma página lo describe con soporte para extensión de video, upscaling de resolución e interpolación avanzada.

Eso lo separa de un endpoint simple de texto a video.

La forma de la API se acerca más a un sistema creativo con estado. Puedes generar un clip, conservar el ID de interacción y pedir ediciones posteriores sin volver a subir ni redescribir todo. Puedes proporcionar imágenes de referencia. Puedes subir un video y pedir una edición. Puedes pasar dos imágenes y pedirle al modelo que genere la transición entre ambas.

Para quienes construyen aplicaciones, esos detalles importan más que la calidad de una demo aislada. Un flujo necesita manijas. Necesita parámetros. Necesita primitivas repetibles que puedan convertirse en interfaz de producto.

Omni 1.1 Flash entrega más de esas manijas.

¿Cómo usar Gemini Omni Flash API?

Puedes usar Gemini Omni 1.1 Flash desde la Interactions API de Gemini llamando al modelo gemini-omni-1.1-flash.

La documentación oficial muestra ejemplos en Python, JavaScript y REST. La versión más simple es un prompt de texto con formato de respuesta de video. Para controlar resolución, la documentación muestra response_format con una resolución como 1080p.

Los controles de API que conviene mirar primero son:

  • model: "gemini-omni-1.1-flash"
  • response_format
  • resolution
  • previous_interaction_id para edición con estado
  • entradas de imagen para image-to-video e interpolación
  • videos subidos mediante Files API
  • pistas opcionales de tarea como image_to_video, edit o extend

La documentación de Google recomienda depender primero del prompt y usar el parámetro task solo cuando el modelo necesita ayuda para elegir el modo correcto, porque fijar task agrega restricciones.

Esa es una señal útil de diseño de producto.

Si construyes una herramienta para desarrolladores o creadores, probablemente no quieras que cada acción del usuario se convierta en un selector rígido de tareas. Una buena interfaz puede exponer presets como “extender este clip”, “crear una transición” o “generar un borrador”, mientras deja que el prompt cargue la intención creativa.

¿Qué cambia con videos 360p y 4K en Gemini Omni Flash?

El cambio de workflow es que Gemini Omni 1.1 Flash separa la calidad de iteración de la calidad final.

Google dice que las previews en 360p pueden generarse hasta 60% más rápido que 720p y a un tercio del costo frente a la resolución estándar de 720p de Omni 1.1. La resolución predeterminada es 720p, mientras que 1080p y 4K están disponibles como salidas generadas mediante upscaling.

Eso no es solo un detalle de precio. Cambia cómo puede sentirse un producto de video.

Un flujo serio de video generativo casi nunca acierta en el primer resultado. Los usuarios prueban prompts, movimiento de cámara, iluminación, timing, comportamiento del sujeto, referencias, restricciones de marca y continuidad de escena. Si cada intento es lento y caro, el producto se vuelve cauteloso. Si los borradores son más rápidos y baratos, el producto puede fomentar exploración.

Una aplicación bien diseñada alrededor de esto probablemente no empezaría con “genera un clip 4K perfecto”.

Empezaría con ciclos de borrador:

  1. Generar tres o cuatro variantes en 360p.
  2. Compararlas lado a lado.
  3. Conservar la dirección más prometedora.
  4. Refinar el prompt o los medios de referencia.
  5. Extender o editar el resultado elegido.
  6. Subir resolución solo cuando la dirección creativa esté estable.

Ese es el ángulo para desarrolladores. La resolución no es solamente una opción de render. Se vuelve parte del workflow del producto.

¿Cómo funciona la interpolación de video con IA?

La interpolación de primer y último frame permite pasar dos imágenes a Gemini Omni Flash y pedirle que genere la transición de video entre ambas.

La documentación de Google describe el patrón de forma directa: proporcionas dos imágenes en la lista de entrada, describes la transición deseada y el modelo anima desde el primer frame hasta el frame final.

Esto es útil porque muchos flujos creativos reales ya piensan en keyframes.

Un diseñador puede tener una toma de producto al inicio y una composición deseada al final. Un equipo de marketing puede querer una revelación de marca que empiece en un objeto y termine en un frame con logo. Un editor de video puede necesitar un movimiento suave de cámara entre dos estados visuales. Un equipo de ecommerce o juegos puede querer una vista que rote o transforme un objeto sin perder su identidad.

Sin interpolación, el usuario espera que un prompt acierte el inicio y el final. Con interpolación, la aplicación puede permitir que el usuario fije ambos extremos y pedirle al modelo que resuelva el movimiento entre ellos.

Eso convierte el video generativo en una forma más dirigida de generación multimedia.

No es determinístico, claro. Pero es mucho más controlable que depender solo de texto.

¿Cómo extender video con IA usando Gemini Omni Flash?

La extensión de escenas permite que Gemini Omni 1.1 Flash continúe un video existente generando una nueva continuación al final del clip.

El anuncio de Google dice que Omni 1.1 puede analizar hasta 10 segundos de contexto previo y extender videos en incrementos de 10 segundos hasta una duración acumulada total de 40 segundos. La documentación de API describe la extensión como una continuación de 3 a 10 segundos desde el final de un clip existente.

Hay dos caminos prácticos.

Si el video fue generado por el modelo, puedes continuar el flujo con edición multi-turn usando previous_interaction_id. Si el video viene de fuera de la interacción actual, puedes subirlo mediante Files API y pasarlo junto a un prompt de extensión.

Eso vuelve útil la extensión para algo más que “hacer el clip más largo”.

Un desarrollador puede construir storyboards ramificados, conceptos iterativos de anuncios, recorridos de producto, visuales para lecciones, previews inmobiliarias, cinemáticas de juegos o clips de entrenamiento donde el usuario sigue guiando el siguiente segmento. La unidad de trabajo deja de ser un prompt aislado y pasa a ser una secuencia de generaciones controladas.

La advertencia es importante: la extensión solo agrega contenido al final. La documentación de Google dice que no puedes anteponer contenido ni extender la mitad de un clip. También dice que los videos subidos para extensión deben durar 10 segundos o menos, salvo en flujos multi-turn. Además, al momento de publicar esta nota, editar o extender videos subidos no está disponible para usuarios en el Espacio Económico Europeo, Suiza y el Reino Unido, aunque la edición o extensión de videos generados por el modelo sí está soportada.

Eso debería moldear cómo se presenta la función en una interfaz. “Continuar esta escena” es correcto. “Editar cualquier parte de cualquier video” no lo es.

¿Qué revisar antes de llevar Gemini Omni Flash a producción?

Antes de llevar Gemini Omni 1.1 Flash a producción, conviene tratarlo como un modelo API listo para usar, pero con detalles operativos sensibles al tiempo.

Al 28 de agosto de 2026, el ID de modelo en la documentación es gemini-omni-1.1-flash. Las notas de lanzamiento dicen que el endpoint preliminar anterior, gemini-omni-flash-preview, quedará obsoleto el 30 de septiembre de 2026. La documentación también muestra varios comportamientos que importan para arquitectura de producto.

Primero, las salidas grandes de video necesitan recuperación cuidadosa. La documentación recomienda entrega por URI para videos mayores a 4 MB, especialmente por encima de 720p cuando esté disponible. Eso significa que una app de producción debería pensar en manejo asíncrono, polling, estados fallidos, almacenamiento, reintentos y progreso visible para el usuario.

Segundo, la edición con estado depende de decisiones de almacenamiento. La documentación señala que usar store=false puede mejorar la generación síncrona más rápida, pero también impide editar después el video generado mediante previous_interaction_id. Esa es una decisión de producto, no solo una optimización.

Tercero, las restricciones regionales importan. La edición y extensión de videos subidos no están disponibles en todos los mercados. Si tu base de usuarios incluye Europa, Suiza o el Reino Unido, la interfaz y la documentación necesitan distinguir entre workflows con videos generados y workflows con videos subidos.

Cuarto, los precios deben revisarse antes de publicar una calculadora o comprometer márgenes. El anuncio de Google da la comparación de borradores en 360p, pero las superficies de precios y versiones pueden cambiar rápido alrededor de modelos multimedia recién declarados GA.

Por último, esto sigue siendo medios generativos. Los desarrolladores necesitan flujos de revisión, límites de moderación, validación de derechos sobre medios subidos y etiquetas claras para explicar qué fue generado, editado, extendido o escalado.

El modelo te da más control. No elimina la responsabilidad de producto.

¿Por qué importa para las herramientas de IA para desarrolladores?

Gemini Omni 1.1 Flash importa porque la generación de video empieza a exponer los controles que los desarrolladores necesitan para construir herramientas reales.

La primera ola de productos de video con IA fue principalmente cajas de prompt y galerías. Eso sirve para demos, pero queda corto para software. Los desarrolladores necesitan estado, referencias, borradores, renders finales, configuración explícita de salida, modos específicos, manejo de archivos y restricciones que puedan mapearse a decisiones de interfaz.

Omni 1.1 Flash se mueve en esa dirección.

Le da a un equipo de producto suficiente estructura para construir un workflow creativo real:

  • Una sala de borradores usando 360p.
  • Un camino de render final usando 1080p o 4K.
  • Una herramienta de transición por keyframes usando interpolación.
  • Una función para continuar escenas usando extensión.
  • Un editor conversacional usando previous_interaction_id.
  • Una tubería de archivos para videos de referencia subidos.
  • Un historial de generación que puede preservar o descartar editabilidad según lo que necesite el producto.

Por eso este lanzamiento vale la pena para desarrolladores.

El titular de mercado será “el video con IA de Google mejoró”. El titular técnico es más preciso: el modelo de video con IA de Google se está convirtiendo en una superficie de API sobre la que se pueden construir productos.

Esa es la señal que conviene seguir.

También encaja con una línea más amplia de Google en herramientas para desarrolladores. En yoDEV ya vimos cómo Gemini 3.7 Flash apunta al costo y rendimiento de modelos para trabajo agéntico, cómo Gemini 3.1 Ultra empuja contexto y ejecución nativa, y cómo Antigravity 2.0 muestra que la API puede ser más importante que la demo de superficie.

Con Omni 1.1 Flash, esa misma lógica llega al video.

1 me gusta