HeadlinesBriefing favicon HeadlinesBriefing.com

Co-Director de Video con IA: Automatización

Google AI Blog •
×

Los avances recientes en difusión de video demuestran una generación de alta fidelidad notable, pero transformar clips en motores de narración larga coherentes sigue siendo un desafío. La mayoría de los pipelines agénticos existentes sufren de deriva semántica y fallos en cascada debido a indicaciones independientes y artesanales, a menudo requiriendo una intervención manual exhaustiva. Los métodos existentes también enfrentan deriva de características y colapso de contenido.

Hoy, presentamos nuestra investigación sobre un co-director de video con IA, un marco unificado multi-agente que planifica explícitamente la continuidad visual en narrativas de múltiples tomas. Construido como una capa de orquestación sobre Gemini y Veo, este marco hereda nativamente mecanismos de seguridad como la marca de agua Synth ID. Hemos desarrollado marcos — Co-Director (aparecerá en COLM 2026), CANVAS (aparecerá en EMNLP 2026), A²RD y VQQA — que traducen la especificación creativa humana de alto nivel en ejecución.

Estos marcos actúan como socios creativos receptivos que abstraen las cargas de mantener la continuidad visual. En evaluaciones integrales, nuestro marco demuestra ganancias sustanciales en consistencia narrativa multi-toma y persistencia de personajes, generando con éxito videos de minutos de duración mientras mitiga la deriva visual y la propagación de errores en el pipeline.

Para asegurar la coherencia semántica, presentamos el co-director de video con IA, un marco jerárquico multi-agente que formaliza la narración de video como un problema de optimización global. Esta dirección de arriba hacia abajo garantiza que todo el pipeline opere bajo una visión unificada, alimentando indicaciones estructuradas a los modelos Gemini y Veo.

Entidades clave: Empresas: Google