HeadlinesBriefing favicon HeadlinesBriefing.com

ИИ-сорежиссёр видео: автоматизация

Google AI Blog •
×

Недавние достижения в диффузии видео демонстрируют замечательную генерацию с высокой точностью, но преобразование клипов в связные движки длинного повествования остается сложной задачей. Большинство существующих агентных конвейеров страдают от семантического дрейфа и каскадных сбоев из-за независимых, ручных подсказок, часто требующих исчерпывающего ручного вмешательства. Существующие методы также сталкиваются с дрейфом признаков и коллапсом контента.

Сегодня мы представляем наше исследование ИИ-сорежиссёра видео, единой мультиагентной структуры, которая явно планирует визуальную непрерывность в многосценных повествованиях. Построенная как оркестрационный слой поверх Gemini и Veo, эта структура изначально наследует механизмы безопасности, такие как водяной знак Synth ID. Мы разработали структуры — Co-Director (появится на COLM 2026), CANVAS (появится на EMNLP 2026), A²RD и VQQA — которые переводят высокоуровневые человеческие творческие спецификации в исполнение.

Эти структуры действуют как отзывчивые творческие партнеры, которые абстрагируют бремя поддержания визуальной непрерывности. В ходе всесторонних оценок наша структура демонстрирует существенные улучшения в согласованности многосценного повествования и устойчивости персонажей, успешно генерируя видео длительностью в минуты, смягчая визуальный дрейф и распространение ошибок в конвейере.

Для обеспечения семантической согласованности мы представляем ИИ-сорежиссёра видео, иерархическую мультиагентную структуру, формализующую видеоповествование как глобальную задачу оптимизации. Это управление сверху вниз гарантирует, что весь конвейер работает под единым видением, подавая структурированные подсказки в модели Gemini и Veo.

Ключевые субъекты: Компании: Google