HeadlinesBriefing favicon HeadlinesBriefing.com

Ko-Direktur Video AI: Otomatisasi

Google AI Blog •
×

Kemajuan terbaru dalam difusi video menunjukkan generasi dengan ketepatan tinggi yang luar biasa, tetapi mengubah klip menjadi mesin bercerita panjang yang koheren tetap menantang. Sebagian besar pipeline agen yang ada menderita penyimpangan semantik dan kegagalan berjenjang karena prompt yang independen dan dibuat manual, sering kali memerlukan intervensi manual yang ekstensif. Metode yang ada juga menghadapi penyimpangan fitur dan keruntuhan konten.

Hari ini, kami memperkenalkan penelitian kami tentang ko-direktur video AI, kerangka kerja multi-agen terpadu yang secara eksplisit merencanakan kontinuitas visual dalam narasi multi-shot. Dibangun sebagai lapisan orkestrasi di atas Gemini dan Veo, kerangka kerja ini secara alami mewarisi mekanisme keamanan seperti watermarking Synth ID. Kami telah mengembangkan kerangka kerja — Co-Director (akan muncul di COLM 2026), CANVAS (akan muncul di EMNLP 2026), A²RD, dan VQQA — yang menerjemahkan spesifikasi kreatif manusia tingkat tinggi menjadi eksekusi.

Kerangka kerja ini bertindak sebagai mitra kreatif yang responsif yang mengabstraksi beban mempertahankan kontinuitas visual. Melalui evaluasi komprehensif, kerangka kerja kami menunjukkan peningkatan substansial dalam konsistensi naratif multi-shot dan persistensi karakter, berhasil menghasilkan video berdurasi menit sambil mengurangi penyimpangan visual dan propagasi kesalahan pipeline.

Untuk memastikan koherensi semantik, kami menyajikan ko-direktur video AI, kerangka kerja multi-agen hierarkis yang memformalkan penceritaan video sebagai masalah optimasi global. Pengarahan dari atas ke bawah ini memastikan seluruh pipeline beroperasi di bawah visi terpadu, memasukkan prompt terstruktur ke model Gemini dan Veo.

Entitas kunci: Perusahaan: Google