HeadlinesBriefing favicon HeadlinesBriefing.com

AI ভিডিও সহ-পরিচালক: স্বয়ংক্রিয়করণ

Google AI Blog •
×

ভিডিও ডিফিউশনে সাম্প্রতিক অগ্রগতি উল্লেখযোগ্য উচ্চ-বিশ্বস্ততা প্রজন্ম প্রদর্শন করে, কিন্তু ক্লিপগুলিকে সুসংগত দীর্ঘ গল্প বলার ইঞ্জিনে রূপান্তর করা চ্যালেঞ্জিং থেকে যায়। বেশিরভাগ বিদ্যমান এজেন্টিক পাইপলাইন স্বাধীন, হাতে তৈরি প্রম্পটিংয়ের কারণে শব্দার্থিক প্রবাহ এবং ক্যাসকেডিং ব্যর্থতায় ভোগে, প্রায়শই ব্যাপক ম্যানুয়াল হস্তক্ষেপের প্রয়োজন হয়। বিদ্যমান পদ্ধতিগুলি বৈশিষ্ট্য প্রবাহ এবং বিষয়বস্তু পতনেরও সম্মুখীন হয়।

আজ, আমরা আমাদের গবেষণা উপস্থাপন করছি একটি AI ভিডিও সহ-পরিচালক, একটি একীভূত, বহু-এজেন্ট ফ্রেমওয়ার্ক যা মাল্টি-শট বর্ণনায় দৃশ্যমান ধারাবাহিকতা স্পষ্টভাবে পরিকল্পনা করে। Gemini এবং Veo-এর উপরে একটি অর্কেস্ট্রেশন স্তর হিসাবে নির্মিত, এই ফ্রেমওয়ার্কটি Synth ID ওয়াটারমার্কিংয়ের মতো সুরক্ষা প্রক্রিয়াগুলি স্বাভাবিকভাবে উত্তরাধিকার সূত্রে পায়। আমরা ফ্রেমওয়ার্ক তৈরি করেছি — Co-Director (COLM 2026-এ প্রদর্শিত হবে), CANVAS (EMNLP 2026-এ প্রদর্শিত হবে), A²RD, এবং VQQA — যা উচ্চ-স্তরের মানব সৃজনশীল নির্দিষ্টতাকে কার্যকরী অনুবাদ করে।

এই ফ্রেমওয়ার্কগুলি প্রতিক্রিয়াশীল সৃজনশীল অংশীদার হিসাবে কাজ করে যা দৃশ্যমান ধারাবাহিকতা বজায় রাখার বোঝা বিমূর্ত করে। বিস্তৃত মূল্যায়নে, আমাদের ফ্রেমওয়ার্ক মাল্টি-শট বর্ণনামূলক ধারাবাহিকতা এবং চরিত্র অধ্যবসায়ে যথেষ্ট লাভ প্রদর্শন করে, সফলভাবে মিনিট-দীর্ঘ ভিডিও তৈরি করে যখন দৃশ্যমান প্রবাহ এবং পাইপলাইন ত্রুটি বিস্তার হ্রাস করে।

শব্দার্থিক সুসংগততা নিশ্চিত করতে, আমরা AI ভিডিও সহ-পরিচালক উপস্থাপন করছি, একটি শ্রেণিবদ্ধ বহু-এজেন্ট ফ্রেমওয়ার্ক যা ভিডিও গল্প বলাকে একটি বৈশ্বিক অপ্টিমাইজেশন সমস্যা হিসাবে আনুষ্ঠানিক করে। এই উপর-থেকে-নীচ স্টিয়ারিং নিশ্চিত করে যে পুরো পাইপলাইন একটি একীভূত দৃষ্টিভঙ্গির অধীনে কাজ করে, Gemini এবং Veo মডেলগুলিতে কাঠামোগত প্রম্পট খাওয়ায়।

মূল সত্তা: কোম্পানি: Google