HeadlinesBriefing favicon HeadlinesBriefing.com

गूगल डीपमाइंड ने जेमिनी के लिए एजेंटिक वीडियो समझ लॉन्च की

Google DeepMind Blog •
×

गूगल डीपमाइंड ने जेमिनी 3.7 फ्लैश, 3.6 फ्लैश और 3.5 फ्लैश-लाइट मॉडल में एजेंटिक वीडियो समझ फीचर लॉन्च किया है, जिससे टोकन खपत में 88% तक की कमी आई है, लागत में 66% तक की कमी आई है और सटीकता में 7% तक की वृद्धि हुई है। निश्चित फ्रेम दर पर स्थैतिक प्रसंस्करण के विपरीत, यह सुविधा जेमिनी को एक एजेंटिक लूप के माध्यम से दृश्य फ्रेम, ऑडियो और ट्रांस्क्रिप्ट्स में वीडियो सेगमेंट्स को डायनामिक रूप से खोजने, स्कैन करने और निरीक्षण करने की अनुमति देती है।

बेंचमार्क दर्शाते हैं कि दक्षता में वृद्धि लंबे रूप की सामग्री पर सबसे अधिक स्पष्ट है — 10 मिनट के गाइड से लेकर कई घंटे की रिकॉर्डिंग तक — जहां डेवलपर्स पहले उच्च टोकन लागत और विवरण खोने के बीच ट्रेड-ऑफ का सामना करते थे। एजेंटिक समझ के साथ जेमिनी 3.7 फ्लैश अब वीडियो विश्लेषण के लिए सटीकता-लागत पैरेतो सीमा पर स्थित है।

मुख्य क्षमताओं में शामिल हैं: सटीक संपादन के लिए उप-सेकंड क्षण पुनःप्राप्ति; कई घंटे के वीडियो में सुई के ढेर में खोज; उच्च-FPS पुनर्नमूने के माध्यम से असामान्यता का पता लगाना; और कार्यों और वस्तुओं की सटीक गणना। प्रारंभिक एक्सेस पार्टनर्स ने मजबूत परिणाम बताए। यह सुविधा आज जेमिनी API के माध्यम से गूगल एआई स्टूडियो और जेमिनी एंटरप्राइज एजेंट प्लेटफॉर्म पर उपलब्ध है, जो वीडियो अपलोड और यूट्यूब वीडियो के लिए है।

मुख्य इकाइयाँ: कंपनियाँ: गूगल डीपमाइंड, गूगल एआई स्टूडियो, जेमिनी एंटरप्राइज एजेंट प्लेटफॉर्म | व्यक्ति: मारियो लूचिच

अक्सर पूछे जाने वाले प्रश्न: एजेंटिक वीडियो समझ स्थैतिक प्रसंस्करण की तुलना में टोकन उपयोग को कैसे कम करती है?

स्थिर फ्रेम दर पर वीडियो ingest करने के बजाय, एजेंटिक वीडियो समझ जेमिनी को केवल उन संबंधित फ्रेम, ऑडियो या ट्रांस्क्रिप्ट सेगमेंट को डायनामिक रूप से लाने की अनुमति देती है जो एक प्रश्न का उत्तर देने के लिए आवश्यक हैं, जिससे लंबे रूप के वीडियो पर टोकन खपत में अधिकतम 88% की कमी आती है।