HeadlinesBriefing favicon HeadlinesBriefing.com

गूगल जेमिनी 3.8 TTS: फ्लैश और फ्लैश-लाइट की तुलना

Google DeepMind Blog •
×

गूगल डिपमाइंड ने जेमिनी परिवार में दो नए टेक्स्ट-टू-स्पीच मॉडल पेश किए हैं: जेमिनी 3.8 फ्लैश टीटीएस और जेमिनी 3.8 फ्लैश-लाइट टीटीएस。 इन मॉडलों ने आवाज़ उत्पादन को स्थिर प्रीसेट से गतिशील रचनात्मक स्टूडियो में बदल दिया है, जिससे रचनाकार, डेवलपर और उद्यमों को अधिक समृद्ध और अभिव्यक्तिपूर्ण ऑडियो अनुभव बनाने में सक्षम बनाया गया है। जेमिनी 3.8 फ्लैश टीटीएस गहरी रचनात्मक दिशा और कैरेक्टर डिज़ाइन के लिए बनाया गया है, जो उपयोगकर्ताओं को प्राकृतिक भाषा प्रॉम्प्ट के माध्यम से गेमिंग, ऑडियोबुक्स, पॉडकास्ट और इंटरैक्टिव मीडिया में शून्य से कस्टम आवाज़ उत्पन्न करने की अनुमति देता है। जेमिनी 3.8 फ्लैश-लाइट टीटीएस उच्च मात्रा, लागत-कुशल पैमाने पर केंद्रित है, डबिंग, वॉयस एजेंट्स और टोन और पेस नियंत्रण के सूक्ष्म नियंत्रण के साथ अभिव्यक्तिपूर्ण सामग्री के लिए अनुकूलित है।

इन मॉडलों ने जेमिनी ऑडियो परिवार का विस्तार किया है, जिसमें 3.5 लाइव ट्रांसलेट, 3.5 ट्रांसक्राइब, 3.8 लाइव और 3.8 लाइव एक्सटेंडेड थिंकिंग जैसे रिलीज़ शामिल हैं। उपयोगकर्ता 30 मूल आवाज़ों से अनंत लाइब्रेरी तक स्केल कर सकते हैं, जिसमें 2,000 से अधिक उत्पादन-तैयार आवाज़ें शामिल हैं, जिनमें मेक्सिकन स्पेनिश, क्यूबेक फ्रेंच और स्कॉटिश इंग्लिश जैसी व्यापक भाषा कवरेज है। आवाज़ प्रतिलिपि केवल 30-सेकंड के नमूने से समर्थित है, जिसे सहमति सत्यापन, सिंथ आईडी वॉटरमार्क और C2PA क्रेडेंशियल्स द्वारा समर्थित है।

दोनों मॉडल सटीक पंक्ति-दर-पंक्ति प्रदर्शन नियंत्रण प्रदान करते हैं, लंबे रूप की पीढ़ी में न्यूनतम स्पीकर ड्रिफ्ट, नेटिव दो-spreaker सीन स्टेजिंग और स्क्रिप्टेड वोकल बर्स्ट्स प्रदान करते हैं जो वास्तविक बातचीत की बनावट देते हैं। आवाज़ रीमिक्सिंग क्षमताएं भी जल्द ही आ रही हैं, जो प्रॉम्प्ट के माध्यम से टिम्बर, पिच, पेस और एक्सेंट के सूक्ष्म समायोजन की अनुमति देगी।

मुख्य इकाइयाँ: कंपनियाँ: Google DeepMind, Google AI Studio, Google Vids | व्यक्ति: Alan Cowen

अक्सर पूछे जाने वाले प्रश्न: जेमिनी 3.8 फ्लैश टीटीएस और फ्लैश-लाइट टीटीएस के बीच मुख्य अंतर क्या हैं?

जेमिनी 3.8 फ्लैश टीटीएस गहरी रचनात्मक दिशा और कैरेक्टर डिज़ाइन के लिए डिज़ाइन किया गया है, जो शून्य से कस्टम आवाज़ निर्माण को सक्षम बनाता है जिसमें अभिनय संकेतों, गति और dialect परिवर्तनों पर सूक्ष्म नियंत्रण होता है। फ्लैश-लाइट टीटीएस उच्च मात्रा, लागत-कुशल पैमाने के लिए अनुकूलित है, जो डबिंग, वॉयस एजेंट्स और टोन और पेस नियंत्रण के सूक्ष्म नियंत्रण के साथ अभिव्यक्तिपूर्ण सामग्री के लिए आदर्श है।