HeadlinesBriefing favicon HeadlinesBriefing.com

मेटा रीयल-टाइम ऑडियो मॉडल 20+ वक्ता

Engadget •
×

मेटा ने अपना पहला रीयल-टाइम ऑडियो मॉडल, Muse Voice Transcribe, मेटा सुपरइंटेलिजेंस लैब (MSI) से पेश किया है। यह मॉडल 20 से अधिक वक्ताओं के लिए डिक्टेशन और ट्रांसक्रिप्शन संभाल सकता है और एक साथ कई भाषाओं को सहजता से संभाल सकता है। मेटा के सीईओ मार्क जुकरबर्ग ने एक उदाहरण साझा किया जो मॉडल की वक्ताओं के बीच अंतर करने और भाषाओं के बीच स्विच करने की क्षमता को दर्शाता है, जिसमें "कोड-स्विचिंग" भी शामिल है।

"मॉडल तय करता है कि कब सुनना है। यह कठिन शब्दों पर थोड़ा अधिक प्रतीक्षा करता है और आसान शब्दों पर तेजी से प्रतिबद्ध होता है, प्रत्येक टोकन की भविष्यवाणी करने और सटीकता बढ़ाने के लिए अनुकूली देरी का उपयोग करता है," जुकरबर्ग ने समझाया। "यह गड़बड़, वास्तविक ऑडियो पर भी टिका रहता है — 70+ भाषाओं में प्रशिक्षित (लॉन्च पर 25 मान्य), मध्य-वाक्य कोड-स्विचिंग संभालता है, और 20+ वक्ताओं के साथ घंटे भर के सत्रों का प्रबंधन करता है।"

मेटा की रिलीज़ Google Gemini 3.5 Transcribe के एक सप्ताह से भी कम समय बाद आई है। जबकि Google अपने मॉडल को Android और Chrome में एकीकृत कर रहा है, Muse Voice Transcribe के लिए मेटा की योजनाएँ अस्पष्ट हैं। वर्तमान में, यह मॉडल मेटा के Mac ऐप में डिक्टेशन को शक्ति देता है और डेवलपर्स के लिए Muse Code और मेटा के मॉडल API के माध्यम से उपलब्ध है, जिसकी कीमत $3 प्रति 1,000 ऑडियो मिनट है।

यह MSL की नवीनतम रिलीज़ है, एक कोडिंग एजेंट और ओपन-वेट मॉडल के बाद। डेमो मेटा के शोध ब्लॉग पर उपलब्ध है।

मुख्य संस्थाएँ: कंपनियाँ: Meta, Google, Muse, MSI | लोग: मार्क जुकरबर्ग, अलेक्जेंडर वांग

सामान्य प्रश्न: Muse Voice Transcribe क्या है?

Muse Voice Transcribe मेटा का पहला रीयल-टाइम ऑडियो धारणा मॉडल है जो 20 से अधिक वक्ताओं और कई भाषाओं के लिए एक साथ डिक्टेशन और ट्रांसक्रिप्शन संभालता है।

सामान्य प्रश्न Q: Muse Voice Transcribe क्या है?

सामान्य प्रश्न A: Muse Voice Transcribe मेटा का पहला रीयल-टाइम ऑडियो धारणा मॉडल है जो 20 से अधिक वक्ताओं और कई भाषाओं के लिए एक साथ डिक्टेशन और ट्रांसक्रिप्शन संभालता है।