HeadlinesBriefing favicon HeadlinesBriefing.com

Gemini 3.5 Transcribe: सटीक स्पीच-टू-टेक्स्ट

Google DeepMind Blog •
×

आज, हम Gemini 3.5 Transcribe पेश कर रहे हैं, जो हमारा अब तक का सबसे सटीक स्पीच-टू-टेक्स्ट मॉडल है, जिसे बुद्धिमान वॉयस इंटरैक्शन के लिए डिज़ाइन किया गया है। पारंपरिक भाषण पहचान मॉडल के विपरीत जो पृष्ठभूमि शोर, जटिल शब्दजाल और असंगति सफाई से जूझते हैं, Gemini 3.5 Transcribe कच्चे ऑडियो को सीधे सटीक, परिष्कृत, स्वरूपित पाठ में परिवर्तित करता है।

हमारे उत्पादों जैसे Gemini ऐप और Android में, हमने देखा है कि उपभोक्ता पहले से ही इस प्रतिलेखन मॉडल से लाभान्वित हो रहे हैं, जिसमें Android पर Rambler और macOS पर Gemini ऐप जैसी नई वॉयस क्षमताएं शामिल हैं। अब, डेवलपर्स Google AI Studio में Gemini API और Gemini Enterprise Agent Platform में Gemini 3.5 Transcribe के साथ समान क्षमताएं बना सकते हैं।

मॉडल दो अलग-अलग API में उपलब्ध है: रीयल-टाइम स्ट्रीमिंग इंटरैक्टिव वॉयस ऐप्स के लिए Live API का उपयोग करके gemini-3.5-transcribe-live के साथ उप-सेकंड विलंबता के साथ निरंतर द्विदिश स्ट्रीमिंग प्रदान करती है। पूर्व-रिकॉर्ड किए गए ऑडियो प्रोसेसिंग Interactions API का उपयोग करके gemini-3.5-transcribe के साथ रिकॉर्ड किए गए ऑडियो, बैठकों, कॉल लॉग और अधिक को वक्ता विशेषता और शब्द-स्तरीय टाइमस्टैम्प के साथ ट्रांसक्राइब करती है।

Artificial Analysis द्वारा मापे गए अनुसार, यह स्ट्रीमिंग के लिए 4.0% और गैर-स्ट्रीमिंग उपयोग-मामलों के लिए 2.6% की औसत शब्द त्रुटि दर (WER) प्राप्त करता है। यह शोरगुल वाले वास्तविक दुनिया के वातावरण में मजबूत प्रदर्शन दिखाता है, डाक कोड और ऑर्डर आईडी जैसी अल्फ़ान्यूमेरिक संस्थाओं को सटीक रूप से कैप्चर करता है। Gemini 3.5 Transcribe का प्रदर्शन हमारे पिछले प्रतिलेखन मॉडल, Chirp 3 से एक बड़ी उन्नति का प्रतिनिधित्व करता है, जो नई क्षमताएं, बेहतर शब्द त्रुटि दर और काफी बेहतर विलंबता प्रदान करता है।

मुख्य संस्थाएं: कंपनियां: Google DeepMind, Google | लोग: Luke Leonhard