HeadlinesBriefing favicon HeadlinesBriefing.com

Gemini 3.5 Transcribe: নির্ভুল স্পিচ-টু-টেক্সট

Google DeepMind Blog •
×

আজ, আমরা Gemini 3.5 Transcribe চালু করছি, যা আমাদের সবচেয়ে নির্ভুল স্পিচ-টু-টেক্সট মডেল, যা বুদ্ধিমান ভয়েস ইন্টারঅ্যাকশনের জন্য ডিজাইন করা হয়েছে। প্রচলিত স্পিচ রিকগনিশন মডেলগুলির বিপরীতে যা ব্যাকগ্রাউন্ড শব্দ, জটিল জার্গন এবং অসঙ্গতি পরিষ্কারের সাথে লড়াই করে, Gemini 3.5 Transcribe কাঁচা অডিওকে সরাসরি নির্ভুল, পরিমার্জিত, ফরম্যাট করা টেক্সটে রূপান্তর করে।

আমাদের পণ্যগুলিতে যেমন Gemini অ্যাপ এবং Android-এ, আমরা দেখেছি যে ভোক্তারা ইতিমধ্যেই এই ট্রান্সক্রিপশন মডেল থেকে উপকৃত হচ্ছে, যেমন Android-এ Rambler এবং macOS-এ Gemini অ্যাপের মতো নতুন ভয়েস ক্ষমতা সহ। এখন, ডেভেলপাররা Google AI Studio-তে Gemini API এবং Gemini Enterprise Agent Platform-এ Gemini 3.5 Transcribe দিয়ে অনুরূপ ক্ষমতা তৈরি করতে পারেন।

মডেলটি দুটি পৃথক API-তে উপলব্ধ: রিয়েল-টাইম স্ট্রিমিং ইন্টারঅ্যাকটিভ ভয়েস অ্যাপ্লিকেশনের জন্য Live API ব্যবহার করে gemini-3.5-transcribe-live সহ সাব-সেকেন্ড লেটেন্সি সহ অবিচ্ছিন্ন দ্বিমুখী স্ট্রিমিং প্রদান করে। প্রাক-রেকর্ড করা অডিও প্রসেসিং Interactions API ব্যবহার করে gemini-3.5-transcribe সহ রেকর্ড করা অডিও, মিটিং, কল লগ এবং আরও অনেক কিছু স্পিকার অ্যাট্রিবিউশন এবং শব্দ-স্তরের টাইমস্ট্যাম্প সহ ট্রান্সক্রাইব করে।

Artificial Analysis দ্বারা পরিমাপ করা হয়েছে, এটি স্ট্রিমিংয়ের জন্য 4.0% এবং নন-স্ট্রিমিং ব্যবহারের ক্ষেত্রে 2.6% গড় শব্দ ত্রুটি হার (WER) অর্জন করে। এটি কোলাহলপূর্ণ বাস্তব-বিশ্ব পরিবেশে শক্তিশালী কর্মক্ষমতা দেখায়, ডাক কোড এবং অর্ডার আইডির মতো আলফানিউমেরিক সত্তা সঠিকভাবে ক্যাপচার করে। Gemini 3.5 Transcribe-এর কর্মক্ষমতা আমাদের পূর্ববর্তী ট্রান্সক্রিপশন মডেল, Chirp 3 থেকে একটি বড় অগ্রগতির প্রতিনিধিত্ব করে, যা নতুন ক্ষমতা, উন্নত শব্দ ত্রুটি হার এবং উল্লেখযোগ্যভাবে ভাল লেটেন্সি প্রদান করে।

মূল সত্তা: কোম্পানি: Google DeepMind, Google | ব্যক্তি: Luke Leonhard