HeadlinesBriefing favicon HeadlinesBriefing.com

মেটা রিয়েল-টাইম অডিও মডেল ২০+ বক্তা

Engadget •
×

মেটা তাদের প্রথম রিয়েল-টাইম অডিও মডেল, Muse Voice Transcribe, মেটা সুপারইন্টেলিজেন্স ল্যাব (MSI) থেকে চালু করেছে। মডেলটি ২০ জনের বেশি বক্তার জন্য ডিক্টেশন এবং ট্রান্সক্রিপশন পরিচালনা করতে পারে এবং একসাথে একাধিক ভাষা নির্বিঘ্নে পরিচালনা করতে পারে। মেটার সিইও মার্ক জাকারবার্গ একটি উদাহরণ শেয়ার করেছেন যা মডেলের বক্তাদের মধ্যে পার্থক্য করার এবং ভাষার মধ্যে স্যুইচ করার ক্ষমতা প্রদর্শন করে, যার মধ্যে "কোড-সুইচিং" অন্তর্ভুক্ত।

"মডেল সিদ্ধান্ত নেয় কখন শুনতে হবে। এটি কঠিন শব্দে একটু বেশি অপেক্ষা করে এবং সহজ শব্দে দ্রুত প্রতিশ্রুতিবদ্ধ হয়, প্রতিটি টোকেন পূর্বাভাস এবং নির্ভুলতা বাড়াতে অভিযোজিত বিলম্ব ব্যবহার করে," জাকারবার্গ ব্যাখ্যা করেছেন। "এটি বিশৃঙ্খল, বাস্তব অডিওতেও টিকে থাকে — ৭০+ ভাষায় প্রশিক্ষিত (লঞ্চে ২৫টি বৈধ), বাক্যের মাঝে কোড-সুইচিং পরিচালনা করে এবং ২০+ বক্তার সাথে ঘণ্টাব্যাপী সেশন পরিচালনা করে।"

মেটার প্রকাশ Google Gemini 3.5 Transcribe-এর এক সপ্তাহেরও কম পরে। Google তার মডেলটি Android এবং Chrome-এ একীভূত করছে, যখন Muse Voice Transcribe-এর জন্য মেটার পরিকল্পনা অস্পষ্ট রয়ে গেছে। বর্তমানে, মডেলটি মেটার Mac অ্যাপে ডিক্টেশন চালায় এবং Muse Code এবং মেটার মডেল API-এর মাধ্যমে ডেভেলপারদের জন্য উপলব্ধ, যার মূল্য $৩ প্রতি ১,০০০ অডিও মিনিট।

এটি MSL-এর সর্বশেষ প্রকাশ, একটি কোডিং এজেন্ট এবং ওপেন-ওয়েট মডেলের পরে। মেটার গবেষণা ব্লগে একটি ডেমো উপলব্ধ।

মূল সত্তা: কোম্পানি: Meta, Google, Muse, MSI | ব্যক্তি: মার্ক জাকারবার্গ, আলেকজান্ডার ওয়াং

সাধারণ প্রশ্ন: Muse Voice Transcribe কী?

Muse Voice Transcribe হল মেটার প্রথম রিয়েল-টাইম অডিও উপলব্ধি মডেল যা ২০ জনের বেশি বক্তা এবং একাধিক ভাষার জন্য একসাথে ডিক্টেশন এবং ট্রান্সক্রিপশন পরিচালনা করে।

সাধারণ প্রশ্ন Q: Muse Voice Transcribe কী?

সাধারণ প্রশ্ন A: Muse Voice Transcribe হল মেটার প্রথম রিয়েল-টাইম অডিও উপলব্ধি মডেল যা ২০ জনের বেশি বক্তা এবং একাধিক ভাষার জন্য একসাথে ডিক্টেশন এবং ট্রান্সক্রিপশন পরিচালনা করে।