HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI কীভাবে GPT-Live তৈরি করেছে

ByteByteGo •
×

যখন পারফরম্যান্স গুরুত্বপূর্ণ তখন আপনি কীভাবে AI অপ্টিমাইজ করবেন? এবং আপনি কীভাবে AI প্রয়োগ করে পারফরম্যান্স আগের চেয়ে আরও ভালো (এবং সহজ) করতে পারেন? সেটাই 30K ইঞ্জিনিয়ার P99 CONF-এ অন্বেষণ করবেন। এখানে আপনি যে টকগুলির প্রত্যাশা করতে পারেন তার একটি স্বাদ: Lovable-এ Sandboxmaxxing: প্রতিটি প্রম্পট < 1s-এ একটি স্যান্ডবক্স পায়; দ্য অটোনোমাস পারফরম্যান্স এজেন্ট: একটি Netflix প্রোডাকশন স্টোরি; AI এজেন্টদের জন্য ক্রেজি ফাস্ট, ওপেন সোর্স ইনফ্রাস্ট্রাকচার তৈরির শিক্ষা; এজেন্টকে একটি ক্লাস্টার দিন: স্কেলে পারফরম্যান্স ইঞ্জিনিয়ারিংয়ের জন্য কার্যকর AI; AI ওয়ার্কলোডের জন্য 500 বিলিয়ন+ ফাইল পরিচালনা; AI ব্যবহার করে আপনার ক্যাশে অ্যালগরিদম কীভাবে উন্নত করবেন। আপনার বিনামূল্যে টিকিট পান। বোনাস: নিবন্ধনকারীরা O'Reilly লাইব্রেরিতে তাৎক্ষণিক 30-দিনের অ্যাক্সেস পান, এবং উপস্থিতরা 500টি বিনামূল্যে সোয়াগ প্যাক-এর মধ্যে 1টি জেতার জন্য প্রবেশ করতে পারেন।

আপনি যদি আগে ভয়েস অ্যাসিস্ট্যান্ট ব্যবহার করে থাকেন, তাহলে সম্ভবত অপ্রত্যাশিত বাধার সম্মুখীন হয়েছেন। আপনি সিস্টেমের সাথে কথা বলেন, এবং যে মুহূর্তে আপনি সঠিক শব্দটি ভাবার জন্য একটু থামেন, এটি কথা বলা শুরু করে। তারপর আপনি এটি বাধা দেন যাতে আপনি চালিয়ে যেতে পারেন। এটি একটি সাধারণ হতাশা, কারণ বেশিরভাগ ভয়েস মডেল হয় শুনতে পারে বা কথা বলতে পারে, কিন্তু একই সাথে দুটোই নয়।

নতুন ভয়েস মডেল, যেমন OpenAI-এর GPT-Live-1, একই সাথে শুনে এবং কথা বলে এটি পরিবর্তন করে। মডেল ক্রমাগত সিদ্ধান্ত নেয় যে এটি চুপ থাকবে, বাধা দেবে, নাকি কথা বলা শুরু করবে। এটি কথোপকথনকে কম অনিচ্ছাকৃত বাধার সাথে আরও স্বাভাবিক অনুভব করায়। ভিতরে, এই সিস্টেমগুলি新一代 ভয়েস মডেল আর্কিটেকচারের সাথে কম লেটেন্সির জন্য অপ্টিমাইজ করা একটি সার্ভিং সিস্টেমকে একত্রিত করে। এটি কীভাবে এন্ড টু এন্ড কাজ করে তা বোঝার জন্য, আমরা GPT Voice টিম-এর ইঞ্জিনিয়ার Zahan Malkani এবং Justin Uberti (যিনি WebRTC তৈরি করেছেন)-এর সাথে দেখা করেছি। আমরা তাদের উভয়কে বিস্তারিত শেয়ার করার জন্য ধন্যবাদ জানাই।

এই নিবন্ধে, আপনি শিখবেন: ভয়েস সিস্টেমের তিন প্রজন্ম, যার মধ্যে ক্যাসকেডেড পাইপলাইন, টার্ন-ভিত্তিক এন্ড-টু-এন্ড মডেল এবং ফুল-ডুপ্লেক্স মডেল রয়েছে; কথা বলা থেকে চিন্তা করা প্রতিনিধিত্ব করা, GPT-Live-এর পিছনের মূল ধারণা; সার্ভিং সিস্টেমের পিছনের ইঞ্জিনিয়ারিং, যার মধ্যে লাইভ এবং অ্যাসিঙ্ক পাথ রয়েছে; ফুল-ডুপ্লেক্স ভয়েস সিস্টেমে মূল্যায়ন কীভাবে আলাদা; এবং রিয়েলটাইম সিস্টেম তৈরির জন্য ইঞ্জিনিয়ারিং পাঠ এবং ভয়েসের জন্য পরবর্তী কী।

মূল সত্তা: কোম্পানি: OpenAI, ByteByteGo, Lovable, Netflix, O'Reilly, Lang Chain | ব্যক্তি: Zahan Malkani, Justin Uberti