HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI ने GPT-Live कैसे बनाया

ByteByteGo •
×

जब प्रदर्शन मायने रखता है तो आप AI को कैसे अनुकूलित करते हैं? और आप AI को लागू करके प्रदर्शन को पहले से बेहतर (और आसान) कैसे बना सकते हैं? यही वह चीज़ है जिसे 30K इंजीनियर P99 CONF में खोजेंगे। यहाँ उन वार्ताओं का एक नमूना है जिनकी आप अपेक्षा कर सकते हैं: Lovable में Sandboxmaxxing: हर प्रॉम्प्ट को < 1s में एक सैंडबॉक्स मिलता है; द ऑटोनॉमस परफॉर्मेंस एजेंट: एक Netflix प्रोडक्शन स्टोरी; AI एजेंट्स के लिए क्रेज़ी फास्ट, ओपन सोर्स इन्फ्रास्ट्रक्चर बनाने से सीखे गए सबक; एजेंट को एक क्लस्टर दें: स्केल पर परफॉर्मेंस इंजीनियरिंग के लिए प्रभावी AI; AI वर्कलोड के लिए 500 बिलियन+ फाइलें प्रबंधित करना; AI का उपयोग करके अपने कैश एल्गोरिदम को कैसे सुधारें। अपना मुफ्त टिकट प्राप्त करें। बोनस: पंजीकरण करने वालों को O'Reilly लाइब्रेरी तक तत्काल 30-दिन की पहुंच मिलती है, और उपस्थित लोग 500 मुफ्त स्वैग पैक में से 1 जीतने के लिए प्रवेश कर सकते हैं।

यदि आपने पहले वॉइस असिस्टेंट का उपयोग किया है, तो आपने संभवतः अप्रत्याशित रुकावटों का अनुभव किया होगा। आप सिस्टम से बात करते हैं, और जिस क्षण आप सही शब्द सोचने के लिए थोड़ा रुकते हैं, वह बोलना शुरू कर देता है। फिर आप उसे बाधित करते हैं ताकि आप जारी रख सकें। यह एक आम निराशा है, क्योंकि अधिकांश वॉइस मॉडल या तो सुन सकते हैं या बोल सकते हैं, लेकिन दोनों एक साथ नहीं।

नए वॉइस मॉडल, जैसे OpenAI का GPT-Live-1, एक साथ सुनकर और बोलकर इसे बदल देते हैं। मॉडल लगातार तय करता है कि उसे चुप रहना चाहिए, बाधित करना चाहिए, या बोलना शुरू करना चाहिए। यह बातचीत को कम अनजाने रुकावटों के साथ अधिक स्वाभाविक महसूस कराता है। अंदरूनी तौर पर, ये सिस्टम नई पीढ़ी के वॉइस मॉडल आर्किटेक्चर को कम विलंबता के लिए अनुकूलित सर्विंग सिस्टम के साथ जोड़ते हैं। यह सब एंड टू एंड कैसे काम करता है, यह समझने के लिए हम GPT Voice टीम के इंजीनियरों Zahan Malkani और Justin Uberti (जिन्होंने WebRTC बनाया) से मिले। हम दोनों को विवरण साझा करने के लिए धन्यवाद देते हैं।

इस लेख में, आप सीखेंगे: वॉइस सिस्टम की तीन पीढ़ियाँ, जिनमें कैस्केडेड पाइपलाइन, टर्न-आधारित एंड-टू-एंड मॉडल और फुल-डुप्लेक्स मॉडल शामिल हैं; सोच को बोलने से अलग करना, GPT-Live के पीछे का मुख्य विचार; सर्विंग सिस्टम के पीछे की इंजीनियरिंग, जिसमें लाइव और एसिंक पथ शामिल हैं; फुल-डुप्लेक्स वॉइस सिस्टम में मूल्यांकन कैसे अलग है; और रियलटाइम सिस्टम बनाने के लिए इंजीनियरिंग सबक और वॉइस के लिए आगे क्या है।

मुख्य संस्थाएँ: कंपनियाँ: OpenAI, ByteByteGo, Lovable, Netflix, O'Reilly, Lang Chain | लोग: Zahan Malkani, Justin Uberti