HeadlinesBriefing HeadlinesBriefing 12 languages

How OpenAI Built GPT-Live

ByteByteGo ·

🇬🇧 English

How do you optimize AI when performance matters? And how can you apply AI to make performance better (and easier) than ever before? That’s what 30K engineers will explore at P99 CONF. Here’s a taste of the talks you can expect: Sandboxmaxxing at Lovable: Every Prompt Gets a Sandbox in < 1s; The Autonomous Performance Agent: A Netflix Production Story; Lessons Learned from Building Crazy Fast, Open Source Infrastructure for AI Agents; Give the Agent a Cluster: Effective AI for Performance Engineering at Scale; Managing 500 Billion+ Files for AI Workloads; How to Improve Your Cache Algorithm Using AI. GET YOUR FREE TICKET. Bonus: Registrants get immediate 30-day access to the complete O’Reilly library, and attendees can enter to win 1 of 500 free swag packs.

If you have used voice assistants before, you have probably experienced unexpected interruptions. You talk with the system, and the moment you pause briefly to think of the right term, it starts talking. Then you interrupt it so you can continue. This is a common frustration, because most voice models can either listen or speak, but not both at the same time.

Newer voice models, like OpenAI’s GPT-Live-1, change that by listening and speaking at the same time. The model constantly decides whether it should stay quiet, interrupt, or start talking. This makes the conversation feel more natural with fewer unintentional interruptions. Under the hood, these systems combine a new generation of voice model architecture with a serving system optimized for low latency. To understand how it all works end to end, we met with engineers on the GPT Voice team, Zahan Malkani and Justin Uberti (who created WebRTC). We thank both of them for sharing the details with us.

In this article, you’ll learn: the three generations of voice systems, including cascaded pipelines, turn-based end-to-end models, and full-duplex models; delegating thinking from talking, the core idea behind GPT-Live; the engineering behind the serving system, including the live and async paths; how evaluation is different in full-duplex voice systems; and engineering lessons for building realtime systems and what is next for voice.

View original article →


🇸🇦 العربية

كيف بنت OpenAI نموذج GPT-Live

كيف تُحسّن الذكاء الاصطناعي عندما تكون الأداء مهمًا؟ وكيف يمكنك تطبيق الذكاء الاصطناعي لجعل الأداء أفضل (وأسهل) من أي وقت مضى؟ هذا ما سيستكشفه 30 ألف مهندس في P99 CONF. إليك عينة من المحادثات التي يمكنك توقعها: Sandboxmaxxing في Lovable: كل موجه يحصل على صندوق رمل في أقل من ثانية واحدة؛ وكيل الأداء المستقل: قصة إنتاج من Netflix؛ الدروس المستفادة من بناء بنية تحتية مفتوحة المصدر فائقة السرعة لوكلاء الذكاء الاصطناعي؛ امنح الوكيل عنقودًا: ذكاء اصطناعي فعال لهندسة الأداء على نطاق واسع؛ إدارة أكثر من 500 مليار ملف لأحمال عمل الذكاء الاصطناعي؛ كيفية تحسين خوارزمية التخزين المؤقت باستخدام الذكاء الاصطناعي. احصل على تذكرتك المجانية. مكافأة: يحصل المسجلون على وصول فوري لمدة 30 يومًا إلى مكتبة O'Reilly الكاملة، ويمكن للحاضرين الدخول للفوز بواحد من 500 حزمة هدايا مجانية.

إذا كنت قد استخدمت المساعدات الصوتية من قبل، فمن المحتمل أنك واجهت مقاطعات غير متوقعة. تتحدث مع النظام، وفي اللحظة التي تتوقف فيها قليلاً للتفكير في المصطلح المناسب، يبدأ في التحدث. ثم تقاطعه حتى تتمكن من المتابعة. هذا إحباط شائع، لأن معظم نماذج الصوت يمكنها إما الاستماع أو التحدث، ولكن ليس كليهما في نفس الوقت.

نماذج الصوت الأحدث، مثل GPT-Live-1 من OpenAI، تغير ذلك من خلال الاستماع والتحدث في نفس الوقت. يقرر النموذج باستمرار ما إذا كان يجب أن يبقى صامتًا أو يقاطع أو يبدأ في التحدث. هذا يجعل المحادثة تبدو أكثر طبيعية مع مقاطعات غير مقصودة أقل. تحت الغطاء، تجمع هذه الأنظمة بين جيل جديد من بنية نموذج الصوت ونظام خدمة مُحسّن لزمن استجابة منخفض. لفهم كيفية عمل كل شيء من البداية إلى النهاية، التقينا بمهندسين في فريق GPT Voice، Zahan Malkani وJustin Uberti (الذي أنشأ WebRTC). نشكرهما على مشاركة التفاصيل معنا.

في هذه المقالة، ستتعلم: الأجيال الثلاثة من أنظمة الصوت، بما في ذلك خطوط الأنابيب المتتالية والنماذج الشاملة القائمة على الأدوار والنماذج ثنائية الاتجاه الكاملة؛ تفويض التفكير من التحدث، الفكرة الأساسية وراء GPT-Live؛ الهندسة وراء نظام الخدمة، بما في ذلك المسارات المباشرة وغير المتزامنة؛ كيف يختلف التقييم في أنظمة الصوت ثنائية الاتجاه الكاملة؛ ودروس الهندسة لبناء أنظمة الوقت الفعلي وما التالي للصوت.

الكيانات الرئيسية: الشركات: OpenAI، ByteByteGo، Lovable، Netflix، O'Reilly، Lang Chain | الأشخاص: Zahan Malkani، Justin Uberti

الأسئلة الشائعة: ما هي الفكرة الأساسية وراء GPT-Live؟

تفويض التفكير من التحدث.

سؤال الأسئلة الشائعة: ما هي الفكرة الأساسية وراء GPT-Live؟

إجابة الأسئلة الشائعة: تفويض التفكير من التحدث.

ما هي الفكرة الأساسية وراء GPT-Live؟

تفويض التفكير من التحدث.

العربية version →


🇧🇩 বাংলা

OpenAI কীভাবে GPT-Live তৈরি করেছে

যখন পারফরম্যান্স গুরুত্বপূর্ণ তখন আপনি কীভাবে AI অপ্টিমাইজ করবেন? এবং আপনি কীভাবে AI প্রয়োগ করে পারফরম্যান্স আগের চেয়ে আরও ভালো (এবং সহজ) করতে পারেন? সেটাই 30K ইঞ্জিনিয়ার P99 CONF-এ অন্বেষণ করবেন। এখানে আপনি যে টকগুলির প্রত্যাশা করতে পারেন তার একটি স্বাদ: Lovable-এ Sandboxmaxxing: প্রতিটি প্রম্পট < 1s-এ একটি স্যান্ডবক্স পায়; দ্য অটোনোমাস পারফরম্যান্স এজেন্ট: একটি Netflix প্রোডাকশন স্টোরি; AI এজেন্টদের জন্য ক্রেজি ফাস্ট, ওপেন সোর্স ইনফ্রাস্ট্রাকচার তৈরির শিক্ষা; এজেন্টকে একটি ক্লাস্টার দিন: স্কেলে পারফরম্যান্স ইঞ্জিনিয়ারিংয়ের জন্য কার্যকর AI; AI ওয়ার্কলোডের জন্য 500 বিলিয়ন+ ফাইল পরিচালনা; AI ব্যবহার করে আপনার ক্যাশে অ্যালগরিদম কীভাবে উন্নত করবেন। আপনার বিনামূল্যে টিকিট পান। বোনাস: নিবন্ধনকারীরা O'Reilly লাইব্রেরিতে তাৎক্ষণিক 30-দিনের অ্যাক্সেস পান, এবং উপস্থিতরা 500টি বিনামূল্যে সোয়াগ প্যাক-এর মধ্যে 1টি জেতার জন্য প্রবেশ করতে পারেন।

আপনি যদি আগে ভয়েস অ্যাসিস্ট্যান্ট ব্যবহার করে থাকেন, তাহলে সম্ভবত অপ্রত্যাশিত বাধার সম্মুখীন হয়েছেন। আপনি সিস্টেমের সাথে কথা বলেন, এবং যে মুহূর্তে আপনি সঠিক শব্দটি ভাবার জন্য একটু থামেন, এটি কথা বলা শুরু করে। তারপর আপনি এটি বাধা দেন যাতে আপনি চালিয়ে যেতে পারেন। এটি একটি সাধারণ হতাশা, কারণ বেশিরভাগ ভয়েস মডেল হয় শুনতে পারে বা কথা বলতে পারে, কিন্তু একই সাথে দুটোই নয়।

নতুন ভয়েস মডেল, যেমন OpenAI-এর GPT-Live-1, একই সাথে শুনে এবং কথা বলে এটি পরিবর্তন করে। মডেল ক্রমাগত সিদ্ধান্ত নেয় যে এটি চুপ থাকবে, বাধা দেবে, নাকি কথা বলা শুরু করবে। এটি কথোপকথনকে কম অনিচ্ছাকৃত বাধার সাথে আরও স্বাভাবিক অনুভব করায়। ভিতরে, এই সিস্টেমগুলি新一代 ভয়েস মডেল আর্কিটেকচারের সাথে কম লেটেন্সির জন্য অপ্টিমাইজ করা একটি সার্ভিং সিস্টেমকে একত্রিত করে। এটি কীভাবে এন্ড টু এন্ড কাজ করে তা বোঝার জন্য, আমরা GPT Voice টিম-এর ইঞ্জিনিয়ার Zahan Malkani এবং Justin Uberti (যিনি WebRTC তৈরি করেছেন)-এর সাথে দেখা করেছি। আমরা তাদের উভয়কে বিস্তারিত শেয়ার করার জন্য ধন্যবাদ জানাই।

এই নিবন্ধে, আপনি শিখবেন: ভয়েস সিস্টেমের তিন প্রজন্ম, যার মধ্যে ক্যাসকেডেড পাইপলাইন, টার্ন-ভিত্তিক এন্ড-টু-এন্ড মডেল এবং ফুল-ডুপ্লেক্স মডেল রয়েছে; কথা বলা থেকে চিন্তা করা প্রতিনিধিত্ব করা, GPT-Live-এর পিছনের মূল ধারণা; সার্ভিং সিস্টেমের পিছনের ইঞ্জিনিয়ারিং, যার মধ্যে লাইভ এবং অ্যাসিঙ্ক পাথ রয়েছে; ফুল-ডুপ্লেক্স ভয়েস সিস্টেমে মূল্যায়ন কীভাবে আলাদা; এবং রিয়েলটাইম সিস্টেম তৈরির জন্য ইঞ্জিনিয়ারিং পাঠ এবং ভয়েসের জন্য পরবর্তী কী।

মূল সত্তা: কোম্পানি: OpenAI, ByteByteGo, Lovable, Netflix, O'Reilly, Lang Chain | ব্যক্তি: Zahan Malkani, Justin Uberti

GPT-Live-এর পিছনের মূল ধারণা কী?

কথা বলা থেকে চিন্তা করা প্রতিনিধিত্ব করা।

বাংলা version →


🇩🇪 Deutsch

Wie OpenAI GPT-Live baute

Wie optimiert man KI, wenn Leistung zählt? Und wie kann man KI einsetzen, um die Leistung besser (und einfacher) als je zuvor zu machen? Genau das werden 30K Ingenieure auf der P99 CONF erkunden. Hier ist ein Vorgeschmack auf die Vorträge, die Sie erwarten können: Sandboxmaxxing bei Lovable: Jeder Prompt erhält einen Sandbox in < 1s; Der autonome Performance-Agent: Eine Netflix-Produktionsgeschichte; Lehren aus dem Aufbau blitzschneller Open-Source-Infrastruktur für KI-Agenten; Geben Sie dem Agenten einen Cluster: Effektive KI für Performance-Engineering im großen Maßstab; Verwaltung von 500 Milliarden+ Dateien für KI-Workloads; Wie Sie Ihren Cache-Algorithmus mit KI verbessern. HOLEN SIE SICH IHR KOSTENLOSES TICKET. Bonus: Registrierte erhalten sofortigen 30-tägigen Zugang zur vollständigen O'Reilly-Bibliothek, und Teilnehmer können an der Verlosung von 1 von 500 kostenlosen Swag-Paketen teilnehmen.

Wenn Sie schon einmal Sprachassistenten verwendet haben, haben Sie wahrscheinlich unerwartete Unterbrechungen erlebt. Sie sprechen mit dem System, und in dem Moment, in dem Sie kurz innehalten, um über den richtigen Begriff nachzudenken, beginnt es zu sprechen. Dann unterbrechen Sie es, um fortzufahren. Das ist eine häufige Frustration, denn die meisten Sprachmodelle können entweder zuhören oder sprechen, aber nicht beides gleichzeitig.

Neuere Sprachmodelle wie OpenAIs GPT-Live-1 ändern das, indem sie gleichzeitig zuhören und sprechen. Das Modell entscheidet ständig, ob es still bleiben, unterbrechen oder anfangen soll zu sprechen. Dadurch fühlt sich das Gespräch natürlicher an, mit weniger unbeabsichtigten Unterbrechungen. Unter der Haube kombinieren diese Systeme eine neue Generation von Sprachmodellarchitektur mit einem Serving-System, das für niedrige Latenz optimiert ist. Um zu verstehen, wie alles Ende-zu-Ende funktioniert, trafen wir uns mit Ingenieuren des GPT Voice-Teams, Zahan Malkani und Justin Uberti (der WebRTC entwickelte). Wir danken beiden dafür, dass sie die Details mit uns geteilt haben.

In diesem Artikel erfahren Sie: die drei Generationen von Sprachsystemen, einschließlich kaskadierter Pipelines, turn-basierter Ende-zu-Ende-Modelle und Vollduplex-Modelle; das Delegieren des Denkens vom Sprechen, die Kernidee hinter GPT-Live; die Technik hinter dem Serving-System, einschließlich der Live- und Async-Pfade; wie sich die Evaluierung in Vollduplex-Sprachsystemen unterscheidet; und Engineering-Lektionen für den Aufbau von Echtzeitsystemen und was als Nächstes für Sprache kommt.

Wichtige Entitäten: Unternehmen: OpenAI, ByteByteGo, Lovable, Netflix, O'Reilly, Lang Chain | Personen: Zahan Malkani, Justin Uberti

Was ist die Kernidee hinter GPT-Live?

Das Delegieren des Denkens vom Sprechen.

Deutsch version →


🇪🇸 Español

Cómo OpenAI construyó GPT-Live

¿Cómo optimizas la IA cuando el rendimiento importa? ¿Y cómo puedes aplicar la IA para mejorar el rendimiento (y hacerlo más fácil) que nunca? Eso es lo que 30K ingenieros explorarán en P99 CONF. Aquí tienes una muestra de las charlas que puedes esperar: Sandboxmaxxing en Lovable: cada prompt obtiene un sandbox en < 1s; El agente autónomo de rendimiento: una historia de producción de Netflix; Lecciones aprendidas al construir infraestructura de código abierto extremadamente rápida para agentes de IA; Dale un clúster al agente: IA efectiva para ingeniería de rendimiento a escala; Gestionando 500 mil millones+ archivos para cargas de trabajo de IA; Cómo mejorar tu algoritmo de caché usando IA. CONSIGUE TU ENTRADA GRATIS. Bonificación: los registrados obtienen acceso inmediato de 30 días a la biblioteca completa de O'Reilly, y los asistentes pueden participar para ganar 1 de 500 paquetes de swag gratis.

Si has usado asistentes de voz antes, probablemente hayas experimentado interrupciones inesperadas. Hablas con el sistema y, en el momento en que haces una breve pausa para pensar en el término correcto, empieza a hablar. Entonces lo interrumpes para poder continuar. Esta es una frustración común, porque la mayoría de los modelos de voz pueden escuchar o hablar, pero no ambos al mismo tiempo.

Los modelos de voz más nuevos, como GPT-Live-1 de OpenAI, cambian eso al escuchar y hablar al mismo tiempo. El modelo decide constantemente si debe quedarse callado, interrumpir o empezar a hablar. Esto hace que la conversación se sienta más natural con menos interrupciones involuntarias. Bajo el capó, estos sistemas combinan una nueva generación de arquitectura de modelos de voz con un sistema de servicio optimizado para baja latencia. Para entender cómo funciona todo de principio a fin, nos reunimos con ingenieros del equipo de GPT Voice, Zahan Malkani y Justin Uberti (quien creó WebRTC). Agradecemos a ambos por compartir los detalles con nosotros.

En este artículo, aprenderás: las tres generaciones de sistemas de voz, incluidos pipelines en cascada, modelos end-to-end basados en turnos y modelos full-duplex; delegar el pensamiento del habla, la idea central detrás de GPT-Live; la ingeniería detrás del sistema de servicio, incluidos los caminos en vivo y asíncronos; cómo la evaluación es diferente en sistemas de voz full-duplex; y lecciones de ingeniería para construir sistemas en tiempo real y qué sigue para la voz.

Entidades clave: Empresas: OpenAI, ByteByteGo, Lovable, Netflix, O'Reilly, Lang Chain | Personas: Zahan Malkani, Justin Uberti

¿Cuál es la idea central detrás de GPT-Live?

Delegar el pensamiento del habla.

Español version →


🇫🇷 Français

Comment OpenAI a construit GPT-Live

Comment optimisez-vous l'IA lorsque la performance compte ? Et comment pouvez-vous appliquer l'IA pour rendre la performance meilleure (et plus facile) que jamais ? C'est ce que 30K ingénieurs exploreront à P99 CONF. Voici un aperçu des conférences à venir : Sandboxmaxxing chez Lovable : chaque prompt obtient un sandbox en < 1s ; L'agent de performance autonome : une histoire de production Netflix ; Leçons apprises en construisant une infrastructure open source ultra-rapide pour les agents IA ; Donnez un cluster à l'agent : une IA efficace pour l'ingénierie de performance à grande échelle ; Gérer 500 milliards+ de fichiers pour les charges de travail IA ; Comment améliorer votre algorithme de cache avec l'IA. OBTENEZ VOTRE BILLET GRATUIT. Bonus : les inscrits obtiennent un accès immédiat de 30 jours à la bibliothèque complète O'Reilly, et les participants peuvent tenter de gagner 1 des 500 packs de goodies gratuits.

Si vous avez déjà utilisé des assistants vocaux, vous avez probablement vécu des interruptions inattendues. Vous parlez au système, et au moment où vous faites une brève pause pour réfléchir au bon terme, il commence à parler. Puis vous l'interrompez pour pouvoir continuer. C'est une frustration courante, car la plupart des modèles vocaux peuvent soit écouter, soit parler, mais pas les deux en même temps.

Les modèles vocaux plus récents, comme GPT-Live-1 d'OpenAI, changent cela en écoutant et en parlant en même temps. Le modèle décide constamment s'il doit rester silencieux, interrompre ou commencer à parler. Cela rend la conversation plus naturelle avec moins d'interruptions involontaires. Sous le capot, ces systèmes combinent une nouvelle génération d'architecture de modèle vocal avec un système de service optimisé pour une faible latence. Pour comprendre comment tout fonctionne de bout en bout, nous avons rencontré des ingénieurs de l'équipe GPT Voice, Zahan Malkani et Justin Uberti (qui a créé WebRTC). Nous les remercions tous les deux de nous avoir partagé les détails.

Dans cet article, vous apprendrez : les trois générations de systèmes vocaux, y compris les pipelines en cascade, les modèles de bout en bout basés sur les tours et les modèles full-duplex ; déléguer la réflexion de la parole, l'idée centrale derrière GPT-Live ; l'ingénierie derrière le système de service, y compris les chemins live et asynchrones ; comment l'évaluation est différente dans les systèmes vocaux full-duplex ; et les leçons d'ingénierie pour construire des systèmes temps réel et ce qui attend la voix.

Entités clés : Entreprises : OpenAI, ByteByteGo, Lovable, Netflix, O'Reilly, Lang Chain | Personnes : Zahan Malkani, Justin Uberti

FAQ : Quelle est l'idée centrale derrière GPT-Live ?

Déléguer la réflexion de la parole.

FAQ Q : Quelle est l'idée centrale derrière GPT-Live ?

FAQ R : Déléguer la réflexion de la parole.

Quelle est l'idée centrale derrière GPT-Live ?

Déléguer la réflexion de la parole.

Français version →


🇮🇳 हिन्दी

OpenAI ने GPT-Live कैसे बनाया

जब प्रदर्शन मायने रखता है तो आप AI को कैसे अनुकूलित करते हैं? और आप AI को लागू करके प्रदर्शन को पहले से बेहतर (और आसान) कैसे बना सकते हैं? यही वह चीज़ है जिसे 30K इंजीनियर P99 CONF में खोजेंगे। यहाँ उन वार्ताओं का एक नमूना है जिनकी आप अपेक्षा कर सकते हैं: Lovable में Sandboxmaxxing: हर प्रॉम्प्ट को < 1s में एक सैंडबॉक्स मिलता है; द ऑटोनॉमस परफॉर्मेंस एजेंट: एक Netflix प्रोडक्शन स्टोरी; AI एजेंट्स के लिए क्रेज़ी फास्ट, ओपन सोर्स इन्फ्रास्ट्रक्चर बनाने से सीखे गए सबक; एजेंट को एक क्लस्टर दें: स्केल पर परफॉर्मेंस इंजीनियरिंग के लिए प्रभावी AI; AI वर्कलोड के लिए 500 बिलियन+ फाइलें प्रबंधित करना; AI का उपयोग करके अपने कैश एल्गोरिदम को कैसे सुधारें। अपना मुफ्त टिकट प्राप्त करें। बोनस: पंजीकरण करने वालों को O'Reilly लाइब्रेरी तक तत्काल 30-दिन की पहुंच मिलती है, और उपस्थित लोग 500 मुफ्त स्वैग पैक में से 1 जीतने के लिए प्रवेश कर सकते हैं।

यदि आपने पहले वॉइस असिस्टेंट का उपयोग किया है, तो आपने संभवतः अप्रत्याशित रुकावटों का अनुभव किया होगा। आप सिस्टम से बात करते हैं, और जिस क्षण आप सही शब्द सोचने के लिए थोड़ा रुकते हैं, वह बोलना शुरू कर देता है। फिर आप उसे बाधित करते हैं ताकि आप जारी रख सकें। यह एक आम निराशा है, क्योंकि अधिकांश वॉइस मॉडल या तो सुन सकते हैं या बोल सकते हैं, लेकिन दोनों एक साथ नहीं।

नए वॉइस मॉडल, जैसे OpenAI का GPT-Live-1, एक साथ सुनकर और बोलकर इसे बदल देते हैं। मॉडल लगातार तय करता है कि उसे चुप रहना चाहिए, बाधित करना चाहिए, या बोलना शुरू करना चाहिए। यह बातचीत को कम अनजाने रुकावटों के साथ अधिक स्वाभाविक महसूस कराता है। अंदरूनी तौर पर, ये सिस्टम नई पीढ़ी के वॉइस मॉडल आर्किटेक्चर को कम विलंबता के लिए अनुकूलित सर्विंग सिस्टम के साथ जोड़ते हैं। यह सब एंड टू एंड कैसे काम करता है, यह समझने के लिए हम GPT Voice टीम के इंजीनियरों Zahan Malkani और Justin Uberti (जिन्होंने WebRTC बनाया) से मिले। हम दोनों को विवरण साझा करने के लिए धन्यवाद देते हैं।

इस लेख में, आप सीखेंगे: वॉइस सिस्टम की तीन पीढ़ियाँ, जिनमें कैस्केडेड पाइपलाइन, टर्न-आधारित एंड-टू-एंड मॉडल और फुल-डुप्लेक्स मॉडल शामिल हैं; सोच को बोलने से अलग करना, GPT-Live के पीछे का मुख्य विचार; सर्विंग सिस्टम के पीछे की इंजीनियरिंग, जिसमें लाइव और एसिंक पथ शामिल हैं; फुल-डुप्लेक्स वॉइस सिस्टम में मूल्यांकन कैसे अलग है; और रियलटाइम सिस्टम बनाने के लिए इंजीनियरिंग सबक और वॉइस के लिए आगे क्या है।

मुख्य संस्थाएँ: कंपनियाँ: OpenAI, ByteByteGo, Lovable, Netflix, O'Reilly, Lang Chain | लोग: Zahan Malkani, Justin Uberti

GPT-Live के पीछे का मुख्य विचार क्या है?

सोच को बोलने से अलग करना।

हिन्दी version →


🇮🇩 Bahasa Indonesia

Bagaimana OpenAI Membangun GPT-Live

Bagaimana Anda mengoptimalkan AI ketika performa penting? Dan bagaimana Anda dapat menerapkan AI untuk membuat performa lebih baik (dan lebih mudah) dari sebelumnya? Itulah yang akan dieksplorasi oleh 30K engineer di P99 CONF. Berikut adalah cuplikan dari pembicaraan yang dapat Anda harapkan: Sandboxmaxxing di Lovable: Setiap prompt Mendapatkan Sandbox dalam < 1 detik; Agen Performa Otonom: Kisah Produksi Netflix; Pelajaran yang Dipetik dari Membangun Infrastruktur Open Source yang Sangat Cepat untuk Agen AI; Beri Agen Sebuah Cluster: AI yang Efektif untuk Rekayasa Performa dalam Skala Besar; Mengelola 500 Miliar+ File untuk Beban Kerja AI; Cara Meningkatkan Algoritma Cache Anda Menggunakan AI. DAPATKAN TIKET GRATIS ANDA. Bonus: Pendaftar mendapatkan akses langsung 30 hari ke perpustakaan O'Reilly lengkap, dan peserta dapat ikut serta untuk memenangkan 1 dari 500 paket swag gratis.

Jika Anda pernah menggunakan asisten suara sebelumnya, Anda mungkin pernah mengalami interupsi yang tidak terduga. Anda berbicara dengan sistem, dan saat Anda berhenti sejenak untuk memikirkan istilah yang tepat, ia mulai berbicara. Lalu Anda menginterupsinya agar Anda dapat melanjutkan. Ini adalah frustrasi yang umum, karena sebagian besar model suara dapat mendengarkan atau berbicara, tetapi tidak keduanya pada saat yang sama.

Model suara yang lebih baru, seperti GPT-Live-1 dari OpenAI, mengubah itu dengan mendengarkan dan berbicara pada saat yang sama. Model terus-menerus memutuskan apakah harus tetap diam, menginterupsi, atau mulai berbicara. Ini membuat percakapan terasa lebih alami dengan lebih sedikit interupsi yang tidak disengaja. Di balik layar, sistem ini menggabungkan arsitektur model suara generasi baru dengan sistem penyajian yang dioptimalkan untuk latensi rendah. Untuk memahami bagaimana semuanya bekerja dari awal hingga akhir, kami bertemu dengan engineer di tim GPT Voice, Zahan Malkani dan Justin Uberti (yang menciptakan WebRTC). Kami berterima kasih kepada keduanya karena telah berbagi detailnya dengan kami.

Dalam artikel ini, Anda akan mempelajari: tiga generasi sistem suara, termasuk pipeline bertingkat, model end-to-end berbasis giliran, dan model full-duplex; mendelegasikan pemikiran dari berbicara, ide inti di balik GPT-Live; rekayasa di balik sistem penyajian, termasuk jalur live dan async; bagaimana evaluasi berbeda dalam sistem suara full-duplex; dan pelajaran rekayasa untuk membangun sistem real-time dan apa selanjutnya untuk suara.

Entitas Utama: Perusahaan: OpenAI, ByteByteGo, Lovable, Netflix, O'Reilly, Lang Chain | Orang: Zahan Malkani, Justin Uberti

Apa ide inti di balik GPT-Live?

Mendelegasikan pemikiran dari berbicara.

Bahasa Indonesia version →


🇯🇵 日本語

OpenAI はいかにして GPT-Live を構築したか

パフォーマンスが重要なとき、AI をどのように最適化しますか?そして、AI を活用してパフォーマンスをこれまで以上に良く(そして簡単に)するにはどうすればよいでしょうか?それこそが 30K 人のエンジニア が P99 CONF で探求するテーマです。期待できる講演の一部をご紹介します:Lovable における Sandboxmaxxing:すべてのプロンプトが 1 秒未満でサンドボックスを取得;自律型パフォーマンスエージェント:Netflix のプロダクションストーリー;AI エージェント向けの超高速オープンソースインフラ構築から得た教訓;エージェントにクラスターを:大規模なパフォーマンスエンジニアリングのための効果的な AI;AI ワークロード向けに 5000 億以上のファイル を管理;AI を使ってキャッシュアルゴリズムを改善する方法。無料チケットを取得しましょう。特典:登録者は O'Reilly ライブラリ全体への 30 日間の即時アクセスを取得でき、参加者は 500 個の無料スワッグパック のうち 1 つを当てる抽選に参加できます。

これまでに音声アシスタントを使ったことがあるなら、予期しない中断を経験したことがあるでしょう。システムと話していて、適切な言葉を考えようと少し間を置いた瞬間に、それは話し始めます。そして続けるためにあなたがそれを遮ります。これはよくある不満です。なぜなら、ほとんどの音声モデルは聞くか話すかのどちらかしかできず、同時に両方はできないからです。

OpenAI の GPT-Live-1 のような新しい音声モデルは、同時に聞いて話すことでこれを変えます。モデルは、黙っているべきか、遮るべきか、話し始めるべきかを絶えず判断します。これにより、意図しない中断が減り、会話がより自然に感じられます。内部では、これらのシステムは新世代の音声モデルアーキテクチャと、低遅延に最適化された配信システムを組み合わせています。すべてがエンドツーエンドでどのように機能するかを理解するために、私たちは GPT Voice チーム のエンジニアである Zahan Malkani と Justin Uberti(WebRTC の創設者)に会いました。詳細を共有してくれたお二人に感謝します。

この記事では、以下を学びます:音声システムの 3 世代(カスケードパイプライン、ターンベースのエンドツーエンドモデル、全二重モデルを含む);話すことから考えることを委任する、GPT-Live の背後にある中心的なアイデア;ライブパスと非同期パスを含む配信システムの背後にあるエンジニアリング;全二重音声システムで評価がどのように異なるか;リアルタイムシステムを構築するためのエンジニアリングの教訓と、音声の次なる展開。

主要エンティティ:企業:OpenAI、ByteByteGo、Lovable、Netflix、O'Reilly、Lang Chain | 人物:Zahan Malkani、Justin Uberti

FAQ:GPT-Live の背後にある中心的なアイデアは何ですか?

話すことから考えることを委任すること。

FAQ 質問:GPT-Live の背後にある中心的なアイデアは何ですか?

FAQ 回答:話すことから考えることを委任すること。

GPT-Live の背後にある中心的なアイデアは何ですか?

話すことから考えることを委任すること。

日本語 version →


🇧🇷 Português

Como a OpenAI construiu o GPT-Live

Como você otimiza a IA quando o desempenho importa? E como você pode aplicar a IA para tornar o desempenho melhor (e mais fácil) do que nunca? É isso que 30K engenheiros vão explorar na P99 CONF. Aqui está uma amostra das palestras que você pode esperar: Sandboxmaxxing na Lovable: cada prompt ganha um sandbox em < 1s; O agente autônomo de desempenho: uma história de produção da Netflix; Lições aprendidas ao construir infraestrutura de código aberto extremamente rápida para agentes de IA; Dê um cluster ao agente: IA eficaz para engenharia de desempenho em escala; Gerenciando 500 bilhões+ arquivos para cargas de trabalho de IA; Como melhorar seu algoritmo de cache usando IA. PEGUE SEU INGRESSO GRÁTIS. Bônus: os inscritos recebem acesso imediato de 30 dias à biblioteca completa da O'Reilly, e os participantes podem concorrer a 1 dos 500 pacotes de brindes grátis.

Se você já usou assistentes de voz antes, provavelmente já experimentou interrupções inesperadas. Você fala com o sistema, e no momento em que faz uma breve pausa para pensar no termo certo, ele começa a falar. Então você o interrompe para poder continuar. Essa é uma frustração comum, porque a maioria dos modelos de voz pode ouvir ou falar, mas não ambos ao mesmo tempo.

Modelos de voz mais recentes, como o GPT-Live-1 da OpenAI, mudam isso ao ouvir e falar ao mesmo tempo. O modelo decide constantemente se deve ficar quieto, interromper ou começar a falar. Isso faz a conversa parecer mais natural com menos interrupções não intencionais. Nos bastidores, esses sistemas combinam uma nova geração de arquitetura de modelo de voz com um sistema de serviço otimizado para baixa latência. Para entender como tudo funciona de ponta a ponta, nos reunimos com engenheiros da equipe GPT Voice, Zahan Malkani e Justin Uberti (que criou o WebRTC). Agradecemos a ambos por compartilhar os detalhes conosco.

Neste artigo, você aprenderá: as três gerações de sistemas de voz, incluindo pipelines em cascata, modelos ponta a ponta baseados em turnos e modelos full-duplex; delegar o pensamento da fala, a ideia central por trás do GPT-Live; a engenharia por trás do sistema de serviço, incluindo os caminhos ao vivo e assíncronos; como a avaliação é diferente em sistemas de voz full-duplex; e lições de engenharia para construir sistemas em tempo real e o que vem a seguir para a voz.

Entidades principais: Empresas: OpenAI, ByteByteGo, Lovable, Netflix, O'Reilly, Lang Chain | Pessoas: Zahan Malkani, Justin Uberti

Qual é a ideia central por trás do GPT-Live?

Delegar o pensamento da fala.

Português version →


🇷🇺 Русский

Как OpenAI создала GPT-Live

Как оптимизировать ИИ, когда производительность имеет значение? И как можно применить ИИ, чтобы сделать производительность лучше (и проще), чем когда-либо? Именно это 30K инженеров будут исследовать на P99 CONF. Вот небольшой обзор докладов, которые вас ждут: Sandboxmaxxing в Lovable: каждый промпт получает песочницу менее чем за 1 секунду; Автономный агент производительности: история производства Netflix; Уроки, извлечённые из создания сверхбыстрой инфраструктуры с открытым исходным кодом для ИИ-агентов; Дайте агенту кластер: эффективный ИИ для инженерии производительности в масштабе; Управление 500 миллиардами+ файлов для рабочих нагрузок ИИ; Как улучшить ваш алгоритм кэширования с помощью ИИ. ПОЛУЧИТЕ БЕСПЛАТНЫЙ БИЛЕТ. Бонус: зарегистрировавшиеся получают немедленный 30-дневный доступ к полной библиотеке O'Reilly, а участники могут принять участие в розыгрыше 1 из 500 бесплатных наборов мерча.

Если вы раньше пользовались голосовыми помощниками, вы, вероятно, сталкивались с неожиданными перебиваниями. Вы говорите с системой, и в тот момент, когда вы ненадолго замолкаете, чтобы подумать над нужным словом, она начинает говорить. Затем вы перебиваете её, чтобы продолжить. Это распространённое разочарование, потому что большинство голосовых моделей могут либо слушать, либо говорить, но не то и другое одновременно.

Более новые голосовые модели, такие как GPT-Live-1 от OpenAI, меняют это, слушая и говоря одновременно. Модель постоянно решает, должна ли она молчать, перебить или начать говорить. Это делает разговор более естественным с меньшим количеством непреднамеренных перебиваний. Под капотом эти системы сочетают новое поколение архитектуры голосовых моделей с системой обслуживания, оптимизированной для низкой задержки. Чтобы понять, как всё работает от начала до конца, мы встретились с инженерами команды GPT Voice, Zahan Malkani и Justin Uberti (создателем WebRTC). Мы благодарим обоих за то, что они поделились с нами деталями.

В этой статье вы узнаете: три поколения голосовых систем, включая каскадные конвейеры, поочерёдные сквозные модели и полнодуплексные модели; делегирование мышления от говорения — основную идею GPT-Live; инженерию системы обслуживания, включая живые и асинхронные пути; чем отличается оценка в полнодуплексных голосовых системах; и инженерные уроки для создания систем реального времени и что дальше ждёт голосовые технологии.

Ключевые сущности: Компании: OpenAI, ByteByteGo, Lovable, Netflix, O'Reilly, Lang Chain | Люди: Zahan Malkani, Justin Uberti

Какова основная идея GPT-Live?

Делегирование мышления от говорения.

Русский version →


🇨🇳 简体中文

OpenAI 如何构建 GPT-Live

当性能至关重要时,你如何优化 AI?你又如何应用 AI 让性能比以往更好(也更轻松)?这正是 30K 名工程师 将在 P99 CONF 上探讨的内容。以下是你可以期待的演讲预览:Lovable 的 Sandboxmaxxing:每个提示在不到 1 秒内获得一个沙盒;自主性能代理:一个 Netflix 制作故事;为 AI 代理构建极速开源基础设施的经验教训;给代理一个集群:大规模性能工程中的有效 AI;为 AI 工作负载管理 5000 亿+ 文件;如何使用 AI 改进你的缓存算法。获取你的免费门票。额外福利:注册者可立即获得 O'Reilly 完整图书馆的 30 天访问权限,参会者可以参与抽奖,赢取 500 份免费周边礼包 中的 1 份。

如果你以前使用过语音助手,你可能经历过意外的打断。你和系统说话,而当你短暂停顿以思考合适的词时,它就开始说话了。然后你打断它,以便继续。这是一种常见的挫败感,因为大多数语音模型要么能听,要么能说,但不能同时进行。

更新的语音模型,比如 OpenAI 的 GPT-Live-1,通过同时听和说来改变这一点。模型不断决定它应该保持安静、打断,还是开始说话。这让对话感觉更自然,减少了无意的打断。在底层,这些系统将新一代语音模型架构与针对低延迟优化的服务系统结合在一起。为了端到端地理解这一切如何运作,我们见到了 GPT Voice 团队 的工程师 Zahan Malkani 和 Justin Uberti(他创建了 WebRTC)。我们感谢他们两位与我们分享细节。

在本文中,你将了解:语音系统的三代演进,包括级联流水线、基于轮次的端到端模型和全双工模型;将思考与说话分离,这是 GPT-Live 背后的核心思想;服务系统背后的工程,包括实时路径和异步路径;全双工语音系统中的评估有何不同;以及构建实时系统的工程经验,以及语音的下一步。

关键实体:公司:OpenAI、ByteByteGo、Lovable、Netflix、O'Reilly、Lang Chain | 人物:Zahan Malkani、Justin Uberti

FAQ:GPT-Live 背后的核心思想是什么?

将思考与说话分离。

FAQ 问:GPT-Live 背后的核心思想是什么?

FAQ 答:将思考与说话分离。

GPT-Live 背后的核心思想是什么?

将思考与说话分离。

简体中文 version →