HeadlinesBriefing favicon HeadlinesBriefing.com

Comment OpenAI a construit GPT-Live

ByteByteGo •
×

Comment optimisez-vous l'IA lorsque la performance compte ? Et comment pouvez-vous appliquer l'IA pour rendre la performance meilleure (et plus facile) que jamais ? C'est ce que 30K ingénieurs exploreront à P99 CONF. Voici un aperçu des conférences à venir : Sandboxmaxxing chez Lovable : chaque prompt obtient un sandbox en < 1s ; L'agent de performance autonome : une histoire de production Netflix ; Leçons apprises en construisant une infrastructure open source ultra-rapide pour les agents IA ; Donnez un cluster à l'agent : une IA efficace pour l'ingénierie de performance à grande échelle ; Gérer 500 milliards+ de fichiers pour les charges de travail IA ; Comment améliorer votre algorithme de cache avec l'IA. OBTENEZ VOTRE BILLET GRATUIT. Bonus : les inscrits obtiennent un accès immédiat de 30 jours à la bibliothèque complète O'Reilly, et les participants peuvent tenter de gagner 1 des 500 packs de goodies gratuits.

Si vous avez déjà utilisé des assistants vocaux, vous avez probablement vécu des interruptions inattendues. Vous parlez au système, et au moment où vous faites une brève pause pour réfléchir au bon terme, il commence à parler. Puis vous l'interrompez pour pouvoir continuer. C'est une frustration courante, car la plupart des modèles vocaux peuvent soit écouter, soit parler, mais pas les deux en même temps.

Les modèles vocaux plus récents, comme GPT-Live-1 d'OpenAI, changent cela en écoutant et en parlant en même temps. Le modèle décide constamment s'il doit rester silencieux, interrompre ou commencer à parler. Cela rend la conversation plus naturelle avec moins d'interruptions involontaires. Sous le capot, ces systèmes combinent une nouvelle génération d'architecture de modèle vocal avec un système de service optimisé pour une faible latence. Pour comprendre comment tout fonctionne de bout en bout, nous avons rencontré des ingénieurs de l'équipe GPT Voice, Zahan Malkani et Justin Uberti (qui a créé WebRTC). Nous les remercions tous les deux de nous avoir partagé les détails.

Dans cet article, vous apprendrez : les trois générations de systèmes vocaux, y compris les pipelines en cascade, les modèles de bout en bout basés sur les tours et les modèles full-duplex ; déléguer la réflexion de la parole, l'idée centrale derrière GPT-Live ; l'ingénierie derrière le système de service, y compris les chemins live et asynchrones ; comment l'évaluation est différente dans les systèmes vocaux full-duplex ; et les leçons d'ingénierie pour construire des systèmes temps réel et ce qui attend la voix.

Entités clés : Entreprises : OpenAI, ByteByteGo, Lovable, Netflix, O'Reilly, Lang Chain | Personnes : Zahan Malkani, Justin Uberti

FAQ : Quelle est l'idée centrale derrière GPT-Live ?

Déléguer la réflexion de la parole.

FAQ Q : Quelle est l'idée centrale derrière GPT-Live ?

FAQ R : Déléguer la réflexion de la parole.