HeadlinesBriefing favicon HeadlinesBriefing.com

Wie OpenAI GPT-Live baute

ByteByteGo •
×

Wie optimiert man KI, wenn Leistung zählt? Und wie kann man KI einsetzen, um die Leistung besser (und einfacher) als je zuvor zu machen? Genau das werden 30K Ingenieure auf der P99 CONF erkunden. Hier ist ein Vorgeschmack auf die Vorträge, die Sie erwarten können: Sandboxmaxxing bei Lovable: Jeder Prompt erhält einen Sandbox in < 1s; Der autonome Performance-Agent: Eine Netflix-Produktionsgeschichte; Lehren aus dem Aufbau blitzschneller Open-Source-Infrastruktur für KI-Agenten; Geben Sie dem Agenten einen Cluster: Effektive KI für Performance-Engineering im großen Maßstab; Verwaltung von 500 Milliarden+ Dateien für KI-Workloads; Wie Sie Ihren Cache-Algorithmus mit KI verbessern. HOLEN SIE SICH IHR KOSTENLOSES TICKET. Bonus: Registrierte erhalten sofortigen 30-tägigen Zugang zur vollständigen O'Reilly-Bibliothek, und Teilnehmer können an der Verlosung von 1 von 500 kostenlosen Swag-Paketen teilnehmen.

Wenn Sie schon einmal Sprachassistenten verwendet haben, haben Sie wahrscheinlich unerwartete Unterbrechungen erlebt. Sie sprechen mit dem System, und in dem Moment, in dem Sie kurz innehalten, um über den richtigen Begriff nachzudenken, beginnt es zu sprechen. Dann unterbrechen Sie es, um fortzufahren. Das ist eine häufige Frustration, denn die meisten Sprachmodelle können entweder zuhören oder sprechen, aber nicht beides gleichzeitig.

Neuere Sprachmodelle wie OpenAIs GPT-Live-1 ändern das, indem sie gleichzeitig zuhören und sprechen. Das Modell entscheidet ständig, ob es still bleiben, unterbrechen oder anfangen soll zu sprechen. Dadurch fühlt sich das Gespräch natürlicher an, mit weniger unbeabsichtigten Unterbrechungen. Unter der Haube kombinieren diese Systeme eine neue Generation von Sprachmodellarchitektur mit einem Serving-System, das für niedrige Latenz optimiert ist. Um zu verstehen, wie alles Ende-zu-Ende funktioniert, trafen wir uns mit Ingenieuren des GPT Voice-Teams, Zahan Malkani und Justin Uberti (der WebRTC entwickelte). Wir danken beiden dafür, dass sie die Details mit uns geteilt haben.

In diesem Artikel erfahren Sie: die drei Generationen von Sprachsystemen, einschließlich kaskadierter Pipelines, turn-basierter Ende-zu-Ende-Modelle und Vollduplex-Modelle; das Delegieren des Denkens vom Sprechen, die Kernidee hinter GPT-Live; die Technik hinter dem Serving-System, einschließlich der Live- und Async-Pfade; wie sich die Evaluierung in Vollduplex-Sprachsystemen unterscheidet; und Engineering-Lektionen für den Aufbau von Echtzeitsystemen und was als Nächstes für Sprache kommt.

Wichtige Entitäten: Unternehmen: OpenAI, ByteByteGo, Lovable, Netflix, O'Reilly, Lang Chain | Personen: Zahan Malkani, Justin Uberti