HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI はいかにして GPT-Live を構築したか

ByteByteGo •
×

パフォーマンスが重要なとき、AI をどのように最適化しますか?そして、AI を活用してパフォーマンスをこれまで以上に良く(そして簡単に)するにはどうすればよいでしょうか?それこそが 30K 人のエンジニア が P99 CONF で探求するテーマです。期待できる講演の一部をご紹介します:Lovable における Sandboxmaxxing:すべてのプロンプトが 1 秒未満でサンドボックスを取得;自律型パフォーマンスエージェント:Netflix のプロダクションストーリー;AI エージェント向けの超高速オープンソースインフラ構築から得た教訓;エージェントにクラスターを:大規模なパフォーマンスエンジニアリングのための効果的な AI;AI ワークロード向けに 5000 億以上のファイル を管理;AI を使ってキャッシュアルゴリズムを改善する方法。無料チケットを取得しましょう。特典:登録者は O'Reilly ライブラリ全体への 30 日間の即時アクセスを取得でき、参加者は 500 個の無料スワッグパック のうち 1 つを当てる抽選に参加できます。

これまでに音声アシスタントを使ったことがあるなら、予期しない中断を経験したことがあるでしょう。システムと話していて、適切な言葉を考えようと少し間を置いた瞬間に、それは話し始めます。そして続けるためにあなたがそれを遮ります。これはよくある不満です。なぜなら、ほとんどの音声モデルは聞くか話すかのどちらかしかできず、同時に両方はできないからです。

OpenAI の GPT-Live-1 のような新しい音声モデルは、同時に聞いて話すことでこれを変えます。モデルは、黙っているべきか、遮るべきか、話し始めるべきかを絶えず判断します。これにより、意図しない中断が減り、会話がより自然に感じられます。内部では、これらのシステムは新世代の音声モデルアーキテクチャと、低遅延に最適化された配信システムを組み合わせています。すべてがエンドツーエンドでどのように機能するかを理解するために、私たちは GPT Voice チーム のエンジニアである Zahan MalkaniJustin Uberti(WebRTC の創設者)に会いました。詳細を共有してくれたお二人に感謝します。

この記事では、以下を学びます:音声システムの 3 世代(カスケードパイプライン、ターンベースのエンドツーエンドモデル、全二重モデルを含む);話すことから考えることを委任する、GPT-Live の背後にある中心的なアイデア;ライブパスと非同期パスを含む配信システムの背後にあるエンジニアリング;全二重音声システムで評価がどのように異なるか;リアルタイムシステムを構築するためのエンジニアリングの教訓と、音声の次なる展開。

主要エンティティ:企業:OpenAI、ByteByteGo、Lovable、Netflix、O'Reilly、Lang Chain | 人物:Zahan Malkani、Justin Uberti

FAQ:GPT-Live の背後にある中心的なアイデアは何ですか?

話すことから考えることを委任すること。

FAQ 質問:GPT-Live の背後にある中心的なアイデアは何ですか?

FAQ 回答:話すことから考えることを委任すること。