HeadlinesBriefing favicon HeadlinesBriefing.com

Bagaimana OpenAI Membangun GPT-Live

ByteByteGo •
×

Bagaimana Anda mengoptimalkan AI ketika performa penting? Dan bagaimana Anda dapat menerapkan AI untuk membuat performa lebih baik (dan lebih mudah) dari sebelumnya? Itulah yang akan dieksplorasi oleh 30K engineer di P99 CONF. Berikut adalah cuplikan dari pembicaraan yang dapat Anda harapkan: Sandboxmaxxing di Lovable: Setiap prompt Mendapatkan Sandbox dalam < 1 detik; Agen Performa Otonom: Kisah Produksi Netflix; Pelajaran yang Dipetik dari Membangun Infrastruktur Open Source yang Sangat Cepat untuk Agen AI; Beri Agen Sebuah Cluster: AI yang Efektif untuk Rekayasa Performa dalam Skala Besar; Mengelola 500 Miliar+ File untuk Beban Kerja AI; Cara Meningkatkan Algoritma Cache Anda Menggunakan AI. DAPATKAN TIKET GRATIS ANDA. Bonus: Pendaftar mendapatkan akses langsung 30 hari ke perpustakaan O'Reilly lengkap, dan peserta dapat ikut serta untuk memenangkan 1 dari 500 paket swag gratis.

Jika Anda pernah menggunakan asisten suara sebelumnya, Anda mungkin pernah mengalami interupsi yang tidak terduga. Anda berbicara dengan sistem, dan saat Anda berhenti sejenak untuk memikirkan istilah yang tepat, ia mulai berbicara. Lalu Anda menginterupsinya agar Anda dapat melanjutkan. Ini adalah frustrasi yang umum, karena sebagian besar model suara dapat mendengarkan atau berbicara, tetapi tidak keduanya pada saat yang sama.

Model suara yang lebih baru, seperti GPT-Live-1 dari OpenAI, mengubah itu dengan mendengarkan dan berbicara pada saat yang sama. Model terus-menerus memutuskan apakah harus tetap diam, menginterupsi, atau mulai berbicara. Ini membuat percakapan terasa lebih alami dengan lebih sedikit interupsi yang tidak disengaja. Di balik layar, sistem ini menggabungkan arsitektur model suara generasi baru dengan sistem penyajian yang dioptimalkan untuk latensi rendah. Untuk memahami bagaimana semuanya bekerja dari awal hingga akhir, kami bertemu dengan engineer di tim GPT Voice, Zahan Malkani dan Justin Uberti (yang menciptakan WebRTC). Kami berterima kasih kepada keduanya karena telah berbagi detailnya dengan kami.

Dalam artikel ini, Anda akan mempelajari: tiga generasi sistem suara, termasuk pipeline bertingkat, model end-to-end berbasis giliran, dan model full-duplex; mendelegasikan pemikiran dari berbicara, ide inti di balik GPT-Live; rekayasa di balik sistem penyajian, termasuk jalur live dan async; bagaimana evaluasi berbeda dalam sistem suara full-duplex; dan pelajaran rekayasa untuk membangun sistem real-time dan apa selanjutnya untuk suara.

Entitas Utama: Perusahaan: OpenAI, ByteByteGo, Lovable, Netflix, O'Reilly, Lang Chain | Orang: Zahan Malkani, Justin Uberti