HeadlinesBriefing favicon HeadlinesBriefing.com

Cómo OpenAI construyó GPT-Live

ByteByteGo •
×

¿Cómo optimizas la IA cuando el rendimiento importa? ¿Y cómo puedes aplicar la IA para mejorar el rendimiento (y hacerlo más fácil) que nunca? Eso es lo que 30K ingenieros explorarán en P99 CONF. Aquí tienes una muestra de las charlas que puedes esperar: Sandboxmaxxing en Lovable: cada prompt obtiene un sandbox en < 1s; El agente autónomo de rendimiento: una historia de producción de Netflix; Lecciones aprendidas al construir infraestructura de código abierto extremadamente rápida para agentes de IA; Dale un clúster al agente: IA efectiva para ingeniería de rendimiento a escala; Gestionando 500 mil millones+ archivos para cargas de trabajo de IA; Cómo mejorar tu algoritmo de caché usando IA. CONSIGUE TU ENTRADA GRATIS. Bonificación: los registrados obtienen acceso inmediato de 30 días a la biblioteca completa de O'Reilly, y los asistentes pueden participar para ganar 1 de 500 paquetes de swag gratis.

Si has usado asistentes de voz antes, probablemente hayas experimentado interrupciones inesperadas. Hablas con el sistema y, en el momento en que haces una breve pausa para pensar en el término correcto, empieza a hablar. Entonces lo interrumpes para poder continuar. Esta es una frustración común, porque la mayoría de los modelos de voz pueden escuchar o hablar, pero no ambos al mismo tiempo.

Los modelos de voz más nuevos, como GPT-Live-1 de OpenAI, cambian eso al escuchar y hablar al mismo tiempo. El modelo decide constantemente si debe quedarse callado, interrumpir o empezar a hablar. Esto hace que la conversación se sienta más natural con menos interrupciones involuntarias. Bajo el capó, estos sistemas combinan una nueva generación de arquitectura de modelos de voz con un sistema de servicio optimizado para baja latencia. Para entender cómo funciona todo de principio a fin, nos reunimos con ingenieros del equipo de GPT Voice, Zahan Malkani y Justin Uberti (quien creó WebRTC). Agradecemos a ambos por compartir los detalles con nosotros.

En este artículo, aprenderás: las tres generaciones de sistemas de voz, incluidos pipelines en cascada, modelos end-to-end basados en turnos y modelos full-duplex; delegar el pensamiento del habla, la idea central detrás de GPT-Live; la ingeniería detrás del sistema de servicio, incluidos los caminos en vivo y asíncronos; cómo la evaluación es diferente en sistemas de voz full-duplex; y lecciones de ingeniería para construir sistemas en tiempo real y qué sigue para la voz.

Entidades clave: Empresas: OpenAI, ByteByteGo, Lovable, Netflix, O'Reilly, Lang Chain | Personas: Zahan Malkani, Justin Uberti