HeadlinesBriefing favicon HeadlinesBriefing.com

GPT-Live-1 API: Voz natural para desarrolladores

Hacker News •
×

Estamos lanzando GPT-Live-1 en la API, brindando a los desarrolladores un potente modelo de voz natural para crear aplicaciones activadas por voz y flujos de trabajo empresariales. Se presentó por primera vez en Chat GPT, GPT-Live-1 es capaz de escuchar y hablar al mismo tiempo, y, como se vio con Codex y Chat GPT Work, puede delegar razonamiento más profundo y acciones a los modelos y herramientas con las que está emparejado. Para el lanzamiento de API de GPT-Live-1, nos hemos centrado en nuevas capacidades que permiten a los desarrolladores dirigir y personalizar las experiencias de voz alrededor de sus usuarios, flujos de trabajo y objetivos. Una fuerza central de GPT-Live-1 es la fluida gestión de interrupciones, que ya está generando impacto empresarial: en evaluaciones preliminares, Speak descubrió que GPT-Live-1 daba más tiempo a los aprendices para pensar antes de que el tutor de lenguaje respondiera, reduciendo interrupciones en casi un 80% en comparación con los sistemas basados en turnos.

Fortalezas clave de GPT-Live-1 en la API:

Manejo de interrupciones: Mejora el manejo de interrupciones mediante un único modelo que razona sobre audio entrante y saliente juntos, evitando la latencia y los handoffs frágiles de arquitecturas encadenadas STT-LLM-TTS.

Razonamiento y delegación de llamadas de herramientas: GPT-Live-1 puede delegar razonamiento y llamadas de herramientas a un modelo de texto backend como GPT-6 Astra o un modelo de terceros.

Tono, ritmo y estilo: Permite a los desarrolladores moldear el tono, el ritmo y el estilo conversacional de un agente a través del prompt del sistema.

Gestión de contexto silencioso y ruido de fondo: Mejor manejo del ruido de fondo y el silencio sin interrumpir la conversación o narrar cada paso en voz alta.

Fiabilidad en sesiones largas: Mejora la retención de contexto y la calidad conversacional en interacciones extendidas.

Soporte telefónico: Habilita la implementación de agentes de voz de plena duplex para llamadas telefónicas, desde reservas de restaurantes hasta soporte al cliente.

Prueba GPT-Live-1 Inicia una sesión y habla de forma natural. Interrumpe, ríe, cambia de opinión - pruébalo en casa o en un lugar ruidoso como una cafetería o una calle de la ciudad. Mira lo que puede hacer Habla sobre él - de forma natural. Pide ayuda, luego interrumpe la respuesta a mitad para cambiar la pregunta o agregar detalles. Llévalo contigo. Intenta una conversación mientras caminas al aire libre o con ruidos cotidianos, y observa cómo te sigue. Hazlo juguetón. Ríe, dude, usa reconocimientos cortos, o brevemente habla con alguien cercano - luego continúa la conversación. Esta demostración tiene tiempo limitado. Al usarlo, aceptas los Términos de Open AI y reconoces nuestra Política de privacidad.

Simplifica tu arquitectura de agente de voz y reduce la latencia de voz Los agentes de voz tradicionales encadenan speech-to-text, un modelo de razonamiento y text-to-speech. Cada handoff agrega latencia y crea más oportunidades para perder el timing, el contexto o el ritmo natural de una conversación. Los desarrolladores a menudo se quedan coordinando esas etapas, incluyendo qué sucede cuando alguien interrumpe, pausa o cambia de dirección. GPT-Live-1 maneja la escucha y la habla en un solo modelo, simplificando la capa de voz. Puede responder a interrupciones y reconocimiento mientras ocurren, mientras delega razonamiento más profundo al backend. Esto permite que la conversación continúe mientras el trabajo sucede en segundo plano. Los desarrolladores eligen los modelos, herramientas y marco de agente detrás de la conversación. Por ejemplo, pueden emparejar GPT-Live-1 con un modelo como Luna para tareas de alto volumen como programación o actualizaciones de pedidos, y usar un modelo como Astra para problemas complejos de clientes que requieran razonamiento. Esta flexibilidad permite a los desarrolladores emparejar profundidad de razonamiento, velocidad y costo a cada tarea. GPT-Live-1 proporciona nativamente transcripciones ASR y texto de respuesta. También ofrece fuerte comprensión alfanumérica y admite sesgo de palabras clave. Aunque GPT-Live-1 no es un modelo basado en turnos, admite nativamente la detección de turnos, por lo que los desarrolladores pueden continuar construyendo alrededor de límites de turnos explícitos.

Medir la ventaja de full-duplex En nuestras evaluaciones, GPT-Live-1 mejora el rendimiento de Full Duplex Bench en 30 puntos porcentuales en comparación con GPT-Realtime-2.1, con grandes ganancias en latencia de turnos y comportamiento interactivo...