HeadlinesBriefing favicon HeadlinesBriefing.com

API GPT-Live-1 : Voix naturelle pour les développeurs

Hacker News •
×

Nous lançons GPT-Live-1 dans l'API, offrant aux développeurs un modèle de voix puissant et naturel pour créer des applications activées par la voix et des flux de travail commerciaux. Introduit pour la première fois dans Chat GPT, GPT-Live-1 est capable d'écouter et de parler en même temps, et, comme vu avec Codex et Chat GPT Work, peut déléguer un raisonnement plus profond et des actions aux modèles et outils avec lesquels il est apparié. Pour la sortie API de GPT-Live-1, nous nous sommes concentrés sur de nouvelles capacités permettant aux développeurs de diriger et de personnaliser les expériences vocales autour de leurs utilisateurs, flux de travail et objectifs. Une force centrale de GPT-Live-1 est la gestion fluide des interruptions, qui livre déjà un impact commercial : dans les évaluations préliminaires, Speak a constaté que GPT-Live-1 donnait plus de temps aux apprenants à penser avant que le tuteur de langue ne réponde, réduisant les interruptions de près de 80 % par rapport aux systèmes basés sur les tours.

Forces clés de GPT-Live-1 dans l'API :

Gestion des interruptions : Améliore la gestion des interruptions via un modèle unique qui raisonne sur l'audio entrant et sortant ensemble, évitant la latence et les handoffs fragiles des architectures chainées STT-LLM-TTS.

Délégation du raisonnement et appel d'outils : GPT-Live-1 peut déléguer raisonnement et appel d'outils à un modèle texte backend comme GPT-6 Astra ou un modèle tiers.

Tone, rythme et style : Permet aux développeurs de façonner le ton, le rythme et le style conversationnel d'un agent via l'invite du système.

Gestion de contexte silencieux et bruit de fond : Meilleure gestion du bruit de fond et du silence sans interrompre la conversation ou narrer chaque étape à haute voix.

Fiabilité en sessions longues : Améliore la rétention de contexte et la qualité conversationnelle sur des interactions étendues.

Soutien téléphonique : Active le déploiement d'agents vocaux full-duplex pour les appels téléphoniques, des réservations de restaurants au support client.

Essayez GPT-Live-1 Démarrez une session et parlez naturellement. Interrompez, riez, changez d'avis - essayez-le à la maison ou dans un endroit bruyant comme un café ou une rue de la ville. Voyez ce qu'il peut faire Parlez-dessus - naturellement. Demandez de l'aide, puis interrompez la réponse à mi-chemin pour changer la question ou ajouter des détails. Prenez-le avec vous. Essayez une conversation en marchant dehors ou avec un bruit de fond quotidien, et voyez comment il vous suit. Rendez-le ludique. Riez, hésitez, utilisez des acknowledgments courts, ou brièvement parlez avec quelqu'un à proximité - puis continuez la conversation. Cette démo est limitée dans le temps. En l'utilisant, vous acceptez les conditions d'Open AI et reconnaissez notre Politique de confidentialité.

Simplifiez votre architecture d'agent vocal et réduisez la latence vocale Les agents vocaux traditionnels enchaînent speech-to-text, un modèle de raisonnement et text-to-speech. Chaque handoff ajoute de la latence et crée plus d'occasions de perdre le timing, le contexte ou le rythme naturel d'une conversation. Les développeurs sont souvent ceux qui restent à coordonner ces étapes, incluant ce qui se passe lorsqu'une personne interrompt, pause ou change de direction. GPT-Live-1 gère l'écoute et la parole dans un modèle unique, simplifiant la couche vocale. Il peut répondre aux interruptions et aux acknowledgements au moment même, tandis que le délégation de raisonnement approfondi s'effectue en arrière-plan. Cela permet à la conversation de continuer tandis que le travail se fait en arrière-plan. Les développeurs choisissent les modèles, les outils et le harnais d'agent derrière la conversation. Par exemple, ils peuvent associer GPT-Live-1 à un modèle comme Luna pour des tâches à haut volume comme la planification ou les mises à jour de commandes, et utiliser un modèle comme Astra pour des problèmes clients complexes nécessitant un raisonnement. Cette flexibilité permet aux développeurs de matcher la profondeur de raisonnement, la vitesse et le coût à chaque tâche. GPT-Live-1 fournit nativement des transcriptions ASR et du texte de réponse. Il offre également une forte compréhension alphanumérique et prend en charge le biais de mots clés. Bien que GPT-Live-1 ne soit pas un modèle basé sur les tours, il soutient nativement la détection de tours, de sorte que les développeurs peuvent continuer à construire autour de limites de tours explicites.

Mesure de l'avantage full-duplex Dans nos évaluations, GPT-Live-1 améliore les performances de Full Duplex Bench de 30 points de pourcentage par rapport à GPT-Realtime-2.1, avec de grandes gains en latence de tour et comportement interactif...