HeadlinesBriefing favicon HeadlinesBriefing.com

واجهة برمجة تطبيقات GPT-Live-1: صوت طبيعي للمطورين

Hacker News •
×

نحن نطلق GPT-Live-1 في واجهة البرمجة التطبيقية، مما يمنح المطورين نموذج صوتي قوي وطبيعي لإنشاء تطبيقات активирован بالصوت وعمليات العمل التجارية. تم تقديمه لأول مرة في Chat GPT، GPT-Live-1 capable of listening and speaking at the same time، وكما شوهد مع Codex و Chat GPT Work، يمكن أن ينقل استدلال أعمق وأفعال إلى النماذج والأدوات التي تم pairing معها. بالنسبة لإصدار API من GPT-Live-1، ركزنا على قدرات جديدة تسمح للمطورين بضبط وتخصيص تجارب الصوت حول مستخدميهم، تدفقات العمل، وأهدافهم. قوة أساسية من GPT-Live-1 هي التعامل السلس مع المقاطعات، وقدمت تأثيرًا تجاريًا في التقييمات المبكرة: اكتشف Speak أن GPT-Live-1 gave learners more time to think before the language tutor responded، cutting interruptions by almost 80% compared to previous turn-based systems.

نقاط القوة الرئيسية لـ GPT-Live-1 في API:

معالجة المقاطعات: تحسين معالجة المقاطعات من خلال نموذج واحد يقوم بالتفكير في الصوت الوارد والصادر معًا، تجنبًا للالتأخير واله handoffs الهشة لتراكيب STT-LLM-TTS السلسلة.

التفويض والاستدلال واستدعاء الأدوات: يمكن لـ GPT-Live-1 نقل الاستدلال واستدعاء الأدوات إلى نموذج نص خلفي مثل GPT-6 Astra أو نموذج من طرف ثالث.

النبرة، والإيقاع، والأسلوب: يسمح للمطورين بتشكيل نبرة، وإيقاع، وأسلوب المحادثة لوكيل من خلال prompt النظام.

إدارة السياق الصامت والضوضاء الخلفية: أفضل التعامل مع الضوضاء الخلفية والصمت دون مقاطعة المحادثة أو سرد كل خطوة بصوت عالٍ.

الموثوقية في الجلسات الطويلة: تحسين الاحتفاظ بالسياق وجودة المحادثة في التفاعلات الممتدة.

دعم الهاتف: تمكين نشر وكلاء الصوت كامل الدوبلوكس للمكالمات الهاتفية، من حجوزات المطاعم إلى دعم العملاء.

جرب GPT-Live-1 ابدأ جلسة وتحدث بشكل طبيعي. المقاطعة، الضحك، تغيير الرأي - جربها في المنزل أو في مكان صاخب مثل مقهى أو شارع في المدينة. شاهد ما يمكن أن تفعله تكلم عليها - بشكل طبيعي. اطلب المساعدة، ثم المقاطعة منتصف الرد لتغيير السؤال أو إضافة التفاصيل. خذها معك. حاول محادثة بينما تمشي في الهواء الطلق أو مع ضوضاء يومية، وشاهد كيف يتبعتك. اجعله مرحًا. اضحك، تردد، استخدم اعترافات قصيرة، أو brevemente تحدث مع شخص قريب - ثم استمر في المحادثة. هذه demo محدودة الوقت. باستخدامه، توافق على شروط Open AI وت承认我们的 سياسة الخصوصية.

تبسيط بنية agente الصوت وتقليل latency الصوت normally voice agents speech-to-text، a reasoning model، and text-to-speech. كل handoff يضيف latency ويخلق فرصًا أكثر لفقدان التوقيت، السياق، أو الإيقاع الطبيعي للمحادثة. المطورون غالبًا ما يُتركون协调 تلك المراحل، بما في ذلك ما يحدث عندما ينقطع شخص ما، يتوقف، أو يغير الاتجاه. GPT-Live-1 يستمع ويتحدث في نموذج واحد، مبسطًا طبقة الصوت. يمكنه الرد على المقاطعات والتأكيدات بينما تحدث، بينما ينقل الاستدلال الأعمق إلى الخلفية. هذا يسمح للمحادثة بالاستمرار بينما يحدث العمل في الخلفية. المطورون يختارون النماذج، والأدوات، والإطار الخلفي وراء المحادثة. على سبيل المثال، يمكنهم pairing GPT-Live-1 مع نموذج مثل Luna لمهام عالية الحجم مثل الجدولة أو تحديث الطلبات، واستخدام نموذج مثل Astra لمشاكل العملاء المعقدة التي تتطلب الاستدلال. هذه المرونة تسمح للمطورين بمطابقة عمق الاستدلال، والسرعة، والتكلفة إلى كل مهمة. GPT-Live-1 يوفر نصوص转录 ASR natively ونص الاستجابة. كما يوفر فهمًا قويًا للرقميات والأحرف ويدعم التحيز الكلمات المفتاحية. على الرغم من أن GPT-Live-1 ليس نموذجًا يعتمد على الأدوار، إلا أنه يدعم natively اكتشاف الأدوار، لذا يمكن للمطورون مواصلة البناء around حدود الأدوار الصريحة.

قياس ميزة full-duplex Across تقييماتنا، GPT-Live-1 Full Duplex Bench الأداء بنسبة 30 نقطة مئوية مقارنة بـ GPT-Realtime-2.1، مع مكاسب كبيرة في latency转换 الأدوار والسلوك التفاعلي...