HeadlinesBriefing favicon HeadlinesBriefing.com

GPT-Live-1 API: 自然语音供开发者使用

Hacker News •
×

我们正在 API 中推出 GPT-Live-1,为开发者提供强大的自然语音模型,用于构建语音启用的应用和业务工作流。首次在 Chat GPT 中介绍,GPT-Live-1 能够同时监听和说话,正如 Codex 和 Chat GPT Work 所展示的那样,可以将更深层的推理和操作委托给其配对的模型和工具。针对 API 发布的 GPT-Live-1,我们专注于让开发者围绕其用户、工作流和目标来引导和自定义语音体验。GPT-Live-1 的核心优势之一是流畅的中断处理,已在早期评估中展现业务影响:Speak 发现,GPT-Live-1 让语言导师在回复前给学习者更多思考时间,相比基于轮次的系统,中断次数几乎减少了 80%。

GPT-Live-1 在 API 中的关键优势:

中断处理:通过单一模型对传入和传出音频进行推理,避免链式 STT-LLM-TTS 架构的延迟和脆弱的 handoff。

推理与工具调用委托:GPT-Live-1 可以将推理和工具调用委托给后端文本模型,如 GPT-6 Astra 或第三方模型。

语调、语速和风格:让开发者通过系统提示塑造代理的语调、语速和对话风格。

静默上下文管理与背景噪音:更好地处理背景噪音和静默,而不中断对话或大声叙述每一步。

长会话可靠性:提高跨延长交互的上下文保留和对话质量。

电信支持:启用全双工语音代理用于电话呼叫,从餐厅预订到客户支持。

尝试 GPT-Live-1 开始一个会话并自然发言。中断、大笑、改变主意 - 尝试在家里或在喧闹的咖啡店或城市街道等嘈杂环境中进行。看看它能做什么 说话-over-它 - 自然地。请求帮助,然后在回复中途中断以更改问题或添加细节。带上它。尝试一边走动一边对话,或与日常背景噪音交谈,看看它如何跟上你。让它变得活泼。大笑、犹豫、使用短确认,或简短地与附近的人交谈 - 然后继续对话。此演示时间有限。通过使用它,您同意 Open AI 的条款并确认我们的隐私政策。

简化您的语音代理架构并减少语音延迟 传统的语音代理将语音转文本、推理模型和文本转语音串联在一起。每次 handoff 增加延迟并创造更多机会丢失时机、上下文或对话的自然节奏。开发者往往被留下协调这些阶段,包括当有人中断、暂停或改变方向时会发生什么。GPT-Live-1 在单一模型中处理监听和说话,简化了语音层。它可以即时响应中断和确认,同时将更深层的推理委托到后台。这让对话得以继续,而后台工作正在进行。开发者选择对话背后的模型、工具和代理框架。例如,他们可能会将 GPT-Live-1 与 Luna 模型配对,用于高容量任务,如调度或订单更新,并使用 Astra 模型处理需要推理的复杂客户问题。这种灵活性让开发者能够将推理深度、速度和成本与每个任务相匹配。GPT-Live-1 原生提供 ASR 转录文本和响应文本。它还提供强大的字母数字理解并支持关键词偏置。尽管 GPT-Live-1 不是基于轮次的模型,但它原生支持轮次检测,因此开发者仍然可以围绕明确的轮次边界进行构建。

衡量全双工优势 在我们的评估中,GPT-Live-1 相比 GPT-Realtime-2.1,Full Duplex Bench 性能提升了 30 个百分点,在轮次转换延迟和交互行为方面有显著提升。