AI Pulse

过去打断语音 AI 就卡壳,GPT-Live-1 让打断次数少了近 80%

过去打断语音 AI 就卡壳,GPT-Live-1 让打断次数少了近 80%

传统语音代理是这么干的:先把人说的话转成文字,交给模型处理,再把回答转成语音。三套系统来回倒,每次交接都增加延迟,也容易丢掉节奏和上下文。过去每说完一句都要等,中途打断还会让系统卡壳。

一个模型同时听和说

GPT-Live-1 首次出现在 ChatGPT,现在开放到了 API。它用一个模型同时处理听和说,不用在三套系统间来回倒手。语音层因此简化,模型在后台执行任务时,对话还能继续。

打断处理是这次升级的重点之一。语言学习应用 Speak 的早期评估里,打断次数比之前的回合制系统少了近 80%。模型能处理背景噪音和静默,不会把停顿误判成对话结束,也不会把处理过程一步一步念出来。

OpenAI 给了个限时演示,鼓励去咖啡店、街道这些吵的地方试。你可以故意打断它、大笑、犹豫、改变主意、简短回应,或者跟旁边的人说几句话再继续对话。

模型支持电话场景,可以部署全双工语音代理,两边同时说话也不会乱。从餐厅预订到客户支持都能用。打电话给 AI 客服时,中途插话能得到反应,不用等它说完。长时间对话里,上下文保留和对话质量比之前好,不用反复解释已经说过的内容。

数据表现

在 Full Duplex Bench 上,GPT-Live-1 比 GPT-Realtime-2.1 高 30 个百分点,轮流延迟和交互行为大幅改善。搭配 GPT-6 Astra 的中等推理档位,它在 Tau3 基准上排名第一。这项基准衡量语音代理在端到端任务上的智能。

评估覆盖航空、零售、电信领域的口语客服任务,Pass@1 衡量任务成功率。银行支持场景带知识检索和账户工具,97 个银行知识任务按完成比例计分。另有专门测试覆盖暂停处理、对话轮流、打断和反馈信号,以及代理对背景语音、对他人说话、听众反馈的反应。一项指标衡量代理在对方结束回合后多久开始回复。

工具调用测试用包含自然停顿、犹豫和自我纠正的口语请求,按工具调用序列评分。口语回答则与参考意图比对匹配程度。

给开发者的控制权

开发者可以用系统提示词设置代理的语气、语速和对话风格。深度推理和行动可以委托给配对的模型和工具,比如 Codex 和 ChatGPT Work。推理和工具调用也能交给 GPT-6 Astra 或第三方文本模型。

开发者也能按任务量搭配模型。高容量任务用 Luna 管日程安排或订单更新,复杂客户问题交给 Astra。

模型原生提供语音转录、响应文本和关键词偏置,对字母数字的识别能力也不错。它不是回合制模型,但保留回合检测,沿用回合制产品逻辑的开发者可以继续按回合边界构建。

价格

API 已上线,前端语音层每分钟 0.05 美元。自定义语音需要联系销售了解资格和流程。语音选择从一小批实时语音扩展到更多口音、方言和语言,未来几个月还会继续扩充。

企业入口

OpenAI Presence 用 GPT-Live-1 驱动实时语音交互,帮助企业部署 AI 代理。代理能回答问题、解决问题、使用公司系统、在授权范围内采取行动,需要时升级给人工。

用 GPT-Live-1 作语音层,后端模型和代理框架按产品需求搭配,语音体验可以随任务规模扩展。

阅读原文
📚 相关主题 产品发布语音模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新