你学外语卡壳时,AI老师安静等着,打断次数少了近80%
语言学习应用 Speak 和 OpenAI 合作开发了 GPT-Live-1。首个功能是 Live Tutor Lessons,一节实时辅导课。AI 就在对话中教外语。
关键改动在回合机制。GPT-Live 去掉了轮流检测器。它一边连续处理输入音频,一边生成输出音频,不用等学习者说完。学习者停下来想词时,AI 老师就安静等着,不抢话,也不用靠填充静音撑住对话节奏。
Speak 的内部测试显示了改善幅度。学习者在思考停顿期间,GPT-Live 的打断次数比之前少了近 80%。停顿在 1 到 2 秒时,打断率低于 10%。101 个评分回合里,约 85% 的纠正算合理,约 80% 该纠正的错误也被抓到。还有 12 个评估案例,它主动跳过了纠正——那种时刻,纠正会打断学习者正要说的话。
纠正的时机是一回事,语音识别是另一回事。评估集上,GPT-Live 的转录词错误率约 11%,跟 gpt-realtime-2 差不多。遇到训练分布外的困难语音,比如带浓重英语口音的韩语,错误率接近 40%。
发音反馈更成问题。对清晰的录音,它 22.7% 的情况给出错误纠正,真实错误只捕获了 38%。转录和理解还会对不上。有时转录是对的,模型却像听到了另一个词;有时转录错了,回答反而没问题。
一个简单的设定能改善:直接告诉模型学习者的母语和目标语言。混合语言对话的响应相关性从 69% 涨到 78%。
开发者这边,全双工模型需要重新适配。GPT-Live 以 1 倍实时速度连续生成音频。之前的语音模型生成快于实时,WebRTC 媒体栈大多按这个假设工作。现在,应用得处理一条永不停止的音频流。系统提示是冻结的,会话上下文追加可能非确定性地让模型打断自己。转录片段没有固定边界,应用得按自己的规则分组。GPT-Live 启动了一条连续、永不停止的逻辑媒体时间线。这条时间线直接塑造了下游产品的交互设计。
Speak 为此重建了实时课程框架。导演管理教学进度,观察者跟踪课堂状态,上下文更新和教学提示引导辅导结构。Speak 认为 GPT-Live 是迈向超人类导师的重要进展。它还表示,全双工是语音 AI 的未来。