@kwindla推出PhoneLLM,解决语音智能体延迟痛点
隆重推出 PhoneLLM,一款面向语音代理的开源模型。它在典型语音代理任务上能达到 GPT 5.6 Terra 的性能,延迟仅为其三分之一,成本仅为其十八分之一。
对于语音代理而言,我们需要模型同时具备极低延迟,以及出色的工具调用和指令跟随能力。这里一直存在权衡问题:构建语音代理时,我们往往不得不在延迟或性能之间做出妥协。
而通过 PhoneLLM(以及支撑这个模型诞生的训练和数据栈),我们解决了这个问题。过去几年,前沿模型开发的大部分工作都投入在了利用测试时计算上。这很棒!现在各种尺寸的模型都能实现非常非常出色的性能……前提是你开启了模型的「思考」功能。但如果你需要代理以语音对话的速度响应,你就没法用带思考的模型。
PhoneLLM 是对 NVIDIA Nemotron Nano 30B 全参数微调得到的模型。我们在大量真实世界的电话和客服场景上训练了它。训练的核心是保留 Nano 30B 基础模型出色的原有能力,同时教会模型在关闭思考功能的情况下完成典型语音代理任务。
结果非常出色:长对话中工具调用精准,回答简洁切题,而且速度极快:如果你在负载较轻的 B200 上运行 PhoneLLM,服务端测得的 TTFAT 小于 100ms。:-)
说真的,我们在表征模型延迟时,用的是完整端到端批量请求模拟,使用真实的 Pipecat 语音代理管线。单张 B200 上就能承载超过 80 个并发代理,P95 端到端 TTFAT 小于 600ms,这一结果已经包含了网络开销。
对应的大语言模型每分钟成本约为 0.0025 美元,也就是四分之一美分,延迟还低于目前所有第三方 API 能提供的水平。
这个模型的更多细节,包括 @huggingface 上的权重、如何在 Modal 上一键启动,以及你可以直接克隆的入门项目仓库,都在接下来的推文中……
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖