AI Pulse

IBM语音模型1秒处理3.5小时录音,可本地运行

IBM语音模型1秒处理3.5小时录音,可本地运行

IBM周三发布了两个名为Granite Speech 5.0 Turbo CTC的语音识别模型,参数量只有4.7亿,专为英语语音识别设计。在NVIDIA H200 GPU上,它们实现了超过12,600 RTFx的吞吐量——批处理模式下,1秒可以转录超过3.5小时的语音。

速度这么快,准确率却没怎么牺牲。在OpenASR公开测试集上,非商业版本(CC-BY-NC-SA许可证)词错误率为4.85%,商业友好版本(Apache 2.0许可证)为5.00%。在远场语音识别排行榜FFASR上,截至2026年8月25日,非商业版本排名第五,商业版本排名第九,两者是榜单上速度最快的。

两个模型的主要区别在于训练数据和许可证。非商业版本用了更多数据,许可证是CC-BY-NC-SA-4.0,只能用于非商业用途;商业版本数据少一些,但用Apache 2.0许可证,可以自由用于商业产品。开发者得根据用途选版本。

为什么能这么快?核心在架构。这些模型是仅编码器架构,放弃了之前版本中集成的语言模型,吞吐量提升了20倍以上。它们采用连接主义时间分类(CTC)损失函数训练,用分块注意力机制,避免了标准点积注意力随序列长度二次缩放的问题。输出token率大幅降低至每秒12.5个,通过三级2倍下采样实现。这种设计也带来了局限性:牺牲了语音翻译和关键词偏置等功能,只专注纯转录。

模型已在Hugging Face Transformers中原生支持,可通过pip安装使用。IBM还提供了WebGPU演示,展示流式语音识别(边说边转文字),但只支持Chrome或Edge浏览器。由于模型体积小,适合在手机、平板等边缘设备上运行,无需联网就能完成语音转文字,隐私也更好。

训练数据混合了自然数据和合成数据。自然数据包括MLS、YODAS、CommonVoice等。合成数据包括约2000小时的多说话人拼接数据、500小时特定内容数据、240小时含数字和货币的语音数据。两个版本使用的分词器不同:非商业版本用SentencePiece,商业版本用BPE,两者都在语音转录文本上训练。

目前尚不清楚模型是否支持中文或其他非英语语言,在普通消费级设备(如手机CPU)上的实际速度也未公布。模型是否支持说话人分离(区分谁在说话)以及未来是否会恢复语音翻译等功能,IBM没有说明。但对于需要快速、准确、本地运行的英语语音转文字场景,这两个模型已经提供了可用的开源选择。

阅读原文
📚 相关主题 语音识别模型发布

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新