AI Pulse

英伟达开源整套语音模型,可在本地离线运行

英伟达这次把整套语音技术栈放到了本地:ASR、TTS、codec 一个不缺,量化成 GGUF 格式,通过 NeMo-Speech.cpp 跑在设备端。

具体是六项:
- Magpie-TTS Multilingual——语音合成
- Nemotron Speech Streaming EN 0.6B / Nemotron-3.5 ASR Streaming——流式识别
- Parakeet CTC 1.1B / Parakeet TDT 0.6B v3——识别模型
- NanoCodec——音频编解码,对应一个已合并 PR

整套东西的落点是设备端。Magpie-TTS Multilingual 的参数量是 357M(3.57 亿参数),英伟达给出了在本地用 NeMo-Speech.cpp 运行的说明。

手机上怎么跑,这次发布说明里还没有路径。发布帖下有人留言:平时用 AI Desktop XP 跑开源大语言模型,不知道这些语音模型在手机上该怎么装。

社区的高票讨论停在唤醒词上。有评论说,唤醒词仍然是市场空白,对拿这些模型做产品的人卡得很死。没有它,得先打开应用再开口。另一条说,让基于大语言模型的复杂识别进程一直运行,效率不高。大多数语音控制产品不适合这么干。还有人想要一个容易定制、完全开源的 openwakeword 替代方案。

识别、合成、编解码三件套已经齐了。唤醒词还空着,一个不碰手机就能说话的本地助手,正好少这一环。

阅读原文
📚 相关主题 开源

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新