AI Pulse

29.6M参数语音合成模型,树莓派5上实测比实时还快

SupraLabs 在 Hugging Face 上发布了 SupraTTS-0.1-Beta。约 29.6M 参数,基于 Glow-TTS 架构。作者说音质比原版 Glow-TTS 略好,体积没变。它的定位是小型边缘设备和 CPU。

有人已经在树莓派 5 上跑了一轮:实时因子 0.3 倍,比实时还快。生成延迟不到 1 秒;4 线程下 CPU 负载平均 50%;内存占用 70MB。一个人的测试说明不了所有硬件,但低功耗设备本地跑语音合成,总算有一个具体的数字。

社区反应不慢。有人邀请作者把模型集成到 audio.cpp。这个项目正在扩充自己的“边缘集合”,目前还只是邀请。也有人问普通笔记本 CPU 上的实时因子,想跟树莓派 5 对比。

作者的后续计划包括更好的音质、多语言支持、多声音。还有情感、说话风格和零样本声音克隆。这些都还没做出来。目前这个版本支持哪些语言、用什么许可证发布,也还没说。

眼下最直观的参照,就是树莓派 5 上那组数字。普通笔记本的数据,还在等有人去测。

阅读原文
📚 相关主题 语音合成开源

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新