AI Pulse
📡 X 信号

现在不用GPU,CPU也能跑专业级语音克隆

你现在不再需要GPU就能快速获得工作室级别的语音克隆了。Qwen3 TTS (1.7B Q4_K_M) 加上主线llama.cpp,正式成为100%纯CPU执行零样本语音克隆的最快方案。

在我上一篇发布GPU运行Q8模型的内容之后,我们刚刚把本地C++语音合成向前推进了一大步。开源社区已经将阿里巴巴的SOTA Qwen3 TTS模型量化至Q4_K_M GGUF格式,彻底让本地音频管线摆脱了对专用图形硬件的依赖。

以下是CPU运行SOTA语音克隆的真实基准测试与硬件细分数据:

# 架构与模型设置
使用Qwen3-TTS-12Hz-1.7B-Base-Q4_K_M.gguf搭配8位多模态投影器(mmproj-Q8_0.gguf),llama.cpp用纯C++执行整条管线。无需PyTorch,无需CUDA依赖,也没有VRAM瓶颈。

# 真实内存占用
- 基线RAM:系统空闲时占用1.6GB
- 生成峰值RAM:语音合成活跃时占用8GB RAM
- 需求:任何拥有至少8GB系统内存的普通机器都能轻松运行

# 真实CPU基准测试
- Google Colab免费层(受限2核CPU):合成一段5秒工作室质量音频片段(约8个词)耗时45秒
- 现代消费级CPU(Intel i5/i7 13代/14代,或AMD Ryzen 7000/9000):生成耗时可降至5到20秒(几乎达到1:1实时生成速度!)

# 零样本语音克隆质量
通过--tts-speaker-file参数向C++引擎传入任意5到20秒的。wav音频样本即可。它生成的克隆语音干净自然,和未量化的FP16权重相比几乎完全没有质量损失。

为了让测试更顺畅,我搭建了一个更新后的零配置Google Colab笔记本。它会拉取官方预编译的llama.cpp CPU二进制文件(零编译耗时!),直接在你的浏览器中启动一个在线Gradio网页应用。你可以用麦克风录制5秒片段(或上传。mp3、.wav文件),输入文本,就能在CPU上生成克隆音频。

原生C++音频模型正在让基于边缘设备的离线AI语音代理成为现实。免费Q4 CPU版Colab笔记本和Q4_K_M GGUF HuggingFace仓库的链接放在下方回复里了!

你试过在CPU上跑哪些模型?你用什么CPU硬件做本地推理?

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新