@Sumanth_077开源VoxCPM文本转语音系统
无需分词即可实时克隆人声!VoxCPM 是一个开源文本转语音系统,它在连续空间而非离散 token 中对语音建模。
大多数 TTS 系统会在生成前先把语音转换为离散 token。这种量化带来了一个本质权衡:token 能提供稳定性,但会丢失呼吸、 vocal 纹理、细微发音这类声学细节。
VoxCPM 完全跳过了分词步骤。它基于 MiniCPM-4 构建的端到端扩散自回归架构,直接在连续空间中对语音建模。
该系统采用分层语言建模,包含两个专用组件:一个捕获高层韵律和结构的文本-语义语言模型,以及一个恢复细粒度声学细节的残差声学模型。这种分离消除了对外部语音分词器的依赖,也避免了多阶段流程的误差累积。
两大核心能力:
1. 上下文感知语音生成:模型可以理解文本,推断出合适的韵律和说话风格。解释内容会自然放缓,重音出现在正确位置,问句听着就是问句。
2. 零样本声音克隆:仅需 3-10 秒参考音频,就能复刻说话者的音色、口音、情绪语调、节奏和语速。
关键特性:
• 无分词器架构,采用连续语音建模
• 无需手动调参的上下文感知韵律生成
• 支持通过短参考音频实现零样本声音克隆
• 支持流式合成,适配实时应用
• 支持 SFT 和 LoRA 微调
它是100%开源的。GitHub 链接在评论区!
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖