AI Pulse
📡 X 信号

AI语音比 ElevenLabs 便宜六倍,还会笑会叹气

你还没做好准备迎接这个 🚨 AI 语音现在可以按照指令笑、低语和叹息了。

Fish Audio 刚刚发布了 S2.1 Pro,这是我听过表现力最强的语音 AI。

它的情感范围比 ElevenLabs 和 Cartesia 更广,价格比 ElevenLabs 便宜6倍 💸

完整分析如下 👇

多年来,语音 AI 只有一个目标:听起来像人。这场比赛已经结束了。现在所有产品都能做到听起来逼真了。新的评判标准是表现力。情绪、细微差别、节奏控制。

一支语音能不能「演绎」一句台词,而不只是念出来?这就是 S2.1 Pro 的设计目标。

我用同一份带情绪要求的脚本在 Fish Audio、ElevenLabs 和 Cartesia 上生成了音频。文字完全一样,演绎效果天差地别。停顿、语调,还有 Fish Audio 生成的语音在句间呼吸的感觉,另外两个完全比不了。看下方视频就能感受到。

最令人惊喜的是它的控制方式。你可以用纯文本像导演指挥配音演员一样给它指令:
[紧张的笑] → 就能生成富有表现力的笑声。
[哭] → 它就会哭
[长叹] → 它就会呼出一声长叹

除此之外,你还可以在字词级别控制发音、重音和语速。
生成语音的时代已经过去了。直接导演演绎的时代来了。

而且它不只能用来做配音。S2.1 Pro 首包音频延迟约90ms。这个速度足够支持实时对话,即便被打断、切换话题,节奏也不会乱。这会让语音智能体终于开始有真人的感觉。

实用信息:
• 只需要15秒音频就能克隆一支语音
• 单个模型支持80+种语言
• 源于开源,模型权重开放,可自托管
• 价格仅为 ElevenLabs 的1/6

HeyGen 已经集成了 Fish Audio。更多集成会陆续到来。你可以体验:(有免费额度)

在评论区回复一句你想听听看 AI 语音真实演绎的内容,我会选最好的几个用 S2.1 Pro 生成出来,发布结果 👇

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部