Inworld推出实时文本转语音模型Realtime TTS-2
Realtime TTS-2 今日正式可用,它现在是 Artificial Analysis 上排名第一的模型,也是同级别中全球最快的 TTS。
此前的研究预览版用量远超预期,我们把从中获得的经验反馈回研究中,今日正式发布的这个模型代表了 Inworld 历史上最大的飞跃。
Realtime TTS-2 Flash 也在今日发布,它是全球最快的文本转语音模型,首字节响应时间仅 25ms。价格仅为此前一半,还登顶了排行榜,领先于成本和延迟都高出 20 倍的模型。它专为每毫秒都至关重要的应用打造。
目前已有数亿人每天通过基于该模型构建的应用与 Realtime TTS-2 交互。它为语言学习、辅导、陪伴、角色扮演、健康、健身、新闻、游戏和客户体验领域中排名前 1% 的消费级应用提供动力。
Realtime TTS-2 功能:→ 自然语言语音指令 → 首字节响应时间约 100ms → 跨语言支持:在 200 多种语言中保持同一音色身份 → 自助式专业语音克隆 → 自然语言语音设计 → 多轮上下文 → 订阅价每百万字符 12.50 美元(每分钟 1.5 美分)
Realtime TTS-2 支持通过自然语言语音指令,指示每一行文本该如何朗读。你可以决定发音方式。
[咬着牙说,几乎忍无可忍] “我为你高兴,真的。”
[温暖地说,字字真心] “我为你高兴,真的。”
有了 Realtime TTS-2,你会感觉自己就像一位导演在和一名天赋异禀的配音演员合作——它带来了全新级别的可控性和响应速度。
@livekit 是我们开发 TTS-2 的亲密合作伙伴,其 CTO David Zhao 称它“是情感化语音合成领域真正的一步飞跃”。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖