2.74美分一段多角色对白,Gemini新TTS模型还支持30秒声音定制
Google今天发布两个新的Gemini文本转语音模型。一个叫gemini-3.8-flash-tts。另一个叫gemini-3.8-flash-lite-tts。两个都带一个超过2000个声音的库。
预设声音之外,用30秒音频样本就能创建自定义声音,前提是拥有这段声音的使用权。
API有个特点:一次请求就能定义多个角色之间的完整对话。每个角色可以有单独的声音和语音风格指令。作者放了一段两只鹈鹕讨论要不要搬到太平洋码头的对话,脚本由Claude 4.5 Opus编写。
成本也不高。生成1分18秒音频,耗时约20秒,花费2.74美分。这个价格按Gemini 3.8 Flash TTS算,不是更便宜的Flash-Lite。个人创作者不到3美分就能生成一段多角色对白。
作者用GPT-6 Astra以vibe coding的方式搭了个界面。界面需要自己填API密钥。因为Gemini API开放CORS,网页端可以直接调,不用走服务器中转。
演示链路的分工很清楚。Claude 4.5写脚本,GPT-6 Astra搭界面,Gemini负责声音。对个人创作者,最现实的一道门槛是有没有可合法使用的录音样本。