ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
Google 发布 Gemini 3.8 Flash TTS:用一句话描述就能定制声音

Google 发布 Gemini 3.8 Flash TTS:用一句话描述就能定制声音

AI资讯 Admin 3 次浏览

2026 年 9 月 23 日,Google DeepMind 在官方博客发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS,称这是迄今表现力最强的音频生成模型。新模型支持用自然语言提示词从零设计声音、用 30 秒样本复刻声音,还能逐行指导表演、生成长音频、编排双说话人对话,覆盖 100 多种语言。

先说它和上一代语音模型的区别。过去的 TTS 是"选声音":从预置音色库里挑一个,再调调语速语调。新模型是"造声音"加"导表演":你可以写一句"温暖、略带沙哑的深夜电台嗓",模型直接生成;给 30 秒录音就能复刻一个人的声音;长文朗读时可以逐行指定情绪,双人对话场景里两个说话人的轮转也由模型编排。Flash-Lite 则是更轻量的版本,主打低延迟和低成本,适合对实时性要求高的场景。

落在哪儿,谁会先用上

两个模型同时接入 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids。最先吃到红利的会是三类人:播客和有声书制作者,长音频生成加逐行表演指导直接对准他们的生产流程;视频创作者,Google Vids 里的配音可以直接换成定制声音;企业培训和客服部门,双说话人编排适合做对话式教学内容。巧的是同一天,阿里 Qwen 也发布了 Qwen-Audio-3.1 语音模型全家桶(站内报道 (/article/2056-a-li-qwen-fa-bu-qwen-audio-3-1-yi-kou-qi-wu-kuan-yu-yin-mo-xing-asr-jiang-jia-9)),语音赛道这周明显在加速。

能力越强,边界越要先讲清

30 秒复刻声音的能力,首先想到的应该是风险:未经本人同意的声音复刻,在多数司法辖区都涉及声音权和肖像权问题,商用前必须先确认授权链条。另外"表现力最强"是官方说法,真实效果还要看多语言场景下的实测,尤其是中文长文本的韵律和停顿是否自然——这类细节往往要到开发者真正上手后才见分晓。

推荐工具

更多