Google在官方博客宣布,对Gemini 2.5 Flash和Gemini 2.5 Pro文本转语音(TTS)预览模型进行重要升级。此次更新重点提升情感与语气的多样性、对风格指令的遵从度,以及在多角色对话场景中的一致性表现,旨在让开发者能更精细地控制合成语音的风格和听感。
在节奏控制方面,新版本可根据文本内容进行上下文感知的语速调节,例如在讲解复杂内容时自动放慢,在紧张或高能段落中加快节奏,并更好地执行明确的节奏与停顿指令。多说话人能力也得到强化,可在播客、虚拟访谈、剧情旁白等场景下保持不同角色的音色、语气和情绪持续稳定,且在模型已支持的24种语言中保持一致表现。
目前,Gemini 2.5 Flash TTS(偏重低延迟)与2.5 Pro TTS(偏重音质与表达力)通过Gemini API在Google AI Studio向开发者开放,并替代了今年5月发布的早期TTS版本。业内预计,这类可高度控制的TTS技术将进一步推动有声书、在线教育、本地化营销与创作者内容生产的自动化,但也对版权合规和语音合成滥用防范提出更高要求。
常见问题
Q:Gemini 2.5 Flash和Pro TTS这次主要更新了哪些能力?
A:本次更新重点强化情感与语气多样性、上下文感知的语速节奏控制,以及多说话人和多角色对话时的声音一致性与稳定性。
Q:Gemini 2.5 Flash TTS和2.5 Pro TTS分别适合哪些使用场景?
A:Flash TTS面向低延迟交互场景,如助手对话和互动应用;Pro TTS更适合追求高音质和强表现力的有声书、剧情旁白、营销视频等内容生产。
Q:Gemini 2.5 TTS目前支持哪些语言和地区使用?
A:Gemini 2.5 Flash和Pro TTS作为预览模型,已在Gemini API中面向开发者开放,覆盖24种支持语言,具体语种和地区可在相关文档中查看。
Q:开发者如何在产品中接入这次更新后的TTS能力?
A:开发者可以通过Gemini API在Google AI Studio中选择具有TTS能力的2.5 Flash或2.5 Pro模型,在Playground或示例代码中配置语音风格、节奏、多说话人参数后集成到自身应用。
Q:此前的Gemini TTS模型是否还能继续使用?
A:Google已明确表示,新版Gemini 2.5 Flash和Pro TTS将替代今年5月发布的旧TTS模型,后续能力迭代将以新模型为主,建议开发者尽快迁移配置与调用逻辑。