ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
Suno 推出 Speech beta:朗读语音配上原创配乐,一条音轨一次生成

Suno 推出 Speech beta:朗读语音配上原创配乐,一条音轨一次生成

AI资讯 • Admin • • 5 次浏览

2026 年 10 月 1 日,AI 音乐公司 Suno 的首席产品官 Jack Brody 在官方博客宣布,新的语音音频模型 Speech(beta)结束为期一个月的小范围测试,正式向所有用户开放。Suno 把它称为"首个将语音与音乐作为一条连贯音轨共同生成的音频模型"(the first audio model that generates voice and music together as one cohesive track)。

一次生成:声音和配乐不再分两步走

Speech 的用法很直接:在 Suno 里输入一段文字——可以是一个想法、一首诗,或者任何已经写好的内容——再描述想要的声音和音乐风格,模型就会输出朗读语音配上原创背景音乐,融合成一条统一的音频音轨。

在此之前,做一条"带配乐的朗读"通常要分三步:先用语音合成做出干声,再找一段合适的配乐,最后混音对齐。Speech 把这三步压成一次生成,干声和配乐在生成时就是一起长出来的,理论上衔接会更自然,也省掉了找版权音乐和调混音的麻烦。

从"唱歌"到"说话":Suno 在铺另一张画布

理解 Speech,要放在 Suno 今年的产品路线里看。这家公司以 AI 音乐生成起家,今年 3 月随 v5.5 模型推出了 Voices 声音克隆功能;Speech 则把版图从"唱歌"扩展到了"说话"。Brody 在博客中写道,音乐仍是 Suno 的核心,但公司的视野已经延伸到人类表达的其他形式,他把 Speech 称为社区创作的"另一张画布"(another canvas)。

官方举的例子很生活化:把朋友的短信做成"过度制作的戏剧化朗读",给普通语音留言配上"不必要的史诗级配乐",以及更实用的冥想引导、诗歌朗读、打气话和给孩子的睡前故事。Suno 把这一类需求概括为"创意娱乐"(creative entertainment),并认为它会定义下一波消费科技。

谁会先用上

最先受益的可能是两类人:一是播客和有声内容创作者,以前开场白、转场和片尾需要分别找配音和配乐,现在可以在一个模型里一次成型;二是短视频和社交媒体创作者,"戏剧化朗读"这类玩梗式内容几乎是为传播而生的。当然,前提是生成质量稳定——Suno 自己也在博客里打了预防针。

官方这次没细说的三件事

有三件事,官方博客这次没有交代。第一,价格与订阅:正文没有说明 Speech 是否所有套餐可用,免费用户能用多少。第二,平台:正文没有区分网页端和移动端的使用差异。第三,也是对语音模型最关键的一点:正文没有说明声音授权与内容审核政策——模型生成的声音从哪来、能模仿谁的声音、有哪些使用限制,博客里都没有提,只有一句 beta 免责声明调侃"英式口音偶尔会跑去澳大利亚再回来"。

这些空白不一定代表问题,beta 阶段功能先行、政策后补是常见节奏。但对打算把 Speech 用在正式内容里的创作者来说,动手之前先去看一眼最新的版本说明和社区准则,比直接开干更稳妥。

推荐工具

更多