ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
阿里 Qwen 发布 Qwen-Audio-3.1:一口气五款语音模型,ASR 降价 95%

阿里 Qwen 发布 Qwen-Audio-3.1:一口气五款语音模型,ASR 降价 95%

AI资讯 Admin 3 次浏览

2026 年 9 月 23 日,阿里 Qwen 团队正式发布 Qwen-Audio-3.1 语音大模型全家桶:五个新模型一次到位,覆盖语音识别(ASR)、语音合成(TTS)、实时语音交互(Realtime),外加两个全新的"Next"系列——Qwen-Audio-3.1-ASR-Next 与 Qwen-Audio-3.1-TTS-Next。随模型一起落地的是一轮罕见的语音 API 大降价:TTS 降约 70%,Realtime 降约 85%,ASR 最高降 95%。API 已在 Qwen AI 平台上线,ASR-Next 将稍后推出。

五款模型各自负责什么

  • Qwen-Audio-3.1-ASR:语音识别基础款,强调多语种与方言识别、上下文理解,附带原生转写润色。
  • Qwen-Audio-3.1-TTS:语音合成基础款,负责把文本转成自然语音。
  • Qwen-Audio-3.1-Realtime:实时语音交互款,面向语音助手、电话客服这类需要低延迟对话的场景。
  • Qwen-Audio-3.1-ASR-Next:音频理解方向的新模型,定位比 ASR 更进一步的"听懂",而不仅是"听写"。
  • Qwen-Audio-3.1-TTS-Next:最值得多看一眼的一款。官方定位是"音频创作模型":给一段文本脚本,它能把对话和环境音一次合成出来,拼成完整的电影级音景,直接面向有声书、影视配音、播客、游戏这些专业创作场景。

降价幅度怎么算

这次降价不是象征性的九折。TTS 降约 70%,意味着原来做一小时有声书配音的成本,现在只剩不到三成;Realtime 降约 85%,直接把实时语音对话这种烧 token 的场景拉进可负担区间;ASR 降 95%,近乎把语音转写的边际成本打到地板价。对于会议纪要、电话质检、海量音频归档这类"量大管饱"的任务,账一下子好算多了。

为什么这轮降价值得在意

因为降价的从来不是语音一家。9 月 22 日,OpenAI 刚把 GPT-6 Sol 与 Luna 的 API 价格砍了一半(OpenAI 推出 GPT-6 Sol 和 Luna:API 价格直降一半 (/article/2042-openai-launches-gpt-6-sol-and-luna-api-prices-cut-in-half-for-everyday-work));同一天,Anthropic 发布的 Claude Opus 5.5 也比前代便宜约四成。现在 Qwen 把同样的打法搬到语音赛道,等于宣告:大模型的降价潮已经从文本推理蔓延到语音全栈。谁的成本先下来,谁就先拿到语音智能体、实时翻译、AI 客服这些场景的入场券。

两点提醒

第一,TTS-Next 的"一次合成完整音景"是创作工具的形态升级,不是简单的音质提升。它真正缩短的是有声书、短剧、播客的制作链条——以前要分别录对白、配环境音、做混音的活,现在可能一次生成。但这也意味着对提示词的要求变高:你得会描述声音。

第二,ASR-Next 还没上线,降价针对的是 API 调用而非开源权重。想本地部署、自己搭推理的开发者,这次暂时吃不到红利,还得等后续版本。

总的来说,Qwen-Audio-3.1 的发布逻辑很清楚:用一次到位的模型矩阵把"听、说、实时聊、创作"四个环节全占住,再用降价把门槛砸穿。语音 API 正在变成和文本 API 一样便宜的基础设施,这对做语音产品的团队来说,是重新算一遍成本账的时候了。

推荐工具

更多