MAI-Transcribe-2-Streaming 在 2026 年 10 月 1 日由 Microsoft AI 通过官方博客发布,与它一起亮相的还有语音合成模型 MAI-Voice-2.1 和更快的 MAI-Voice-2.1-Flash。微软把三款模型打包成一套语音智能体组件:一个负责听,一个负责说,中间留给推理模型的时间被刻意压缩。
边听边写,话没说完就能开始处理
MAI-Transcribe-2-Streaming 是微软第一款流式转写模型。它不等说话人说完整句,而是通过持续音频流在 100 多毫秒内给出第一批临时转写结果,随后随着上下文增加不断修正,一句话结束时立即锁定最终文本。按微软公布的数据,在实时听写和字幕场景中,文字浮现速度约为最接近竞品的 2 倍;在 Artificial Analysis 的评测中,它在最终转写和临时转写两个准确率榜单上都排第一。模型支持 60 种语言,并能自动、连续地检测说话人正在使用的语言,转写价格为每小时音频 0.54 美元的引进定价,持续到 2026 年底。
同一个声音,能用 23 种语言开口
MAI-Voice-2.1 是微软目前最强的多语言语音合成模型,支持 23 种语言、26 个地区变体,定价为每 100 万字符 22 美元。它主打的一点是跨语言保持同一音色:同一个声音说英语、普通话和德语时,听感上仍是同一个人,且带当地口音,而不是把一种口音硬套到所有语言上。Flash 版本支持同样的语言,45 秒音频的端到端延迟约 150 毫秒,推理速度提升 55%,价格降到每 100 万字符 15 美元。两款语音模型都支持用几秒参考音频克隆声音,并内置了同意校验,防止声音被冒用。
为什么微软要自己做耳朵和嘴
语音智能体的体验取决于一个闭环:听清、理解、决策、开口,全部要在人还觉得自然的对话节奏内完成。听和说各慢几百毫秒,整轮对话就会显得迟钝。微软这次把转写和合成的延迟同时压低,等于给中间的推理和工具调用腾出时间预算。对开发者来说,客服智能体可以在来电者说完之前就开始识别诉求,多语言助手可以检测语言后用同一音色回话,教学产品也不必为换语言而换“老师”。需要注意的是,100 多毫秒指的是模型给出临时结果的时间,不等于整条语音链路的响应速度,网络和上层应用仍会影响最终体验。