阿里通义推出企业级音频基础模型 Tongyi Fun,由 Fun-ASR 与 Fun-CosyVoice 组成,目标在真实企业环境中实现“听懂—转写—会说”的全链路能力。官方信息显示,Fun-ASR 以数千万小时真实语音训练,覆盖金融、科技、制造等行业术语与嘈杂场景;Fun-CosyVoice 提供多语多音色合成与跨语种声音克隆,强调稳定韵律与自然表达。
在工程实现上,Tongyi Fun 采用上下文增强与 RAG 检索,将企业知识与术语库引入识别与翻译流程,减少跨语言干扰与幻觉。面向落地需求,产品形态支持会议纪要、客服质检、语音机器人与多媒体内容生产,并提供可扩展的 API 与定制训练路径,便于与现有系统集成。
常见问题
Q:Tongyi Fun 由哪些核心组件构成?
A:由 Fun-ASR(语音识别)与 Fun-CosyVoice(语音合成)组成,分别负责理解与生成。
Q:为何引入 RAG?
A:通过检索企业知识库与术语表增强上下文,使转写与翻译更准确,降低幻觉与误判。
Q:语言与音色覆盖如何?
A:支持多语多方言与多种拟人音色,并提供跨语种声音克隆以保持说话人一致性。
Q:适用的企业场景有哪些?
A:会议转写与摘要、客服质检与语音机器人、培训与内容制作、合规审核等。
Q:是否提供开源或接入路径?
A:CosyVoice 等组件有开源实现;企业级接入与控制台在阿里云通义相关产品页提供。