返回AI资讯
阿里发布 Tongyi Fun:企业级音频基础模型,结合 Fun-ASR 与 Fun-CosyVoice

阿里发布 Tongyi Fun:企业级音频基础模型,结合 Fun-ASR 与 Fun-CosyVoice

AI资讯 Admin 92 次浏览

阿里通义推出企业级音频基础模型 Tongyi Fun,由 Fun-ASR 与 Fun-CosyVoice 组成,目标在真实企业环境中实现“听懂—转写—会说”的全链路能力。官方信息显示,Fun-ASR 以数千万小时真实语音训练,覆盖金融、科技、制造等行业术语与嘈杂场景;Fun-CosyVoice 提供多语多音色合成与跨语种声音克隆,强调稳定韵律与自然表达。

在工程实现上,Tongyi Fun 采用上下文增强与 RAG 检索,将企业知识与术语库引入识别与翻译流程,减少跨语言干扰与幻觉。面向落地需求,产品形态支持会议纪要、客服质检、语音机器人与多媒体内容生产,并提供可扩展的 API 与定制训练路径,便于与现有系统集成。

常见问题

Q:Tongyi Fun 由哪些核心组件构成?

A:由 Fun-ASR(语音识别)与 Fun-CosyVoice(语音合成)组成,分别负责理解与生成。

Q:为何引入 RAG?

A:通过检索企业知识库与术语表增强上下文,使转写与翻译更准确,降低幻觉与误判。

Q:语言与音色覆盖如何?

A:支持多语多方言与多种拟人音色,并提供跨语种声音克隆以保持说话人一致性。

Q:适用的企业场景有哪些?

A:会议转写与摘要、客服质检与语音机器人、培训与内容制作、合规审核等。

Q:是否提供开源或接入路径?

A:CosyVoice 等组件有开源实现;企业级接入与控制台在阿里云通义相关产品页提供。

推荐工具

更多