AI 配音
用文字或几秒参考音频就能生成自然语音,AI 配音让有声内容、课程和角色配音不再依赖录音棚与专业声优。
AI 配音建立在 TTS 与音色克隆之上,Qwen3-TTS、GLM-TTS、MOSS-TTS-Nano 等开源模型已能三秒复刻嗓音并控制情绪。做有声内容先看清它支不支持多语言、能否本地 CPU 跑、克隆要不要授权。
用文字或几秒参考音频就能生成自然语音,AI 配音让有声内容、课程和角色配音不再依赖录音棚与专业声优。
一、摘要 MOSS-TTS-Nano 是 OpenMOSS 与 MOSI.AI 发布的开源多语言语音生成模型,定位是“小体积、低延迟、可部署”。它约 0.1B 参数,支持实时语音生成与语音克隆,强调 CPU 友好和本地集成,适合做轻量 Demo、浏览器服务和嵌入式产品原型。 二、核心特性 1、多语言...
一、摘要 Qwen3-TTS 是 Qwen 团队开源的文本转语音(TTS)模型系列,包含 VoiceDesign(文字描述生成新音色)、CustomVoice(指令控制既定高质量音色)与 Base(快速音色克隆与微调基座)。项目同时开源代码与权重,并提供 12Hz 语音 tokenizer 以实现更...
一、摘要 GLM-TTS 是面向工业级语音生成的开源 TTS 系统,支持仅 3 秒语音样本的音色克隆,并提供可控的情绪表达能力。其架构采用两阶段生成流程,并引入基于 GRPO 的强化学习机制,在字符错误率(CER)与情感维度达到开源领先水平。项目强调低训练成本与高可扩展性,适用于教育、电子书、有声内...