ToolNavs AI工具导航
提交工具 登录
返回AI资讯
FunAudioLLM 开源 Fun-Audio-Chat-8B:双分辨率语音表征与语音函数调用

FunAudioLLM 开源 Fun-Audio-Chat-8B:双分辨率语音表征与语音函数调用

AI资讯 Admin 226 次浏览

一、摘要

Fun-Audio-Chat-8B 是 FunAudioLLM 团队开源的“大型音频语言模型”,面向更自然、低延迟的语音交互。它采用“双分辨率语音表征”(5Hz 共享骨干 + 25Hz 精细化头部)以降低计算开销,同时通过 Core-Cocktail 训练策略尽量保留文本 LLM 能力;覆盖语音问答、音频理解、语音函数调用、语音指令遵循与“语音情感共鸣”等任务。模型支持中英双语,许可证为 Apache-2.0。

二、核心特性

1、双分辨率语音表征:用更低帧率的共享骨干降低成本,并用高帧率头部保持语音质量。

2、能力覆盖全面:语音问答、音频理解、语音函数调用、语音指令遵循、语音情感共鸣。

3、推理形态清晰:提供语音转文字(S2T)与语音转语音(S2S)示例脚本,便于快速验证链路。

4、配套组件:推荐同时下载 Fun-CosyVoice3-0.5B-2512 用于语音合成侧能力。

三、安装

1、克隆代码并安装依赖:

  • git clone --recurse-submodules https://github.com/FunAudioLLM/Fun-Audio-Chat && cd Fun-Audio-Chat
  • 安装 ffmpeg,创建 python=3.12 环境。
  • 2、安装框架版本:按仓库示例安装 torch==2.8.0torchaudio==2.8.0requirements.txt
  • 3、准备显存:官方给出的参考是推理约 24GB 显存;训练资源需求更高。

四、典型用例

1、语音助手/客服:用户语音输入,模型输出文字或直接输出语音回复(S2S)。

2、音频理解与语音问答:对录音内容做问答、摘要、要点抽取(以任务提示词驱动)。

3、语音函数调用:把“说出来的指令”映射到工具定义,适合语音控制工作流与业务动作。

4、语音风格与情绪表达:在“语音对话”场景中强化情绪与语气一致性(需结合合成侧配置与数据验证)。

5、产品 Demo:仓库提供 Web Demo(含服务端与前端)用于交互验证与展示。

五、生态与竞品

1、生态:项目基于 Transformers 生态,并在仓库中致谢/引用了 LlamaFactory、Moshi、CosyVoice 等开源组件或相关工作。

2、竞品方向:同类“语音到语音/语音对话”方案常见差异在于端到端程度、延迟、可控性(函数调用/工具格式)、以及对多语言与情绪风格的支持;建议用你的目标场景数据(噪声、口音、长音频、业务术语)做对齐评测后再选型。

六、局限与注意事项

1、算力与工程成本:推理显存门槛不低,端到端语音链路还涉及编解码与实时 I/O。

2、语音内容合规与隐私:真实业务需明确录音授权、存储策略与脱敏流程。

3、函数调用安全:工具定义与权限必须严格收敛,避免“语音指令”触发越权动作。

4、效果波动:不同麦克风、噪声、口音会显著影响稳定性,建议加入前处理与人工兜底。

七、项目地址

https://huggingface.co/FunAudioLLM/Fun-Audio-Chat-8B

八、常见问题

Q: Fun-Audio-Chat-8B 推理需要多大显存?

A: 官方给出的参考是推理约 24GB 显存;实际取决于精度、batch、音频长度与并发。

Q: Fun-Audio-Chat-8B 如何实现语音转文字与语音转语音?

A: 仓库提供 infer_s2t.py(S2T)与 infer_s2s.py(S2S)示例脚本,按说明准备权重与环境即可运行。

Q: Fun-Audio-Chat-8B 为什么还要下载 Fun-CosyVoice3-0.5B-2512?

A: 示例流程会用到语音合成侧模型,用于把文本/中间表示转成最终语音输出。

Q: Fun-Audio-Chat-8B 是否支持中文与英文以外的语言?

A: 公开说明中标注支持英语、中文;如需扩展到更多语言,通常需要额外数据与训练/微调验证。

Q: Fun-Audio-Chat-8B 能否用于生产级语音助手?

A: 可以作为基座进行验证与二次开发,但建议补齐监控、延迟优化、内容安全、权限控制与业务数据评测。

推荐工具

更多