AI 语音代理
延迟降到百毫秒级,语音才谈得上像对话。端到端语音到语音跳过了 ASR 到 TTS 的哪几道转换,轮次管理与工具调用又怎么让语音从会说话走到会办事,一并讲清。
延迟降到百毫秒级,语音才谈得上像对话。端到端语音到语音跳过了 ASR 到 TTS 的哪几道转换,轮次管理与工具调用又怎么让语音从会说话走到会办事,一并讲清。
Voice Agent 可以理解成“以语音为主入口的 Agent”。它不只是把你的话转成文字,再把模型回复念出来,而是把实时听、理解、打断、追问、调用工具、执行任务这些能力放进同一个交互闭环里。所以最近大家讨论 Voice Agent,重点已经不再是语音像不像人,而是它能不能真的替你把事办完。 以前...
语音到语音,通常指模型直接从语音输入到语音输出完成理解和生成,而不是先把声音转成文字、再把文字交给语言模型、最后再转回语音。它之所以越来越热,是因为这种路线更接近人类真实对话,也更有机会保留语气、停顿、情绪和说话风格。 它和传统语音链路差在哪 传统路线是 ASR 加 LLM 再加 TTS,优点是模块...
一、摘要 Chroma 1.0 是由 FlashLabs 训练并完全开源的端到端实时语音到语音模型,支持个性化语音克隆。模型无需传统 ASR→LLM→TTS 管线,可在约 150ms 内完成端到端响应,定位为研究级、可落地的实时对话方案,并作为 OpenAI Realtime 模型的开源替代。 二、...
Step-Audio-R1.1 宣布上线,并称在 Artificial Analysis 的 Speech Reasoning 榜单位列第一;在 BigBench Audio 测试中取得约96.4% 准确率,同时在实时对话场景下实现约1.51秒的首帧音频输出。项目方强调,模型在深度推理与交互时延之间...
一、摘要 Fun-Audio-Chat-8B 是 FunAudioLLM 团队开源的“大型音频语言模型”,面向更自然、低延迟的语音交互。它采用“双分辨率语音表征”(5Hz 共享骨干 + 25Hz 精细化头部)以降低计算开销,同时通过 Core-Cocktail 训练策略尽量保留文本 LLM 能力;覆...
近日,多名用户在社交平台分享称,OpenAI在iOS应用的语音模式中测试了新的界面,界面中首次出现了“提示语(prompt suggestions)”,以便用户在对话前快速选择或启发提问。从现有反馈来看,该功能并未向所有用户开放,表现出典型的A/B测试或分批逐步推送的特征。 目前,OpenAI官方文...
Flowith 宣布 iOS 2.0,主打“主动式语音代理(proactive voice agent)”,强调先监听语境再执行操作的交互路径,旨在减少用户点按与切换成本。官方物料称其采用 iOS 26 的 Liquid Glass 视觉语言,并将订阅统一为“单订阅解锁对话、图像与视频等多模型”,定...