Google 推出 Gemini 2.5 Flash Live 原生音频预览版,语音对话更自然
Google 在开发者更新中发布 Gemini 2.5 Flash 原生音频 Live 预览版,并称其为最新的 Gemini Live 模型迭代,重点提升函数调用(Function Calling)可靠性与对话自然度。该模型以原生音频方式处理输入与输出,减少传统 ASR/TTS 级联带来的延迟与失真...
Google 在开发者更新中发布 Gemini 2.5 Flash 原生音频 Live 预览版,并称其为最新的 Gemini Live 模型迭代,重点提升函数调用(Function Calling)可靠性与对话自然度。该模型以原生音频方式处理输入与输出,减少传统 ASR/TTS 级联带来的延迟与失真...
Qwen 宣布在 Qwen Chat 中推出 Travel Planner,可基于 Amap(高德地图)与 Fliggy(飞猪)接口及搜索能力,自动生成逐日行程,包含酒店与交通建议、景点顺路安排与时间规划。官方展示的用法强调“按兴趣、节奏与预算”自适应,支持从城市灵感到落地执行的全流程辅助。相关介绍...
微软正在 Edge 内测 Copilot 的「Browser Actions」入口,配合已公布的 Copilot Mode,为即将推出的代理式浏览功能做准备。测试界面显示,该开关位于 Copilot 的隐私设置,说明 Copilot 可使用当前 Edge 个人资料信息在网页中完成任务,属于可选、需用...
Qwen 团队发布 Qwen-Image-Edit-2509,为 Qwen-Image-Edit 的月度重构版,聚焦多图编辑与单图一致性。多图模式可拖入“人+产品”“人+场景”等最多 1–3 张参考图,模型在合成时保持主体与材质连贯,减少错位与“拼接感”。在单图编辑中,人脸跨姿势与风格保持身份一致,...
阿里通义团队宣布推出新一代文本转语音模型 Qwen3-TTS (含 Qwen3-TTS-Flash 变体),主打多音色(multi-timbre)、多语种与多方言合成,强调更自然、富有表现力的语音输出。官方演示与博客显示,模型在英文与中文场景表现突出,并新增统一架构以在同一模型内覆盖多语与多方言。当...
OpenAI 发布「Why we built the Responses API」阐述设计取向:Responses 以“推理-行动-反馈”的状态化循环取代单回合对话,允许模型在多轮中保留内部推理状态,并一次返回多种“项目”(消息、函数调用、结构化输出等),适配文本、图像、音频与函数调用等多模态交互。...