返回文章列表

多模态

找到 3 篇相关文章

VLA 是什么?为什么机器人落地一谈到行动控制就绕不开 Vision-Language-Action

VLA 是什么?为什么机器人落地一谈到行动控制就绕不开 Vision-Language-Action

VLA 是 Vision-Language-Action 的缩写,直译就是“视觉-语言-动作”模型。它和普通多模态模型最大的不同,不只是能看图、懂文字,而是最后还要把理解结果变成可执行动作。也正因为多了这一步,VLA 现在几乎成了机器人和具身智能讨论里绕不开的关键词。 如果说传统视觉语言模型的输出大...

AI百科 Admin
134
Voice Agent 是什么?为什么 AI 语音助手开始从“会说话”走向“会办事”

Voice Agent 是什么?为什么 AI 语音助手开始从“会说话”走向“会办事”

Voice Agent 可以理解成“以语音为主入口的 Agent”。它不只是把你的话转成文字,再把模型回复念出来,而是把实时听、理解、打断、追问、调用工具、执行任务这些能力放进同一个交互闭环里。所以最近大家讨论 Voice Agent,重点已经不再是语音像不像人,而是它能不能真的替你把事办完。 以前...

AI百科 Admin
76
多模态代理(Multimodal Agent)是什么?为什么“能看、能听、能做”的 Agent 越来越受关注

多模态代理(Multimodal Agent)是什么?为什么“能看、能听、能做”的 Agent 越来越受关注

多模态代理指的不是只能处理文字的 Agent,而是能同时接收和利用图像、语音、界面状态、文档甚至视频等多种输入,再结合工具调用和任务规划去执行动作。它最近越来越受关注,是因为很多真实任务根本不只发生在文本里,Agent 要真能干活,就得先“看得见、听得懂、再动得了”。 它为什么比普通聊天代理更难 -...

AI百科 Admin
80

推荐工具

更多