VLA 是什么?为什么机器人落地一谈到行动控制就绕不开 Vision-Language-Action VLA 是 Vision-Language-Action 的缩写,直译就是“视觉-语言-动作”模型。它和普通多模态模型最大的不同,不只是能看图、懂文字,而是最后还要把理解结果变成可执行动作。也正因为多了这一步,VLA 现在几乎成了机器人和具身智能讨论里绕不开的关键词。 如果说传统视觉语言模型的输出大... AI百科 • Admin • 2026/4/9 134