具身智能
具身智能把 AI 的考场从对话框搬到了物理世界:动作有连续性,环境会变,抓取会失败,错了没法撤回。
Physical AI、VLA、世界模型常被混用,边界其实清楚:Physical AI 指 AI 进真实环境做事,世界模型回答这么动下去会发生什么,VLA 把画面和指令直接变成动作信号。难点不是模型规模,而是物理世界的不确定性——抓取会滑、传感器有噪声、延迟过几十毫秒控制就失稳,安全边界一步都不能让。
具身智能把 AI 的考场从对话框搬到了物理世界:动作有连续性,环境会变,抓取会失败,错了没法撤回。
VLA 是 Vision-Language-Action 的缩写,直译就是“视觉-语言-动作”模型。它和普通多模态模型最大的不同,不只是能看图、懂文字,而是最后还要把理解结果变成可执行动作。也正因为多了这一步,VLA 现在几乎成了机器人和具身智能讨论里绕不开的关键词。 如果说传统视觉语言模型的输出大...
Physical AI 通常指让 AI 不只理解文字、图片和语音,还能进入物理世界去感知、预测、规划和执行动作。它会成为 2026 年机器人圈的高频热词,是因为大家开始更明确地把“会和真实环境互动的 AI”单独拎出来,而不再把它简单算作普通大模型的延伸。 它和一般意义上的生成式 AI 有什么不同 生...
一、产品定位 Figure 是一家专注通用人形机器人的 AI 机器人公司,当前主打产品为面向家庭场景的 Figure 03。它的定位不是玩具或单一功能家电,而是能在真实家庭环境中自主完成洗衣、整理、简单清洁等杂务的“通用劳动力”。整机高度约一米七三,重量六十一千克,负载二十千克,续航约五小时,采用全...