返回AI资讯
Gemini Robotics ER 2 发布:机器人开始边做边纠错

Gemini Robotics ER 2 发布:机器人开始边做边纠错

AI资讯 Admin 9 次浏览

2026 年 7 月 30 日,Google DeepMind 发布 Gemini Robotics ER 2,并把它定位为机器人的高层“大脑”:模型负责理解连续视频、规划多步骤任务和调用工具,具体动作仍交给底层视觉—语言—动作模型或机器人控制接口。它的重要性在于,机器人系统开始把看、想、做和复查放进同一条实时链路。

这次提升集中在三个环节

  1. 执行时继续判断。 ER 2 可持续观看视频流,在动作进行中判断进度,而不是每完成一步就停下来重新分析。Google 将它接入面向低延迟双向流的 Gemini Live API,希望减少机器人“停下思考”的割裂感。
  2. 发现错误后调整。 模型会识别洒落、打滑、位置偏差等执行异常,并决定重试、纠正或进入下一步。官方给出的进度分类准确率为 57.4%,说明能力有明显进展,但距离可以完全放手仍有空间。
  3. 让不同机器人接力。 多机器人协作允许轮式平台、机械臂或人形机器人共享任务语义,再根据各自擅长的动作完成交接。相比要求一台机器人包办所有事情,这种编排思路更接近仓储、实验室和工厂的现实设备组合。

“什么时候做完”成为关键指标

机器人难点往往不是理解一句指令,而是知道动作是否真正完成。ER 2 的 moment-finding 评测用于定位关键事件发生的准确时刻,例如液体何时已经倒到合适位置。Google 公布的结果为 91.3% 准确率、平均绝对时间误差 0.96 秒,并称执行速度达到对比方案的四倍。

这些数字不能直接等同于真实工厂的成功率。光线变化、遮挡、机械磨损和控制延迟都会影响结果,而且高层模型仍依赖底层动作模型与硬件接口。部署团队需要为每个动作定义可验证的完成条件、失败回退和人工接管机制。

安全能力应怎样理解

Google 表示,ER 2 在人员接近时可让人形机器人停止,并在区域恢复安全后继续工作,同时推出用于评估安全约束、环境监测和物理可行性的基准。这个方向比单纯提升任务得分更重要,但基准表现不能替代现场安全认证、隔离设施和紧急停止装置。

目前开发者可通过 Gemini API 和 Google AI Studio 使用 ER 2,Gemini Enterprise Agent Platform 处于私有预览。对机器人团队而言,最现实的第一步不是让模型直接接管生产线,而是从低风险、结果可核验、随时能人工终止的流程开始测试。

推荐工具

更多