戻るAI情報
ジェミニ・ロボティクスER 2リリース:ロボットは作業中にエラーを修正し始めました

ジェミニ・ロボティクスER 2リリース:ロボットは作業中にエラーを修正し始めました

AI情報 Admin 9 回閲覧

2026年7月30日、Google DeepMindはGemini Robotics ER 2をリリースし、ロボットの高レベルな「脳」として位置づけました。モデルは連続映像の理解、多段階タスクの計画、ツールの呼び出しを担当し、特定の動作は基盤となる視覚言語アクションモデルやロボット制御インターフェースによって処理されます。 その重要性は、ロボットシステムが視聴、思考、実行、再確認を同じリアルタイムの連鎖に統合し始めたことにあります。

この改善は3つの分野に焦点を当てています

  1. 処刑中も判断を続けてください。 ER 2 は動画ストリームを継続的に視聴し、行動中に進捗を判断し、すべてのステップを一歩一つ分析することはありません。 GoogleはこれをGemini Live APIに統合し、低遅延の双方向フローをサポートし、ボットが「一時停止して考える」ような断片的な感覚を減らすことを目指しています。
  2. 誤りが見つかり、調整が行われます。 モデルはス ピル、滑り、位置偏差などの異常を特定し、再試行、修正、または次のステップに進むことを決定します。 公式の進捗分類精度は57.4%で、能力の明確な進歩を示していますが、まだ完全に手放す余地はあります。
  3. 異なるロボットが交代で中継を担当させましょう。 マルチロボット 協働により、車輪付きプラットフォーム、ロボットアーム、またはヒューマノイドロボットがタスクの意味を共有し、それぞれの強みに基づいて引き継ぎを完了できます。 単一のロボットですべてを処理するのではなく、この配置方式は倉庫、実験室、工場機器の実際の組み合わせにより近いものです。

「いつ終わるか」が重要な指標となっています

ロボットにとっての難しさは、命令を理解することではなく、その動作が実際に完了しているかどうかを知ることにあります。 ER 2のモーメントファインディング評価は、液体が適切な場所に注がれた場合など、重要な事象の正確なモーメントを特定するために用いられます。 Googleは91.3%の精度、平均絶対時間誤差0.96秒、実行速度が比較計画の4倍の速さを報告しました。

これらの数字は実際の工場の成功率と直接一致するものではありません。 ライティングの変化、オクルージョン、機械的な摩耗、操作遅延などが結果に影響を与え、高レベルのモデルは依然として基盤となるアクションモデルやハードウェアインターフェースに依存しています。 展開チームは、各アクションごとに検証可能な完了条件、障害ロールバック、手動の引き継ぎメカニズムを定義する必要があります。

安全能力はどのように理解すべきでしょうか?

GoogleはER 2が人が近づくとヒューマノイドロボットを停止させ、安全確保後も作業を継続できると述べました。また、安全性の制約、環境モニタリング、物理的実現可能性の評価のためのベンチマークも導入しています。 このアプローチは単にタスクスコアを向上させるよりも重要ですが、ベンチマーク性能だけでは現場の安全認証、隔離施設、緊急停止装置に代わるものではありません。

現在、開発者はGemini APIやGoogle AI Studioを通じてER 2を利用でき、Gemini Enterprise Agent Platformはプライベートプレビュー中です。 ロボティクスチームにとって最も現実的な第一歩は、モデルに直接生産ラインを乗っ取らせるのではなく、リスクが低く検証可能な結果でテストを始め、いつでも手動で中止できる状態から始めることです。

おすすめツール

もっと見る