2026년 7월 30일, 구글 딥마인드는 Gemini Robotics ER 2를 출시하며 로봇의 고수준 '두뇌'로 자리매김했습니다: 이 모델은 연속 비디오 이해, 다단계 작업 계획, 도구 호출을 담당하며, 특정 동작은 기본 시각-언어-행동 모델이나 로봇 제어 인터페이스가 담당합니다. 그 중요성은 로봇 시스템이 보기, 사고, 실행, 재확인을 하나의 실시간 체인으로 통합하기 시작했다는 점에 있습니다.
이 개선은 세 가지 영역에 집중합니다
- 집행 중에도 계속 심사하세요. ER 2 는 모든 단계를 다시 분석하기 위해 멈추지 않고 행동 중에 진행 상황을 평가하며 영상 스트림을 지속적으로 시청합니다. 구글은 이를 저지연 양방향 흐름을 지원하는 Gemini Live API에 통합하여 봇이 '생각하기 위해 멈춤'하는 단편적인 느낌을 줄이고자 했습니다.
- 오류가 발견되고 조정이 이루어집니다. 모델은 유출, 미끄러짐, 위치 편차와 같은 이상 현상을 식별하고 재시도, 수정 또는 다음 단계로 이동할지 결정합니다. 공식 진척 분류 정확도는 57.4%로, 역량 면에서 명확한 진전이 있음을 보여주지만, 아직 완전히 포기할 여지는 있습니다.
- 서로 다른 로봇이 번갈아 가며 중계하게 하세요. 다중 로봇 협업은 바퀴 플랫폼, 로봇 팔, 또는 휴머노이드 로봇이 작업 의미를 공유하고 강점에 따라 인수인계를 완료할 수 있게 합니다. 모든 것을 단일 로봇이 처리해야 하는 대신, 이 배치 방식은 창고, 실험실, 공장 장비의 실제 결합에 더 가깝습니다.
"언제 끝낼지"가 핵심 지표가 되었습니다
로봇의 어려움은 명령을 이해하는 것이 아니라 그 동작이 실제로 완료되었는지 아는 데 있습니다. ER 2의 모멘트 탐색 평가는 액체가 적절한 위치에 부어졌을 때와 같은 중요한 사건의 정확한 순간을 정확히 파악하는 데 사용됩니다. 구글은 91.3%의 정확도, 평균 절대 시간 오차 0.96초, 실행 속도가 비교 계획보다 4배 빠르다고 보고했습니다.
이 수치는 실제 공장의 성공률과 직접적으로 일치할 수 없습니다. 조명 변화, 오클루전, 기계적 마모, 조작 지연 등이 결과에 영향을 미치며, 고급 모델은 여전히 기본 액션 모델과 하드웨어 인터페이스에 의존합니다. 배포팀은 각 작업에 대해 검증 가능한 완료 조건, 실패 롤백, 수동 인수 메커니즘을 정의해야 합니다.
안전 능력은 어떻게 이해되어야 할까요?
구글은 ER 2가 사람이 접근하면 휴머노이드 로봇을 멈추고, 지역이 안전해진 후에는 계속 작업을 할 수 있으며, 안전 제약, 환경 모니터링, 물리적 타당성 평가를 위한 벤치마크도 도입할 수 있다고 밝혔습니다. 이 접근법은 단순히 작업 점수를 향상시키는 것보다 더 중요하지만, 벤치마킹 성능이 현장 안전 인증, 격리 시설, 비상 정지 장치를 대체할 수는 없습니다.
현재 개발자들은 Gemini API와 Google AI Studio를 통해 ER 2를 사용할 수 있으며, Gemini Enterprise Agent Platform은 비공개 프리뷰 상태입니다. 로봇 팀에게 가장 현실적인 첫걸음은 모델이 직접 생산 라인을 장악하게 하지 않고, 언제든지 수동으로 종료할 수 있는 저위험 검증 결과로 테스트를 시작하는 것입니다.