Google reveals Gemini Robotics 2.0, promising improved dexterity and safety

개요

Google DeepMind가 발표한 Gemini Robotics 2.0은 로봇의 정교한 움직임, 환경 분석 능력, 그리고 다른 로봇과의 협업 능력을 향상시킨 새로운 AI 모델 및 API를 공개하며, 로봇 기술의 발전을 이끌고 있다.

주요 내용

* Gemini Robotics 2.0의 구성: Gemini Robotics 2.0은 세 가지 하위 모델로 구성되어 있으며, 그 중 하나인 Gemini Robotics ER 2 (Embodied Reasoning 2)가 개발자들에게 공개되었다.
* Gemini Robotics ER 2의 기능: 이 비전 언어 모델(VLM)은 실시간 비디오 피드를 처리하여 로봇의 진행 상황을 추적하고, 복잡한 태스크 수행 중 발생하는 실패를 실시간으로 감지하여 해당 단계만 재시도하는 능력이 향상되었다. 또한, 목표 달성에 중요한 특정 순간(예: 커피 잔을 채우고 멈추는 시점)을 높은 정확도로 인식한다.
* 인간 수준의 일반화 목표: Gemini Robotics의 궁극적인 목표는 인간처럼 다양한 작업을 수행할 수 있는 범용 로봇, 즉 "물리적 AGI(Artificial General Intelligence)"를 구현하는 것이다.
* 협업 능력 강화: ER 2 모델은 로봇 간 협업을 가능하게 하여, 여러 로봇이 서로 방해하지 않고 공동의 작업을 수행할 수 있도록 한다.
* Gemini Robotics 2 (Vision-Language-Action 모델): ER 2 모델로부터 받은 지시를 바탕으로 실제 로봇의 행동을 생성하며, 텍스트나 이미지를 생성하는 방식과 유사하게 작동한다. 저지연 오프라인 버전인 Gemini Robotics On-Device 2도 존재한다.
* 안전성 강화: Gemini Robotics 2.0은 AI 환각(hallucination) 문제와 더불어 물리적 로봇이 인간과 상호작용할 때 발생할 수 있는 위험을 심각하게 고려하며, 각 모델 레이어에 전통적인 물리적 안전 조치와 AI 안전 프레임워크를 통합했다.
* ASIMOV-Agentic 안전 벤치마크: 새로운 안전 벤치마크인 ASIMOV-Agentic은 모델이 위험한 도구 호출을 거부하는지, 태스크 수행의 안전성을 평가하는지, 그리고 불확실한 상황에서 인간의 도움을 요청하는지를 평가한다. ER 2는 인간이 로봇에 너무 가까이 다가올 때 안전하게 동작을 중단하는 능력이 개선되었다.
* 데이터 요구사항: On-Device 버전 모델은 약 200개의 예시, 즉 몇 시간의 움직임 데이터만으로 새로운 로봇 디자인에 적응할 수 있다.

시사점

Gemini Robotics 2.0은 로봇의 인지 능력과 행동 제어 능력을 비약적으로 향상시켜, 더욱 복잡하고 안전한 물리적 환경에서의 상호작용 및 협업을 가능하게 함으로써 미래 로봇 공학 및 자동화 분야에 중요한 영향을 미칠 것으로 기대된다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions