Mistral's Robostral Navigate: a state of the art robotics navigation model

개요

Mistral AI가 개발한 Robostral Navigate는 단일 RGB 카메라만을 사용하여 복잡한 환경에서 로봇이 자율적으로 경로를 탐색할 수 있도록 하는 8B 파라미터 규모의 모델입니다.

주요 내용

* Robostral Navigate는 LiDAR나 별도의 심도 센서 없이 일반 RGB 카메라 한 개만을 활용하여, 학습되지 않은 R2R-CE(Room-to-Room in Continuous Environments) 벤치마크에서 76.6%의 성공률을 달성했습니다. 이는 기존의 다중 센서 접근 방식보다 우수한 성능을 보이면서도 더 효율적입니다.
* 이 모델은 시뮬레이션 기반 데이터와 토큰 효율적인 학습 기법을 사용하여 자체적으로 구축되었으며, 다양한 로봇 종류에 적용 가능하고 학습 과정에서 보지 못했던 실제 환경의 장애물에도 적응하는 능력을 갖추고 있습니다.
* Robostral Navigate는 '포인팅(pointing)' 기반 탐색과 강화학습(reinforcement learning)을 결합하여 지속적인 성능 개선을 추구하며, 이는 로봇 공학 분야에서 통합된 구현형 AI(embodied AI)를 향한 발판을 마련합니다.
* 모델은 시뮬레이션에서 생성된 약 40만 개의 궤적 데이터셋과 6천 개의 장면을 활용하여 효율적인 지도 학습(supervised training) 방식으로 훈련되었습니다.
* '프리픽스-캐싱(prefix-caching)' 기반의 토큰 효율적인 훈련 알고리즘을 사용하여 전체 에피소드를 단일 시퀀스로 압축, 학습 시간을 획기적으로 단축시켰습니다.
* 지도 학습 후에는 온라인 강화학습 알고리즘인 CISPO를 적용하여 시행착오를 통해 학습하고 실패로부터 회복하며 탐색적 행동을 습득하도록 하여 성능을 더욱 향상시켰습니다.

시사점

Robostral Navigate는 소형 모델과 단일 RGB 카메라만으로도 최첨단 구현형 탐색 성능을 달성할 수 있음을 입증하며, 이는 제조, 물류, 서비스 등 다양한 산업 분야에서 로봇의 자율적인 환경 탐색 능력을 크게 향상시킬 잠재력을 가지고 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions