GPT-6 Astra on robot arms
개요
GPT-6 Astra 모델은 로봇 팔을 제어하여 두 가지 작업(블록을 그릇에 넣기, 퍼즐 조각을 홈에 맞추기)을 수행하는 실험에서 Fable 5 및 Fable 5.1 모델과 비교되었습니다.
주요 내용
* 블록을 그릇에 넣는 작업:
* GPT-6 Astra는 20번의 시도 중 19번 성공하여 95%의 완료율을 보였으며, 시도당 평균 2.5분, 예상 비용은 0.94달러였습니다.
* Fable 5.1은 8번 성공(40% 완료율), 시도당 평균 6.8분, 예상 비용 2.12달러였습니다.
* Fable 5는 1번 성공(5% 완료율), 시도당 평균 8.2분, 예상 비용 2.69달러였습니다.
* Astra는 Fable 5.1보다 2.4배 높은 완료율과 2.3배 저렴한 비용으로 작업을 수행했습니다.
* 퍼즐 조각을 홈에 넣는 작업:
* GPT-6 Astra는 20번의 시도 중 2번 성공(10% 완료율), 시도당 평균 3.4분, 예상 비용 1.36달러였습니다.
* Fable 5.1은 2번 성공(10% 완료율), 시도당 평균 5.9분, 예상 비용 2.18달러였습니다.
* Fable 5는 0번 성공(0% 완료율), 시도당 평균 7.9분, 예상 비용 2.63달러였습니다.
* 이 작업에서 Astra와 Fable 5.1은 동일한 완료율을 보였으나, Astra가 1.6배 더 저렴한 비용으로 수행했습니다.
* 작업 단계별 분석:
* 블록 작업의 경우, Astra는 20번 시도 중 19번 최종 위치에 배치(Stage 4)했지만, 퍼즐 작업에서는 Fable 모델과 동일하게 홈에 도달 후 멈추는 현상(Stage 2)을 보였습니다.
* 모든 모델은 '접근', '물체 접촉', '물체 들어 올리기', '배치 지점 위로 이동', '최종 위치에 배치' 등 5단계로 평가되었습니다.
* 기술 사양:
* 실험에 사용된 로봇 팔은 Bimanual I2RT YAM 팔로, 각 팔은 6-DoF와 병렬 턱 그리퍼를 가집니다.
* 제어는 절대 엔드-이펙터 포즈를 사용했으며, 관찰은 3개의 카메라 뷰와 고유 상태 정보로 이루어졌습니다.
* 정책은 Inspect Robots 0.58.0이었고, LLM 호출 예산은 20회, 속도 제한은 25%로 설정되었습니다.
* 토큰 비용은 리스트 가격 기준이며, Anthropic의 요청은 프롬프트 캐싱 없이 수행되었고 OpenAI는 Astra의 입력 일부를 자동으로 캐싱했습니다.
시사점
GPT-6 Astra 모델은 특정 작업(블록 넣기)에서 기존 모델 대비 뛰어난 성능과 비용 효율성을 보여주었으나, 다른 복잡한 작업(퍼즐 조각 넣기)에서는 한계를 드러내며 향후 개선의 여지가 있음을 시사합니다.
댓글
GitHub Discussions