GPT-5.6 vs. Claude Fable 5 for Physical AI, which performs best?
개요
GPT-5.6 제품군과 Claude Fable 5 모델을 대상으로 Five Modeling and Simulation 문제를 통해 Physical AI 성능을 비교 평가한 결과, Claude Fable 5가 전반적으로 가장 높은 성능을 보였으며, Dyad AI와 같은 특화된 에이전트 하네스의 중요성이 모델 자체보다 크다는 점이 밝혀졌습니다.
주요 내용
* 모델 성능 비교: Five modeling and simulation 문제에 대한 평가에서 Claude Fable 5가 0.889의 가장 높은 가중치 점수를 기록했으며, GPT-5.6 Sol(0.814), GPT-5.6 Terra(0.786), GPT-5.6 Luna(0.727) 순으로 나타났습니다.
* 평가 방법: Dyad AI 에이전트 하네스를 고정하고, 각 모델의 다섯 가지 난이도별 모델링 및 시뮬레이션 문제에 대한 성능을 52번의 평가를 통해 측정했습니다. 평가 기준은 단순히 코드가 실행되는지 여부가 아닌, 시뮬레이션 결과가 봉인된 실제 결과(ground truth)와 얼마나 일치하는지에 초점을 맞췄습니다.
* 모델별 특성:
* Claude Fable 5: 검증을 위해 실패하는 예제를 구축하며, 엄격한 검증 과정을 거치는 특징을 보였습니다. 높은 정확도를 보였으나 비용이 가장 높았습니다.
* GPT-5.6 Sol: 요구사항 이상으로 작업을 수행하는 경향이 있으며, 독립적인 검증을 잘 수행했습니다. Fable보다 저렴한 비용으로 준수한 성능을 보였습니다.
* GPT-5.6 Terra: 비용 효율성과 속도를 중시하며, 문제의 일부를 경제적으로 처리하는 경향을 보였습니다. 가장 저렴하고 빠른 결과를 도출했으나, 미세한 오차를 발생시키기도 했습니다.
* GPT-5.6 Luna: 설정값 없이 문제의 많은 부분을 읽고 이해하는 데 집중했으나, 복잡한 물리 문제에서는 반복적인 작업으로 이어져 효율성이 떨어졌습니다.
* 가장 어려운 문제 (HL-20 비행체): 다섯 가지 문제 중 가장 어려웠던 NASA HL-20 비행체 문제에서 어떤 모델도 완벽하게 해결하지 못했습니다. Claude Fable 5는 외부 참조가 있는 경우 가장 높은 점수를 기록했습니다.
* 에이전트 하네스의 중요성: 모델을 변경하는 것보다 에이전트 하네스를 변경하는 것이 Physical AI 성능에 더 큰 영향을 미칩니다. Dyad AI 하네스를 사용했을 때와 일반 코딩 에이전트를 사용했을 때의 성능 차이가 모델 간의 성능 차이보다 두 배 이상 컸습니다.
시사점
Physical AI 분야에서는 모델 자체의 선택도 중요하지만, 문제 해결 과정을 안내하고 검증을 강제하는 특화된 에이전트 하네스가 성공의 핵심 요소이며, 사용자는 비용과 요구되는 정확도를 고려하여 최적의 모델과 하네스를 선택해야 합니다.
댓글
GitHub Discussions