We made Grok 4.5, GPT-5.5, and Claude build the same apps

개요

Grok 4.5, GPT-5.5, Claude Opus 4.8, Claude Fable 5 네 가지 AI 모델의 코딩 및 앱 빌드 능력을 동일한 세 가지 프롬프트를 사용하여 비교 평가했다.

주요 내용

* 3D 루빅스 큐브 만들기:
* Claude Opus 4.8과 Fable 5는 첫 시도에 정확하고 색상이 구현된 3D 루빅스 큐브를 만들었으며, 애니메이션 스크램블 및 솔브 기능이 포함되었다.
* Grok 4.5는 첫 시도에 큐브가 렌더링되지 않아 재시도 후 성공했으나, GPT-5.5는 단일 면만 렌더링하는 데 그쳤다.
* Claude 모델들이 이 라운드에서 우위를 보였다.
* 입자 중력 샌드박스 만들기:
* 모든 모델이 작동하는 샌드박스를 만들었으며, GPT-5.5가 가장 매력적인 디자인(빛나는 네온, 짙은 색상의 입자 흔적)을 선보였다.
* Grok 4.5는 깔끔하고 궤도적인 스타일을, Fable 5는 부드러운 빛의 구체를, Opus 4.8은 가장 복잡하고 웹과 유사한 입자 필드를 구현했다.
* GPT-5.5가 시각적인 디자인에서 승리했다.
* 플레이 가능한 브레이크아웃 게임 만들기:
* 네 가지 모델 모두 첫 시도에 점수, 생명, 빛나는 패들을 갖춘 완성도 높은 플레이 가능한 브레이크아웃 게임을 만들었다.
* Grok 4.5와 GPT-5.5는 네온 아케이드 스타일을 강조했다.
* 모든 모델이 실질적으로 사용 가능한 수준의 결과를 제공했다.
* 속도 및 비용 분석:
* Grok 4.5는 가장 빠른 첫 토큰 생성(0.44초)과 높은 처리량(110 tok/s)을 보였으며, 응답당 비용이 0.002¢로 가장 저렴했다.
* GPT-5.5는 짧은 답변에서 가장 빨랐으나 처리량은 절반 수준이었다(53 tok/s).
* Claude Opus 4.8은 중간 수준의 속도와 처리량(47 tok/s)을, Fable 5는 가장 느리고 비싼 응답(28 tok/s, 0.009¢)을 기록했다.
* Grok 4.5가 속도와 비용 측면에서 xAI의 '단위 시간 및 비용당 지능'이라는 주장과 일치하는 성능을 보였다.
* 추가 라운드: 이상한 그림 그리기 (SVG):
* Fable 5가 가장 창의적인 결과물(말하는 말과 우주비행사)을 만들었다.
* GPT-5.5도 재미있는 장면을 묘사했으나, Opus 4.8은 SVG 파서 오류를 유발하는 중복 속성을 포함했다.
* Grok 4.5는 명확하고 읽기 쉬운 장면을 구현했다.

시사점

Grok 4.5는 속도와 비용 효율성에서 경쟁 모델들을 능가하며, 특히 대량의 코드 생성 작업에서 강력한 이점을 제공한다. Claude Opus 4.8과 Fable 5는 높은 신뢰성과 결과물의 정확성에서 강점을 보이지만, 이에 따른 지연 시간과 비용 증가를 감수해야 한다. GPT-5.5는 시각적인 매력과 빠른 짧은 응답 처리 능력을 갖추고 있다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions