Are AI labs pelicanmaxxing?

개요

AI 연구소들이 유명한 '펠리컨 자전거 타기' 벤치마크에 맞춰 모델을 최적화했는지(pelicanmaxxing) 확인하기 위한 실험 결과, 유의미한 증거를 찾지 못했다.

주요 내용

* 벤치마크 설정: 8가지 동물과 6가지 탈것을 조합한 48가지 프롬프트를 생성했으며, 모든 프롬프트는 "동물이 탈것을 타고 있는 SVG 생성"이라는 동일한 문구 구조를 사용했다.
* 실험 모델 및 방법: GPT-4.6 Terra, Claude Sonnet 3.5, Gemini 3.5 Flash, Grok 4.5, Qwen 3.7-Max, GLM 5.2, DeepSeek V4 Pro 총 7개 모델을 대상으로 각 프롬프트별 3개의 샘플을 생성하여 총 1,008개의 SVG를 확보했다. 생성된 SVG는 PNG로 렌더링한 후 GPT-4.6 Luna가 1-5점 척도로 동물, 탈것, 전체적인 조화도를 평가했다. 추가적으로 Gemini 3.5 Flash-Lite가 이미지의 구성 요소를 분석했다.
* 펠리컨 및 자전거 관련 평가:
* 동물별 평균 점수: 펠리컨은 8가지 동물 중 6위에 머물렀으며, 고양이, 고래, 너구리, 왜가리, 영양보다 낮은 점수를 받았다.
* 탈것별 평균 점수: 자전거는 6가지 탈것 중 비행기 바로 다음인 5위를 기록했으며, 스케이트보드, 헬리콥터, 보트보다 낮은 점수를 받았다.
* 회귀 분석 결과: 펠리컨 자체, 자전거 자체, 그리고 펠리컨과 자전거의 조합에 대한 AI 연구소별 특화된 성능 향상은 통계적으로 유의미한 수준을 보이지 않았다. Gemini 3.5 Flash의 자전거 관련 성능 향상이 유일하게 p < 0.05를 만족했으나, 다중 비교 보정을 통과하지 못했다.
* 장면 구성 분석:
* 방향: 모든 21개의 '펠리컨 자전거' 조합 이미지에서 펠리컨이 오른쪽을 향하고 있었으나, 이는 자전거와 펠리컨 모두 오른쪽을 향하는 경향이 강한 동물-탈것 조합이라는 점에서 특별히 이례적이지 않았다.
* 장면 요소: 특정 동물-탈것 조합에서 반복적으로 나타나는 장면 요소들이 관찰되었으나, '펠리컨 자전거' 조합에서만 두드러지는 특징은 발견되지 않았다.
* 실험의 한계: 단일 LLM 심사관 사용, 심사관과 참가 모델 간의 잠재적 편향 가능성, SVG 생성 자체에 대한 최적화(SVGmaxxing) 탐지 불가, 제한된 예산으로 인한 샘플 수 및 모델 수의 제약 등이 지적되었다.

시사점

이번 실험은 AI 연구소들이 펠리컨 자전거 벤치마크에 맞춰 모델을 직접적으로 최적화했다는 명확한 증거를 제시하지 못했으며, 펠리컨이나 자전거 자체의 성능 개선도 두드러지지 않았다. 그러나 Google/DeepMind와 같은 연구소에서 공개적으로 진행하는 SVG 생성 전반의 최적화(SVGmaxxing)는 탐지되지 않았을 가능성이 있으며, 이는 향후 AI 모델 성능 평가 시 고려해야 할 요소이다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions