"Drawing" the Mona Lisa with GPT-5.6, Claude, Gemini, and Grok

개요

GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash 등 네 가지 비전 모델이 색연필 도구 세트를 사용하여 모나리자와 별이 빛나는 밤을 재현하고 텍스트 프롬프트에 따라 그림을 그리는 능력을 평가했습니다.

주요 내용

* 실험 설계: 각 모델은 빈 캔버스와 색연필 도구 세트를 제공받아 대상 이미지 또는 텍스트 프롬프트를 기반으로 그림을 그리도록 했습니다. 모델은 색상, 팁 너비, 압력 설정, 스트로크 그리기, 번지기, 지우기, 캔버스 보기 등의 도구를 사용했습니다.
* 평가 대상: 모나리자와 반 고흐의 별이 빛나는 밤 이미지를 대상으로 객관적인 점수를 매겼으며, 다섯 가지 개방형 텍스트 프롬프트에 대한 그림도 평가했습니다.
* 도구 사용: 모델들은 동일한 도구 세트를 사용했지만 각기 다른 방식으로 활용했습니다. GPT-5.6 Sol은 set_color, set_brush, set_pressure 대신 draw 호출에 설정을 포함했으며, Grok 4.5는 이 설정 도구들을 주로 사용했습니다. Claude Fable 5는 smudgeview_canvas를 자주 사용했고, Gemini 3.6 Flash는 view_canvas를 가장 많이 사용하여 스스로를 검토했습니다.
* 비용 및 토큰: Claude Fable 5가 7개의 그림에 대해 약 160달러를 사용하여 다른 모델(GPT-5.6 Sol: 7.74달러, Grok 4.5: 9.21달러, Gemini 3.6 Flash: 12.87달러)보다 훨씬 높은 비용을 기록했습니다. Grok은 가장 많은 토큰(34M)을 사용했지만 캐시 읽기 비중이 높아 비용이 저렴했으며, Gemini도 캐시 읽기에 의존하여 토큰 사용량 대비 비용이 합리적이었습니다.
* 성능 개선: view_canvas를 통해 캔버스를 지속적으로 재평가한 결과, 모델들은 초기에 성능이 정체되는 경향을 보였으며, 최종 결과물이 중간 과정에서 도달했던 최고 성능보다 낮은 경우가 많았습니다. Gemini 3.6 Flash는 모나리자에서 가장 높은 SSIM(0.449)을 기록했으나, 최종적으로는 0.337로 하락했습니다.
* 객관적 유사성 (SSIM/RMSE): SSIM 기준으로 Gemini 3.6 Flash가 두 대상 이미지 모두에서 가장 높은 최종 점수와 최고 점수를 기록했습니다. 하지만 SSIM은 구조적 유사성을 측정할 뿐, 실제 사람이 보기에 그림의 품질이나 예술성을 나타내지는 않습니다.
* 실행 결과: GPT-5.6 Sol이 전반적으로 가장 우수한 성능을 보였으며, 특히 별이 빛나는 밤과 장미 그림에서 높은 평가를 받았습니다. Grok 4.5는 사용 가능한 결과물을 거의 생성하지 못해 낮은 평가를 받았습니다. Gemini 3.6 Flash는 Grok보다 나았지만, Claude Fable 5는 품질 면에서 두 번째였으나 비용과 시간이 가장 많이 소요되어 효율성이 떨어졌습니다.

시사점

이 실험은 최신 LLM들이 단순한 텍스트 생성이나 분석을 넘어 시각적 창작 작업을 수행하는 잠재력을 보여주지만, 창의성이나 예술적 능력에 대한 객관적인 척도는 아니며, 특히 비용 효율성과 결과의 일관성 측면에서 아직 개선의 여지가 있음을 시사합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions