$100 AI Music Video: Claude Fable 5 vs. GPT-5.6 Sol

개요

Claude Fable 5와 GPT-5.6 Sol 모델을 활용하여 $25 및 $100 예산으로 자체적으로 음악 비디오를 제작하는 실험이 진행되었습니다. 각 모델은 주어진 노래, 예산, 도구를 바탕으로 영상 모델을 탐색하고, 클립을 생성하며, 편집하는 전체 과정을 자율적으로 수행했습니다.

주요 내용

- 자동화된 음악 비디오 제작 시스템: 각 AI 모델은 'plan', 'web_search', 'get_budget', 'generate_image', 'generate_video', 'run_command' (ffmpeg 포함) 등 6가지 도구를 사용하여 음악 비디오 제작을 위한 연구, 생성, 편집을 자동화했습니다.
- 모델별 도구 사용 및 생성 전략 차이:
* Claude Fable 5 ($25)와 GPT-5.6 Sol ($100), Claude Fable 5 ($100)는 텍스트-투-비디오(Text-to-Video) 방식을 주로 사용했습니다.
* GPT-5.6 Sol ($25)은 이미지-투-비디오(Image-to-Video) 파이프라인을 채택하여 먼저 이미지를 생성한 후 애니메이션했습니다.
* GPT-5.6 Sol ($100)은 단일 비디오 모델에 의존하는 대신 세 가지 다른 비디오 모델을 혼합하여 사용했습니다.
- 비용 및 성능 비교:
* $25 예산에서 두 모델 모두 예산을 거의 소진했으며, $100 예산에서는 GPT-5.6 Sol이 $36.57, Claude Fable 5가 $48.60을 사용했습니다.
* 총 비용은 생성 비용 외에 LLM 토큰 비용을 포함하며, GPT-5.6 Sol의 토큰 비용이 Claude Fable 5보다 현저히 낮았습니다. (예: $25 예산 기준, Sol $27.45 vs Fable $41.29).
* Claude Fable 5 ($100)는 가장 높은 총 비용($73.65)을 기록했습니다.
- 제작된 비디오의 한계:
* 네 가지 실험 모두 캐릭터 및 스토리 일관성이 부족하고, 가사를 지나치게 문자 그대로 해석하는 경향을 보였습니다.
* 영상 클립 내 움직임이 노래의 템포와 잘 맞지 않는 경우가 많았습니다.
* 모델들은 생성된 클립을 편집하고 결합하는 데 집중했지만, 자체 생성물을 재편집하거나 품질을 검증하는 과정을 충분히 거치지 않았습니다.
- 모델별 차별점:
* GPT-5.6 Sol ($25)은 텍스트 오버레이, 비디오 효과를 적용하는 등 가장 창의적인 편집 방식을 시도했습니다.
* Claude Fable 5는 더 일관성 있는 출력 품질을 가진 모델을 선택하는 경향을 보였습니다.
- 도구 선택: 모든 실험에서 FAL 플랫폼만 사용되었으며, Replicate 플랫폼은 사용되지 않았습니다.
- 예산 활용: $100 예산은 예상보다 적게 사용되었으며, 모델들은 더 많은 예산을 활용하여 캐릭터 일관성 확보 등 개선된 전략을 선택할 여력이 있었음에도 그렇게 하지 않았습니다.

시사점

이 실험은 현재 프론티어 레벨 모델들이 자율적으로 복잡한 창작 작업을 수행할 수 있는 가능성을 보여주지만, 스토리텔링, 일관성, 스타일리시한 편집과 같은 주관적이고 미학적인 측면에서는 아직 상당한 개선의 여지가 있음을 시사합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions