Two Million Open AI Models, but Most of the Attention Goes to Just 200
개요
Hugging Face의 2백만 개 이상 공개 모델 중 극소수가 다운로드의 대부분을 차지하며, 이는 양적 팽창 속에서 실질적인 선택지의 집중 현상을 보여줍니다.
주요 내용
* Hugging Face는 2025년 기준 1,300만 사용자, 200만 개 이상 공개 모델, 50만 개 이상 공개 데이터셋을 보유하고 있으며, 개발자들은 단순히 파운데이션 모델을 다운로드하는 것을 넘어 전문화된 버전, 어댑터, 벤치마크, 애플리케이션을 구축하고 있습니다.
* 전체 모델 중 절반 가량은 200회 미만의 다운로드를 기록했으며, 상위 200개(전체의 약 0.01%) 모델이 전체 다운로드의 49.6%를 차지할 정도로 다운로드 분포가 매우 불균형합니다.
* 모델 집중 현상 자체는 부정적이지 않으며, 잘 작동하고 문서화가 명확하며 인기 있는 추론 도구로 지원되는 모델 주변으로 개발자들이 모이는 네트워크 효과가 발생합니다.
* 단순히 저장소(repository) 수를 선택지로 혼동하는 것이 문제이며, 사용 가능한 기술적 모델이라도 유지보수되는 서빙 템플릿, 최신 종속성, 신뢰할 수 있는 양자화(quantisation) 부족으로 배포가 어렵거나, 벤치마크 성능은 우수해도 라이선스가 제한적이거나, 실험적 파인튜닝(fine-tune)이 업데이트되지 않는 경우가 있습니다.
* 모델 평가 시 벤치마크 점수와 파라미터 수 외에 최근 유지보수 상태, 이슈 해결 활발성, 확립된 추론 프레임워크와의 호환성, 커뮤니티 생성 양자화 및 배포 가이드, 명확한 라이선스 및 상업적 사용 허가, 관련 도메인용 파인튜닝/어댑터 존재 여부, 원 개발자 외 채택 증거 등을 고려해야 합니다.
* 다운로드 볼륨은 유용한 신호이지만 최종 결정은 아니며, 고도로 전문화된 모델은 다운로드 수가 적더라도 가치가 높을 수 있고, 널리 다운로드된 모델이 모든 워크로드에 적합한 선택은 아닐 수 있습니다.
* 다운로드 집중 현상은 소수의 모델, 유지보수자, 지원 도구에 수많은 애플리케이션이 의존하는 공급망 위험을 야기하며, 라이선스 변경, 저장소 비활성화, 취약점 발생 시 영향이 광범위할 수 있습니다.
* 모델 선택은 소프트웨어 공급망 관리와 유사해졌으며, 모델의 출처, 종속성, 유지보수 상태, 필요 시 마이그레이션 가능성 등을 이해해야 합니다.
* 현재 부족한 것은 모델의 수가 아니라, 장기적인 신뢰를 받을 만한 모델을 결정할 수 있는 신뢰할 수 있는 방법이며, 오픈 AI 생태계의 다음 단계는 게시되는 모델 수보다 개발자가 모델을 평가, 유지보수, 보안, 배포하는 능력에 달려있습니다.
시사점
오픈 AI 생태계는 양적으로는 방대한 선택지를 제공하지만, 실질적인 가치와 안정성은 커뮤니티 지원, 유지보수, 도구화 등 '커뮤니티 깊이'와 '신뢰성'에 의해 결정되며, 이는 모델 선택 시 단순한 다운로드 수 이상의 다각적인 평가를 요구합니다.
댓글
GitHub Discussions