GLM 5.2 beats Claude in our benchmarks

개요

GLM 5.2 모델은 IDOR 탐지 벤치마크에서 Claude Code를 능가하는 성능을 보였으며, 특히 프롬프트만 제공된 환경에서 오픈 웨이트 모델의 경쟁력을 입증했습니다.

주요 내용

  • IDOR 탐지 벤치마크 결과: Semgrep은 IDOR 탐지를 위해 인기 있는 오픈 소스 모델들을 평가했으며, Zhipu AI의 오픈 웨이트 모델인 GLM 5.2가 Claude Code보다 7% 높은 F1 점수(39% vs 32%)를 기록했습니다.
  • Harness의 중요성: Semgrep의 자체 멀티모달 파이프라인이 탑재된 Harness 환경에서 GPT 5.5와 Opus 4.8 모델이 각각 61%와 53%의 F1 점수로 최상위를 차지하며, Harness가 모델 성능에 큰 영향을 미침을 보여주었습니다.
  • GLM 5.2의 특징: GLM 5.2는 오픈 웨이트 모델로, MIT 라이선스로 파라미터가 공개되어 자체 환경에서 실행 및 미세 조정이 가능합니다. 약 7500억 개의 총 파라미터 중 토큰당 400억 개가 활성화되는 Mixture-of-Experts (MoE) 구조를 가지며, 100만 토큰까지 확장이 가능한 긴 컨텍스트를 지원합니다.
  • 비용 효율성: GLM 5.2는 유사한 수준의 최전선 모델 대비 약 1/6의 비용으로 취약점을 발견하며, 벤치마크 상에서 취약점당 약 0.17달러의 비용이 소요되었습니다.
  • 오픈 웨이트 모델의 부상: GLM 5.2는 프롬프트만 제공된 환경에서 Claude Code를 능가하는 성능을 보여주며, 오픈 웨이트 모델이 특정 작업에서는 최전선 모델에 필적하거나 능가할 수 있음을 시사했습니다.
  • 기타 오픈 웨이트 모델 성능: MiniMax M3 (23%)와 Kimi K2.7 Code (22%)는 GLM 5.2보다 낮은 성능을 보였으며, Claude Code와 비슷한 수준이었습니다.

시사점

GLM 5.2와 같은 오픈 웨이트 모델의 급격한 성능 향상은 보안 팀에게 비용 효율적이고 자체 환경에서 운영 가능한 대안을 제시하며, LLM 선택 시 성능과 비용, 환경 등 다양한 요소를 종합적으로 고려해야 함을 강조합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions