A startup claims it broke through a bottleneck that’s holding back LLMs

개요

AI 스타트업 Subquadratic은 LLM의 성능을 저해해 온 수학적 병목 현상을 해결했다고 주장하는 새로운 모델 SubQ를 발표했습니다.

주요 내용

  • SubQ는 기존 LLM보다 빠르고 저렴하며 에너지 효율이 뛰어나다고 알려졌습니다.
  • 최대 12배 더 많은 텍스트를 한 번에 처리할 수 있어 대규모 문서 분석이나 코드베이스 검토와 같은 데이터 집약적인 작업에 유리합니다.
  • 코딩과 같은 주요 작업에서 Google DeepMind, OpenAI, Anthropic의 최고 모델과 비슷한 성능을 보이면서도 효율성을 높였다고 주장합니다.
  • 초기에는 증거가 부족하여 회의적인 시각이 있었으나, 독립적인 평가 기관인 Appen의 테스트 결과가 발표되며 주목받고 있습니다.
  • SubQ는 Transformer의 핵심인 Dense Attention 대신 Sparse Attention을 사용하여 계산량을 대폭 줄였습니다.
  • Sparse Attention 방식은 텍스트 내 모든 단어 쌍 간의 연산을 수행하는 대신, 중요한 관계에만 집중하여 효율성을 높입니다.
  • SubQ는 고정된 패턴이 아닌, 텍스트마다 동적으로 중요한 단어 관계를 선택하는 독자적인 방식을 사용한다고 합니다.
  • Appen의 테스트 결과, SubQ는 FlashAttention과 같은 이전 Sparse Attention 기법보다 56배 더 빨랐으며, 코딩 테스트에서는 89.7%의 점수를 기록하여 최고 수준 모델과 유사한 성능을 보였습니다.
  • 텍스트 컨텍스트 창(context window)이 최대 1,200만 토큰으로, 기존 최고 모델(100만 토큰)보다 훨씬 크며, 400개 문서에 대한 추론 작업에 수 초 만에 응답하는 시연을 보였습니다.
  • 대규모 데이터셋에서 특정 정보를 추출하는 "needle-in-a-haystack" 테스트에서도 98%의 높은 점수를 기록했습니다.
  • 그러나 SubQ가 기존 Qwen 모델의 가중치를 재사용하여 부트스트래핑했다는 점은 LLM 작동 방식을 완전히 재창조했다는 주장과는 상충될 수 있다는 지적도 있습니다.
  • SubQ는 아직 광범위하게 공개되지 않아 실제 적용에서의 성능 검증은 더 필요하며, 일부 회의론은 여전히 존재합니다.

시사점

SubQ의 기술은 LLM의 효율성 문제를 해결하고 새로운 LLM 아키텍처의 가능성을 제시하며, 향후 LLM 개발 방향에 큰 변화를 가져올 수 있습니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions