Kimi-K3 Releases on HuggingFace 7/27

개요

Kimi-K3는 HuggingFace에 공개된 2.8T 파라미터의 오픈 웨이트, 네이티브 멀티모달 에이전트 모델로, Kimi Delta Attention (KDA) 및 Attention Residuals (AttnRes) 아키텍처를 기반으로 하며 100만 토큰의 컨텍스트 창을 지원합니다.

주요 내용

* 모델 아키텍처 및 규모: Kimi K3는 2.8T 파라미터 규모로, KDA와 AttnRes를 기반으로 하며 Stable LatentMoE 프레임워크를 통해 896개의 전문가 중 16개를 활성화하여 Kimi K2 대비 약 2.5배의 확장 효율성을 달성합니다.
* 장기 코딩 능력: 최소한의 인간 개입으로 GPU 커널 최적화, 컴파일러 개발, 비전 기반 게임 개발, CAD, 칩 설계 등 장시간 엔지니어링 세션을 유지하고 대규모 저장소를 탐색하며 터미널 도구를 오케스트레이션할 수 있습니다.
* 에이전트 지식 작업: 텍스트, 이미지, 비디오를 이해하는 네이티브 멀티모달 아키텍처를 활용하여 대화형 시각화, 위젯, 대시보드, 모션 디자인 및 비디오 편집을 포함한 포괄적인 지식 작업을 수행합니다.
* 네이티브 멀티모달리티 및 긴 컨텍스트: 텍스트, 이미지, 비디오를 동일한 모델 내에서 이해하며 100만 토큰의 컨텍스트 창을 지원합니다.
* 평가 결과: 다양한 추론, 코딩, 에이전트 관련 벤치마크에서 Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5, GLM-5.2와 비교하여 경쟁력 있는 성능을 보여줍니다. 특히 GPQA Diamond, Terminal-Bench, Agentic BrowseComp, DeepSearchQA (F1), GDPval-AA v2 등에서 높은 점수를 기록했습니다.
* 양자화: SFT 단계부터 양자화 인식 학습을 적용하여 MXFP4 가중치와 MXFP8 활성화를 사용하며, 광범위한 하드웨어 호환성을 제공합니다.
* API 및 배포: Kimi K3 API는 https://platform.kimi.ai에서 접근 가능하며, OpenAI/Anthropic 호환 API를 제공합니다. vLLM, SGLang, TokenSpeed와 같은 추론 엔진에서 실행이 권장됩니다.
* 모델 사용: Kimi K3는 항상 사고(thinking)가 활성화되어 있으며, reasoning_content를 반환합니다. reasoning_effort 필드로 사고 노력을 조절할 수 있으며, 다중 턴 대화 및 도구 호출 시에는 reasoning_contenttool_calls를 포함한 전체 어시스턴트 메시지를 입력으로 전달해야 합니다.

시사점

Kimi K3의 오픈 웨이트 공개는 차세대 인공지능 연구 및 개발 커뮤니티에 혁신적인 능력을 제공하며, 장기 코딩, 복잡한 지식 작업, 멀티모달 이해 등 다양한 분야에서의 발전을 가속화할 것으로 기대됩니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions