배경 및 맥락
Moonshot AI는 앞선 Kimi K3 발표에서 2.8T parameter의 open 3T-class 모델과 1M-token context를 내세우면서 full weights를 7월 27일까지 공개하겠다고 예고했다. 하지만 대형 MoE 모델은 API에서 동작하는지와 독립 배포 가능한 artifact가 존재하는지가 전혀 다른 문제다. weights, 라이선스, quantization, serving engine, context cache, tool-call 상태 처리까지 확인돼야 비로소 연구·사내 배포·비교 평가의 대상이 된다.
핵심 내용
Hugging Face의 Moonshot AI model card는 Kimi K3 full weights를 Kimi K3 License로 제공한다고 명시한다. Kimi K3는 총 2.8T parameter, 활성 104B parameter, 93 layer의 Mixture-of-Experts 모델이며, token마다 896개 expert 중 16개를 선택하고 2개의 shared expert를 둔다. 1,048,576-token context, 160K vocabulary, MoonViT-V2 401M vision encoder를 갖고 text와 image를 지원한다. SFT 단계부터 MXFP4 weights·MXFP8 activations를 쓴 quantization-aware training을 적용했다. 배포 경로로 vLLM 및 SGLang을 제시하며 OpenAI·Anthropic-compatible API도 제공한다. 단, multi-turn 및 tool call에서 assistant의 reasoning_content와 tool_calls를 포함한 전체 메시지를 그대로 다음 요청으로 되돌려야 한다고 안내한다.
경쟁 구도 / 비교
기존 Notion 항목은 Kimi K3의 architecture와 weights 공개 계획을 다뤘다. 이번 후속은 예고가 실제 공개 model artifact와 deployment instructions로 전환됐다는 점에 한정한다. 일반적인 OpenAI-compatible endpoint는 text content만 이어도 되지만, Kimi K3는 preserved thinking history를 요구해 orchestration·trace 저장 방식에 직접 영향을 준다. 또한 2.8T total parameter라는 수치만으로 비용을 추정하면 안 되며, 104B active parameter, KV-cache, 1M context, expert parallelism, accelerator interconnect를 함께 고려해야 한다.
의미
open-weight frontier 모델 평가의 체크리스트는 benchmark 순위에서 license, 파일 접근성, runtime maturity, precision 지원, tool-state 호환성, 안전·운영 통제로 확장돼야 한다. 플랫폼 팀은 작은 재현 실험부터 시작해 실제 업무의 latency, cache hit rate, tool-call success, retry cost, VRAM·network 사용량을 측정해야 한다. 특히 reasoning history를 보존하는 모델은 로그에 민감한 추론 데이터가 남을 수 있으므로 retention, redaction, access control을 사전에 설계해야 한다.