배경 및 맥락
Frontier 모델 경쟁은 dense parameter 수의 확대에서, 장문 컨텍스트·멀티모달·장기 실행 코딩을 효율적으로 처리하는 sparse MoE와 serving stack의 경쟁으로 이동하고 있다. Moonshot AI는 Kimi K3를 이 흐름의 open 3T-class 모델로 소개하며 Kimi 제품군과 API에 우선 제공했다.
핵심 내용
Kimi K3는 2.8T parameters, native vision, 1M-token context를 내세운다. Stable LatentMoE에서 토큰마다 896개 expert 중 16개를 활성화하고, Kimi Delta Attention(KDA)과 Attention Residuals(AttnRes)를 적용해 Kimi K2 대비 약 2.5배의 scaling efficiency 개선을 주장한다. 학습은 SFT 단계부터 MXFP4 weights와 MXFP8 activations를 사용하는 quantization-aware training을 적용했다. API 가격은 cache-hit input $0.30, cache-miss input $3, output $15 per 1M tokens이며, Moonshot은 full weights를 2026년 7월 27일까지 공개할 예정이라고 명시했다.
경쟁 구도 / 비교
Kimi K3의 핵심은 단순히 큰 모델이라는 점보다 높은 MoE sparsity와 long-context serving에 있다. Moonshot은 64개 이상 accelerator의 고대역폭 supernode 구성을 권장하고 KDA의 prefix-cache 문제를 위한 vLLM 구현 기여도 예고했다. 따라서 closed API 모델과의 비교에서는 품질 점수뿐 아니라 실제 배포에 필요한 GPU topology, cache hit rate, runtime 호환성을 함께 봐야 한다.
의미
open-weight 모델의 산업적 가치는 weights 공개 순간보다 재현 가능한 serving 경로와 license·안전 문서가 갖춰질 때 커진다. 플랫폼 팀은 API benchmark와 공개 weights 기반의 독립 재현 결과를 분리하고, 장기 코딩 agent에 필요한 context·cache·inference 비용을 별도로 산정해야 한다.