PickleeAI와 개발, 오늘 볼 변화만
홈읽을거리아카이브
검색

Picklee

AI와 개발 현장에서 오늘 확인할 변화만 선별합니다.

© 2026 Picklee. All rights reserved.

RSSSitemap

읽을거리

2026년 7월 28일

Moonshot AI, Kimi K3 공개 weights 배포: 2.8T MoE의 실제 serving 경로 확인

Moonshot AI가 Hugging Face에 Kimi K3의 full weights를 Kimi K3 License로 공개했다. 2.8T total / 104B activated parameter의 native multimodal MoE 모델로, 1M-token context, 896개 expert 중 16개 선택, MXFP4 weight·MXFP8 activation 기반 QAT를…

본문 읽기원문 보기

발행일

2026년 7월 28일

업데이트

2026년 7월 28일

주제

AI
모델
오픈소스
에이전트
API
원문 보기

배경 및 맥락

Moonshot AI는 앞선 Kimi K3 발표에서 2.8T parameter의 open 3T-class 모델과 1M-token context를 내세우면서 full weights를 7월 27일까지 공개하겠다고 예고했다. 하지만 대형 MoE 모델은 API에서 동작하는지와 독립 배포 가능한 artifact가 존재하는지가 전혀 다른 문제다. weights, 라이선스, quantization, serving engine, context cache, tool-call 상태 처리까지 확인돼야 비로소 연구·사내 배포·비교 평가의 대상이 된다.


핵심 내용

Hugging Face의 Moonshot AI model card는 Kimi K3 full weights를 Kimi K3 License로 제공한다고 명시한다. Kimi K3는 총 2.8T parameter, 활성 104B parameter, 93 layer의 Mixture-of-Experts 모델이며, token마다 896개 expert 중 16개를 선택하고 2개의 shared expert를 둔다. 1,048,576-token context, 160K vocabulary, MoonViT-V2 401M vision encoder를 갖고 text와 image를 지원한다. SFT 단계부터 MXFP4 weights·MXFP8 activations를 쓴 quantization-aware training을 적용했다. 배포 경로로 vLLM 및 SGLang을 제시하며 OpenAI·Anthropic-compatible API도 제공한다. 단, multi-turn 및 tool call에서 assistant의 reasoning_content와 tool_calls를 포함한 전체 메시지를 그대로 다음 요청으로 되돌려야 한다고 안내한다.


경쟁 구도 / 비교

기존 Notion 항목은 Kimi K3의 architecture와 weights 공개 계획을 다뤘다. 이번 후속은 예고가 실제 공개 model artifact와 deployment instructions로 전환됐다는 점에 한정한다. 일반적인 OpenAI-compatible endpoint는 text content만 이어도 되지만, Kimi K3는 preserved thinking history를 요구해 orchestration·trace 저장 방식에 직접 영향을 준다. 또한 2.8T total parameter라는 수치만으로 비용을 추정하면 안 되며, 104B active parameter, KV-cache, 1M context, expert parallelism, accelerator interconnect를 함께 고려해야 한다.


의미

open-weight frontier 모델 평가의 체크리스트는 benchmark 순위에서 license, 파일 접근성, runtime maturity, precision 지원, tool-state 호환성, 안전·운영 통제로 확장돼야 한다. 플랫폼 팀은 작은 재현 실험부터 시작해 실제 업무의 latency, cache hit rate, tool-call success, retry cost, VRAM·network 사용량을 측정해야 한다. 특히 reasoning history를 보존하는 모델은 로그에 민감한 추론 데이터가 남을 수 있으므로 retention, redaction, access control을 사전에 설계해야 한다.

이어 읽기

관련 읽을거리

전체 보기
2026년 7월 17일Moonshot, 2.8T Kimi K3 공개…7월 27일 full weights 배포Moonshot AI가 7월 17일 2.8T-parameter, 1M-token context의 Kimi K3를 Kimi·Kimi Work·Kimi Code·Kimi API에 공개했다. Kimi Delta Attention과 Attention Residuals를 적용한 MoE 구조로, 896개 expert 중 16개를 활성화하며 full model weights는 7월 27일 공개할…2026년 7월 27일Anthropic, Claude Sonnet 5 출시: 에이전트 성능과 비용 효율 강화Anthropic은 Claude Sonnet 5를 출시했다. 브라우저·터미널 같은 도구를 사용해 계획을 세우고 자율 실행하는 agentic 작업을 겨냥하며, Claude API와 Claude Code에서 claude-sonnet-5로 제공된다. 출시 프로모션 가격은 2026년 8월 31일까지 입력 $2·출력 $10 per 1M tokens이며 이후 $3·$15다.2026년 7월 27일NVIDIA, Cosmos 3 Edge 공개: 4B 온디바이스 Physical AI 모델NVIDIA는 Cosmos 3 Edge를 공개했다. Nemotron 기반 4B 모델로, NVIDIA Jetson Thor 등 엣지 컴퓨터에서 vision reasoning과 로봇 action 생성을 로컬로 수행하도록 설계됐으며 Cosmos 3 오픈 월드 모델 계열의 edge 배포판이다.2026년 7월 17일Thinking Machines, 975B MoE 오픈 웨이트 Inkling 공개Thinking Machines Lab가 7월 15일 975B total·41B active parameter의 MoE 모델 Inkling을 full weights로 공개했다. 최대 1M-token context와 text·image·audio native reasoning을 지원하며, 45T token의 text·image·audio·video 데이터로 pretraining됐다.…