PickleeAI와 개발, 오늘 볼 변화만
홈읽을거리아카이브
검색

Picklee

AI와 개발 현장에서 오늘 확인할 변화만 선별합니다.

© 2026 Picklee. All rights reserved.

RSSSitemap

읽을거리

2026년 4월 2일

PrismML Bonsai — 세계 최초 상용 가능 1-bit LLM, iPhone에서 44 tok/s 달성

PrismML이 2026년 3월 31일 세계 최초로 상용 수준 1-bit LLM 'Bonsai' 시리즈를 공개했다. 8B·4B·1.7B 세 가지 모델을 Apache 2.0 라이센스로 무료 배포하며, 기존 FP16 대비 메모리를 14배 절감하고 추론 속도를 8배 높이면서도 동급 모델과 동일한 벤치마크 성능을 유지한다.

본문 읽기원문 보기

발행일

2026년 4월 2일

업데이트

2026년 4월 2일

주제

AI
오픈소스
모델
원문 보기

배경 및 맥락

1-bit LLM 연구는 Microsoft의 BitNet, 퀄컴의 연구 등에서 수년간 진행되어 왔다. 핵심 문제는 가중치를 1-bit으로 양자화할 때 발생하는 정확도 손실이 실용적 수준을 넘어선다는 점이었다. 그간 4-bit, 8-bit 양자화는 상용화에 성공했지만 1-bit은 항상 벤치마크 gap이 컸다.

PrismML은 Caltech 연구 기반의 접근법으로 이 문제를 해결했다. 8B 모델 기준 메모리 사용량을 16GB에서 1GB로 줄이면서, FP16 모델과 벤치마크 parity를 달성했다. 전통적인 양자화 트레이드오프를 깨뜨린 결과다.


핵심 내용

  • 모델 라인업: Bonsai 8B, 4B, 1.7B — Apache 2.0 무료 배포
  • 성능: FP16 대비 14x 메모리 절감, 8x 추론 속도 향상, 벤치마크 동등
  • 엣지 실행: iPhone 17 Pro Max에서 MLX Swift로 44 tok/s 달성
  • 즉시 사용 가능: Hugging Face에서 배포, 출시 당일 'Locally AI' 앱 지원
  • Hacker News: 365 포인트, 140 댓글로 커뮤니티 반응 뜨거움

경쟁 구도 / 비교

Microsoft BitNet은 1-bit 개념을 선도했지만 상용 수준 성능 및 실용적 배포 패키징에서 한계가 있었다. Qualcomm의 온디바이스 AI 칩 접근법이나 Apple의 Core ML과 달리, Bonsai는 하드웨어 제약 없이 기존 모바일 프레임워크(MLX)에서 동작한다. 비슷한 규모의 Llama 3.1 8B 대비 메모리 효율성에서 압도적 우위를 보인다.

구분Bonsai 8BLlama 3.1 8B (FP16)
메모리1GB16GB
속도8x faster기준
라이센스Apache 2.0Llama 라이센스
엣지 실행iPhone 지원제한적

의미

온디바이스 AI가 "할 수 있다"는 개념 증명 단계에서 "지금 당장 iPhone에서 돌아간다"는 현실로 이동했다. 클라우드 API 의존도를 낮춰야 하는 기업, 프라이버시 보존이 중요한 헬스케어·금융 AI 애플리케이션, 오프라인 환경의 로보틱스에 즉각적인 실용적 임팩트가 있다. 2026년 하반기 엣지 AI 시장 구도를 바꿀 핵심 기술로 주목된다.

이어 읽기

관련 읽을거리

전체 보기
2026년 7월 28일Moonshot AI, Kimi K3 공개 weights 배포: 2.8T MoE의 실제 serving 경로 확인Moonshot AI가 Hugging Face에 Kimi K3의 full weights를 Kimi K3 License로 공개했다. 2.8T total / 104B activated parameter의 native multimodal MoE 모델로, 1M-token context, 896개 expert 중 16개 선택, MXFP4 weight·MXFP8 activation 기반 QAT를…2026년 7월 27일NVIDIA, Cosmos 3 Edge 공개: 4B 온디바이스 Physical AI 모델NVIDIA는 Cosmos 3 Edge를 공개했다. Nemotron 기반 4B 모델로, NVIDIA Jetson Thor 등 엣지 컴퓨터에서 vision reasoning과 로봇 action 생성을 로컬로 수행하도록 설계됐으며 Cosmos 3 오픈 월드 모델 계열의 edge 배포판이다.2026년 7월 17일Moonshot, 2.8T Kimi K3 공개…7월 27일 full weights 배포Moonshot AI가 7월 17일 2.8T-parameter, 1M-token context의 Kimi K3를 Kimi·Kimi Work·Kimi Code·Kimi API에 공개했다. Kimi Delta Attention과 Attention Residuals를 적용한 MoE 구조로, 896개 expert 중 16개를 활성화하며 full model weights는 7월 27일 공개할…2026년 7월 17일Thinking Machines, 975B MoE 오픈 웨이트 Inkling 공개Thinking Machines Lab가 7월 15일 975B total·41B active parameter의 MoE 모델 Inkling을 full weights로 공개했다. 최대 1M-token context와 text·image·audio native reasoning을 지원하며, 45T token의 text·image·audio·video 데이터로 pretraining됐다.…