PickleeAI와 개발, 오늘 볼 변화만
홈읽을거리아카이브
검색

Picklee

AI와 개발 현장에서 오늘 확인할 변화만 선별합니다.

© 2026 Picklee. All rights reserved.

RSSSitemap

읽을거리

2026년 3월 27일

Google TurboQuant — LLM KV 캐시 6배 압축, 정확도 손실 제로 달성 (ICLR 2026)

Google이 LLM의 KV 캐시를 기존 16비트에서 3비트로 압축해 메모리 사용량을 최소 6배 줄이면서도 정확도 손실이 없는 알고리즘 TurboQuant를 공개했다. ICLR 2026에서 정식 발표 예정이며, H100 GPU에서 4비트 적용 시 32비트 대비 최대 8배 추론 성능 향상이 확인됐다.

본문 읽기원문 보기

발행일

2026년 3월 27일

업데이트

2026년 3월 27일

주제

트렌드
AI
모델
개발도구
원문 보기

이어 읽기

관련 읽을거리

전체 보기
2026년 4월 8일Cursor, warp decode 공개 — Blackwell 기반 MoE 추론을 1.84x 가속하며 정확도도 개선Cursor는 2026년 4월 6일 warp decode를 공개하며, Blackwell GPU에서 Mixture-of-Experts(MoE) decode 경로의 병렬화 축을 expert 중심에서 output 중심으로 뒤집어 1.84x throughput 향상과 FP32 기준 1.4x 더 높은 정확도를 얻었다고 밝혔다. 기존 expert-centric 경로의 8단계 중 5단계를 제거하고,…2026년 7월 15일Google, Qwen 3.5-397B MoE를 Ironwood TPU에서 최적화: prefill 최대 4.7배 향상Google for Developers는 397B-parameter Qwen 3.5 MoE를 Ironwood TPU v7x에서 서빙하기 위한 최적화 사례를 공개했다. 17B active parameters/token의 희소 모델을 대상으로 DP+EP 병렬화, JAX/Pallas 커널, 통신 fusion을 적용해 2026년 4~6월 사이 decode-heavy 성능은 약 3.1배,…2026년 7월 13일Meta, Muse Image·Muse Video 공개: 툴 사용·자기개선형 미디어 생성 모델Meta Superintelligence Labs가 Muse Image를 출시하고 Muse Video를 프리뷰했다. Muse Image는 이미지 생성 과정에서 search·code 도구를 호출하고 결과를 스스로 수정하는 agentic model이며, Muse Video는 같은 사전학습 기반에서 native audio를 지원한다.2026년 7월 12일I think I have LLM burnout나는 LLM 결과를 읽는 데 그렇게 지칠 줄은 몰랐습니다.