PickleeAI와 개발, 오늘 볼 변화만
홈읽을거리아카이브
검색

Picklee

AI와 개발 현장에서 오늘 확인할 변화만 선별합니다.

© 2026 Picklee. All rights reserved.

RSSSitemap

주제

#모델

68개 읽을거리를 모았습니다.
2026년 7월 28일

Moonshot AI, Kimi K3 공개 weights 배포: 2.8T MoE의 실제 serving 경로 확인

Moonshot AI가 Hugging Face에 Kimi K3의 full weights를 Kimi K3 License로 공개했다. 2.8T total / 104B activated parameter의 native multimodal MoE 모델로, 1M-token context, 896개 expert 중 16개 선택, MXFP4 weight·MXFP8 activation 기반 QAT를…

AI
모델
읽기
2026년 7월 27일

Anthropic, Claude Sonnet 5 출시: 에이전트 성능과 비용 효율 강화

Anthropic은 Claude Sonnet 5를 출시했다. 브라우저·터미널 같은 도구를 사용해 계획을 세우고 자율 실행하는 agentic 작업을 겨냥하며, Claude API와 Claude Code에서 claude-sonnet-5로 제공된다. 출시 프로모션 가격은 2026년 8월 31일까지 입력 $2·출력 $10 per 1M tokens이며 이후 $3·$15다.

AI
Claude
읽기
2026년 7월 27일

NVIDIA, Cosmos 3 Edge 공개: 4B 온디바이스 Physical AI 모델

NVIDIA는 Cosmos 3 Edge를 공개했다. Nemotron 기반 4B 모델로, NVIDIA Jetson Thor 등 엣지 컴퓨터에서 vision reasoning과 로봇 action 생성을 로컬로 수행하도록 설계됐으며 Cosmos 3 오픈 월드 모델 계열의 edge 배포판이다.

AI
모델
읽기
2026년 7월 26일

Google, Gemini 3.6 Flash·3.5 Flash-Lite·3.5 Flash Cyber 공개

Google이 7월 21일 Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber를 공개했다. 3.6 Flash는 3.5 Flash 대비 출력 토큰 사용량을 17% 낮췄다고 밝히며, 입력·출력 가격은 각각 $1.50/$7.50 per 1M tokens다.

AI
Gemini
읽기
2026년 7월 26일

Moonshot AI, Kimi K3 공개: 2.8T open 3T-class 모델

Moonshot AI는 Kimi K3를 공개했다. 2.8T parameters, native vision, 1M-token context를 갖춘 open 3T-class 모델이며 Kimi.com·Kimi Work·Kimi Code·Kimi API에서 제공된다. 전체 weights는 7월 27일까지 공개할 예정이라고 밝혔다.

AI
모델
읽기
2026년 7월 17일

Moonshot, 2.8T Kimi K3 공개…7월 27일 full weights 배포

Moonshot AI가 7월 17일 2.8T-parameter, 1M-token context의 Kimi K3를 Kimi·Kimi Work·Kimi Code·Kimi API에 공개했다. Kimi Delta Attention과 Attention Residuals를 적용한 MoE 구조로, 896개 expert 중 16개를 활성화하며 full model weights는 7월 27일 공개할…

AI
모델
읽기
2026년 7월 17일

Thinking Machines, 975B MoE 오픈 웨이트 Inkling 공개

Thinking Machines Lab가 7월 15일 975B total·41B active parameter의 MoE 모델 Inkling을 full weights로 공개했다. 최대 1M-token context와 text·image·audio native reasoning을 지원하며, 45T token의 text·image·audio·video 데이터로 pretraining됐다.…

AI
모델
읽기
2026년 7월 16일

Mistral, 단일 RGB 카메라 로봇 내비게이션 모델 Robostral Navigate 공개

Mistral AI가 자연어 지시와 단일 RGB 카메라 입력만으로 복잡한 환경을 이동하는 8B embodied-navigation 모델 Robostral Navigate를 공개했다. 이 모델은 R2R-CE validation unseen에서 76.6% 성공률을 기록해, 회사 발표 기준 최고 단일 카메라 방식보다 9.7%p, depth·다중 카메라 방식보다 4.5%p 높았다.

AI
모델
읽기
2026년 7월 15일

Google, Qwen 3.5-397B MoE를 Ironwood TPU에서 최적화: prefill 최대 4.7배 향상

Google for Developers는 397B-parameter Qwen 3.5 MoE를 Ironwood TPU v7x에서 서빙하기 위한 최적화 사례를 공개했다. 17B active parameters/token의 희소 모델을 대상으로 DP+EP 병렬화, JAX/Pallas 커널, 통신 fusion을 적용해 2026년 4~6월 사이 decode-heavy 성능은 약 3.1배,…

AI
모델
읽기
2026년 7월 13일

Meta, Muse Image·Muse Video 공개: 툴 사용·자기개선형 미디어 생성 모델

Meta Superintelligence Labs가 Muse Image를 출시하고 Muse Video를 프리뷰했다. Muse Image는 이미지 생성 과정에서 search·code 도구를 호출하고 결과를 스스로 수정하는 agentic model이며, Muse Video는 같은 사전학습 기반에서 native audio를 지원한다.

AI
모델
읽기
2026년 7월 12일

I think I have LLM burnout

나는 LLM 결과를 읽는 데 그렇게 지칠 줄은 몰랐습니다.

트렌드
AI
읽기
2026년 7월 12일

GPT-5.6 Sol Ultra produces proof of the Cycle Double Cover Conjecture [pdf]

GPT-5.6 Sol Ultra produces proof of the Cycle Double Cover Conjecture [pdf] 소식의 핵심을 빠르게 정리하면, AI 모델 흐름에서 다음 변화를 미리 읽게 해주는 이슈입니다. 이 글에서는 사실 관계와 맥락, 그리고 실무자가 바로 참고할 포인트를 뉴스레터 톤으로 전달합니다.

트렌드
AI
읽기
2026년 7월 10일

GPT‑Live

GPT‑Live 소식의 핵심을 빠르게 정리하면, AI 모델 흐름에서 다음 변화를 미리 읽게 해주는 이슈입니다. 이 글에서는 사실 관계와 맥락, 그리고 실무자가 바로 참고할 포인트를 뉴스레터 톤으로 전달합니다.

트렌드
AI
읽기
2026년 7월 10일

GPT-5.6

GPT-5.6 소식의 핵심을 빠르게 정리하면, AI 모델 흐름에서 다음 변화를 미리 읽게 해주는 이슈입니다. 이 글에서는 사실 관계와 맥락, 그리고 실무자가 바로 참고할 포인트를 뉴스레터 톤으로 전달합니다.

트렌드
AI
읽기
2026년 7월 5일

Leanstral 1.5 - open proof-engineering model moves formal verification toward practical code review

Mistral이 Lean 4 기반 proof engineering 모델 Leanstral 1.5를 공개했다. Apache-2.0 라이선스의 119B total / 6B active parameter 모델이며 miniF2F 100%, PutnamBench 587/672, FATE-H 87%, FATE-X 34%를 기록하고 57개 오픈소스 저장소 테스트에서 5개 미보고 버그를 찾아냈다고 밝혔다.

AI
모델
읽기
2026년 7월 5일

OpenAI GeneBench-Pro - computational biology agents get a harder benchmark for research judgment

OpenAI가 computational biology용 research-level benchmark인 GeneBench-Pro를 공개했다. 10개 domain, 21개 sub-domain, 129문제로 구성되며 GPT-5.6 Sol은 high reasoning level에서 28.7%, Pro mode에서 31.5% pass rate를 기록했다.

AI
연구
읽기
2026년 7월 4일

Wafer GLM5.2 on AMD MI355X - ROCm inference narrows the CUDA deployment gap

Wafer가 AMD MI355X에서 GLM5.2를 서빙하며 20k input / 1k output, 60% cache-hit workload 기준 2,626 tok/s/node와 2.4 RPS, 단일 스트림 213 tok/s를 달성했다고 공개했다. 회사는 이 구성이 B200 측정치의 약 80% 성능이지만 비용은 Blackwell 대비 2배 이상 낮다고 주장한다.

AI
모델
읽기
2026년 7월 3일

Mistral OCR 4 - document parsing shifts from text extraction to structured AI ingestion

Mistral이 OCR 4를 공개했다. 이 모델은 텍스트 추출뿐 아니라 bounding boxes, typed block classification, inline confidence score를 함께 반환하며 170개 언어와 단일 컨테이너 self-hosting을 지원한다.

AI
모델
읽기
2026년 7월 3일

Apple reveals new AI architecture built around Google Gemini models

Apple은 오늘 Apple Intelligence 플랫폼의 대대적인 개편을 발표하여 Gemini 제품군의 기술을 사용하여 Google과 협력하여 개발된 기반 모델을 기반으로 구축된 새로운 아키텍처를 공개했습니다. The new architecture centers on Apple Foundation Models co-developed with Google, which Apple says…

트렌드
AI
읽기
2026년 7월 2일

Etched frontier inference clusters - transformer ASIC startup moves toward rack-scale production

Etched가 frontier inference cluster 전략을 공개하며 TSMC N4P A0 silicon, 첫 rack-scale product 검증, USD 1B 이상 demand, USD 800M 누적 조달을 밝혔다. 회사는 Low Voltage Inference와 Cluster Scale Memory를 통해 frontier model의 prefill·decode…

AI
산업
읽기
2026년 7월 2일

Gemma 4 12B: A unified, encoder-free multimodal model

고성능 다중 모드 인텔리전스를 노트북에 직접 제공하도록 설계된 모델인 Gemma 4 12B에 대한 개요입니다.

트렌드
AI
읽기
2026년 7월 1일

Claude Sonnet 5

코딩 및 일상적인 전문 작업을 위한 최고 수준의 인텔리전스를 갖춘 가장 강력한 Sonnet입니다.

트렌드
AI
읽기
2026년 6월 30일

Base44 Base1 - vibe-coding platforms chase vertical model ownership

Wix가 8천만 달러에 인수했던 Base44가 자연어 앱 생성 플랫폼을 위한 자체 AI 모델 Base1을 롤아웃하기 시작했다.

AI
개발도구
읽기
2026년 6월 30일

Every Eval Ever - fragmented AI benchmarks get a shared metadata layer

EvalEval Coalition이 Every Eval Ever를 공개해 AI 평가 결과를 하나의 공개 스키마와 데이터셋으로 모으고, Hugging Face Hub의 evaluation results 구조와 연결되는 기반을 제시했다.

AI
연구
읽기
2026년 6월 30일

Anthropic says Alibaba illicitly extracted Claude AI model capabilities

Anthropic says Alibaba illicitly extracted Claude AI model capabilities 소식의 핵심을 빠르게 정리하면, AI 모델 흐름에서 다음 변화를 미리 읽게 해주는 이슈입니다. 이 글에서는 사실 관계와 맥락, 그리고 실무자가 바로 참고할 포인트를 뉴스레터 톤으로 전달합니다.

트렌드
AI
읽기
2026년 6월 29일

OlmoLogic - Prolog-verifiable RLVR improves open logical reasoning

연구진은 2026년 6월 26일 Olmo-3 RLVR recipe에 inductive logic programming task를 통합한 OlmoLogic 7B Think를 공개했다. 56×H100에서 6일 동안 3,350 optimization step으로 학습했고, SLR-Bench accuracy를 15.1에서 45.1로 끌어올리며 held-out logic benchmark 평균도…

AI
모델
읽기
2026년 6월 29일

VLX-Go - lightweight vision-language waypoints for embodied navigation

Om AI Lab은 2026년 6월 28일 Hugging Face를 통해 VLX-Go를 공개했다. VLX-Go는 최근 monocular frame, 현재 관측, 자연어 instruction을 받아 robot controller가 실행할 short-horizon local waypoint를 예측하는 0.6B 규모 vision-language planner다.

AI
모델
읽기
2026년 6월 27일

DeepSpec - speculative decoding becomes an open production optimization stack

DeepSeek은 speculative decoding draft model을 훈련하고 평가하기 위한 MIT-licensed DeepSpec repository를 공개했다. README 기준 DeepSpec은 data preparation, draft model implementation, training, evaluation scripts를 포함하며 DSpark, DFlash,…

AI
오픈소스
읽기
2026년 6월 27일

GPT-5.6 Sol preview - frontier model releases become policy-gated infrastructure decisions

OpenAI는 2026년 6월 26일 GPT-5.6 series의 limited preview를 발표하며 Sol, Terra, Luna 3개 tier와 새로운 max reasoning effort, subagent 기반 ultra mode를 공개했다. Sol은 Terminal-Bench 2.1, GeneBench v1, ExploitBench, ExploitGym 같은 장시간…

AI
OpenAI
읽기
2026년 6월 26일

QHexRT - Qualcomm Hexagon NPU inference moves small LLMs fully on-device

RunAnywhereAI는 Qualcomm Hexagon NPU용 full-stack inference engine인 QHexRT를 공개했고, 첫 catalog entry로 Liquid AI의 LFM 2.5 230M을 지원한다. 발표는 decode graph, prefill graph, lm-head, embeddings까지 inference path의 모든 tensor가 HTP에 머무르며…

AI
개발도구
읽기
2026년 6월 25일

GLM-5.2 - open long-context models push agentic coding toward 1M-token workspaces

Z.AI는 GLM-5.2를 공개하며 1M-token context, flexible effort levels, MIT license, long-horizon coding benchmark 성능을 전면에 내세웠다. 공개 글은 IndexShare로 1M context에서 per-token FLOPs를 2.9x 줄이고, Terminal Bench 2.1 81.0, SWE-bench Pro…

AI
모델
읽기
2026년 6월 24일

FFASR Leaderboard - voice AI benchmarks move from clean speech to far-field reality

Hugging Face와 Treble Technologies는 Far-Field ASR(FFASR) Leaderboard를 공개해 ASR 모델을 reverberation, background noise, competing speech, room acoustics 같은 실제 far-field 조건에서 비교할 수 있게 했다. 기존 clean/near-field benchmark 중심 평가가…

AI
모델
읽기
2026년 6월 24일

Kog Laneformer 2B - latency-first coding models move architecture into the serving layer

Kog는 Hugging Face에 Laneformer 2B의 weights와 model code를 공개했다. 이 모델은 2.3B parameter instruction-tuned coding model로, Delayed Tensor Parallelism과 lane-structured Transformer를 통해 batch-size-one decoding latency를 모델 아키텍처…

AI
모델
읽기
2026년 6월 24일

Krea 2 technical report - open image models compete on creative control, not only fidelity

Krea는 Krea 2 technical report를 공개하며 K2 Raw와 K2 Turbo 계열의 open-weights text-to-image foundation model을 설명했다. 보고서는 data curation, diffusion transformer architecture, multi-stage training, prompt expander, style-reference…

AI
모델
읽기
2026년 6월 24일

NVIDIA NeMo AutoModel - MoE fine-tuning gets a drop-in performance path for Transformers

NVIDIA와 Hugging Face는 Transformers v5 위에서 NeMo AutoModel을 사용해 MoE fine-tuning을 가속하는 방법을 공개했다. NeMo AutoModel은 Expert Parallelism, DeepEP fused all-to-all dispatch, TransformerEngine kernels를 추가해 같은 from_pretrained() 계열…

AI
개발도구
읽기
2026년 6월 22일

PP-OCRv6 on Hugging Face - document AI stays specialized, small, and multilingual

PaddlePaddle은 Hugging Face에서 PP-OCRv6를 공개하며 1.5M, 7.7M, 34.5M parameter의 tiny/small/medium OCR tier를 제공한다고 밝혔다. medium/small tier는 50개 언어를 지원하고, medium은 자체 multi-scenario benchmark에서 detection Hmean 86.2%, recognition…

AI
모델
읽기
2026년 6월 19일

OpenAI AI chemist — GPT-5.4가 자동화 실험실과 결합해 Chan-Lam 수율을 개선

OpenAI와 Molecule.one은 2026년 6월 17일 GPT-5.4를 Maria AI/Lab과 연결한 near-autonomous chemistry workflow가 primary sulfonamide Chan-Lam coupling에서 TEMPO 계열 additive를 찾아 수율을 개선했다고 발표했다. Maria Lab은 OAI-M1-03에서 10,080개 반응을 실행했고, 최적…

AI
OpenAI
읽기
2026년 6월 9일

Claude Fable 5 — frontier model 공개가 capability race에서 guardrailed deployment 경쟁으로 이동

Anthropic은 2026년 6월 9일 Claude Fable 5를 공개하며, 그동안 제한적으로만 다뤘던 Mythos 계열 capability를 일반 사용자에게 부분 개방했다. 고위험 질의는 Opus 4.8로 자동 우회시키는 safeguard를 걸었고, 가격은 input 100만 토큰당 10달러, output 100만 토큰당 50달러로 제시했다.

AI
Claude
읽기
2026년 6월 8일

Introducing Mellum2 — software engineering용 small expert model 경쟁이 giant general model에서 low-latency control layer로 이동

JetBrains는 2026년 6월 1일 Mellum2를 공개했다. 이 모델은 text·code 특화 12B Mixture-of-Experts 구조를 사용하며 token당 2.5B만 활성화해, routing·RAG·summarization·sub-agent 같은 latency-sensitive workload에서 2배 이상 빠른 추론을 목표로 한다.

AI
오픈소스
읽기
2026년 6월 6일

Introducing Gemma 4 12B — local multimodal agent 실행이 16GB급 엣지 하드웨어로 내려오다

Google은 2026년 6월 3일 Gemma 4 12B를 공개했다. 이 모델은 vision·audio를 별도 encoder 없이 LLM backbone에 직접 투입하는 unified multimodal 구조를 채택했고, 16GB급 VRAM 또는 unified memory에서도 구동 가능하도록 설계됐으며, Apache 2.0 라이선스로 공개됐다.

AI
모델
읽기
2026년 6월 1일

Introducing Command A+ — sovereign enterprise AI가 폐쇄형 API 의존에서 배포 가능한 open model stack으로 이동

Cohere는 2026년 5월 20일 Command A+를 Apache 2.0으로 공개했다. 이 모델은 218B total·25B active의 MoE 구조, 128K 입력 컨텍스트, 텍스트·이미지·tool use를 지원하며 최소 2×H100 환경에서도 구동 가능한 enterprise용 open model이다.

AI
모델
읽기
2026년 6월 1일

NVIDIA Alpamayo 2 Super — autonomous driving이 perception stack에서 reasoning-first physical AI stack으로 이동

NVIDIA는 2026년 6월 1일 Alpamayo 2 Super를 공개했다. 이 모델은 32B 규모의 open reasoning vision-language-action model로, level 4 robotaxi 개발을 위해 perception·planning·action을 하나의 driving stack으로 묶고, 함께 AlpaGym·OmniDreams·NuRec 기반 agent…

AI
모델
읽기
2026년 5월 28일

Introducing Claude Opus 4.8 — 모델 경쟁이 지능 향상에서 장시간 agent workflow 신뢰성 경쟁으로 이동

Anthropic은 2026년 5월 28일 Claude Opus 4.8을 공개했다. Opus 4.7 대비 coding·agentic tasks·reasoning 성능을 개선했고, 가격은 유지한 채 Claude Code용 dynamic workflows 연구 프리뷰와 effort control도 함께 내놨다.

AI
Claude
읽기
2026년 4월 9일

Meta, Muse Spark 공개 — Meta AI를 'social-context aware' personal superintelligence로 재정의

Meta는 2026년 4월 8일 Meta Superintelligence Labs의 첫 모델 Muse Spark를 공개했다. 이 모델은 Meta AI 앱과 meta.ai를 즉시 구동하며, Instant/Thinking 모드, 병렬 subagent 실행, multimodal perception, visual coding, 향후 Instagram·Facebook·Threads 콘텐츠 인용…

AI
모델
읽기
2026년 4월 8일

Cursor, warp decode 공개 — Blackwell 기반 MoE 추론을 1.84x 가속하며 정확도도 개선

Cursor는 2026년 4월 6일 warp decode를 공개하며, Blackwell GPU에서 Mixture-of-Experts(MoE) decode 경로의 병렬화 축을 expert 중심에서 output 중심으로 뒤집어 1.84x throughput 향상과 FP32 기준 1.4x 더 높은 정확도를 얻었다고 밝혔다. 기존 expert-centric 경로의 8단계 중 5단계를 제거하고,…

AI
모델
읽기
2026년 4월 6일

AirLLM — 4GB GPU에서 70B LLM 돌리는 초경량 추론 라이브러리

양자화나 증류 없이 70B 모델을 4GB GPU에서, Llama 3.1 405B를 8GB VRAM에서 실행할 수 있는 추론 최적화 라이브러리. 계층별 모델 분해(layer-wise decomposition)로 필요한 레이어만 메모리에 로드하는 방식. 블록 단위 양자화 압축으로 3배 속도 향상. GitHub 스타 15k+.

오픈소스
무료
읽기
2026년 4월 5일

Google Gemma 4 공개 — Apache 2.0·256K 컨텍스트·멀티모달, 오픈 에이전틱 모델의 새 기준

Google이 4월 2~3일 Gemma 4를 Apache 2.0 라이선스로 공개했다. Effective 2B·4B·26B MoE·31B Dense 네 가지 크기로 제공되며, 256K 토큰 컨텍스트, 비전·오디오 네이티브 멀티모달, 140개 이상 언어를 지원한다.

트렌드
오픈소스
읽기
2026년 4월 5일

PrismML, Bonsai 1-bit LLM 출시 — 1GB 메모리로 8B 추론, 엣지 AI의 현실화

PrismML이 4월 3일 스텔스에서 등장해 세계 최초 상업적으로 실행 가능한 1-bit LLM 패밀리 Bonsai를 Apache 2.0으로 공개했다. 플래그십인 Bonsai 8B는 1.15GB 메모리에 구동되며, FP16 8B 모델 대비 14배 소형·8배 빠른 속도·5배 낮은 에너지 소비를 달성하면서 추론 품질은 동급 수준을 유지한다.

트렌드
오픈소스
읽기
2026년 4월 5일

Google TurboQuant — KV Cache 6배 압축·H100 어텐션 8배 가속, 정확도 손실 제로로 LLM 서빙 비용 구조 재정의

Google Research가 공개한 TurboQuant는 LLM의 KV Cache를 3비트로 압축하는 학습 불필요(training-free) 벡터 양자화 알고리즘이다. 메모리 사용량 6배 감소, NVIDIA H100 어텐션 연산 8배 가속을 정확도 손실 없이 달성하며 ICLR 2026에 발표된다.

트렌드
AI
읽기
2026년 4월 4일

Google Gemini 3.1 Flash Live 공개 — 실시간 음성 에이전트용 오디오 모델, ComplexFuncBench Audio 90.8%

Google은 2026년 3월 26일 Gemini 3.1 Flash Live를 공개하며 실시간 음성 대화용 모델을 Live API preview로 제공하기 시작했다. Google 발표에 따르면 이 모델은 ComplexFuncBench Audio에서 90.8%, Audio MultiChallenge에서 36.1%를 기록하며 다단계 함수 호출과 장기 오디오 추론 성능을 끌어올렸다.

트렌드
API
읽기
2026년 4월 3일

NVIDIA Blackwell Ultra, MLPerf Inference v6.0 신기록 — 288 GPU로 DeepSeek-R1 초당 249만 토큰 처리

NVIDIA Blackwell Ultra(GB300 NVL72 4시스템, 총 288 GPU)가 MLPerf Inference v6.0에서 DeepSeek-R1 오프라인 처리량 기준 초당 249만 토큰을 기록하며 6개월 전 대비 최대 2.77배 향상된 성능으로 전 카테고리를 석권했다. 이번 벤치마크에 Qwen3-VL-235B, GPT-OSS-120B, 텍스트-투-비디오(WAN-2.2) 등…

트렌드
AI
읽기
2026년 4월 3일

Arcee Trinity-Large-Thinking 출시 — 미국계 오픈 에이전트 모델이 가격 대비 frontier 경쟁력 제시

Arcee AI가 2026년 4월 1일 Trinity-Large-Thinking을 공개했다. Apache 2.0 오픈웨이트 reasoning 모델로, long-horizon agent와 multi-turn tool calling에 초점을 맞췄고 PinchBench에서 Opus 4.6 바로 아래 2위를 기록했다고 밝혔다.

AI
모델
읽기
2026년 4월 3일

Gemma 4 공개 — Apache 2.0 오픈 모델을 agentic workflow 중심으로 재정의

Google DeepMind가 2026년 4월 2일 Gemma 4를 공개했다. E2B, E4B, 26B MoE, 31B Dense 네 가지 크기로 출시됐고, Apache 2.0 라이선스 아래 reasoning, function calling, JSON output, vision/audio 입력까지 지원한다.

AI
모델
읽기
2026년 4월 3일

Microsoft, MAI 모델 3종 출시 — Foundry를 독자 멀티모달 모델 유통 채널로 본격 전환

Microsoft가 2026년 4월 2일 MAI-Transcribe-1, MAI-Voice-1, MAI-Image-2를 공개했다. 세 모델은 Microsoft Foundry와 MAI Playground에서 즉시 사용 가능하며, MAI-Transcribe-1은 상위 25개 언어 대상 음성 인식, MAI-Voice-1은 1초에 60초 분량 음성 생성, MAI-Image-2는 Copilot과…

AI
모델
읽기
2026년 4월 2일

Alibaba Qwen3.6-Plus 공개 — 1M 컨텍스트·에이전트 코딩, Claude Opus 4.5 수준 달성

Alibaba가 2026년 4월 2일 Qwen3.6-Plus를 공개했다. 기본 1M 토큰 컨텍스트 윈도우와 멀티모달 네이티브 지원, 리포지토리 수준 코딩 에이전트 기능을 갖췄으며, SWE-bench와 Terminal-Bench 2.0에서 Anthropic Claude Opus 4.5와 동등한 성능을 기록했다.

AI
모델
읽기
2026년 4월 2일

Google Gemini 3.1 Flash-Lite 출시 — Pro 대비 1/8 가격에 Gemini 2.5 Flash 동등 성능

Google이 Gemini 3.1 Flash-Lite를 개발자 프리뷰로 출시했다. 입력 $0.25/1M 토큰(Pro의 1/8 수준), 출력 $1.50/1M 토큰이며, Gemini 2.5 Flash 대비 Time to First Token 2.5배 향상, 출력 속도 45% 향상을 달성하면서 핵심 성능 지표에서는 Gemini 2.5 Flash와 동등하다.

AI
모델
읽기
2026년 4월 2일

PrismML Bonsai — 세계 최초 상용 가능 1-bit LLM, iPhone에서 44 tok/s 달성

PrismML이 2026년 3월 31일 세계 최초로 상용 수준 1-bit LLM 'Bonsai' 시리즈를 공개했다. 8B·4B·1.7B 세 가지 모델을 Apache 2.0 라이센스로 무료 배포하며, 기존 FP16 대비 메모리를 14배 절감하고 추론 속도를 8배 높이면서도 동급 모델과 동일한 벤치마크 성능을 유지한다.

AI
오픈소스
읽기
2026년 4월 1일

NVIDIA Nemotron 3 Super — 120B MoE 오픈소스 에이전트 모델, SWE-Bench 60.5% 달성

NVIDIA가 에이전트 워크로드 특화 오픈소스 모델 Nemotron 3 Super를 공개했다. Mamba-Transformer 하이브리드 MoE 아키텍처로 원래 1,200억 파라미터에서 활성 파라미터 120억만 사용, SWE-Bench Verified 60.47% 및 PinchBench 85.6%로 동급 오픈소스 최고 성능을 기록했다.

트렌드
오픈소스
읽기
2026년 4월 1일

Google TurboQuant — LLM KV 캐시 메모리 6배 압축, H100에서 8배 속도 향상

Google Research가 LLM의 KV 캐시 메모리를 6배 압축하면서 정확도 손실이 없는 알고리즘 TurboQuant를 공개했다. 16비트에서 3비트로의 훈련 없는(training-free) 압축으로 NVIDIA H100에서 최대 8배의 어텐션 연산 속도 향상을 달성하며, ICLR 2026 발표 예정이다.

트렌드
AI
읽기
2026년 4월 1일

GPT-5.4 출시 — 추론·코딩·에이전트 통합 모델, OSWorld-V 인간 기준선 AI 최초 초과

OpenAI가 3월 5일 GPT-5.4를 출시했다. GPT-5.3 Codex의 코딩 역량을 메인라인 추론 모델에 통합한 것으로, 100만 토큰 컨텍스트 윈도우와 멀티스텝 에이전트 워크플로우 자율 실행 능력을 탑재했다. 실제 데스크톱 생산성 태스크를 시뮬레이션하는 OSWorld-V 벤치마크에서 75%를 기록, 인간 기준선(72.4%)을 AI 최초로 초과했다.

AI
모델
읽기
2026년 4월 1일

OpenAI, 최초 오픈웨이트 모델 gpt-oss-120b 공개 — Apache 2.0, o4-mini 수준 추론 성능

OpenAI가 처음으로 오픈웨이트 모델인 gpt-oss-120b(117B 파라미터, MoE)와 gpt-oss-20b를 Apache 2.0 라이선스로 공개했다. 단일 80GB GPU에서 실행 가능하며, 코딩·수학·툴 사용에서 o4-mini와 동등하거나 일부 초과한다.

AI
오픈소스
읽기
2026년 3월 31일

Google TurboQuant — KV 캐시를 3비트로 6배 압축, 재학습 없이 H100에서 8배 처리량

Google의 TurboQuant가 ICLR 2026에서 발표될 예정이다. LLM의 KV 캐시를 3~4비트로 압축해 메모리를 4~6배 절감하면서 정확도 손실이 전혀 없고, H100 GPU에서 32-bit 대비 최대 8배 처리량 향상을 달성한다.

AI
모델
읽기
2026년 3월 31일

GPT-5.4 출시 — 컴퓨터 사용 에이전트로 인간 기준선(OSWorld 72%) 돌파

OpenAI는 3월 29일 GPT-5.4를 출시했다. 컴퓨터 사용(computer use)을 핵심 역량으로 탑재하여 OSWorld-Verified 벤치마크에서 75%를 기록, 인간 평균(72%)을 처음으로 추월했다.

AI
모델
읽기
2026년 3월 31일

Mistral Voxtral TTS — 4B 오픈소스 음성 합성 모델, ElevenLabs 대비 7~9배 저렴

Mistral AI가 3월 26일 오픈소스 텍스트-음성 변환 모델 Voxtral TTS(4B 파라미터)를 출시했다. 9개 언어를 지원하고 5초 이하의 음성 샘플로 목소리를 복제하며, 첫 오디오 출력 지연(TTFA)이 90ms에 불과해 실시간 음성 에이전트 구현이 가능하다.

AI
모델
읽기
2026년 3월 31일

NVIDIA Nemotron 3 Super — 120B Mamba-Transformer MoE 오픈 에이전트 모델, 이전 대비 5배 처리량

NVIDIA가 에이전트 AI 특화 오픈 모델 Nemotron 3 패밀리를 출시했다. 플래그십인 Nemotron 3 Super는 120B 파라미터(활성 12B)의 Mamba-Transformer MoE 하이브리드 아키텍처를 채택해 Nemotron 2 대비 5배 처리량을 달성하고 1M 토큰 컨텍스트 윈도우를 지원한다.

AI
모델
읽기
2026년 3월 31일

Google TurboQuant — LLM KV 캐시 3.5비트 압쳙으로 메모리 6배 절감, 오픈소스 공개

Google이 LLM의 KV-캐시를 채널당 3.5비트로 압쳙하는 오픈소스 양자화 기법 TurboQuant를 공개했다. 메모리 사용량을 최대 6배 줄이고 추론 속도를 대폭 향상시킨다.

AI
모델
읽기
2026년 3월 31일

OpenAI, $1,200억 역대 최대 평더링 완료 — Amazon $500억 주도, 기업가치 $7,300억 돌파

OpenAI가 Amazon $500억, Nvidia·SoftBank 각 $300억 등으로 구성된 총 $1,200억 평더링 라운드를 마무리했다. Pre-money 기업가치 $7,300억으로, 2026년 AI 산업 내 최대 단일 투자 이벤트다.

AI
OpenAI
읽기
2026년 3월 31일

Anthropic Mythos 유출 — 코딩·사이버보안 SOTA, "역량의 단계적 도약" 확인

Anthropicが내부 테스트 중이던 신규 모델 'Mythos(Claude Mythos/Opus 5)'가 데이터 유출로 공개됐다. 소프트웨어 코딩, 학술 추론, 사이버보안 영역에서 Claude Opus 4.6 대비 "극적으로 높은 점수"를 기록한 것으로 알려졌다.

AI
모델
읽기
읽을거리로 돌아가기