PickleeAI와 개발, 오늘 볼 변화만
홈읽을거리아카이브
검색

Picklee

AI와 개발 현장에서 오늘 확인할 변화만 선별합니다.

© 2026 Picklee. All rights reserved.

RSSSitemap

주제

#오픈소스

77개 읽을거리를 모았습니다.
2026년 7월 28일

Moonshot AI, Kimi K3 공개 weights 배포: 2.8T MoE의 실제 serving 경로 확인

Moonshot AI가 Hugging Face에 Kimi K3의 full weights를 Kimi K3 License로 공개했다. 2.8T total / 104B activated parameter의 native multimodal MoE 모델로, 1M-token context, 896개 expert 중 16개 선택, MXFP4 weight·MXFP8 activation 기반 QAT를…

AI
모델
읽기
2026년 7월 28일

NVIDIA·업계, Open Secure AI Alliance 출범: 공개 방어 스택·NOOA 추진

NVIDIA와 Hugging Face·Microsoft·Cloudflare·CrowdStrike 등은 Open Secure AI Alliance를 출범시켰다. 오픈 모델·harness·보안 도구를 함께 개발·공개해 AI agent 시대의 취약점 대응, red teaming, 평가와 방어 자동화를 강화하겠다는 구상이며 NVIDIA는 NOOA(Object-Oriented Agent)…

AI
오픈소스
읽기
2026년 7월 27일

Google Cloud, k8s-aibom 오픈소스화: 런타임 ML-BOM 자동 생성

Google Cloud는 GKE용 오픈소스 Kubernetes controller k8s-aibom을 공개했다. 이 도구는 cluster API와 container environment를 모니터링해 vLLM·Triton 같은 실행 중 AI runtime을 탐지하고, CycloneDX 1.6 Machine Learning Bill of Materials(ML-BOM)를 자동 생성한다.

AI
오픈소스
읽기
2026년 7월 27일

NVIDIA, Cosmos 3 Edge 공개: 4B 온디바이스 Physical AI 모델

NVIDIA는 Cosmos 3 Edge를 공개했다. Nemotron 기반 4B 모델로, NVIDIA Jetson Thor 등 엣지 컴퓨터에서 vision reasoning과 로봇 action 생성을 로컬로 수행하도록 설계됐으며 Cosmos 3 오픈 월드 모델 계열의 edge 배포판이다.

AI
모델
읽기
2026년 7월 17일

Moonshot, 2.8T Kimi K3 공개…7월 27일 full weights 배포

Moonshot AI가 7월 17일 2.8T-parameter, 1M-token context의 Kimi K3를 Kimi·Kimi Work·Kimi Code·Kimi API에 공개했다. Kimi Delta Attention과 Attention Residuals를 적용한 MoE 구조로, 896개 expert 중 16개를 활성화하며 full model weights는 7월 27일 공개할…

AI
모델
읽기
2026년 7월 17일

Thinking Machines, 975B MoE 오픈 웨이트 Inkling 공개

Thinking Machines Lab가 7월 15일 975B total·41B active parameter의 MoE 모델 Inkling을 full weights로 공개했다. 최대 1M-token context와 text·image·audio native reasoning을 지원하며, 45T token의 text·image·audio·video 데이터로 pretraining됐다.…

AI
모델
읽기
2026년 7월 16일

Prime Intellect, 오픈형 agentic RL 스택 확장에 USD 130M Series A

Prime Intellect가 7월 8일 Radical Ventures 주도로 USD 130M Series A를 유치해 누적 자금이 USD 150M을 넘었다고 발표했다. 회사는 compute, large-scale RL, environments, sandboxes, evals, deployment를 묶은 스택을 제공하며 6,000곳 이상 고객과 USD 100M 이상의 annualized…

AI
에이전트
읽기
2026년 7월 15일

Google, Qwen 3.5-397B MoE를 Ironwood TPU에서 최적화: prefill 최대 4.7배 향상

Google for Developers는 397B-parameter Qwen 3.5 MoE를 Ironwood TPU v7x에서 서빙하기 위한 최적화 사례를 공개했다. 17B active parameters/token의 희소 모델을 대상으로 DP+EP 병렬화, JAX/Pallas 커널, 통신 fusion을 적용해 2026년 4~6월 사이 decode-heavy 성능은 약 3.1배,…

AI
모델
읽기
2026년 7월 13일

GitLost: We Tricked GitHub's AI Agent into Leaking Private Repos

요약: Noma Labs는 GitHub의 새로운 Agentic Workflows에서 중요한 프롬프트 주입 취약점을 발견했습니다. 이를 통해 인증되지 않은 공격자가 비공개 저장소와 동일한 조직에 속한 공개 저장소에 조작된 GitHub 문제를 게시하여 비공개 저장소에서 자동으로 데이터를 가져올 수 있습니다. 수암…

트렌드
AI
읽기
2026년 7월 11일

Show HN: Getting GLM 5.2 running on my slow computer

25GB RAM 소비자 컴퓨터에서 GLM-5.2(744B MoE)를 실행하세요. 순수 C, 제로 깊이, 전문가가 디스크에서 스트리밍합니다. 작은 엔진, 거대한 모델. 🐦 - JustVugg/colibri

트렌드
AI
읽기
2026년 7월 6일

Jamesob's guide to running SOTA LLMs locally

로컬에서 LLM을 운영하는 것에 대해 내가 아는 모든 것. GitHub에 계정을 만들어 jamesob/local-llm 개발에 기여하세요.

트렌드
AI
읽기
2026년 7월 5일

Leanstral 1.5 - open proof-engineering model moves formal verification toward practical code review

Mistral이 Lean 4 기반 proof engineering 모델 Leanstral 1.5를 공개했다. Apache-2.0 라이선스의 119B total / 6B active parameter 모델이며 miniF2F 100%, PutnamBench 587/672, FATE-H 87%, FATE-X 34%를 기록하고 57개 오픈소스 저장소 테스트에서 5개 미보고 버그를 찾아냈다고 밝혔다.

AI
모델
읽기
2026년 7월 1일

Godot AI code policy - OSS maintainers draw a hard review boundary

Godot Engine은 AI-generated code contribution을 허용하지 않는 정책을 공식화했다. 핵심 이유는 저작권 불확실성보다 유지보수자가 provenance, license contamination, subtle bug를 검증해야 하는 review burden이 과도하게 커진다는 점이다.

AI
개발도구
읽기
2026년 6월 30일

Every Eval Ever - fragmented AI benchmarks get a shared metadata layer

EvalEval Coalition이 Every Eval Ever를 공개해 AI 평가 결과를 하나의 공개 스키마와 데이터셋으로 모으고, Hugging Face Hub의 evaluation results 구조와 연결되는 기반을 제시했다.

AI
연구
읽기
2026년 6월 29일

OlmoLogic - Prolog-verifiable RLVR improves open logical reasoning

연구진은 2026년 6월 26일 Olmo-3 RLVR recipe에 inductive logic programming task를 통합한 OlmoLogic 7B Think를 공개했다. 56×H100에서 6일 동안 3,350 optimization step으로 학습했고, SLR-Bench accuracy를 15.1에서 45.1로 끌어올리며 held-out logic benchmark 평균도…

AI
모델
읽기
2026년 6월 29일

VLX-Go - lightweight vision-language waypoints for embodied navigation

Om AI Lab은 2026년 6월 28일 Hugging Face를 통해 VLX-Go를 공개했다. VLX-Go는 최근 monocular frame, 현재 관측, 자연어 instruction을 받아 robot controller가 실행할 short-horizon local waypoint를 예측하는 0.6B 규모 vision-language planner다.

AI
모델
읽기
2026년 6월 27일

DeepSpec - speculative decoding becomes an open production optimization stack

DeepSeek은 speculative decoding draft model을 훈련하고 평가하기 위한 MIT-licensed DeepSpec repository를 공개했다. README 기준 DeepSpec은 data preparation, draft model implementation, training, evaluation scripts를 포함하며 DSpark, DFlash,…

AI
오픈소스
읽기
2026년 6월 25일

GLM-5.2 - open long-context models push agentic coding toward 1M-token workspaces

Z.AI는 GLM-5.2를 공개하며 1M-token context, flexible effort levels, MIT license, long-horizon coding benchmark 성능을 전면에 내세웠다. 공개 글은 IndexShare로 1M context에서 per-token FLOPs를 2.9x 줄이고, Terminal Bench 2.1 81.0, SWE-bench Pro…

AI
모델
읽기
2026년 6월 24일

Kog Laneformer 2B - latency-first coding models move architecture into the serving layer

Kog는 Hugging Face에 Laneformer 2B의 weights와 model code를 공개했다. 이 모델은 2.3B parameter instruction-tuned coding model로, Delayed Tensor Parallelism과 lane-structured Transformer를 통해 batch-size-one decoding latency를 모델 아키텍처…

AI
모델
읽기
2026년 6월 24일

Krea 2 technical report - open image models compete on creative control, not only fidelity

Krea는 Krea 2 technical report를 공개하며 K2 Raw와 K2 Turbo 계열의 open-weights text-to-image foundation model을 설명했다. 보고서는 data curation, diffusion transformer architecture, multi-stage training, prompt expander, style-reference…

AI
모델
읽기
2026년 6월 24일

NVIDIA NeMo AutoModel - MoE fine-tuning gets a drop-in performance path for Transformers

NVIDIA와 Hugging Face는 Transformers v5 위에서 NeMo AutoModel을 사용해 MoE fine-tuning을 가속하는 방법을 공개했다. NeMo AutoModel은 Expert Parallelism, DeepEP fused all-to-all dispatch, TransformerEngine kernels를 추가해 같은 from_pretrained() 계열…

AI
개발도구
읽기
2026년 6월 23일

huggingface_hub weekly release CI - open-weight agents make release automation auditable

Hugging Face는 huggingface_hub를 4-6주 주기에서 weekly release로 바꾼 GitHub Actions 기반 release pipeline을 공개했다. OpenCode, GLM-5.2 open-weight model, HF Inference Providers, PyPI Trusted Publishing을 사용하되, release notes와…

AI
오픈소스
읽기
2026년 6월 23일

OpenAI Patch the Planet - AI-assisted security needs maintainer-controlled remediation loops

OpenAI는 Trail of Bits와 함께 Patch the Planet을 공개해 cURL, NATS Server, pyca/cryptography, Sigstore, aiohttp, Go, Python 등 주요 OSS 프로젝트에 AI-assisted security research와 human expert review를 결합한다. Daybreak/Codex Security 흐름은…

AI
OpenAI
읽기
2026년 6월 22일

Intel XPU Kernel Skill - coding agents optimize Triton kernels beyond CUDA-first defaults

Intel DCG AI Software와 OCTO Parallel Computing Lab은 Hugging Face Kernel Hub용 Intel XPU Kernel Skill을 공개했다. Xe-Forge 기반 CoVeR loop는 LLM이 Triton kernel을 생성, 검증, benchmark, refine하도록 만들며 Arc Pro B70에서 KernelBench Level-2…

AI
개발도구
읽기
2026년 6월 22일

PP-OCRv6 on Hugging Face - document AI stays specialized, small, and multilingual

PaddlePaddle은 Hugging Face에서 PP-OCRv6를 공개하며 1.5M, 7.7M, 34.5M parameter의 tiny/small/medium OCR tier를 제공한다고 밝혔다. medium/small tier는 50개 언어를 지원하고, medium은 자체 multi-scenario benchmark에서 detection Hmean 86.2%, recognition…

AI
모델
읽기
2026년 6월 22일

Reflection-SpaceX compute deal - open-source frontier AI hits a capacity wall

Nvidia-backed Reflection AI가 SpaceXAI의 Colossus 2 compute에 접근하는 대형 계약을 체결한 것으로 보도됐다. 계약 구조는 2026년 7월 1일부터 2029년까지 월 1.5억 달러, 총 약 USD 6.3B 규모로 알려졌고, Reflection은 GB300급 compute를 확보해 open-source frontier model 경쟁을 이어가려 한다.

AI
산업
읽기
2026년 6월 20일

JEP 401 Value Classes — Java object model이 identity-free domain value로 이동한다

OpenJDK JEP 401은 Java에 value classes and objects를 preview feature로 도입해, final fields만 갖고 object identity가 없는 domain value 프로그래밍 모델을 제공한다. 최근 Project Valhalla의 JDK 28 target 보도와 함께 Java의 장기 성능 병목인 객체 identity overhead가…

개발도구
트렌드
읽기
2026년 6월 12일

OpenEnv committee launch — open agent training이 harness별 튜닝에서 공유 environment protocol로 이동

Hugging Face는 2026년 6월 8일 OpenEnv가 Meta-PyTorch, Nvidia, Modal, Prime Intellect, Unsloth 등과 함께 위원회 기반 프로젝트로 전환됐다고 발표했다. OpenEnv는 터미널, 브라우저 등 agent execution environment를 표준 인터페이스로 노출하는 레이어로 정의되며,…

AI
에이전트
읽기
2026년 6월 10일

Cloudflare acquires VoidZero — AI 코딩 시대의 배포 스택이 framework 선택에서 execution path 통합으로 이동

Cloudflare는 2026년 6월 5일 Vite 생태계를 이끄는 VoidZero를 인수한다고 밝혔다. Vite, Vitest, Rolldown, Oxc를 Workers 플랫폼과 더 깊게 결합하고, D1·R2 같은 인프라를 intent-based 방식으로 자동 프로비저닝하는 방향을 제시했다.

AI
개발도구
읽기
2026년 6월 8일

Introducing Mellum2 — software engineering용 small expert model 경쟁이 giant general model에서 low-latency control layer로 이동

JetBrains는 2026년 6월 1일 Mellum2를 공개했다. 이 모델은 text·code 특화 12B Mixture-of-Experts 구조를 사용하며 token당 2.5B만 활성화해, routing·RAG·summarization·sub-agent 같은 latency-sensitive workload에서 2배 이상 빠른 추론을 목표로 한다.

AI
오픈소스
읽기
2026년 6월 7일

Ollama 0.30 — local AI 배포 경쟁이 모델 자체에서 runtime 호환성과 GPU 보편성으로 이동

Ollama는 2026년 6월 5일 Ollama 0.30을 공개하며 GGUF 호환성과 llama.cpp 통합을 강화했다. 발표에 따르면 NVIDIA GPU에서 최대 20% 빠른 처리량을 제공하고, Vulkan을 기본 활성화해 AMD·Intel까지 GPU 가속 범위를 넓혔으며, LFM·Prism·Unsloth 계열을 포함한 더 많은 모델을 즉시 실행할 수 있게 했다.

AI
오픈소스
읽기
2026년 6월 6일

IBM and Red Hat Project Lightwell — open source AI 시대의 공급망 보안이 clearinghouse 모델로 재편

IBM과 Red Hat은 2026년 5월 28일 Project Lightwell을 발표하며 open source software 보안을 위해 50억 달러와 2만 명 이상의 엔지니어를 투입하겠다고 밝혔다. 이 프로젝트는 enterprise clearinghouse를 통해 취약점 신고, 검증된 패치 배포, upstream disclosure를 조율하고 AI 기반 검증·테스트를 결합하는 모델이다.

AI
오픈소스
읽기
2026년 6월 6일

Introducing Gemma 4 12B — local multimodal agent 실행이 16GB급 엣지 하드웨어로 내려오다

Google은 2026년 6월 3일 Gemma 4 12B를 공개했다. 이 모델은 vision·audio를 별도 encoder 없이 LLM backbone에 직접 투입하는 unified multimodal 구조를 채택했고, 16GB급 VRAM 또는 unified memory에서도 구동 가능하도록 설계됐으며, Apache 2.0 라이선스로 공개됐다.

AI
모델
읽기
2026년 6월 5일

Supabase Series F — vibe coding이 backend를 demo layer에서 agentic production substrate로 밀어올리다

Supabase는 2026년 6월 5일 보도 기준 5억 달러 Series F를 유치했고, valuation은 약 105억 달러 post-money 수준으로 뛰었다. TechCrunch 보도에 따르면 지난 1년 사용량은 600% 이상 성장했고, 신규 database의 60% 이상이 어떤 형태로든 AI tool에 의해 생성되고 있으며, 사용자 수는 1천만 명에 근접했다.

AI
산업
읽기
2026년 6월 4일

Redis Iris — agent stack이 prompt tuning에서 context engine 아키텍처로 이동

Redis는 2026년 5월 18일 Redis Iris를 발표하며 agent failure의 핵심 원인을 모델 성능이 아니라 context layer의 분산·지연·낙후 문제로 규정했다. Iris는 Context Retriever, Agent Memory, Data Integration, LangCache, Redis Search 다섯 요소를 묶어…

AI
에이전트
읽기
2026년 6월 1일

Introducing Command A+ — sovereign enterprise AI가 폐쇄형 API 의존에서 배포 가능한 open model stack으로 이동

Cohere는 2026년 5월 20일 Command A+를 Apache 2.0으로 공개했다. 이 모델은 218B total·25B active의 MoE 구조, 128K 입력 컨텍스트, 텍스트·이미지·tool use를 지원하며 최소 2×H100 환경에서도 구동 가능한 enterprise용 open model이다.

AI
모델
읽기
2026년 6월 1일

NVIDIA Alpamayo 2 Super — autonomous driving이 perception stack에서 reasoning-first physical AI stack으로 이동

NVIDIA는 2026년 6월 1일 Alpamayo 2 Super를 공개했다. 이 모델은 32B 규모의 open reasoning vision-language-action model로, level 4 robotaxi 개발을 위해 perception·planning·action을 하나의 driving stack으로 묶고, 함께 AlpaGym·OmniDreams·NuRec 기반 agent…

AI
모델
읽기
2026년 5월 31일

Introducing Trusted Remote Execution: Policy-Enforced Scripts for AI Agents and Humans

AWS는 2026년 5월 4일 Trusted Remote Execution(Rex)을 오픈소스로 공개했다. Rex는 Rhai 스크립트가 host에 직접 접근하지 못하게 하고, 모든 시스템 작업을 Cedar policy로 승인한 뒤에만 실행하는 runtime으로, AI agent가 만든 스크립트도 동일한 정책 경계 안에서 동작한다.

AI
오픈소스
읽기
2026년 5월 30일

Introducing Search Toolkit — agent retrieval 경쟁이 RAG 데모에서 검색 파이프라인 운영력으로 이동

Mistral은 2026년 5월 28일 Search Toolkit을 public preview로 공개했다. 이 오픈소스 프레임워크는 ingestion, retrieval, evaluation을 하나의 공통 인터페이스로 묶고, BM25·dense retrieval·hybrid search와 recall, precision, MRR, NDCG 평가를 함께 제공한다.

AI
개발도구
읽기
2026년 5월 29일

Arm open-sources Metis — AI 보안 검증이 규칙 기반 스캐너에서 repo-context reasoning으로 이동

Arm은 2026년 5월 28일 Metis를 오픈소스로 공개했다. Metis는 source code·build files·documentation을 함께 읽는 RAG 기반 agentic AI security framework로, Arm 내부 130개 이상 소프트웨어 프로젝트에서 사용 중이며 true positive는 최대 10배 높이고 false positive는 약 50% 줄였다고 밝혔다.

AI
오픈소스
읽기
2026년 5월 29일

Linux Foundation launches DNS-AID — agent discovery 경쟁이 중앙 레지스트리에서 DNS 기반 개방 표준으로 이동

Linux Foundation은 2026년 5월 27일 DNS-AID 프로젝트를 공개했다. 이 프로젝트는 DNS 인프라를 활용해 AI agents와 MCP servers를 publish, discover, verify할 수 있게 하는 오픈소스 reference implementation으로, Python SDK·CLI·MCP server를 함께 제공한다.

AI
에이전트
읽기
2026년 5월 28일

Warp is now open-source — agentic development 도구 경쟁이 폐쇄형 제품에서 공개형 orchestrated workflow로 이동

Warp는 2026년 4월 28일 Warp client를 AGPL로 오픈소스화하고, 커뮤니티가 Oz 기반 agent-first workflow로 제품 개발에 참여할 수 있다고 발표했다. 동시에 Kimi·MiniMax·Qwen 같은 오픈 모델 지원, auto (open) model routing, 설정 파일 공개도 함께 내놨다.

AI
개발도구
읽기
2026년 4월 8일

Show HN: I built a tiny LLM to demystify how language models work

작은 물고기처럼 말하는 ~9M 매개변수 LLM입니다. GitHub에 계정을 만들어 arman-bd/guppylm 개발에 기여하세요.

트렌드
AI
읽기
2026년 4월 8일

awesome-design-md — AI 에이전트를 위한 디자인 시스템 컬렉션

Google Stitch의 DESIGN 문서 개념을 바탕으로, 유명 서비스의 시각 언어를 Markdown으로 정리해 AI 코딩 에이전트가 유사한 UI를 구현하도록 돕는 오픈소스 컬렉션. 공식 디자인 시스템이 아니라 공개 웹사이트를 바탕으로 추출한 비공식 레퍼런스라는 점이 핵심이다.

AI
오픈소스
읽기
2026년 4월 7일

Issue: Claude Code is unusable for complex engineering tasks with Feb updates

실행 전 체크리스트 비슷한 행동 보고서를 찾기 위해 기존 문제를 검색했습니다. 이 보고서에는 민감한 정보(API 키, 비밀번호 등)가 포함되어 있지 않습니다. 행동 유형 문제 기타 예상치 못한...

트렌드
AI
읽기
2026년 4월 6일

Hugging Face State of Open Source Spring 2026 — 오픈 모델 경쟁의 무게중심이 미국 중심에서 다극·주권형 생태계로 이동

Hugging Face가 2026년 3월 17일 공개한 Spring 2026 리포트에 따르면, 플랫폼은 1,300만 사용자·200만 개 이상의 공개 모델·50만 개 이상의 공개 데이터셋으로 커졌고, 중국 모델이 전체 다운로드의 41%를 차지하며 미국을 추월했다. 동시에 Qwen 계열 파생 모델은 11.3만 개를 넘었고, 1~9B급 소형 모델이 실제 배포에서 대형 모델보다 훨씬 높은 채택을…

AI
트렌드
읽기
2026년 4월 6일

AirLLM — 4GB GPU에서 70B LLM 돌리는 초경량 추론 라이브러리

양자화나 증류 없이 70B 모델을 4GB GPU에서, Llama 3.1 405B를 8GB VRAM에서 실행할 수 있는 추론 최적화 라이브러리. 계층별 모델 분해(layer-wise decomposition)로 필요한 레이어만 메모리에 로드하는 방식. 블록 단위 양자화 압축으로 3배 속도 향상. GitHub 스타 15k+.

오픈소스
무료
읽기
2026년 4월 5일

Claw Code, Claude Code 소스 유출 계기로 등장한 오픈소스 AI 코딩 에이전트 — 출시 1주일 만에 GitHub 100K stars

3월 31일 Anthropic Claude Code의 TypeScript 소스코드 약 51만 2천 줄이 npm 레지스트리에 실수로 노출된 사건을 계기로, 개발자 Sigrid Jin이 클린룸 방식으로 오픈소스 AI 코딩 에이전트 프레임워크 Claw Code를 출시했다. 출시 첫날 72,000 GitHub stars를 기록하고 일주일 만에 100K를 돌파하며 역사상 가장 빠르게 성장한 AI…

트렌드
오픈소스
읽기
2026년 4월 5일

Google Gemma 4 공개 — Apache 2.0·256K 컨텍스트·멀티모달, 오픈 에이전틱 모델의 새 기준

Google이 4월 2~3일 Gemma 4를 Apache 2.0 라이선스로 공개했다. Effective 2B·4B·26B MoE·31B Dense 네 가지 크기로 제공되며, 256K 토큰 컨텍스트, 비전·오디오 네이티브 멀티모달, 140개 이상 언어를 지원한다.

트렌드
오픈소스
읽기
2026년 4월 5일

PrismML, Bonsai 1-bit LLM 출시 — 1GB 메모리로 8B 추론, 엣지 AI의 현실화

PrismML이 4월 3일 스텔스에서 등장해 세계 최초 상업적으로 실행 가능한 1-bit LLM 패밀리 Bonsai를 Apache 2.0으로 공개했다. 플래그십인 Bonsai 8B는 1.15GB 메모리에 구동되며, FP16 8B 모델 대비 14배 소형·8배 빠른 속도·5배 낮은 에너지 소비를 달성하면서 추론 품질은 동급 수준을 유지한다.

트렌드
오픈소스
읽기
2026년 4월 5일

Google TurboQuant — KV Cache 6배 압축·H100 어텐션 8배 가속, 정확도 손실 제로로 LLM 서빙 비용 구조 재정의

Google Research가 공개한 TurboQuant는 LLM의 KV Cache를 3비트로 압축하는 학습 불필요(training-free) 벡터 양자화 알고리즘이다. 메모리 사용량 6배 감소, NVIDIA H100 어텐션 연산 8배 가속을 정확도 손실 없이 달성하며 ICLR 2026에 발표된다.

트렌드
AI
읽기
2026년 4월 5일

Agency Swarm — 조직형 멀티에이전트 오케스트레이션 프레임워크

OpenAI Agents SDK 위에 올려진 멀티에이전트 프레임워크. 역할별 에이전트와 communication flow를 명시적으로 정의해 조직처럼 협업시키는 데 초점이 있다.

AI
오픈소스
읽기
2026년 4월 5일

Agno — 프레임워크·런타임·컨트롤 플레인을 묶은 에이전트 스택

multi-agent 시스템을 구축·실행·관리하는 전체 스택. framework, AgentOS runtime, control plane을 함께 제공해 프로덕션 지향성이 강하다.

AI
오픈소스
읽기
2026년 4월 5일

AutoGen — Microsoft의 멀티에이전트 프로그래밍 프레임워크

Microsoft가 만드는 agentic AI 프레임워크. 여러 에이전트가 자율적으로 또는 인간과 함께 협업하는 구조를 코드로 만들 수 있다.

AI
오픈소스
읽기
2026년 4월 5일

AutoGPT — 지속 실행형 AI 에이전트 플랫폼

지속 실행형 AI 에이전트를 만들고 배포하는 대표 오픈소스 프로젝트. 단일 데모 에이전트가 아니라 플랫폼·서버·마켓플레이스·벤치마크까지 묶인 생태계로 확장됐다.

AI
오픈소스
읽기
2026년 4월 5일

browser-use — 웹사이트를 AI 에이전트용 인터페이스로 바꾸는 브라우저 자동화

웹사이트를 AI 에이전트가 조작할 수 있게 해주는 브라우저 자동화 오픈소스. 사람이 브라우저로 하던 클릭·입력·탐색을 agent workflow에 연결하는 데 강하다.

AI
오픈소스
읽기
2026년 4월 5일

CrewAI — 역할 기반 멀티에이전트 협업 프레임워크

각 agent에 역할을 부여하고 crew 단위로 협업시키는 Python 프레임워크. LangChain에 의존하지 않는 독립 구조와 비교적 쉬운 진입점으로 인기가 높다.

AI
오픈소스
읽기
2026년 4월 5일

Dify — 워크플로·RAG·에이전트를 묶은 프로덕션 플랫폼

시각적 워크플로, RAG, agent 기능, observability를 한데 묶은 오픈소스 플랫폼. 빠르게 프로토타입을 만들고 운영 환경으로 가져가는 데 강하다.

AI
오픈소스
읽기
2026년 4월 5일

LangGraph — 상태를 가진 에이전트를 그래프로 설계하는 프레임워크

장기 실행·상태 유지·human-in-the-loop를 강조하는 low-level orchestration 프레임워크. agent를 노드와 엣지 그래프로 설계해 복잡한 흐름을 다루기 좋다.

AI
오픈소스
읽기
2026년 4월 5일

Model Context Protocol Servers — MCP 레퍼런스 서버 모음

MCP의 공식 레퍼런스 서버 모음. filesystem, fetch, git, memory 같은 예시 서버를 통해 LLM/에이전트가 외부 도구와 안전하게 연결되는 방식을 보여준다.

AI
오픈소스
읽기
2026년 4월 5일

Semantic Kernel — 엔터프라이즈 지향 에이전트 오케스트레이션 SDK

Microsoft의 모델 중립 SDK. agent, multi-agent workflow, plugin, MCP, vector DB를 함께 다루며 .NET/Python/Java를 지원한다.

AI
오픈소스
읽기
2026년 4월 5일

CLI-Anything — 기존 소프트웨어를 에이전트용 CLI로 바꾸는 프레임워크

기존 GUI 소프트웨어·리포를 에이전트가 다루기 쉬운 stateful CLI와 SKILL.md로 변환하는 오픈소스 프레임워크. HARNESS.md 기반 7단계 생성·테스트·배포 절차를 제공한다.

AI
오픈소스
읽기
2026년 4월 4일

Meta BOxCrete 공개 — 데이터센터 콘크리트 배합을 AI로 최적화, 강도 도달 43% 단축

Meta는 2026년 3월 30일 BOxCrete를 공개하며 데이터센터용 콘크리트 배합 최적화에 AI를 적용한 사례를 발표했다. Meta에 따르면 Rosemount 데이터센터 현장에서는 AI가 제안한 배합이 기존 공식보다 full structural strength 도달 시간을 43% 줄였고 cracking risk도 약 10% 낮췄다.

트렌드
오픈소스
읽기
2026년 4월 3일

Arcee Trinity-Large-Thinking 출시 — 미국계 오픈 에이전트 모델이 가격 대비 frontier 경쟁력 제시

Arcee AI가 2026년 4월 1일 Trinity-Large-Thinking을 공개했다. Apache 2.0 오픈웨이트 reasoning 모델로, long-horizon agent와 multi-turn tool calling에 초점을 맞췄고 PinchBench에서 Opus 4.6 바로 아래 2위를 기록했다고 밝혔다.

AI
모델
읽기
2026년 4월 3일

Gemma 4 공개 — Apache 2.0 오픈 모델을 agentic workflow 중심으로 재정의

Google DeepMind가 2026년 4월 2일 Gemma 4를 공개했다. E2B, E4B, 26B MoE, 31B Dense 네 가지 크기로 출시됐고, Apache 2.0 라이선스 아래 reasoning, function calling, JSON output, vision/audio 입력까지 지원한다.

AI
모델
읽기
2026년 4월 2일

vLLM Model Runner V2 출시 — Prefill-Decode 분리 스케줄링으로 오픈소스 LLM 추론 아키텍처 혁신

2026년 3월, vLLM 프로젝트가 Model Runner V2(MRV2)를 릴리즈했다. 기존 스케줄러 아키텍처를 전면 재설계하여 Prefill-Decode 완전 분리 스케줄링과 Zero-Copy DMA 전송을 도입했다. HuggingFace 대비 24배 처리량을 유지하며 GitHub 스타 74,900개로 프로덕션 LLM 추론 엔진의 사실상 표준 위치를 공고히 했다.

AI
오픈소스
읽기
2026년 4월 2일

PrismML Bonsai — 세계 최초 상용 가능 1-bit LLM, iPhone에서 44 tok/s 달성

PrismML이 2026년 3월 31일 세계 최초로 상용 수준 1-bit LLM 'Bonsai' 시리즈를 공개했다. 8B·4B·1.7B 세 가지 모델을 Apache 2.0 라이센스로 무료 배포하며, 기존 FP16 대비 메모리를 14배 절감하고 추론 속도를 8배 높이면서도 동급 모델과 동일한 벤치마크 성능을 유지한다.

AI
오픈소스
읽기
2026년 4월 2일

Claw Code — Claude Code 소스 기반 Python/Rust 클린룸 재구현 프로젝트 (130k★)

Claude Code 소스 공개를 계기로 탄생한 클린룸 재구현 프로젝트. Python + Rust로 에이전트 하네스 아키텍처를 재구현했다. 출시 2시간 만에 50k 스타, 현재 130k 스타 / 102k 포크. Sigrid Jin이 발기인.

트렌드
오픈소스
읽기
2026년 4월 1일

NVIDIA Nemotron 3 Super — 120B MoE 오픈소스 에이전트 모델, SWE-Bench 60.5% 달성

NVIDIA가 에이전트 워크로드 특화 오픈소스 모델 Nemotron 3 Super를 공개했다. Mamba-Transformer 하이브리드 MoE 아키텍처로 원래 1,200억 파라미터에서 활성 파라미터 120억만 사용, SWE-Bench Verified 60.47% 및 PinchBench 85.6%로 동급 오픈소스 최고 성능을 기록했다.

트렌드
오픈소스
읽기
2026년 4월 1일

Google TurboQuant, LLM KV 캐시 메모리 6배 압축·H100 속도 8배 향상 달성

Google Research가 ICLR 2026에서 발표할 TurboQuant를 공개했다. 별도 학습 없이 LLM의 KV 캐시를 3비트로 압축해 메모리를 6배 절감하고, NVIDIA H100에서 어텐션 연산 속도를 최대 8배 높이면서도 정확도 손실이 없다.

AI
트렌드
읽기
2026년 4월 1일

OpenAI, 최초 오픈웨이트 모델 gpt-oss-120b 공개 — Apache 2.0, o4-mini 수준 추론 성능

OpenAI가 처음으로 오픈웨이트 모델인 gpt-oss-120b(117B 파라미터, MoE)와 gpt-oss-20b를 Apache 2.0 라이선스로 공개했다. 단일 80GB GPU에서 실행 가능하며, 코딩·수학·툴 사용에서 o4-mini와 동등하거나 일부 초과한다.

AI
오픈소스
읽기
2026년 4월 1일

gstack — Garry Tan(YC 회장)이 만든 AI 소프트웨어 팩토리

Y Combinator 회장 Garry Tan이 만든 Claude Code 기반 AI 소프트웨어 팩토리. 23개의 전문화된 AI 역할(경영진, 엔지니어링, 디자인, QA, 보안 등)을 조합해 10~15개 스프린트를 병렬로 돌린다. 60일간 60만 줄 프로덕션 코드 산출, 일일 1~2만 줄 생산량. GitHub 스타 60.1k.

트렌드
오픈소스
읽기
2026년 4월 1일

Paperclip — AI 에이전트 팀을 회사처럼 운영하는 오케스트레이션 플랫폼

여러 AI 에이전트를 하나의 회사 조직처럼 구성하고 운영하는 오픈소스 오케스트레이션 플랫폼. 조직도, 목표 정렬, 예산 관리, 거버넌스(승인 게이트, 롤백, 감사 로그)까지 갖추고 있다. "OpenClaw이 직원이라면 Paperclip은 회사다." GitHub 스타 42.8k.

트렌드
오픈소스
읽기
2026년 3월 31일

Google TurboQuant — KV 캐시를 3비트로 6배 압축, 재학습 없이 H100에서 8배 처리량

Google의 TurboQuant가 ICLR 2026에서 발표될 예정이다. LLM의 KV 캐시를 3~4비트로 압축해 메모리를 4~6배 절감하면서 정확도 손실이 전혀 없고, H100 GPU에서 32-bit 대비 최대 8배 처리량 향상을 달성한다.

AI
모델
읽기
2026년 3월 31일

Mistral Voxtral TTS — 4B 오픈소스 음성 합성 모델, ElevenLabs 대비 7~9배 저렴

Mistral AI가 3월 26일 오픈소스 텍스트-음성 변환 모델 Voxtral TTS(4B 파라미터)를 출시했다. 9개 언어를 지원하고 5초 이하의 음성 샘플로 목소리를 복제하며, 첫 오디오 출력 지연(TTFA)이 90ms에 불과해 실시간 음성 에이전트 구현이 가능하다.

AI
모델
읽기
2026년 3월 31일

NVIDIA Nemotron 3 Super — 120B Mamba-Transformer MoE 오픈 에이전트 모델, 이전 대비 5배 처리량

NVIDIA가 에이전트 AI 특화 오픈 모델 Nemotron 3 패밀리를 출시했다. 플래그십인 Nemotron 3 Super는 120B 파라미터(활성 12B)의 Mamba-Transformer MoE 하이브리드 아키텍처를 채택해 Nemotron 2 대비 5배 처리량을 달성하고 1M 토큰 컨텍스트 윈도우를 지원한다.

AI
모델
읽기
2026년 3월 31일

Google TurboQuant — LLM KV 캐시 3.5비트 압쳙으로 메모리 6배 절감, 오픈소스 공개

Google이 LLM의 KV-캐시를 채널당 3.5비트로 압쳙하는 오픈소스 양자화 기법 TurboQuant를 공개했다. 메모리 사용량을 최대 6배 줄이고 추론 속도를 대폭 향상시킨다.

AI
모델
읽기
읽을거리로 돌아가기