PickleeAI와 개발, 오늘 볼 변화만
홈읽을거리아카이브
검색

Picklee

AI와 개발 현장에서 오늘 확인할 변화만 선별합니다.

© 2026 Picklee. All rights reserved.

RSSSitemap

읽을거리

2026년 7월 16일

Prime Intellect, 오픈형 agentic RL 스택 확장에 USD 130M Series A

Prime Intellect가 7월 8일 Radical Ventures 주도로 USD 130M Series A를 유치해 누적 자금이 USD 150M을 넘었다고 발표했다. 회사는 compute, large-scale RL, environments, sandboxes, evals, deployment를 묶은 스택을 제공하며 6,000곳 이상 고객과 USD 100M 이상의 annualized…

본문 읽기원문 보기

발행일

2026년 7월 16일

업데이트

2026년 7월 16일

주제

AI
에이전트
오픈소스
연구
원문 보기

배경 및 맥락

생성형 AI의 초기 경쟁은 더 큰 foundation model을 사거나 API를 연결하는 데 집중됐다. 그러나 agent가 여러 단계의 도구 호출, 장기 컨텍스트, 사용자 데이터, 실제 시스템 변경을 다루기 시작하면서 성능은 base model보다 환경 설계와 반복 가능한 평가·학습 루프에 크게 좌우된다.

Prime Intellect는 이 변화에 맞춰 compute, reinforcement learning, agent environment, sandbox, evaluation, inference·deployment를 한 스택으로 제공하겠다는 포지션을 취한다. 핵심 주장은 기업이 범용 모델을 그대로 쓰는 대신, 자사 workflow에서 생성되는 피드백으로 모델을 계속 최적화할 수 있게 한다는 것이다.


핵심 내용

Prime Intellect는 7월 8일 Radical Ventures가 주도하고 NVIDIA Ventures, Intel Capital, Dell Technologies Capital 등이 참여한 USD 130M Series A를 발표했다. 회사 발표 기준 누적 자금은 USD 150M 이상이며, 6,000개 이상 고객과 USD 100M 이상의 annualized revenue를 보유한다.

제품 스택에는 대규모 RL, environments, sandboxes, evals, compute, inference, deployment가 포함된다. 이는 agent의 tool-use 실패를 재현할 환경과 자동 채점 verifier, rollout 생성, post-training, 운영 서빙을 따로 구매하지 않고 하나의 루프로 연결하려는 구성이다. 회사는 Ramp 사례에서 spreadsheet search용 35B 모델이 자체 post-training 뒤 Opus보다 정확하고 Haiku보다 27% 빠르며 비용이 낮았다고 제시했지만, 이는 벤더가 발표한 workload별 결과이므로 독립 재현이 필요하다.


경쟁 구도 / 비교

일반 LLM API는 빠르게 기능을 출시하는 데 적합하지만, 모델의 reward function·tool environment·실패 데이터가 공급자 밖에 남는다. 반대로 자체 RL stack은 실험 통제권과 업무 특화 성능을 주지만, verifier 품질, data governance, GPU 비용, rollback 설계까지 조직이 책임져야 한다.

기존 MLOps가 offline training과 serving을 분리했다면, agentic RL은 production trace가 다음 학습 배치와 eval suite로 다시 들어오는 연속 운영을 요구한다. 따라서 경쟁 우위는 모델 파라미터 수보다 environment fidelity와 regression을 막는 evaluation coverage에서 생긴다.


의미

이번 투자 흐름은 “더 좋은 범용 모델을 기다린다”는 전략보다, 특정 업무에서 개선을 누적하는 agent platform이 별도 인프라 시장이 됐음을 보여준다. 장기 실행 agent일수록 long-horizon task, context 관리, sub-agent coordination, sandbox 안전성이 모델 지능만큼 중요해진다.

실무팀은 먼저 실제 업무 trace를 기반으로 taskset과 success·failure criteria를 만들고, 그 위에서 base model과 post-trained model을 동일 조건으로 비교해야 한다. 배포 후에는 token cost, tail latency, tool error, human override, 품질 회귀를 함께 모니터링해 학습으로 되돌리는 통제 루프를 설계하는 것이 핵심이다.

이어 읽기

관련 읽을거리

전체 보기
2026년 7월 28일Moonshot AI, Kimi K3 공개 weights 배포: 2.8T MoE의 실제 serving 경로 확인Moonshot AI가 Hugging Face에 Kimi K3의 full weights를 Kimi K3 License로 공개했다. 2.8T total / 104B activated parameter의 native multimodal MoE 모델로, 1M-token context, 896개 expert 중 16개 선택, MXFP4 weight·MXFP8 activation 기반 QAT를…2026년 7월 28일NVIDIA·업계, Open Secure AI Alliance 출범: 공개 방어 스택·NOOA 추진NVIDIA와 Hugging Face·Microsoft·Cloudflare·CrowdStrike 등은 Open Secure AI Alliance를 출범시켰다. 오픈 모델·harness·보안 도구를 함께 개발·공개해 AI agent 시대의 취약점 대응, red teaming, 평가와 방어 자동화를 강화하겠다는 구상이며 NVIDIA는 NOOA(Object-Oriented Agent)…2026년 7월 27일NVIDIA, Cosmos 3 Edge 공개: 4B 온디바이스 Physical AI 모델NVIDIA는 Cosmos 3 Edge를 공개했다. Nemotron 기반 4B 모델로, NVIDIA Jetson Thor 등 엣지 컴퓨터에서 vision reasoning과 로봇 action 생성을 로컬로 수행하도록 설계됐으며 Cosmos 3 오픈 월드 모델 계열의 edge 배포판이다.2026년 7월 17일Moonshot, 2.8T Kimi K3 공개…7월 27일 full weights 배포Moonshot AI가 7월 17일 2.8T-parameter, 1M-token context의 Kimi K3를 Kimi·Kimi Work·Kimi Code·Kimi API에 공개했다. Kimi Delta Attention과 Attention Residuals를 적용한 MoE 구조로, 896개 expert 중 16개를 활성화하며 full model weights는 7월 27일 공개할…