PickleeAI와 개발, 오늘 볼 변화만
홈읽을거리아카이브
검색

Picklee

AI와 개발 현장에서 오늘 확인할 변화만 선별합니다.

© 2026 Picklee. All rights reserved.

RSSSitemap

읽을거리

2026년 5월 21일

Introducing AMS — 오픈웨이트 LLM 검증이 프롬프트 테스트에서 구조적 안전성 스캔으로 이동

Google은 2026년 4월 27일 AMS(Activation-based Model Scanner)를 오픈소스로 공개했다. 이 도구는 프롬프트를 실제로 생성하지 않고도 10~40초 안에 open-weight LLM의 safety-relevant activation structure를 검사해, instruction-tuned 모델과 uncensored 또는 변조된 모델을 구분하도록 설계됐다.

본문 읽기원문 보기

발행일

2026년 5월 21일

업데이트

2026년 5월 21일

주제

AI
오픈소스
원문 보기

배경 및 맥락

오픈웨이트 LLM 생태계가 커질수록 문제는 단순히 더 좋은 모델을 찾는 것이 아니라, 지금 내려받은 가중치가 정말 의도된 안전 특성을 유지하고 있는지 검증하는 일로 바뀌고 있다. 기존 방식은 HarmBench 같은 behavioral benchmark를 돌려 harmful prompt에 대한 거부 여부를 확인하는 접근이 중심이었지만, 이 방식은 느리고 우회 가능하며, CI 파이프라인에서 대량 체크포인트를 걸러내기에는 비용이 크다.

Google은 이 병목을 모델 출력이 아니라 내부 표현 구조로 우회한다. safety tuning이 있는 instruction-tuned 모델은 harmful/benign 개념을 activation space에서 비교적 선형적으로 분리하는 구조를 만들고, 안전성이 제거되면 그 구조가 무너진다는 가정이다.


핵심 내용

AMS는 contrastive prompt pair를 한 번 forward pass로 통과시킨 뒤 intermediate hidden state에서 direction vector를 계산하고 class separation을 sigma score로 측정한다. Google 설명에 따르면 표준 스캔은 harmful_content, injection_resistance, refusal_capability를 보고, quick mode는 더 적은 개념으로 약 40% 빠르게 돌릴 수 있다. 전체 스캔 시간은 GPU 기준 10~40초 수준이며, Hugging Face 호환 모델에 적용 가능하다.

검증 결과도 실무적이다. instruction-tuned Llama, Gemma, Qwen 계열은 3.88.4σ 분리를 보였고, uncensored 계열은 1.11.3σ로 CRITICAL, abliteration 변형은 3.3σ로 WARNING, base model은 0.69σ였다. Quantized INT4/INT8 모델도 분리도 drift가 5% 미만이라고 제시해 production deployment 전 검사를 염두에 둔 설계임을 드러낸다.


경쟁 구도 / 비교

기존 안전 검증 툴은 대체로 benchmark coverage, jailbreak set, model behavior sampling에 의존했다. AMS는 "무엇을 말했는가"가 아니라 "어떻게 표현하는가"를 본다는 점에서 다른 계층이다. 이는 red-team을 대체한다기보다, 공급망 검증과 release gating에 더 적합한 선행 검사층을 만든다.

또한 최근 agent와 open-model 도입이 늘면서 fine-tuned checkpoint 재사용이 흔해졌는데, AMS는 이 흐름에서 보안팀이 요구하던 provenance check를 모델 내부 표현 수준까지 끌어올린다. 결과적으로 모델 안전이 정책 문서가 아니라 자동화 가능한 artifact 검증 문제로 바뀌는 셈이다.


의미

산업적으로는 오픈모델 운영의 책임이 단순 벤치마크 비교를 넘어 소프트웨어 공급망 검증 체계로 이동하고 있다. 앞으로 기업이 오픈모델을 production에 올릴 때는 license와 cost뿐 아니라, 안전 fingerprint와 weight integrity를 함께 요구할 가능성이 높다.

실무적으로는 MLOps 팀이 모델 registry 업로드, 배포 전 CI, 서드파티 checkpoint 승인 절차에 structural safety scan을 넣는 방향을 검토할 만하다. AMS 같은 도구는 안전 평가를 더 자주, 더 싸게, 더 자동화된 방식으로 수행하게 만드는 초기 신호다.

이어 읽기

관련 읽을거리

전체 보기
2026년 7월 28일Moonshot AI, Kimi K3 공개 weights 배포: 2.8T MoE의 실제 serving 경로 확인Moonshot AI가 Hugging Face에 Kimi K3의 full weights를 Kimi K3 License로 공개했다. 2.8T total / 104B activated parameter의 native multimodal MoE 모델로, 1M-token context, 896개 expert 중 16개 선택, MXFP4 weight·MXFP8 activation 기반 QAT를…2026년 7월 28일NVIDIA·업계, Open Secure AI Alliance 출범: 공개 방어 스택·NOOA 추진NVIDIA와 Hugging Face·Microsoft·Cloudflare·CrowdStrike 등은 Open Secure AI Alliance를 출범시켰다. 오픈 모델·harness·보안 도구를 함께 개발·공개해 AI agent 시대의 취약점 대응, red teaming, 평가와 방어 자동화를 강화하겠다는 구상이며 NVIDIA는 NOOA(Object-Oriented Agent)…2026년 7월 27일Google Cloud, k8s-aibom 오픈소스화: 런타임 ML-BOM 자동 생성Google Cloud는 GKE용 오픈소스 Kubernetes controller k8s-aibom을 공개했다. 이 도구는 cluster API와 container environment를 모니터링해 vLLM·Triton 같은 실행 중 AI runtime을 탐지하고, CycloneDX 1.6 Machine Learning Bill of Materials(ML-BOM)를 자동 생성한다.2026년 7월 27일NVIDIA, Cosmos 3 Edge 공개: 4B 온디바이스 Physical AI 모델NVIDIA는 Cosmos 3 Edge를 공개했다. Nemotron 기반 4B 모델로, NVIDIA Jetson Thor 등 엣지 컴퓨터에서 vision reasoning과 로봇 action 생성을 로컬로 수행하도록 설계됐으며 Cosmos 3 오픈 월드 모델 계열의 edge 배포판이다.