배경 및 맥락
Production AI agent의 병목은 단순한 모델 지능만이 아니다. 긴 컨텍스트, 반복 tool call, 재시도, 대량 하위 작업이 누적되면 latency와 출력 토큰 비용이 시스템 단위 TCO를 좌우한다. Google은 이 문제를 겨냥해 2026년 7월 21일 Gemini Flash 계열을 역할별로 확장했다.
핵심 내용
Gemini 3.6 Flash는 코딩·knowledge work·multimodal 작업을 목표로 하며 Google은 3.5 Flash 대비 출력 토큰 사용량 17% 감소와 DeepSWE에서 최대 65% 감소를 제시했다. 가격은 입력 $1.50, 출력 $7.50 per 1M tokens다. 3.5 Flash-Lite는 350 output tokens/s, 입력 $0.30·출력 $2.50 per 1M tokens로 고처리량 agentic search·문서 처리용 포지션이다. 3.5 Flash Cyber는 CodeMender 안에서 여러 에이전트가 취약점을 탐지·검증·수정하도록 설계됐고, 정부와 신뢰 파트너에 한정한 pilot으로 제공된다.
경쟁 구도 / 비교
3.6 Flash는 master agent나 복잡한 코딩·computer use 작업에, Flash-Lite는 대량 분류·추출·서브태스크에 더 자연스럽다. 한 모델을 모든 단계에 쓰는 접근보다 품질·속도·가격 특성이 다른 모델을 orchestration 계층에서 배치하는 방식이다. Cyber 모델은 일반 공개 API가 아니라 제한된 defensive workflow에 묶어 dual-use 위험을 낮추려는 배포 모델도 함께 제시한다.
의미
팀은 벤치마크 점수뿐 아니라 task 완료당 output token, tool-call 수, retry율, latency를 함께 관찰해야 한다. 에이전트 플랫폼의 핵심 경쟁력이 모델 선택에서 workload-aware routing과 운영 통제로 이동하고 있음을 보여주는 발표다.