PickleeAI와 개발, 오늘 볼 변화만
홈읽을거리아카이브
검색

Picklee

AI와 개발 현장에서 오늘 확인할 변화만 선별합니다.

© 2026 Picklee. All rights reserved.

RSSSitemap

읽을거리

2026년 7월 13일

Google, Gemini 3.5 Flash computer use와 Gemini Omni Flash API 공개

Google은 2026년 6월 AI 업데이트에서 Gemini 3.5 Flash에 desktop·mobile·browser 환경을 보고 추론·행동하는 computer use를 통합했고, 동적 video workflow용 natively multimodal Gemini Omni Flash를 API public preview로 공개했다.

본문 읽기원문 보기

발행일

2026년 7월 13일

업데이트

2026년 7월 13일

주제

AI
에이전트
API
원문 보기

배경 및 맥락

AI 에이전트의 실무 가치가 단순 질의응답을 넘어 실제 업무 도구와 화면을 조작해 다단계 작업을 끝내는 능력에 달려가면서, 모델 제공자는 tool calling과 GUI interaction을 하나의 플랫폼 계층으로 묶고 있다. 이에 따라 개발팀의 책임도 프롬프트 품질에서 권한 통제, 상태 관리, 관찰성, 실패 복구까지 넓어진다.

Google은 2026년 7월 1일 공개한 6월 AI 업데이트에서 Gemini 3.5 Flash의 computer use, Gemini Omni Flash API public preview, Gemma 4 12B의 로컬 실행을 함께 정리했다. 여기서는 개발자가 바로 적용 가능한 computer use와 multimodal API 변화에 초점을 둔다.


핵심 내용

Gemini 3.5 Flash의 computer use는 desktop·mobile·browser 환경에서 화면을 보고, 추론하고, 행동하는 custom agent를 만들 수 있게 한다. Google은 이를 continuous software testing과 knowledge work 같은 long-horizon·enterprise automation의 성능 개선과 연결했다. 이는 browser automation이나 legacy GUI 작업을 모델의 단발성 function call이 아니라 시각적 상태 전이로 처리하는 접근이다.

Gemini Omni Flash는 동적 video workflow를 만들기 위한 natively multimodal 모델로 API public preview에 들어갔다. 같은 업데이트에는 16GB 메모리에서 로컬 실행할 수 있는 Gemma 4 12B와 실시간 speech-to-speech Gemini 3.5 Live Translate도 포함됐지만, 공개 자료는 이들 기능의 가격·SLA·세부 평가 수치를 제시하지 않았다.


경쟁 구도 / 비교

기존 agent 구현은 텍스트 기반 API, DOM selector, 개별 function call을 조합하는 방식이 많았다. computer use는 시각적 입력을 포함해 더 넓은 애플리케이션을 다룰 수 있지만, 화면 해석 오류·비결정적 UI·권한 상승으로 인해 selector 기반 자동화보다 재현성과 제어 난도가 높다. 따라서 모델의 성공률만이 아니라 동일 상태에서의 반복성, 중단·재개, 사람 승인 경로를 비교해야 한다.

Omni Flash처럼 video 입출력을 API로 제공하는 모델은 별도 vision·audio·generation 파이프라인을 조립하는 부담을 줄일 수 있다. 반면 입력 포맷, token/compute 과금 단위, 결과 검수 체계가 불명확하면 프로토타입의 비용 구조를 예측하기 어렵다.


의미

에이전트 도입의 핵심 설계 단위가 모델 호출에서 실행 환경으로 이동하고 있다. 팀은 UI를 조작하는 agent에 별도 계정·격리 브라우저·allowlist·명시적 confirmation을 적용하고, screenshot·action trace·retry reason을 함께 저장해야 한다.

PM과 테크 리더는 computer use를 “사람을 대신하는 클릭 봇”으로 평가하기보다, 어떤 업무를 sandboxed end-to-end workflow로 재설계할 수 있는지 검증해야 한다. 특히 테스트 자동화에서는 UI 변경에 강한지, 실패 시 안전하게 멈추는지가 모델의 nominal success rate보다 중요하다.

이어 읽기

관련 읽을거리

전체 보기
2026년 7월 28일Moonshot AI, Kimi K3 공개 weights 배포: 2.8T MoE의 실제 serving 경로 확인Moonshot AI가 Hugging Face에 Kimi K3의 full weights를 Kimi K3 License로 공개했다. 2.8T total / 104B activated parameter의 native multimodal MoE 모델로, 1M-token context, 896개 expert 중 16개 선택, MXFP4 weight·MXFP8 activation 기반 QAT를…2026년 7월 27일Anthropic, Claude Sonnet 5 출시: 에이전트 성능과 비용 효율 강화Anthropic은 Claude Sonnet 5를 출시했다. 브라우저·터미널 같은 도구를 사용해 계획을 세우고 자율 실행하는 agentic 작업을 겨냥하며, Claude API와 Claude Code에서 claude-sonnet-5로 제공된다. 출시 프로모션 가격은 2026년 8월 31일까지 입력 $2·출력 $10 per 1M tokens이며 이후 $3·$15다.2026년 7월 27일Vercel Ship 2026: AI SDK 7·Connect·eve로 에이전트 스택 확장Vercel은 Ship 2026에서 AI SDK 7, Vercel Connect, 오픈소스 agent framework eve를 발표했다. AI SDK 7은 multi-turn·tool call·파일·sandbox 작업을 provider-agnostic 인터페이스로 다루고, Connect는 장기 provider token 대신 작업 단위의 임시·scoped credential을 에이전트에…2026년 7월 17일Moonshot, 2.8T Kimi K3 공개…7월 27일 full weights 배포Moonshot AI가 7월 17일 2.8T-parameter, 1M-token context의 Kimi K3를 Kimi·Kimi Work·Kimi Code·Kimi API에 공개했다. Kimi Delta Attention과 Attention Residuals를 적용한 MoE 구조로, 896개 expert 중 16개를 활성화하며 full model weights는 7월 27일 공개할…