PickleeAI와 개발, 오늘 볼 변화만
홈읽을거리아카이브
검색

Picklee

AI와 개발 현장에서 오늘 확인할 변화만 선별합니다.

© 2026 Picklee. All rights reserved.

RSSSitemap

읽을거리

2026년 6월 29일

VLX-Go - lightweight vision-language waypoints for embodied navigation

Om AI Lab은 2026년 6월 28일 Hugging Face를 통해 VLX-Go를 공개했다. VLX-Go는 최근 monocular frame, 현재 관측, 자연어 instruction을 받아 robot controller가 실행할 short-horizon local waypoint를 예측하는 0.6B 규모 vision-language planner다.

본문 읽기원문 보기

발행일

2026년 6월 29일

업데이트

2026년 6월 29일

주제

AI
모델
오픈소스
원문 보기

배경 및 맥락

Embodied AI는 대화형 모델이나 이미지 이해 모델과 다른 배포 조건을 가진다. 로봇은 사용자의 목표를 이해하는 동시에, 움직이는 사람과 장애물, 카메라 시야 변화, 실제 구동 오차를 계속 반영해야 한다. 따라서 모델이 장면을 설명하는 것만으로는 부족하고, controller가 바로 사용할 수 있는 local goal이나 waypoint가 필요하다.

최근 캐시에는 General Intuition처럼 gameplay data를 action-model substrate로 보는 항목과 AI RFIC inverse design처럼 물리 세계 설계 bottleneck을 다룬 항목이 있었다. VLX-Go는 이들과 다르게 로봇 navigation loop 안에서 vision-language model이 어떤 control interface를 내보내야 하는지 다룬다.


핵심 내용

VLX-Go는 vision-language short-horizon waypoint prediction을 목표로 하는 embodied navigation 모델이다. 입력은 최근 visual history, 현재 frame, 자연어 instruction이며, 출력은 downstream controller나 simulator가 사용할 short-horizon waypoint sequence다. 모델은 전체 경로를 한 번에 계획하거나 text-only action을 내는 대신, 다음 몇 스텝의 local motion target을 반복적으로 예측한다.

공개 글에 따르면 VLX-Go는 0.6B 규모의 lightweight planner다. Navigation은 한 번의 추론이 아니라 closed-loop에서 반복 실행되므로, 작은 모델은 inference cost와 edge deployment 측면에서 의미가 있다. 학습은 offline trajectory data로 visual history, instruction, waypoint target의 대응을 학습한 뒤 online simulator feedback으로 collision, obstacle interaction, closed-loop drift 같은 failure mode를 보완하는 구조다.


경쟁 구도 / 비교

일반 VLM은 captioning, VQA, scene reasoning에 강하지만 로봇 제어에서는 출력 형식이 중요하다. 텍스트로 '왼쪽으로 이동'을 말하는 것과 controller가 실행 가능한 local waypoint를 주는 것은 다른 문제다. VLX-Go는 high-level planning과 low-level control을 분리해 모델은 waypoint를 예측하고 controller는 velocity command, safety constraint, platform-specific dynamics를 처리하도록 한다.

End-to-end policy나 global planner와 비교하면 VLX-Go의 장점은 책임 경계가 명확하다는 점이다. Simulator feedback과 safety layer를 별도로 붙일 수 있고, dynamic scene에서 이전 예측을 다음 관측으로 수정할 수 있다. 반대로 collision rate 개선, reward 설계, real robot deployment 검증은 여전히 별도 엔지니어링 과제로 남는다.


의미

산업적으로 robotics foundation model 경쟁은 더 큰 멀티모달 모델을 만드는 것만이 아니라, 인식 결과를 실제 제어 loop가 쓸 수 있는 중간 표현으로 바꾸는 방향으로 이동하고 있다. 이 interface가 안정되면 물류, 매장, 제조, 가정용 로봇에서 natural-language instruction과 기존 controller를 연결하는 비용이 낮아진다.

실무적으로 embodied AI 팀은 모델 benchmark를 offline QA나 visual grounding 점수로만 판단하면 안 된다. Success rate, tracking rate, collision rate, re-planning latency, simulator-to-real gap, fallback policy를 함께 계측해야 한다. 특히 사람 근처에서 움직이는 시스템은 planner 성능과 별개로 physical safety constraint를 controller 계층에서 독립적으로 강제해야 한다.

이어 읽기

관련 읽을거리

전체 보기
2026년 7월 28일Moonshot AI, Kimi K3 공개 weights 배포: 2.8T MoE의 실제 serving 경로 확인Moonshot AI가 Hugging Face에 Kimi K3의 full weights를 Kimi K3 License로 공개했다. 2.8T total / 104B activated parameter의 native multimodal MoE 모델로, 1M-token context, 896개 expert 중 16개 선택, MXFP4 weight·MXFP8 activation 기반 QAT를…2026년 7월 27일NVIDIA, Cosmos 3 Edge 공개: 4B 온디바이스 Physical AI 모델NVIDIA는 Cosmos 3 Edge를 공개했다. Nemotron 기반 4B 모델로, NVIDIA Jetson Thor 등 엣지 컴퓨터에서 vision reasoning과 로봇 action 생성을 로컬로 수행하도록 설계됐으며 Cosmos 3 오픈 월드 모델 계열의 edge 배포판이다.2026년 7월 17일Moonshot, 2.8T Kimi K3 공개…7월 27일 full weights 배포Moonshot AI가 7월 17일 2.8T-parameter, 1M-token context의 Kimi K3를 Kimi·Kimi Work·Kimi Code·Kimi API에 공개했다. Kimi Delta Attention과 Attention Residuals를 적용한 MoE 구조로, 896개 expert 중 16개를 활성화하며 full model weights는 7월 27일 공개할…2026년 7월 17일Thinking Machines, 975B MoE 오픈 웨이트 Inkling 공개Thinking Machines Lab가 7월 15일 975B total·41B active parameter의 MoE 모델 Inkling을 full weights로 공개했다. 최대 1M-token context와 text·image·audio native reasoning을 지원하며, 45T token의 text·image·audio·video 데이터로 pretraining됐다.…