최초 보도 9월 25일 — 원문보다 늦게 정리한 기사입니다.
VLM에 '리허설 능력' 부여한 로봇 조작 프레임워크 공개
월드 액션 에이전트, 행동을 미리 검토·수정하는 방식으로 LIBERO-Pro 벤치마크 최고 성능 달성
arXiv에 게재된 논문에 따르면, 연구진이 범용 비전-언어 모델(이미지와 텍스트를 함께 이해하는 인공지능 모델)을 활용해 로봇 팔을 더 안정적으로 제어하는 새로운 방식을 제안했습니다. '월드 액션 에이전트(World Action Agent, WAA)'로 명명된 이 시스템은 모델에게 단순히 장면을 설명하게 하는 대신, 실제로 행동할 수 있는 작업공간을 제공합니다.
WAA는 세 가지 핵심 요소로 구성됩니다. 첫째, '접촉 시점(contact view)'은 로봇이 상호작용하려는 지점 주변을 자동으로 포착하는 카메라 각도입니다. 둘째, '행동 리허설(action rehearsal)'은 계획된 동작을 수정 가능한 제안으로 전환해, 에이전트가 단독으로 혹은 별도의 '상상 에이전트(Imagination Agent)'의 도움을 받아 실제 실행 전에 미리 검토하고 수정할 수 있게 합니다. 셋째, '시야 내 보정(in-view correction)'은 관찰-리허설-실행 사이의 오차를 해당 시점에서 직접 찾아내 제거함으로써 폐루프를 완성합니다.
이 프레임워크는 시간이 지날수록 재사용 가능한 노하우도 축적합니다. '스킬 에이전트(Skill Agent)'는 전문가 영상과 사람의 시연으로부터 근거 기반 검토를 거쳐 다중모달 기술을 진화시키며, 시스템 자체의 상호작용 기록은 더 작은 VLM이 동일한 프레임워크를 조작하도록 학습시키는 데 사용됩니다.
LIBERO-Pro 벤치마크 테스트에서, LIBERO-90 과제 세트만으로 진화시킨 스킬을 사용한 WAA는 평균 성공률 75.6%를 기록해 기존의 종단간(end-to-end) 비전-언어-행동(VLA) 모델, 코드 기반 정책 에이전트, 동일한 백본을 사용한 시각적 프레임워크 기준선을 모두 능가하며 최고 성능을 달성했습니다. 동일한 학습 스킬은 추가 학습 없이도 robosuite 시뮬레이션 환경에서 효과를 유지했습니다. 별도로, Qwen3.5-9B 모델을 WAA의 상호작용 기록으로 미세조정한 결과, 미학습 영역(out-of-domain) 과제에서의 성공률이 1.7%에서 43.3%로 크게 상승했습니다.
Yehang Zhang 등이 참여한 이번 연구는 '진행 중인 작업'으로 소개됐습니다. 연구진은 VLM을 수동적인 장면 해석자나 코드 생성기로 취급하는 대신, 행동을 리허설하고 보정하는 순환 구조를 부여함으로써 범용 모델이 훨씬 더 유능한 로봇 조종자가 될 수 있음을 시사한다고 밝혔습니다.
이 노트로 갱신된 항목· 새 노트가 들어오면 AI가 매일 이 항목들을 고쳐 씁니다
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.