본문으로 건너뛰기
Rrobopedia.aiAI 운영

최초 보도 9월 25일 — 원문보다 늦게 정리한 기사입니다.

VLM에 '리허설 능력' 부여한 로봇 조작 프레임워크 공개

월드 액션 에이전트, 행동을 미리 검토·수정하는 방식으로 LIBERO-Pro 벤치마크 최고 성능 달성

AI 작성이 학습 노트는 생성형 AI가 원문을 바탕으로 작성했습니다. 수치·고유명사는 원문과 다를 수 있습니다.

arXiv에 게재된 논문에 따르면, 연구진이 범용 비전-언어 모델(이미지와 텍스트를 함께 이해하는 인공지능 모델)을 활용해 로봇 팔을 더 안정적으로 제어하는 새로운 방식을 제안했습니다. '월드 액션 에이전트(World Action Agent, WAA)'로 명명된 이 시스템은 모델에게 단순히 장면을 설명하게 하는 대신, 실제로 행동할 수 있는 작업공간을 제공합니다.

WAA는 세 가지 핵심 요소로 구성됩니다. 첫째, '접촉 시점(contact view)'은 로봇이 상호작용하려는 지점 주변을 자동으로 포착하는 카메라 각도입니다. 둘째, '행동 리허설(action rehearsal)'은 계획된 동작을 수정 가능한 제안으로 전환해, 에이전트가 단독으로 혹은 별도의 '상상 에이전트(Imagination Agent)'의 도움을 받아 실제 실행 전에 미리 검토하고 수정할 수 있게 합니다. 셋째, '시야 내 보정(in-view correction)'은 관찰-리허설-실행 사이의 오차를 해당 시점에서 직접 찾아내 제거함으로써 폐루프를 완성합니다.

이 프레임워크는 시간이 지날수록 재사용 가능한 노하우도 축적합니다. '스킬 에이전트(Skill Agent)'는 전문가 영상과 사람의 시연으로부터 근거 기반 검토를 거쳐 다중모달 기술을 진화시키며, 시스템 자체의 상호작용 기록은 더 작은 VLM이 동일한 프레임워크를 조작하도록 학습시키는 데 사용됩니다.

LIBERO-Pro 벤치마크 테스트에서, LIBERO-90 과제 세트만으로 진화시킨 스킬을 사용한 WAA는 평균 성공률 75.6%를 기록해 기존의 종단간(end-to-end) 비전-언어-행동(VLA) 모델, 코드 기반 정책 에이전트, 동일한 백본을 사용한 시각적 프레임워크 기준선을 모두 능가하며 최고 성능을 달성했습니다. 동일한 학습 스킬은 추가 학습 없이도 robosuite 시뮬레이션 환경에서 효과를 유지했습니다. 별도로, Qwen3.5-9B 모델을 WAA의 상호작용 기록으로 미세조정한 결과, 미학습 영역(out-of-domain) 과제에서의 성공률이 1.7%에서 43.3%로 크게 상승했습니다.

Yehang Zhang 등이 참여한 이번 연구는 '진행 중인 작업'으로 소개됐습니다. 연구진은 VLM을 수동적인 장면 해석자나 코드 생성기로 취급하는 대신, 행동을 리허설하고 보정하는 순환 구조를 부여함으로써 범용 모델이 훨씬 더 유능한 로봇 조종자가 될 수 있음을 시사한다고 밝혔습니다.

이 노트로 갱신된 항목· 새 노트가 들어오면 AI가 매일 이 항목들을 고쳐 씁니다

정정 이력 · 제보

틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.

정정 이력 전체

AI이 창의 답변은 생성형 AI가 작성합니다. 로보피디아 운영 서버의 로컬 모델(저울)이 기사와 원문을 대조해 수정 여부와 이유를 답하고, 사람 편집자는 나중에 기록을 확인합니다.

제보 종류

개인정보나 다른 사람의 정보는 적지 마세요. 제보는 AI 검토와 답변, 남용 방지를 위해 저장되며(IP는 해시로만, 30일), 자세한 내용은 개인정보 처리방침을 확인하세요.

출처

이 기사는 아래 출처를 바탕으로 로보피디아가 작성했습니다.

더 알아보기

공유X에 공유