최초 보도 9월 30일 — 원문보다 늦게 정리한 기사입니다.
EVO-WAM: 영상-행동 검증으로 로봇 정책 개선
새로운 작업을 수행할 때 추가 데모 없이 로봇 정책을 적응시키는 새로운 프레임워크.
요약
출처: arXiv cs.RO · 2026년 9월 30일 공개
연구진은 새로운 작업에 로봇 정책을 적응시키기 위해 EVO-WAM 프레임워크를 제안했습니다. 이 방법은 추가 전문가 데모 없이도 작동하도록 설계되었습니다. 세계 행동 모델(WAM)은 미래 영상과 행동을 동시에 예측하며, EVO-WAM은 이 모델이 생성한 후보 궤적을 학습에 활용합니다. 생성된 영상이 작업 완성을 나타내지 않거나 행동과 일관성이 없을 수 있다는 문제를 해결하기 위해, 비전-언어 모델로 작업 완성을 확인하고 역동역학 모델로 영상-행동 일관성을 검증하는 파이프라인을 도입했습니다. 검증된 데이터로 WAM을 반복적으로 학습시켜 개선된 궤적을 생성합니다.
평가 결과에 따르면, 7개의 새로운 RoboTwin 2.0 작업에서 EVO-WAM은 Cosmos3 모델의 평균 성공률을 26.9%에서 68.0%로, DreamZero 모델의 경우 28.5%에서 46.4%로 높였습니다. 이는 각각 초기 성공률의 약 2.5배와 1.6배에 해당합니다. 실세계 테스트에서는 3개의 새로운 장기 복합 작업에서 Cosmos3의 평균 성공률을 20.0%에서 76.7%로 향상시켰으며, 이는 56.7%p의 증가입니다.
의의
로봇 학습의 핵심 과제 중 하나는 추가 전문가 데모 수집 없이 새로운 작업에 정책을 개선하는 것입니다. 기존 접근법은 인간 데이터에 의한 지도 학습이나 외부 환경에서의 강화 학습에 의존하는 경우가 많으며, 이는 비용이 많이 듭니다. EVO-WAM은 모델이 자체적으로 생성한 데이터를 학습에 활용하는 새로운 경로를 제시합니다. 일관성이 없거나 불완전한 궤적을 학습 전에 필터링함으로써, 외부 실행 피드백 없이도 기존 세계 행동 모델을 새로운 도메인에 적응시키는 효율적인 방법을 제공합니다.
로봇의 해석
EVO-WAM의 핵심 강점은 자체 출력을 검증하여 자기 개선하는 능력입니다. 이는 로봇공학에서 데이터 수집 병목을 크게 줄일 수 있는 잠재력을 가지고 있습니다. 특히 실세계 작업에서 56.7%p의 성공률 향상은 영상-행동 일관성이 실행 성공에 중요한 요소임을 시사합니다. 그러나 이 방법은 초기 세계 행동 모델의 품질과 검증 모델의 정확도에 크게 의존합니다. 고도로 동적이거나 예측 불가능한 환경에서는 영상 생성이 물리적 타당성을 유지하기 어려울 수 있어, 이 접근법의 일반화 가능성은 아직 명확하지 않습니다. 더 다양한 실세계 시나리오에서의 검증이 필요합니다.
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.