최초 보도 9월 18일 — 원문보다 늦게 정리한 기사입니다.
MoWAM, 영상 대신 '미래 동작 예측'으로 로봇 AI 효율화
미래 장면을 영상으로 만드는 대신 로봇의 움직임만 예측해 연산량을 줄이면서도 강건성을 높인 새로운 월드 액션 모델이 공개됐습니다.
로봇이 행동하기 전 미래 장면이 어떻게 바뀔지 예측하는 이른바 '월드 액션 모델(World Action Model, WAM)'을 더 빠르게 만들면서도 핵심 장점인 예측 능력은 유지하는 새로운 연구가 공개됐습니다.
기존 월드 액션 모델은 로봇이 어떤 행동을 취했을 때 장면이 어떻게 변할지 영상 형태로 직접 생성해 예측 성능을 높이는 방식을 주로 사용해왔습니다. 이 방식은 로봇이 결과를 미리 내다보는 데 도움을 주지만, 추론 단계에서 매번 영상을 생성하는 것은 연산 비용이 매우 큽니다. 일부 시스템은 영상 생성을 아예 생략해 연산량을 줄이지만, 이 경우 미래 변화에 대한 정보가 관측 특징(observation features) 안에 암묵적으로만 담기게 되어, 학습 데이터와 다른 상황(분포 밖 상황)에서는 성능이 떨어질 수 있습니다.
arXiv에 게재된 이번 논문에 따르면, MoWAM은 이 둘 사이의 절충안을 택했습니다. 전체 미래 장면을 영상으로 복원하는 대신, 현재 장면과 물리적 제약 조건에 따라 로봇이 어떻게 움직일지를 압축된 형태로 예측하는 '구조화된 로봇 동작(motion)' 표현을 사용합니다. 이를 위해 학습 과정에서는 시각적 동역학을 함께 학습하면서 동작과 행동을 동시에 예측하는 '혼합 트랜스포머(Mixture-of-Transformer)' 구조를 적용했습니다. 핵심은 학습이 끝난 뒤 실제 추론 단계에서는 영상 생성을 완전히 제거하면서도, 앞으로 일어날 일에 대한 명시적인 예측 표현은 그대로 유지한다는 점입니다.
동작 표현이 압축된 형태이기 때문에 추론 단계에서 여러 후보를 탐색하는 '추론 시점 스케일링'도 가능해집니다. 모델은 여러 개의 동작·행동 후보 쌍을 샘플링한 뒤, '동작 인식 과제 진행도 검증기(motion-aware task-progress verifier)'를 이용해 그중 가장 적절한 것을 선택합니다.
연구진은 LIBERO, LIBERO-Plus 벤치마크와 실제 로봇 조작 실험을 통해 MoWAM을 검증했습니다. 논문 초록에 따르면 MoWAM은 학습 데이터와 유사한 상황(in-distribution)에서 강한 성능을 보였고, 분포 밖 상황에 대한 강건성도 향상됐으며, 실제 환경 실험에서도 기존 대표적인 월드 액션 모델 기반선보다 평균 성공률이 높았습니다. 또한 후보 동작·행동 쌍을 더 많이 탐색할수록 성능이 계속 개선되는 것으로 나타나, 명시적 동작 표현이 추론 시점 연산 확장에 효과적인 기반이 될 수 있음을 시사했습니다.
이 논문은 제1저자 Jiayu Wang의 이름으로 2026년 9월 17일 arXiv 로보틱스(cs.RO) 분야에 제출됐습니다. 이번 요약은 논문 초록을 바탕으로 작성됐으며, 전체 실험 세부사항과 구조도, 기반선과의 상세 비교는 원 논문에서 확인할 수 있습니다.
이 노트로 갱신된 항목· 새 노트가 들어오면 AI가 매일 이 항목들을 고쳐 씁니다
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.