본문으로 건너뛰기
Rrobopedia.aiAI 운영

최초 보도 9월 25일 — 원문보다 늦게 정리한 기사입니다.

행동을 구분하는 세계모델 'AD-WM', 로봇 계획 성능 대폭 향상

단순 예측 정확도 대신 행동 간 차이를 보존하도록 학습, 프랑카 로봇 물건 집기 성공률 42%→71%로 상승

AI 작성이 학습 노트는 생성형 AI가 원문을 바탕으로 작성했습니다. 수치·고유명사는 원문과 다를 수 있습니다.

로봇 계획(planning)에 쓰이는 대부분의 세계모델은 현재 상태와 행동이 주어졌을 때 다음에 일어날 일을 예측하고, 실제 결과와의 오차를 줄이는 방식으로 학습됩니다. 그러나 모델예측제어(MPC, 앞으로 취할 여러 행동의 결과를 미리 시뮬레이션해 최적 행동을 고르는 제어 기법)에는 단순히 정확한 예측만으로는 부족합니다. 같은 상태에서 출발하는 여러 대안 행동들을 서로 비교해 그중 최선을 골라내야 하기 때문입니다. 최근 arXiv에 게재된 한 논문은 이 두 가지 목표가 실제로는 다르며, 예측 정확도는 높지만 행동 간 차이를 잘 구분하지 못하는 모델이 존재할 수 있다고 지적합니다.

Jiabin Qiu 등 연구진이 제출한 이 논문은 이러한 문제를 정면으로 다루는 'AD-WM(Action-Discriminative World Model, 행동 구별형 세계모델)'을 제안합니다. AD-WM은 잔차 잠재 동역학(residual latent dynamics)에 '예측기 단계의 행동 복원 정규화(predictor-level action-recovery regularization)'라는 학습 기법을 결합합니다. 이는 역동역학(inverse dynamics)과, 조건부 상호정보량(conditional mutual information) 개념에서 착안한 정규화된 복원 목표를 활용해, 내부 예측 표현만 보고도 원래 어떤 행동이었는지 복원할 수 있을 만큼 충분한 정보를 유지하도록 모델을 유도하는 방식입니다. 결과적으로 서로 다른 행동은 상상된 결과에서도 의미 있게 다르게 나타나게 됩니다. 이 보조 학습 목표들은 실제 테스트 시에는 제거되므로, 계획 알고리즘(플래너) 자체는 그대로 유지되고 오직 내부 세계모델만 달라집니다.

시뮬레이션 벤치마크인 OGBench-Cube에서 AD-WM은 어려운 시작 조건(hard-start)에서의 성공률을 기존 LeWM 기반 비교 모델의 3.7%에서 52.0%로 끌어올렸습니다. 다섯 개 시뮬레이션 환경 중 네 곳에서 평균 성공률도 향상되었습니다. 연구진은 계획 성능을 진단하는 실험도 진행했는데, 흔히 쓰이는 지표인 '단순 사실 예측 오차'와 '전체 행동 후보군에 대한 순위 정확도'는 실제 폐루프(closed-loop) 과제 성공률과 잘 맞아떨어지지 않았습니다. 반면 상위 후보 행동들만을 대상으로 오차를 측정하는 'CEM(교차엔트로피법) 정렬 엘리트 후회(CEM-aligned elite regret)' 지표는 실제 성공률과 훨씬 밀접하게 일치했습니다.

실제 환경 전이 성능을 확인하기 위해 연구진은 고정된 V-JEPA 2 시각 인코더와 DROID 로봇 조작 데이터셋으로 후속 학습을 진행한 뒤, 별도의 실험실 맞춤 조정 없이 프랑카(Franka) 로봇팔에서 제로샷(zero-shot) 평가를 실시했습니다. 그 결과 기본적인 물건 집기·놓기(pick-and-place) 성공률이 기존 방식의 42.2%에서 AD-WM 적용 시 71.1%로 상승했습니다.

연구진은 계획을 위한 세계모델은 단순 예측 정확도만을 좇을 것이 아니라, 의사결정에 필요한 '행동에 따른 차이'를 명시적으로 보존하도록 학습해야 한다고 결론짓습니다. 이는 학습된 잠재 세계모델 위에 MPC 기반 로봇 제어기를 구축하려는 연구자와 개발자들에게 중요한 시사점이 될 수 있습니다. 추가 영상과 코드는 논문 프로젝트 페이지에서 확인할 수 있습니다.

정정 이력 · 제보

틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.

정정 이력 전체

AI이 창의 답변은 생성형 AI가 작성합니다. 로보피디아 운영 서버의 로컬 모델(저울)이 기사와 원문을 대조해 수정 여부와 이유를 답하고, 사람 편집자는 나중에 기록을 확인합니다.

제보 종류

개인정보나 다른 사람의 정보는 적지 마세요. 제보는 AI 검토와 답변, 남용 방지를 위해 저장되며(IP는 해시로만, 30일), 자세한 내용은 개인정보 처리방침을 확인하세요.

출처

이 기사는 아래 출처를 바탕으로 로보피디아가 작성했습니다.

더 알아보기

공유X에 공유