최초 보도 9월 18일 — 원문보다 늦게 정리한 기사입니다.
로봇 조작 AI에 '예측 감각' 더한 새 학습법 등장
미래 경로를 명시하지 않고도 로봇이 다음 상황을 예측하게 하는 경량 기법이 여러 벤치마크에서 성능을 끌어올렸습니다.
확산 모델(디퓨전 모델)을 이용해 조작 동작을 학습하는 로봇 정책은 현재 장면을 3차원으로 파악해 '지금 무엇을 해야 할지'는 잘 판단합니다. 하지만 지금 당장의 최적 동작을 아는 것과 앞으로 상호작용이 어떻게 전개될지 아는 것은 다른 문제이며, 이 차이가 길고 복잡한 접촉 작업에서 성능을 떨어뜨리는 원인이 되곤 합니다.
arXiv에 게재된 논문 'Learning Foresight without Explicit Trajectories for 3D Diffusion Policies'는 이를 해결하기 위해 '무브먼트 트렌드 가이던스(Movement Trend Guidance)'라는 방법을 제안합니다. 이 방법은 로봇에게 구체적인 미래 이동 경로를 강제하는 대신, 짧은 과거 관측 기록을 압축한 잠재 표현(latent representation)을 학습하도록 합니다. 이 잠재 표현은 상호작용이 어떤 방향으로 흘러가는지를 담고 있습니다. 학습 단계에서는 드문드문 주어지는 미래 그리퍼 상태 정보로 이 표현을 지도학습하지만, 실제 추론 단계에서는 미래 정보 없이 학습된 잠재 표현만을 현재 관측과 함께 조건으로 사용합니다.
구조적으로 이 잠재 표현은 두 가지 경로로 동작 생성 네트워크에 전달됩니다. 하나는 전역 조건화 신호로, 다른 하나는 신경망 내부 특징을 조절하는 기법인 게이트형 FiLM 분기를 통해서인데, 이는 확산 정책에서 동작을 생성하는 핵심 네트워크인 UNet의 병목 지점에만 적용됩니다. 연구진은 널리 쓰이는 기준 모델인 DP3(3D 확산 정책)의 기존 밀집 동작·수용 지평선(receding-horizon) 방식을 그대로 유지하면서 이 기법을 얹었으며, 추가되는 파라미터는 DP3 대비 3.52%에 불과합니다.
성능 향상 폭은 상당합니다. 50개 과제를 혼합 학습한 RoboTwin2.0 벤치마크에서 62.8%의 성공률을 기록해 기존 DP3의 56.1%를 앞질렀습니다. 40개 조작 과제로 구성된 LIBERO-40에서는 격차가 더 커서 71.93% 대 37.08%를 기록했습니다. 정교한 손 조작 능력을 평가하는 DexArt 벤치마크에서도 검증됐으며, 5개의 실제 로봇 과제에서는 72.0% 대 49.0%의 성공률을 보였습니다.
연구진은 핵심 통찰을 다음과 같이 요약합니다. 확산 정책은 "정확히 어디로 움직여야 하는지 지시받지 않고도, 상호작용이 어느 방향으로 향하는지 아는 것만으로 상당한 이득을 얻을 수 있다"는 것입니다. 즉 로봇이 구체적인 미래 경로를 세우고 그대로 따르지 않더라도, 압축된 형태의 '경향' 정보만으로도 즉각적인 판단력이 눈에 띄게 좋아질 수 있다는 뜻입니다.
Zhongbo Zhang을 비롯한 저자들이 제출한 이 연구는 로보틱스와 컴퓨터 비전이 교차하는 영역에 속하며, 로봇 학습 분야의 더 큰 흐름과도 맞닿아 있습니다. 즉 모델을 더 크게 만들거나 명시적인 계획 모듈을 추가하기보다, 시간적 예측 감각 같은 유용한 구조를 기존 아키텍처에 저렴하게 주입하는 방식입니다. 이 기법이 DP3의 기존 구조에 최소한의 파라미터 증가만으로 결합될 수 있다는 점에서, 이미 확산 기반 조작 정책을 사용 중인 팀들에게는 비교적 손쉬운 업그레이드가 될 수 있습니다. 다만 서로 다른 로봇 형태와 과제군에서 독립적인 재현 검증이 이뤄져야 이번 결과의 일반성을 더 확실히 알 수 있을 것입니다.
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.
출처
이 기사는 아래 출처를 바탕으로 로보피디아가 작성했습니다.
더 알아보기