최초 보도 9월 25일 — 원문보다 늦게 정리한 기사입니다.
스스로 보정하는 VLA 로봇 정책, 하드웨어 오차 극복
새로운 사후 학습 기법으로 비전-언어-행동 로봇 정책이 별도의 재보정 없이 하드웨어 변화에 적응할 수 있게 됐습니다.
비전-언어-행동(VLA) 모델은 카메라 영상과 언어 명령을 직접 로봇의 모터 명령으로 변환하는 방식으로, 최근 로봇 조작 분야의 핵심 기반 기술로 자리잡고 있습니다. 하지만 이런 모델들은 대체로 '메모리가 없는' 구조를 가지고 있어, 학습 당시와 다르게 로봇의 하드웨어 상태가 변했을 때 이를 스스로 인지할 방법이 없습니다. 부품 마모나 불완전한 보정, 미세한 센서 오프셋 등은 조용히 성능을 떨어뜨리며, 이를 해결하려면 보통 로봇을 멈추고 수동으로 재보정해야 했습니다.
Hongxin Zhang이 이끄는 연구팀은 arXiv에 게재된 논문을 통해 '셀프-어댑티브 VLA(Self-Adaptive VLA)'라는 해결책을 제안했습니다. 이 방식은 사후 학습(post-training) 기법으로, 처음부터 모델을 새로 만드는 대신 이미 학습된 기본 VLA 정책에 추가로 적용하는 방식입니다.
연구 과정은 몇 단계로 진행됩니다. 먼저 연구진은 구동 편차(actuation bias)나 관절 엔코더 오프셋 같은 하드웨어 변화를 의도적으로 주입한 뒤, 이런 변화된 조건에서 정책이 수행한 결과 데이터를 수집합니다. 이후 기본 정책의 원래 학습 데이터를, 알려진 변화량만큼 전문가의 기록된 행동을 미리 보정한 '변화 조건부 전문가 시연(shift-conditioned expert demonstrations)' 데이터로 변환합니다.
이 시스템의 핵심은 가볍고 탈부착 가능한 '컨텍스트 인코더'입니다. 이 인코더는 변화된 환경에서 얻은 시각 정보, 고유수용감각(proprioception, 로봇이 자신의 관절 위치와 움직임을 내부적으로 감지하는 능력) 신호, 그리고 최근 행동 기록을 하나의 잠재 컨텍스트 토큰으로 압축합니다. 이 토큰은 '적응형 레이어 정규화(AdaLN)'라는 기법을 통해 정책의 행동을 조정하며, 사실상 현재 로봇이 처한 특정 하드웨어 상태에 맞춰 어떻게 대응해야 하는지를 모델에게 알려주는 역할을 합니다.
주목할 만한 발견은 이러한 컨텍스트 토큰들을 앙상블(결합)할 수 있다는 점입니다. 이를 통해 정책은 한 번의 조정으로 끝나는 것이 아니라 여러 단계에 걸쳐 반복적으로 스스로 오류를 수정할 수 있습니다. 이러한 단계적 보정 과정은 하드웨어 변화로 인한 오차를 점진적으로 줄이는 데 도움을 줍니다.
연구팀은 양팔 협응(bi-manual) 작업과 정교한 손동작이 필요한 조작 과제를 포함해 정밀도가 중요한 4가지 조작 과제에서 셀프-어댑티브 VLA를 시험했습니다. 논문에 따르면, 구동 편차나 관절 엔코더 오프셋 같은 하드웨어 변화가 존재하는 상황에서도 이 방법은 기본 정책 성능의 80% 이상을 회복했습니다. 연구팀은 또한 로봇을 새로운 작업대로 옮겼을 때도, 변형되지 않은 기본 정책에 비해 셀프-어댑티브 VLA가 더 안정적인 배포를 가능하게 했다고 밝혔습니다.
arXiv에 게재된 논문에서 밝힌 바에 따르면, 이번 연구는 시간이 지남에 따라 하드웨어 편차가 불가피하게 발생하는 대규모 로봇 배치 환경에서 확장성을 높이고, 마모가 발생할 때마다 개별 로봇을 수동으로 재보정할 필요가 없어 유지보수를 더 쉽게 만드는 방향으로 자리매김하고 있습니다. 논문에는 해당 기법을 시연하는 보충 영상도 arXiv 게재물 링크를 통해 포함되어 있습니다.
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.