최초 보도 9월 18일 — 원문보다 늦게 정리한 기사입니다.
촉각까지 읽는 세계모델 'Agile-WAM' 로봇 제어 가속
시각과 촉각을 하나로 묶은 경량 모델이 접촉이 많은 작업에서 성공률을 크게 끌어올렸습니다
로봇이 물체를 정교하게 다루려면 접촉 순간의 물리적 변화를 정확히 예측해야 하지만, 이를 잘 해내는 모델일수록 계산이 무거워 실시간 제어에는 부적합한 경우가 많았습니다. arXiv에 게재된 논문에 따르면, 새로 제안된 'Agile-WAM'은 미래의 세계 상태와 로봇 행동을 동시에 예측하는 이른바 '세계 행동 모델(World Action Model, WAM)' 계열이면서도, 빠른 속도가 필요한 고빈도 조작 작업에 적합하도록 설계됐습니다.
논문에 따르면 기존의 촉각 기반 세계 행동 모델들은 복잡한 접촉 역학을 포착하기 위해 대규모로 사전학습된 생성모델 백본에 의존하는 경우가 많았고, 이 때문에 추론 속도가 느려지고 유연한 배포가 어려웠습니다. 반면 Agile-WAM은 시각 정보와 촉각 정보를 하나의 공유된 잠재 표현(latent)으로 인코딩한 뒤, 이를 곧바로 '시각-촉각-행동' 흐름 매칭(flow-matching) 과정에 입력합니다. 이 과정은 로봇 행동 구간의 잠재 표현과 미래 시각·촉각 상태의 잠재 표현을 동시에 생성하며, 무거운 생성모델을 중간 단계로 거치지 않습니다.
이 설계의 핵심 통찰은 시각과 촉각 신호가 서로 다른 속도로 변한다는 점입니다. 카메라 영상은 연속된 프레임끼리 매우 비슷한 경우가 많지만, 촉각 신호는 로봇 손가락이 물체에 닿거나 떨어지는 순간 급격하게 변할 수 있습니다. 연구진은 이러한 시간적 차이를 반영하기 위해 '다중 시야 멀티모달 예측(multi-horizon multimodal prediction)' 기법을 도입했습니다. 시각 잠재 표현은 상대적으로 먼 미래 시점을 예측하도록 학습시키는 반면, 촉각 잠재 표현은 바로 다음 프레임만 예측하도록 해 접촉 순간의 미세한 변화를 정밀하게 포착합니다.
연구팀은 시뮬레이션 환경의 아홉 가지 조작 작업과 실제 로봇의 다섯 가지 접촉 중심 조작 작업으로 Agile-WAM을 평가했습니다. 전체적으로 Agile-WAM은 가장 강력한 비교 기준 모델보다 높은 작업 성공률을 기록하면서도 낮은 추론 지연 시간을 유지했습니다. 특히 실제 로봇 실험에서는 전체 성공률이 기준 모델 대비 29.4% 상대적으로 향상됐으며, 추론 지연 시간은 11.9밀리초에 그쳐 정교한 작업에 필요한 촘촘하고 빠른 제어 루프를 지원할 수 있음을 보여줬습니다.
논문은 이러한 결과가 멀티모달 세계 행동 모델이 반드시 거대한 생성모델 백본을 필요로 하지 않는다는 것을 보여준다고 설명합니다. 연구진에 따르면, 목적에 맞게 설계된 컴팩트한 구조만으로도 접촉이 많은 작업에 필요한 물리적 이해력과 실시간 로봇 제어에 필요한 반응 속도를 동시에 확보할 수 있습니다. 이번 연구는 Hanchu Zhou 등 연구진이 제출했으며, 추가 세부 정보는 논문에서 언급된 프로젝트 페이지에서 공개될 예정이지만 해당 페이지의 정확한 주소는 초록 원문에 명시되지 않았습니다.
실험에 사용된 구체적인 로봇 플랫폼이나 대상 물체는 논문 초록에 명시되지 않았지만, 보고된 성능 향상은 삽입, 조립, 섬세한 물체 취급처럼 시각 정보만으로는 부족한 작업에서 촉각을 활용해 빠르게 반응하는 로봇 개발에 의미 있는 진전으로 볼 수 있습니다.
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.