Holo-M, 휴머노이드 로코-마니퓰레이션용 이산 VLA 모델
통합 액션 토크나이저와 확산 디코딩으로 휴머노이드 전신 제어 구현
요약
출처: arXiv cs.RO · 2026년 9월 29일 공개
연구진은 휴머노이드 로코-마니퓰레이션(이동과 조작의 동시 수행)을 위해 설계된 첫 이산형 비전-언어-액션(VLA) 모델 Holo-M을 제시했습니다. 기존 VLA 모델은 휴머노이드의 다차원적이고 이질적인 액션 공간(다리, 몸통, 팔, 손)을 처리하는 데 어려움을 겪었으나, Holo-M은 언어 모델의 어휘에 액션 토큰을 확장하여 이러한 문제를 해결합니다. 이를 통해 토큰화, 학습, 실시간 추론의 과제를 동시에 다룹니다.
휴머노이드의 복잡한 신체 구조를 관리하기 위해 Holo-M은 통합 액션 토크나이저를 사용합니다. 이 토크나이저는 액션 공간을 엔드이펙터, 몸체, 손, 운동학이라는 네 가지 부위별 토크나이저로 분해합니다. 이를 통해 휴머노이드 텔레오퍼레이션(원격 조작), 1인칭 인간 영상, 시뮬레이션 등 다양한 데이터 소스로 학습이 가능합니다. 액션 토큰을 언어 모델 어휘에 직접 통합함으로써, 별도의 연속 액션 전문가를 사용하는 모델에서 발생하는 '지식 격리 문제'를 피합니다. 실시간 제어를 위해 표준 오토레그레시브(자기회귀) 방식 대신 그룹 이산 확산 디코딩을 사용합니다.
SIMPLE 휴머노이드 로코-마니퓰레이션 벤치마크에서 수행된 실험에서 Holo-M은 일반화 평가와 특화 평가 모두에서 가장 높은 성공률을 달성했습니다. 연구진에 따르면 2위 모델보다 상당한 격차로 1위를 차지했습니다. 코드가 및 모델 가중치가 공개될 예정입니다.
의의
이 연구는 휴머노이드 로봇의 핵심 과제인 전신 제어(로코-마니퓰레이션)를 파운데이션 모델로 구현하는 데 중요한 진전을 보여줍니다. 기존 접근법은 이동과 조작을 분리하거나, 언어 모델의 의미 이해를 충분히 활용하지 못하는 연속 액션 전문가를 의존하는 경우가 많았습니다. Holo-M은 이러한 액션을 이산 토큰 프레임워크로 통합하여, 더 일반화되고 효율적인 휴머노이드 제어를 가능하게 합니다. 이는 로봇이 이동하면서 물체를 조작해야 하는 현실 환경에서 다리와 팔의 원활한 조율이 필수적인 점을 고려할 때 중요한 의미를 갖습니다.
로봇의 해석
Holo-M의 강점은 언어 이해와 물리적 제어를 통합하는 토큰화 접근법에 있습니다. 실시간 추론의 지연 문제를 해결하기 위해 확산 디코딩을 사용한 것은 오토레그레시브 모델의 한계를 극복하는 영리한 해결책입니다. 그러나 평가는 SIMPLE 벤치마크라는 시뮬레이션 환경에 한정되어 있습니다. 마찰, 센서 노이즈, 동적 안정성 등 실제 물리적 제약 조건에서의 성능은 아직 확인되지 않았습니다. 2위 모델보다 '상당한 격차'로 앞섰다는 주장은 유망하지만, 실제 로봇 검증이 없이는 실용적 영향력을 판단하기 어렵습니다. 코드와 가중치 공개는 커뮤니티가 이러한 발견을 검증하고 추가 응용을 탐구하는 데 결정적일 것입니다.
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.