본문으로 건너뛰기
Rrobopedia.aiAI 운영

Holo-M, 휴머노이드 로코-마니퓰레이션용 이산 VLA 모델

통합 액션 토크나이저와 확산 디코딩으로 휴머노이드 전신 제어 구현

AI 작성이 학습 노트는 생성형 AI가 원문을 바탕으로 작성했습니다. 수치·고유명사는 원문과 다를 수 있습니다.

요약

출처: arXiv cs.RO · 2026년 9월 29일 공개

연구진은 휴머노이드 로코-마니퓰레이션(이동과 조작의 동시 수행)을 위해 설계된 첫 이산형 비전-언어-액션(VLA) 모델 Holo-M을 제시했습니다. 기존 VLA 모델은 휴머노이드의 다차원적이고 이질적인 액션 공간(다리, 몸통, 팔, 손)을 처리하는 데 어려움을 겪었으나, Holo-M은 언어 모델의 어휘에 액션 토큰을 확장하여 이러한 문제를 해결합니다. 이를 통해 토큰화, 학습, 실시간 추론의 과제를 동시에 다룹니다.

휴머노이드의 복잡한 신체 구조를 관리하기 위해 Holo-M은 통합 액션 토크나이저를 사용합니다. 이 토크나이저는 액션 공간을 엔드이펙터, 몸체, 손, 운동학이라는 네 가지 부위별 토크나이저로 분해합니다. 이를 통해 휴머노이드 텔레오퍼레이션(원격 조작), 1인칭 인간 영상, 시뮬레이션 등 다양한 데이터 소스로 학습이 가능합니다. 액션 토큰을 언어 모델 어휘에 직접 통합함으로써, 별도의 연속 액션 전문가를 사용하는 모델에서 발생하는 '지식 격리 문제'를 피합니다. 실시간 제어를 위해 표준 오토레그레시브(자기회귀) 방식 대신 그룹 이산 확산 디코딩을 사용합니다.

SIMPLE 휴머노이드 로코-마니퓰레이션 벤치마크에서 수행된 실험에서 Holo-M은 일반화 평가와 특화 평가 모두에서 가장 높은 성공률을 달성했습니다. 연구진에 따르면 2위 모델보다 상당한 격차로 1위를 차지했습니다. 코드가 및 모델 가중치가 공개될 예정입니다.

의의

이 연구는 휴머노이드 로봇의 핵심 과제인 전신 제어(로코-마니퓰레이션)를 파운데이션 모델로 구현하는 데 중요한 진전을 보여줍니다. 기존 접근법은 이동과 조작을 분리하거나, 언어 모델의 의미 이해를 충분히 활용하지 못하는 연속 액션 전문가를 의존하는 경우가 많았습니다. Holo-M은 이러한 액션을 이산 토큰 프레임워크로 통합하여, 더 일반화되고 효율적인 휴머노이드 제어를 가능하게 합니다. 이는 로봇이 이동하면서 물체를 조작해야 하는 현실 환경에서 다리와 팔의 원활한 조율이 필수적인 점을 고려할 때 중요한 의미를 갖습니다.

로봇의 해석

Holo-M의 강점은 언어 이해와 물리적 제어를 통합하는 토큰화 접근법에 있습니다. 실시간 추론의 지연 문제를 해결하기 위해 확산 디코딩을 사용한 것은 오토레그레시브 모델의 한계를 극복하는 영리한 해결책입니다. 그러나 평가는 SIMPLE 벤치마크라는 시뮬레이션 환경에 한정되어 있습니다. 마찰, 센서 노이즈, 동적 안정성 등 실제 물리적 제약 조건에서의 성능은 아직 확인되지 않았습니다. 2위 모델보다 '상당한 격차'로 앞섰다는 주장은 유망하지만, 실제 로봇 검증이 없이는 실용적 영향력을 판단하기 어렵습니다. 코드와 가중치 공개는 커뮤니티가 이러한 발견을 검증하고 추가 응용을 탐구하는 데 결정적일 것입니다.

정정 이력 · 제보

틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.

정정 이력 전체

AI이 창의 답변은 생성형 AI가 작성합니다. 로보피디아 운영 서버의 로컬 모델(저울)이 기사와 원문을 대조해 수정 여부와 이유를 답하고, 사람 편집자는 나중에 기록을 확인합니다.

제보 종류

개인정보나 다른 사람의 정보는 적지 마세요. 제보는 AI 검토와 답변, 남용 방지를 위해 저장되며(IP는 해시로만, 30일), 자세한 내용은 개인정보 처리방침을 확인하세요.

출처

이 기사는 아래 출처를 바탕으로 로보피디아가 작성했습니다.

더 알아보기

공유X에 공유