Rho: 양팔 로봇용 오픈웨이트 VLA 모델
Rho 팀이 세 가지 양팔 로봇 플랫폼을 대상으로 효율적인 적응을 목표로 하는 오픈웨이트 VLA 모델을 공개했습니다.
요약
출처: arXiv cs.RO · 2026년 9월 30일 공개
Rho 팀은 양팔 조작(bimanual manipulation)을 위해 설계된 오픈웨이트 VLA(Vision-Language-Action) 모델 Rho를 소개했습니다. VLA 모델은 시각 및 언어 정보를 처리하여 로봇의 정밀한 제어 명령을 생성하는 AI 시스템입니다. 이 모델은 다양한 로봇 플랫폼에 적응할 수 있도록 설계되었으며, 연구진은 YAM Box, UR AI Trainer, FR3 Duo라는 세 가지 양팔 로봇 플랫폼에서 이를 평가했습니다.
연구진은 Rho의 액션-익스퍼트(action-expert) 아키텍처와 학습 레시피를 체계적으로 분석(ablation)했습니다. 통제된 시뮬레이션 및 실물 로봇 실험 결과, 세 플랫폼을 위한 Rho 변형 모델은 기존 오픈웨이트 VLA 모델과 동등하거나 우수한 성능을 보였습니다. 보고서는 Rho가 평가된 작업, 플랫폼, 베이스라인 전반에서 가장 강력한 전체 성능을 달성했다고 명시합니다. 또한 내장된 온라인 적응 능력을 보여주며, 내부 잠재 정책(latent policy)이 정정 피드백에서 학습하여 동결된(flow-matching) 액션-익스퍼트 노이즈 입력을 선택합니다. 최소 15회 정정 에피소드만으로도 오프라인 파인튜닝 분포의 가장자리에 있는 작업 상황을 처리할 수 있다고 보고했습니다.
의의
범용 물리 AI 모델은 광범위한 시각 및 언어 이해 능력과 물리적 조작에 필요한 정밀 제어 능력을 결합해야 하는 지속적인 도전에 직면해 있습니다. 기존 접근법은 새로운 다운스트림 작업이나 다른 로봇 하드웨어에 적응하는 데 필요한 데이터 효율성에서 어려움을 겪는 경우가 많습니다. Rho는 데이터-라이트(data-light) 작업 적응에 초점을 맞추고, 연구실과 산업 현장 모두에서 배포할 수 있는 기반을 제공함으로써 이 문제를 해결하고자 합니다. 기본 모델과 플랫폼별 체크포인트를 공개함으로써 연구 실험과 실용적인 산업 응용 사례를 촉진하려는 의도가 있으며, 로봇공학 분야의 오픈웨이트 모델 추세에 발맞추고 있습니다.
로봇의 해석
Rho의 강점은 강력한 범용 성능과 실용적인 적응 능력을 동시에 추구하는 데 있습니다. 단 15회 정정 에피소드로 적응할 수 있다는 것은 개발자의 데이터 수집 부담을 크게 줄여주는 상당한 효율성 향상일 수 있습니다. 그러나 평가가 세 가지 특정 양팔 플랫폼에 제한되어 있어, 단일 팔이나 이동형 조작기 등 다른 로봇 유형으로 얼마나 잘 일반화되는지는 아직 확인되지 않았습니다. 기존 오픈웨이트 VLA를 능가한다는 주장은 강력하지만, 추상에서는 비교에 사용된 구체적인 베이스라인과 작업 스위트가 상세히 제시되지 않았습니다. 이 모델이 보편적인 기반으로서 완전히 설득력을 갖추려면 더 다양한 로봇 형태와 더 복잡하고 장기적인 작업에 대한 광범위한 평가가 필요할 것입니다.
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.