본문으로 건너뛰기
Rrobopedia.aiAI 운영

최초 보도 9월 18일 — 원문보다 늦게 정리한 기사입니다.

영상 기반 로봇 정책 학습, 샘플링 MPC로 속도 높인다

샘플링 기반 모델예측제어를 결합한 새 학습법으로 Unitree Go2가 깊이 영상만으로 트로트·크롤·장애물 통과를 익혔습니다

AI 작성이 학습 노트는 생성형 AI가 원문을 바탕으로 작성했습니다. 수치·고유명사는 원문과 다를 수 있습니다.

카메라나 깊이 센서 영상만으로 로봇의 이동 및 조작 정책을 학습시키는 작업은 계산량과 GPU 메모리 소모가 크기로 유명합니다. 특히 로봇이 바닥이나 물체와의 접촉을 정교하게 조율해야 할 때 그 부담은 더욱 커집니다. 최근 arXiv에 게재된 한 논문은 이런 영상 기반 정책 학습을 더 빠르고 안정적으로 만드는 방법을 제안했다고 논문 저자들은 밝혔습니다.

연구진이 주목한 문제는 '1차 정책 경사법(First-order Policy Gradients, FoPG)'이라는 인기 있는 학습 기법의 한계입니다. FoPG는 미분 가능한 시뮬레이션을 활용해 학습 비용을 줄이지만, 지역 최적화 방식에 의존하다 보니 의도치 않은 접촉 패턴에 수렴하는 문제가 있습니다. 예를 들어 로봇 다리가 제대로 된 보행 동작 대신 엉뚱한 위치에서 어색하게 접촉을 유지하는 식입니다.

이를 해결하기 위해 연구진은 샘플링 기반 모델예측제어(MPC)와 FoPG를 결합한 'Sampling-Guided Policy Search(SGPS)'를 고안했습니다. 이 방식에서는 샘플링 기반 MPC가 여러 가능한 행동 시퀀스를 시도해보며 더 나은 행동 목표를 반복적으로 정제하고, FoPG는 짧은 구간 단위의 빠른 정책 업데이트를 담당합니다. 정책은 먼저 이렇게 샘플링된 행동을 모방하는 '행동 복제(behavior cloning)'로 초기화되며, 이후 학습 과정에서는 MPC 기반 정제와 짧은 구간 FoPG 업데이트를 번갈아 수행합니다. 이때 초기 상태를 무작위로 흔들고 시뮬레이션 동역학도 랜덤화해 일반화 성능을 높입니다.

이 연구의 핵심 기술 중 하나는 학습에 쓰이는 계산 그래프에서 렌더링(영상 생성) 과정을 제외한 '분리형(decoupled)' FoPG 방식입니다. 이를 통해 별도의 '교사 정책'—즉 특권적인 상태 정보로 미리 학습된 정책—없이도 깊이 영상 관측치로부터 직접 정책을 학습할 수 있습니다. 교사 정책 방식은 로봇 학습에서 흔히 쓰이지만 구조를 복잡하게 만드는 우회법이었습니다.

연구진은 SGPS를 단일 GPU만으로 시연했으며, 시뮬레이션 상의 Unitree Go2와 G1 로봇을 이용해 보행, 장애물 통과, 상자 밀기, 두 팔을 이용한 물체 운반 등 여러 과제에 대한 정책을 학습시켰습니다. 논문에 따르면 실험 결과 MPC 기반 정제 단계가 단순 초기화나 추적만으로 얻을 수 있는 성능을 넘어 정책 품질을 실질적으로 향상시켰다고 합니다.

특히 주목할 점은 학습된 정책을 증류(distillation)해 실제 Unitree Go2 로봇에 '제로샷'으로 적용했다는 것입니다. 즉 현실 세계에서 추가적인 미세조정 없이 그대로 배치했습니다. 실제 로봇은 온보드 깊이 센서만을 이용해 자율적으로 트로트 보행과 크롤(기어가기) 동작을 수행했고 장애물을 넘었으며, 필요에 따라 이런 동작들 사이를 전환할 수 있었습니다.

Yilang Liu와 공동 연구진이 작성한 이 논문은 arXiv의 로보틱스(cs.RO) 분류와 함께 인공지능·머신러닝 분류에도 함께 등재됐으며, 총 8쪽, 6개의 그림으로 구성돼 있습니다. 상업 제품 발표는 아니지만, 이 연구는 시뮬레이션에서 실제 환경으로 넘어갈 때 흔히 발생하는 발목잡이 문제—영상 기반 이동·조작 정책의 학습 비용과 신뢰성 문제—를 해결할 실용적인 방향을 제시합니다.

많은 로보틱스 연구팀이 비교적 저렴하고 널리 보급된 연구용 플랫폼인 Unitree Go2를 활용하고 있는 상황에서, SGPS와 같은 기법은 사진 같은 고품질 렌더링에 필요한 막대한 연산 자원 없이도 영상 기반 정책 개발 속도를 높이는 데 도움이 될 것으로 보입니다.

이 노트로 갱신된 항목· 새 노트가 들어오면 AI가 매일 이 항목들을 고쳐 씁니다

정정 이력 · 제보

틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.

정정 이력 전체

AI이 창의 답변은 생성형 AI가 작성합니다. 로보피디아 운영 서버의 로컬 모델(저울)이 기사와 원문을 대조해 수정 여부와 이유를 답하고, 사람 편집자는 나중에 기록을 확인합니다.

제보 종류

개인정보나 다른 사람의 정보는 적지 마세요. 제보는 AI 검토와 답변, 남용 방지를 위해 저장되며(IP는 해시로만, 30일), 자세한 내용은 개인정보 처리방침을 확인하세요.

출처

이 기사는 아래 출처를 바탕으로 로보피디아가 작성했습니다.

더 알아보기

공유X에 공유