최초 보도 9월 18일 — 원문보다 늦게 정리한 기사입니다.
로봇 없이도 가능한 인간 피드백 AI 학습법
HIL-UMI, 손에 든 시연 도구만으로 로봇용 시각-언어-행동 모델을 개선
카메라 영상과 언어 지시를 바로 로봇 동작으로 변환하는 대규모 시각-언어-행동(VLA) 모델을 특정 작업에 맞게 조정하려면 보통 사람이 시연한 데이터로 지도 미세조정(SFT)을 진행합니다. 그러나 Zimu Han 연구팀은 이 방식에 두 가지 한계가 있다고 지적합니다. 첫째, 고정된 시연 데이터는 로봇이 실제로 마주칠 수 있는 모든 상황(분포 밖 상태)을 다 담지 못합니다. 둘째, 표준 모방학습은 어떤 시연이 더 유용한지 구분하지 않고 모든 데이터를 동일하게 취급합니다.
인간이 개입하는 상호작용 학습(human-in-the-loop)은 이 두 문제를 해결할 수 있지만, 통상적으로는 실제 로봇 위에서 정책을 실행시키며 사람이 지켜보다가 개입해야 해서 시간과 자원이 많이 듭니다. 연구팀이 새로 발표한 논문에서는 유니버설 매니퓰레이션 인터페이스(UMI)—로봇 없이도 사람이 손에 들고 조작 시연을 기록할 수 있는 도구—를 기반으로 한 HIL-UMI 프레임워크를 소개합니다.
HIL-UMI의 핵심 아이디어는, 시연자가 보고 있는 것과 동일한 카메라·센서 데이터 스트림에 대해 현재 VLA 정책에게 질의하되, 정책이 실제로 행동을 취하지는 않게 하는 것입니다. 대신 시스템은 사람이 시연한 행동 궤적과 정책이 예측했을 행동을 비교하는 '에너지 점수(Energy Score)'를 계산합니다. 두 궤적이 크게 어긋나면 — 즉 정책이 잘 다루지 못하는 분포 밖 상황일 가능성이 높다는 신호이면 — 해당 시점을 표적 데이터 수집 대상으로 표시합니다.
또 다른 별도의 피드백 루프에서는 작업 도중 정책 스스로가 예측한 진행도 점수, 즉 '어드밴티지(advantage)'를 살펴봅니다. 이 값이 낮게 나오는 구간은 재학습에 특히 중요한 부분으로 간주되어, 진행도 기반 어드밴티지 추정기를 개선하는 데 사용됩니다. 갱신된 추정기는 이후 '어드밴티지 조건부 행동복제(advantage-conditioned behavioral cloning)' 단계를 이끄는데, 이는 기존 시연 데이터와 새로 수집한 데이터를 각 구간의 유용성에 따라 균형 있게 섞어 학습하는 방식입니다.
연구팀은 장기간에 걸친 다단계 작업과 정밀함이 요구되는 작업을 포함한 네 가지 실제 조작 과제에서 HIL-UMI를 시험했습니다. 단순 SFT 대비 HIL-UMI는 일관된 성능 향상을 보였고, 표적 데이터 수집과 어드밴티지 개선 두 요소 모두 각각 측정 가능한 기여를 했습니다. '테이블 정리(Clean Up Table)' 과제에서는 HIL-UMI가 실제 로봇 구동 중 사람이 감독·개입해야 하는 대표적 상호작용 모방학습 기법인 HG-DAgger보다 우수한 성능을 보였으며, 프레임당 데이터 수집 시간도 더 짧았습니다.
HIL-UMI는 데이터 수집 과정을 실제 로봇 구동과 분리하기 때문에, 연구진은 이를 VLA 정책의 사후 학습(post-training)을 더 확장성 있게 만드는 방법으로 제시합니다. 여러 명의 조작자가 서로 다른 장소에서, 목표 정책이 탑재된 실물 로봇 없이도 개선 데이터를 기여할 수 있게 될 가능성이 있다는 설명입니다.
arXiv에 게재된 이번 논문(arXiv:2609.20659)에는 Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai Li, Hui Shen, Hao Dong가 저자로 참여했습니다.
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.