최초 보도 9월 25일 — 원문보다 늦게 정리한 기사입니다.
사람의 짧은 개입으로 로봇 조작 학습 속도 높인 'Res-HIL'
고정된 모방학습 정책 위에 작은 보정 동작을 얹어 정밀한 로봇 조작 능력을 빠르게 향상시키는 새 프레임워크
마리아 이아보르스카이아(Mariia Iavorskaia) 연구원이 이끄는 연구팀이 사람의 개입을 활용해 정밀한 로봇 조작 기술을 더 쉽게 가르칠 수 있는 강화학습 프레임워크 'Res-HIL'을 제안했습니다. 이 내용은 논문 사전공개 사이트 arXiv(cs.RO 분야)에 게재된 논문을 통해 확인됐습니다.
현재 로봇의 정교한 조작 기술은 대부분 모방학습(imitation learning, 사람의 시연 영상을 보고 그대로 따라 하도록 학습시키는 방식)으로 훈련됩니다. 문제는 학습에 사용된 상황과 조금만 달라져도 로봇의 정책이 쉽게 실패한다는 점입니다. 논문에 따르면 이를 해결하려면 더 많은 시연 데이터를 모아야 하는데, 이는 상당한 시간과 인력을 필요로 합니다.
이에 대한 대안으로 사람이 온라인 학습 도중 실시간으로 보정 피드백을 주는 '휴먼인더루프(human-in-the-loop) 강화학습'이 있습니다. 하지만 논문은 기존 방식들이 이러한 개입만으로 로봇의 전체 작업 정책을 처음부터 새로 학습시키려 한다는 한계를 지적했습니다.
Res-HIL은 그 중간 지점을 택했습니다. 먼저 학습된 모방 정책은 고정한 채로 두고, 그 위에 작은 보정 동작만을 담당하는 별도의 '잔차(residual)' 정책을 새로 학습시키는 방식입니다. 사람이 학습 도중 개입할 때마다 그 순간은 두 가지 학습 신호를 동시에 만들어냅니다. 하나는 잔차 정책에 정확히 어떤 보정을 해야 하는지 직접 알려주는 지도 신호이고, 다른 하나는 그 직전 로봇의 자율 행동을 소급해서 평가하는 보상 재구성 신호입니다. 또한 잔차 정책을 처음에는 0으로 초기화해 온라인 학습 과정을 안정시키고 속도를 높였다고 연구팀은 설명했습니다.
연구팀은 정밀한 동작과 긴 흐름의 작업이 결합된 접촉이 많은 다섯 가지 조작 과제로 Res-HIL을 검증했습니다. 초기 시연 단 20회만으로 시작했음에도, Res-HIL은 온라인 학습 단 10분 만에 다섯 과제 모두에서 기존 최고 성능의 전체 정책 휴먼인더루프 강화학습 기법 및 사람의 개입 없이 잔차만 미세조정하는 기법을 뛰어넘었다고 논문은 밝혔습니다. 또한 Res-HIL은 자신이 출발점으로 삼은 사전학습 정책의 성능을 향상시켰고, 시연 데이터를 5배 더 많이 사용한 모방학습 정책보다도 더 나은 결과를 보였다고 설명했습니다.
논문에 포함된 분해 실험(ablation study)에서는 각 설계 요소의 기여도를 따로 확인했습니다. 그 결과 잔차 정책에 대한 직접적인 지도 신호가 전체 성능에 핵심적인 요소였으며, 개입 인식 기반 보상 재구성 요소는 그 자체로는 덜 중요했지만 학습 효율을 크게 끌어올리는 데 기여했습니다.
이번 연구는 모방학습의 손쉬운 활용성과 강화학습의 온라인 보정 능력 사이의 간극을 좁히려는 연구 흐름에 힘을 보태는 사례입니다. 전체 시연이나 정책 전체 재학습 대신 작고 목표가 뚜렷한 보정에 사람의 노력을 집중시킴으로써, Res-HIL과 같은 접근법은 정밀함이 중요한 접촉 중심 작업에서 실제 로봇에 정교한 조작 기술을 배치하는 비용을 낮출 수 있을 것으로 보입니다. 구체적인 과제 구성, 로봇 하드웨어, 정량적 수치 결과는 arXiv 사전공개 논문 전문에 담겨 있습니다.
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.