최초 보도 9월 24일 — 원문보다 늦게 정리한 기사입니다.
촉각과 소리까지 배우는 오픈소스 로봇 조작 플랫폼 'PolyUMI'
무선 핸드헬드 그리퍼로 시각·촉각·청각 데이터를 동시에 기록해 로봇에게 '접촉 감각'을 가르칩니다
로봇 조작 학습에 필요한 촉각과 소리, 시각 데이터를 손쉽게 모을 수 있는 오픈소스 플랫폼 'PolyUMI'가 공개됐습니다. arXiv(cs.RO)에 게재된 프리프린트(논문 번호 2609.29760v1)에 따르면, 이번 연구는 로봇이 접촉 상황을 사람처럼 감지하고 대응하도록 돕는 것을 목표로 합니다.
논문 설명에 따르면 현재 대부분의 모방 학습(사람의 시연 데이터를 보고 행동을 배우는 방식) 파이프라인은 주로 카메라 영상과 자기수용 감각(로봇 자신의 관절·팔다리 위치 정보)에 의존합니다. 문제는 미끄러짐이나 미세한 충돌처럼 눈으로 확인하기 어려운 접촉 사건들이 이 과정에서 빠지기 쉽다는 점입니다.
PolyUMI의 핵심 하드웨어는 사람이 손에 쥐고 직접 시연할 수 있는 가볍고 무선으로 작동하는 그리퍼입니다. 이 장치는 별도의 유선 워크스테이션 연결 없이도 손목 카메라 영상, 광학식 촉각 신호, 접촉 시 발생하는 소리, 자기수용 감각 데이터를 동시에 기록합니다. 특히 주목할 만한 설계는, 사람이 시연할 때 사용한 센서가 달린 '손가락' 부품을 그대로 로봇의 말단 장치(엔드 이펙터)에 옮겨 장착할 수 있다는 점입니다. 덕분에 데이터 수집 단계와 실제 로봇 구동 단계에서 센서가 감지하는 기하학적 구조가 그대로 유지됩니다.
이렇게 모은 다양한 감각 데이터를 효과적으로 활용하기 위해 연구진은 'VisTA'라는 토큰 단위 멀티모달 정책 모델도 함께 제안했습니다. 이는 서로 다른 종류의 센서 정보를 시간 흐름에 따라 통합해, 접촉 상황을 고려한 로봇 행동을 예측하는 머신러닝 모델입니다.
연구팀은 물체의 속성을 추론하는 과제, 잡기 도중 미끄러짐을 제어하는 과제, 접촉이 많이 발생하는 조작 과제 등 세 가지 유형의 실험으로 시스템을 검증했습니다. 논문에 따르면 촉각과 청각 신호는 시각 정보만으로는 알 수 없는 작업 관련 정보를 드러냈으며, VisTA는 이러한 실험들에서 기존 멀티모달 정책 방식과 대등하거나 더 뛰어난 성능을 보였습니다.
이번 연구는 Rickmer Krohn을 비롯한 연구진이 주도했으며, 2026년 9월 24일 제출된 9쪽 분량, 그림 10개로 구성된 프리프린트입니다. 저자들은 논문 내 프로젝트 페이지에서 더 자세한 내용을 제공한다고 밝혔으나, 초록 원문에서는 해당 링크를 직접 확인할 수 없었습니다. 연구팀은 다중 센서 하드웨어와 이에 맞는 정책 모델을 오픈소스로 함께 공개함으로써, 시각 정보에만 의존하던 기존 방식보다 더 풍부한 접촉 인식 데이터를 다른 연구실들도 손쉽게 수집할 수 있도록 하는 것이 목표라고 설명했습니다.
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.