최초 보도 9월 24일 — 원문보다 늦게 정리한 기사입니다.
끊임없이 작동하는 로봇, 지켜보고 기억하며 동시에 움직인다
사전학습된 백본에 경량 모듈을 더한 ARMS, 두 팔 로봇이 멈추지 않고 여러 작업을 동시 처리하도록 지원
대부분의 로봇 행동 모델은 정돈된 환경을 가정하고 학습됩니다. 하나의 지시가 주어지고, 중간에 방해가 없으며, 한 번에 한 단계씩만 추론하면 되는 상황입니다. 하지만 실제 현장은 이렇게 단순하지 않습니다. 항상 켜져 있는 로봇은 지시가 도착하고 사라지는 상황, 장면이 계속 바뀌는 상황, 그리고 자신이 이전에 취한 행동이 다음에 추론해야 할 내용을 바꿔놓는 상황까지 모두 다뤄야 합니다.
arXiv에 게재되고 제10회 로봇러닝학회(CoRL 2026)에 채택된 새 논문은 이 문제를 정면으로 다룹니다. 연구진이 제안한 시스템 ARMS(Always-on Robot in Multi-modal Streams, 멀티모달 스트림 속에서 항상 작동하는 로봇)는 저자들의 표현대로 "의도적으로 단순한 스트리밍 정책"입니다. 완전히 새로운 구조를 설계하는 대신, 연구진은 사전학습된 하나의 π0.5(파이제로점오) 백본에 세 가지 경량 모듈을 추가했습니다. 이 모듈들은 매 행동 결정 전에 실시간 인지 정보, 로봇의 신체 상태 정보, 그리고 로봇 자신의 과거 행동 기록을 백본이 읽을 수 있는 맥락으로 변환해 전달합니다.
핵심 설계는 비동기성입니다. 논문에 따르면 이 맥락 수집 모듈들은 백그라운드에서 갱신되기 때문에, 장면을 '지켜보는 것'과 과거 행동을 '기억해내는 것'이 로봇의 실제 행동을 막지 않습니다. 이는 두 팔이 서로를 기다리지 않고 동시에 움직여야 하는 양팔 로봇 시스템에서 특히 중요합니다. 어느 팔이 무엇을 했는지 추적하기 위해 ARMS는 저자들이 '에이전트-인과적 자기 이력(agent-causal self-history)'이라 부르는, 각 팔의 행동과 시점을 기록하는 로그 체계를 함께 사용합니다.
이런 시스템을 학습시키려면 보통 방대한 수동 라벨링이 필요하지만, 연구진은 실제 양팔 원격조작(teleoperation) 데이터를 기반으로 ARMS 전용 데이터셋을 구축해 이를 피했습니다. 이 데이터셋은 단계별 구축 스크립트가 데이터 수집 과정에서 각 모듈에 필요한 라벨을 자동으로 생성하도록 설계되어, 추가적인 수작업 라벨링 없이도 모든 모듈을 지도학습할 수 있습니다.
결합 평가 과제에서 ARMS는 45%의 성공률을 기록했습니다. 이는 연구진이 비교한 네 가지 주요 베이스라인 모델 중 가장 강력한 모델의 28%보다 크게 앞선 결과로, 지시가 계속 도착하고 겹치는 벤치마크에서는 상당한 차이입니다. 구성요소별 제거(ablation) 실험 결과도 설계를 뒷받침했습니다. 메모리 모듈, 신체 상태 헤드, 비동기 동시성 메커니즘을 각각 제거했을 때 성능이 모두 저하됐으며, 이는 세 요소 모두가 실제로 유의미한 역할을 하고 있음을 보여줍니다.
주저자 Ding Yi 등이 제출한 이 논문은 로봇이 개별 명령 사이에 리셋되는 방식이 아니라 개방된 환경에서 지속적으로 작동할 수 있도록 만드는 것을 목표로 합니다. 로봇이 정해진 시나리오의 시연을 넘어 실제 현장에서 장시간 운용되는 방향으로 나아가면서, 이러한 능력은 점점 더 중요해지고 있습니다.
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.