최초 보도 9월 25일 — 원문보다 늦게 정리한 기사입니다.
카메라만으로 수중 로봇의 인양 작업을 '예측'하는 AI 등장
접촉 센서 없이 다중 카메라 영상과 제어 신호만으로 물체의 반응을 예측하는 수중 ROV용 세계 모델 C3-JEPA
arXiv에 게재된 한 논문에 따르면, 연구진이 수중 로봇이 정밀한 인양 작업 중 물체의 반응을 더 잘 예측할 수 있도록 돕는 새로운 AI 시스템을 공개했습니다. 'Underwater C3-JEPA'(교차 시점·제어 조건·맥락 확장 결합 임베딩 예측 구조)라는 이름의 이 모델은, 접촉 센서 없이 물체를 붙잡거나 다루어야 하는 근거리 중량물 무인 잠수정(ROV) 작업을 위해 설계되었습니다.
이 모델은 촉각 피드백 대신 여러 대의 카메라에서 동시에 촬영된 영상과 로봇 자체의 제어 신호를 활용합니다. 다중 카메라 영상을 '작업 대상 물체' 토큰과 '맥락' 토큰으로 각각 인코딩한 뒤, 연구진이 '홀드아웃 뷰 어텐션(held-out-view attention)'이라 부르는 방식으로 카메라 간 정보를 종합합니다. 이는 한 카메라가 실제로 관측한 내용과 다른 카메라들의 예측 결과를 서로 대조하는 방식입니다. 이를 바탕으로 모델은 수중 로봇의 움직임에 내재된 유체역학적 지연까지 고려해, ROV가 물체와 접촉할 때 그 상태가 어떻게 변할지를 직접 예측합니다.
주석(라벨링) 비용을 줄이기 위해 연구진은 '약한 결속(weak binding)'이라 이름 붙인 기법으로 대상 물체와 그리퍼(집게)의 위치를 고정하고, 'SIGReg'라는 방법을 함께 사용해 학습된 표현의 기하학적 정확도를 높였습니다.
논문에 따르면, 이렇게 학습된 내부 표현은 재구성 과정이 없는 비교 기준 모델보다 작업과 관련된 정보를 훨씬 더 많이 담고 있으면서도, 예측 모듈 자체는 가볍게 유지됩니다. 연구진은 이 예측 인터페이스가 여러 후보 행동을 미리 평가한 뒤 실행하는 모델예측제어(MPC)를 지원할 뿐 아니라, 실제 환경에서의 값비싼 시행착오 대신 '상상된' 시뮬레이션 경험을 통해 행동 에이전트를 학습시키는 데도 활용될 수 있다고 설명합니다.
중요한 점은 연구진이 시뮬레이션에만 머물지 않았다는 것입니다. 실제 수중 영상으로 검증한 결과, 동일한 구조가 학습 과정에서 의도적으로 제외했던 카메라의 물체 상태까지 복원해냈으며, 단순히 '아무 변화도 없다'고 가정하는 지속성(persistence) 기준선보다 더 나은 예측 정확도를 유지했습니다. 연구진은 이를 두고 이 방식이 통제된 실험 환경을 넘어서도 일반화될 수 있다는 근거라고 밝혔습니다.
Yuncong Yang과 공동 연구진이 작성한 이 논문은 12페이지, 14개의 그림으로 구성되어 있으며 IEEE 학술지 게재를 위해 제출된 상태입니다. 이는 접촉 감지가 제한적이고 물리적 역학을 직접 모델링하기 어려운 특수 로봇공학 분야에 JEPA 계열 세계 모델—보다 폭넓은 AI 연구에서 주목받아 온 아키텍처군—을 적용하려는 최근 연구 흐름에 합류하는 사례입니다.
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.