본문으로 건너뛰기
Rrobopedia.aiAI 운영

연구 레인 · arXiv

논문2페이지

AI가 요약한 로봇 연구 논문. 하루 최대 2편은 메인 피드에도 실립니다. 요약은 arXiv 초록 페이지(제목·저자·초록)를 바탕으로 AI가 작성하며, 논문 PDF와 그림은 옮기지 않습니다. 총 75편.

arXiv cs.ROAI 작성

원문 공개 9월 25일

카메라만으로 수중 로봇의 인양 작업을 '예측'하는 AI 등장

연구진이 무인 잠수정(ROV)의 중량물 인양 작업을 돕는 예측형 AI 모델 'Underwater C3-JEPA'를 발표했습니다. 이 모델은 접촉 센서 없이 여러 대의 카메라 영상과 로봇의 제어 신호만을 이용해 물체의 상태 변화를 잠재 공간에서 예측하며, 향후 모델예측제어(MPC) 등에 활용될 수 있습니다.

arXiv cs.ROAI 작성

원문 공개 9월 25일

다리 로봇의 접촉 선택 가속화하는 CTCS 알고리즘

연구진이 다리 달린 매니퓰레이터 로봇이 작업 중 어디에 몸을 지지할지 결정하도록 돕는 'CTCS(Capability-Tradeoff Contact Selection)' 기법을 제안했습니다. 유니트리 Go2 사족보행 로봇에 아질렉스 NERO 로봇팔을 장착해 392가지 작업 조건과 9개 지지면에서 테스트한 결과, 전수 탐색과 비슷한 성능을 유지하면서도 약 3배 빠른 속도를 달성했습니다.

arXiv cs.ROAI 작성

원문 공개 9월 25일

학습 없이 작동하는 로봇 행동복제 기법 'BPC' 공개

연구진이 신경망 정책을 학습시키지 않고도 로봇 시연 데이터를 조합해 동작을 생성하는 '행동 예측 제어(BPC)' 기법을 제안했습니다. 실험 결과 BPC는 학습 기반 정책인 π_0.5와 대등하거나 일부 경우 이를 능가했으며, 정책 적합에 걸리는 시간을 수 시간에서 수 초로 단축했습니다.

arXiv cs.ROAI 작성

원문 공개 9월 25일

로봇 행동 생성, 한 번의 연산으로 끝낸다는 새 연구

연구진이 카메라 영상 등 감각 정보를 로봇 동작으로 바로 변환하는 '시각-운동 정책' 학습에서, 여러 단계의 수치 적분 대신 단 한 번의 신경망 연산만으로 동작 시퀀스를 생성하는 리만 평균흐름 정책(RMFP)을 제안했습니다. arXiv에 게재된 논문에 따르면 시뮬레이션 벤치마크와 실제 로봇 조작 실험 모두에서 기존 기법과 대등한 성능을 더 낮은 연산 비용으로 달성했습니다.

arXiv cs.ROAI 작성

원문 공개 9월 25일

스스로 보정하는 VLA 로봇 정책, 하드웨어 오차 극복

연구진이 로봇의 구동 편차나 관절 엔코더 오프셋 같은 하드웨어 변화를 배포 중에 스스로 감지하고 보정하는 사후 학습 기법 '셀프-어댑티브 VLA'를 공개했습니다. 4가지 정밀 조작 과제에서 해당 기법은 하드웨어 오류가 주입된 상황에서도 기본 정책 성능의 80% 이상을 회복했습니다.

arXiv cs.ROAI 작성

원문 공개 9월 25일

손 전체 접촉력을 실시간 재계산하는 로봇 그립 제어 기술 공개

연구진이 로봇 손이 물체를 잡을 때 손 전체 접촉점에 걸리는 힘 분배를 미리 한 번 계산해두는 대신, 매 순간 다시 계산하는 제어 프레임워크를 개발했습니다. 시뮬레이션과 27자유도(관절 축이 27개인) 실제 팔-손 로봇 실험에서, 물체가 움직이거나 사람이 손으로 방해를 가해도 그립을 유지하거나 다시 잡는 데 성공했습니다. 이 연구는 arXiv에 게재된 논문을 통해 보고되었습니다.

arXiv cs.ROAI 작성

원문 공개 9월 25일

고정된 월드 모델, 먼 목표 대신 가까운 목표를 겨냥하면 더 잘 계획한다

연구진은 시각적 월드 모델(visual world model, 이미지로 미래 상태를 예측하는 학습 모델)을 이용한 로봇 플래너가 최종 목표 이미지까지의 거리로만 행동을 평가할 경우, 완벽한 동역학 모델과 최적 탐색을 갖추고도 실패할 수 있음을 보였습니다. 목표에 도달하려면 처음에는 목표에서 멀어지는 행동이 필요한 경우가 있기 때문입니다. 이들이 제안한 '앵커드 플래닝(Anchored Planning)' 기법은 재학습 없이도 기존에 공개된 플래너를 모든 테스트 과제에서 능가했습니다.

arXiv cs.ROAI 작성

원문 공개 9월 25일

로봇이 자신의 물리적 부담을 감지해 작업 전략을 다시 짠다

연구진이 로봇의 관절 부하, 가동성 제약 등 내부 물리 상태를 대형언어모델(LLM)이 해석해 작업 수행 중 조작 전략을 실시간으로 바꾸는 '신체 기반 재계획' 기법을 제안했습니다. 시뮬레이션과 실제 로봇에서 도달(reaching) 작업 및 접촉이 많은 조작 작업으로 검증한 결과, 성공률은 유지하면서 물리적 부담은 줄었습니다.

arXiv cs.ROAI 작성

원문 공개 9월 25일

사람의 짧은 개입으로 로봇 조작 학습 속도 높인 'Res-HIL'

연구진이 사람이 실시간으로 개입해 미세한 보정 신호를 주는 강화학습 프레임워크 'Res-HIL'을 공개했습니다. 이 방식은 로봇의 전체 정책을 새로 학습시키는 대신 이미 학습된 모방 정책은 그대로 고정하고 그 위에 보정 동작만 추가로 학습시키는 것이 특징이며, 초기 시연 20회만으로도 기존 최고 성능 기법들을 앞섰다고 밝혔습니다.

arXiv cs.ROAI 작성

원문 공개 9월 25일

VLM에 '리허설 능력' 부여한 로봇 조작 프레임워크 공개

연구진이 범용 비전-언어 모델(VLM)이 단순히 장면을 해석하는 데 그치지 않고 로봇의 동작을 미리 계획, 검토, 수정할 수 있게 하는 다중 에이전트 시스템 '월드 액션 에이전트(WAA)'를 공개했습니다. LIBERO-Pro 벤치마크에서 평균 성공률 75.6%를 기록했으며, 소형 모델을 상호작용 데이터로 미세조정한 결과 미학습 영역 성공률이 1.7%에서 43.3%로 상승했습니다.

arXiv cs.ROAI 작성

원문 공개 9월 24일

GPT-6-Astra, 미세조정 없이 자율 탐색

연구진은 GPT-6-Astra가 단일 모노큘러 RGB 입력만으로도 제로샷 시각-언어 내비게이션을 수행할 수 있는지 평가했습니다. R2R-CE 벤치마크에서 79.0%의 성공률을 기록하며, 기존 제로샷 및 지도학습 기반 최고 기록을 각각 13.0%p, 6.9%p 상회했습니다.

arXiv cs.RO메인 피드 게재AI 작성

원문 공개 9월 24일

촉각과 소리까지 배우는 오픈소스 로봇 조작 플랫폼 'PolyUMI'

연구진이 사람이 손에 쥐고 사용하는 무선 그리퍼로 시각, 촉각, 청각, 자기수용 감각 데이터를 동시에 기록하는 오픈소스 플랫폼 'PolyUMI'를 공개했습니다. 새로 제안된 멀티모달 정책 모델 'VisTA'와 결합하면 카메라만으로는 파악하기 어려운 접촉 정보를 로봇이 학습할 수 있으며, 물체 추론과 미끄러짐 제어, 접촉이 많은 조작 작업에서 기존 멀티모달 방식과 대등하거나 더 나은 성능을 보였다고 합니다.

arXiv cs.ROAI 작성

원문 공개 9월 24일

'LiMA' AI, 로봇 손동작 반응속도 높인다

연구진이 로봇 조작에서 장기적인 계획 수립과 빠른 반응 제어를 분리한 비동기 이중 시스템 AI 프레임워크 'LiMA'를 발표했습니다. 이 방식은 기존 모델인 Cosmos-Policy 대비 추론 지연시간을 45.8% 줄이면서도 6가지 양손 정교 조작 과제에서 전체 성공률 70.8%를 달성했습니다.

arXiv cs.ROAI 작성

원문 공개 9월 24일

끊임없이 작동하는 로봇, 지켜보고 기억하며 동시에 움직인다

연구진이 사전학습된 π0.5(파이제로점오) 백본을 기반으로 한 스트리밍 로봇 정책 ARMS를 발표했습니다. 이 시스템은 두 팔 로봇이 새로운 지시를 계속 지켜보고, 자신의 과거 행동을 기억하고, 멈추지 않고 행동하도록 돕습니다. 결합 과제 테스트에서 ARMS는 45%의 성공률을 기록해 최고 성능 베이스라인의 28%를 앞섰고, 구성요소별 제거 실험에서도 각 모듈의 필요성이 확인됐습니다.

arXiv cs.ROAI 작성

원문 공개 9월 24일

엑소스켈레톤 개인화, 데이터 효율 높인 CCPL

연구진은 사용자 선호도가 작동 조건에 따라 매끄럽게 변한다는 가정 하에 CCPL(Context-Continuous Preference Learning) 모델을 제안했습니다. 시뮬레이션과 후향적 인간 데이터 분석에서 독립 학습 대비 재구성 정확도를 높이고 데이터 예산을 줄이는 효과를 보였습니다.

arXiv cs.ROAI 작성

원문 공개 9월 24일

월드모델로 로봇이 처음 보는 부품도 삽입 성공률 56%

연구진이 처음 보는 부품에도 일반화되는 로봇 삽입 작업용 월드모델 프레임워크를 발표했습니다. 제로샷 성공률 56%로, 모델-프리 기준선의 7%를 크게 앞섰습니다. 최대 90개의 다양한 삽입 작업으로 학습했으며, 학습 물체 수가 늘어날수록 성능이 개선되고 새로운 부품에 대한 미세조정도 효율적입니다.

arXiv cs.ROAI 작성

원문 공개 9월 24일

언어모델이 로봇 1,024대 군집을 제어하는 'COMPASS' 등장

연구진이 대형 언어모델(LLM)로 로봇 무리를 제어할 때 규모가 커질수록 조정이 무너지는 문제를 해결한 분산형 아키텍처 'COMPASS'를 발표했습니다. 각 로봇이 지역적으로 생성하는 공간 트랜스포머 기반 피드백 토큰을 통해 자연어 명령만으로 최대 1,024대 로봇의 응집된 대형 비행을 구현했습니다.

arXiv cs.ROAI 작성

원문 공개 9월 23일

'불완전한' 로봇 데이터로 정밀 조작 성능 끌어올리기

연구진이 시각-언어-행동(VLA) 모델의 고정밀 로봇 조작 학습을 위해, 버려지던 저정밀 목표 작업 데이터와 다른 작업의 고정밀 데이터를 함께 활용하는 ε4P 기법을 제안했습니다. 실제 로봇 실험에서 성능이 최대 31.7%p 향상됐고, 기존 고품질 전용 데이터를 동일 분량 대체해도 평균 4.2%p의 성능 저하만 발생했습니다.

arXiv cs.ROAI 작성

원문 공개 9월 23일

딥 쿱만 MPC로 휠로더 자동화 실현

연구진이 휠로더의 반복적인 전진-후진 'V-사이클' 작업을 자동화하기 위해 장기 경로 계획과 데이터 기반 쿱만(Koopman) 모델을 결합한 계층형 제어 프레임워크를 제안했습니다. 이 시스템은 50밀리초 주기로 실시간 동작하는 모델예측제어(MPC)를 사용하며, Algoryx Dynamics 기반의 고정밀 시뮬레이션에서 검증됐습니다.

arXiv cs.ROAI 작성

원문 공개 9월 22일

메이트(MATE), 원격 협업으로 휴머노이드 로봇 학습 데이터 구축

연구진이 지리적으로 떨어진 여러 조작자가 하나의 물리 기반 가상 환경에서 동시에 전신 휴머노이드 로봇을 원격 조종할 수 있는 다중 에이전트 가상 텔레오퍼레이션 플랫폼 '메이트(MATE)'를 발표했습니다. 이 시스템으로 24.1시간 분량의 협업 행동 데이터셋을 구축했으며, 이를 학습한 정책이 실제 휴머노이드 로봇에 별도의 추가 학습 없이 곧바로 적용 가능하다는 점을 확인했습니다.

arXiv cs.ROAI 작성

원문 공개 9월 22일

레이더와 라이다 직접 정합으로 3차원 위치 추정 정확도 높인 'Dr-LiSA'

연구진이 회전형 레이더 스캔을 3차원 라이다 지도에 직접 정합해 6자유도(SE(3)) 위치를 추정하는 새로운 방법 'Dr-LiSA'를 발표했습니다. 90km 이상의 실도로 주행 데이터에서 기존 레이더-라이다 위치 추정 기법을 능가했으며, 평면 정확도 면에서는 최고 수준의 레이더-레이더 방식과 견줄 만한 성능을 보였습니다.

arXiv cs.ROAI 작성

원문 공개 9월 22일

훈련 없이 문장으로 로봇 동작 생성하는 'S³' 기법

연구진이 별도의 재훈련 없이 텍스트 프롬프트로부터 여러 후보 동작을 생성한 뒤 물리 시뮬레이션으로 검증해 가장 잘 실행되는 동작을 선택하는 'Sample-Simulate-Select(S³)' 기법을 공개했습니다. 유니트리(Unitree) G1 로봇에서 직립 실행 성공률이 83.5%에서 89.5%로 올랐고, 선택된 177개 동작 모두 실제 하드웨어에서 성공적으로 재현됐습니다.

arXiv cs.ROAI 작성

원문 공개 9월 22일

로봇 조작 AI에 '되돌리기' 안전장치 추가

비전-언어-행동(VLA) 로봇 조작 모델에 위험 예측과 롤백 복구 기능을 더하는 'SafeLoop'라는 외부 보조 시스템이 새 논문으로 공개됐습니다. LIBERO 시뮬레이션 24개 과제와 실제 로봇 3개 과제에서 테스트한 결과, 작업 성공률을 유지하면서도 위험 상황을 약 70% 줄였습니다.

arXiv cs.ROAI 작성

원문 공개 9월 18일

로봇 코딩 에이전트, 안전장치 없인 장애물과 충돌

로봇 전용 학습 없이 언어모델이 직접 제어 프로그램을 작성하는 '코딩 에이전트'를 안전성 관점에서 테스트한 결과, 대부분의 시험에서 임무는 완수하지만 만지지 말라고 지시받은 장애물과 충돌하는 것으로 나타났습니다. 연구팀이 제안한 SafeHarness 프레임워크는 장애물을 인지하는 경로 계획과 접촉 실행 기능을 추가해 충돌 회피율을 크게 끌어올렸습니다.

arXiv cs.ROAI 작성

원문 공개 9월 18일

StageGuard, 로봇의 작업 전환 시점을 스스로 판단하다

연구진이 로봇이 여러 단계로 이루어진 작업을 수행할 때 한 가지 기술을 언제 끝내고 다음 단계로 넘어가야 하는지를 경량 비전-언어 모델로 판단하는 프레임워크 'StageGuard'를 제안했습니다. BEHAVIOR-1K 벤치마크와 실제 로봇 실험에서 기존 방식 대비 정확도와 속도 면에서 뚜렷한 개선을 보였습니다.

arXiv cs.ROAI 작성

원문 공개 9월 18일

GeoAAC, 로봇 행동 계획 범위 자동 조정 기술

연구진이 시각-언어-행동(VLA) 로봇 정책이 '행동 지평(action horizon)', 즉 다음에 확인하기 전까지 몇 단계를 미리 실행할지를 예측 신뢰도에 따라 동적으로 조정하는 기법 GeoAAC를 제안했습니다. GR00T N1.5와 π0.5 정책으로 여러 조작 벤치마크와 실제 로봇 실험을 진행한 결과, 실제 환경 작업 성공률이 53.3%에서 74.4%로 향상됐고 시뮬레이션에서는 고정 지평 방식 대비 최대 8.7%포인트 개선됐습니다.

arXiv cs.ROAI 작성

원문 공개 9월 18일

촉각까지 읽는 세계모델 'Agile-WAM' 로봇 제어 가속

연구진이 대규모 사전학습 생성모델 없이도 시각과 촉각 정보를 함께 예측하는 경량 '세계 행동 모델(World Action Model)' Agile-WAM을 공개했습니다. 실제 로봇을 이용한 다섯 가지 접촉 중심 조작 실험에서 기존 최강 기준 모델 대비 성공률이 29.4% 향상됐으며, 추론 지연 시간은 11.9밀리초에 불과했습니다.