원문 공개 10월 3일
SNAP: 신시점 합성을 통한 기하학적 학습
연구진은 신시점 합성(NVS)을 활용해 강력한 3D 기하학적 표현을 학습하는 자체 학습 모델 SNAP을 제안했습니다. 디코더의 표현력을 제한하고 잠재 공간 재구성 목표를 사용함으로써, 5가지 로봇 및 비전 작업에서 기존 방법들을 능가하는 성능을 보였습니다.
연구 레인 · arXiv
AI가 요약한 로봇 연구 논문. 하루 최대 2편은 메인 피드에도 실립니다. 요약은 arXiv 초록 페이지(제목·저자·초록)를 바탕으로 AI가 작성하며, 논문 PDF와 그림은 옮기지 않습니다. 총 74편.
원문 공개 10월 3일
연구진은 신시점 합성(NVS)을 활용해 강력한 3D 기하학적 표현을 학습하는 자체 학습 모델 SNAP을 제안했습니다. 디코더의 표현력을 제한하고 잠재 공간 재구성 목표를 사용함으로써, 5가지 로봇 및 비전 작업에서 기존 방법들을 능가하는 성능을 보였습니다.
원문 공개 10월 3일
연구진은 단일 스테레오 카메라로 정밀한 양손 조작을 수행하는 EyeRobot 2.0을 소개합니다. 3D 고정점에 시선을 집중시키고 이미지 중앙에 더 많은 계산 자원을 할당하는 능동 시선 고정(AVF) 방식을 사용합니다. 실제 로봇 실험에서 수동 스테레오 대비 40% 높은 성공률을 기록했으며, 손목 카메라가 가려진 상황에서는 손목 카메라 정책을 능가했습니다.
원문 공개 10월 2일
연구진은 모델 가중치를 업데이트하지 않고 로봇 조작 능력을 개선하는 RPG 프레임워크를 제안했습니다. 시뮬레이션에서 연습 과제를 생성하고 심볼릭 스킬을 정제하는 방식으로, 15라운드 연습 후 성공률이 95.0%에 도달했으며 물리적 시험 30회 모두 성공했습니다.
원문 공개 10월 2일
연구진은 다중 로봇 협동을 위한 분산 계층형 프레임워크 DuoMind를 제안했습니다. 각 로봇에 VLM 기반 오케스트레이터와 VLA 기반 액션 모델을 배치하고, 새로운 벤치마크 RoboPoly로 성능을 검증했습니다.
원문 공개 10월 2일
연구진은 휴머노이드 로봇의 도구 사용 능력을 평가하기 위한 18개 태스크 벤치마크 'HumanoidToolBench'와 3.1k 시연 데이터셋 'ToolBook'을 소개했습니다. 시뮬레이션과 실물 로봇 평가 결과, 도구 선택과 태스크 완료 사이에 상당한 격차가 있음을 확인했습니다.
원문 공개 10월 1일
연구진은 자체 생성된 궤적에 대한 상대적 선호도만으로 사전 학습된 로봇 정책을 유도하는 PrefPI 프레임워크를 제안했습니다. 이 방법은 초기 정책에서 드물게 관찰되는 동작으로의 전환을 목표로 합니다. 실제 하드웨어 테스트에서 150개의 선호도 라벨링 궤적만으로 물체 운반 높이를 10.7cm에서 19.8cm로 높였습니다.
원문 공개 10월 1일
연구진은 영상 생성 모델(VGM)의 시공간 선험 지식을 로봇 제어에 활용하기 위해, 관절 구성을 가상 카메라로 렌더링하는 '액션 뷰'를 제안했습니다. RoboTwin 2.0에서 88.98% 성공률, TriWorldBench에서 65.66점을 기록했습니다.
원문 공개 10월 1일
연구진은 촉각 피드백을 탐색에 활용하는 TacEx 프레임워크를 제안했습니다. 이 방법은 작업 보상이나 전문가 시연 없이도 로봇이 조작 기술을 더 효율적으로 학습할 수 있도록 돕습니다.
원문 공개 9월 30일
연구진은 모델 가중치를 재학습하지 않고 코딩 에이전트로 로봇 행동을 프로그래밍하는 ASENA를 제안했습니다. 4B 파라미터 내비게이션 정책과 결합하여 표준 벤치마크에서 최상위 성과를 기록하고, 반복적 자기 수정으로 성능을 높였습니다.
원문 공개 9월 30일
연구진은 동적 환경에서 로봇의 조작 능력을 향상시키기 위해 DSDyn-VLA라는 이중 스트림 프레임워크를 제안했습니다. 시뮬레이션과 실세계 모두에서 기존 방법 대비 성능이 크게 개선된 것으로 보고되었습니다.
원문 공개 9월 30일
연구진은 LocoWM을 제안하며, 이는 기반 보행 정책과 세계 모델을 결합하여 미래 물리적 상태를 예측합니다. 잔차 어댑터는 이 예측을 기반으로 보정 동작을 생성하여 정밀도와 강인성을 향상시킵니다.
원문 공개 9월 30일
연구진은 시각-언어-행동(VLA) 모델의 성능을 저하시키는 '보편적 적대적 객체'를 제안했습니다. 이는 표면 텍스처가 최적화된 구형 물체로, Pi0와 RDT 모델의 평균 작업 성공률을 31.2%에서 39.9%까지 낮추는 것으로 보고되었습니다.
원문 공개 9월 30일
연구진은 시각 입력 장애 상황에서의 VLA 모델 동작을 분석했습니다. 작업 성공률이 비슷하더라도 블랙아웃과 정지는 서로 다른 물리적 실패 모드를 유발하며, 이는 로봇의 안전에 중요한 영향을 미칩니다.
원문 공개 9월 30일
연구진은 세계-행동 모델(WAM)을 위한 4비트 양자화 프레임워크 SteerQuant를 제안했습니다. 이 방법은 최종 행동에 영향을 덜 미치는 계산에 오류를 유도하여, 시뮬레이션에서 최대 2.23배, 실제 로봇에서 1.35배의 추론 속도 향상을 달성했습니다.
Rho 팀은 양팔 조작을 위한 오픈웨이트 VLA 모델 Rho를 발표했습니다. 연구진에 따르면 YAM Box, UR AI Trainer, FR3 Duo를 위한 Rho 변형 모델은 시뮬레이션 및 실물 로봇 실험에서 기존 오픈웨이트 VLA 모델과 동등하거나 우수한 성능을 보였습니다. 또한 15회 정정 에피소드만으로 온라인 적응이 가능하다고 보고했습니다.
원문 공개 9월 30일
연구진은 사전 학습된 DINO 기능을 활용하여 로봇 정책 학습을 개선하는 ReWAM 모델을 제안했습니다. 이 모델은 RoboTwin 2.0에서 93.6%의 성공률, RoboDojo에서 8.28%의 성공률을 기록하며, 생성형 비디오 사전 학습 없이도 강력한 성능을 보여주었습니다.
원문 공개 9월 30일
연구진은 크로스BFM을 통해 여러 휴머노이드 로봇에 공통된 잠재 동작 공간을 생성하는 프레임워크를 제안했습니다. 이 방법은 학습 비용을 수백 GPU-시간에서 1시간 미만으로 줄이고, 로봇 간 동작 추적 및 목표 도달 기술을 이전할 수 있게 합니다.
원문 공개 9월 30일
연구진은 WorldLine을 소개하며, 이는 10,000시간 이상의 액션 없는 로봇 영상에서 동역학을 학습하고 10개 이상의 로봇 플랫폼에서 2,000시간 이상의 액션 궤적으로 이를 접지합니다. RoboTwin과 AgiBot에서 평균 74%의 성공 예측 정확도를 보이며, 도메인 외 설정에서 직접 정책 실행보다 작업 성공률을 최대 21.4%p 높였습니다.
원문 공개 9월 30일
연구진은 EVO-WAM이라는 프레임워크를 제안하여, 추가 전문가 데모 없이 로봇 정책을 새로운 작업에 적응시킵니다. 생성된 영상-행동 쌍의 일관성을 검증하여 모델을 반복적으로 개선하는 방식입니다. 시뮬레이션과 실세계 모두에서 성공률이 크게 향상된 것으로 보고됩니다.
원문 공개 9월 30일
연구진은 인간 데모를 휴머노이드 로봇의 학습 신호로 변환하는 EgoAlign 프레임워크를 제안했습니다. 시뮬레이터 피드백을 활용해 인간과 로봇의 차이를 조정하며, 물리적 로봇 데모 없이 제로샷 배포가 가능하도록 합니다.
연구진은 DexRoam 시스템을 제안하며, 이는 에고센트릭(1인칭) 인간 데모로부터 이동형 양손 민첩 조작을 학습합니다. 무트래커 캡처 시스템과 3단계 정렬을 통해 정밀한 전신 동작을 보존하여, GR00T N1.7에서 평균 성공률을 29%에서 56%로, pi0.5에서 32%에서 57%로 높였습니다.
원문 공개 9월 29일
연구진은 운동학 루프와 결합 구동기를 가진 로봇을 위한 그래프 네이티브 프레임워크 RoboCompiler를 제안했습니다. Kangaroo 로봇에서 잔차 및 야코비안 평가 시간을 96.7% 줄이는 성과를 보고했습니다.
연구진은 휴머노이드 로코-마니퓰레이션(이동-조작)을 위한 이산형 비전-언어-액션(VLA) 모델 Holo-M을 제안했습니다. 통합 액션 토크나이저와 그룹 이산 확산 디코딩을 사용해 SIMPLE 벤치마크에서 가장 높은 성공률을 기록했습니다.
원문 공개 9월 29일
연구진은 로봇 팔과 기저부 동작을 조율하기 위해 MM-ABC라는 기반 모델을 제안했습니다. 이 시스템은 다양한 시뮬레이션 벤치마크와 실세계 작업에서 높은 성공률을 기록했습니다.
원문 공개 9월 29일
연구진은 3D 가우시안 스플래팅(3DGS) 씬에서 직접 작동하는 GPU 가속 거리 메트릭인 CollisionSplatting을 제안했습니다. 이 메트릭은 학습된 이미지 조건 보상 함수와 결합하여, 높은 처리량과 낮은 메모리 사용량으로 충돌 인식 및 시각적 계획을 동시에 수행합니다.
원문 공개 9월 29일
연구진은 VLA 모델의 데모 커버리지 한계를 극복하기 위해 F4R을 제안했습니다. 실제 실패를 시뮬레이션 환경으로 재구성해 정책을 개선하며, 4개 조작 작업에서 OOD 성공률 90.0%를 기록했습니다. 이는 추가 실데이터 수집 없이 베이스라인 대비 18.75%p 높은 성과입니다.
원문 공개 9월 25일
연구진이 모델예측제어(MPC)를 위한 새로운 세계모델(world model) 'AD-WM'을 공개했습니다. 이 모델은 단순히 다음 상태를 예측하는 데 그치지 않고 서로 다른 행동 후보를 명확히 구분하도록 학습되어, 시뮬레이션 조작 과제 성공률을 크게 높였고 실제 프랑카(Franka) 로봇팔에서도 물건 집기 성공률을 42.2%에서 71.1%로 끌어올렸습니다.
원문 공개 9월 25일
연구진이 단 한 번의 사람 시연 영상만으로 로봇 제어 프로그램을 생성, 검증, 수정하는 시스템 'RAPID'를 공개했습니다. 시뮬레이션 속 접촉이 많은 조작 작업과 실제 프랑카(Franka) 로봇팔 실험에서 물체의 위치, 형태, 재질, 환경이 달라져도 일반화 성능을 보였습니다.
원문 공개 9월 25일
연구진이 로봇의 행동과 예상 영상을 함께 예측하는 '월드 액션 모델(WAM)'의 새로운 방식인 롤링-WAM을 공개했습니다. 매 주기마다 전체를 처음부터 다시 계산하는 대신 단계적으로 노이즈를 제거하는 방식으로, LIBERO·RoboTwin 시뮬레이션과 실제 유니트리(Unitree) G1 휴머노이드 실험에서 기존 방식과 비슷한 조작 성능을 유지하면서 재계획 속도를 4.5배 높였습니다.
원문 공개 9월 25일
연구진이 무인 잠수정(ROV)의 중량물 인양 작업을 돕는 예측형 AI 모델 'Underwater C3-JEPA'를 발표했습니다. 이 모델은 접촉 센서 없이 여러 대의 카메라 영상과 로봇의 제어 신호만을 이용해 물체의 상태 변화를 잠재 공간에서 예측하며, 향후 모델예측제어(MPC) 등에 활용될 수 있습니다.