최초 보도 9월 30일 — 원문보다 늦게 정리한 기사입니다.
코딩 에이전트로 로봇 내비게이션
LLM이 코드를 작성해 로봇을 제어하는 ASENA 프레임워크, 벤치마크 성능 대폭 향상
요약
출처: arXiv cs.RO · 2026년 9월 30일 공개
연구진은 ASENA라는 프레임워크를 소개했습니다. 이 시스템은 대규모 언어 모델(LLM)을 물리적 로봇 기능과 연결합니다. 신경망을 다시 학습하는 대신, 코딩 에이전트가 센싱과 이동을 위한 실행 가능 코드를 생성하고 테스트하며 디버깅합니다. 이 구조는 영구적 메모리를 지원하여 에이전트가 성공한 전략을 저장하고, 기록된 결과를 바탕으로 오류를 수정할 수 있게 합니다.
핵심 구성 요소인 ASENA-VLN은 로봇의 몸체 좌표계에서 궤적을 예측하는 40억 파라미터의 단안 정책입니다. 경로 지시, 시각 질문, 그리고 새로운 기하학적 원자 작업 데이터셋으로 학습된 이 모듈은 코딩 에이전트의 도구로 사용됩니다. 단독 모델로서 R2R에서 68.7%, RxR에서 70.2%의 성공률을 보고합니다. 코딩 에이전트와 결합되면 내비게이션 기술이 에이전틱 벤치마크에서 전체 성공률을 11%p 높이고 실행 시간을 줄입니다. 100개 작업 부분집합에 대한 10회의 반복을 통해 R2R 성공률은 72%에서 98%로, RxR은 65%에서 89%로 상승합니다. Unitree G1을 활용한 실세계 테스트에서는 지도 없이 탐색, 검사, 제스처 합성을 수행했습니다.
의의
전통적인 임바디드 내비게이션은 새로운 지시나 복잡한 추론에 취약한 고정된 정책에 의존하는 경우가 많습니다. ASENA는 제어를 코딩 에이전트로 이동시켜 내비게이션을 소프트웨어 엔지니어링 문제로 다룹니다. 이는 LLM을 동적으로 하위 기술을 구성하는 고수준 플래너로 사용하는 더 큰 추세를 반영합니다. 그래디언트 업데이트가 아닌 코드 실행을 통한 자기 수정 능력은 더 적응적이고 투명한 로봇 행동으로 가는 길을 제시합니다.
로봇의 해석
여기의 강점은 고수준 추론과 하위 제어를 분리한 것입니다. 에이전트가 코드를 작성하고 디버깅할 수 있게 하는 것은 LLM의 기존 논리 능력을 활용하므로 일반화 측면에서 유망한 경로입니다. 그러나 반복적 개선 단계가 시뮬레이터에 의존한다는 점은 실세계 견고성에 대한 의문을 제기합니다. Unitree G1 데모는 설득력이 있지만, 시뮬레이션 성공률과 물리적 배포 사이의 간극은 여전히 중요한 장벽입니다. 미래 연구는 에이전트가 임의의 코드를 생성할 때 지연 시간과 안전성을 해결해야 합니다.
이 노트로 갱신된 항목· 새 노트가 들어오면 AI가 매일 이 항목들을 고쳐 씁니다
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.