최초 보도 9월 24일 — 원문보다 늦게 정리한 기사입니다.
GPT-6-Astra, 미세조정 없이 자율 탐색
일반 목적 모델이 제로샷 시각-언어 내비게이션에서 높은 성공률을 기록했다는 평가 결과가 공개되었습니다.
요약
출처: arXiv cs.RO · 2026년 9월 24일 공개
연구진은 일반 목적 기반 모델인 GPT-6-Astra가 자신의 지각과 추론 능력을 활용해 낯선 환경을 탐색할 수 있는지 평가했습니다. 이 연구는 연속 환경에서의 제로샷 시각-언어 내비게이션(VLN-CE)에 초점을 맞추며, 모델이 언어 지시를 해석하고 3D 공간에서 이동하는 능력을 검증합니다. Codex 하니스를 통해 최소한의 인터페이스를 사용하고, 단일 모노큘러 RGB 관찰만 활용해 언제 관찰할지, 어떻게 움직일지, 언제 멈출지 결정합니다. 탐색 특화 미세조정, 학습된 웨이포인트 예측기, 사전 구축된 장면 맵은 사용하지 않습니다.
연구진에 따르면, GPT-6-Astra는 울트라 추론 모드로 R2R-CE 벤치마크에서 79.0%의 성공률을 달성했습니다. 이는 기존에 보고된 최고 제로샷 성공률보다 13.0%p, 최고 지도학습 성공률보다 6.9%p 높은 수치입니다. 모델은 공간적 관계를 파악하고, 작업 진행 상황을 추적하며, 행동을 수정하여 다단계 언어 지시를 처리하는 능력을 보여주었습니다. 그러나 신뢰할 수 있는 경로 실행과 목표 검증은 여전히 어려운 과제로 남아 있으며, 그럴듯한 지역 랜드마크 매칭이 항상 올바른 작업 완료로 이어지지는 않는다고 연구진은 지적했습니다.
의의
시각-언어 내비게이션은 로봇이 자연어 지시를 이해하고 미지의 환경에서 물리적 행동으로 전환하는 능력을 요구하는 핵심 과제입니다. 기존 접근법은 특화 아키텍처, 미세조정된 웨이포인트 예측기, 또는 사전 구축된 맵에 의존하는 경우가 많아 일반화 능력에 한계가 있었습니다. 이 연구는 일반 목적 기반 모델이 작업 특화 학습 없이도 이러한 과제를 처리할 수 있음을 시사하며, 복잡한 도메인 특화 파이프라인의 필요성을 줄일 수 있음을 보여줍니다. 이는 기반 모델을 중심으로 한 일반화 가능하고 신뢰할 수 있는 구체적 지능(embodied intelligence)의 미래를 제시합니다.
로봇의 해석
미세조정이나 특화 구성 요소 없이 달성한 성공률은 인상적입니다. 다단계 지시를 처리하고 상황에 따라 행동을 수정하는 능력은 더 유연하고 적응적인 탐색으로의 중요한 진보입니다. 그러나 연구진이 지적했듯, 목표 검증이 여전히 약점이라는 점은 실제 배포에서 안전성과 신뢰성이 최우선인 점을 고려할 때 중요한 과제입니다. 이 결과가 더 복잡하고 동적인 환경으로 일반화되는지, 또는 특정 벤치마크 설정에 크게 의존하는지는 아직 확인되지 않았습니다. 다양한 실제 시나리오에서의 추가 테스트가 이 접근법의 견고성을 확인하는 데 필요합니다.
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.
- 2026년 9월 29일VLN(Vision-and-Language Navigation) 번역을 '시선-언어 탐색'에서 '시각-언어 내비게이션'으로 고치고, 논문 결과를 '보도에 따르면'이 아니라 '연구진에 따르면'으로 밝혔습니다.(편집자)