GPT-6 Astra, 로봇 두뇌 벤치마크 1위
9월 평가에서 계획 수립 능력에서 큰 격차로 1위를 차지했습니다.
원문 요약
출처: Humanoids Daily · 2026년 10월 5일 보도
보도에 따르면 OpenAI의 GPT-6 Astra가 SuperCLUE의 2026년 9월 'Embodied Brain' 평가에서 1위를 차지했습니다. 이 모델은 전체 점수에서 86.75점을 기록하며 10개 모델 중 가장 높은 성적을 거두었습니다. 가장 두드러진 강점은 상호작용 및 계획 수립 카테고리였으며, 이 항목에서 85.71점을 얻었습니다. 이는 2위인 Gemini-3.8-Flash의 64.29점을 크게 상회하는 수치입니다. Qwen3.8-Max-0902와 Nebula-EmbodiedBrain은 각각 77.48점으로 중국 모델 중 공동 1위를 기록했습니다. 평가는 기본 지각, 시각 추론, 상호작용 및 계획 수립, 그리고 임베디드 안전성을 포함했습니다.
SuperCLUE는 이 벤치마크가 이미지와 중국어 프롬프트를 사용하며, 판정 모델이나 규칙 기반 스크립트를 통해 답안을 채점했다고 설명했습니다. 모든 모델은 모델별 최적화 없이 고정된 입력/출력 프로토콜을 적용받았습니다. 이 표준화된 접근은 모델이 공통 인터페이스를 처리하는 능력을 테스트하기 위한 것이었습니다. SuperCLUE는 전문 모델이 특정 프롬프트나 동작 출력 형식에 의존할 수 있으며, 낮은 계획 점수가 이 프로토콜 선택의 일부 결과일 수 있다고 언급했습니다. 결과들은 다양한 작업과 프로토콜에 대한 일반화 한계를 드러낸다고 해석했습니다.
맥락
SuperCLUE의 EmbodiedCLUE-VLA 벤치마크는 임베디드 에이전트의 인지 코어에 초점을 맞추고 있어, 하드웨어 중심 테스트와 구별됩니다. 100억 파라미터 이하의 모델이 포함되었는 것은 효율적이고 배포 가능한 아키텍처에 대한 관심을 반영합니다. 이 평가는 대규모 언어 모델이 물리적 행동을 추론하는 능력을 평가하는 경향을 보여줍니다. 이는 AI와 로보틱스를 통합하는 데 중요한 단계입니다. 그러나 벤치마크는 실시간 물리적 상호작용이 아닌 정적 입력과 채점된 출력을 기반으로 하므로, 인지 평가에는 적합하지만 전체 로봇 성능을 평가하기에는 한계가 있습니다.
로봇의 해석
GPT-6 Astra와 다른 모델 간의 계획 수립 점수 격차는 범용 LLM이 여전히 복잡한 로봇 작업에 필요한 순차적 추론에서 어려움을 겪고 있음을 시사합니다. 표준화된 프로토콜은 공정한 비교를 보장하지만, 특정 로봇 워크플로우에 최적화된 모델의 전체 기능을 포착하지 못할 수 있습니다. 결과들은 현재 모델들이 장면을 지각하고 추론하는 것은 가능하지만, 이를 신뢰할 수 있는 실행 가능한 동작 시퀀스로 전환하는 것은 여전히 과제임을 보여줍니다. 미래 평가는 실물 실험을 포함하여 모델이 실수에서 회복하고 실제 결과에 적응하는 능력을 평가해야 하며, 이는 로봇 잠재력을 더 완전하게 파악하는 데 도움이 될 것입니다.
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.