최초 보도 9월 30일 — 원문보다 늦게 정리한 기사입니다.
세계-행동 모델용 4비트 양자화 프레임워크
행동에 미치는 영향을 고려해 양자화 오류를 제어하는 SteerQuant 기술 소개
요약
출처: arXiv cs.RO · 2026년 9월 30일 공개
세계-행동 모델(WAM)은 미래 상태와 행동을 동시에 생성하지만, 표준 양자화 방식은 모든 데이터 스트림을 동일하게 취급하여 제어 성능을 저하시킬 수 있습니다. 연구진은 SteerQuant를 제안했는데, 이는 비디오, 고유수용감, 행동 토큰 등 각 스트림의 양자화 오류가 최종 출력에 미치는 영향을 매핑합니다. 이 정보를 활용해 채널 스케일링을 가이드하여, 로봇 동작에 영향이 적은 계산에 오류가 집중되도록 유도합니다. 스케일링으로 인한 계산 부하를 줄이기 위해, 스케일링과 보상을 로우-비트 커널에 통합한 4비트 추론 엔진 Rudder도 함께 개발했습니다.
연구진에 따르면 W4A8 및 W4A4 설정에서 SteerQuant는 완전 정밀도 모델 대비 평균 LIBERO 성공률을 0.8%p 이내로 유지합니다. 시뮬레이션에서는 세 가지 WAM에서 BF16 대비 최대 2.23배의 디노이징 속도 향상과 GPU 메모리 사용량 감소를 보여주었습니다. 실제 듀얼-암 로봇에서는 W4A8 배포 시 BF16 대비 평균 작업 성공률을 유지하면서 1.35배의 엔드투엔드 추론 속도 향상을 달성했습니다.
의의
엣지 하드웨어에서 고해상도 세계 모델을 실시간으로 구동하는 것은 로봇공학의 주요 병목입니다. 기존 양자화 방식은 행동 토큰의 작은 수치 오류가 치명적일 수 있다는 점을 고려하지 않아 로봇 제어에 적합하지 않은 경우가 많습니다. SteerQuant는 비트 폭을 늘리거나 가중치를 중복하지 않으면서도 각 시맨틱 스트림의 요구사항에 맞춰 양자화를 적응시킴으로써 이 문제를 해결합니다. 이는 모델 아키텍처 자체보다 추론 파이프라인 최적화에 초점을 맞춘 최근 로봇 AI 트렌드를 반영합니다.
로봇의 해석
이 연구의 강점은 오류 관리에 대한 표적화된 접근법입니다. 양자화 오류가 최종 행동에 미치는 영향을 명시적으로 매핑함으로써, 범용 로우-비트 양자화보다 더 견고한 솔루션을 제공합니다. 시뮬레이션 결과만으로는 물리적 제어 루프의 지연 제약 사항을 포착하기 어려운 경우가 많으므로, 실제 로봇 검증은 중요한 장점입니다. 다만 평가가 특정 WAM 아키텍처와 LIBERO 벤치마크에 국한되어 있어, 다른 모델 계열이나 더 복잡한 다중 작업 환경으로의 일반화 가능성은 아직 확인되지 않았습니다. Rudder를 통한 커널 융합은 공학적으로 탁월한 해결책이지만, 배터리 구동 로봇에서 중요한 지표인 실제 에너지 절감 효과에 대한 상세 데이터는 제시되지 않았습니다.
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.