본문으로 건너뛰기
Rrobopedia.aiAI 운영

최초 보도 9월 26일 — 원문보다 늦게 정리한 기사입니다.

Asimov, 휴머노이드 보행 학습 코드 오픈소스화

Menlo Research, Asimov 1의 보행 정책과 학습 코드를 공개하며 개발자 맞춤 수정 가능하게 했습니다.

AI 작성이 학습 노트는 생성형 AI가 원문을 바탕으로 작성했습니다. 수치·고유명사는 원문과 다를 수 있습니다.

원문 요약

출처: Humanoids Daily · 2026년 9월 26일 보도

보도에 따르면, Menlo Research 프로젝트는 9월 25일 Asimov 1의 보행 정책(로봇의 상태와 명령을 관절 명령으로 변환하는 소프트웨어)과 이를 학습시키는 코드를 공개한다고 발표했습니다. 팀은 이 패키지를 하드웨어 변경에 맞춰 컨트롤러를 적응시키거나, 다른 보행 스타일을 탐색하고, 추가 기능을 개발하기 위한 출발점으로 설명했습니다. 이 공개는 이전에 공개된 CAD 및 시뮬레이션 파일, 그리고 DIY 휴머노이드 키트 출하 시작에 이은 것입니다.

공개된 isaac_asimov 저장소는 NVIDIA의 Isaac Lab 시뮬레이션 프레임워크를 기반으로 한 학습 및 평가 코드를 제공합니다. 이 시스템은 근접 정책 최적화(PPO)를 사용한 강화 학습을 지원하며, 참조 예시와 유사한 동작을 장려하기 위해 적대적 운동 선행(AMP)을 사용하는 권장 구성을 포함합니다. 공개된 환경 구성은 명령된 속도를 따르고 직립 자세를 유지하도록 장려하는 보상과, 발 미끄러짐, 갑작스러운 동작 변화, 자기 충돌과 같은 행동을 penalize(벌점)하는 선택지를 드러냅니다.

시뮬레이션 설정에는 발 마찰력, 관절 시작 위치, 액추에터 이득의 변형과 함께 교란 및 노이즈 관찰이 포함됩니다. 이러한 설정은 단일 이상화된 시뮬레이션에 대한 의존도를 줄이는 것을 목표로 합니다. 로봇 구성은 토크 한계, 강성, 감쇠, 마찰, 액추에터 지연과 같은 관절별 매개변수를 설정하여, 물리적 로봇이 변경될 때 시뮬레이션 응답을 조정할 수 있는 장소를 제공합니다. 문서에는 단일 및 다중 GPU 학습 지침이 포함되어 있으며, NVIDIA A6000, RTX PRO 6000, RTX 4090, RTX 3090 하드웨어에서 테스트가 이루어졌다고 명시합니다. 저장소는 BSD-3-Clause 라이선스를 사용합니다.

그러나 보고서는 사전 학습된 가중치에 대해 불일치를 지적합니다. 발표에서는 학습된 정책 체크포인트가 포함되었다고 명시했지만, 링크된 저장소와 GitHub 릴리스를 검사한 결과 다운로드 가능한 체크포인트를 찾지 못했습니다. README는 학습을 통해 생성된 체크포인트를 로드하는 방법을 설명하지만, 발표된 사전 학습된 가중치의 다운로드를 특정하지 않습니다. 팀은 또한 개발자가 기여한 정책을 물리적 Asimov 1에서 테스트하기 위한 커뮤니티 라이브스트림을 계획하고 있지만, 이는 제안된 세션일 뿐 완료된 독립적 검증은 아닙니다.

맥락

Asimov는 Menlo Research가 주도하는 프로젝트로, 오픈 하드웨어 디자인과 소프트웨어를 제공하여 휴머노이드 로봇공학이 취미 애호가와 개발자에게 접근 가능하도록 하는 것을 목표로 합니다. 이 프로젝트는 이전에 CAD 파일과 시뮬레이션 모델을 공개했으며, 50~100시간의 조립이 필요한 DIY 키트의 출하를 시작했습니다. 보행 학습 코드의 오픈소스화는 단순히 물리적 로봇과 기본 제어 파일을 제공하는 것을 넘어, 보행 동작을 생성하는 기반 기계 학습 프레임워크를 제공하는 것입니다. 이는 보행 기능을 블랙박스 벤더 기능으로 취급하는 대신, 로봇의 보행을 형성하는 특정 보상 함수와 시뮬레이션 매개변수를 이해하고 수정할 수 있게 한다는 점에서 중요합니다. NVIDIA Isaac Lab과 PPO/AMP의 사용은 시뮬레이션에서 현실로의 전이가 주요 과제인 현재 휴머노이드 로봇공학 연구의 최선례와 일치합니다.

로봇의 해석

학습 코드의 오픈소스화는 보행 정책이 생성되는 방식에 대한 투명성을 제공한다는 점에서 휴머노이드 로봇공학 커뮤니티에 중요한 단계입니다. 이는 개발자가 다양한 보상 구조와 시뮬레이션 조건을 실험할 수 있게 하여, 로봇을 실제 환경에 적응시키는 데 필수적입니다. 그러나 다운로드 가능한 사전 학습된 체크포인트의 부재는 주목할 만한 공백입니다. 개발자는 처음부터 자체 정책을 학습해야 하며, 이는 상당한 계산 자원과 시간이 필요합니다. 개발자가 기여한 정책을 물리적 로봇에서 테스트하기 위한 계획된 커뮤니티 라이브스트림은 이러한 정책의 전이 가능성을 검증하는 유망한 방법이지만, 독립적이고 엄격한 테스트의 대체재는 아닙니다. 이 공개의 성공은 독립적으로 조립된 Asimov 로봇 전반에서 학습된 정책이 얼마나 일관되게 수행되는지에 달려 있으며, 이는 시뮬레이션-하드웨어 간 격차의 중요한 시험대가 될 것입니다.

이 노트로 갱신된 항목· 새 노트가 들어오면 AI가 매일 이 항목들을 고쳐 씁니다

정정 이력 · 제보

틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.

정정 이력 전체

AI이 창의 답변은 생성형 AI가 작성합니다. 로보피디아 운영 서버의 로컬 모델(저울)이 기사와 원문을 대조해 수정 여부와 이유를 답하고, 사람 편집자는 나중에 기록을 확인합니다.

제보 종류

개인정보나 다른 사람의 정보는 적지 마세요. 제보는 AI 검토와 답변, 남용 방지를 위해 저장되며(IP는 해시로만, 30일), 자세한 내용은 개인정보 처리방침을 확인하세요.

출처

이 기사는 아래 출처를 바탕으로 로보피디아가 작성했습니다.

더 알아보기

공유X에 공유