최초 보도 9월 18일 — 원문보다 늦게 정리한 기사입니다.
FunArt, 단일 3D 스캔만으로 움직이는 부품 찾아내는 AI
생성형 3D 모델의 내부 표현을 활용해 로봇이 만지기 전에 서랍·손잡이·경첩의 움직임을 파악하는 새 프레임워크
가정이나 물류창고에서 작업하는 로봇은 물체가 무엇인지 아는 것을 넘어, 그 부품이 어떻게 움직이는지도 이해해야 합니다. 어떤 서랍이 미끄러지듯 열리는지, 어떤 캐비닛 문이 회전하며 열리는지, 손잡이는 어디에 달려 있는지를 파악해야 실제로 조작할 수 있기 때문입니다. arXiv에 게재된 새 논문에 따르면, 연구진은 로봇이 물체를 직접 만져보지 않고도 단 한 번의 정적 3D 스캔만으로 이런 정보를 추출하는 프레임워크 'FunArt'를 개발했습니다.
FunArt는 위치 정보가 포함된 RGB-D(색상+깊이) 관측 데이터를 입력받아 물체 인스턴스를 복원한 뒤, 융합된 형상을 생성형 3D 모델 TRELLIS.2가 사용하는 O-Voxel 표현으로 변환합니다. 이어 TRELLIS.2의 고정된 희소 압축 VAE(3D 형상을 압축된 코드로 변환하는 신경망 구성요소)를 구조적 사전 지식으로 활용합니다. 가벼운 쿼리 기반 디코더가 이 압축된 객체 단위 코드와 표면에 정렬된 조밀한 특징을 결합해, 움직이는 부품을 분할하는 동시에 손잡이나 노브 같은 기능적 상호작용 요소를 식별하고, 각 부품의 운동 유형(회전 또는 슬라이딩), 축, 원점, 운동 범위까지 함께 추정합니다.
기준 데이터셋인 Articulate3D에서 FunArt는 움직이는 부품 분할, 관절 구조(articulation) 추정, 기능적 요소 분할 전 영역에서 기존 최고 성능을 경신한 것으로 알려졌습니다. 이는 정답 물체 정보가 주어졌을 때와 주어지지 않았을 때 모두에 해당합니다. 완전 종단간(end-to-end) 설정에서는 기존 최강 기법 대비 움직이는 부품 분할에서 AP50 1.5포인트, 원점·축을 동시에 고려한 평가에서 AP50 2.8포인트, 기능적 요소 분할에서 AP50 6.7포인트 앞섰습니다. (AP50은 컴퓨터 비전에서 널리 쓰이는 정확도 지표입니다.)
연구진은 이러한 결과가 생성형 3D 모델의 내부 표현이 단순한 형상 정보 이상을 담고 있음을 보여준다고 설명합니다. 논문에는 "생성형 3D 잠재 표현은 물리적 상호작용 이전에 로봇의 인식과 계획을 초기화할 수 있는 실행 가능한 구조적 단서를 담고 있다"는 문장이 담겨 있습니다.
이 차이는 실제 배치 측면에서 의미가 있습니다. 기존 접근법 상당수는 여러 차례의 관측을 통해 물체가 움직이는 모습을 직접 관찰하거나, 로봇이 실제로 잡거나 밀어야 할 기능적 부품과 관절 구조를 별개로 다루는 경우가 많았습니다. FunArt는 정적 스캔 한 번으로 두 가지를 동시에 산출함으로써, 시행착오 없이도 낯선 환경에서 로봇이 조작 계획을 더 빠르게 시작할 수 있는 출발점을 제공할 수 있습니다. 이 연구는 데니스 로톤디(Dennis Rotondi)가 제1저자로 제출했으며 현재 arXiv 프리프린트로 공개되어 있습니다.
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.