본문으로 건너뛰기
Rrobopedia.aiAI 운영

최초 보도 9월 17일 — 원문보다 늦게 정리한 기사입니다.

GIST, 손잡이·버튼 기능까지 이해하는 로봇 AI 개발

물체와 부품, 그 기능·행동까지 하나로 잇는 ‘통합 3차원 장면 그래프’ 기술

AI 작성이 학습 노트는 생성형 AI가 원문을 바탕으로 작성했습니다. 수치·고유명사는 원문과 다를 수 있습니다.

로봇이 전자레인지가 어디 있는지 아는 것만으로는 음식을 데울 수 없습니다. 문을 열려면 손잡이를 찾아야 하고, 작동시키려면 버튼의 위치와 기능도 알아야 합니다. 사람에게는 당연한 정보지만 로봇에게는 그렇지 않았다고, 로봇신문 보도를 통해 전해졌습니다.

광주과학기술원(GIST) AI학과 김의환 교수 연구팀은 이러한 한계를 넘어서기 위한 AI 기술을 개발했습니다. 김이룸 석·박사통합과정생이 제1저자로 참여한 이번 연구에서, 연구팀은 물체와 부품의 위치뿐 아니라 각각의 기능과 가능한 행동까지 하나로 연결해 표현하는 통합 3차원 장면 그래프(Unified 3DSG) 개념을 제시했습니다. 이를 실제 카메라 영상으로부터 자동으로 구축하기 위해 OP3DSG(Open-Vocabulary Part-Aware 3D Scene Graph Generation) 기술을 개발했습니다.

3차원 장면 그래프(3DSG)는 공간 속 물체와 물체 사이의 관계를 연결해 로봇이 주변 환경을 이해하고 이동·작업 순서를 계획할 수 있게 돕는 일종의 ‘3차원 지식지도’입니다. 하지만 기존 3DSG는 의자, 전자레인지 같은 물체 단위 정보 표현에 초점이 맞춰져 있어, 물체를 구성하는 작은 부품이나 그 기능까지 구체적으로 담지 못했습니다. 작은 부품은 크기가 작고 촬영 각도에 따라 모습이 크게 달라져, 기존 AI는 물체 전체만 찾아내거나 다른 각도에서 찍힌 같은 부품을 제대로 연결하지 못하는 경우가 많았습니다.

OP3DSG는 먼저 영상에서 주요 물체를 찾은 뒤, 해당 물체에 포함될 것으로 예상되는 세부 부품을 함께 탐색합니다. 예를 들어 오븐을 발견하면 버튼, 문, 손잡이 등을 찾아야 할 대상으로 추가하는 방식입니다. 이후 여러 각도에서 촬영된 영상을 3차원 공간으로 통합하는데, 이때 부품의 위치와 의미뿐 아니라 색상 정보까지 비교해 서로 다른 영상 속 같은 부품을 정확히 연결합니다. 위치·거리 정보로 기본적인 공간 관계를 구성한 뒤에는 대규모언어모델(LLM, 사람 언어를 방대한 데이터로 학습한 AI 모델)을 활용해 부품과 물체 사이의 기능적 관계와 가능한 행동을 추가로 검토·보완합니다. 예컨대 ‘전자레인지-손잡이’라는 공간적 관계에 ‘손잡이는 문을 여는 데 쓰인다’는 기능적 관계를 더해 로봇이 수행할 행동까지 표현하는 식입니다.

연구팀은 새롭게 개발한 평가 체계 ‘유니그래프3D(UniGraph3D)’로 성능을 검증했습니다. AI가 찾아낸 상위 3개 후보 안에 정답 부품이 포함되는 비율은 83.6%로, 기존 최고 성능인 52.4%보다 31.2%포인트 높았습니다. 물체와 부품 간 공간적 관계 파악 성능은 기존 최고 성능보다 7.9%포인트, 기능적 관계 파악 성능은 9.2%포인트 향상됐습니다.

연구팀은 이 기술을 이동형 로봇 ‘스트레치 3(Stretch 3)’에 적용해 실제 환경에서의 활용 가능성을 확인했습니다. 로봇은 주변 의자 개수를 세거나 TV를 켜기 위한 리모컨의 위치를 찾아 이동할 수 있었습니다. “빨래를 정리해 줘”라는 지시에는 수건을 찾아 바구니에 넣는 작업 순서를 계획했고, “목이 마르다. 마실 때 쓸 수 있는 것을 가져다 달라”처럼 구체적인 물체 이름을 알려주지 않은 지시에도 기능적 관계를 바탕으로 필요한 물체를 찾아 그 위치를 이동 목표로 설정할 수 있었습니다.

김의환 교수는 “이번 연구의 핵심은 로봇이 ‘무엇이 어디에 있는지’뿐 아니라 ‘어떤 부품을 사용할 수 있고, 어떻게 사용할 수 있는지’까지 이해하는 데 필요한 정보를 하나로 연결한 것”이라며 “앞으로 서비스 로봇이 복잡한 실제 환경을 이해하고, 사람의 자연어 지시를 구체적인 작업 계획과 이동으로 연결하는 데 기반 기술로 활용될 수 있을 것으로 기대한다”고 말했습니다.

이번 연구는 과학기술정보통신부·정보통신기획평가원의 AI Bots 협업 플랫폼 및 자기조직 인공지능 기술개발 사업, 과학기술정보통신부·한국연구재단 신진연구자지원사업, 과학기술정보통신부·국가과학기술연구회 글로벌 TOP 전략연구단 지원사업의 지원을 받았습니다. 논문 ‘OP3DSG: Open-Vocabulary Part-Aware 3D Scene Graph Generation for Real-World Environments’는 유럽컴퓨터비전협회(ECVA)가 주관하고 스웨덴 말뫼에서 9월 8일부터 12일까지 열린 국제학술대회 ‘European Conference on Computer Vision(ECCV) 2026’에서 발표됐습니다.

정정 이력 · 제보

틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.

정정 이력 전체

AI이 창의 답변은 생성형 AI가 작성합니다. 로보피디아 운영 서버의 로컬 모델(저울)이 기사와 원문을 대조해 수정 여부와 이유를 답하고, 사람 편집자는 나중에 기록을 확인합니다.

제보 종류

개인정보나 다른 사람의 정보는 적지 마세요. 제보는 AI 검토와 답변, 남용 방지를 위해 저장되며(IP는 해시로만, 30일), 자세한 내용은 개인정보 처리방침을 확인하세요.

출처

이 기사는 아래 출처를 바탕으로 로보피디아가 작성했습니다.

더 알아보기

공유X에 공유