트웰브랩스, 피지컬 AI용 Pegasus 1.6 출시
시점 기반 영상 이해로 로봇 학습 데이터 생성을 돕는 새로운 모델입니다.
원문 요약
출처: The Robot Report · 2026년 10월 7일 보도
보도에 따르면 트웰브랩스(TwelveLabs)는 복잡한 현실 환경을 영상으로 이해할 수 있도록 돕는 Pegasus 1.6 모델을 출시했습니다. 이 모델은 작업 수행자의 시점에서 촬영된 시점 기반(egocentric) 영상에 특화되어 있으며, 요리나 공장 조립, 원격 로봇 조작 등 다양한 시나리오를 처리할 수 있다고 회사 측은 밝혔습니다. 트웰브랩스는 Pegasus 1.6이 시간적 맥락, 공간 추론, 작업 완료 판단을 제공하여 원시 영상을 구조화되고 검토 가능한 지식으로 변환한다고 설명했습니다.
제이 리(Jae Lee) 트웰브랩스 공동창업자 겸 CEO는 이 모델이 특정 독점 하드웨어나 카메라를 요구하지 않는다고 강조했습니다. 대신 작업자의 관점에서 동작과 상호작용을 포착하는 데 중점을 둡니다. 트웰브랩스는 Pegasus 1.6이 텔레오퍼레이션(원격 조작) 데이터보다 수집과 확장이 용이한 시점 기반 영상을 이해하도록 설계된 첫 번째 AI 모델이라고 밝혔습니다. 또한 기존 영상 데이터와 정지 이미지 분석도 지원하며, 클립 간 손, 객체, 도구 추적 등 엔티티 인식 기능이 개선되었습니다.
이번 릴리스는 동작 분할 및 라벨링, 밀도 캡션 라벨링, 품질 점수화, 검색 및 큐레이션, 동의 및 컴플라이언스 플래깅 등 5가지 워크플로를 지원합니다. 이 기능들은 타임스탬프가 있는 동작 라벨 생성, 공간 관계에 대한 설명 언어 생성, 저품질 클립 필터링, 드문 이벤트 표면화, 프라이버시 민감 콘텐츠 감지 등을 자동화합니다. 트웰브랩스는 이 시스템이 Pegasus 1.5의 Time-Based Metadata 기능을 기반으로 확장되었으며, 현재 로봇 연구소와 데이터 팀이 민첩성, 조작, 반도체 품질 관리 등 산업 응용 분야에 활용하고 있다고 전했습니다.
맥락
2021년 설립된 트웰브랩스는 대규모 영상 라이브러리를 보유한 기업을 대상으로 영상 지능 플랫폼을 제공하는 기업입니다. 마렌고(Marengo)와 피가서스(Pegasus) 모델은 인간이 영상을 검토하는 시간의 일부만 사용하여 영상을 처리하도록 설계되었습니다. 피지컬 AI로의 전환은 로봇 개발자들이 인간 행동에서 모델을 학습시키기 위해 더 확장 가능한 방법을 모색하는 업계의 더 큰 흐름을 반영합니다. 전통적인 텔레오퍼레이션 데이터는 규모가 제한적이고 생성 비용이 높아, 다양한 현실 상호작용을 포착하는 데 영상 기반 접근법이 매력적인 대안이 되고 있습니다.
시점 기반 영상에 대한 집중은 인간 작업의 1인칭 관점을 포착하여 로봇이 환경을 인식하고 상호작용하는 방식과 직접적으로 관련되기 때문에 중요합니다. 트웰브랩스는 동작을 분할하고 객체를 라벨링하는 영상 이해 계층을 제공함으로써, 원시 영상 데이터와 고급 로봇 정책 학습에 필요한 구조화된 데이터셋 사이의 간극을 메우려는 것입니다.
로봇의 해석
Pegasus 1.6의 출시는 피지컬 AI의 핵심 병목인 비구조화 영상을 실행 가능한 학습 데이터로 변환하는 필요성을 강조합니다. 시점 기반 영상에 초점을 맞춤으로써 트웰브랩스는 텔레오퍼레이션 데이터보다 풍부하고 수집이 용이한 데이터 소스를 다루고 있으며, 이는 민첩한 조작 기술 개발을 가속화할 수 있습니다. 그러나 이 접근법의 효과성은 모델이 다양한 작업과 환경으로 얼마나 잘 일반화되는지에 달려 있습니다. Pegasus 1.6이 생성하는 구조화된 메타데이터가 상당한 인간 개입 없이 복잡한 현실 작업을 수행하는 로봇을 학습시키는 데 충분한지 아직 확인되지 않았습니다. 프라이버시 및 컴플라이언스 기능 통합은 긍정적인 단계이지만, 로봇 팀이 생성하는 학습 데이터의 품질과 유용성이 진정한 시험대가 될 것입니다.
정정 이력 · 제보
틀린 내용을 알려 주세요. AI(저울)가 기사와 원문을 대조해 고칠지 판단하고 이유를 답합니다. AI가 수정이 필요하다고 판단하면 수정안을 만들고, 사람 편집자가 승인한 뒤 반영합니다. 고친 내용은 아래와 정정 이력에 공개됩니다.