TwelveLabs가 작업자 시점의 영상을 분석하는 생성형 모델 ‘Pegasus 1.6’을 공개했다. 작업 동작과 장면 정보를 텍스트로 구조화해 로봇·물리 AI 영상의 분류와 검토에 활용하도록 설계했다.
TwelveLabs는 6일 발표문에서 Pegasus 1.6을 에고센트릭 영상 이해를 지원하는 모델로 소개했다. 에고센트릭 영상은 작업자나 조작자의 시점에서 촬영한 1인칭 영상이다. 회사는 조리와 공장 조립, 원격 로봇 조작 영상을 활용 사례로 들었다.
모델은 작업 단계와 손·물체의 상호작용을 시간 정보와 함께 구분하고, 공간 관계와 장면 맥락을 설명하는 문장을 생성한다. 영상의 선명도·구도·안정성을 평가해 검토 대상을 추리는 기능과 자연어 검색 기능도 포함됐다. 얼굴이나 주변인, 화면·문서에 표시된 민감 정보를 탐지해 표시하는 기능도 발표문에 담겼다.
TwelveLabs 공식 개발자 문서는 에고센트릭 영상 이해, 이미지 분석, 개선된 개체 인식과 메타데이터 추출, 구간 내 시간표시 이벤트 추출을 새 기능으로 제시했다. 로봇 영상의 품질 검토와 원격 조작 영상에서 다음 행동을 예측하는 용도도 설명했다. 이는 회사가 안내한 기능과 활용 예시다.
이번 출시는 영상 이해 모델을 로봇·물리 AI용 데이터 처리에 적용하려는 시도다. 앞서 본지는 로보틱스·물리 AI 분야의 투자 흐름을 다뤘다. Pegasus 1.6의 실제 로봇 학습 성능이나 현장 안전성 개선을 입증한 독립 평가와 고객 적용 사례는 발표문과 공식 문서에서 확인되지 않았다.

최윤서 기자
댓글0
첫 댓글을 남겨 보세요.