UniMate: 다양한 골격 애니메이션을 위한 통합 기반 모델
UniMate: One Unified Model to Animate Diverse Skeletons
arXivUniMate는 3D 리깅 자산과 텍스트 프롬프트만으로 임의의 다양한 골격에 맞는 움직임을 합성하는 통합 기반 모델입니다.
- 보행 동물부터 해양 생물까지 광범위한 1만여 개 시퀀스를 학습한 대규모 데이터셋(UniML3D)을 기반으로 높은 범용성을 확보했습니다.
- 기존 애니메이션 모델의 한계를 넘어, 특정 골격에 대한 재학습이나 복잡한 최적화 과정 없이도 고품질 움직임 생성이 가능합니다.
- 골격의 위상학적 구조를 고려하는 확산 변환기를 사용하며, 리깅된 3D 자산과 텍스트 프롬프트를 입력으로 받습니다.
UniMate는 기존의 애니메이션 생성 모델들이 특정 골격에 대한 위상학적 제약(topology-constrained)을 가지거나 개별적인 및 참조 동작이 필요한 한계를 극복하기 위해 개발된 통합 기반 모델입니다. 이 모델은 리깅된 3D 자산과 텍스트 만으로 임의의 다양한 골격에 맞는 움직임을 합성할 수 있으며, 테스트 시간 최적화나 개별 골격 재학습 과정 없이도 고품질 애니메이션 생성이 가능합니다.
UniMate는 골격의 위상학적 구조를 통합하는 '위상 인식 확산 (topology-aware diffusion transformer)'를 핵심으로 사용합니다. 이 아키텍처는 쌍별 관절 관계 및 측지 거리를 이용한 그래프 인식 어텐션 편향, 그래프 라플라시안을 통한 스펙트럴 회전 위치 등 세 가지 메커니즘을 통합하여 골격 정보를 처리합니다. 또한, bipedal, quadrupedal, avian, marine, insectoid 등을 포함하는 13,006개의 움직임 시퀀스로 구성된 UniML3D 데이터셋으로 학습되었습니다.
이 모델은 품질, 일반화 및 효율성 측면에서 기존 최고 성능의 기준 모델(state-of-the-art baselines)을 능가하는 것으로 나타났습니다. UniMate는 교차 위상 전이(zero-shot cross-topology transfer), 움직임 보간(in-betweening), 확장, 그리고 텍스트 기반 편집 등 광범위한 기능을 지원하며, 이는 다양한 생물학적 구조에 애니메이션을 적용할 수 있음을 의미합니다.
용어 풀이
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
- 프롬프트
- AI에게 주는 지시나 질문 글.
- 트랜스포머
- 오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
- 제로샷
- 예시를 하나도 주지 않고 바로 과제를 시키는 방식.