인간과 동물의 움직임을 통합 생성하는 UniMo 프레임워크 공개
UniMo: Unifying Human and Animal Motion Generation
arXiv연구진은 인간과 동물의 3D 움직임을 통합적으로 생성하는 UniMo 프레임워크를 개발했습니다. 이는 종(種)마다 별도의 모델이 필요했던 기존의 한계를 극복한 것이 핵심입니다.
- UniMo는 골격 구조 차이를 무시하는 점군 기반(Point Cloud) 방식을 채택했으며, 인간과 동물을 아우르는 대규모 데이터셋 UniML3D를 함께 공개했습니다.
- 이 기술은 로봇 공학, AR/VR 콘텐츠 제작 등 다양한 분야에서 현실적이고 자연스러운 움직임 구현의 핵심적인 기반을 제공할 것으로 기대됩니다.
- UniMo는 HumanML3D를 포함한 여러 공개 벤치마크에서 최고 성능을 달성하며, 통합적인 인간-동물 움직임 생성의 가능성을 입증했습니다.
조건부 3D 모션 생성이 로보틱스, AR/VR, 게임 등 다양한 분야에서 핵심 연구 주제로 부상했으나, 기존의 인간 중심 기술을 동물 영역으로 확장하는 데는 어려움이 있었습니다. 이는 동물이 표준적인 인간 골격 구조와 달리 매우 다양한 골격을 가지기 때문이며, 이 문제를 해결하기 위해 연구진은 UniMo라는 통합된 점군(point cloud) 기반 모션 생성 프레임워크를 제안했습니다. UniMo는 파라메트릭 골격을 비파라메트릭 표현으로 변환하여 위상학적 불일치를 우회하며, 활동적인 관절에 더 많은 포인트를 할당하는 동적 샘플링을 통해 성능을 높였습니다.
이와 함께 연구진은 인간과 동물 양쪽 범주를 아우르는 대규모 모션-언어 데이터셋 UniML3D를 공개했습니다. 이 데이터셋에는 총 145,907개의 모션 시퀀스와 433,388개의 캡션이 포함되어 있으며, 이는 기존의 동물 관련 데이터셋보다 102배 이상 큰 규모입니다. 이러한 대규모 데이터를 통해 통합적인 인간-동물 움직임 생성의 가능성을 입증했습니다.
UniMo는 HumanML3D, KIT-ML, AnimalML3D를 포함한 세 가지 공개 에서 최고 수준의 결과를 달성하며 그 효과와 실현 가능성을 보여주었습니다. 이 기술은 인간과 동물의 움직임을 통합적으로 생성할 수 있음을 입증함으로써, 로봇 공학 및 콘텐츠 제작 분야에 핵심적인 기반을 제공할 것으로 기대됩니다.
용어 풀이
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.