확산 모델로 모터 스킬 다양성을 학습하는 DSD 기술
DSD: Learning Diverse and Reusable Motor Skills via Diffusion Skill Discovery
arXiv로봇이나 가상 캐릭터가 인간처럼 여러 상황에서 재사용 가능한 동작을 학습하도록 돕는 'DSD(Diffusion Skill Discovery)' 기술이 개발되었습니다.
- 고차원 제어 문제에서 어려웠던 '상태 분포 엔트로피'를 확산 모델로 근사하여, 동작의 폭넓은 다양성 확보라는 핵심 난제를 해결했습니다.
- 이를 통해 학습된 모터 스킬은 휴머노이드와 같은 고난도 로봇 제어 환경에서도 광범위하고 민첩하게 재활용되어 높은 활용도를 보여줍니다.
- 실험 결과, DSD는 기존 방법론 대비 월등히 넓고 다양한 동작의 '재사용 가능한 스킬 레퍼토리'를 성공적으로 구축한 것이 가장 큰 성과입니다.
인간은 다양한 목표와 상황에서 풍부한 모터 스킬 레퍼토리를 재사용하며 효율적으로 새로운 작업을 학습합니다. 시뮬레이션 캐릭터에게도 이 전략을 적용할 수 있습니다. 광범위한 동작 커버리지를 확보하기 위해 상태 엔트로피를 최대화하는 것이 중요하지만, 고차원 제어 문제에서는 이를 직접 추정하기 어렵다는 기술적 난제가 있었습니다. 기존의 근사 방법들은 충분히 넓은 범위의 상태 공간 커버리지를 촉진하지 못하여, 행동 다양성이 제한적인 스킬을 초래했습니다.
이러한 문제를 해결하고자 연구진은 (diffusion model)을 활용하는 'Diffusion Skill Discovery (DSD)'를 제안했습니다. DSD는 스코어 매칭(score matching) 기법을 통해 정책이 유도하는 상태 분포의 엔트로피 기울기를 근사합니다. 이 목표 함수는 고차원 제어 환경에서 더 넓은 범위의 동작을 발견하도록 장려하며, 학습된 스킬은 계층적 제어와 오프라인 궤적 기반의 제어 등 두 가지 다운스트림 환경에 재사용될 수 있습니다.
실험 결과에 따르면, DSD는 기존의 스킬 발견 방법론들보다 더 넓고 다양한 재사용 가능한 모터 스킬 레퍼토리를 성공적으로 구축했습니다. 이는 여러 다운스트림 작업에서 활용할 수 있는 복잡하고 민첩한 동작의 출현으로 이어졌으며, 기술적 우수성을 입증했습니다.
용어 풀이
- 확산 모델
- 잡음에서 시작해 조금씩 다듬으며 이미지나 영상을 만들어 내는 생성 모델.
- 휴머노이드
- 팔·다리·몸통처럼 사람과 비슷한 몸 구조를 가진 로봇.
- 제로샷
- 예시를 하나도 주지 않고 바로 과제를 시키는 방식.