AI 정책 연구
Scaling Reinforcement Learning for Diffusion Models via Velocity Matching
ARarXiv
확산 모델의 보상 기반 미세 조정(reward fine-tuning)을 위해 속도 매칭(Velocity Matching) 방식을 제안했다.
세 줄 요약
- 제안된 보상 기반 속도 매칭(RVM)은 궤적 추적이 필요 없는 업데이트 방식으로, 속도 필드에 직접 작용한다.
- RVM은 다양한 대규모 확산 모델 작업에서 기존의 궤적 기반 정책 경사 방식보다 경쟁하거나 더 나은 성능을 보인다.
- 속도 업데이트가 단순화되면 특정 손실 변형보다 보상과 앵커 설계가 중요하며, 비디오 생성에는 동적 추적 보상이 필요하다.
확산 모델의 보상 기반 미세 조정(reward fine-tuning)을 위해 속도 매칭(Velocity Matching) 방식을 제안했다.