리서치 연구
ReNFT: Repairing Mode Collapse in Reward Post-Training via Internal Probability-Mass Recalibration
ARarXiv
확산 생성 모델이 보상 기반 학습을 거치면 특정 모드에만 집중하는 '모드 붕괴'가 발생하여 이미지의 다양성이 사라지는 문제가 생깁니다.
세 줄 요약
- ReNFT는 외부 신호 없이 생성기 자체 내부에서 확률 분포를 재조정하여, 이미 붕괴된 적응기를 복구하는 혁신적인 방법을 제시합니다.
- 이는 모델이 새로운 내용을 학습하기보다 기존에 억눌려 있던 잠재적 가능성을 되살리는 방식이라, 창의성과 신뢰성 확보에 중요합니다.
- 그 결과, 높은 보상 점수를 유지하면서도 다양성 지표를 크게 개선하여 외부 개입을 대체할 수 있는 대안을 제시했습니다.
확산 생성 모델이 보상 기반 학습을 거치면 특정 모드에만 집중하는 '모드 붕괴'가 발생하여 이미지의 다양성이 사라지는 문제가 생깁니다.