리서치 연구

ReNFT: Repairing Mode Collapse in Reward Post-Training via Internal Probability-Mass Recalibration

ARarXiv9월 2일 발표 · 1분 · 심사 전 논문

확산 생성 모델이 보상 기반 학습을 거치면 특정 모드에만 집중하는 '모드 붕괴'가 발생하여 이미지의 다양성이 사라지는 문제가 생깁니다.

세 줄 요약arXiv 원문 기반
  1. ReNFT는 외부 신호 없이 생성기 자체 내부에서 확률 분포를 재조정하여, 이미 붕괴된 적응기를 복구하는 혁신적인 방법을 제시합니다.
  2. 이는 모델이 새로운 내용을 학습하기보다 기존에 억눌려 있던 잠재적 가능성을 되살리는 방식이라, 창의성과 신뢰성 확보에 중요합니다.
  3. 그 결과, 높은 보상 점수를 유지하면서도 다양성 지표를 크게 개선하여 외부 개입을 대체할 수 있는 대안을 제시했습니다.

확산 생성 모델이 보상 기반 학습을 거치면 특정 모드에만 집중하는 '모드 붕괴'가 발생하여 이미지의 다양성이 사라지는 문제가 생깁니다.

원문arXiv · ReNFT: Repairing Mode Collapse in Reward Post-Training via Internal Probability-Mass Recalibration같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기