가상 착용(VTON) 품질 향상을 위한 보상 모델 TryOnReward
TryOnReward: Learning Foveated Consistency for Reinforcement Fine-Tuning of Virtual Try-On
arXiv가상 착용(VTON) 기술은 사람의 미묘한 선호도와 디테일을 정확히 반영하는 평가 지표가 부족하여, 실제 사용 환경에서 품질 확보에 어려움을 겪었습니다.
- 연구진은 시선 집중(Foveation) 방식을 도입한 정교한 보상 모델 'TryOnReward'를 개발하여, 품질 평가의 영역을 특정 부위에 국한하고 정확도를 높였습니다.
- 이 모델은 쌍별 선호도와 차원별 점수를 결합 학습함으로써, 단순 착용 수준을 넘어 인간이 만족하는 고품질 가상 쇼핑 경험 구현에 기여합니다.
- 연구진은 대규모 인간 주석 기반 데이터셋(TryOnReward-100K)과 다양한 시나리오 벤치마크를 공개하여 기술의 신뢰성과 적용 범위를 입증했습니다.
가상 착용(Virtual Try-On, VTON) 기술은 사람의 선호도에 맞는 시각적으로 자연스러운 결과물을 만드는 것을 목표로 합니다. 하지만 기존의 평가 지표들은 인간의 판단과 상관관계가 약하며, 일반적인 비전-언어 모델()로는 의류와 인물의 디테일을 정확하게 구분하는 품질 평가가 어렵다는 한계가 있었습니다. 이러한 문제는 특히 (RFT) 과정에서 심각한 보상 해킹을 유발했습니다.
연구진은 VTON에 특화된 정교한 보상 모델인 TryOnReward를 개발하여 이 문제를 해결하고자 했습니다. 이 모델은 비전-언어 백본을 기반으로 하며, 각 품질 차원을 관련 영역에 근거하는 '시선 집중(foveation) 보정 목표'를 채택함으로써 전역적인 우회 학습을 방지합니다.
TryOnReward는 쌍별 선호도와 개별 차원별 품질 점수를 결합적으로 최적화하며, 상대적 및 절대적 품질 신호를 모두 활용하는 마진 인식 감독(margin-aware supervision) 기법을 사용합니다. 또한, 대규모 인간 주석 기반 데이터셋인 TryOnReward-100K를 구축하고 TryOn-Bench와 같은 다양한 도 함께 제공했습니다.
실험 결과에 따르면, TryOnReward는 일반적인 평가 모델보다 인간 선호도 정렬 측면에서 유의미하게 뛰어난 성능을 보였습니다. 이 모델이 RFT의 보상 함수로 사용될 경우, 여러 기준선(baselines)에서 일관되게 인간이 선호하는 가상 착용 결과를 도출할 수 있었습니다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.
- 강화 학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.