진화하는 데이터를 활용한 상호 적대적 자가 학습 모델 연구
Mutually Adversarial Self-Training with Evolving Data for Unified Multimodal Models
arXiv이미지 생성과 시각 이해를 결합한 통합 모델(UMM)의 성능을 높이기 위해, 본 연구는 상호 적대적 자가 훈련 방식인 MATE 프레임워크를 제안했습니다.
- 단순히 협력하는 것이 아니라, 두 기능이 서로 도전자를 맡아 경쟁하며, 이 과정 자체가 다음 학습 데이터로 순환하는 '진화적 자가 대결'을 구현합니다.
- 외부 적대자 없이 오직 자체 출력물만으로 학습하며, 주요 평가 지표(GenEval 등) 전반에 걸쳐 높은 성능 향상을 입증하여 모델의 신뢰도를 높였습니다.
- 핵심은 모델 자체 출력을 활용하여 끊임없이 난이도를 높이는 '데이터 공간에서의 자가 플레이'를 통해 지속적인 성능 개선을 이룬 점입니다.
통합 모델(UMMs)은 이미지 생성과 시각 이해를 공유 백본에 결합합니다. 이 두 기능은 역방향의 과제이기 때문에, 최근 연구들은 UMM을 협력적으로 자가 훈련시키는 방식을 사용해왔습니다. 본 논문에서는 MATE(Mutually Adversarial self-Training with Evolving data)라는 기반의 후처리 프레임워크를 제안합니다. MATE는 두 기능이 단순히 협력하는 것이 아니라 서로에게 도전장을 던지는 방식으로 작동하며, 이 도전 과정 자체가 모델 훈련에 따라 진화합니다.
MATE의 작동 방식은 순차적인 '도전자-해결사' 역할을 교대하는 것입니다. 예를 들어, 이해(understanding) 브랜치가 여러 후보 설명을 제시하면, 생성(generation) 브랜치는 이를 유사한 이미지로 변환해야 하며, 그 반대의 과정도 이루어집니다. 이 과정에서 적대자는 별도의 외부 요소가 아닌 모델 자체의 출력물에서 발생합니다. 특히 한쪽 브랜치를 능가하는 후보들은 다음 에포크에서 다른 쪽 브랜치에 대한 도전 과제가 되어 학습을 지속적으로 진화시키는 '데이터 공간에서의 자가 대결(self-play)'을 구현합니다.
실험 결과, MATE는 성능 향상을 입증했습니다. Janus-Pro-1B 모델에서 GenEval 점수를 2.4점 개선했으며, DPG-Bench에서는 1.7점의 향상을 보였습니다. 또한, 아홉 가지 이해도 평균을 0.7점 높였으며, 반복적인 이미지-텍스트 사이클 전반에 걸쳐 일관성을 강화하는 효과를 가져왔습니다.
용어 풀이
- 멀티모달
- 글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
- 강화 학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.