확장 가능한 멀티모달 지시 수행 데이터 합성 및 증류 연구
Towards Scalable RLVR: Multimodal Instruction Following Data Synthesis and Distillation
arXiv범용 에이전트 구축의 핵심인 다중 모드 지시 따르기(MMIF)를 위해, 데이터 부족 문제를 해결하는 MIFS 합성 파이프라인을 개발했습니다.
- MIFS는 생성 제약 프로토콜과 학습 가능성 기반 증류 메커니즘을 결합하여 RL에 최적화된 9만 개의 멀티모달 데이터셋을 구축하고 고정밀 보상 신호를 제공합니다.
- 이 방법은 기존 지도학습(SFT)의 일반화 성능 저하 문제를 해결하며, 시각 능력을 유지하면서 지시 수행 정밀도를 크게 높이는 것이 핵심입니다.
- 실험 결과, MIFS로 학습한 모델은 원본 데이터 대비 평균 8.13%의 성능 향상과 3배 빠른 수렴 속도를 보여 효율성을 입증했습니다.
범용 구축에 필수적인 다중 모드 지시 따르기(MMIF)는 현재 지도학습 (SFT) 방식에 크게 의존하고 있어 표면적인 패턴 매칭에 그치고 일반화 능력이 저하되는 문제가 있습니다. 대안으로 제시된 검증 가능한 보상 기반 (RLVR)은 유망하지만, 고품질의 RL 준비 데이터 부족으로 인해 확장성에 병목 현상이 발생합니다.
이러한 격차를 해소하기 위해 MIFS(Multimodal Instruction Following Synthesis)라는 체계적인 파이프라인이 제안되었습니다. MIFS는 생성 제약 프로토콜을 도입하여 다양한 원본 샘플을 합성하고, RL 훈련 역학에 기반해 데이터를 필터링하는 학습 가능성 인식 증류 메커니즘을 거칩니다. 또한 코드 기반 검증기가 정책 학습을 위한 고정밀 보상 신호를 제공하며, 이 과정을 통해 총 8개 제약 범주와 14개 작업 도메인에 걸친 9만 개의 데이터셋이 구축되었습니다.
실험 결과, MIFS로 학습된 MLLM은 네 가지 MMIF 에서 평균 8.13%의 성능 향상을 보였으며, 원본 데이터를 사용했을 때보다 3배 빠른 훈련 수렴 속도를 달성했습니다. 이 접근 방식은 SFT가 흔히 보이는 일반화 트레이드오프를 완화하여 핵심 시각 능력을 유지하면서 지시 수행 정밀도를 크게 높이는 것이 특징입니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
- 강화 학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
- 멀티모달
- 글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.