모델 연구
Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms
ARarXiv
LLM의 여러 전문 능력을 통합하는 세 가지 방식(Merge, Mix RL, MOPD)을 비교 분석하여 최적의 융합 전략을 제시합니다.
세 줄 요약
- 평균 성능 차이는 미미하지만, 특정 다중 도메인 벤치마크에서는 방법론 간 최대 8.6점까지 큰 격차가 발생할 수 있습니다.
- 개발 목표에 따라 비용 효율적인 통합(Merge), 통일 모델 학습(Mix RL), 전문성 보존(MOPD) 중 적절한 전략을 선택하는 것이 중요합니다.
- 세 방법 모두 단일 샘플 정확도는 높이지만, 전체 해답 커버리지나 미지의 능력까지 향상시킨다는 근본적인 한계는 있습니다.
LLM의 여러 전문 능력을 통합하는 세 가지 방식(Merge, Mix RL, MOPD)을 비교 분석하여 최적의 융합 전략을 제시합니다.