모델 연구
Boosting LLM Exploration via Weak-Model Guidance in RLVR
ARarXiv
LLM의 추론 능력을 강화하는 RLVR 방식은 성능을 높이지만, 모델이 과도하게 자신만만해져 다양한 사고 과정을 탐색하지 못하는 '엔트로피 붕괴' 문제가 발생합니다.
세 줄 요약
- 연구진은 작고 약한 언어 모델이 생성한 부분적인 '외부 접두사'를 활용하여 목표 모델의 과신을 깨고, 의도적으로 새로운 추론 경로를 탐색하도록 유도하는 방법을 제안했습니다.
- 제안된 방법은 기존 RLVR 대비 일관되게 높은 성능을 보였으며, 특히 요구되는 풀이 개수($k$)가 늘어날수록 추론 커버리지를 대폭 확장하는 효과를 입증했습니다.
- 별도의 복잡한 지도 학습(SFT)이나 정교한 보상 함수 설계 없이도 LLM의 생성 다양성을 효율적으로 확보할 수 있다는 실용적인 장점을 가집니다.
LLM의 추론 능력을 강화하는 RLVR 방식은 성능을 높이지만, 모델이 과도하게 자신만만해져 다양한 사고 과정을 탐색하지 못하는 '엔트로피 붕괴' 문제가 발생합니다.