활용 사례 연구
Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR
ARarXiv
LLM의 추론 능력을 높이기 위해 온-정책 증류(OPD)와 검증 가능한 보상 기반 강화학습(RLVR)을 결합하는 새로운 방법을 제시했습니다.
세 줄 요약
- 연구진은 두 신호를 한 번에 통합하기보다, OPD로 지식을 확장한 후 RL로 정교하게 다듬는 'OPD-then-RL' 2단계 접근법이 가장 효과적임을 입증했습니다.
- 이는 OPD가 모델의 해결 범위를 넓히고, RL이 그 범위 내에서 성능을 극대화하는 상호 보완적인 과정을 거치기 때문에 가능합니다.
- 특히 두 단계 전환 시점에는 OPD의 검증 점수(validation score)를 핵심 지표로 활용하여 RL 적용 여부를 결정하는 것이 중요합니다.
LLM의 추론 능력을 높이기 위해 온-정책 증류(OPD)와 검증 가능한 보상 기반 강화학습(RLVR)을 결합하는 새로운 방법을 제시했습니다.