소형 검색 에이전트를 위한 검증 가능한 보상 기반 강화 학습 연구
Reinforcement Learning with Verifiable Rewards for Small Search Agents
arXiv연구진은 대규모 모델에서만 가능하다고 여겨졌던 '검증 가능한 보상 기반 강화 학습(RLVR)' 기법을 작은 규모의 검색 에이전트에도 성공적으로 적용하는 방법을 제시했습니다.
- 작은 모델에 이 기술을 적용한 결과, 지식 증류 과정 없이도 성능 향상(3.8배)을 입증했으나, 기존처럼 정답 일치만을 보상으로 사용하면 오히려 최악의 결과를 냈습니다.
- 이는 복잡한 추론 능력이 반드시 거대한 모델에 국한되지 않음을 보여주며, 제한된 자원에서도 고성능 AI 구현 가능성을 높였다는 점에서 큰 의미가 있습니다.
- 따라서 소형 모델에 RLVR을 적용할 때는 대형 모델의 방식을 단순히 축소하는 것이 아니라, 해당 모델과 작업 환경에 맞는 보상 설계 연구가 필수적으로 선행되어야 합니다.
검증 가능한 보상 기반 (RLVR)은 수학이나 코딩처럼 명확한 보상을 가진 문제에서 좋은 성능을 보이지만, 보상이 덜 명확한 영역에서의 적용 가능성은 여전히 미지수입니다. 본 연구에서는 오픈 도메인 질문 답변에 RLVR을 적용하기 위해 검색(retrieval)과 참조 매칭을 통해 보상을 확보하는 방식을 사용했습니다. 기존에는 대규모 모델에서만 시연되었던 이 방법을 소형 모델에도 테스트하여 그 가능성을 확인했습니다.
연구진은 Qwen3.5-0.8B와 같은 소형 모델에 Group Relative Policy Optimization (GRPO)과 Wikipedia 검색 도구를 활용해 MuSiQue 환경에서 학습을 진행했습니다. 세 가지 형태의 보상을 변화시키며 실험한 결과, (distillation) 과정 없이도 최고의 실행이 0.352의 평균 정확히 일치율에 도달했으며, 이는 기존 대비 3.8배 향상된 수치입니다.
다만, 테스트 결과는 보상의 형태가 중요함을 보여주었습니다. 특히 검색-R1 기반의 정답 일치만을 이용하는 희소한(sparse) 보상은 세 가지 보상 중 가장 낮은 성능을 기록했습니다. 따라서 연구진은 소형 모델에 RLVR을 적용할 때는 대규모 모델의 방식을 단순히 축소하기보다는, 해당 모델과 작업 환경에 맞는 별도의 보상 설계 연구가 필수적이라고 결론지었습니다.
용어 풀이
- 강화 학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
- 지식 증류
- 큰 모델의 답을 작은 모델이 따라 배우게 해서 가볍고 빠른 모델을 만드는 방법.