에이전트 학습을 위한 자가 은퇴형 지식 증류 기법
RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning
arXiv다중 단계 에이전트의 강화 학습(RL) 과정에서, 기존 지식 증류 방식은 교사 정보의 신뢰성이나 학습 단계별 효과 변화 등 근본적인 한계를 가졌습니다.
- 연구진은 학생 스스로 교사 역할을 중단하는 'RetireOPD'를 제안했습니다. 이는 성능 차이가 줄면 자동으로 교사를 배제하고 RL만으로 학습을 진행하는 적응형 은퇴 방식입니다.
- 이 기법은 에이전트가 환경에 최적화된 지식만을 습득하게 하여, ALFWorld 등 복잡한 작업에서 기존 RL 대비 높은 성공률과 정확도 향상을 입증했습니다.
- Qwen2.5 모델 기반으로 테스트되었으며, 기본 RL 방식뿐 아니라 자체적으로 만든 교사 모델보다 전반적인 성능이 우수함을 확인하여 효과를 검증했습니다.
다중 단계 를 (RL)으로 훈련할 때, 기존의 온-정책 (OPD) 방식은 교사 정보의 신뢰성 문제나 지도 효과가 학습 단계에 따라 달라지는 한계를 가집니다. 이에 연구진은 이러한 문제를 해결하기 위해 'RetireOPD (Self-Retiring On-Policy Distillation)'를 제안했습니다.
RetireOPD는 먼저 환경 보상을 통해 분리된(decoupled) 스킬 기반의 교사 모델을 최적화합니다. 이후 학생 모델은 RL과 OPD를 결합하여 공동으로 훈련됩니다. 이 방식의 핵심은 'Adaptive Retirement'로, 학생이 스스로 교사와의 성능 차이가 줄어들고 목표 성공률에 도달하면 교사를 배제하고 순수 RL만으로 학습을 진행하는 적응형 메커니즘입니다.
Qwen2.5 모델(1.5B~7B)을 기반으로 테스트한 결과, RetireOPD는 ALFWorld에서 기존 RL 기준 대비 14.1%에서 18.8%의 성공률 향상을 보였으며, WebShop에서는 11.8%에서 19.0%의 정확도 향상을 기록했습니다. 이 성능은 기본 RL 방식뿐만 아니라 자체적으로 구축한 스킬 기반 교사 모델보다 모든 환경에서 우수함을 입증했습니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 강화 학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
- 지식 증류
- 큰 모델의 답을 작은 모델이 따라 배우게 해서 가볍고 빠른 모델을 만드는 방법.