에이전트 학습을 위한 자가 은퇴형 지식 증류 기법 — AI 생성 일러스트AI 일러스트
AI 에이전트 연구

에이전트 학습을 위한 자가 은퇴형 지식 증류 기법

RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning

arXiv9월 17일 발표 · 2분 · 심사 전 논문

다중 단계 에이전트의 강화 학습(RL) 과정에서, 기존 지식 증류 방식은 교사 정보의 신뢰성이나 학습 단계별 효과 변화 등 근본적인 한계를 가졌습니다.

세 줄 요약arXiv 원문 기반
  1. 연구진은 학생 스스로 교사 역할을 중단하는 'RetireOPD'를 제안했습니다. 이는 성능 차이가 줄면 자동으로 교사를 배제하고 RL만으로 학습을 진행하는 적응형 은퇴 방식입니다.
  2. 이 기법은 에이전트가 환경에 최적화된 지식만을 습득하게 하여, ALFWorld 등 복잡한 작업에서 기존 RL 대비 높은 성공률과 정확도 향상을 입증했습니다.
  3. Qwen2.5 모델 기반으로 테스트되었으며, 기본 RL 방식뿐 아니라 자체적으로 만든 교사 모델보다 전반적인 성능이 우수함을 확인하여 효과를 검증했습니다.

다중 단계 를 (RL)으로 훈련할 때, 기존의 온-정책 (OPD) 방식은 교사 정보의 신뢰성 문제나 지도 효과가 학습 단계에 따라 달라지는 한계를 가집니다. 이에 연구진은 이러한 문제를 해결하기 위해 'RetireOPD (Self-Retiring On-Policy Distillation)'를 제안했습니다.

RetireOPD는 먼저 환경 보상을 통해 분리된(decoupled) 스킬 기반의 교사 모델을 최적화합니다. 이후 학생 모델은 RL과 OPD를 결합하여 공동으로 훈련됩니다. 이 방식의 핵심은 'Adaptive Retirement'로, 학생이 스스로 교사와의 성능 차이가 줄어들고 목표 성공률에 도달하면 교사를 배제하고 순수 RL만으로 학습을 진행하는 적응형 메커니즘입니다.

Qwen2.5 모델(1.5B~7B)을 기반으로 테스트한 결과, RetireOPD는 ALFWorld에서 기존 RL 기준 대비 14.1%에서 18.8%의 성공률 향상을 보였으며, WebShop에서는 11.8%에서 19.0%의 정확도 향상을 기록했습니다. 이 성능은 기본 RL 방식뿐만 아니라 자체적으로 구축한 스킬 기반 교사 모델보다 모든 환경에서 우수함을 입증했습니다.

용어 풀이

에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
강화 학습
행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
지식 증류
큰 모델의 답을 작은 모델이 따라 배우게 해서 가볍고 빠른 모델을 만드는 방법.
원문arXiv · RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning같은 주제 가이드 · 바로 써 보기매일 아침 소식, 예약 작업으로 받기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv