활용 사례 연구
Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation
ARarXiv
온-정책 증류(OPD)는 교사 모델의 오류 가능성을 간과하는 문제가 있었습니다. 이를 해결하기 위해 프롬프트별 신뢰도 검증을 거치는 '교사 게이팅(TGOPD)' 기법을 제안합니다.
세 줄 요약
- 이 기법은 검증자를 이용해 각 프롬프트의 교사 모델 신뢰도를 사전에 측정합니다. 신뢰도가 낮으면 다른 방식으로 학습을 전환하며, 기존 OPD보다 전반적인 성능 향상을 입증했습니다.
- 단순한 성능 개선을 넘어, 기존에는 놀고 있던 교사 모델의 자원을 활용하여 신뢰도 검증을 진행합니다. 이로 인해 GPU 활용률이 크게 증가하며 컴퓨팅 효율성까지 확보했습니다.
- 대규모 언어 모델을 증류(Distillation)할 때는 '교사 신뢰도'를 프롬프트 단위로 확인하는 것이 핵심 원리입니다. 교사의 잠재적 오류 위험이 있다면, 반드시 게이팅 및 검증 과정을 거쳐야 합니다.
온-정책 증류(OPD)는 교사 모델의 오류 가능성을 간과하는 문제가 있었습니다. 이를 해결하기 위해 프롬프트별 신뢰도 검증을 거치는 '교사 게이팅(TGOPD)' 기법을 제안합니다.