온-정책 자기 증류에서 특권 정보의 기여도 분석
What Does Privileged Information Add to On-Policy Self-Distillation?
arXiv언어 모델이 자체 답안으로 학습하는 '온-정책 자기 증류(OPSD)' 방식에 외부 참조 정보가 얼마나 추가적인 이점을 주는지 실험했습니다.
- 수학 문제 기반 테스트 결과, 외부 참조 정보는 성능 향상에 기여하지만 그 효과는 크지 않으며, 특히 완성된 풀이 과정 전체를 제공할 때 가장 큰 개선을 보였습니다.
- 따라서 단순히 답만 보여주기보다, 직접 응답과 추론 과정을 아우르는 파라미터 공유가 모델의 기존 추론 능력을 높이는 핵심 방법임을 시사합니다.
- 다만, 짧은 직접 응답 학습을 길고 복잡한 추론 과정으로 대체할 경우 성능 향상이 오히려 하락하는 등 학습 모드 변화에 따라 효과가 달라질 수 있습니다.
본 연구는 언어 모델이 자체 답안을 통해 학습하는 온-정책 자기 증류(OPSD) 방식에 외부 참조 정보가 추가적으로 어떤 이점을 제공하는지 실험했습니다. 이를 위해 5,319개의 수학 문제로 구성된 AMPLE-Math라는 재사용 가능한 모듈을 구축하고, 동일한 정답을 공유하는 여섯 가지 추론 관점(reasoning views)을 비교 분석했습니다. 연구진은 참조가 없는 증류 방식과 각 관점을 비교하며, 사고 과정을 거치는 교사 모델이 직접 응답 결과와 함께 감독할 때의 성능 변화를 측정했습니다.
실험 결과에 따르면, 참조 정보는 전반적인 개선에 기여하지만 그 추가적 이점은 크지 않은 것으로 나타났습니다. 특히 Qwen 모델에서는 추가적인 참조 혜택이 미미했지만, 완성된 풀이 과정(polished solution)에서 가장 강력한 효과를 보였습니다. 구체적으로, 완전한 추론 경로(complete traces)는 SmolLM3-3B 모델의 50단계에서 두 퍼센트 포인트의 성능 향상을 추가로 가져오는 것으로 확인되었습니다.
종합적인 분석은 OPSD가 직접 응답과 사고 과정을 아우르는 공유를 통해 기존 추론 능력에 대한 접근성을 높이는 데 가치가 있음을 시사합니다. 즉, 특권 참조 정보의 진정한 가치는 단순히 해답을 얼마나 많이 보여주느냐가 아니라, 이처럼 여러 모드(cross-mode) 간의 지식 전이(transfer)에 기여하는 정도입니다. 다만, 짧은 직접 응답 학습 방식을 길고 복잡한 추론 과정으로 대체할 경우 성능 향상이 오히려 하락하는 등, 학습 모드의 변화에 따라 효과가 달라질 수 있다는 점도 함께 제시되었습니다.
용어 풀이
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.