선택적 증류에서 학습률은 중립적인 기준이 아니다
A Shared Learning Rate Is Not a Neutral Control in Selective On-Policy Distillation
arXiv기존 연구에서 가정했던 '단일하고 공통된 학습률'은 선택적 온-정책 증류(SOPD) 비교에 있어 중립적인 기준이 될 수 없다는 점을 밝혀냈습니다.
- 실제로는 학습률 변화에 따라 밀집 감독 방식과 선택적 방법 간의 성능 차이가 크게 변동하는 '선택자-학습률 얽힘' 현상이 관찰되었습니다.
- 따라서 특정 학습률 범위에서만 유효한 결과가 단일 지표로 비교될 경우, 모델 성능을 과대평가하거나 왜곡하여 해석할 위험이 매우 높습니다.
- 연구의 공정성을 확보하기 위해서는 단순히 하나의 학습률 열만 제시하는 것이 아니라, '선택자별 x 학습률 매트릭스' 형태로 결과를 보고해야 합니다.
기존 연구에서는 선택적 온-정책 증류(Selective on-policy )를 비교할 때, 모든 경우에 공통된 단일 학습률을 '중립적인 제어 변수'로 가정하는 경향이 있었습니다. 하지만 본 연구는 이러한 가정이 사실과 다르다는 점을 보여줍니다. 즉, 선택적 온-정책 증류의 성능 비교에서 사용되는 학습률은 중립적인 기준점 역할을 하지 못하며, 이 간과된 요소가 결과 해석에 큰 왜곡을 초래할 수 있습니다.
를 사용하여 GSM8K 데이터셋으로 실험한 결과, 밀집 감독(dense supervision) 방식은 $8 imes$의 학습률 그리드 전반에 걸쳐 통계적으로 평탄한 변화(swing 1.8 pp)를 보였습니다. 반면, 선택적 방법들은 학습률에 따라 큰 폭의 변동을 나타냈습니다. 예를 들어, 무작위 5% 하위 집합은 5.4 pp의 swing을 보였고, teachability selector는 최대 17.7 pp까지 변화했습니다. 이로 인해 밀집 대 선택적 방식 간의 성능 차이는 학습률에 따라 크게 달라지며, $1 ext{e-}4$일 때와 $5 ext{e-}5$일 때 그 차이가 2.0배가 되는 현상이 관찰되었습니다.
이러한 '선택자-학습률 얽힘(selector-rate entanglement)' 현상은 피드백 루프를 통해 증폭되며, 심지어 초기 학생의 점수를 사용한 고정 스코어링 평가에서도 여전히 유의미하게 나타났습니다. 특히 실제 연구에서 사용되는 $1 ext{e-}6$부터 $1 ext{e-}5$ 범위의 학습률에서는 그 패턴이 더욱 두드러져, 밀집 방식 자체가 19.8 pp를 swing하고 선택적 방식은 49.5 pp까지 swing하는 등 큰 변동성을 보였습니다. 따라서 연구자들은 단순히 하나의 공통된 학습률 열을 제시하기보다 '선택자별 x 학습률 매트릭스' 형태로 결과를 보고해야 합니다.
용어 풀이
- distillation
- 큰 모델의 답을 작은 모델이 따라 배우게 해서 가볍고 빠른 모델을 만드는 방법.
- LoRA
- 모델 전체 대신 작은 추가 부분만 학습시켜 적은 비용으로 미세 조정하는 기법.