온정책 증류에서 프롬프트 폭과 정책 업데이트의 상호작용 분석
Prompt Breadth and Rollout Refresh Interact in On-Policy Distillation
arXiv본 연구는 온정책 증류(OPD) 과정에서 프롬프트의 폭과 응답 생성 정책의 주기적 업데이트가 모델 성능에 미치는 상호작용을 분석했습니다.
- 응답을 고정하는 방식보다 정책을 주기적으로 업데이트할 때, 프롬프트 폭 증가가 정확도를 크게 높이는 긍정적인 상호작용이 확인되었습니다.
- 모델의 효율성은 단순히 프롬프트 개수만으로 결정되는 것이 아니라, 정책 업데이트 빈도와 추론 예산에 따라 달라진다는 점을 시사합니다.
- 성능은 작업 규모에 따라 다르게 나타나, 짧은 길이에서는 주기적 모델이 유리하지만 긴 출력 제한에서는 응답 고정 방식이 더 높은 평균 정확도를 보였습니다.
본 연구는 온정책 증류(OPD) 과정에서 모델 성능에 영향을 미치는 두 가지 제어 변수, 즉 의 폭과 응답 생성 정책의 주기적 업데이트(rollout refresh)를 공동으로 분석했습니다. 3x3 수학 추론 실험을 통해 총 14,080개의 궤적과 110번의 최적화 업데이트가 진행되었으며, 프롬프트 은행과 응답 생성 정책 스냅샷 개수를 변화시키며 테스트를 수행했습니다.
응답을 초기 정책으로 고정하는 방식(frozen response)에서는 프롬프트 폭 증가가 정확도를 21.16%에서 19.05%로 낮추는 경향을 보였습니다. 반면, 업데이트 시마다 응답을 새로 생성하는 주기적 업데이트 방식을 적용했을 때는 프롬프트 폭이 정확도를 23.61%에서 25.57%로 높이는 결과를 나타냈으며, 이 상호작용은 4.07 퍼센트 포인트에 달했습니다.
또한, 두 가지 유형의 모델을 비교한 결과 흥미로운 역전 현상이 발견되었습니다. 주기적 모델(periodic models)이 짧은 예산 내에서 더 높은 정확도와 답변 완료율을 보였으나, 응답 고정 방식의 모델들은 32K 출력 제한과 같은 긴 출력 한계에서는 평균 정확도가 높아지는 경향을 보였습니다. 다만 이 경우, 후자는 1.7배에서 1.8배 많은 응답 을 사용했습니다.
용어 풀이
- 프롬프트
- AI에게 주는 지시나 질문 글.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.