모델 연구
Rethinking On-Policy Distillation of Large Language Models II: One Training Example
ARarXiv
연구진은 대규모 언어 모델(LLM)의 온-정책 증류(OPD) 과정에서 훈련 데이터가 수행하는 역할을 집중적으로 분석했습니다.
세 줄 요약
- 단 하나의 질문만으로도 전체 데이터를 사용했을 때 얻는 성능 대부분을 회복할 수 있으며, 의미적으로 다양한 질문 추가 시 학습 범위가 크게 확장됨이 확인되었습니다.
- 이는 LLM의 미세 조정 과정에서 방대한 데이터셋 자체가 필수적이지 않을 수 있음을 시사하며, 효율적인 지식 습득 방법론 개발에 중요한 단서를 제공합니다.
- 다만, 데이터 양과 관계없이 모델이 새로운 지식을 흡수하는 속도 자체는 느리며, 충분한 단계(step)를 거쳐야 하는 근본적 한계가 존재함을 밝혀냈습니다.
연구진은 대규모 언어 모델(LLM)의 온-정책 증류(OPD) 과정에서 훈련 데이터가 수행하는 역할을 집중적으로 분석했습니다.