모델 연구
KItCAT: Knowledge Injection via Input Corruption for Auto-regressive Training
ARarXiv
대규모 언어 모델(LLM)이 전문 분야의 지식을 학습하는 데 어려움을 겪자, KItCAT이라는 경량 학습 전략이 제안되었습니다. 이 방법은 입력 시퀀스를 무작위로 변형하여 데이터 증강을 수행합니다.
세 줄 요약
- 기존에는 계산 비용이 많이 드는 문장 재작성(paraphrasing) 과정 없이도 작동하며, 입력 토큰의 무작위 변형만으로 다양한 학습 데이터를 저렴하게 생성하는 것이 핵심입니다.
- 매뉴얼이나 전문 기술 문서 같은 니치한 자료에서 부족했던 지식을 모델에 효과적으로 주입할 수 있어, LLM이 일반 영역을 넘어 전문 분야에서도 강력한 성능을 발휘하도록 돕습니다.
- 디코더 전용(decoder-only) LLM에 적용 가능하며, 기존 지속적 사전 학습(CPT) 대비 성능 향상이 입증되었습니다. 관련 코드가 공개되어 연구 활용도가 높습니다.
대규모 언어 모델(LLM)이 전문 분야의 지식을 학습하는 데 어려움을 겪자, KItCAT이라는 경량 학습 전략이 제안되었습니다. 이 방법은 입력 시퀀스를 무작위로 변형하여 데이터 증강을 수행합니다.