리서치 연구
TF-IDF 가중 손실로 LLM 토큰 중요도 재조정
Rebalancing Token Importance in Language Models with TF-IDF Weighted Cross-Entropy Loss
arXivLLM은 균일한 토큰 가중치로 학습되어 정보량이 낮은 일반적인 단어에 치우치고, 표면적인 텍스트를 과도하게 암기하는 문제가 발생합니다.
세 줄 요약
- 이 문제를 해결하고자, 본 연구는 TF-IDF 통계 기반의 가중치 손실 함수를 도입하여 의미적으로 중요한 토큰을 강조하고 영향력을 조절합니다.
- 실험 결과, 이 방법은 서브스트링 암기 길이를 최대 58%까지 줄이면서도 기존의 성능과 일반화 능력(Perplexity)을 효과적으로 보존함을 입증했습니다.
- 또한, 본 접근법은 어떤 아키텍처에도 구애받지 않아 기존 학습 과정에 3% 미만의 낮은 연산 부하로 쉽게 통합할 수 있다는 높은 실용성을 제공합니다.
(LLM)은 일반적으로 균일한 로 학습되는데, 이 방식은 정보량이 낮은 빈번한 토큰이 학습을 지배하게 만들고 표면적인 텍스트 구간을 과도하게 암기하는 경향을 증가시킵니다. 본 연구는 이러한 문제를 해결하기 위해 TF-IDF 통계를 활용하여 토큰별 기여도를 재조정하는 정보 가중 손실 함수를 제시합니다.
이 새로운 손실 함수는 의미적으로 중요한 토큰의 영향력은 강조하고, 흔하게 사용되는(ubiquitous) 토큰의 영향력은 낮추어 학습 과정에 적용됩니다. 이 접근법은 아키텍처에 구애받지 않으며 기존 훈련 파이프라인에 3% 미만의 낮은 연산 오버헤드로 통합할 수 있어 실용성이 높습니다.
1.1B에서 13B 에 이르는 다섯 가지 디코더 전용 LLM을 대상으로 실험한 결과, 본 방법은 Perplexity와 다운스트림 작업 성능을 유지하면서도 암기된 서브스트링의 길이를 일관되게 줄이는 것을 입증했습니다. 시 평균 서브스트링 암기 길이가 14% 감소했으며, TinyLLaMA 1.1B 전체 가중치 미세 조정에서는 최대 58%까지 감소하는 결과를 보였습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- LoRA
- 모델 전체 대신 작은 추가 부분만 학습시켜 적은 비용으로 미세 조정하는 기법.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.