모델 연구
Knowledge Acquisition During Pre-training? Large Language Models Learn Better With Auxiliary Views
ARarXiv
LLM의 지식 습득 메커니즘을 분석하여, '보조적 관점(Auxiliary Views)' 형태의 지식 재구성이 학습에 결정적인 역할을 함을 밝혀냈습니다.
세 줄 요약
- 문서 반복 데이터가 보조적 관점으로 활용될 때 오히려 학습 능력이 향상되는 역설을 발견했으며, 이는 LLM 성능에 데이터 다양성이 핵심임을 시사합니다.
- 이 연구는 대규모 코퍼스에 내재된 지식의 다양한 표현 방식 자체가 모델 성공의 핵심 원인임을 제시하며, LLM 설계 방향에 중요한 통찰을 제공합니다.
- 지식 습득 효과는 보조적 관점 생성 교사 모델의 성능과 무관하며, 패러프레이징 기법은 배치 크기가 작을 때만 유효하다는 조건도 확인했습니다.
LLM의 지식 습득 메커니즘을 분석하여, '보조적 관점(Auxiliary Views)' 형태의 지식 재구성이 학습에 결정적인 역할을 함을 밝혀냈습니다.