모델 연구
The Geometry of Ignorance: LLMs Know When to Temper Bayesian Priors
ARarXiv
LLM의 불확실성을 기하학적으로 분석하여, 정보가 부족할 때 사용하는 '무지 방향(direction of ignorance)'을 발견했습니다. 이 구조는 훈련 데이터 기반의 사전 확률(Bayesian prior)을 인코딩합니다.
세 줄 요약
- 예측 상태를 이 방향으로 투영하면 $\lambda$라는 계수가 도출되는데, 이는 문맥 정보가 늘어날수록 모델이 사전 지식에 의존하는 정도가 점진적으로 감소함을 수학적으로 설명합니다.
- 이 기하학적 해석을 통해 LLM의 불확실성을 정량화하고, $\lambda$ 값을 조절함으로써 모델이 사전 지식에 의존하는 정도를 능동적으로 제어할 수 있음을 입증했습니다.
- 이 원리는 다양한 규모와 계열의 LLM에서 공통적으로 나타나며, 모델 크기가 클수록 충분한 문맥 정보가 주어졌을 때 사전 지식에 대한 의존도가 낮아지는 경향을 보입니다.
LLM의 불확실성을 기하학적으로 분석하여, 정보가 부족할 때 사용하는 '무지 방향(direction of ignorance)'을 발견했습니다. 이 구조는 훈련 데이터 기반의 사전 확률(Bayesian prior)을 인코딩합니다.