리서치 연구
대규모 언어 모델의 확률적 구조 분석
The Probabilistic Structure of Large Language Models
arXiv대규모 언어 모델(LLM)의 작동 원리를 기존 연구와 달리 하나의 통합된 '확률적 관점'에서 총체적으로 분석합니다.
세 줄 요약
- 텍스트 생성을 확률적 과정의 순차적 시뮬레이션으로 정의하고, KL 발산의 비대칭성이 환각과 진실성의 차이를 설명함을 밝힙니다.
- 단순한 통계 학습을 넘어 LLM의 근본적인 한계를 이해하며, 다른 생성 방식과의 비교를 통해 지식을 확장할 수 있습니다.
- 특히 노이즈에서 데이터를 복원하는 역시간 확률 과정을 이용하는 확산 모델 등 다양한 생성 메커니즘까지 포괄적으로 논합니다.
본 논문은 (LLM)을 확률적인 관점에서 총체적으로 다루며, LLMs를 시퀀스에 대한 확률 측정치로 설명합니다. 학습 과정은 최대 우도 추정 문제로 공식화되며, 이는 확률적 경사 하강법(stochastic gradient methods)을 통해 해결됩니다. 텍스트 생성 자체는 이 과정을 통해 얻어진 확률적 과정의 순차적인 시뮬레이션으로 간주됩니다.
특히, 텍스트 생성에서 콜백-라이블러 발산(Kullback–Leibler divergence)의 비대칭성이 현상과 통계적 개연성 및 진실성 사이의 구분을 설명하는 데 사용됩니다. 이는 LLM이 단순히 통계적으로 그럴듯한 결과를 만들어낼 수 있음을 보여주는 이론적 근거를 제시합니다.
또한, 이 관점을 보완하여 (diffusion models)도 논의됩니다. 확산 모델은 생성 과정을 순차적인 토큰 예측으로 보는 대신, 노이즈를 데이터로 변환하는 역시간 확률 과정의 시뮬레이션으로 간주하며, 이는 이산 및 연속 시간 모두에서 적용될 수 있습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 환각
- AI가 사실이 아닌 내용을 그럴듯하게 지어내는 현상.
- 확산 모델
- 잡음에서 시작해 조금씩 다듬으며 이미지나 영상을 만들어 내는 생성 모델.