사실적 환각의 비용: 압축률-왜곡 한계에 대한 연구
The Cost of Compression: A Rate-Distortion Limit on Factual Hallucination
arXiv닫힌 책 QA 모델의 환각은 단순히 관련 사실이 누락되는 '커버리지 문제' 외에, 유한 메모리 용량 때문에 관찰된 사실마저 왜곡될 수 있음을 이론적으로 증명했습니다.
- 연구진은 오류를 '관찰된 사실의 압축 왜곡'과 '미관찰 사실의 커버리지 부족' 두 가지로 분리하여 설명하는 정보이론적 경계를 제시했습니다.
- 이는 선택적 기억이나 강제 압축 같은 복잡한 메모리 과정을 정보이론적으로 분석할 수 있는 체계를 제공하며, LLM의 근본적인 한계 이해에 도움을 줍니다.
- 다만, 본 연구는 환각 현상의 완전한 이론이 아닌, '유한 메모리 조건에서의 관찰 사실 손실적 회상'이라는 특정 오류 양상을 다루고 있음을 유념해야 합니다.
본 연구는 닫힌 책(closed-book) 질의응답에서 발생하는 사실적 을 단순히 관련 사실이 누락되는 '커버리지 문제'로만 보는 시각을 넘어, 유한 메모리 용량으로 인해 관찰된 사실마저 근사적으로 저장되어 왜곡될 수 있는 두 번째 오류 원인을 다룹니다. 연구진은 이 현상을 분석하기 위해 $N$개의 가능한 질의와 $K$개의 가능한 답변이 존재하는 비정형 QA 과제를 설정하고, 학습자가 $M$개의 훈련 사실을 최대 $B$비트로 압축하여 저장하는 모델을 가정했습니다.
연구 결과에 따르면, 무작위로 추출된 테스트 질의에 대해 발생하는 오류 $\mathcal{E}$는 수학적 경계(bound)를 통해 다음과 같이 증명되었습니다. 이 경계식은 전체 오류를 '관찰된 사실에서의 압축 왜곡'과 '미관찰 사실의 커버리지 부족'이라는 두 가지 독립적인 항으로 분리하여 설명합니다. 이는 선택적 기억이나 강제 압축 같은 복잡한 메모리 과정을 정보이론적으로 분석할 수 있는 체계를 제공합니다.
연구진은 이 이론을 현대 언어 모델()에 적용하기 위해 사실 부하량과 유효 학습 가능한 메모리를 변화시키면서 예측된 시그니처를 시뮬레이션 및 제어된 사실 주입 프로브를 통해 연구했습니다. 본 연구는 환각 현상 전체의 완전한 이론은 아니지만, '유한 메모리 조건 하에서 관찰된 사실이 손실적으로 회상되는' 특정 오류 양상을 정보이론적 관점에서 설명하는 데 기여합니다.
용어 풀이
- 환각
- AI가 사실이 아닌 내용을 그럴듯하게 지어내는 현상.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.