리서치 연구
LLM 환각 탐지: 주의 그래프의 위상학적 분석
Detecting Hallucination in LLMs: Tracing the Topological Signatures of Impaired Context Sharing
arXivLLM의 환각 탐지를 위해, 주의 그래프 내 정보 흐름 패턴의 위상학적 특징을 분석하는 새로운 방법론을 제시했습니다.
세 줄 요약
- 연구 결과, 환각은 토큰 간 맥락 공유가 원활하지 않을 때 발생하며, 이는 주의 메커니즘의 구조적 결함과 관련이 깊습니다.
- 이 연구는 단순히 환각 여부를 판별하는 것을 넘어, 모델이 어떤 과정에서 잘못된 추론을 하는지 근본적인 작동 원리를 파악하게 합니다.
- 특히 환각은 최종 레이어에서 정보가 과도하게 압축되거나 초기 토큰의 문맥 검색이 불분명해지는 패턴으로 나타나는 경향을 확인했습니다.
본 연구는 이 생성하는 응답에서 (hallucination)을 효과적으로 구별하기 위해, 어텐션 그래프 내 정보 흐름 패턴의 위상학적 특징을 분석하는 방법론을 제시합니다. 특히 Forman-Ricci 곡률을 분석하여 주의 그래프 내 정보 병목 현상을 나타내는 구조적 패턴을 식별하고, 환각과 관련된 어텐션 헤드의 반(semi-local) 및 전역(global) 정보 흐름 특성을 포착하는 접근 방식을 도입했습니다.
실험 결과에 따르면, LLM에서 환각이 발생할 경우 간 맥락 공유가 원활하지 않은 것과 강하게 연관되어 있음이 확인되었습니다. 구체적으로는 최종 레이어에서 정보가 과도하게 압축되거나(information over-squashing), 초기 토큰으로부터의 문맥 검색이 분산되는 경향, 또는 자체 어텐션에 대한 지나친 의존성 등이 환각 응답의 특징으로 나타났습니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 환각
- AI가 사실이 아닌 내용을 그럴듯하게 지어내는 현상.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 트랜스포머
- 오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.