시너지 헤드 정보 분포 변화에 따른 MLLM 환각 현상 분석 및 완화 방안
MLLMs Hallucinate when Information Distribution Drifts in Synergy Heads
arXiv대규모 멀티모달 언어 모델(MLLMs)의 고질적인 환각 문제를 해결하기 위해, 모델 내부 정보 분포를 분석하고 교정하는 새로운 방법 'HEAL'을 제안했습니다.
- 연구 결과, 환각은 특정 모달리티 강도보다 '시너지 헤드'의 정보 분포가 건강한 균형에서 벗어날 때 발생함을 밝혀냈으며, HEAL은 이 시너지 헤드의 값 벡터에 동적 보정 요소를 주입합니다.
- 본 기술은 모델이 시각-언어 의존성을 능동적으로 조절하여 출력을 사실적인 근거로 유도함으로써, MLLM의 신뢰도를 높이는 해석 가능한 방법을 제시했습니다.
- 기존 방식들이 주의 가중치 같은 간접적 신호에 의존했던 것과 달리, HEAL은 모델 내부 구조(헤드)의 정보 분포 자체를 직접 분석하여 환각을 완화한다는 기술적 차별점을 갖습니다.
(MLLMs)은 문제로 인해 신뢰성 있는 실제 적용에 어려움을 겪고 있습니다. 기존의 주의 기반 완화 방법들은 주로 어텐션 와 같은 간접적인 신호에 의존하여, 환각 발생의 근본 원인이 되는 실제 정보 변화를 정확하게 반영하지 못했습니다. 본 연구에서는 이러한 한계를 극복하기 위해 'HEAL(Head-lEvel information disentAnglement and caLibration)'이라는 방법을 제안했습니다.
HEAL은 먼저 다중 헤드 출력에 인과적 노이즈 개입(causal noise intervention)을 적용하여 원인적으로 중복되는 헤드를 필터링합니다. 이후, 카운터팩추얼 차분-차분 분석(counterfactual Difference-in-Differences)을 통해 남은 헤드의 정보 분포를 분리하고 네 가지 유형으로 분류했습니다. 이 분석 결과, 환각 현상은 특정 모달리티별 헤드의 양이나 강도와는 관계없이, '시너지 헤드'의 정보 분포가 건강한 평형 상태에서 벗어날 때 발생한다는 점이 밝혀졌습니다.
이에 착안하여 HEAL은 시너지 헤드의 값 벡터에 동적 정보 보정 계수(dynamic information calibration factors)를 주입합니다. 이 과정은 시각-언어 의존성을 능동적으로 조절하며 모델의 출력을 사실적인 근거 쪽으로 유도하는 역할을 합니다. 광범위한 실험을 통해 HEAL이 여러 MLLMs에서 환각 현상을 효과적으로 줄이는 것이 입증되었으며, 이는 모델 신뢰도를 높이는 해석 가능하고 간단한 경로를 제공합니다.
용어 풀이
- 멀티모달
- 글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 환각
- AI가 사실이 아닌 내용을 그럴듯하게 지어내는 현상.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.