확산 모델 기반 RAG의 지식 충돌 탐지 기법 연구
The Temporal Tug-of-War: Visualizing and Detecting RAG Conflicts in Diffusion Models via Trajectory Variance
arXiv검색 증강 생성(RAG) 과정에서 외부 컨텍스트와 모델의 내부 지식이 충돌하는 현상을 포착하고 시각화하는 방법을 제시합니다.
- '트랙토리 분산 점수(TVS)'라는 해석 가능한 지표를 개발하여, 여러 추론 경로 간의 의미적 차이를 측정해 충돌 여부를 정량적으로 판단합니다.
- 답변 근거가 되는 지식의 모순을 명확히 파악함으로써, AI 시스템의 신뢰성과 투명성을 크게 높일 수 있습니다.
- 계산량이 적어 실용적이며, 다양한 확산 모델 아키텍처에서도 충돌 감지 원리가 효과적으로 적용됨을 입증했습니다.
(RAG) 과정에서 외부 컨텍스트가 모델의 내부 지식과 모순될 때, 확산 언어 모델은 특정 실패 모드를 보입니다. 이 충돌 현상은 반복적인 디노이징 과정을 통해 눈에 띄는 '지식 간의 싸움'으로 나타납니다. 연구진은 이러한 충돌을 감지하기 위한 관찰 가능한 지표로 '시간적 의미 분기(temporal semantic divergence)'를 식별하고, 이를 측정하는 해석 가능한 방법인 트랙젝토리 분산 점수(TVS)를 도입했습니다.
TVS는 독립적인 확률적 디노이징 궤적 전반에 걸친 답변 의 평균 쌍별 코사인 거리를 계산하여, 파라미터 지식과 컨텍스트 간의 시간적 충돌 정도를 포착합니다. 이 점수는 단지 두 번의 병렬 추론 실행만 필요하므로 계산 비용이 낮고 실용적입니다. LLaDA와 Dream 7B 등 다양한 아키텍처에서 테스트되었으며, 로지스틱 회귀 분류기를 사용하여 높은 정확도를 달성했습니다.
연구 결과는 충돌로 인해 발생하는 트랙젝토리 역학 및 그 핵심 속성이 서로 다른 확산 아키텍처를 넘나들며 전이됨을 입증합니다. 이는 제안된 TVS 기반의 충돌 감지 원리가 다양한 모델 환경에서도 효과적으로 적용될 수 있음을 의미하며, AI 시스템의 신뢰성과 투명성을 높이는 데 기여할 수 있습니다.
용어 풀이
- 검색 증강 생성
- 답하기 전에 관련 문서를 찾아 그 내용을 근거로 답하게 하는 방법.
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
- 확산 모델
- 잡음에서 시작해 조금씩 다듬으며 이미지나 영상을 만들어 내는 생성 모델.