긴 문맥 속 LLM 성능 저하 원인: 컨텍스트 포이즈닝 — AI 생성 일러스트AI 일러스트
리서치 연구

긴 문맥 속 LLM 성능 저하 원인: 컨텍스트 포이즈닝

Context Poisoning as Extreme-Value Attention Interference in Long-Context Language Models

arXiv9월 22일 발표 · 3분 · 심사 전 논문

대규모 언어 모델(LLM)이 긴 문맥을 처리할 때, 관련 없는 정보가 많아지면 중요한 증거를 놓치는 현상(컨텍스트 포이즈닝)이 발생합니다.

세 줄 요약arXiv 원문 기반
  1. 성능 저하는 단순히 전체 길이 때문이 아니라, 방해 요소(distractor)의 개수($N$)에 따라 증거 정보 활용 여유 공간이 급격히 줄어드는 것이 핵심 원인입니다.
  2. 본 연구는 장문 이해 성능 저하의 근본적인 메커니즘을 규명하며, 현재 LLM이 방대한 정보를 처리할 때 겪는 신뢰성 문제를 학술적으로 입증했습니다.
  3. 따라서 효과적인 정보 활용을 위해서는 검색 게이팅, 증거 기반 추론 아키텍처(retrieve-then-reason), 또는 검증 시스템 도입이 필수적입니다.

(LLM)은 긴 를 처리할 수 있지만, 관련 없는 정보가 추가될 경우 중요한 증거를 찾아 사용하지 못하는 현상, 즉 '컨텍스트 포이즈닝'을 겪습니다. 연구진은 이 현상을 어텐션에서의 극값 간섭으로 규정하며, 결정적 증거 점수는 상한선이 존재하는 반면, 효과적인 방해 요소(distractor)의 최대 점수는 그 개수($N$)에 따라 증가한다고 분석했습니다.

소프트맥스 검색 추상화 하에서 유한 표본 상한선을 도출한 결과, 고정된 정확도 목표를 유지하려면 증거 여유 공간이 단순히 원본 문맥 길이가 아닌 효과적인 방해 요소의 개수($N$)에 따라 $\Omega(\sqrt{\log N})$으로 증가해야 함을 보여주었습니다. 이는 장문 이해 성능 저하가 점수 별칭(score aliasing), 위치별칭, 소프트맥스 희석 등과 관련됨을 시사합니다.

실험 결과에 따르면, 된 하드 네거티브의 존재는 전체 문맥이 증가함에 따라 검색 정확도를 떨어뜨렸습니다. 특히 동일한 형식의 조건에서 가장 큰 정확도 하락이 관찰되었으며, 증거 사용 개선을 위한 검색 게이팅은 증거 회상률을 보존하는 것에 달려있다고 밝혔습니다. 이러한 결과는 증거 병목(evidence bottlenecks), 별칭에 강한 표현, 검색 후 추론 아키텍처 등 새로운 접근 방식을 촉진합니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
프롬프트
AI에게 주는 지시나 질문 글.
임베딩
글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
원문arXiv · Context Poisoning as Extreme-Value Attention Interference in Long-Context Language Models같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv