긴 문맥 속 LLM 성능 저하 원인: 컨텍스트 포이즈닝
Context Poisoning as Extreme-Value Attention Interference in Long-Context Language Models
arXiv대규모 언어 모델(LLM)이 긴 문맥을 처리할 때, 관련 없는 정보가 많아지면 중요한 증거를 놓치는 현상(컨텍스트 포이즈닝)이 발생합니다.
- 성능 저하는 단순히 전체 길이 때문이 아니라, 방해 요소(distractor)의 개수($N$)에 따라 증거 정보 활용 여유 공간이 급격히 줄어드는 것이 핵심 원인입니다.
- 본 연구는 장문 이해 성능 저하의 근본적인 메커니즘을 규명하며, 현재 LLM이 방대한 정보를 처리할 때 겪는 신뢰성 문제를 학술적으로 입증했습니다.
- 따라서 효과적인 정보 활용을 위해서는 검색 게이팅, 증거 기반 추론 아키텍처(retrieve-then-reason), 또는 검증 시스템 도입이 필수적입니다.
(LLM)은 긴 를 처리할 수 있지만, 관련 없는 정보가 추가될 경우 중요한 증거를 찾아 사용하지 못하는 현상, 즉 '컨텍스트 포이즈닝'을 겪습니다. 연구진은 이 현상을 어텐션에서의 극값 간섭으로 규정하며, 결정적 증거 점수는 상한선이 존재하는 반면, 효과적인 방해 요소(distractor)의 최대 점수는 그 개수($N$)에 따라 증가한다고 분석했습니다.
소프트맥스 검색 추상화 하에서 유한 표본 상한선을 도출한 결과, 고정된 정확도 목표를 유지하려면 증거 여유 공간이 단순히 원본 문맥 길이가 아닌 효과적인 방해 요소의 개수($N$)에 따라 $\Omega(\sqrt{\log N})$으로 증가해야 함을 보여주었습니다. 이는 장문 이해 성능 저하가 점수 별칭(score aliasing), 위치별칭, 소프트맥스 희석 등과 관련됨을 시사합니다.
실험 결과에 따르면, 된 하드 네거티브의 존재는 전체 문맥이 증가함에 따라 검색 정확도를 떨어뜨렸습니다. 특히 동일한 형식의 조건에서 가장 큰 정확도 하락이 관찰되었으며, 증거 사용 개선을 위한 검색 게이팅은 증거 회상률을 보존하는 것에 달려있다고 밝혔습니다. 이러한 결과는 증거 병목(evidence bottlenecks), 별칭에 강한 표현, 검색 후 추론 아키텍처 등 새로운 접근 방식을 촉진합니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 프롬프트
- AI에게 주는 지시나 질문 글.
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.