LLM의 서사 의미 표현 편향(Summarization Bias) 연구
Summarization Bias: The Directional Collapse of Objective Projection into Told-Mode Labels in Large Language Models --- A Conceptual Framework and Registered Test Protocol
arXivLLM이 서사적 의미를 전달할 때, 복잡한 재구성 구조 대신 요약된 설명이나 명시적인 라벨로 표현하려는 경향성(요약 편향)을 제안합니다.
- 이는 내용을 직접 보여주기보다(Shown Mode), 정보를 단순히 선언하는 방식(Told Mode)을 기본값으로 사용하기 때문에 발생하는 현상입니다.
- 이러한 편향이 확산되면, AI가 생성하거나 평가하는 콘텐츠의 깊이가 얕아지고 서사적 표현력이 평면적인 설명 위주로 퇴보할 위험이 있습니다.
- 본 연구는 해당 현상을 개념적으로 정의하고 테스트 프로토콜을 제시한 것이며, 아직 검증된 사실이라기보다 심층 연구가 필요한 가설적 틀임을 참고해야 합니다.
본 논문은 (LLMs)이 내러티브적 의미를 생성할 때, 이를 재구성 가능한 추론 구조로 보여주기보다 추상적인 요약 라벨 형태로 표현하려는 경향성인 '요약 편향(summarization bias)'을 제안합니다. 이 현상은 내러티브 효과가 told-shown 축으로 이론화되는 맥락에서 이해됩니다. Told 모드에서는 감정적/정보적 내용이 명시적으로 선언되어 독자의 재구성이 적게 필요하며, Shown 모드는 이러한 내용이 표면에서 억제되고 물리적 단서와 우회적인 방식으로 재구성되어야 하는 고부하 조건입니다.
요약 편향은 두 가지 영역에서 작동할 수 있다고 가정됩니다. 첫째, 생성적 영역에서는 모델이 감정을 객관적 투영(Objective Projection)을 통해 보여주기보다 선언하는 방식을 기본값으로 사용합니다. 둘째, 평가적 영역에서는 LLM이 서사 품질을 판단할 때 told-mode의 명시성을 보상하고 shown-mode의 억제는 과소 감지하는 경향을 보입니다. 이 평가적 편향은 LLMs가 심판자 역할을 할수록 콘텐츠가 평면적인 선언 위주로 퇴보하게 만드는 결과를 초래할 수 있어 더 중요하다고 지적됩니다.
본 보고서는 해당 편향이 검증되었다고 주장하기보다는, 개념을 정의하고 이를 기존의 LLM-as-judge 편향과 비교하며, 두 가지 영역에 대한 테스트 프로토콜을 사전에 등록하여 구성적인 틀을 제시하는 것을 목표로 합니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.