LLM 파이프라인의 지시적 모호성 변화(Deictic Shift) 연구
Can LLMs in Draft-Verify-Revise Pipelines Resolve Deictic Ambiguity?
arXivLLM을 순차적으로 사용하는 '초안-검증-수정' 파이프라인에서는 문맥 축적에 따라 특정 표현의 의미가 변하는 '지시적 모호성 변화(Deictic Shift)' 문제가 발생할 수 있습니다.
- 테스트 결과, GPT-5.2와 Gemini 3 Pro 모두 높은 성능을 보였으며, 특히 적은 추론 노력으로도 우수한 결과를 내는 모델이 비용 효율적인 대안임을 확인했습니다.
- 따라서 LLM 파이프라인 설계 시에는 지시적 모호성 위험을 고려하여, 모든 단계에서 참조 대상(Referent)을 명확히 지정하는 것이 필수적입니다.
- 특히 최종 검증 단계에서 오류가 발생하면, 모델은 심층적인 논리보다 표면적인 단서에 의존할 수 있으므로 개발자가 주의해야 합니다.
초안-검증-수정(Draft-verify-revise)은 추론 시간을 확장하기 위해 사용되는 일반적인 오케스트레이션 패턴이다. 이 과정에서 문맥이 단계별로 축적되면서, "previous"와 같은 문맥 의존적 표현이 지시적 변화(deictic shift), 즉 참조 대상의 변화를 겪을 수 있다. 연구진은 이러한 현상을 셋으로 분석하며, 각 단계에서 LLM이 해당 표현을 올바르게 해석하는지 여부를 테스트했다.
연구는 3개 제공업체의 6개 모델을 대상으로 총 21가지 추론 노력 구성(reasoning effort configurations) 하에 진행되었다. 그 결과, GPT-5.2는 추론 노력이 없을 때의 정확도 0.156에서 최고 수준의 추론 노력에서는 0.942까지 성능이 상승하는 모습을 보였다. 반면 Gemini 3 Pro는 모든 단계에서 0.94 이상을 유지하며 안정적인 성능을 나타냈다.
특히 메타-평가기(meta-evaluator)가 오류를 범했을 때, 모델은 운영적 추론보다는 표면적인 단서에 의존하는 경향이 관찰되었다. 따라서 컨텍스트 엔지니어들은 지시적 변화의 위험성을 인지하고, LLM 파이프라인을 구현할 때는 각 단계에서 참조 대상(intended referent)을 명확하게 지정하여 모호성을 방지해야 한다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 합성 데이터
- 실제로 모은 것이 아니라 AI나 프로그램으로 만들어 낸 학습용 데이터.