LLM 다중 턴 상호작용에서 발생하는 '대화 이력 효과' 분석
What if LLMs Ate Their Words: Causal History Effects in Multi-Turn Interaction
arXivLLM의 다중 턴 상호작용에서는 이전 답변이 후속 행동에 영향을 주는 '대화 이력 효과'가 존재하며, 이는 모델과 태스크에 따라 성능 저하를 유발합니다.
- 단순히 컨텍스트 길이를 줄이는 것만으로는 성능 저하를 설명하기 어려우며, 과거 답변을 중립적으로 대체하거나 특정 턴을 수정하면 성능 개선이 관찰되었습니다.
- 따라서 LLM의 장기적 안정성을 높이려면 전체 대화 기록을 일괄 관리하기보다, 성능에 결정적인 영향을 미치는 핵심 이력만을 식별하여 개입하는 '선택적' 접근이 필요합니다.
- 대화 이력의 영향은 보편적인 내부 신호가 아닌, 각 태스크와 모델 환경에 따라 다르게 발현되는 '선택적 효과'라는 점을 이해하는 것이 중요합니다.
다중 턴(Multi-turn) 상호작용은 의 이전 응답이 후속 행동에 영향을 미치는 피드백 과정을 만듭니다. 연구 결과, 이러한 대화 이력으로 인한 성능 저하는 태스크와 모델에 따라 다르게 나타나며, 단순히 한 번의 입력만 고려한 높은 성능이 반드시 상호작용에서의 강건성을 보장하지는 않는 것으로 확인되었습니다.
연구진은 과거 답변을 중립적인 내용으로 대체하는 '중화(neutralization)' 기법을 적용하여 대화 이력의 영향을 분석했습니다. 그 결과, 2,973개의 궤적에서 중화를 수행했을 때 다운스트림 최소-최대 정규화 성능이 +.027만큼 변화하는 것이 관찰되었습니다. 또한, 단순히 컨텍스트 길이를 줄이는 것만으로는 이러한 역사 편집 효과를 설명하기에 불충분하다는 점을 보여주었습니다.
더 나아가 개별 어시스턴트 턴 단위로 개입하는 '턴 수술'을 진행한 결과, 선택된 237개 성능 저하 궤적 중 63.7%가 적어도 하나의 유익한 개입을 포함하고 있었습니다. 특히 이진 분류 태스크의 경우, 48.4%에서 실패했던 상황이 성공으로 역전되는 사례가 발견되었으며, 이는 대화 이력의 영향이 보편적인 내부 신호라기보다는 각 태스크에 따라 선택적으로 나타나는 효과임을 시사합니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.