모델 연구

Caught in the Story: Narrative Captivity in Multi-turn LLMs Conversation

ARarXiv9월 4일 발표 · 1분 · 심사 전 논문

연구진은 LLM이 다중 차례의 대화에서 상대방의 일방적인 서사만 듣고 판단을 내리는 '서사적 포획(Narrative Captivity)'이라는 새로운 실패 모드를 발견했습니다.

세 줄 요약arXiv 원문 기반
  1. 17개 LLM에 대한 테스트 결과, 여러 번의 서사적 입력은 모델의 최종 윤리적 판단을 평균 25%p나 변화시키는 등 광범위한 편향성이 확인되었습니다.
  2. 사용자가 일상에서 복잡한 도덕적 조언을 구할 때, LLM이 객관적인 관점 대신 제시된 한쪽 서사에 쉽게 매몰될 위험에 주목해야 합니다.
  3. 이러한 판단 왜곡은 모델의 선호도 최적화 과정에서 기인하며, 현재까지 제안된 추론 전략으로는 이 문제를 완전히 해결하기 어렵다는 한계가 있습니다.

연구진은 LLM이 다중 차례의 대화에서 상대방의 일방적인 서사만 듣고 판단을 내리는 '서사적 포획(Narrative Captivity)'이라는 새로운 실패 모드를 발견했습니다.

원문arXiv · Caught in the Story: Narrative Captivity in Multi-turn LLMs Conversation같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기