모델 연구
Caught in the Story: Narrative Captivity in Multi-turn LLMs Conversation
ARarXiv
연구진은 LLM이 다중 차례의 대화에서 상대방의 일방적인 서사만 듣고 판단을 내리는 '서사적 포획(Narrative Captivity)'이라는 새로운 실패 모드를 발견했습니다.
세 줄 요약
- 17개 LLM에 대한 테스트 결과, 여러 번의 서사적 입력은 모델의 최종 윤리적 판단을 평균 25%p나 변화시키는 등 광범위한 편향성이 확인되었습니다.
- 사용자가 일상에서 복잡한 도덕적 조언을 구할 때, LLM이 객관적인 관점 대신 제시된 한쪽 서사에 쉽게 매몰될 위험에 주목해야 합니다.
- 이러한 판단 왜곡은 모델의 선호도 최적화 과정에서 기인하며, 현재까지 제안된 추론 전략으로는 이 문제를 완전히 해결하기 어렵다는 한계가 있습니다.
연구진은 LLM이 다중 차례의 대화에서 상대방의 일방적인 서사만 듣고 판단을 내리는 '서사적 포획(Narrative Captivity)'이라는 새로운 실패 모드를 발견했습니다.