리서치 연구
LLM의 공손성 판단 능력 평가: 인간 화용론적 규범과의 비교
Polite but Misaligned: Evaluating LLM Politeness Judgments Against Human Pragmatic Norms
arXiv대규모 언어 모델(LLM)이 사회적 공손성을 판단하는 능력을 인간의 실제 화용론적 규범과 비교 분석했습니다.
세 줄 요약
- 모델들은 공손성 판단 시 '중립' 레이블을 과도하게 사용하고, 무례함(Impolite)으로 분류하는 경향이 강한 체계적 편향을 보였습니다.
- 단순 평균 정확도 측정 대신, 다양한 인간 평가 기준에 따른 '불일치의 방향성 패턴'을 분석해야 LLM의 진정한 사회적 이해도를 파악할 수 있습니다.
- LLM은 인간 기준과 완전히 일치하지 않으며, 명시적인 언어적 단서가 제공될 때에만 공손성 판단의 정확도가 높아지는 경향을 확인했습니다.
대규모 언어 모델(LLM)이 사회적 공손성을 판단하는 능력을 인간의 실제 화용론적 규범과 비교 분석했습니다.