LLM의 공손성 판단 능력 평가: 인간 화용론적 규범과의 비교 — AI 생성 일러스트AI 일러스트
리서치 연구

LLM의 공손성 판단 능력 평가: 인간 화용론적 규범과의 비교

Polite but Misaligned: Evaluating LLM Politeness Judgments Against Human Pragmatic Norms

arXiv9월 25일 발표 · 1분 · 심사 전 논문

대규모 언어 모델(LLM)이 사회적 공손성을 판단하는 능력을 인간의 실제 화용론적 규범과 비교 분석했습니다.

세 줄 요약arXiv 원문 기반
  1. 모델들은 공손성 판단 시 '중립' 레이블을 과도하게 사용하고, 무례함(Impolite)으로 분류하는 경향이 강한 체계적 편향을 보였습니다.
  2. 단순 평균 정확도 측정 대신, 다양한 인간 평가 기준에 따른 '불일치의 방향성 패턴'을 분석해야 LLM의 진정한 사회적 이해도를 파악할 수 있습니다.
  3. LLM은 인간 기준과 완전히 일치하지 않으며, 명시적인 언어적 단서가 제공될 때에만 공손성 판단의 정확도가 높아지는 경향을 확인했습니다.

대규모 언어 모델(LLM)이 사회적 공손성을 판단하는 능력을 인간의 실제 화용론적 규범과 비교 분석했습니다.

원문arXiv · Polite but Misaligned: Evaluating LLM Politeness Judgments Against Human Pragmatic Norms같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv