모델 연구
You Really Didn't Get That? Benchmarking Social Pragmatic Inference for Indirect and Playful Chinese Online Comments
ARarXiv
맥락 의존적이고 간접적인 중국 온라인 댓글의 사회적 의미를 파악하기 위한 새로운 화용론적 추론 평가 기준(벤치마크)이 개발되었습니다.
세 줄 요약
- 8개 대규모 언어 모델(LLM)을 테스트한 결과, 평균 정확도는 68.70%로 나타나 인간의 정확도(90.8%)와 큰 격차를 보였습니다.
- 이는 AI가 단순한 문장 이해를 넘어, 실제 대화 맥락 속에서 발생하는 미묘하고 상황적인 의도를 파악하는 데 여전히 어려움이 있음을 시사합니다.
- 모델들은 전반적 아이러니나 장난기 같은 큰 흐름은 포착하지만, 댓글에 사용된 구체적인 상호작용 방식이나 메커니즘을 식별하는 데 한계가 있었습니다.
맥락 의존적이고 간접적인 중국 온라인 댓글의 사회적 의미를 파악하기 위한 새로운 화용론적 추론 평가 기준(벤치마크)이 개발되었습니다.