리서치 연구
WiC는 WSD가 아니다: LLM의 어휘 모호성 해결 연구
WiC is Not WSD: A Study on LLMs and Lexical Ambiguity Resolution
arXiv대규모 언어 모델(LLM)이 단어의 문맥적 의미를 파악하는 과정에서 겪는 어려움(WiC)의 원인을 분석하고 해결 방안을 제시합니다.
세 줄 요약
- 연구 결과, 전통적인 WSD 방식처럼 후보 의미(candidate senses)를 명시적으로 제공할 때 LLM의 문맥 이해 성능이 전반적으로 향상됨을 확인했습니다.
- 이는 모델이 단순히 단어를 아는 수준을 넘어 일관되고 목표 지향적인 판단을 내리려면 구조화된 의미 정보가 필수적임을 시사합니다.
- 다만, 관찰된 오류의 상당수는 단순한 이해 부족보다 라벨 경계의 모호성이나 지나치게 세분화된 구별에서 오는 오판일 수 있다는 점에 유의해야 합니다.
Word-in-Context (WiC) 문제는 최근 언어 모델(s)에게 여전히 어려운 과제로 남아있다. 본 연구는 이러한 어려움이 단순히 단어의 두 가지 문맥적 사용을 비교하는 것뿐만 아니라, 관련 의미론적 세분성 수준을 명시적으로 지정하는 구체적인 의미 목록(sense inventory)의 부재에서 비롯된다고 가설을 제시했다.
연구진은 LLM에 대해 WiC와 전통적인 Word Sense Disambiguation (WSD)를 비교 평가했으며, 그 결과 전통 WSD 방식처럼 후보 의미(candidate senses)를 제공했을 때 모든 설정에서 WiC 성능이 향상됨을 발견했다. 이는 명시적인 의미 정보가 모델이 더 일관되고 목표 지향적인 판단을 내리는 데 필수적임을 보여준다.
인간 평가 결과에 따르면, 관찰된 많은 WiC 오류는 단순한 어휘 이해의 실패라기보다는 라벨 자체의 모호성이나 모델과 주석가 간 의미 경계 불일치에서 기인하는 경우가 많았다. 특히 LLM은 지나치게 세분화된 구별을 시도하며 과잉 해석(overthinking)하여 오류를 범하는 경향이 있다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.