LLM의 의미 구조 이해 능력, 전방향 테스트 결과 분석
Scoring Both Directions: LLMs realize the MRS they cannot reliably parse
arXiv연구진은 대규모 언어 모델(LLM)의 영어 의미 이해 능력을 형식적 표현인 MRS를 이용해 생성 및 파싱 두 방향으로 테스트했습니다.
- 모델들은 MRS로부터 문장을 만드는 능력은 높았으나, 주어진 문장에서 의미 구조를 추출하는 파싱 작업에서는 기존 시스템에 크게 뒤처졌습니다.
- 이는 LLM이 유창한 텍스트 생성만으로는 복잡하고 형식적인 의미 구조까지 완벽히 이해했다고 보기 어렵다는 점을 시사합니다.
- 따라서 AI의 언어 이해 능력을 평가할 때는 단순한 텍스트 생성 능력뿐 아니라 의미론적 구조를 파악하는 양방향 테스트가 필수적입니다.
영어 자원 문법(ERG)은 주어진 문장에서 최소 재귀 의미론(MRS)이라는 형식적 의미 표현을 생성하는 계산 문법입니다. 이 문법은 양방향으로 작동하며 MRS를 다시 영어 문장으로 변환할 수 있습니다. 연구진은 (LLM) 두 가지(Claude Sonnet 및 Claude Opus)를 대상으로, 별도의 작업별 훈련 없이 전이 학습된 시스템과 비교하여 MRS로부터의 문장 생성 방향과 문장에서 MRS로 파싱하는 양방향 테스트를 수행했습니다.
MRS로부터 문장을 생성하는 방향에서는 LLM들이 높은 성능을 보였습니다. 예를 들어, Opus는 76.3 BLEU를 기록했는데, 이는 72k 쌍으로 훈련된 시스템(66.1 BLEU)보다 10점 높고, 백만 개의 추가 쌍으로 훈련된 시스템(77.2 BLEU)과 비교 가능한 수준이었습니다. Sonnet은 65.7 BLEU를 기록하는 등 전반적으로 우수한 생성 능력을 보여주었습니다.
그러나 문장에서 MRS로 파싱하는 방향에서는 모델들이 기존 시스템에 크게 뒤처졌습니다. LLM들은 그래프의 술어와 인수에 대해 각각 57.2(Sonnet) 및 65.5(Opus) F$_1$을 기록했는데, 이는 ACE가 달성한 91.0과 큰 차이가 있었습니다. 연구진은 이러한 결과를 바탕으로 단순히 높은 생성 점수만으로는 모델이 복잡하고 형식적인 의미 구조를 완벽히 이해했다고 보기 어렵다고 결론지었습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.