리서치 연구
LLM의 문맥 이해도를 평가하는 지식 그래프 기반 프레임워크
Do LLMs Understand Context? A Knowledge Graph-Based Evaluation Framework
arXivLLM의 성능 평가가 단순히 표면적 유사도 측정에 그치지 않고, 주어진 문맥을 얼마나 깊이 이해했는지 판단하는 것이 핵심 과제로 떠올랐습니다.
세 줄 요약
- 이에 연구진은 지식 그래프(KG) 기반의 새로운 평가 프레임워크를 제시하고, 구조와 의미 정보를 결합한 하이브리드 유사도 측정 방식 S3KG를 도입했습니다.
- 이 방법론을 통해 LLM의 답변이 단순 암기가 아닌, 주어진 문맥에 얼마나 논리적이고 사실적으로 근거하는지 정교하게 진단할 수 있게 됩니다.
- 실제 9개 벤치마크에서 높은 성능 향상을 입증했으며, KG 구조를 활용해 모델 실패 원인까지 세밀하게 분석 가능하다는 장점이 있습니다.
(LLMs)은 뛰어난 언어 능력을 보여주지만, 이들이 단순히 패턴 매칭을 하는지 진정한 문맥적 이해를 하는지에 대한 근본적인 의문이 남아있다. 기존의 BLEU나 perplexity 같은 전통적인 평가는 표면적인 성능만 측정할 뿐이며, 질문 답변(QA)에서 요구되는 맥락에 기반한 추론 능력을 평가하는 데 한계가 있다.
연구진은 이러한 간극을 해소하기 위해 지식 그래프(KG)를 활용한 새로운 평가 프레임워크를 제안했다. 이 방법론의 핵심은 구조적 신호와 의미론적 신호를 결합하여 단일 점수로 산출하는 하이브리드 유사도 측정 방식인 Semantic Structural Similarity for KGs (S3KG)이다.
이 프레임워크는 트리플렛 수준에서 추론 오류를 식별하고 분류할 수 있는 진단 분석 체계를 제공함으로써, 모델 실패 원인에 대한 정교한 분석을 가능하게 한다. 실제로 9개 전반에 걸쳐 S3KG는 가장 강력한 기준선 대비 최대 $+7.6$점의 F1 향상과 최대 $0.973$의 AUROC를 달성했다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.