LLM 다국어 사실 오류 거부 능력 평가 벤치마크 'SWORD' 공개 — AI 생성 일러스트AI 일러스트
리서치 연구

LLM 다국어 사실 오류 거부 능력 평가 벤치마크 'SWORD' 공개

SWORD: Wikidata-based Distortions Reveal Hidden Cross-Lingual Inconsistencies in LLM Factual Error Rejection

arXiv9월 10일 발표 · 2분 · 심사 전 논문

LLM의 다국어 사실 오류 거부 능력을 평가하기 위해 위키데이터 기반의 새로운 벤치마크 'SWORD'가 개발되었습니다.

세 줄 요약arXiv 원문 기반
  1. 분석 결과, 모델은 무작위 오류보다 의미적으로 그럴듯한 왜곡에 의존하며, 특히 아시아 언어에서 현저하게 성능 저하가 관찰되었습니다.
  2. 기존 벤치마크는 단순히 정답 선택 능력만 측정할 뿐, 다국어 환경에서의 깊이 있는 사실 추론 능력을 제대로 평가하지 못합니다.
  3. 따라서 LLM의 다국어 역량은 언어별로 성능 격차가 크므로, 평균 점수만으로 모델을 평가하는 것은 위험합니다.

기존 성능 평가는 단순히 정답을 선택하는 능력을 측정할 뿐, 모델의 진정한 사실적 이해도를 제대로 평가하지 못한다는 문제의식에서 출발했다. 이에 연구진은 다국어 환경에서 모델이 일관되게 사실 오류를 거부하는지 검증하기 위해 'SWORD(Systematic Wikidata-based Object-Relation Distortion)'라는 새로운 를 개발하여 제시했다.

SWORD는 위키데이터 트리플을 통제된 방식으로 변형하여, 무작위 엔티티 대체부터 의미적으로 그럴듯한 속성 기반 선택에 이르기까지 다양한 사실 오류 문장을 8개 주요 언어로 생성한다. 분석 결과, 모델들은 무의미한 무작위 왜곡보다 의미가 유사한 왜곡(semantically plausible distortions)에서 더 높은 정확도를 보이는 경향이 관찰되었다.

특히 다국어 성능을 비교했을 때 상당한 격차가 발견되었다. 일부 모델에서는 아시아 언어(East Asian languages)를 대상으로 할 때 기준선 대비 최대 28 퍼센트 포인트의 성능 저하가 나타났다. 이는 다국어 사실 추론 능력이 비대칭적이며, 평균적인 정확도 지표만으로는 파악하기 어려운 중요한 결함임을 보여준다.

용어 풀이

LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · SWORD: Wikidata-based Distortions Reveal Hidden Cross-Lingual Inconsistencies in LLM Factual Error Rejection같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv