LLM 기반 XAI 설명 품질 평가 프레임워크 'XAI-Arena' — AI 생성 일러스트AI 일러스트
리서치 연구

LLM 기반 XAI 설명 품질 평가 프레임워크 'XAI-Arena'

XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?

arXiv9월 10일 발표 · 2분 · 심사 전 논문

기존의 설명 가능한 AI(XAI) 방법론은 평가가 주관적인 인간 판단에 의존하여 재현성과 확장성에 한계가 있었습니다.

세 줄 요약arXiv 원문 기반
  1. 연구진은 LLM을 활용한 'XAI-Arena' 프레임워크를 개발, 단순성, 명확성 등 다차원적 관점에서 XAI 설명의 품질을 객관적으로 평가합니다.
  2. 이 방식은 주관적 판단 의존도를 낮추고 재현 가능하며 확장성 높은 비교 평가 기준을 제시하여 AI 연구의 객관성을 높입니다.
  3. XAI-Arena는 다양한 데이터셋과 이해관계자 페르소나를 기반으로 검증되었으며, LLM이 설명 품질 비교 평가의 표준 도구로 활용될 수 있음을 보여줍니다.

기존의 설명 가능한 AI(XAI) 방법론은 설명 품질을 평가할 때 주관적인 인간 판단에 의존하는 경향이 있어 재현성, 확장성 및 연구 간 비교 가능성에 한계가 있었습니다. 이에 연구진은 을 활용하여 XAI 설명의 품질을 객관적이고 체계적으로 비교 평가할 수 있는 'XAI-Arena' 프레임워크를 개발했습니다.

XAI-Arena는 단순성, 명확성, 작업 적절성(task adequacy), 신뢰 보정(trust calibration), 실행 가능성(actionability), 투명성, 충실도(faithfulness), 전반적인 해석 가능성을 포함한 다차원적 관점에서 XAI 설명을 비교 평가할 수 있도록 설계되었습니다. 이 프레임워크는 다양한 데이터셋과 머신러닝 모델, 그리고 이해관계자 페르소나를 기반으로 벤치마킹을 수행했습니다.

실제 인간 검증 결과에 따르면, LLM이 생성한 평가는 인간의 평가와 강한 양의 상관관계를 보였습니다(Spearman's rho=.693, p<.001). 이는 LLM 기반 평가가 XAI 설명 품질의 체계적인 차이를 포착할 수 있으며, 학술 연구에 활용 가능한 확장 가능하고 재현성 높은 비교 평가 틀을 제공함을 의미합니다.

용어 풀이

LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
원문arXiv · XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv