리서치 연구
해석 가능성 방법론에서 모델 자체 이해로의 전환
From Interpretability Methods to Interpretable Models
arXiv컴퓨터 비전 분야의 설명 가능한 AI(XAI) 연구는 다양한 분석 도구를 갖추었으나, 그 방법론 자체를 비교하는 데만 치중되어 왔다는 문제 제기입니다.
세 줄 요약
- 따라서 학계는 해석 도구 개발에 집중하기보다, 모델 자체가 어떤 방식으로 데이터를 계산하고 표현하는지에 대한 근본적인 이해로 초점을 전환해야 합니다.
- AI의 신뢰성을 확보하려면 단순히 성능을 넘어, 실제로 AI 결과에 의존하는 일반 사용자가 '이해할 수 있는' 수준까지 해석 가능성을 입증해야 합니다.
- 결국 모델의 해석 가능성은 이론적 증명이나 추론을 넘어서, 실제 사용자 관점에서 객관적으로 측정하고 검증하는 것이 핵심 과제입니다.
컴퓨터 비전 분야의 설명 가능한 AI(XAI)는 어트리뷰션, 특징 시각화, 개념 기반, 회로 기반 등 성숙한 도구 상자를 갖추게 되었다. 그러나 이 분야의 노력은 주로 이러한 방법론을 구축하고 비교하는 데 집중되어 왔으며, 본래 답변하고자 했던 '모델 자체의 해석 가능성'에 대한 질문에는 소홀했다.
필자들은 연구 초점을 방법론에서 모델로 전환해야 한다고 주장하며, 두 가지 보완적인 방향을 제시한다. 첫 번째는 기존 도구를 활용하여 다양한 모델이 무엇을 표현하고 계산하는지 특성화하고 비교할 수 있는 영역이다.
두 번째이자 더 어려운 과제는 모델이 실제로 의존하는 인간 사용자(신뢰 및 인증의 독립적 평가자)에게 이해될 수 있는지 여부이다. 이는 전문가가 예상하는 바를 확인하는 것을 넘어선 영역이며, 추론할 것이 아니라 반드시 측정되어야 한다.