산업 객체 탐지를 위한 인간 친화적 XAI 적용
Adapting Vision-Language Models for Human-Readable XAI in Industrial Object Detection
arXiv산업 현장에서 AI의 신뢰도를 높이기 위해, 전문가가 아닌 작업자도 이해할 수 있는 설명(XAI) 인터페이스를 개발했습니다. 이 시스템은 비전-언어 모델을 미세 조정하여 작동합니다.
- 기존 범용 VLM은 현장 사용자에게 충분히 맥락에 맞는 설명을 제공하기 어려웠습니다. 연구진은 모델을 미세 조정하여 설명의 명료성과 상황 인지 능력을 기존 최고 성능 모델보다 개선했음을 입증했습니다.
- 본 기술은 AI 설명 자체의 접근성을 높여, 제조 현장의 품질 검사 등 다양한 작업자들이 AI 시스템을 더욱 쉽게 이해하고 높은 신뢰를 바탕으로 활용하도록 돕습니다.
- 이 연구는 산업용 객체 탐지에 특화된 방법론이며, 독점적 데이터와 공개 로봇 공학 데이터셋을 활용하여 성능을 검증했습니다.
설명 가능한 인공지능(XAI)은 제조 라인에 AI를 통합하고 신뢰도를 구축하는 데 필수적인 요소입니다. 그러나 기존의 대부분의 XAI 방법론들은 기술 전문가에게 초점을 맞추고 있어, 품질 검사 등에서 AI를 사용하는 현장의 비전문가 작업자들에게는 접근성이 떨어진다는 한계가 있었습니다. 본 연구에서는 이러한 문제를 해결하기 위해 된 비전-언어 모델()을 기반으로 산업 제조 환경에 특화된 XAI 인터페이스를 개발했습니다.
기존의 범용 VLM들은 현장 사용자에게 명확하고 맥락과 관련된 설명을 제공하는 데 어려움을 겪었습니다. 이에 연구진은 VLM을 미세 조정하여 해당 인터페이스에 통합함으로써, 비전문 사용자를 위한 상황적이고 접근성이 높은 설명 생성을 가능하게 했습니다. 이로써 AI 설명 자체의 활용성과 사용성을 높이는 것이 목표입니다.
개발된 방법론은 독점적인 데이터셋과 공개 로봇 공학 데이터셋을 사용하여 성능이 검증되었습니다. 그 결과, 제안된 방식은 설명의 명료성, 지침 준수도, 이미지 기반 정확성(image groundedness), 그리고 상황 인지 능력 등 여러 측면에서 GPT 4o-mini 대비 개선된 성능을 입증했습니다. 이 기술은 제조 현장의 품질 검사 등 다양한 작업자들이 AI 시스템에 대한 높은 신뢰를 바탕으로 활용하도록 지원합니다.
용어 풀이
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
- VLM
- 이미지와 글을 함께 이해하는 모델.