비전-언어 모델의 답변 거부 및 추론 능력 분석 — AI 생성 일러스트AI 일러스트
리서치 연구

비전-언어 모델의 답변 거부 및 추론 능력 분석

Knowing When Not to Answer: Abstention and Refusal Reasoning in Vision--Language Models

arXiv9월 9일 발표 · 3분 · 심사 전 논문

비전-언어 모델(VLM)이 의료 진단 등 다중 맥락적 판단을 요구하는 질문에 대해 적절히 '답변 거부'를 하는지 여부를 심층적으로 분석했습니다.

세 줄 요약arXiv 원문 기반
  1. 모델들은 답변 거부를 먼저 하는 유형과 추측하는 유형으로 명확히 나뉘었으며, 특히 일부는 특정 표정에서 잘못된 진단을 내릴 위험이 높았습니다.
  2. AI의 오진 위험을 낮추기 위해 임상적 가드레일 적용이나 프롬프트/인터페이스 디자인 개선이 효과적인 안전장치임을 제시합니다.
  3. 결론적으로, VLM이 아무리 발전해도 이미지만으로 다중 맥락의 전문적인 진단을 대체할 수 없다는 근본적인 한계를 인지해야 합니다.

비전-언어 모델()은 의료 진단과 같이 상세하고 다중 맥락적인 평가가 필요한 영역에서 이미지 해석을 요청받고 있으며, 이는 근거 없는 추론으로 인해 안전 문제를 야기할 수 있습니다. 예를 들어, 자폐 스펙트럼 장애(ASD) 진단은 정지된 얼굴 사진만으로는 불가능하며 행동 및 발달 증거를 필요로 합니다. 본 연구는 VLM이 이러한 답변 불가한 쌍 이미지 질의에 대해 적절히 '답변 거부'하는지 여부를 감사했습니다.

연구진은 합성적이고 인구통계학적으로 균형 잡힌, 신원 통제 중립/표정 포트레이트 쌍과 중립-중립 대조군으로 구성된 PARITY라는 세트를 도입했습니다. 이 질의가 이미지 자체만으로는 답변 불가능하기 때문에, 비답변 선택은 유해한 귀속으로 간주됩니다. 분석 결과, VLM들은 '거부 우선 모델'과 '추측하는 모델'로 명확히 나뉘는 경향을 보였으며, 특히 추측하는 모델의 경우 특정 표정이 유해한 선택을 불균형적으로 촉발시키는 것으로 나타났습니다.

임상적 가드레일(Clinical guardrails)을 적용하거나 단일 이미지로 프레이밍하는 방식은 답변 거부율을 상당히 높이는 것으로 확인되었습니다. 이는 프롬프팅 및 인터페이스 디자인 모두에서 실행 가능한 완화 방안이 있음을 시사합니다. 궁극적으로, VLM의 발전에도 불구하고 이미지만으로는 다중 맥락적 전문 진단을 대체할 수 없다는 근본적인 한계를 인지하는 것이 중요합니다.

용어 풀이

VLM
이미지와 글을 함께 이해하는 모델.
원문arXiv · Knowing When Not to Answer: Abstention and Refusal Reasoning in Vision--Language Models같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv