VQA 이미지 분석을 위한 개입 기반 영역 라벨링 기술
Don't Just Look, Intervene: Perturbation Based Region Labeling for VQA Images
arXivVLM의 시각적 추론 학습을 위해, 답변에 결정적인 영향을 미치는 '모델-인과적 이미지 영역'을 식별하는 CSGR 방법을 제안했습니다.
- 이 방법은 후보 영역에 '반사실적 개입(counterfactual intervention)'을 가해 답변 민감도를 측정하며, 기존 방식 대비 우수한 성능 향상을 입증했습니다.
- 단순히 이미지를 '보는' 것을 넘어, 모델의 답변을 실제로 변화시키는 핵심 시각 증거를 찾아내 VLM 학습의 질적 향상을 가능하게 합니다.
- CSGR은 영역 라벨링을 통해 모델이 어떤 시각 정보에 의존하는지 파악하여, VLM의 추론 과정을 근본적으로 개선할 수 있는 기반 기술입니다.
기존의 (VLMs)은 정확한 답변을 도출하기 위해 시각적 증거에 의존해야 하지만, 이러한 시각적 추론 근거를 수동으로 주석 처리하거나 데이터셋별로 정의하는 것은 비용이 많이 듭니다. 이에 연구진은 '모델-인과적 시각 증거'라는 새로운 주석 대상을 도입했습니다. 이는 주어진 이미지-질문 쌍에 대해 모델의 답변 분포를 변화시키는 반사실적 개입(counterfactual intervention)을 통해 식별되는 이미지 영역들의 집합입니다.
이러한 원칙을 바탕으로 '반사실적 검색 기반 근거 영역 찾기(CSGR)'라는 확장 가능한 파이프라인이 제안되었습니다. CSGR은 후보 영역들을 제시하고, 이들 영역에 개입을 가하여 답변 민감도를 측정하며, 여러 심사위원들의 증거를 집계함으로써 VQA 데이터에서 답변 결정에 중요한 역할을 하는 영역들을 근사적으로 찾아냅니다.
제안된 주석 방식의 유용성을 평가하기 위해 CSGR은 세 가지 기존의 근거 인식 학습 루틴(어텐션 스티어링, Visual CoT , 잠재 시각 추론)에 적용되었습니다. 실험 결과, 경쟁하는 자동 영역 라벨링 메커니즘들과 비교했을 때, CSGR 주석 방식이 도메인 내외 평가 모두에서 크로스 엔트로피만을 이용한 파인튜닝 대비 가장 일관된 성능 향상을 제공함을 입증했습니다.
용어 풀이
- 비전 언어 모델
- 이미지와 글을 함께 이해하는 모델.
- 파인튜닝
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.