시각 질의응답 강건성을 위한 반사실적 추론 연구 — AI 생성 일러스트AI 일러스트
리서치 연구

시각 질의응답 강건성을 위한 반사실적 추론 연구

Counterfactual Reasoning for Robust Visual Question Answering

arXiv9월 16일 발표 · 2분 · 심사 전 논문

시각 질의응답(VQA) 모델은 학습 데이터의 허위 상관관계에 의존하여 분포 외(OOD) 환경에서 일반화 성능이 떨어지는 한계가 있었습니다.

세 줄 요약arXiv 원문 기반
  1. 이를 해결하기 위해 대조적 추론 학습 프레임워크를 제안하며, 세 단계 커리큘럼과 답변-대조 손실(AC), 기울기 불일치 손실(GD)을 도입해 인과적 시각 근거 학습을 강화했습니다.
  2. 이러한 방법론은 모델이 분포 외(OOD) 상황에서도 강건성을 확보하고, 표준 데이터셋 대비 일반화 성능 저하 폭을 크게 줄이는 데 기여합니다.
  3. 실제 테스트 결과, 본 모델은 편향에 민감한 VQA-CP v2 등 OOD 벤치마크에서 높은 경쟁력을 보이며, 강건성과 표준 성능 간의 우수한 균형을 입증했습니다.

최신 시각 질의응답(VQA) 모델들은 학습 데이터에 내재된 허위 상관관계에 의존하는 경향이 있어, 분포 외(OOD) 환경에서 일반화 성능이 저하되는 문제가 있었습니다. 기존 연구에서도 반사실적 학습을 통해 이 문제를 해결하려는 노력이 있었으나, 본 논문은 주의를 인과적 증거로 유도하고 특징 구분을 강화하기 위해 개선된 대조적 추론 학습 프레임워크를 제안합니다.

제안된 프레임워크는 세 가지 주요 기여점을 포함합니다. 첫째, 안정적인 다중 목표 최적화를 위한 3단계 커리큘럼을 도입했습니다. 둘째, 더 판별력 있는 특징 학습을 위해 향상된 배치-대조 손실(Batch-Contrastive loss)을 사용합니다. 셋째, 예측 공간을 정제하는 답변-대조 손실(AC loss)과 인과적 시각 근거를 강제하는 기울기 불일치 손실(GD loss)이라는 두 가지 새로운 정규화 기법을 추가했습니다.

이 모델은 편향에 민감한 VQA-CP v2 에서 61.64%의 경쟁력 있는 정확도를 달성했으며, 표준 VQA v2 데이터셋에서는 62.80%를 유지하는 결과를 보였습니다. 이는 OOD 강건성과 인-분포 성능 간에 1.16%라는 작은 일반화 격차만을 보여주며, 두 영역에서 강력한 균형을 이룬다는 것을 입증합니다.

용어 풀이

벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · Counterfactual Reasoning for Robust Visual Question Answering같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기