VQA 답변 가능성 예측을 위한 VT-Transformer 제안 — AI 생성 일러스트
리서치 연구

VQA 답변 가능성 예측을 위한 VT-Transformer 제안

Vision And Text Transformer For Predicting Answerability On Visual Question Answering

arXiv9월 16일 발표 · 2분 · 프리프린트

시각적 질의응답(VQA) 시스템에서 질문과 이미지 간의 '답변 가능성'을 단순한 이진 분류가 아닌 정량적인 점수로 예측하는 방법을 제시합니다.

세 줄 요약arXiv 원문 기반
  1. 연구진은 기존 방식의 한계를 극복하기 위해, 시각 및 텍스트 특징을 결합한 트랜스포머 구조(VT-Transformer)를 활용하여 답변 가능성을 회귀 문제로 모델링했습니다.
  2. 이러한 회귀 기반 접근 방식은 모달리티 간의 미묘하고 복잡한 상호작용까지 포착할 수 있어, 멀티모달 AI 시스템의 정확도를 획기적으로 향상시킬 잠재력을 가집니다.
  3. 실제 VizWiz 2020 데이터셋 실험 결과, 제안된 VT-Transformer가 기존 경쟁 모델 대비 높은 효과와 안정성을 성공적으로 입증했습니다.

시각적 질의응답(VQA) 시스템에서 질문과 이미지 간에 '답변 가능성(Answerability)'을 예측하는 것은 새롭고 중요한 과제입니다. 기존 연구들은 이 답변 가능성을 단순한 이진 매핑으로 활용하는 경향이 있었으나, 이는 문제의 본질을 충분히 반영하지 못한다는 한계가 지적되었습니다.

이에 연구진은 VT-Transformer를 제안했습니다. 이 모델은 아키텍처를 활용하여 시각적 특징과 텍스트적 특징을 결합하며, 답변 가능성을 회귀(regression) 문제로 접근합니다. 이러한 방식은 모달리티 간의 복잡하고 미묘한 상호작용까지 포착할 수 있도록 설계되었습니다.

실험 결과에 따르면, 제안된 VT-Transformer는 VizWiz 2020 데이터셋에서 경쟁적인 베이스라인 모델들과 비교했을 때 높은 효과와 안정성을 입증했습니다. 이는 답변 가능성 예측을 회귀 기반으로 처리하는 접근 방식의 유효성을 보여줍니다.

용어 풀이

트랜스포머
오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
원문arXiv · Vision And Text Transformer For Predicting Answerability On Visual Question Answering
원문 보기arXiv