멀티모달 RAG 성능 측정을 위한 교차 모드 다단계 추론 벤치마크 — AI 생성 일러스트AI 일러스트
리서치 연구

멀티모달 RAG 성능 측정을 위한 교차 모드 다단계 추론 벤치마크

CrossModalQA: A Cross-modal and Multi-hop Benchmark for Multimodal Retrieval-augmented Generation

arXiv9월 9일 발표 · 2분 · 심사 전 논문

CrossModalQA는 기존 LLM의 지식 한계를 극복하기 위해, 복합적인 멀티모달 추론 능력을 측정하는 오픈 도메인 벤치마크입니다.

세 줄 요약arXiv 원문 기반
  1. 이 벤치마크는 비전-투-텍스트부터 다중 이미지 교차 분석까지 총 다섯 가지 깊이 있는 추론 경로를 포함하며, 평균 3.5홉의 복잡도를 가집니다.
  2. 연구 결과, 답변 정확도는 모델 크기 확장보다 필요한 근거 자료(증거)를 완벽하게 검색하고 조합하는 능력에 더 크게 좌우됩니다.
  3. 따라서 향후 멀티모달 RAG 시스템의 성능을 높이려면 다중 이미지와 관련된 복합적 추론 능력을 강화하는 것이 핵심 과제입니다.

대규모 언어 모델(MLLMs)의 강력한 기능에도 불구하고, 지식은 불완전하고 업데이트가 어렵기 때문에 외부 텍스트와 이미지를 활용하는 (RAG)이 중요해지고 있다. 하지만 기존 들은 단일 단계 검색이나 제한된 컨텍스트에만 초점을 맞추거나, 복잡한 다단계 및 멀티 이미지 추론 경로를 충분히 탐구하지 못했다는 한계가 있었다.

이에 CrossModalQA라는 오픈 도메인 벤치마크가 소개되었다. 이 벤치마크는 총 1,863개의 질문-답변 쌍으로 구성되었으며, 4,987개의 위키피디아 기사와 4,431개의 위키미디어 커먼스 이미지를 기반으로 한다. CrossModalQA는 비전-투-텍스트, 텍스트-투-비전, 다중 이미지 교차 분석 등 다섯 가지 상호 보완적인 추론 경로를 포함하며, 평균적으로 3.50홉의 높은 추론 깊이를 요구한다.

실험 결과에 따르면, 기존 멀티모달 RAG 시스템은 완전한 증거 사슬을 복구하는 데 어려움을 겪으며, 검색이 불완전할 경우 폐쇄형 모델보다 성능이 떨어질 수 있다. 추가 분석 결과, 답변 정확도에는 생성기 확장보다는 완전한 교차 모드 검색 기여도가 더 크며, 다중 이미지 검색 및 추론 능력이 엔드투엔드 성능을 제한하는 주요 병목 지점임이 밝혀졌다.

용어 풀이

멀티모달
글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
검색 증강 생성
답하기 전에 관련 문서를 찾아 그 내용을 근거로 답하게 하는 방법.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · CrossModalQA: A Cross-modal and Multi-hop Benchmark for Multimodal Retrieval-augmented Generation같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv