그래프 구조 없이 구현하는 멀티모달 RAG 프레임워크 — AI 생성 일러스트AI 일러스트
리서치 연구

그래프 구조 없이 구현하는 멀티모달 RAG 프레임워크

Less Is More: Graph-free Multimodal RAG via Multi-signal Late Fusion

arXiv9월 18일 발표 · 3분 · 심사 전 논문

기존 RAG는 복잡한 그래프 구축 및 유지보수 비용이 문제였습니다. 이에 연구진은 질문, 앵커 이미지, VLM 강화 질의 등 세 가지 신호를 결합하는 'TrioRAG'라는 새로운 그래프 없는 멀티모달 프레임워크를 제안했습니다.

세 줄 요약arXiv 원문 기반
  1. TrioRAG는 기존 시스템 대비 성능은 유지하거나 능가하면서도 비용을 절감하고 추론 속도를 1.6~2.3배 가속화했습니다. 또한, 웹 출처의 노이즈 이미지를 다루는 새로운 자동차 벤치마크 'AutoQA'를 개발하여 실용성을 입증했습니다.
  2. 이 기술은 대규모 데이터셋을 그래프로 구조화할 필요 없이도 고성능의 멀티모달 QA 구현이 가능함을 보여줍니다. 특히 노이즈가 많은 웹 이미지 환경에서도 텍스트 기반 검색으로 안정적인 성능 유지가 핵심 강점입니다.
  3. 본 연구의 벤치마크는 출처 외(out-of-corpus) 웹 이미지를 다루는 복잡한 추론에 초점을 맞췄습니다. 따라서 일반적인 문서 기반 데이터셋보다는 모델 주도형 테스트베드로서 활용하는 것이 적절합니다.

기존의 그래프 기반 (RAG) 방식은 다중 모드, 교차 문서 질의응답에 널리 사용되어 왔으나, 코퍼스 수준의 그래프를 구축하고 유지하는 과정이 비용이 많이 들고 느리며 관리하기 어렵다는 문제가 있었습니다. 이에 연구진은 질문 자체, 기준 이미지(anchor image), 그리고 이 두 가지 신호 모두에서 생성된 강화 질의라는 세 가지 상호 보완적인 신호를 통합하는 'TrioRAG'라는 그래프 없는 프레임워크를 제안했습니다.

TrioRAG는 각 신호가 페이지 텍스트와 이미지를 공유하는 다중 벡터 인덱스에 독립적으로 검색을 수행한 후, 이 결과를 지연 융합(late fusion) 방식으로 결합합니다. 연구 결과에 따르면, TrioRAG는 기존의 그래프 기반 시스템과 동등하거나 그 이상의 성능을 보이면서도 전체 비용을 절감하고 쿼리당 추론 속도를 1.6배에서 2.3배까지 가속화하는 성과를 보였습니다.

또한, 연구진은 노이즈가 포함된 웹 출처 이미지를 기반으로 질문을 생성하는 새로운 멀티모달 자동차 인 'AutoQA'를 개발했습니다. 이 벤치마크는 매뉴얼 전반에 걸친 추론 능력을 요구하며, 특히 이미지 검색만으로는 문서 수준의 재현율이 낮아지는 상황에서 VLM 강화 질의와 같은 텍스트 기반 신호가 검색의 안정성을 유지하는 핵심 강점을 보여줍니다.

용어 풀이

검색 증강 생성
답하기 전에 관련 문서를 찾아 그 내용을 근거로 답하게 하는 방법.
VLM
이미지와 글을 함께 이해하는 모델.
멀티모달
글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · Less Is More: Graph-free Multimodal RAG via Multi-signal Late Fusion같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv