멀티모달 지식 그래프 추론: VISPATH 프레임워크 공개
VISPATH: Visual-Intent-Guided Path Reasoning for Multimodal Knowledge Graph Question Answering
arXiv기존의 멀티모달 지식 그래프 질문 답변(MM-KGQA) 모델들은 다단계 추론 과정에서 시각 정보를 활용하지 못하는 한계가 있었습니다.
- VISPATH는 질문과 현재 추론 상태를 기반으로 각 단계별 멀티모달 의도를 재계산하여 경로 탐색을 수행하는 혁신적인 프레임워크입니다.
- 이 기술은 복잡한 다단계 추론에서 시각적 단서의 중요성을 입증하며, 실제 테스트에서 최고 성능 모델을 능가하는 높은 정확도를 기록했습니다.
- 연구진은 2~4단계에 이르는 다중 홉(multi-hop) 추론을 평가할 수 있는 새로운 표준 벤치마크인 VISPATH-Bench를 함께 공개했습니다.
지식 그래프 질문 답변(KGQA)은 구조적 그래프 추론을 통해 자연어 질문에 답하는 기술로, 최근에는 입력과 KG 증거를 결합하는 MM-KGQA가 주목받고 있다. 하지만 기존의 MM-KGQA 방법들은 일반적으로 멀티모달 정보를 시작 엔티티 근거화나 증거 검색 단계에서만 활용하고, 이후 다단계 추론 과정은 텍스트 기반 그래프 탐색으로 축소되는 한계가 있었다. 이로 인해 중간 단계에서 중요하게 작용하는 멀티모달 단서를 효과적으로 이용하지 못했다.
이러한 제약을 해결하기 위해 연구진은 시각-의도 기반 경로 추론 프레임워크인 VISPATH를 제안했다. VISPATH는 먼저 멀티모달 근거화와 그래프 구조적 단서를 결합하여 신뢰할 수 있는 시작 엔티티를 식별한다. 이후 입력, 질문, 그리고 현재까지의 부분 경로로부터 단계별 멀티모달 의도를 재계산함으로써 의도 기반의 경로 발견을 수행하며, 각 확장은 현재 추론 상태에 의해 안내된다.
VISPATH는 발견된 경로들을 질문, 추론 스케치 및 단계별 의도와의 일관성을 기준으로 평가하는 '추론-체인 가지치기(reasoning-chain pruning)'를 통해 정제한다. 또한 선택된 증거가 답변 생성에 충분한지 여부를 최종적으로 확인한다. 연구진은 2홉에서 4홉까지의 다중 홉 추론을 평가할 수 있는 새로운 표준 인 VISPATH-Bench를 구축했으며, GPT-4o 백본을 사용했을 때 VISPATH가 VISPATH-Bench에서 평균 정확도 10.6% 향상, 2홉 추론에서는 13.1% 향상을 달성하며 기존 최고 성능 모델을 능가했음을 입증했다.
용어 풀이
- 멀티모달
- 글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.