다중 모드 예측을 위한 신뢰도 기반 변분 텐서 융합
RiVaT-Fuse: Reliability-Calibrated Variational Tensor Fusion for Multimodal Prediction under Modality Uncertainty
arXiv다양한 출처의 정보(이미지, 메타데이터 등)를 결합하여 예측할 때 발생하는 신뢰도 불확실성을 다루는 새로운 융합 프레임워크가 제안되었습니다.
- RiVaT-Fuse는 단순 데이터 결합 대신 변분 목적 함수를 사용하여 샘플별 잠재 상태를 추정하며, 신뢰도를 행렬 형태로 정교하게 모델링하는 것이 핵심입니다.
- 이 연구는 데이터 간의 상호작용과 신뢰도를 수학적으로 깊이 있게 다루어, 기존 방식보다 높은 예측 성능과 외부 교란에 대한 안정성을 확보했습니다.
- 이미지-메타데이터 벤치마크에서 강력한 결과를 보였으나, 변분 목적 함수와 복잡한 수학적 구조로 인해 구현 난이도가 높을 수 있습니다.
이미지-메타데이터와 같은 이질적인 증거를 결합하여 예측하는 과정에서는 각 샘플과 잠재 요인별로 신뢰도가 다르게 나타날 수 있습니다. 기존의 표현 수준 융합 방식들은 단순히 연결(concatenation)이나 어텐션 등의 집계 구조를 선택할 뿐, 모달리티 불확실성 하에서 결합된 표현이 무엇을 의미하는지 명시적으로 정의하지 못했습니다.
제안된 RiVaT-Fuse는 이러한 문제를 해결하기 위해 신뢰도 보정 변분 텐서 융합 프레임워크를 제시하며, 융합 과정을 샘플별 잠재 상태 추정으로 정의합니다. 이는 단순한 벡터 직접 집계 대신 변분 목적 함수를 통해 이미지 증거, 메타데이터 증거, 구조화된 교차 모달 상호작용 및 안정성을 균형 있게 추정하여 합의된 잠재 상태를 도출하는 방식입니다.
RiVaT-Fuse는 기존의 스칼라 형태의 모달리티 신뢰도를 행렬 값 기반의 신뢰도 기하학(trust geometry)으로 대체하고, 상호작용을 가산적, 곱셈적, 관계적 구성 요소로 분해합니다. 이 프레임워크를 이미지 수준의 이미지-메타데이터 예측 에 적용한 결과, 직접적인 표현 수준 기반 방식들 중 가장 강력한 전반적 예측 순위를 달성했으며, 교란 조건 하에서 확률 및 레이블 안정성을 개선하는 것으로 나타났습니다.
용어 풀이
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.