리서치 연구
CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation
ARarXiv
MLLM 기반 임베딩 모델은 개념은 같아도 속성-사물 결합 방식이 다른 장면을 구분하는 데 어려움을 겪습니다. 본 연구는 리랭커의 정교한 판단 능력을 임베딩 모델에 학습시키는 CORE를 제안했습니다.
세 줄 요약
- CORE는 5단계 조합 매칭 레벨과 Rank-KL 목적 함수를 도입하여, 임베딩 모델이 복잡하고 미세한 순위 판단을 재현하도록 훈련시켰으며 높은 성능 향상을 입증했습니다.
- 이는 AI가 단순히 사물을 인식하는 단계를 넘어 '어떤 속성이 어떤 사물에 결합되었는지'와 같은 복잡한 관계까지 이해하는 차세대 멀티모달 임베딩 모델 개발 가능성을 제시합니다.
- 세 가지 조합 추론 벤치마크에서 성능을 입증했으며, 개선된 능력이 COCO나 Flickr30K 등 다른 검색 환경에서도 안정적으로 전이됨을 확인했습니다.
MLLM 기반 임베딩 모델은 개념은 같아도 속성-사물 결합 방식이 다른 장면을 구분하는 데 어려움을 겪습니다. 본 연구는 리랭커의 정교한 판단 능력을 임베딩 모델에 학습시키는 CORE를 제안했습니다.