리서치 연구
객체 수준 증거 분리를 위한 ProtoLIP 연구
ProtoLIP: From Sentence-Level to Object-Level Evidence Disentanglement
arXiv시각-언어 모델(VLM)의 해석 가능성 한계를 극복하기 위해, 텍스트 질의에 따른 객체별 증거 분리 및 위치 파악을 개선한 ProtoLIP 레이어를 제안합니다.
세 줄 요약
- ProtoLIP은 재사용 가능한 시각적 프로토타입을 텍스트 기반 '의미론적 가족'으로 조직화하고, 질의 의존적인 라우팅을 통해 증거 제공 범위를 정교하게 제어합니다.
- 특히, 모델의 최종 매칭 점수를 '의미론적 가족'과 '개별 프로토타입 기여'로 정확히 분해하여 VLM의 증거 기반 추론 과정을 명확하게 분석할 수 있습니다.
- 별도의 공간 주석이나 모델 재학습 없이도 성능 향상이 가능하며, 텍스트 기반의 약한 감독만을 사용하여 독립적으로 사전 학습된 여러 VLM에도 효과적으로 전이됩니다.
쿼리 기반의 시각-언어 모델()은 텍스트 질의에 따라 시각적 증거가 어떻게 변화하는지 보여주며 정교한 해석을 가능하게 합니다. 하지만 현재 방식으로는 완전한 설명에 의존하는 증거 조건화가 반드시 객체별 증거로 분리되지 않으며, 노출된 증거 지도 역시 모델 예측을 구성하는 정확한 증거를 식별하지 못하는 한계가 있습니다.
본 논문에서는 재사용 가능한 시각적 프로토타입을 텍스트 기반의 '의미론적 가족(semantic families)'으로 조직화하고, 질의에 의존적인 가족 라우팅을 사용하여 증거 제공 범위를 제한하는 경량의 ProtoLIP 레이어를 제안합니다. 이 구조는 공간 주석이나 백본 재학습 없이도 쿼리 세분성 전반에 걸쳐 증거 위치 파악 및 분리를 개선할 수 있습니다.
ProtoLIP은 매칭 점수를 국소화된 프로토타입 증거로부터 직접 구성하여, 이 점수가 '의미론적 가족' 기여와 개별 '프로토타입' 기여로 정확하게 분해되도록 합니다. 이는 텍스트 기반의 약한 감독만을 사용함에도 불구하고 공간적으로 지도된 모델과 경쟁할 수 있으며, 독립적으로 사전 학습된 VLM에도 효과적으로 전이될 수 있습니다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.