VLM의 모달리티 간극: 작업별 효과에 따른 기하학적 분석
One Geometry, Different Outcomes: Readout-Dependent Effects of the Modality Gap in Vision-Language Models
arXiv비전-언어 모델(VLM)은 이미지와 텍스트를 정렬하지만, 두 모달리티 간의 '간극'이라는 기하학적 분리를 가집니다. 본 연구는 이 간극이 단일한 방향으로 설명되는 구조임을 밝혀냈습니다.
- 간극을 수정하는 방식은 수행하는 작업(분류, 검색 등)에 따라 효과가 매우 다릅니다. 특정 작업에서는 성능 향상을 가져오지만, 다른 작업에서는 순위 왜곡이나 제한적인 결과를 초래합니다.
- 단순히 성능 개선에 그치지 않고, 모델의 동작 원리를 기하학적으로 분석하여 VLM 시스템 설계에 과학적이고 체계적인 기반을 제시한다는 점에서 중요합니다.
- 간극 수정 효과가 모든 다운스트림 작업에서 균일하지 않으며, 이 분석은 간극이 단일 방향(rank-one)으로 설명된다는 전제에 기반하고 있습니다.
대조 학습 비전-언어 모델()은 이미지와 텍스트 쌍을 정렬된 공간으로 만드지만, 두 모달리티 사이에는 여전히 '모달리티 간극'이라는 기하학적 분리가 존재한다. 본 연구는 이 간극에 대한 통일된 기하학적 설명을 제공하며, 평균 분리 성분이 근사적으로 랭크-원임을 밝혀냈다. 이는 단일 지배 방향이 이미지-텍스트 평균 분리 제곱 노름의 94.4%에서 99.9%를 포착함을 의미한다.
간극을 수정하는 방식은 수행되는 작업에 따라 그 효과가 다르게 나타난다. 분류(zero-shot classification)에서는 쿼리 측 고정 간극 오프셋 빼기가 가산 클래스 편향과 정확히 동일하다. 반면, 표준 교차 모달 검색(cross-modal retrieval)에서 간극 방향을 투영하여 제거하면 후보별 노름 정보가 손실되어 승수적 순위 왜곡이 유발된다.
혼합 모달 검색(mixed-modal retrieval)의 경우, 간극 방향은 후보들을 모달리티별로 정렬하는 역할을 하며, 이를 제거할 경우 교차 모달 순위를 개선할 수 있다. 이러한 결과들은 간극 수정이 다운스트림 설정에서 성능을 향상시키거나 저하시키는 이유를 설명하며, 유사도 기반 VLM 시스템 설계에 원칙적인 기반을 제공한다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
- 제로샷
- 예시를 하나도 주지 않고 바로 과제를 시키는 방식.