비전-언어 모델 성능 향상을 위한 ProCAP 프롬프트 학습
ProCAP: Probabilistic Cross-Attentive Prompt Learning for Vision-Language Models
arXiv비전-언어 모델(VLM)이 데이터 부족이나 도메인 변화에 취약한 한계를 극복하기 위해, 시각 및 텍스트 상호작용을 강화하는 'ProCAP' 프롬프트 학습 방식을 제안했습니다.
- ProCAP은 기존 VLM의 가중치를 변경하지 않으면서도, 교차 어텐션(cross-attention) 메커니즘으로 시각/언어 토큰 간 상호 보완적 연결을 구축하여 안정성을 높였습니다.
- 데이터가 부족하거나 테스트 환경이 달라져도 성능 저하를 막아주므로, 실제 산업 현장에서 높은 범용성과 신뢰도를 갖춘 AI 시스템 구현에 기여할 것으로 기대됩니다.
- 과적합 방지를 위해 가우시안 정규화와 InfoNCE 헤드를 적용했으며, 11개 데이터셋 및 도메인 변화 환경에서 우수한 성능을 입증했습니다.
기존의 사전 학습된 비전-언어 모델()은 CLIP과 같이 프롬프팅을 통해 새로운 카테고리를 인식할 수 있지만, 레이블 데이터가 부족하거나 테스트 분포가 변화하는 환경에서는 성능 저하를 겪는 한계가 있습니다. 본 연구에서 제안하는 ProCAP은 확률적 교차 어텐션(Probabilistic Cross-Attentive) 학습 프레임워크로, 기존 CLIP 를 업데이트하지 않으면서도 시각 및 텍스트 모달리티 간의 상호작용을 개선하고 학습 안정성을 높이는 것을 목표로 합니다.
ProCAP은 시각적 프롬프트 과 텍스트적 프롬프트 토큰을 모두 학습하며, 이 두 가지를 스택된 양방향 멀티-헤드 교차 어텐션(stacked bidirectional multi-head cross-attention)으로 연결하여 두 브랜치가 서로 깊이별로 정제되도록 합니다. 또한 과적합 방지를 위해 프롬프트 토큰을 가우시안 평균과 분산으로 화하고, 경량 KL 및 L2 페널티를 적용했습니다. 여기에 공유된 저차원 공간에서 교차 어텐션 이미지 특징을 클래스 레벨 텍스트 표현과 정렬하는 InfoNCE 헤드를 추가했습니다.
ProCAP은 11개의 데이터셋에 걸친 소수샷 기반-신규 일반화( base-to-novel generalization) 및 ImageNet 변화 벤치마크를 통해 도메인 일반화 성능을 검증했습니다. 그 결과, CLIP 백본을 변경하지 않은 상태에서도 강력한 종합적인 베이스-투-노벨 성능과 경쟁력 있는 전이 성능을 달성했음을 입증했습니다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.
- 프롬프트
- AI에게 주는 지시나 질문 글.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- few-shot
- 몇 개의 예시를 함께 보여 주고 과제를 시키는 방식.