비전-언어 모델 성능 향상을 위한 ProCAP 프롬프트 학습 — AI 생성 일러스트AI 일러스트
리서치 연구

비전-언어 모델 성능 향상을 위한 ProCAP 프롬프트 학습

ProCAP: Probabilistic Cross-Attentive Prompt Learning for Vision-Language Models

arXiv9월 28일 발표 · 3분 · 심사 전 논문

비전-언어 모델(VLM)이 데이터 부족이나 도메인 변화에 취약한 한계를 극복하기 위해, 시각 및 텍스트 상호작용을 강화하는 'ProCAP' 프롬프트 학습 방식을 제안했습니다.

세 줄 요약arXiv 원문 기반
  1. ProCAP은 기존 VLM의 가중치를 변경하지 않으면서도, 교차 어텐션(cross-attention) 메커니즘으로 시각/언어 토큰 간 상호 보완적 연결을 구축하여 안정성을 높였습니다.
  2. 데이터가 부족하거나 테스트 환경이 달라져도 성능 저하를 막아주므로, 실제 산업 현장에서 높은 범용성과 신뢰도를 갖춘 AI 시스템 구현에 기여할 것으로 기대됩니다.
  3. 과적합 방지를 위해 가우시안 정규화와 InfoNCE 헤드를 적용했으며, 11개 데이터셋 및 도메인 변화 환경에서 우수한 성능을 입증했습니다.

기존의 사전 학습된 비전-언어 모델()은 CLIP과 같이 프롬프팅을 통해 새로운 카테고리를 인식할 수 있지만, 레이블 데이터가 부족하거나 테스트 분포가 변화하는 환경에서는 성능 저하를 겪는 한계가 있습니다. 본 연구에서 제안하는 ProCAP은 확률적 교차 어텐션(Probabilistic Cross-Attentive) 학습 프레임워크로, 기존 CLIP 를 업데이트하지 않으면서도 시각 및 텍스트 모달리티 간의 상호작용을 개선하고 학습 안정성을 높이는 것을 목표로 합니다.

ProCAP은 시각적 프롬프트 과 텍스트적 프롬프트 토큰을 모두 학습하며, 이 두 가지를 스택된 양방향 멀티-헤드 교차 어텐션(stacked bidirectional multi-head cross-attention)으로 연결하여 두 브랜치가 서로 깊이별로 정제되도록 합니다. 또한 과적합 방지를 위해 프롬프트 토큰을 가우시안 평균과 분산으로 화하고, 경량 KL 및 L2 페널티를 적용했습니다. 여기에 공유된 저차원 공간에서 교차 어텐션 이미지 특징을 클래스 레벨 텍스트 표현과 정렬하는 InfoNCE 헤드를 추가했습니다.

ProCAP은 11개의 데이터셋에 걸친 소수샷 기반-신규 일반화( base-to-novel generalization) 및 ImageNet 변화 벤치마크를 통해 도메인 일반화 성능을 검증했습니다. 그 결과, CLIP 백본을 변경하지 않은 상태에서도 강력한 종합적인 베이스-투-노벨 성능과 경쟁력 있는 전이 성능을 달성했음을 입증했습니다.

용어 풀이

VLM
이미지와 글을 함께 이해하는 모델.
프롬프트
AI에게 주는 지시나 질문 글.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
매개변수
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
few-shot
몇 개의 예시를 함께 보여 주고 과제를 시키는 방식.
원문arXiv · ProCAP: Probabilistic Cross-Attentive Prompt Learning for Vision-Language Models같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv