모델 연구

Retrieval Heads Meet Vision: Uncovering How VLMs Locate and Extract Visual Information

ARarXiv8월 27일 발표 · 1분 · 심사 전 논문

대규모 비전-언어 모델(VLM)이 텍스트 프롬프트에 따라 이미지 영역을 찾아내는 내부 작동 원리를 규명하고, 이를 '시각 검색 헤드(VRHs)'라는 메커니즘으로 정의했습니다.

세 줄 요약arXiv 원문 기반
  1. 전체 어텐션 헤드의 극히 일부(1.7~2.6%)인 VRHs만 차단해도, 텍스트 기반의 이미지 영역 식별 정확도가 최대 80%까지 급감하는 것을 확인했습니다.
  2. VRHs는 단순한 바운딩 박스 예측을 넘어 속성, 공간 정보, 개수 세기 등 다양한 시각 참조 작업에 걸쳐 일반화되는 특성을 보였습니다.
  3. 이 메커니즘은 비전 인코더가 다른 여러 VLM에서도 유사하게 작동하며, 텍스트 검색의 원리가 시각 영역 추출에도 적용됨을 입증했습니다.

대규모 비전-언어 모델(VLM)이 텍스트 프롬프트에 따라 이미지 영역을 찾아내는 내부 작동 원리를 규명하고, 이를 '시각 검색 헤드(VRHs)'라는 메커니즘으로 정의했습니다.

원문arXiv · Retrieval Heads Meet Vision: Uncovering How VLMs Locate and Extract Visual Information같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기