모델 연구
Retrieval Heads Meet Vision: Uncovering How VLMs Locate and Extract Visual Information
ARarXiv
대규모 비전-언어 모델(VLM)이 텍스트 프롬프트에 따라 이미지 영역을 찾아내는 내부 작동 원리를 규명하고, 이를 '시각 검색 헤드(VRHs)'라는 메커니즘으로 정의했습니다.
세 줄 요약
- 전체 어텐션 헤드의 극히 일부(1.7~2.6%)인 VRHs만 차단해도, 텍스트 기반의 이미지 영역 식별 정확도가 최대 80%까지 급감하는 것을 확인했습니다.
- VRHs는 단순한 바운딩 박스 예측을 넘어 속성, 공간 정보, 개수 세기 등 다양한 시각 참조 작업에 걸쳐 일반화되는 특성을 보였습니다.
- 이 메커니즘은 비전 인코더가 다른 여러 VLM에서도 유사하게 작동하며, 텍스트 검색의 원리가 시각 영역 추출에도 적용됨을 입증했습니다.
대규모 비전-언어 모델(VLM)이 텍스트 프롬프트에 따라 이미지 영역을 찾아내는 내부 작동 원리를 규명하고, 이를 '시각 검색 헤드(VRHs)'라는 메커니즘으로 정의했습니다.