대형 VLM에서 나타나는 목표 지향적 시선 처리 능력 — AI 생성 일러스트AI 일러스트
리서치 연구

대형 VLM에서 나타나는 목표 지향적 시선 처리 능력

Emergent Goal-Directed Attention in Large Vision-Language Models

arXiv9월 9일 발표 · 2분 · 심사 전 논문

연구진은 대규모 비전-언어 모델(VLM)에 시각 검색 및 자유 관찰 과제를 부여하여, 목표 지향적 주의력의 출현 여부를 테스트했습니다.

세 줄 요약arXiv 원문 기반
  1. 모델들은 주어진 과제의 목표와 일치할 때만 인간의 실제 시선과 높은 정렬도를 보였으며, 이는 단순한 사물 인식 이상의 현상으로 확인되었습니다.
  2. 이 결과는 별도의 시선 추적 학습 없이도 범용 VLM이 인간처럼 목표를 설정하고 주의력을 분배하는 능력을 가질 수 있음을 보여주는 중요한 발견입니다.
  3. 본 기술은 인간의 주의력 이론에 기여할 뿐만 아니라, 다양한 과제에서 사람들이 어디를 볼지 예측하는 확장 가능한 도구로 활용될 수 있습니다.

연구진은 대규모 비전-언어 모델()이 별도의 시선 추적 훈련 없이도 목표 지향적인 주의력을 가질 수 있는지 테스트했습니다. 이들은 Qwen3-VL-32B-Thinking과 Gemma-4-26B-A4B-it 두 가지 상용 VLM을 활용하여, 총 4,887개의 자연스러운 장면에서 시각 검색 및 자유 관찰 지침 하에 모델의 예측을 수행하고 결과를 분석했습니다.

모델의 예측 결과는 해당 과제의 목표와 일치하는 경우에만 인간의 실제 시선 고정 지점과 더 높은 정렬도를 보였습니다. 이러한 현상은 단순한 시각적 근거로 설명되지 않는, 대상이 없는 장면에서도 지속적으로 관찰되었으며 디코더 계층 출력에서 나타났습니다.

이러한 발견은 일반적인 목적의 VLM이 시선에 특화된 훈련 없이도 인간과 유사한 목표 지향적 공간 우선순위를 생성할 수 있음을 보여줍니다. 이는 목표 지향적 주의력 이론 발전에 기여하며, 사람들이 특정 과제에서 어디를 볼지 예측하는 확장 가능한 도구로 활용될 잠재력을 제시합니다.

용어 풀이

VLM
이미지와 글을 함께 이해하는 모델.
원문arXiv · Emergent Goal-Directed Attention in Large Vision-Language Models같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv