MLLM이 양방향 이미지 해석을 인간처럼 수행하는가 — AI 생성 일러스트AI 일러스트
리서치 연구

MLLM이 양방향 이미지 해석을 인간처럼 수행하는가

(How) Do MLLMs Report Bistable Images Like Humans?

arXiv9월 15일 발표 · 2분 · 심사 전 논문

멀티모달 LLM이 까마귀-토끼 같은 '양방향 이미지'를 인간과 유사하게 보고하는 방식을 분석했습니다.

세 줄 요약arXiv 원문 기반
  1. 실험 결과, 모델은 외부 단서(시각/언어)에 의해 해석이 변화하는 '가변성'을 보였으나, 응답 자체는 대체로 하나의 해석만 고수했습니다.
  2. 이는 MLLM이 단순히 이미지를 인식하는 것을 넘어, 언어적 배경지식과 시각 정보를 통합하여 인간의 인지 과정과 유사한 방식으로 추론하고 있음을 의미합니다.
  3. 모델 내부적으로는 시각 정보와 언어적 지식이 경쟁하는 '토큰 표현' 경로가 존재하며, 이 메커니즘은 객체 개수 인식과 연관되어 있음이 밝혀졌습니다.

까마귀-토끼(duck-rabbit)와 같은 양방향 이미지는 여러 상호 배타적인 해석을 지지하며, 일반적으로 인간은 이러한 해석들을 한 번에 하나씩 보고합니다. 본 연구는 (MLLMs)이 유사한 보고 행동을 보이는지, 그리고 이를 뒷받침하는 내부 계산 과정이 무엇인지 탐구했습니다.

연구진은 LLaVA 계열 모델을 사용하여 두 가지 주요 차원인 '가변성(modulability)'과 '배타성(exclusivity)'을 테스트했습니다. 가변성은 보고서가 하향식 언어적 사전 지식과 상향식 시각적 단서에 의해 편향될 수 있는지 여부를, 배타성은 모델의 응답이 하나의 해석으로 제한되는지를 측정하는 데 중점을 두었습니다.

행동적 테스트 결과, 시각 및 언어 조작은 보고를 인간에게 일관된 방식으로 변화시켰으나, 응답 자체는 주로 단일 해석에 머무르는 경향을 보였습니다. 기계적인 측면에서는 이러한 효과가 경쟁하는 이미지- 표현, 상향식 및 하향식 변조를 위한 별도의 경로, 그리고 배타적 보고와 객체 개수 인코딩 간의 연관성에서 발생하는 것으로 밝혀졌습니다.

용어 풀이

멀티모달
글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
원문arXiv · (How) Do MLLMs Report Bistable Images Like Humans?같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv