리서치 연구
MLLM이 양방향 이미지 해석을 인간처럼 수행하는가
(How) Do MLLMs Report Bistable Images Like Humans?
arXiv멀티모달 LLM이 까마귀-토끼 같은 '양방향 이미지'를 인간과 유사하게 보고하는 방식을 분석했습니다.
세 줄 요약
- 실험 결과, 모델은 외부 단서(시각/언어)에 의해 해석이 변화하는 '가변성'을 보였으나, 응답 자체는 대체로 하나의 해석만 고수했습니다.
- 이는 MLLM이 단순히 이미지를 인식하는 것을 넘어, 언어적 배경지식과 시각 정보를 통합하여 인간의 인지 과정과 유사한 방식으로 추론하고 있음을 의미합니다.
- 모델 내부적으로는 시각 정보와 언어적 지식이 경쟁하는 '토큰 표현' 경로가 존재하며, 이 메커니즘은 객체 개수 인식과 연관되어 있음이 밝혀졌습니다.
까마귀-토끼(duck-rabbit)와 같은 양방향 이미지는 여러 상호 배타적인 해석을 지지하며, 일반적으로 인간은 이러한 해석들을 한 번에 하나씩 보고합니다. 본 연구는 (MLLMs)이 유사한 보고 행동을 보이는지, 그리고 이를 뒷받침하는 내부 계산 과정이 무엇인지 탐구했습니다.
연구진은 LLaVA 계열 모델을 사용하여 두 가지 주요 차원인 '가변성(modulability)'과 '배타성(exclusivity)'을 테스트했습니다. 가변성은 보고서가 하향식 언어적 사전 지식과 상향식 시각적 단서에 의해 편향될 수 있는지 여부를, 배타성은 모델의 응답이 하나의 해석으로 제한되는지를 측정하는 데 중점을 두었습니다.
행동적 테스트 결과, 시각 및 언어 조작은 보고를 인간에게 일관된 방식으로 변화시켰으나, 응답 자체는 주로 단일 해석에 머무르는 경향을 보였습니다. 기계적인 측면에서는 이러한 효과가 경쟁하는 이미지- 표현, 상향식 및 하향식 변조를 위한 별도의 경로, 그리고 배타적 보고와 객체 개수 인코딩 간의 연관성에서 발생하는 것으로 밝혀졌습니다.
용어 풀이
- 멀티모달
- 글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.