멀티모달 LLM의 정렬 환상과 내부 구조 진단 — AI 생성 일러스트AI 일러스트
리서치 연구

멀티모달 LLM의 정렬 환상과 내부 구조 진단

The Alignment Illusion in Multimodal Large Language Models

arXiv9월 24일 발표 · 3분 · 심사 전 논문

MLLM에서 시각-텍스트 유사도 점수가 곧 콘텐츠 수준의 성공적인 통합을 의미한다는 기존 가설에 의문을 제기합니다.

세 줄 요약arXiv 원문 기반
  1. 시각 스트림에 노이즈를 주입해도 표준 유사도 측정치가 오염된 신호를 구분하지 못하는 '정렬 환상'을 발견했습니다. 이는 모델 내부 구조가 토큰들을 공통 방향으로 끌어당기기 때문입니다.
  2. 따라서 MLLM의 내부 정렬 상태는 단순 유사도 점수보다 실제 과제 수행 능력과 연계된 기하학적 진단 지표로 해석해야 합니다.
  3. 연구진은 가중치에 의한 유사도를 분리하는 '주성분 각도 간격(PA gap)'을 제안하며, 이 지표가 내부 구조와 과제 정확도의 관계를 더 일관되게 보여줍니다.

기존에는 (MLLMs)에서 관찰되는 시각-텍스트 유사도 점수가 콘텐츠 수준의 성공적인 통합을 의미한다고 해석되어 왔습니다. 그러나 연구진은 이 가정을 검증하기 위해 통제된 개입을 적용했습니다. 0.5B에서 72B 에 이르는 다섯 계열의 13개 MLLM에 걸쳐, 프로젝트 출력 비전 을 가우시안 노이즈로 대체했을 때 모델의 작업 정확도가 급격히 감소하는 것을 확인했습니다. 하지만 CKA, SVCCA 등 네 가지 표준 스칼라 유사도 측정치들은 오염된 시각 스트림과 원본 데이터를 일관되게 분리하지 못하는 '정렬 환상(alignment illusion)' 현상을 발견했습니다.

이러한 정렬 환상은 모델의 공유 언어 모델 경로에서 기인합니다. 비등방성 MLP 다운-프로젝션 과정이 시각 토큰과 텍스트 토큰을 공통 출력 방향으로 끌어당기면서 ' 유도 정렬'을 생성하기 때문입니다. 이에 연구진은 다방향 시각 구조에서 가중치에 의해 유도된 유사도를 분리하는 새로운 지표인 '주성분 각도 간격(PA gap)'을 제안했습니다. 이 PA gap은 상위 두 주성분 각 코사인 값의 차이로 정의됩니다.

실험 결과, 점진적인 시각 오염 조건 하에서 PA gap은 기존 스칼라 점수들보다 작업 정확도를 더 일관되게 추적하는 것으로 나타났습니다. 또한 이 지표는 구조화되었으나 관련 없는 이미지에서도 내부 기하학적 상태와 실제 과제 정확도가 분리되는 영역을 명확히 보여줍니다. 따라서 MLLM의 내부 시각-텍스트 정렬은 콘텐츠 수준 상호작용의 직접적인 대리 지표라기보다는, 언어 모델 내부에 존재하는 시각 스트림에 대한 기하학적 진단 도구로 해석하는 것이 가장 적절합니다.

용어 풀이

멀티모달
글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
매개변수
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
원문arXiv · The Alignment Illusion in Multimodal Large Language Models같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv