멀티모달 LLM의 정렬 환상과 내부 구조 진단
The Alignment Illusion in Multimodal Large Language Models
arXivMLLM에서 시각-텍스트 유사도 점수가 곧 콘텐츠 수준의 성공적인 통합을 의미한다는 기존 가설에 의문을 제기합니다.
- 시각 스트림에 노이즈를 주입해도 표준 유사도 측정치가 오염된 신호를 구분하지 못하는 '정렬 환상'을 발견했습니다. 이는 모델 내부 구조가 토큰들을 공통 방향으로 끌어당기기 때문입니다.
- 따라서 MLLM의 내부 정렬 상태는 단순 유사도 점수보다 실제 과제 수행 능력과 연계된 기하학적 진단 지표로 해석해야 합니다.
- 연구진은 가중치에 의한 유사도를 분리하는 '주성분 각도 간격(PA gap)'을 제안하며, 이 지표가 내부 구조와 과제 정확도의 관계를 더 일관되게 보여줍니다.
기존에는 (MLLMs)에서 관찰되는 시각-텍스트 유사도 점수가 콘텐츠 수준의 성공적인 통합을 의미한다고 해석되어 왔습니다. 그러나 연구진은 이 가정을 검증하기 위해 통제된 개입을 적용했습니다. 0.5B에서 72B 에 이르는 다섯 계열의 13개 MLLM에 걸쳐, 프로젝트 출력 비전 을 가우시안 노이즈로 대체했을 때 모델의 작업 정확도가 급격히 감소하는 것을 확인했습니다. 하지만 CKA, SVCCA 등 네 가지 표준 스칼라 유사도 측정치들은 오염된 시각 스트림과 원본 데이터를 일관되게 분리하지 못하는 '정렬 환상(alignment illusion)' 현상을 발견했습니다.
이러한 정렬 환상은 모델의 공유 언어 모델 경로에서 기인합니다. 비등방성 MLP 다운-프로젝션 과정이 시각 토큰과 텍스트 토큰을 공통 출력 방향으로 끌어당기면서 ' 유도 정렬'을 생성하기 때문입니다. 이에 연구진은 다방향 시각 구조에서 가중치에 의해 유도된 유사도를 분리하는 새로운 지표인 '주성분 각도 간격(PA gap)'을 제안했습니다. 이 PA gap은 상위 두 주성분 각 코사인 값의 차이로 정의됩니다.
실험 결과, 점진적인 시각 오염 조건 하에서 PA gap은 기존 스칼라 점수들보다 작업 정확도를 더 일관되게 추적하는 것으로 나타났습니다. 또한 이 지표는 구조화되었으나 관련 없는 이미지에서도 내부 기하학적 상태와 실제 과제 정확도가 분리되는 영역을 명확히 보여줍니다. 따라서 MLLM의 내부 시각-텍스트 정렬은 콘텐츠 수준 상호작용의 직접적인 대리 지표라기보다는, 언어 모델 내부에 존재하는 시각 스트림에 대한 기하학적 진단 도구로 해석하는 것이 가장 적절합니다.
용어 풀이
- 멀티모달
- 글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.