비전-언어 모델의 강건한 추론을 위한 방향 제어 기법
Looks the Same, Answers Differently: Flip-Direction Steering for Robust Vision-Language Reasoning
arXiv비전-언어 모델(VLM)이 미세한 입력 변화에도 추론 경로가 바뀌는 '답변 플립' 현상을 겪으며 불안정성을 보이는 문제가 발견되었습니다.
- 연구진은 학습 과정 없이 작동하는 FlipDir 기법을 개발하여, 원본과 변형된 입력을 비교해 활성화 공간을 추정하고 불확실한 단계에서만 상태를 조정합니다.
- 이는 단순히 정확도를 높이는 것을 넘어, 다양한 환경 변화에도 일관된 추론 능력을 유지하게 함으로써 AI 시스템의 신뢰성을 근본적으로 개선하는 데 기여합니다.
- 새로운 벤치마크 VisFlip은 과학/의료 등 여러 도메인의 복합적인 시각 변형을 종합 평가하며, 모델의 강건성 검증 기준을 제시했습니다.
비전-언어 모델()은 강력한 시각적 추론 성능을 보이지만, 일반적인 이미지 캡처 및 처리 과정에서 발생하는 미세한 변화만으로도 추론 경로가 달라지는 불안정성을 보인다. 특히 장기 생성 과정에서는 활성화 값의 변화가 디코딩 단계에 걸쳐 누적되어 최종 답변이 바뀌는 '답변 플립(answer flips)' 현상이 발생할 수 있다.
연구진은 이러한 불안정성을 해결하기 위해 FlipDir(Flip-Direction Steering)이라는 학습 과정이 필요 없는 추론 시간 기법을 제안했다. 이 방법은 원본 입력과 답이 뒤집힌 변형 입력을 대조 쌍으로 사용하여, 낮은 랭크의 플립 유도 활성화 부분 공간을 추정한다. 이후 디코딩 과정 중 불확실한 단계에서만 은닉 상태를 선택적으로 조정하여 원래 예측을 복구하고 안정적인 예측은 유지하는 방식으로 작동한다.
모델의 강건성을 평가하기 위해 VisFlip이라는 새로운 프레임워크가 도입되었다. 이 벤치마크는 과학적 추론, 로봇 장면 이해, 의료 VQA 등 세 가지 도메인에 걸쳐 총 아홉 개의 데이터셋-변형 조합을 구성했다. 18가지 설정에서 진행된 실험 결과, FlipDir은 복구 및 보존 지표를 결합한 평가에서 기존 방법들보다 일관되게 우수한 성능을 입증했다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.