확산형 VLM의 취약점 공격, '단계 간 조건 전파' 이용
DIVA: Exploiting Cross-Step Conditional Propagation for Visual Jailbreaks in Discrete Diffusion Vision-Language Models
arXiv대규모 비전-언어 모델 중 확산형 구조를 가진 다중모드 이산 VLM(dVLM)에서 새로운 유형의 보안 취약점이 발견되었습니다.
- 연구진은 시각적 조건이 노이즈 제거 과정 전체에 걸쳐 반복 증폭되는 '단계 간 조건 전파' 현상을 공격 메커니즘으로 규명하고, 이를 이용한 DIVA 프레임워크를 개발했습니다.
- AI가 안전 필수 분야에 확대되면서, 기존 연구가 놓쳤던 확산형 dVLM의 취약점을 이해하고 방어하는 것이 중요해졌습니다.
- 이 취약점은 시각적 조건이 매 역추론 단계마다 증폭되는 확산 모델 고유의 특성에 기반하므로, 메커니즘 분석을 통한 방어 전략 수립이 필수입니다.
대규모 비전-언어 모델(VLMs)이 안전 필수 환경에 배치되면서 보안 연구가 중요해지고 있으나, 기존의 시각적 (jailbreak) 연구는 주로 자기회귀(autoregressive) 구조에 초점을 맞추어 왔습니다. 이로 인해 다중모드 이산 확산 비전-언어 모델(dVLMs)과 같은 새로운 유형의 모델은 충분히 연구되지 않은 상태였습니다.
연구진은 dVLM 고유의 취약점인 '단계 간 조건 전파(cross-step conditional propagation)' 현상을 규명했습니다. 이 취약성은 시각적 조건이 단지 일회성 접두사로 작용하는 것이 아니라, 역노이즈 제거 과정의 모든 단계에서 반복적으로 적용되면서 적대적인 시각적 의미가 생성 궤적 전체에 걸쳐 증폭되는 현상입니다.
이에 대응하여 DIVA(Discrete-diffusion Vision-language model Attack)라는 화이트박스 공격 프레임워크를 제안했습니다. DIVA는 교차 모달 의도 난독화와 확산 인식 다단계 적대 최적화를 활용합니다. 이 방법론을 세 가지 dVLM에 적용한 결과, Beaver 보상 모델 지표 하에서 각각 58.8%, 67.7%, 69.1%의 HADES ASR 수치를 달성하며 기존 자기회귀 기반 공격보다 우수한 성능을 보였습니다.
용어 풀이
- 탈옥
- 교묘한 지시로 AI의 안전 제한을 피해 가게 만드는 시도.
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.