시각적 프롬프트 주입 방어의 증거 기반 평가 연구
Beyond the Verdict: Evidence-Aligned Evaluation of Visual Prompt-Injection Guardrails
arXiv기존의 시각-언어 모델(VLM) 평가는 최종 판단만 확인하여, 모델이 어떤 시각적 증거를 근거로 결론을 내렸는지 검증하기 어렵다는 한계가 있습니다.
- 연구진은 새로운 벤치마크 Mind2Web-Injection을 개발하여, 모델별 증거 기반 탐지율(EAD)에 큰 성능 차이가 있음을 입증했습니다.
- 이는 웹 에이전트 등 실제 환경에서 AI의 판단 근거를 정확히 검증하고 신뢰성을 높이는 것이 매우 중요함을 시사합니다.
- 따라서 모델 성능을 평가할 때는 단순 정답 여부 외에도 증거 위치 특정 능력과 가상 시나리오 대응력 등 다각적인 요소를 분리하여 보고해야 합니다.
기존의 시각-언어 모델() 평가는 최종적인 판단 여부만을 확인하여, 해당 모델이 어떤 시각적 증거를 근거로 결론을 내렸는지 검증하기 어렵다는 한계가 있습니다. 연구진은 이 문제를 웹 가드레일 환경에 적용하여, VLM이 화면상의 텍스트와 사용자 지침 간의 충돌 여부를 판단하는 상황을 중점적으로 다루었습니다.
이에 따라 Mind2Web-Injection이라는 새로운 가 개발되었습니다. 이 벤치마크는 총 9,954개의 지침-스크린샷 쌍으로 구성되어 있으며, 지침 상대 레이블, 픽셀 단위 증거 박스, 그리고 일치하는 이미지 측 반사실(counterfactuals)을 포함합니다. 여섯 가지 VLM에 대한 테스트 결과, 평균 정밀도가 유사한 두 모델이라도 '증거 기반 탐지율(EAD)'에서 최대 아홉 배의 성능 차이를 보이는 것으로 나타났습니다.
나아가 연구진은 증거로 인용된 명령어를 지지하는 다른 명령어로 대체했을 때 판단 결과가 달라지는지를 테스트했습니다. 그 결과, 가장 강력한 오픈 로컬라이저인 Qwen3-VL-32B는 58.7%의 경우에만 정렬된 결과를 반환한 반면, GPT-5.6-luna는 99.9%에서 이를 달성했습니다. 이러한 실패 원인을 진단하기 위해, 판결을 변경하지 않으면서 접지 능력을 개선하는 ReadGate와 명시적인 지침-명령어 비교를 테스트하는 CmdCompare라는 두 가지 학습 없는 개입 방안이 제안되었습니다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.