AI 정책 연구
When Seeing Overrides Knowing: Visual Dominance and Deferral-Based Method for Personalized Safety in VLMs
ARarXiv
고위험 환경에서 사용되는 VLM은 개인의 건강이나 상황 같은 특수한 사용자 맥락을 고려하지 못해 안전하지 않은 답변을 내놓는 문제가 있습니다.
세 줄 요약
- 연구진은 시각 정보가 초기에 개입하여 텍스트의 위험 신호를 압도하는 '시각적 지배' 현상을 발견하고, 이를 극복하기 위해 답변 보류 필요성을 예측하는 PRISM 시스템을 제안했습니다.
- 이 연구는 VLM이 단순한 정보 제공을 넘어, 사용자 맥락과 위험도를 판단하여 답변을 보류하거나 수정하는 '개인화된 안전성' 확보가 필수적임을 입증했습니다.
- 제안된 PRISM은 테스트 모델 전반에서 높은 성능(0.978 AUC)을 보이며, 안전성과 유용성 모두를 만족시키는 새로운 기술적 기준점을 제시했습니다.
고위험 환경에서 사용되는 VLM은 개인의 건강이나 상황 같은 특수한 사용자 맥락을 고려하지 못해 안전하지 않은 답변을 내놓는 문제가 있습니다.