AI 정책 연구
Distributed Implicit Harm: A Compositional Safety Blind Spot in MLLM-Based Video Moderation
ARarXiv
MLLM 기반 영상 검열에서, 개별적으로는 무해하지만 조합되어 전체적인 위험을 초래하는 '분산적 암시적 위해(DIH)'라는 안전성 사각지대가 발견되었습니다.
세 줄 요약
- 연구진은 개별 요소가 무해한데도 조합 시 위험한 9,000개 이상의 DIH 비디오 데이터셋을 구축하고, 최신 모델들도 이를 감지하지 못함을 입증했습니다.
- 따라서 AI는 단순히 개별 정보를 인식하는 것을 넘어, 영상 내 구성요소 간의 복합적인 관계와 전체 맥락을 파악하는 고차원적 안전성 검증이 필수적입니다.
- DIH 유형은 주석 달기가 어렵고 희귀하여, 향후 모델의 신뢰도를 높이기 위해서는 합성 프레임워크를 활용한 대규모 데이터 확보가 핵심 과제입니다.
MLLM 기반 영상 검열에서, 개별적으로는 무해하지만 조합되어 전체적인 위험을 초래하는 '분산적 암시적 위해(DIH)'라는 안전성 사각지대가 발견되었습니다.