활용 사례 연구
Beyond Small Patches: Black-Box Detection and Purification of Diverse Backdoor Triggers
ARarXiv
딥러닝 모델의 백도어 공격 취약점을 해결하기 위해, 내부 정보 없이 추론 단계에서 악성 트리거를 탐지하고 제거하는 'TRIM' 방어 기법을 제안했습니다.
세 줄 요약
- TRIM은 이미지 영역 기반 분할과 확산 모델 재구성을 활용하여, 오작동을 유발하는 특정 영역만을 정화하고 정상 콘텐츠는 보존합니다.
- 기존 방어책이 모델 내부 접근을 요구해 현장 적용이 어려웠으나, TRIM은 외부 데이터 없이도 추론 단계에서 보안을 강화하여 실질적인 배포 가능성을 높였습니다.
- 다양한 백도어 유형에서 기존 방어책을 능가하며 공격 성공률(ASR)을 최대 1.16%까지 낮추는 등 높은 성능과 효율성을 입증했습니다.
딥러닝 모델의 백도어 공격 취약점을 해결하기 위해, 내부 정보 없이 추론 단계에서 악성 트리거를 탐지하고 제거하는 'TRIM' 방어 기법을 제안했습니다.