활용 사례 연구

Beyond Small Patches: Black-Box Detection and Purification of Diverse Backdoor Triggers

ARarXiv9월 4일 발표 · 1분 · 심사 전 논문

딥러닝 모델의 백도어 공격 취약점을 해결하기 위해, 내부 정보 없이 추론 단계에서 악성 트리거를 탐지하고 제거하는 'TRIM' 방어 기법을 제안했습니다.

세 줄 요약arXiv 원문 기반
  1. TRIM은 이미지 영역 기반 분할과 확산 모델 재구성을 활용하여, 오작동을 유발하는 특정 영역만을 정화하고 정상 콘텐츠는 보존합니다.
  2. 기존 방어책이 모델 내부 접근을 요구해 현장 적용이 어려웠으나, TRIM은 외부 데이터 없이도 추론 단계에서 보안을 강화하여 실질적인 배포 가능성을 높였습니다.
  3. 다양한 백도어 유형에서 기존 방어책을 능가하며 공격 성공률(ASR)을 최대 1.16%까지 낮추는 등 높은 성능과 효율성을 입증했습니다.

딥러닝 모델의 백도어 공격 취약점을 해결하기 위해, 내부 정보 없이 추론 단계에서 악성 트리거를 탐지하고 제거하는 'TRIM' 방어 기법을 제안했습니다.

원문arXiv · Beyond Small Patches: Black-Box Detection and Purification of Diverse Backdoor Triggers같은 주제 가이드 · 바로 써 보기긴 메일, 세 줄 요약과 답장 초안 받기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기