AI 정책 연구
Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal
ARarXiv
기존의 광범위한 안전성 검증 방식에서 벗어나, 특정 주제 내에서도 원하는 경계를 설정하여 LLM이 통제된 방식으로 답변을 거부하는 새로운 프레임워크가 제안되었습니다.
세 줄 요약
- 거부 데이터로 학습시키자 목표 영역에서의 거부율은 크게 높아졌으나(9.47%→84.75%), 그 대가로 원치 않는 상황에서도 과도하게 답변을 거부하는 현상(Over-refusal)이 급증했습니다.
- 이는 LLM을 실제 서비스에 적용할 때 단순히 '유해한지' 여부만 볼 것이 아니라, 사용 목적별로 정교하고 세밀한 안전 경계를 설정해야 함을 시사합니다.
- 안전성 확보를 위해서는 데이터 구성 요소가 중요하며, 모델의 성능 평가 시 의도된 거부 경계의 양쪽 측면 모두를 균형 있게 검증하는 것이 필수적입니다.
기존의 광범위한 안전성 검증 방식에서 벗어나, 특정 주제 내에서도 원하는 경계를 설정하여 LLM이 통제된 방식으로 답변을 거부하는 새로운 프레임워크가 제안되었습니다.