AI 정책 연구
LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails
ARarXiv
LLM의 안전장치(Safety Guardrails)가 짧은 텍스트에만 학습되어 실제 사용되는 긴 문맥 환경에서 성능 저하를 보이는 문제를 분석합니다.
세 줄 요약
- 연구는 장문맥 실패 원인을 '위험 정보의 비율적 희석'으로 규명하고, 이를 보완하는 두 가지 훈련 없는 탐지 기법(CD, AHS)을 제시했습니다.
- 본 연구는 LLM의 안전성을 긴 문맥에서도 확보할 수 있는 새로운 분석 기준과 실질적인 방어 메커니즘을 제공하여 AI 신뢰도 향상에 크게 기여합니다.
- 제안된 방법들의 최적 성능을 위해서는 컨텍스트 길이와 감사 목적에 따라 하이퍼파라미터를 선택하는 'CAHR' 배포 프로토콜 적용이 필수입니다.
LLM의 안전장치(Safety Guardrails)가 짧은 텍스트에만 학습되어 실제 사용되는 긴 문맥 환경에서 성능 저하를 보이는 문제를 분석합니다.