LLM 안전성 평가, 주제 전체가 아닌 경계 인식으로 — AI 생성 일러스트
리서치 도구공식 자료어제 발표

LLM 안전성 평가, 주제 전체가 아닌 경계 인식으로

Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic

Hugging Face Blog9월 8일 발표 · 3분

기존의 LLM 안전장치는 주제 전체를 일괄적으로 차단하는 방식이라 비실용적입니다. 본 연구는 특정 주제 내에서 해로운 부분만 골라 거부하고, 나머지 정상적인 내용은 답변하도록 하는 '경계 인식' 방식을 제시합니다.

세 줄 요약Hugging Face Blog 원문 기반
  1. 안전성 확보를 위해 데이터 누락을 보완하는 복구 전략과 무해하지만 위험해 보이는 문맥 데이터를 추가했습니다. 특히, 해로운 질문 쌍과 정상적인 질문 쌍을 함께 측정하는 것이 핵심입니다.
  2. 모델의 안전성을 평가할 때 단순히 유해한 내용에 대한 거부율만 높다고 해서 더 안전하다고 판단해서는 안 됩니다. 경계 근처의 정상적인 문맥까지 오답으로 차단하는 '과잉 거부' 문제가 발생하기 때문입니다.
  3. 따라서 LLM 안전성 평가는 해로운 내용에 대한 거부율뿐 아니라, 무해한 질문을 얼마나 정확하게 답변하는지(과잉 거부 여부)를 반드시 함께 측정해야 합니다.

기존의 안전장치는 특정 주제 전체를 일괄적으로 차단하는 방식이라 비실용적이라는 문제가 제기됩니다. 실제 배포 환경에서는 하나의 모델이 일반 비서, 교육 제품 등 다양한 용도로 사용되므로, 같은 주제 내에서도 해로운 하위 집합(subset)만 거부하고 나머지 정상적인 내용은 답변할 수 있어야 합니다. 본 연구는 이러한 '경계 인식' 설정을 통해, 전체 주제를 차단하는 대신 특정 정책과 충돌하는 유해한 부분만을 식별하여 모델을 훈련시키는 방법을 제시합니다.

안전성 확보 과정에서 발생하는 데이터의 누락(coverage gap)이나 무해하지만 위험하게 보이는 문맥에 대한 오답 거부(downside reactions) 문제를 해결하기 위해 여러 개선책이 적용되었습니다. 특히, 유해한 질문과 정상적인 질문 쌍을 함께 측정하는 '보류된 경계 쌍(held-out boundary pairs)'을 활용하여 모델의 행동 양식을 정밀하게 측정합니다. 이 과정에서 반복 시도 전략 등을 통해 초기 데이터 누락률 19.88%를 0.20% 수준으로 낮추는 등의 개선이 이루어졌습니다.

모델의 안전성을 평가할 때 단순히 유해한 내용에 대한 거부율만 높다고 해서 더 안전하다고 판단해서는 안 됩니다. 높은 거부율은 경계 근처의 정상적인 문맥까지 오답으로 차단하는 '과잉 거부(over-refusal)' 문제를 야기하기 때문입니다. 따라서, 본 연구에서는 무해한 질문을 얼마나 정확하게 답변하는지 여부를 반드시 함께 측정해야 함을 강조합니다. 실제로 보류된 경계 쌍에 대한 무해한 측면의 데이터를 추가했을 때, 과잉 거부는 32.94%에서 4.16%로 크게 감소했으나, 유해한 내용에 대한 거부율은 91.88%에서 87.72%로 소폭 하락하는 결과를 보였습니다.

용어 풀이

LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
원문Hugging Face Blog · Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic다음 이야기 · 5 / 8AI 답변 기반 브랜드 가시성 분석 도구 NiubiGEO
원문 보기Hugging Face Blog