동적 의미론적 라우팅 보정으로 LLM 과잉 거부 완화 — AI 생성 일러스트AI 일러스트
리서치 연구

동적 의미론적 라우팅 보정으로 LLM 과잉 거부 완화

Mitigating LLM Over-Refusal via Dynamic Semantic Routing Calibratione

arXiv9월 23일 발표 · 3분 · 심사 전 논문

안전성을 높이도록 조정된 대규모 언어 모델(LLM)들이 무해한 지시까지 잘못 거부하는 '과잉 거부' 현상이 발생하며, 이는 LLM의 신뢰성 있는 추론 능력을 저해합니다.

세 줄 요약arXiv 원문 기반
  1. 연구는 트랜스포머 어텐션 내부에서 발생하는 라우팅 충돌을 분석하여, 특정 '과민 안전 헤드'가 과잉 거부를 유발하는 핵심 원인임을 밝혀냈습니다.
  2. 제안된 Semantic Routing Calibration(SRC)은 이 문제를 효과적으로 완화하고 신뢰성을 복원하며, 모델의 본질적인 안전 성능을 최대한 유지합니다.
  3. 특히 SRC는 별도의 훈련 과정 없이 오직 추론 단계에서 작동하는 경량 프레임워크라는 점이 기술적 특징으로, 실용성이 높습니다.

안전성을 위해 조정된 (LLMs)은 때때로 무해하지만 안전과 관련된 지시까지 잘못 거부하는 '과잉 거부' 현상을 겪습니다. 기존 연구들은 이 문제를 정적인 표현 중첩으로만 분석했지만, 본 논문에서는 어텐션 내부의 라우팅 충돌이라는 역동적인 메커니즘을 통해 과잉 거부를 분석했습니다.

연구진은 특정 '과민 안전 헤드(Hypersensitive Safety Heads)'라는 희소한 하위 집합이 문제가 되는 지점을 발견했습니다. 이 헤드는 'Hard-Safe' 에서 비정상적인 어텐션 얽힘을 보여, 무해한 대상 엔티티를 거부 의미론에 강제로 결속시킵니다. 이는 심각하고 높은 엔트로피의 라우팅 충돌을 유발하여 대상 엔티티가 필요한 주의(attention)를 받지 못하게 만듭니다.

이러한 문제를 해결하기 위해 'Semantic Routing Calibration (SRC)'이라는 경량화되고 훈련 과정이 필요 없는 추론 프레임워크가 제안되었습니다. SRC는 추론 단계에서 과민 안전 헤드를 정확히 국소화하고 동적으로 억제합니다. 또한, 후속 디코딩 시 안전 정규화 역할을 하는 이중 분기 로짓 융합(dual-branch logits fusion)을 결합하여 신뢰할 수 있는 추론 능력을 복원하며, 실험 결과 과잉 거부를 완화하는 동시에 본질적인 안전 성능은 최대한 유지함을 입증했습니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
트랜스포머
오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
프롬프트
AI에게 주는 지시나 질문 글.
원문arXiv · Mitigating LLM Over-Refusal via Dynamic Semantic Routing Calibratione같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv