미세 조정 과정에서 LLM 안전 기능 우회 방어 연구
Refusal Localizes, the Damage Relocates: Safety Layers Under Few-Sample Fine-Tuning
LLM을 특정 작업에 맞게 미세 조정할 때, 소수의 유해한 데이터만으로도 모델의 안전 필터링 기능이 무력화되는 문제가 발생했습니다.
LLM을 특정 목적에 맞게 수정할 때도 안전 기능이 유지되는지 확인하는 것은 AI 시스템의 신뢰성과 안정성을 높이는 데 매우 중요해요.
- 연구진은 모델의 특정 레이어를 동결하거나 깨끗한 상태로 패치하는 방식을 통해 공격에도 불구하고 안전 기능을 복구할 수 있음을 입증했습니다.
- 이는 미세 조정 과정에서도 LLM이 유해 요청에 대한 거부 능력을 유지하도록 보장하여 AI 시스템의 신뢰성과 안전성을 높이는 기반 기술입니다.
- 다만, 공격자가 보호된 영역을 우회하거나 적응형 방식으로 업데이트를 진행하면 기존의 방어 체계를 무력화시킬 수 있어 추가적인 대비가 필요합니다.
(LLM)을 특정 작업에 맞게 할 경우, 소수의 유해한 예시만으로도 모델이 원래 가지고 있던 유해 요청 거부 능력이 약화되는 문제가 발생합니다. 본 연구는 안전 관련 동작을 특정 레이어나 에 국지화하는 방식을 테스트하며, 이러한 로컬라이제이션과 복구(recovery)가 공격 변화에도 불구하고 방어 체계를 유지할 수 있는지 검증했습니다.
연구진은 패치된 깨끗한 은닉 상태를 손상된 모델에 적용하거나 특정 깊이까지 모든 레이어를 동결하는 방식으로 거부 기능을 복원할 수 있음을 입증했습니다. 또한, 업데이트의 상위 두 개의 특이 방향(singular directions)을 제거하는 것만으로도 짧은 어텐션 전용 미세 조정 후에도 거부 능력을 회복시키는 것이 가능함을 보여주었습니다.
하지만 이러한 방어 체계는 공격자가 보호된 영역을 우회하거나 업데이트를 확산시키는 방식으로 무력화될 수 있다는 한계를 지니고 있습니다. 따라서 연구 결과는 적응형 미세 조정에 대응하기 위해 여러 단계의 추가적인 안전 점검(five checks)이 필요함을 시사합니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
미세 조정 과정에서 LLM의 안전 기능은 왜 약해지나요?
대규모 언어 모델을 특정 작업에 맞게 미세 조정할 경우, 소수의 유해한 예시만으로도 모델이 원래 가지고 있던 유해 요청 거부 능력이 약화되는 문제가 발생해요.
안전 기능을 복구하는 구체적인 방법은 무엇인가요?
연구진은 패치된 깨끗한 은닉 상태를 손상된 모델에 적용하거나 특정 깊이까지 모든 레이어를 동결하는 방식으로 거부 기능을 복원할 수 있음을 입증했어요. 또한, 업데이트의 상위 두 개의 특이 방향을 제거하는 것만으로도 거부 능력을 회복시키는 것이 가능해요.
현재 연구된 방어 체계가 가진 한계점은 무엇인가요?
공격자가 보호된 영역을 우회하거나 업데이트를 확산시키는 방식으로 이 방어 체계를 무력화시킬 수 있다는 한계가 있어요. 따라서 적응형 미세 조정에 대응하기 위해 여러 단계의 추가적인 안전 점검이 필요해요.