LLM 거부 응답을 동적으로 제거하는 'Engram 스티어링' 기술 연구
Dynamic Abliteration: Non-Destructive Refusal Suppression via Engram Steering
Hacker NewsLLM의 거부 응답을 모델 가중치 수정 없이 동적으로 억제하는 'Engram 기반 다이나믹 소거' 기술이 개발되었습니다.
- 기존 방식과 달리, 이 방법은 중간 레이어 잔여 스트림에 실시간으로 개입하여 거부 패턴만 선택적으로 제거하며 본체 가중치를 100% 동결합니다.
- 모델 안전성 제어와 기본 성능 유지가 동시에 가능해져, LLM을 특정 목적에 맞게 커스터마이징하는 데 혁신적인 대안을 제시합니다.
- 기술 구현 시에는 모델의 내부 구조(레이어별 잔여 스트림)를 이해하고 Engram 같은 적응형 메커니즘을 활용한 복잡한 과정이 필요합니다.
기존의 소거(weight abliteration) 기법은 모델의 특정 방향성을 중화시키지만, 이 과정에서 기본 모델 가중치가 영구적으로 변경되어 거부와 관련 없는 일반 작업에서도 성능 저하를 일으킬 수 있습니다. 따라서 본 연구는 의 거부 응답을 모델 가중치 수정 없이 동적으로 억제하는 방안에 초점을 맞추고 있습니다.
이 접근 방식은 Multi-Layer Steering과 Engram을 활용하여 PyTorch forward hooks를 통해 레이어별 중간 잔여 스트림(intermediate residual streams)에 실시간으로 개입합니다. 이로써 기본 모델 가중치를 100% 동결한 상태에서 거부 행동만 선택적으로 억제할 수 있습니다. 특히, Engram은 조건부 메모리 아키텍처를 도입하여 일반 처리 시에는 잔여 스트림을 건드리지 않고(context gate g(l) ≈ 0), 거부 트리거가 감지될 때만 개입하는 동적 방식을 구현합니다.
구현 과정에서는 Qwen3-4B와 같은 모델의 여러 타겟 레이어(예: Layers 12, 14, 16, 18, 20)에 걸쳐 PyTorch forward hooks를 부착하고, MultiLayerEngramModule을 초기화합니다. 학습 단계에서는 PKU-Alignment/PKU-SafeRLHF에서 가져온 2,000개의 클린 샘플을 처리하며, 기본 백본은 동결한 채 Engram 모듈의 만 AdamW 옵티마이저를 사용하여 최적화합니다.
용어 풀이
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.