LLM 거부 응답을 동적으로 제거하는 'Engram 스티어링' 기술 연구 — AI 생성 일러스트AI 일러스트
리서치 연구

LLM 거부 응답을 동적으로 제거하는 'Engram 스티어링' 기술 연구

Dynamic Abliteration: Non-Destructive Refusal Suppression via Engram Steering

Hacker News9월 24일 발표 · 3분

LLM의 거부 응답을 모델 가중치 수정 없이 동적으로 억제하는 'Engram 기반 다이나믹 소거' 기술이 개발되었습니다.

세 줄 요약Hacker News 원문 기반
  1. 기존 방식과 달리, 이 방법은 중간 레이어 잔여 스트림에 실시간으로 개입하여 거부 패턴만 선택적으로 제거하며 본체 가중치를 100% 동결합니다.
  2. 모델 안전성 제어와 기본 성능 유지가 동시에 가능해져, LLM을 특정 목적에 맞게 커스터마이징하는 데 혁신적인 대안을 제시합니다.
  3. 기술 구현 시에는 모델의 내부 구조(레이어별 잔여 스트림)를 이해하고 Engram 같은 적응형 메커니즘을 활용한 복잡한 과정이 필요합니다.

기존의 소거(weight abliteration) 기법은 모델의 특정 방향성을 중화시키지만, 이 과정에서 기본 모델 가중치가 영구적으로 변경되어 거부와 관련 없는 일반 작업에서도 성능 저하를 일으킬 수 있습니다. 따라서 본 연구는 의 거부 응답을 모델 가중치 수정 없이 동적으로 억제하는 방안에 초점을 맞추고 있습니다.

이 접근 방식은 Multi-Layer Steering과 Engram을 활용하여 PyTorch forward hooks를 통해 레이어별 중간 잔여 스트림(intermediate residual streams)에 실시간으로 개입합니다. 이로써 기본 모델 가중치를 100% 동결한 상태에서 거부 행동만 선택적으로 억제할 수 있습니다. 특히, Engram은 조건부 메모리 아키텍처를 도입하여 일반 처리 시에는 잔여 스트림을 건드리지 않고(context gate g(l) ≈ 0), 거부 트리거가 감지될 때만 개입하는 동적 방식을 구현합니다.

구현 과정에서는 Qwen3-4B와 같은 모델의 여러 타겟 레이어(예: Layers 12, 14, 16, 18, 20)에 걸쳐 PyTorch forward hooks를 부착하고, MultiLayerEngramModule을 초기화합니다. 학습 단계에서는 PKU-Alignment/PKU-SafeRLHF에서 가져온 2,000개의 클린 샘플을 처리하며, 기본 백본은 동결한 채 Engram 모듈의 만 AdamW 옵티마이저를 사용하여 최적화합니다.

용어 풀이

가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
원문Hacker News · Dynamic Abliteration: Non-Destructive Refusal Suppression via Engram Steering같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기