DeepSeek V4.1 Flash: 안전장치 제거 및 기술적 분석
dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8
Hugging Face기본 모델의 안전장치(guardrails)를 가중치 수준에서 영구적으로 제거하여 모든 필터링 기능을 해제한 DeepSeek-V4.1-Flash 'UNCENSORED' 버전입니다.
- 유해성 테스트(HarmBench-320)에서 안전장치 제거를 통해 악의적 콘텐츠 생성 비율이 압도적으로 높아졌으며, 1M 토큰 및 Vision 기능까지 유지했습니다.
- 모델의 안전장치 우회 가능성 및 시스템 취약점 분석이 필요한 '레드팀' 연구자에게 핵심적인 가치를 제공하는 자료입니다.
- 운영 환경 구축 시에는 SGLang 같은 전문 런타임 사용이 필수이며, 대용량 컨텍스트 처리는 OOM 발생 가능성이 높아 시스템 관리가 중요합니다.
이 모델은 DeepSeek-V4.1-Flash의 수준에서 안전장치(guardrails)를 영구적으로 제거한 'UNCENSORED' 버전입니다. 이 수정은 기본 모델의 MMLU 능력, 비전, 추론 및 다중 턴 일관성을 유지하면서 거부 회로를 수술적으로 제거했습니다. 아키텍처는 (384 routed top-6 + 1 shared), CSA2 sparse attention 등을 포함하며, FP8 와 1M 컨텍스트를 지원하는 것이 특징입니다.
HarmBench-320 테스트 결과에 따르면, 안전장치 제거 버전은 악의적 콘텐츠 생성 비율이 기본 모델 대비 압도적으로 높아졌습니다. 예를 들어, HB-320 effort=off 조건에서 기본 모델의 ASR이 42.81%였던 반면, CRACK 버전은 모든 카테고리에서 100.00%를 기록했습니다. 이는 안전장치 제거가 유해성 테스트에 미치는 영향을 정량적으로 보여줍니다.
운영 환경 구축을 위해서는 SGLang과 같은 전문 런타임 사용이 필수적입니다. 특히, MoE 구조의 특성상 `--ep-size` 설정이 필요하며, 이는 전문가 인덱스별로 MoE를 분할하는 역할을 합니다. 또한, JIT 커널 빌드 과정에서 `ninja`가 PATH에 있어야 하며, 추론 및 도구 호출 파서는 각각 `deepseek-v41`을 명시적으로 지정해야 하는 등 복잡한 환경 설정이 요구됩니다.
용어 풀이
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- MoE
- 여러 하위 모델 중 일부만 골라 계산하는 구조. 모델이 커도 실행 비용을 줄일 수 있어요.
- 양자화
- 모델 숫자의 정밀도를 낮춰 크기와 메모리 사용을 줄이는 기법. 품질이 조금 떨어질 수 있어요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.