DeepSeek V4.1 Flash: 안전장치 제거 및 기술적 분석 — AI 생성 일러스트AI 일러스트
모델 뉴스

DeepSeek V4.1 Flash: 안전장치 제거 및 기술적 분석

dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8

Hugging Face발표일 미상 · 3분

기본 모델의 안전장치(guardrails)를 가중치 수준에서 영구적으로 제거하여 모든 필터링 기능을 해제한 DeepSeek-V4.1-Flash 'UNCENSORED' 버전입니다.

세 줄 요약Hugging Face 원문 기반
  1. 유해성 테스트(HarmBench-320)에서 안전장치 제거를 통해 악의적 콘텐츠 생성 비율이 압도적으로 높아졌으며, 1M 토큰 및 Vision 기능까지 유지했습니다.
  2. 모델의 안전장치 우회 가능성 및 시스템 취약점 분석이 필요한 '레드팀' 연구자에게 핵심적인 가치를 제공하는 자료입니다.
  3. 운영 환경 구축 시에는 SGLang 같은 전문 런타임 사용이 필수이며, 대용량 컨텍스트 처리는 OOM 발생 가능성이 높아 시스템 관리가 중요합니다.

이 모델은 DeepSeek-V4.1-Flash의 수준에서 안전장치(guardrails)를 영구적으로 제거한 'UNCENSORED' 버전입니다. 이 수정은 기본 모델의 MMLU 능력, 비전, 추론 및 다중 턴 일관성을 유지하면서 거부 회로를 수술적으로 제거했습니다. 아키텍처는 (384 routed top-6 + 1 shared), CSA2 sparse attention 등을 포함하며, FP8 와 1M 컨텍스트를 지원하는 것이 특징입니다.

HarmBench-320 테스트 결과에 따르면, 안전장치 제거 버전은 악의적 콘텐츠 생성 비율이 기본 모델 대비 압도적으로 높아졌습니다. 예를 들어, HB-320 effort=off 조건에서 기본 모델의 ASR이 42.81%였던 반면, CRACK 버전은 모든 카테고리에서 100.00%를 기록했습니다. 이는 안전장치 제거가 유해성 테스트에 미치는 영향을 정량적으로 보여줍니다.

운영 환경 구축을 위해서는 SGLang과 같은 전문 런타임 사용이 필수적입니다. 특히, MoE 구조의 특성상 `--ep-size` 설정이 필요하며, 이는 전문가 인덱스별로 MoE를 분할하는 역할을 합니다. 또한, JIT 커널 빌드 과정에서 `ninja`가 PATH에 있어야 하며, 추론 및 도구 호출 파서는 각각 `deepseek-v41`을 명시적으로 지정해야 하는 등 복잡한 환경 설정이 요구됩니다.

용어 풀이

가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
MoE
여러 하위 모델 중 일부만 골라 계산하는 구조. 모델이 커도 실행 비용을 줄일 수 있어요.
양자화
모델 숫자의 정밀도를 낮춰 크기와 메모리 사용을 줄이는 기법. 품질이 조금 떨어질 수 있어요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
원문Hugging Face · dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기