Qwen3-8B 모델의 초저비트 양자화 및 패킹 실행 연구 — AI 생성 일러스트AI 일러스트
리서치 연구

Qwen3-8B 모델의 초저비트 양자화 및 패킹 실행 연구

Scaling Post-Training Ternarisation to Qwen3-8B Capability Retention, Reproduction, Lossless Packing, and Packed Execution

arXiv9월 10일 발표 · 3분 · 심사 전 논문

연구진은 Qwen3-4B 모델의 초저비트 양자화 기술을 8B 규모까지 성공적으로 확장 적용하는 전 과정을 구현했습니다.

세 줄 요약arXiv 원문 기반
  1. 이 방법을 통해 모델 크기를 8.24 GiB로 압축하고, 직접 패킹된 실행 환경에서 초당 15.52 토큰/s의 높은 처리 속도를 달성했습니다.
  2. 모델 용량 감소와 성능 저하 최소화라는 두 마리 토끼를 잡아, 메모리가 제한적인 환경에서도 LLM 배포가 가능함을 입증한 기술적 성과입니다.
  3. 다만, 이 결과는 검증된 기준점이며, 더 광범위한 시드 값이나 커널 최적화 등은 향후 추가 연구가 필요한 영역으로 남아있습니다.

본 연구는 Qwen3-4B에서 Qwen3-8B로 이어지는 공격적인 사후 학습 변환 파이프라인을 확장 적용하는 과정을 다룹니다. 이 과정에서는 KOTMS 회전, E2M-ATQ 적응형 삼진화(ternarisation), 그리고 GPTQ 스타일의 오류 보정 기법을 전용 A16 구성으로 사용했습니다. 연구의 핵심 기여는 외부 재현 게이트, 매칭된 4B/8B 역량 분석, 교차 코퍼스 퍼플렉시티 측정, 유효 비트 계산, 손실 없는 격자 인식 패킹, 그리고 직접적인 패킹 실행에 이르는 전 과정의 특성화입니다.

8B 모델은 세 가지 코퍼스에서 각각 1.361x, 1.318x, 1.393x의 퍼플렉시티 비율을 달성했습니다. n=500 조건에서 진행된 여덟 가지 태스크의 평균 정확도는 FP16 대비 64.6%를 기록했으며, 이는 72.4%에 해당합니다. 이 결과는 78.5%의 기회 보정 유지율과 7.8점의 절대 비용을 나타냅니다. 비교 대상인 매칭된 4B 모델은 69.6%의 정확도를 유지하며 8B 대비 8.9점의 우위를 보여주었습니다.

패킹된 체크포인트는 8.24 GiB 크기이며, 기록된 퍼플렉시티를 측정 정밀도까지 보존합니다. 직접 패킹 실행 환경에서는 7.35 GiB에서 초당 15.52 을 달성했습니다. 다만, 예비적인 패킹 GEMV는 FP16 cuBLAS보다 느린 성능을 보였습니다. 이 연구를 통해 모델 크기가 공격적인 사후 학습 이산화에 대한 견고성을 높이고, 직접 실행이 가능하다는 검증된 기준점을 마련했으나, 더 광범위한 시드 값이나 커널 최적화 등은 추가 연구가 필요합니다.

용어 풀이

가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
제로샷
예시를 하나도 주지 않고 바로 과제를 시키는 방식.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
원문arXiv · Scaling Post-Training Ternarisation to Qwen3-8B Capability Retention, Reproduction, Lossless Packing, and Packed Execution같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기