Qwen3-8B 모델의 초저비트 양자화 및 패킹 실행 연구
Scaling Post-Training Ternarisation to Qwen3-8B Capability Retention, Reproduction, Lossless Packing, and Packed Execution
arXiv연구진은 Qwen3-4B 모델의 초저비트 양자화 기술을 8B 규모까지 성공적으로 확장 적용하는 전 과정을 구현했습니다.
- 이 방법을 통해 모델 크기를 8.24 GiB로 압축하고, 직접 패킹된 실행 환경에서 초당 15.52 토큰/s의 높은 처리 속도를 달성했습니다.
- 모델 용량 감소와 성능 저하 최소화라는 두 마리 토끼를 잡아, 메모리가 제한적인 환경에서도 LLM 배포가 가능함을 입증한 기술적 성과입니다.
- 다만, 이 결과는 검증된 기준점이며, 더 광범위한 시드 값이나 커널 최적화 등은 향후 추가 연구가 필요한 영역으로 남아있습니다.
본 연구는 Qwen3-4B에서 Qwen3-8B로 이어지는 공격적인 사후 학습 변환 파이프라인을 확장 적용하는 과정을 다룹니다. 이 과정에서는 KOTMS 회전, E2M-ATQ 적응형 삼진화(ternarisation), 그리고 GPTQ 스타일의 오류 보정 기법을 전용 A16 구성으로 사용했습니다. 연구의 핵심 기여는 외부 재현 게이트, 매칭된 4B/8B 역량 분석, 교차 코퍼스 퍼플렉시티 측정, 유효 비트 계산, 손실 없는 격자 인식 패킹, 그리고 직접적인 패킹 실행에 이르는 전 과정의 특성화입니다.
8B 모델은 세 가지 코퍼스에서 각각 1.361x, 1.318x, 1.393x의 퍼플렉시티 비율을 달성했습니다. n=500 조건에서 진행된 여덟 가지 태스크의 평균 정확도는 FP16 대비 64.6%를 기록했으며, 이는 72.4%에 해당합니다. 이 결과는 78.5%의 기회 보정 유지율과 7.8점의 절대 비용을 나타냅니다. 비교 대상인 매칭된 4B 모델은 69.6%의 정확도를 유지하며 8B 대비 8.9점의 우위를 보여주었습니다.
패킹된 체크포인트는 8.24 GiB 크기이며, 기록된 퍼플렉시티를 측정 정밀도까지 보존합니다. 직접 패킹 실행 환경에서는 7.35 GiB에서 초당 15.52 을 달성했습니다. 다만, 예비적인 패킹 GEMV는 FP16 cuBLAS보다 느린 성능을 보였습니다. 이 연구를 통해 모델 크기가 공격적인 사후 학습 이산화에 대한 견고성을 높이고, 직접 실행이 가능하다는 검증된 기준점을 마련했으나, 더 광범위한 시드 값이나 커널 최적화 등은 추가 연구가 필요합니다.
용어 풀이
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 제로샷
- 예시를 하나도 주지 않고 바로 과제를 시키는 방식.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.