Qwen3.8 기반 코딩 특화 초경량 LLM 공개
ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-Coder-GGUF
Qwen3.8-Flash-Next를 기반으로 전문가(Expert) 절반을 제거하고 양자화하여, 코딩 및 멀티모달 기능에 특화된 초경량 모델이 공개되었습니다.
초대형 언어 모델의 강력한 기능을 메모리 용량이 제한된 환경에서도 구동할 수 있게 해줘서 현장 배포 및 서비스화에 매우 유리해요.
- 원본 대비 크기를 획기적으로 줄여(354GB → 58.4GB), 메모리 효율성을 극대화하면서도 코딩 전문 벤치마크에서 높은 성능을 유지했습니다.
- 초대형 모델의 강력한 기능을 제한된 메모리 환경에서도 구동 가능하게 하여, 현장 배포 및 서비스화에 매우 유리합니다.
- 이 모델은 코딩과 비전 등 특정 영역에 초점을 맞춰 압축되었으므로, 해당 범위를 벗어난 일반적인 작업에서는 성능 저하가 예상됩니다.
ISTA-DASLab에서 Qwen3.8-Flash-Next를 기반으로 전문가(Expert) 절반을 제거하고 한 모델이 공개되었습니다. 이 모델은 코드 생성, 도구 사용, 비전 및 공간 추론 등 특정 기능에 초점을 맞춰 압축되었으며, 원본 대비 크기를 획기적으로 줄여 메모리 효율성을 높였습니다. 전문가 절반을 제거하는 방식은 단순 양자화와는 다르며, 남아있는 는 3.5 bpw로 저장됩니다.
원본 모델인 Qwen3.8-Flash-Next는 176.9B 에 달하며 BF16 기준으로 354 GB의 크기를 차지합니다. 반면, 압축된 GSQ-RCO Coder 모델은 총 58.4 GB로 줄었으며, 실제로 메모리에 상주해야 하는 작업 집합(resident working set)은 29.6 GB에 불과합니다. 이는 원본 대비 효과적으로 파라미터당 1.89 비트 수준의 효율을 달성한 수치입니다.
이 모델은 코딩 전문성을 검증하는 에서 높은 성능을 유지했습니다. LiveCodeBench v6에서는 86.28점, SWE-bench Verified에서는 75.60점을 기록하며 원본 대비 우수한 성능을 보여주었습니다. 다만, 이 압축 과정은 코딩 및 비전 등 특정 도메인에 초점을 맞춘 것이므로, 해당 범위를 벗어난 일반적인 작업에서는 성능 저하가 예상됩니다.
모델의 경량화는 RCO(Riemannian Manifolds)와 GSQ(GSQ: Highly-Accurate Low-Precision Scalar Quantization)라는 두 가지 고급 기술을 결합하여 이루어졌습니다. 전문가 제거(Pruning)는 모델에서 전체 전문가 블록을 아예 삭제하는 것이고, 양자화는 파라미터의 저장 정밀도를 낮추는 것입니다. 이 두 기법이 결합되어 의 크기를 줄이고 메모리 사용량을 최적화했습니다.
용어 풀이
- 양자화
- 모델 숫자의 정밀도를 낮춰 크기와 메모리 사용을 줄이는 기법. 품질이 조금 떨어질 수 있어요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
모델의 크기를 줄이는 데 어떤 기술을 사용했나요?
이 경량화는 RCO와 GSQ라는 두 가지 고급 기술을 결합하여 이루어졌어요. 구체적으로 전문가 제거(Pruning)를 통해 전체 전문가 블록을 삭제하고, 양자화를 이용해 파라미터의 저장 정밀도를 낮추었어요.
이 모델은 어떤 작업에 특화되어 있나요?
코드 생성, 에이전트 도구 사용, 비전 및 공간 추론 등 특정 기능에 초점을 맞춰 압축되었어요. 따라서 해당 범위를 벗어난 일반적인 작업에서는 성능 저하가 예상돼요.
원본 모델의 크기는 어느 정도였나요?
원본 모델인 Qwen3.8-Flash-Next는 176.9B 파라미터에 달하며, BF16 기준으로 354 GB의 크기를 차지했어요. 압축된 GSQ-RCO Coder 모델은 총 58.4 GB로 줄었어요.