모델 뉴스

Qwen3.8 기반 코딩 특화 초경량 LLM 공개

ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-Coder-GGUF

HFHugging Face발표일 미상 · 3분

Qwen3.8-Flash-Next를 기반으로 전문가(Expert) 절반을 제거하고 양자화하여, 코딩 및 멀티모달 기능에 특화된 초경량 모델이 공개되었습니다.

왜 중요해요AI 정리

초대형 언어 모델의 강력한 기능을 메모리 용량이 제한된 환경에서도 구동할 수 있게 해줘서 현장 배포 및 서비스화에 매우 유리해요.

세 줄 요약Hugging Face 원문 기반
  1. 원본 대비 크기를 획기적으로 줄여(354GB → 58.4GB), 메모리 효율성을 극대화하면서도 코딩 전문 벤치마크에서 높은 성능을 유지했습니다.
  2. 초대형 모델의 강력한 기능을 제한된 메모리 환경에서도 구동 가능하게 하여, 현장 배포 및 서비스화에 매우 유리합니다.
  3. 이 모델은 코딩과 비전 등 특정 영역에 초점을 맞춰 압축되었으므로, 해당 범위를 벗어난 일반적인 작업에서는 성능 저하가 예상됩니다.

ISTA-DASLab에서 Qwen3.8-Flash-Next를 기반으로 전문가(Expert) 절반을 제거하고 한 모델이 공개되었습니다. 이 모델은 코드 생성, 도구 사용, 비전 및 공간 추론 등 특정 기능에 초점을 맞춰 압축되었으며, 원본 대비 크기를 획기적으로 줄여 메모리 효율성을 높였습니다. 전문가 절반을 제거하는 방식은 단순 양자화와는 다르며, 남아있는 는 3.5 bpw로 저장됩니다.

원본 모델인 Qwen3.8-Flash-Next는 176.9B 에 달하며 BF16 기준으로 354 GB의 크기를 차지합니다. 반면, 압축된 GSQ-RCO Coder 모델은 총 58.4 GB로 줄었으며, 실제로 메모리에 상주해야 하는 작업 집합(resident working set)은 29.6 GB에 불과합니다. 이는 원본 대비 효과적으로 파라미터당 1.89 비트 수준의 효율을 달성한 수치입니다.

이 모델은 코딩 전문성을 검증하는 에서 높은 성능을 유지했습니다. LiveCodeBench v6에서는 86.28점, SWE-bench Verified에서는 75.60점을 기록하며 원본 대비 우수한 성능을 보여주었습니다. 다만, 이 압축 과정은 코딩 및 비전 등 특정 도메인에 초점을 맞춘 것이므로, 해당 범위를 벗어난 일반적인 작업에서는 성능 저하가 예상됩니다.

모델의 경량화는 RCO(Riemannian Manifolds)와 GSQ(GSQ: Highly-Accurate Low-Precision Scalar Quantization)라는 두 가지 고급 기술을 결합하여 이루어졌습니다. 전문가 제거(Pruning)는 모델에서 전체 전문가 블록을 아예 삭제하는 것이고, 양자화는 파라미터의 저장 정밀도를 낮추는 것입니다. 이 두 기법이 결합되어 의 크기를 줄이고 메모리 사용량을 최적화했습니다.

용어 풀이

양자화
모델 숫자의 정밀도를 낮춰 크기와 메모리 사용을 줄이는 기법. 품질이 조금 떨어질 수 있어요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
궁금한 점AI 정리 · 원문 기반
모델의 크기를 줄이는 데 어떤 기술을 사용했나요?

이 경량화는 RCO와 GSQ라는 두 가지 고급 기술을 결합하여 이루어졌어요. 구체적으로 전문가 제거(Pruning)를 통해 전체 전문가 블록을 삭제하고, 양자화를 이용해 파라미터의 저장 정밀도를 낮추었어요.

이 모델은 어떤 작업에 특화되어 있나요?

코드 생성, 에이전트 도구 사용, 비전 및 공간 추론 등 특정 기능에 초점을 맞춰 압축되었어요. 따라서 해당 범위를 벗어난 일반적인 작업에서는 성능 저하가 예상돼요.

원본 모델의 크기는 어느 정도였나요?

원본 모델인 Qwen3.8-Flash-Next는 176.9B 파라미터에 달하며, BF16 기준으로 354 GB의 크기를 차지했어요. 압축된 GSQ-RCO Coder 모델은 총 58.4 GB로 줄었어요.

원문Hugging Face · ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-Coder-GGUF
궁금한 점 3개AI 정리