Swift 1.5, Qwen3.8 기반 고효율 LLM 양자화 모델 공개
ukisai/Swift-1.5-Qwen3.8-27B-GSQ-RCO-GGUF
Hugging FaceUkisAI가 Qwen3.8을 기반으로 에이전트 및 코딩 작업에 최적화된 대규모 언어 모델 Swift 1.5를 고효율 GGUF 양자화 형태로 공개했습니다.
- 본 모델은 후처리 과정을 거쳐 사고 토큰 사용량을 58.5% 절감하고, 처리 속도를 최대 9.18배 향상시키는 뛰어난 효율성을 보여줍니다.
- 다양한 양자화 계층(IQ2_XS~IQ3_S)을 제공하여 메모리 제약이 있는 환경에서도 고성능 LLM 구동 및 추론이 가능합니다.
- 제공된 성능 평가는 512 토큰 컨텍스트를 기준으로 측정되었으므로, 32K와 같은 장문맥에서의 실제 품질은 별도 검증이 필요합니다.
UkisAI가 Qwen3.8-27B를 기반으로 및 코딩 작업에 최적화된 Swift 1.5의 버전을 공개했습니다. 이 모델은 후처리 과정을 거쳐 전반적인 성능을 개선하는 동시에, 사고 사용량을 줄이는 데 초점을 맞췄습니다. 그 결과, 여러 작업에서 기존 대비 58.5% 적은 사고 토큰을 사용하며 0.35% 높은 점수를 기록했고, 최대 9.18배의 속도 향상을 달성했습니다.
사용자는 메모리 환경에 맞춰 다양한 양자화 계층(IQ2_XS부터 IQ3_S까지) 중 하나를 선택할 수 있으며, 각 티어는 단일 GGUF 파일로 제공됩니다. 이 모델은 혼합 정밀도 할당 프로파일을 나타내며, `-mtp` 옵션이 추가된 파일은 해당 모델의 MTP 구현을 지원하는 런타임 환경이 필요합니다.
성능 평가는 C4 prose, CodeParrot code, GSM8K math text 등 다양한 분야의 홀드아웃 텍스트를 사용하여 KLD 측정 방식으로 이루어졌습니다. 개발자들은 `llama.cpp` 빌드를 사용하고 `llama-server`와 같은 도구를 통해 모델을 구동할 수 있습니다. 다만, 제공된 테스트는 컨텍스트 길이 512 토큰 기준으로 진행되었으며, 32K 이상의 장문맥에서의 품질은 별도로 검증해야 합니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- GGUF
- 언어 모델을 개인 PC에서 돌리기 쉽게 담는 파일 형식. llama.cpp 계열 도구에서 써요.
- 양자화
- 모델 숫자의 정밀도를 낮춰 크기와 메모리 사용을 줄이는 기법. 품질이 조금 떨어질 수 있어요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
이 모델을 구동하려면 어떤 도구를 사용해야 하나요?
개발자들은 `llama.cpp` 빌드를 사용하여 `llama-server` 같은 도구로 모델을 구동할 수 있어요.
'사고 토큰'이 무엇이며, 이 모델에서 어떤 역할을 하나요?
본문에서는 사고 토큰(thinking tokens) 사용량을 줄이는 데 초점을 맞췄다고 설명하고 있어요. 후처리 과정을 거쳐 전반적인 성능을 개선하는 데 도움을 줍니다.
32K와 같은 아주 긴 문맥에서도 좋은 성능이 보장되나요?
아니요, 제공된 테스트는 컨텍스트 길이 512 토큰 기준으로 진행되었기 때문에, 32K 이상의 장문맥에서의 품질은 별도로 검증해야 해요.