모델 도구
Qwen3.8 기반, 추론 효율을 극대화한 Swift 모델 공개
ukisai/Swift-Qwen3.8-27B-GGUF
Hugging FaceUkisAI가 Qwen3.8-27B를 기반으로 추론 효율성을 극대화한 'Swift' 버전을 GGUF 형식으로 공개했습니다.
세 줄 요약
- 주요 벤치마크 테스트 결과, 평균 토큰 사용량을 최대 58.3%까지 절감하는 등 높은 효율을 보였으며 성능 손실은 1% 미만으로 유지되었습니다.
- LLM의 운영 비용과 지연 시간을 크게 줄여주므로, 제한된 컴퓨팅 자원에서도 고성능 추론이 필요한 개발자에게 실질적인 이점을 제공합니다.
- 해당 모델은 GGUF 포맷으로 배포되어 메모리 효율성을 극대화한 양자화 환경에서 최적의 성능을 발휘하도록 설계되었습니다.
Swift-Qwen3.8-27B는 UkisAI가 Qwen3.8-27B를 기반으로 개발한 추론 효율성(reasoning-efficient) 파생 모델입니다. 이 모델은 기존 대비 58.3% 적은 사고 (thinking tokens)을 사용하면서도 성능 손실이 1% 미만으로 유지되는 것이 특징이며, 여러 작업에서 최대 x1.95의 속도 향상을 제공합니다.
주요 테스트 결과에 따르면, Swift 모델은 높은 효율성을 보였습니다. 예를 들어, 일반 추론 능력 측정을 위한 GPQA-Diamond 벤치마크에서는 Base 대비 평균 토큰을 41.0% 감소시켰고, MMLU-Pro에서는 46.2%의 감소율을 기록했습니다. 이 외에도 IFBench와 AIME 2026 등 다양한 영역에서 높은 효율성을 입증했습니다.
이 모델은 된 배포 환경(Quantized deployment)에 최적화되어 있으며, 형식으로 제공됩니다. INT4 평가 결과에서도 GPQA-Diamond의 경우 Base 대비 Swift가 평균 토큰을 32.1% 줄이는 등 메모리 효율성을 유지하며 성능을 발휘하는 것이 확인되었습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 양자화
- 모델 숫자의 정밀도를 낮춰 크기와 메모리 사용을 줄이는 기법. 품질이 조금 떨어질 수 있어요.
- GGUF
- 언어 모델을 개인 PC에서 돌리기 쉽게 담는 파일 형식. llama.cpp 계열 도구에서 써요.