Swift 1.5, Qwen3.8 기반 고효율 LLM 양자화 모델 공개 — AI 생성 일러스트AI 일러스트
모델 도구

Swift 1.5, Qwen3.8 기반 고효율 LLM 양자화 모델 공개

ukisai/Swift-1.5-Qwen3.8-27B-GSQ-RCO-GGUF

Hugging Face발표일 미상 · 2분

UkisAI가 Qwen3.8을 기반으로 에이전트 및 코딩 작업에 최적화된 대규모 언어 모델 Swift 1.5를 고효율 GGUF 양자화 형태로 공개했습니다.

세 줄 요약Hugging Face 원문 기반
  1. 본 모델은 후처리 과정을 거쳐 사고 토큰 사용량을 58.5% 절감하고, 처리 속도를 최대 9.18배 향상시키는 뛰어난 효율성을 보여줍니다.
  2. 다양한 양자화 계층(IQ2_XS~IQ3_S)을 제공하여 메모리 제약이 있는 환경에서도 고성능 LLM 구동 및 추론이 가능합니다.
  3. 제공된 성능 평가는 512 토큰 컨텍스트를 기준으로 측정되었으므로, 32K와 같은 장문맥에서의 실제 품질은 별도 검증이 필요합니다.

UkisAI가 Qwen3.8-27B를 기반으로 및 코딩 작업에 최적화된 Swift 1.5의 버전을 공개했습니다. 이 모델은 후처리 과정을 거쳐 전반적인 성능을 개선하는 동시에, 사고 사용량을 줄이는 데 초점을 맞췄습니다. 그 결과, 여러 작업에서 기존 대비 58.5% 적은 사고 토큰을 사용하며 0.35% 높은 점수를 기록했고, 최대 9.18배의 속도 향상을 달성했습니다.

사용자는 메모리 환경에 맞춰 다양한 양자화 계층(IQ2_XS부터 IQ3_S까지) 중 하나를 선택할 수 있으며, 각 티어는 단일 GGUF 파일로 제공됩니다. 이 모델은 혼합 정밀도 할당 프로파일을 나타내며, `-mtp` 옵션이 추가된 파일은 해당 모델의 MTP 구현을 지원하는 런타임 환경이 필요합니다.

성능 평가는 C4 prose, CodeParrot code, GSM8K math text 등 다양한 분야의 홀드아웃 텍스트를 사용하여 KLD 측정 방식으로 이루어졌습니다. 개발자들은 `llama.cpp` 빌드를 사용하고 `llama-server`와 같은 도구를 통해 모델을 구동할 수 있습니다. 다만, 제공된 테스트는 컨텍스트 길이 512 토큰 기준으로 진행되었으며, 32K 이상의 장문맥에서의 품질은 별도로 검증해야 합니다.

용어 풀이

에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
GGUF
언어 모델을 개인 PC에서 돌리기 쉽게 담는 파일 형식. llama.cpp 계열 도구에서 써요.
양자화
모델 숫자의 정밀도를 낮춰 크기와 메모리 사용을 줄이는 기법. 품질이 조금 떨어질 수 있어요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
궁금한 점AI 정리 · 원문 기반
이 모델을 구동하려면 어떤 도구를 사용해야 하나요?

개발자들은 `llama.cpp` 빌드를 사용하여 `llama-server` 같은 도구로 모델을 구동할 수 있어요.

'사고 토큰'이 무엇이며, 이 모델에서 어떤 역할을 하나요?

본문에서는 사고 토큰(thinking tokens) 사용량을 줄이는 데 초점을 맞췄다고 설명하고 있어요. 후처리 과정을 거쳐 전반적인 성능을 개선하는 데 도움을 줍니다.

32K와 같은 아주 긴 문맥에서도 좋은 성능이 보장되나요?

아니요, 제공된 테스트는 컨텍스트 길이 512 토큰 기준으로 진행되었기 때문에, 32K 이상의 장문맥에서의 품질은 별도로 검증해야 해요.

원문Hugging Face · ukisai/Swift-1.5-Qwen3.8-27B-GSQ-RCO-GGUF같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기