Qwen 모델의 추론 효율을 높인 Swift 어댑터 공개
ukisai/Swift-Qwen3.8-27b
Hugging FaceUkisAI가 Qwen3.8-27B를 기반으로 'Swift'라는 추론 효율화 어댑터를 개발했습니다. 이 기술은 LLM의 과도한 사고 과정을 줄여 성능을 유지하면서 속도를 높이는 것이 핵심입니다.
- 주요 벤치마크 테스트 결과, Swift는 추론에 필요한 평균 토큰을 최대 58%까지 대폭 절감했습니다. 이 과정에서 성능 손실은 1% 미만으로 유지되어 약 2배 가까운 처리 속도 향상을 달성했습니다.
- 추론 효율성의 증가는 API 호출 비용 절감은 물론, 실시간 서비스 환경에서 응답 속도를 획기적으로 개선하는 큰 이점을 제공합니다. 낮은 메모리 사용량으로 고성능 추론이 가능해집니다.
- Swift는 모델의 '사고 토큰'을 페널티 처리하여 학습되었으며, 최적의 효율성을 위해서는 양자화(Quantized) 배포 환경에서 활용하는 것이 가장 효과적입니다.
UkisAI가 Qwen3.8-27B를 기반으로 'Swift'라는 추론 효율화 어댑터를 개발했습니다. 이 기술은 (LLM)의 과도한 사고 과정을 줄여 성능을 유지하면서 속도를 높이는 것이 핵심입니다. Swift는 기존 대비 58.3% 적은 생각 (thinking tokens)을 사용하며, 성능 손실이 1% 미만으로 유지되어 여러 작업에서 x1.95에 달하는 처리 속도 향상을 제공한다고 설명합니다.
Swift의 작동 원리는 모델의 추론 과정에서 과도한 사고를 유발하는 '추론 마커 토큰(reasoning-marker tokens)'을 식별하고, 이 토큰 사용에 페널티를 부여하여 Qwen 모델을 (fine-tuning)하는 방식입니다. 이러한 훈련 과정을 통해 Swift는 더 짧은 추론 흔적(reasoning traces)을 생성하며, 과도한 사고 오류 발생률 또한 줄이는 효과를 보였습니다.
다양한 테스트 결과에 따르면, Swift는 평균 토큰 사용량을 크게 절감했습니다. 예를 들어 GPQA-Diamond의 경우 Mean tokens이 15,014개에서 8,855개로 감소하는 등 높은 효율성을 보였습니다. 특히 (Quantized) 배포 환경에서는 정확도를 유지하거나 개선하며, AIME 2026 같은 과제에서 출력 용량 실패율을 31~33% 줄이는 성과를 나타냈습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 양자화
- 모델 숫자의 정밀도를 낮춰 크기와 메모리 사용을 줄이는 기법. 품질이 조금 떨어질 수 있어요.