모델 도구
Qwen/Qwen3.8-Flash-Next-FP8
HFHugging Face
이 저장소는 후처리된 모델에 대한 FP8 양자화 가중치와 설정 파일을 Hugging Face Transformers 형식으로 담고 있다.
세 줄 요약
- Qwen3.8-Flash-Next는 QSA를 사용한 하이브리드 어텐션, Gated Residual, N-gram 임베딩 등을 도입했다.
- 모델은 파라미터 125B 중 6B가 활성화되고 51B의 n-gram 임베딩을 갖는다.
- Qwen Cloud에서 공식 API 서비스로 Qwen3.8-Flash를 제공하며, 이는 Qwen3.8-Flash-Next 기반이다.
이 저장소는 후처리된 모델에 대한 FP8 양자화 가중치와 설정 파일을 Hugging Face Transformers 형식으로 담고 있다.