모델 뉴스
테르너리 양자화로 대규모 언어 모델 경량화 성공
prism-ml/Ternary-Bonsai-2-27B-mlx-2bit
Hugging FacePrism ML이 27B급 대규모 언어 모델(LLM)인 Bonsai 2를 공개했습니다. 이 모델은 가중치를 테르너리 방식으로 양자화하여 온디바이스 구동에 최적화된 경량화를 달성한 것이 핵심입니다.
세 줄 요약
- FP16 대비 크기를 8.60GB 수준으로 대폭 줄였음에도 불구하고, 복잡한 추론 및 사고 과정에서 원본 지능의 98.2%를 유지하는 뛰어난 성능을 입증했습니다.
- 이 기술은 고성능 LLM을 일반 노트북이나 저전력 환경에서도 효율적으로 구동할 수 있게 함으로써 온디바이스 AI 구현과 접근성을 크게 향상시킬 것으로 기대됩니다.
- 최적의 성능 발휘를 위해서는 MLX나 llama.cpp 같은 특정 백엔드와 커스텀 양자화 커널을 사용해야 하며, 일반적인 로더로는 정상 작동하지 않을 수 있습니다.
Prism ML이 Qwen3.8-27B를 기반으로 하는 Bonsai 2라는 27B급 을 공개했습니다. 이 모델은 를 테르너리 방식으로 하여 구동에 최적화된 경량화를 달성한 것이 핵심입니다. 이 방식은 , 어텐션 투영 등 전반적인 가중치에 적용되었으며, 이론적으로 1.72 bits/weight의 효율을 보여줍니다.
이 모델은 디스크에서 총 8.60 GB 크기(언어 모델 + 비전 타워 포함)로 구현되었습니다. FP16 지능 대비 98.2%를 유지하는 것으로 보고되었으며, 이는 일반적인 저비트 빌드보다 높은 수치입니다. 특히 수학적 계산이나 코딩 수준의 추론 및 행동 능력을 낮은 비트 영역에서도 보존한 것이 특징입니다.
모델을 구동하기 위해서는 MLX나 llama.cpp와 같은 특정 백엔드가 제공하는 커스텀 로더를 사용해야 합니다. 이 모델은 Hadamard 회전을 포함하고 있어, 일반적인 LLM 로더로는 활성화 변환(activation transform) 및 역 임베딩 조회 과정이 생략되어 잘못된 출력을 반환할 수 있습니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 양자화
- 모델 숫자의 정밀도를 낮춰 크기와 메모리 사용을 줄이는 기법. 품질이 조금 떨어질 수 있어요.
- 온디바이스
- 서버를 거치지 않고 휴대폰이나 PC 안에서 직접 돌아가는 AI.
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.