삼진법 가중치로 경량화된 대규모 언어 모델 'Bonsai 2' 공개
prism-ml/Ternary-Bonsai-2-27B-gguf
Hugging Face270억 개 매개변수를 가진 'Bonsai 2'는 가중치를 삼진법(ternary)으로 압축하여 대규모 언어 모델의 크기를 혁신적으로 줄인 것이 핵심입니다.
- FP16 대비 약 9.3배 작은 5~7GB 크기임에도, 지능은 98.2%를 유지하며 복잡한 추론 및 에이전트 기능을 성공적으로 구현했습니다.
- 이는 고성능 GPU가 아닌 일반 노트북이나 단일 GPU 환경에서도 초대형 AI 모델을 구동할 수 있게 하여 접근성을 크게 높입니다.
- 사용 시에는 삼진법 가중치를 지원하는 전용 `llama.cpp` 포크가 필수이며, 메모리 환경에 따라 PTQ1_0 또는 PQ2_0 패킹 방식을 선택해야 합니다.
Bonsai 2는 Qwen3.8-27B를 기반으로 하며, 모델의 를 삼진법(ternary)으로 압축하여 의 크기를 혁신적으로 줄인 것이 특징입니다. 이 기술을 통해 FP16 대비 약 9.3배 작은 용량(PTQ1_0 기준 5.95 GB)으로도 높은 성능을 유지합니다. 특히, 일반적인 저비트 표현에서 추론 능력이 급격히 떨어지는 현상에도 불구하고, Bonsai 2는 복잡한 사고, 추론 및 행동 능력을 성공적으로 보존하며 FP16 지능의 98.2%를 유지하는 것으로 보고되었습니다.
모델은 Qwen3.8-27B 아키텍처를 계승했으며, 하이브리드 어텐션(약 75% 선형/25% 전체)과 SwiGLU MLP 구조를 채택했습니다. 총 는 27.36B이며, 최대 262K 의 컨텍스트 길이를 지원합니다. 가중치 형식은 , 어텐션 투영, MLP 투영 등 전반에 걸쳐 삼진법 g128을 사용하며, 이는 {−1, 0, +1} 값을 가지는 방식으로 저장됩니다.
실제 배포를 위해서는 특화된 패킹 형식이 필요합니다. PTQ1_0은 트릿을 밀집하게 패킹하여 정보 이론적 목표에 근접한 용량을 제공하며, PQ2_0은 각 트릿을 2비트 슬롯에 저장하는 방식을 사용합니다. 이 모델의 고유한 삼진법 하이브리드 어텐션 커널은 표준 llama.cpp에서는 지원되지 않으므로, 반드시 전용 포크를 사용하여 구동해야 합니다.
용어 풀이
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.