삼진법 가중치로 경량화된 대규모 언어 모델 'Bonsai 2' 공개 — AI 생성 일러스트AI 일러스트
모델 뉴스

삼진법 가중치로 경량화된 대규모 언어 모델 'Bonsai 2' 공개

prism-ml/Ternary-Bonsai-2-27B-gguf

Hugging Face발표일 미상 · 3분

270억 개 매개변수를 가진 'Bonsai 2'는 가중치를 삼진법(ternary)으로 압축하여 대규모 언어 모델의 크기를 혁신적으로 줄인 것이 핵심입니다.

세 줄 요약Hugging Face 원문 기반
  1. FP16 대비 약 9.3배 작은 5~7GB 크기임에도, 지능은 98.2%를 유지하며 복잡한 추론 및 에이전트 기능을 성공적으로 구현했습니다.
  2. 이는 고성능 GPU가 아닌 일반 노트북이나 단일 GPU 환경에서도 초대형 AI 모델을 구동할 수 있게 하여 접근성을 크게 높입니다.
  3. 사용 시에는 삼진법 가중치를 지원하는 전용 `llama.cpp` 포크가 필수이며, 메모리 환경에 따라 PTQ1_0 또는 PQ2_0 패킹 방식을 선택해야 합니다.

Bonsai 2는 Qwen3.8-27B를 기반으로 하며, 모델의 를 삼진법(ternary)으로 압축하여 의 크기를 혁신적으로 줄인 것이 특징입니다. 이 기술을 통해 FP16 대비 약 9.3배 작은 용량(PTQ1_0 기준 5.95 GB)으로도 높은 성능을 유지합니다. 특히, 일반적인 저비트 표현에서 추론 능력이 급격히 떨어지는 현상에도 불구하고, Bonsai 2는 복잡한 사고, 추론 및 행동 능력을 성공적으로 보존하며 FP16 지능의 98.2%를 유지하는 것으로 보고되었습니다.

모델은 Qwen3.8-27B 아키텍처를 계승했으며, 하이브리드 어텐션(약 75% 선형/25% 전체)과 SwiGLU MLP 구조를 채택했습니다. 총 는 27.36B이며, 최대 262K 의 컨텍스트 길이를 지원합니다. 가중치 형식은 , 어텐션 투영, MLP 투영 등 전반에 걸쳐 삼진법 g128을 사용하며, 이는 {−1, 0, +1} 값을 가지는 방식으로 저장됩니다.

실제 배포를 위해서는 특화된 패킹 형식이 필요합니다. PTQ1_0은 트릿을 밀집하게 패킹하여 정보 이론적 목표에 근접한 용량을 제공하며, PQ2_0은 각 트릿을 2비트 슬롯에 저장하는 방식을 사용합니다. 이 모델의 고유한 삼진법 하이브리드 어텐션 커널은 표준 llama.cpp에서는 지원되지 않으므로, 반드시 전용 포크를 사용하여 구동해야 합니다.

용어 풀이

가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
임베딩
글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
원문Hugging Face · prism-ml/Ternary-Bonsai-2-27B-gguf같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기