테르너리 양자화로 대규모 언어 모델 경량화 성공 — AI 생성 일러스트AI 일러스트
모델 뉴스

테르너리 양자화로 대규모 언어 모델 경량화 성공

prism-ml/Ternary-Bonsai-2-27B-mlx-2bit

Hugging Face발표일 미상 · 2분

Prism ML이 27B급 대규모 언어 모델(LLM)인 Bonsai 2를 공개했습니다. 이 모델은 가중치를 테르너리 방식으로 양자화하여 온디바이스 구동에 최적화된 경량화를 달성한 것이 핵심입니다.

세 줄 요약Hugging Face 원문 기반
  1. FP16 대비 크기를 8.60GB 수준으로 대폭 줄였음에도 불구하고, 복잡한 추론 및 사고 과정에서 원본 지능의 98.2%를 유지하는 뛰어난 성능을 입증했습니다.
  2. 이 기술은 고성능 LLM을 일반 노트북이나 저전력 환경에서도 효율적으로 구동할 수 있게 함으로써 온디바이스 AI 구현과 접근성을 크게 향상시킬 것으로 기대됩니다.
  3. 최적의 성능 발휘를 위해서는 MLX나 llama.cpp 같은 특정 백엔드와 커스텀 양자화 커널을 사용해야 하며, 일반적인 로더로는 정상 작동하지 않을 수 있습니다.

Prism ML이 Qwen3.8-27B를 기반으로 하는 Bonsai 2라는 27B급 을 공개했습니다. 이 모델은 를 테르너리 방식으로 하여 구동에 최적화된 경량화를 달성한 것이 핵심입니다. 이 방식은 , 어텐션 투영 등 전반적인 가중치에 적용되었으며, 이론적으로 1.72 bits/weight의 효율을 보여줍니다.

이 모델은 디스크에서 총 8.60 GB 크기(언어 모델 + 비전 타워 포함)로 구현되었습니다. FP16 지능 대비 98.2%를 유지하는 것으로 보고되었으며, 이는 일반적인 저비트 빌드보다 높은 수치입니다. 특히 수학적 계산이나 코딩 수준의 추론 및 행동 능력을 낮은 비트 영역에서도 보존한 것이 특징입니다.

모델을 구동하기 위해서는 MLX나 llama.cpp와 같은 특정 백엔드가 제공하는 커스텀 로더를 사용해야 합니다. 이 모델은 Hadamard 회전을 포함하고 있어, 일반적인 LLM 로더로는 활성화 변환(activation transform) 및 역 임베딩 조회 과정이 생략되어 잘못된 출력을 반환할 수 있습니다.

용어 풀이

LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
양자화
모델 숫자의 정밀도를 낮춰 크기와 메모리 사용을 줄이는 기법. 품질이 조금 떨어질 수 있어요.
온디바이스
서버를 거치지 않고 휴대폰이나 PC 안에서 직접 돌아가는 AI.
임베딩
글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
원문Hugging Face · prism-ml/Ternary-Bonsai-2-27B-mlx-2bit같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기