Bonsai 2 27B, 9배 작아진 크기로 성능을 유지한 AI 모델
Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint
Hacker NewsBonsai 2 27B는 Qwen3.8을 기반으로 테르너리 압축 기술을 적용하여, 대규모 언어 모델의 크기를 혁신적으로 줄인 최신 AI 모델입니다.
- 모델 크기는 기존 대비 9배 이상 축소되었음에도 불구하고, 성능은 최대 98.2%를 유지하며 고성능과 초경량화를 동시에 달성했습니다.
- 이 기술 덕분에 클라우드 연결 없이도 개인 장치에서 코딩 에이전트나 멀티모달 분석 등 복잡한 지식 노동을 수행하는 것이 가능해졌습니다.
- 앞으로 AI 시스템의 핵심은 모델 자체의 성능뿐 아니라, 주어진 메모리 및 전력 예산 내에서 얼마나 많은 유용한 지능을 구현할 수 있는지가 될 것입니다.
Ternary Bonsai 2 27B는 Qwen3.8 27B를 기반으로 하며, 테르너리 {−1, 0, +1} 와 FP16 그룹별 스케일링을 사용합니다. 이 기술 덕분에 모델은 효과적으로 1.76 비트/가중치를 구현하여 총 모델 크기를 5.9GB로 줄였습니다. 해당 모델은 262K 과 (텍스트 및 이미지) 입력을 지원하며, Apache 2.0 라이선스로 공개되었습니다.
Ternary Bonsai 2 27B는 풀 정밀도 버전 대비 9배 이상 작아졌음에도 불구하고, 종합 성능의 98.2%를 유지했습니다. 이 모델은 추론, 코딩, 비전, 기능 등 다양한 영역에서 높은 성능을 보이며, 특히 작은 오류가 누적되기 쉬운 코딩 에이전트나 장기 작업에서도 풀 정밀도 모델의 성능을 상당 부분 보존하는 것이 특징입니다.
실제 사용 환경 측면에서, Ternary Bonsai 2 27B는 NVIDIA GeForce RTX 5090에서 최대 143 토큰/초에 달하는 높은 처리량과 에너지 효율성을 제공합니다. 예를 들어, RTX 4090에서는 0.714 mWh/토큰을 소비하여 풀 정밀도 8B 모델보다 40% 더 에너지 효율적입니다. 이러한 성능은 로컬 환경에서 코딩 에이전트 루프나 사설 문서 분석 등 복잡한 지식 노동 수행에 유리합니다.
용어 풀이
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 컨텍스트 창
- 모델이 한 번에 읽고 참고할 수 있는 입력의 최대 길이. 보통 토큰 수로 나타내요.
- 멀티모달
- 글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.