모델 뉴스
Show HN: Shoehorn – Quantize any model down to run on your machine
HNHacker News
쇼호른은 실제 사용 가능한 메모리에 맞춰 언어 모델을 양자화하는 도구로 소개됐다.
세 줄 요약
- 실제 메모리에서 추론에 필요한 만큼을 빼고 텐서별 혼합 정밀도를 배정해 보통 예산의 99.99%를 쓰며, 예시에서는 519.2 MiB 중 13 KB만 남겼다.
- 사전 양자화에서 메모리 여유를 낭비하거나 로드 실패를 겪던 문제를 피하고, 브라우저에서 내 메모리에 맞는 모델을 품질 순으로 보여 준다.
- llama.cpp가 PATH에 있어야 하고, Homebrew 설치 시 함께 들어오며, 리포지토리를 클론한 뒤 cargo install --path .이 필요하다.
쇼호른은 실제 사용 가능한 메모리에 맞춰 언어 모델을 양자화하는 도구로 소개됐다.