모델 뉴스

Show HN: Shoehorn – Quantize any model down to run on your machine

HNHacker News8월 18일 발표 · 1분

쇼호른은 실제 사용 가능한 메모리에 맞춰 언어 모델을 양자화하는 도구로 소개됐다.

세 줄 요약Hacker News 원문 기반
  1. 실제 메모리에서 추론에 필요한 만큼을 빼고 텐서별 혼합 정밀도를 배정해 보통 예산의 99.99%를 쓰며, 예시에서는 519.2 MiB 중 13 KB만 남겼다.
  2. 사전 양자화에서 메모리 여유를 낭비하거나 로드 실패를 겪던 문제를 피하고, 브라우저에서 내 메모리에 맞는 모델을 품질 순으로 보여 준다.
  3. llama.cpp가 PATH에 있어야 하고, Homebrew 설치 시 함께 들어오며, 리포지토리를 클론한 뒤 cargo install --path .이 필요하다.

쇼호른은 실제 사용 가능한 메모리에 맞춰 언어 모델을 양자화하는 도구로 소개됐다.

원문Hacker News · Show HN: Shoehorn – Quantize any model down to run on your machine같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기