모델 도구
Show HN: Running 104GB Qwen3.8-Flash-Next on 48GB Mac with at ~12 tok/s
HNHacker News
대용량 언어 모델(LLM)을 메모리 용량이 부족한 기기에서도 구동할 수 있는 'slotstream' 기술이 공개되었습니다. 이 도구는 거대한 가중치 파일을 SSD에서 스트리밍하여 제한된 RAM 환경에서 모델을 실행합니다.
세 줄 요약
- 48GB Mac 환경에서 따뜻하게 로드 시 초당 약 12 토큰의 속도를 보이며, 메모리 사용량을 자동으로 최적화하여 시스템 자원을 효율적으로 관리하는 것이 핵심입니다.
- 고성능 LLM을 최고 사양 서버가 아닌 일반 소비자용 노트북에서도 구동 가능하게 함으로써 AI 개발 및 활용의 접근성을 크게 높여줄 것으로 기대됩니다.
- 모델 가중치 파일 때문에 최소 110GB 이상의 여유 디스크 공간이 필수적이며, 긴 프롬프트는 첫 토큰 생성 전 처리 시간이 길어지는 단점이 있습니다.
대용량 언어 모델(LLM)을 메모리 용량이 부족한 기기에서도 구동할 수 있는 'slotstream' 기술이 공개되었습니다. 이 도구는 거대한 가중치 파일을 SSD에서 스트리밍하여 제한된 RAM 환경에서 모델을 실행합니다.