애플 실리콘 기반 로컬 LLM 추론 엔진 'Splash' 소개
incoai/splash
GitHub애플 실리콘 환경에 최적화된 로컬 LLM 추론 엔진 'Splash'가 출시되어, 맥북에서 다양한 대규모 언어 모델을 효율적으로 구동할 수 있게 했습니다.
- 모델별로 커널, 초안 모델(draft model), 메모리 계획을 특화하여 설계함으로써, 기존 대비 압도적인 처리 속도와 최적의 성능을 제공합니다.
- 오픈AI 및 앤트로픽과 호환되는 표준 API를 지원하며, 복잡한 설정 없이 Mac 환경 내에서 다양한 코딩 에이전트와 연동됩니다.
- 구동을 위해서는 최소 Apple M3 이상의 Mac과 36GB 이상의 통합 메모리가 필수적이며, 모델은 Splash 전용 패키지 형식을 사용합니다.
Splash는 애플 실리콘 환경에 최적화된 로컬 추론 엔진으로, 코딩 및 오픈AI 또는 앤트로픽과 호환되는 클라이언트에 다양한 모델을 제공합니다. 이 엔진은 각 모델별로 커널, 초안 모델(draft model), 메모리 계획 등을 특화하여 설계되었기 때문에 높은 처리 속도를 자랑합니다. 예를 들어, 48 GB M5 Pro 환경에서 Qwen3.8-27B를 디코드할 때 이전 세대 엔진 대비 2배의 속도를 보였으며, 32K 컨텍스트 캐시 사용 시 첫 을 282ms 만에 반환하는 성능이 측정되었습니다.
Splash를 구동하기 위해서는 최소 Apple M3 이상의 Mac과 macOS 26.4 이상 버전이 필요하며, 36 GB의 통합 메모리(최소)가 요구됩니다. 설치는 Homebrew를 통해 진행할 수 있으며, `splash serve --model incoai/Qwen3.8-27B-Splash` 명령어를 사용하여 서버를 시작합니다. 초기 실행 시 모델 패키지를 다운로드하고 사용 가능한 메모리를 확인한 후, 127.0.0.1:8000에서 서비스가 시작됩니다.
이 엔진은 OpenAI Chat Completions (`/v1/chat/completions`) 및 Anthropic Messages (`/v1/messages`) 등 표준 를 지원하며 스트리밍, 도구 호출, JSON Schema 출력 등을 처리할 수 있습니다. 서버 실행 시 `--kv-format` 플래그를 사용하여 저장 방식을 `int8` (기본값) 또는 `bf16`으로 지정하여 메모리 최적화가 가능합니다. 또한, `--max-context 256K`와 같은 옵션을 통해 최대 컨텍스트 제한을 설정할 수 있습니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
- KV 캐시
- 모델이 앞에서 계산한 값을 저장해 두고 다음 토큰을 만들 때 다시 쓰는 메모리. 입력이 길수록 커져요.