애플 실리콘 기반 로컬 LLM 추론 엔진 'Splash' 소개 — AI 생성 일러스트AI 일러스트
개발도구 도구

애플 실리콘 기반 로컬 LLM 추론 엔진 'Splash' 소개

incoai/splash

GitHub9월 23일 업데이트 · 3분

애플 실리콘 환경에 최적화된 로컬 LLM 추론 엔진 'Splash'가 출시되어, 맥북에서 다양한 대규모 언어 모델을 효율적으로 구동할 수 있게 했습니다.

세 줄 요약GitHub 원문 기반
  1. 모델별로 커널, 초안 모델(draft model), 메모리 계획을 특화하여 설계함으로써, 기존 대비 압도적인 처리 속도와 최적의 성능을 제공합니다.
  2. 오픈AI 및 앤트로픽과 호환되는 표준 API를 지원하며, 복잡한 설정 없이 Mac 환경 내에서 다양한 코딩 에이전트와 연동됩니다.
  3. 구동을 위해서는 최소 Apple M3 이상의 Mac과 36GB 이상의 통합 메모리가 필수적이며, 모델은 Splash 전용 패키지 형식을 사용합니다.

Splash는 애플 실리콘 환경에 최적화된 로컬 추론 엔진으로, 코딩 및 오픈AI 또는 앤트로픽과 호환되는 클라이언트에 다양한 모델을 제공합니다. 이 엔진은 각 모델별로 커널, 초안 모델(draft model), 메모리 계획 등을 특화하여 설계되었기 때문에 높은 처리 속도를 자랑합니다. 예를 들어, 48 GB M5 Pro 환경에서 Qwen3.8-27B를 디코드할 때 이전 세대 엔진 대비 2배의 속도를 보였으며, 32K 컨텍스트 캐시 사용 시 첫 을 282ms 만에 반환하는 성능이 측정되었습니다.

Splash를 구동하기 위해서는 최소 Apple M3 이상의 Mac과 macOS 26.4 이상 버전이 필요하며, 36 GB의 통합 메모리(최소)가 요구됩니다. 설치는 Homebrew를 통해 진행할 수 있으며, `splash serve --model incoai/Qwen3.8-27B-Splash` 명령어를 사용하여 서버를 시작합니다. 초기 실행 시 모델 패키지를 다운로드하고 사용 가능한 메모리를 확인한 후, 127.0.0.1:8000에서 서비스가 시작됩니다.

이 엔진은 OpenAI Chat Completions (`/v1/chat/completions`) 및 Anthropic Messages (`/v1/messages`) 등 표준 를 지원하며 스트리밍, 도구 호출, JSON Schema 출력 등을 처리할 수 있습니다. 서버 실행 시 `--kv-format` 플래그를 사용하여 저장 방식을 `int8` (기본값) 또는 `bf16`으로 지정하여 메모리 최적화가 가능합니다. 또한, `--max-context 256K`와 같은 옵션을 통해 최대 컨텍스트 제한을 설정할 수 있습니다.

용어 풀이

에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
API
프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
KV 캐시
모델이 앞에서 계산한 값을 저장해 두고 다음 토큰을 만들 때 다시 쓰는 메모리. 입력이 길수록 커져요.
원문GitHub · incoai/splash같은 주제 가이드 · 바로 써 보기오류가 나면 터미널 출력째 묻기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기GitHub