Core ML과 ANE을 활용한 로컬 LLM 추론 기술 — AI 생성 일러스트AI 일러스트
개발도구 도구

Core ML과 ANE을 활용한 로컬 LLM 추론 기술

mizorewww/laya-coreml

GitHub9월 22일 업데이트 · 3분

Apple Silicon의 Core ML 및 Neural Engine(ANE)을 활용하여, 클라우드 연결 없이 기기 자체에서 작동하는 개방형 의사결정 모델입니다.

세 줄 요약GitHub 원문 기반
  1. 기존 MLX 기반 모델 대비 압도적인 에너지 효율성을 보여주며, 전력 소모와 추론 속도를 크게 개선한 점이 가장 큰 강점입니다.
  2. 이는 LLM 구동에 있어 클라우드 의존도를 낮추고, 온디바이스 AI의 실용성과 에너지 효율을 극대화하는 방안을 제시합니다.
  3. 다만, 기록된 성능 지표는 주로 단일 질문 또는 짧은 컨텍스트 기반의 테스트 결과이므로, 장문 처리 등 전반적인 사용 환경을 고려해야 합니다.

laya-coreml은 Apple Silicon 환경에서 Core ML 및 Neural Engine(ANE)을 사용하여 작동하는 개방형 의사결정 모델입니다. 이 시스템은 텍스트 생성 대신, 명시적인 플래너 기능과 가시적인 사이클 안전 계층을 통해 게임 플레이와 같은 상황에서 로컬로 결정을 내립니다. 예를 들어, 스네이크 게임 시연에서는 확률(probabilities), 점수(score), 길이 등을 표시하며, 기록된 Core ML 실행 결과를 1배속으로 재현할 수 있습니다.

성능 측정 결과에 따르면, 단일 질문 처리 시 M3 Max 환경에서 Core ML ANE FP16은 P50/P95가 각각 4.98 ms / 5.31 ms를 기록했습니다. 특히 에너지 효율 측면에서 Compiled MLX FP16 대비 2.78배의 전력 소모 감소(System energy / decision)를 보였으며, W8 팔레트 변형 모델은 3.19배의 에너지 개선을 달성한 것으로 보고되었습니다.

사용자는 `pip install 'laya-coreml[demo]'` 명령어를 통해 라이브러리를 설치하고, 허깅페이스에서 필요한 를 다운로드하여 오프라인으로 추론할 수 있습니다. 다만, ANE 번들은 질문, 옵션 및 상태를 포함하여 총 96 의 제한이 있어 더 긴 요청에는 용량 오류가 발생할 수 있으며, 일반 목적의 모델은 1024 토큰을 지원합니다.

용어 풀이

가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
원문GitHub · mizorewww/laya-coreml같은 주제 가이드 · 바로 써 보기오류가 나면 터미널 출력째 묻기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기GitHub