Apple Silicon 기반 로컬 LLM, 구조화된 의사결정 처리 성능 공개
mizorewww/laya-mlx
GitHubLaya-MLX는 Apple Silicon 환경에 최적화된 로컬 AI 모델로, 일반적인 텍스트 생성 대신 분류나 점수 부여 같은 구조화된 의사결정(Typed Decisions)을 빠르고 독립적으로 처리하는 것이 핵심입니다.
- PyTorch나 클라우드 API 없이 MLX 프레임워크를 활용하여 온디바이스 구동이 가능하며, 다국어 환경에서도 7ms대의 낮은 지연 시간과 높은 처리량으로 효율성을 입증했습니다.
- LLM의 범용적인 출력 방식에서 벗어나 정형화된 작업에 특화되어 있어, 비즈니스 워크플로우 자동화나 시스템 통합 시 예측 가능하고 안정적인 결과를 제공합니다.
- 본 포트는 원 개발사의 공식 출시는 아니며 Apple Silicon 환경에 최적화된 독립적인 MLX 구현체이므로, 사용 전 하드웨어 사양 및 MLX 프레임워크 요구사항을 반드시 확인해야 합니다.
Laya-MLX는 일반적인 텍스트 생성 대신 선택지(choice), 점수(score) 부여 등 구조화된 의사결정(Typed Decisions)에 특화된 모델입니다. 이 모델은 PyTorch나 클라우드 같은 외부 종속성 없이 MLX 프레임워크를 활용하여 Apple Silicon 환경에서 로컬로 추론이 가능합니다. 이는 구동을 목표로 하며, 사용자는 `laya-mlx` 패키지를 통해 쉽게 접근할 수 있습니다.
M3 Max 환경에서 테스트된 성능 지표에 따르면, 짧은 영어 입력에 대한 중앙값 종단 간 지연 시간(median end-to-end)은 13.42 ms를 기록했으며, 다국어 체크포인트 사용 시에는 7.39 ms로 측정되었습니다. 또한, 50개 질문을 처리하는 테스트에서는 멀티링구얼 모델의 경우 395.0 q/s에 달하는 높은 처리량을 보였습니다.
Laya는 텍스트 생성 방식에서 벗어나, 선택지(choice)에 대한 확률 분포, 순서화된 루브릭 점수(score), 또는 명제에 대한 P(true)와 같은 정형화된 출력을 이방향 포워드 패스 방식으로 처리합니다. 개발진은 본 구현체가 원본 프로젝트의 공식 출시가 아닌 독립적인 MLX 포트임을 밝히며, 사용 시 하드웨어 사양 및 MLX 프레임워크 요구사항을 확인해야 한다고 안내했습니다.
용어 풀이
- 오픈 웨이트
- 학습된 가중치를 공개해 누구나 내려받아 쓸 수 있게 한 모델. 학습 데이터까지 공개한다는 뜻은 아니에요.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
- 온디바이스
- 서버를 거치지 않고 휴대폰이나 PC 안에서 직접 돌아가는 AI.