애플 실리콘 기반 로컬 LLM 에이전트 'Laya MLX' 공개
mizorewww/laya-mlx
GitHubLLM이 일반 텍스트 생성 대신 선택지, 점수 등 구조화된 결정을 내리도록 돕는 'Laya' 시스템의 MLX 포트가 공개되었습니다.
- PyTorch나 클라우드 API 없이 Apple Silicon에서 완전히 로컬로 구동되며, 다국어 질문에 대해 7.4ms 수준의 낮은 지연 시간을 기록했습니다.
- LLM 출력을 단순 텍스트가 아닌 정형화된 데이터(선택/점수)로 받아 신뢰성 높은 애플리케이션 개발에 핵심적인 역할을 합니다.
- 다만 이 포트는 독립적으로 구현된 버전이며, 일반 대화보다는 구조적 결정에 특화되어 있고 성능은 하드웨어 및 질문 유형에 따라 달라집니다.
시스템 Laya는 일반적인 텍스트 생성 대신 선택지(choice), 점수(score) 또는 확률(noul)과 같은 구조화된 결정을 내리는 데 특화되어 있습니다. 이는 소프트웨어가 필요한 정형화된 출력을 제공하여 신뢰성 높은 애플리케이션 개발에 활용될 수 있습니다. 이 시스템은 PyTorch나 클라우드 없이 Apple Silicon 환경에서 MLX를 사용하여 완전히 로컬로 구동되는 것이 특징입니다.
Laya MLX는 뛰어난 성능을 보여주는데, 예를 들어 다국어 체크포인트 사용 시 단일 질문에 대한 평균 종단 간 지연 시간은 7.4ms 수준으로 측정되었습니다. M3 Max 환경에서 테스트된 결과에 따르면, 멀티링구얼 모델의 경우 50개 질문 처리량(throughput)이 395.0 q/s를 기록했습니다. 이러한 성능은 준비, 화, 추론 및 결과 포맷팅 시간을 포함하며, 로딩 시간은 제외된 수치입니다.
해당 구현체는 원본 프로젝트의 독립적인 MLX 포트이며, 구조적 결정에 초점을 맞추고 있습니다. 사용자는 `laya-mlx`를 통해 체크포인트를 다운로드하고 로드할 수 있으며, 시스템은 영어(421M)와 다국어(322M) 등 다양한 모델을 지원합니다. 이 포트는 원본 , 프롬프트 형식 지정 및 출력 스키마를 유지하며, 언어 라우팅 기능을 통해 비영어권 문자가 감지될 경우 다국어 체크포인트로 연결하는 기능도 제공합니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
- 프롬프트
- AI에게 주는 지시나 질문 글.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.