애플 실리콘 기반 로컬 LLM 에이전트 'Laya MLX' 공개 — AI 생성 일러스트AI 일러스트
AI 에이전트 도구

애플 실리콘 기반 로컬 LLM 에이전트 'Laya MLX' 공개

mizorewww/laya-mlx

GitHub9월 22일 업데이트 · 3분

LLM이 일반 텍스트 생성 대신 선택지, 점수 등 구조화된 결정을 내리도록 돕는 'Laya' 시스템의 MLX 포트가 공개되었습니다.

세 줄 요약GitHub 원문 기반
  1. PyTorch나 클라우드 API 없이 Apple Silicon에서 완전히 로컬로 구동되며, 다국어 질문에 대해 7.4ms 수준의 낮은 지연 시간을 기록했습니다.
  2. LLM 출력을 단순 텍스트가 아닌 정형화된 데이터(선택/점수)로 받아 신뢰성 높은 애플리케이션 개발에 핵심적인 역할을 합니다.
  3. 다만 이 포트는 독립적으로 구현된 버전이며, 일반 대화보다는 구조적 결정에 특화되어 있고 성능은 하드웨어 및 질문 유형에 따라 달라집니다.

시스템 Laya는 일반적인 텍스트 생성 대신 선택지(choice), 점수(score) 또는 확률(noul)과 같은 구조화된 결정을 내리는 데 특화되어 있습니다. 이는 소프트웨어가 필요한 정형화된 출력을 제공하여 신뢰성 높은 애플리케이션 개발에 활용될 수 있습니다. 이 시스템은 PyTorch나 클라우드 없이 Apple Silicon 환경에서 MLX를 사용하여 완전히 로컬로 구동되는 것이 특징입니다.

Laya MLX는 뛰어난 성능을 보여주는데, 예를 들어 다국어 체크포인트 사용 시 단일 질문에 대한 평균 종단 간 지연 시간은 7.4ms 수준으로 측정되었습니다. M3 Max 환경에서 테스트된 결과에 따르면, 멀티링구얼 모델의 경우 50개 질문 처리량(throughput)이 395.0 q/s를 기록했습니다. 이러한 성능은 준비, 화, 추론 및 결과 포맷팅 시간을 포함하며, 로딩 시간은 제외된 수치입니다.

해당 구현체는 원본 프로젝트의 독립적인 MLX 포트이며, 구조적 결정에 초점을 맞추고 있습니다. 사용자는 `laya-mlx`를 통해 체크포인트를 다운로드하고 로드할 수 있으며, 시스템은 영어(421M)와 다국어(322M) 등 다양한 모델을 지원합니다. 이 포트는 원본 , 프롬프트 형식 지정 및 출력 스키마를 유지하며, 언어 라우팅 기능을 통해 비영어권 문자가 감지될 경우 다국어 체크포인트로 연결하는 기능도 제공합니다.

용어 풀이

LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
API
프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
프롬프트
AI에게 주는 지시나 질문 글.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
원문GitHub · mizorewww/laya-mlx같은 주제 가이드 · 바로 써 보기매일 아침 소식, 예약 작업으로 받기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기GitHub