MoE 모델 추론 효율을 높인 오픈소스 프레임워크 Edge0 — AI 생성 일러스트
개발도구 도구

MoE 모델 추론 효율을 높인 오픈소스 프레임워크 Edge0

Edge0-AI/Edge0

GitHub9월 11일 발표 · 3분

MoE(Mixture-of-Experts) 모델의 추론 효율성을 극대화한 오픈소스 프레임워크입니다. SSD 전문가 오프로드, Recover-LoRA, 사전 라우팅 예측 기술을 통합하여 스트리밍 처리를 지원합니다.

세 줄 요약GitHub 원문 기반
  1. 전문가 가중치를 필요할 때만 불러와 메모리 사용량을 제한하고, 다음 라우팅을 미리 예측해 디코딩 처리량을 최대 59%까지 향상시키는 것이 핵심입니다.
  2. 대규모 언어 모델의 추론 성능을 획기적으로 개선하여, 적은 메모리 자원과 높은 처리량으로 고성능 AI 서비스를 구현할 수 있게 합니다.
  3. 현재 MLX 백엔드는 Apple Silicon에 최적화되어 있으며, 사용 시에는 기본 모델 외 LoRA 및 사전 라우팅 어댑터가 필수적으로 함께 구성되어야 합니다.

Edge0은 스트리밍 (Mixture-of-Experts) 추론 프레임워크입니다. 이 프레임워크는 SSD 전문가 오프로드, Recover-, 그리고 사전 라우팅 예측이라는 검증된 조합을 확장 가능한 형태로 구현했습니다. 백엔드는 설계상 격리되어 있어 현재 MLX 백엔드가 Apple Silicon에서 작동하며, 등 다른 플랫폼도 동일한 핵심 추상화에 플러그인 방식으로 추가될 수 있습니다.

Edge0의 주요 기술적 특징은 전문가 를 저장 공간에서 필요할 때 스트리밍하는 SSD 전문가 오프로드 방식입니다. 이 방식을 통해 피크 메모리는 활성 세트에 의해 제한되며, 모델 수에 비례하지 않습니다. 또한, 사전 라우팅(Prerouter) 헤드는 다음 단계의 전문가 경로를 예측하여 디코딩 처리량을 최대 +59%까지 향상시키는 역할을 합니다.

이 프레임워크는 두 가지 모델 티어(`edge0-35b`와 `edge0-8b`)를 제공합니다. 각 티어는 릴리스된 체크포인트, 학습된 LoRA 어댑터, 그리고 학습된 사전 라우팅 헤드가 하나의 단위로 구성되어 배포됩니다. 예를 들어, `edge0-35b`는 4비트, 40개 레이어, 256개의 전문가를 가지며, 이 모든 요소가 함께 패키징되어 바로 실행 가능한 모델을 만듭니다.

용어 풀이

오픈소스
소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
MoE
여러 하위 모델 중 일부만 골라 계산하는 구조. 모델이 커도 실행 비용을 줄일 수 있어요.
LoRA
모델 전체 대신 작은 추가 부분만 학습시켜 적은 비용으로 미세 조정하는 기법.
CUDA
엔비디아 GPU에서 계산 프로그램을 돌리게 해 주는 개발 플랫폼.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
원문GitHub · Edge0-AI/Edge0
원문 보기GitHub