Edge0: 스트리밍 MoE 추론을 위한 오픈소스 프레임워크
Edge0-AI/Edge0
GitHubEdge0은 대규모 언어 모델(LLM)을 위한 오픈 소스 스트리밍 MoE 추론 프레임워크입니다.
- SSD 전문가 오프로드와 사전 라우팅 예측 기술을 결합하여 메모리 사용량을 최적화하고 디코딩 처리량(throughput)을 최대 59%까지 향상시킵니다.
- 양자화된 모델에서도 원본 대비 성능 저하가 적으며, Apple Silicon 등 소비자급 하드웨어에서 고성능 LLM 추론이 가능합니다.
- 현재 MLX 백엔드는 Apple Silicon을 지원하며, 최적의 성능 구현을 위해서는 LoRA 및 사전 라우팅 어댑터 사용이 필수입니다.
Edge0은 (LLM)을 위한 스트리밍 (MoE) 추론 프레임워크입니다. 이 프레임워크는 'SSD 전문가 오프로드', 'Recover-', 그리고 '사전 라우팅 예측'이라는 세 가지 기술을 결합한 검증된 방식을 확장 가능한 형태로 구현했습니다. 백엔드는 설계상 격리되어 있어, 현재 MLX 백엔드는 Apple Silicon에서 작동하며 등 다른 플랫폼도 동일한 핵심 추상화에 플러그인 방식으로 추가할 수 있습니다.
Edge0은 두 가지 모델 티어(`edge0-35b`와 `edge0-8b`)를 제공합니다. 이들은 각각 4비트 된 체크포인트, 학습된 LoRA 어댑터, 그리고 사전 라우팅 헤드로 구성되어 하나의 단위로 작동합니다. 예를 들어, `edge0-35b`는 4비트, 40개 레이어, 256개의 전문가를 가지며, `edge0-8b`는 4비트, 24개 레이어, 128개의 전문가를 가집니다. 이 모델들은 기본적으로 Qwen3.5-MoE나 Ling 3.0 같은 오픈 희소 MoE 기반 모델을 사용합니다.
이 프레임워크의 핵심 기술 중 하나는 SSD(Storage-Side Decoding) 전문가 오프로드입니다. 이를 통해 피크 메모리 사용량이 활성 세트에 의해 제한되어 파라미터 개수에 구애받지 않습니다. 또한, 사전 라우팅 헤드는 다음 단계의 전문가 경로를 예측하여 순방향 과정과 전문가 로드를 겹치게 함으로써 디코딩 처리량을 최대 +59%까지 향상시킬 수 있습니다. 성능 테스트 결과에 따르면, `edge0-8b` 모델은 Mac mini M4 Pro 환경에서 23.9–25.3 tok/s의 디코드 속도를 보였습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 오픈 소스
- 소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
- Mixture-of-Experts
- 여러 하위 모델 중 일부만 골라 계산하는 구조. 모델이 커도 실행 비용을 줄일 수 있어요.
- LoRA
- 모델 전체 대신 작은 추가 부분만 학습시켜 적은 비용으로 미세 조정하는 기법.
- CUDA
- 엔비디아 GPU에서 계산 프로그램을 돌리게 해 주는 개발 플랫폼.
- 양자화
- 모델 숫자의 정밀도를 낮춰 크기와 메모리 사용을 줄이는 기법. 품질이 조금 떨어질 수 있어요.