35B MoE 모델을 3 GiB 메모리로 구동하는 Edge0 프레임워크 — AI 생성 일러스트AI 일러스트
모델 도구

35B MoE 모델을 3 GiB 메모리로 구동하는 Edge0 프레임워크

Edge0/Edge0-35B-A3B-preview

Hugging Face발표일 미상 · 3분

350억 개 매개변수 규모의 MoE LLM을 'edge0' 프레임워크로 구현하여, 대용량 모델을 단 3 GiB 미만의 활성 메모리로 구동하는 것이 핵심입니다.

세 줄 요약Hugging Face 원문 기반
  1. 'SSD 전문가 오프로드'와 '사전 라우팅 예측(Prerouter)' 기술을 활용해, 모든 가중치를 메모리에 올리지 않고도 고성능 추론이 가능합니다.
  2. 메모리 제약이 큰 온디바이스 환경에서도 고성능 LLM 사용을 가능하게 하여, 엣지 AI 서비스 상용화에 중요한 전환점이 될 전망입니다.
  3. 현재는 프리뷰 단계이며, 에이전트 기능이나 복잡한 작업에는 최적화가 부족하고, MLX 백엔드는 애플 실리콘에 초점을 맞추고 있습니다.

Edge0-35b-a3b는 35B 규모의 (MoE) 으로, 활성 메모리 3 GiB 미만에서 구동이 가능합니다. 이 모델은 모든 를 RAM에 올리지 않고도 작동하는 '폰급(phone-class)' 메모리를 활용하며, 상호작용적인 사용을 위해 초당 15 디코딩 속도를 제공합니다. 이는 저장 공간의 가중치는 그대로 유지하고 필요한 전문가만 온디맨드로 스트리밍하여 활성 가중치만을 RAM에 로드하는 방식 덕분입니다.

이러한 효율성은 세 가지 핵심 메커니즘을 통해 구현됩니다. 첫째, SSD 전문가 오프로드를 적용하여 전문가 가중치를 저장 공간에서 필요할 때만 가져옵니다. 둘째, 사전 라우팅 예측(Prerouter)은 순방향 과정 중 전문가 로딩 지연을 방지하여 디코딩 처리량을 높입니다. 셋째, Recover- 기법을 사용하여 int4 기반 모델에 LoRA 어댑터를 학습시켜 양자화로 인한 성능 손실을 복구합니다.

벤치마크 결과에 따르면, edge0 파이프라인(int4 + 어댑터)은 FP16 기준 대비 평균 3.9 포인트의 작은 손실을 보였습니다. 다만 현재는 프리뷰 단계이며, 에이전트 작업이나 다단계 계획에는 아직 최적화가 부족합니다. 또한 MLX 백엔드는 애플 실리콘에 초점을 맞추고 있으며, 장문 컨텍스트 사용 시 KV 캐시로 인해 메모리가 증가할 수 있습니다.

용어 풀이

Mixture of Experts
여러 하위 모델 중 일부만 골라 계산하는 구조. 모델이 커도 실행 비용을 줄일 수 있어요.
LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
LoRA
모델 전체 대신 작은 추가 부분만 학습시켜 적은 비용으로 미세 조정하는 기법.
양자화
모델 숫자의 정밀도를 낮춰 크기와 메모리 사용을 줄이는 기법. 품질이 조금 떨어질 수 있어요.
원문Hugging Face · Edge0/Edge0-35B-A3B-preview같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기