기기별 맞춤형 성능을 자랑하는 오픈소스 LLM 추론 엔진
Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agents
에이전트 구동용 오픈소스 추론 엔진 'Magnitude'는 사용자 기기 사양에 맞춰 모델 커널을 자체 최적화하는 것이 핵심입니다.
이 엔진은 사용자의 기기 사양에 맞춰 최적화되고 모든 데이터가 로컬에서 처리되어, 빠르면서도 높은 수준의 개인 정보 보호를 보장하는 AI 구동 환경을 제공해요.
- 자체 튜닝 과정을 거치며 기존 범용 엔진 대비 최대 2배의 속도 향상을 보여주며, Apple Silicon부터 CPU까지 광범위한 환경에서 작동합니다.
- 모든 데이터 처리와 프롬프트가 로컬 환경에서만 이루어져 높은 수준의 개인 정보 보호를 보장하며, 기존 에이전트들과 쉽게 연동됩니다.
- Apache 2.0 기반의 완전한 오픈소스로, 별도의 최소 사양 제한 없이 일반 CPU 환경에서도 구동 가능하여 접근성이 매우 높습니다.
Magnitude는 를 위한 추론 엔진으로, 사용자의 특정 하드웨어에 맞춰 자체적으로 최적화됩니다. 이 엔진은 모델 실행 전에 커널을 기기에서 컴파일하고 튜닝하는 과정을 거치며, 이를 통해 일반적인 범용 엔진 대비 최대 2배까지 빠른 속도를 구현할 수 있습니다.
이 엔진은 Apple Silicon, NVIDIA, AMD 는 물론 순수 CPU 환경에서도 작동하며 macOS, Linux, Windows를 지원합니다. 성능 면에서는 Metal에서 92% 더 빠른 디코딩 속도와 에서 19%의 향상을 보여주며, 세션 간 캐시 공유 기능을 통해 지연을 방지하고 에이전트당 메모리 사용량을 줄입니다.
Magnitude는 Pi, OpenCode, Hermes, Codex 등 사용자가 이미 사용하는 다양한 에이전트들과 원클릭으로 연결됩니다. 또한 모든 , 파일, 모델은 기기 내에 유지되므로 인터넷 연결 없이도 작동하며 데이터가 외부로 유출되지 않아 높은 수준의 개인 정보 보호를 보장합니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 오픈소스
- 소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
- GPU
- 많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
- CUDA
- 엔비디아 GPU에서 계산 프로그램을 돌리게 해 주는 개발 플랫폼.
- 프롬프트
- AI에게 주는 지시나 질문 글.
이 엔진은 어떻게 속도를 높일 수 있나요?
모델 실행 전에 사용자의 특정 하드웨어에 맞춰 커널을 기기에서 컴파일하고 튜닝하는 과정을 거치기 때문이에요. 이를 통해 일반적인 범용 엔진 대비 최대 2배까지 빠른 속도를 구현할 수 있어요.
데이터는 어디에서 처리되나요?
모든 프롬프트, 파일, 그리고 모델은 사용자의 기기 내에 유지돼요. 따라서 인터넷 연결 없이도 작동하며 데이터가 외부로 유출되지 않아 높은 수준의 개인 정보 보호를 보장해요.
어떤 환경에서 사용할 수 있나요?
Apple Silicon, NVIDIA, AMD GPU 같은 전문 그래픽 카드뿐만 아니라 순수 CPU 환경에서도 작동해요. 또한 macOS, Linux, Windows 등 다양한 운영체제를 지원합니다.