거대 AI 모델을 개인 장비에서 구동하는 추론 엔진 Colibrì
JustVugg/colibri
GitHubColibrì는 744B~2.8T 규모의 거대 MoE(Mixture-of-Experts) 모델을 소비자급 및 이종 하드웨어에서 구동할 수 있게 하는 혁신적인 추론 엔진입니다.
- VRAM, RAM, 저장 공간을 하나의 다단계 메모리 계층으로 취급하며, 필요한 전문가 가중치만 필요 시점에 불러와 사용하는 방식으로 효율성을 극대화했습니다.
- 막대한 컴퓨팅 자원이 요구되던 최신 거대 AI 모델들을 고가의 클라우드나 전문 서버 없이도 개인 장비에서 구동 가능하게 하여 접근성을 높입니다.
- 연구 플랫폼 성격이 강하므로, 성능은 하드웨어 및 워크로드 조건에 따라 측정 기반으로 검증해야 하며 속도 보장(SLA)은 없습니다.
Colibrì는 744B~2.8T 규모의 거대 (Mixture-of-Experts) 모델을 소비자 및 이종 하드웨어 환경에서도 구동할 수 있도록 설계된 혁신적인 추론 엔진입니다. 이 엔진은 VRAM, RAM, 저장 공간을 하나의 다단계 메모리 계층으로 취급하는 것이 핵심이며, 이를 통해 대규모 모델이 희소한 고성능 클라우드 하드웨어에 덜 의존하고 운영 비용을 낮추는 것을 목표로 합니다.
Colibrì의 작동 방식은 (weights)에 대한 JIT(Just-In-Time) 컴파일러와 유사합니다. 거대 모델의 모든 를 메모리에 올리는 대신, 라우터가 특정 처리를 위해 필요하다고 판단하는 전문가들만 필요한 시점에 스트리밍하여 사용합니다. 이 과정에서 VRAM/RAM/NVMe 등 다양한 저장 계층을 활용하며, 측정된 라우팅 히트를 기반으로 어떤 전문가가 어느 메모리 계층에 배치될지 결정합니다.
이 엔진은 GLM-5.2/5.3 (744B), Kimi K3 (2.8T) 등 다양한 최신 MoE 모델을 지원하며, 단순한 속도 주장보다는 엔드투엔드 측정(처리량, 지연 시간, 메모리, 비용)에 중점을 둡니다. Colibrì는 사용자가 를 통해 인텔리전스를 임대하는 것이 아니라, 직접 모델을 '소유'하고 프로빙하며 개선할 수 있는 접근성을 제공합니다.
용어 풀이
- MoE
- 여러 하위 모델 중 일부만 골라 계산하는 구조. 모델이 커도 실행 비용을 줄일 수 있어요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.