거대 AI 모델을 개인 장비에서 구동하는 추론 엔진 Colibrì — AI 생성 일러스트
개발도구 도구

거대 AI 모델을 개인 장비에서 구동하는 추론 엔진 Colibrì

JustVugg/colibri

GitHub9월 14일 발표 · 2분

Colibrì는 744B~2.8T 규모의 거대 MoE(Mixture-of-Experts) 모델을 소비자급 및 이종 하드웨어에서 구동할 수 있게 하는 혁신적인 추론 엔진입니다.

세 줄 요약GitHub 원문 기반
  1. VRAM, RAM, 저장 공간을 하나의 다단계 메모리 계층으로 취급하며, 필요한 전문가 가중치만 필요 시점에 불러와 사용하는 방식으로 효율성을 극대화했습니다.
  2. 막대한 컴퓨팅 자원이 요구되던 최신 거대 AI 모델들을 고가의 클라우드나 전문 서버 없이도 개인 장비에서 구동 가능하게 하여 접근성을 높입니다.
  3. 연구 플랫폼 성격이 강하므로, 성능은 하드웨어 및 워크로드 조건에 따라 측정 기반으로 검증해야 하며 속도 보장(SLA)은 없습니다.

Colibrì는 744B~2.8T 규모의 거대 (Mixture-of-Experts) 모델을 소비자 및 이종 하드웨어 환경에서도 구동할 수 있도록 설계된 혁신적인 추론 엔진입니다. 이 엔진은 VRAM, RAM, 저장 공간을 하나의 다단계 메모리 계층으로 취급하는 것이 핵심이며, 이를 통해 대규모 모델이 희소한 고성능 클라우드 하드웨어에 덜 의존하고 운영 비용을 낮추는 것을 목표로 합니다.

Colibrì의 작동 방식은 (weights)에 대한 JIT(Just-In-Time) 컴파일러와 유사합니다. 거대 모델의 모든 를 메모리에 올리는 대신, 라우터가 특정 처리를 위해 필요하다고 판단하는 전문가들만 필요한 시점에 스트리밍하여 사용합니다. 이 과정에서 VRAM/RAM/NVMe 등 다양한 저장 계층을 활용하며, 측정된 라우팅 히트를 기반으로 어떤 전문가가 어느 메모리 계층에 배치될지 결정합니다.

이 엔진은 GLM-5.2/5.3 (744B), Kimi K3 (2.8T) 등 다양한 최신 MoE 모델을 지원하며, 단순한 속도 주장보다는 엔드투엔드 측정(처리량, 지연 시간, 메모리, 비용)에 중점을 둡니다. Colibrì는 사용자가 를 통해 인텔리전스를 임대하는 것이 아니라, 직접 모델을 '소유'하고 프로빙하며 개선할 수 있는 접근성을 제공합니다.

용어 풀이

MoE
여러 하위 모델 중 일부만 골라 계산하는 구조. 모델이 커도 실행 비용을 줄일 수 있어요.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
매개변수
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
API
프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
원문GitHub · JustVugg/colibri
원문 보기GitHub