개발도구 도구
거대 AI 모델을 소비자 하드웨어에서 구동하는 추론 엔진 'Colibrì'
JustVugg/colibri
GitHubColibrì는 744B~2.8T 규모의 거대 MoE 모델을 일반 소비자급 및 이종 하드웨어에서 구동하는 혁신적인 추론 엔진입니다.
세 줄 요약
- VRAM, RAM, 저장 장치(NVMe 등)를 하나의 다층적 메모리 계층으로 통합하여, 모든 가중치를 고속 메모리에 올리지 않고도 필요한 지식만 스트리밍 처리합니다.
- 값비싼 클라우드 API에 의존하지 않고, 거대 AI 모델을 로컬 환경에서 직접 구동하고 성능을 측정할 수 있게 하여 접근성을 극대화합니다.
- 이 엔진은 연구 플랫폼 성격이 강하며, 성능 개선은 재현 가능한 종단 간 측정과 엄격한 검증을 거쳐야 한다는 점을 참고해야 합니다.
Colibrì는 744B부터 2.8T 에 이르는 거대한 (MoE) 모델들을 일반 소비자급 및 이종 하드웨어 환경에서 구동할 수 있도록 설계된 추론 엔진입니다. 이 엔진의 핵심은 VRAM, RAM, 그리고 저장 장치(NVMe 등)를 하나의 다층적 메모리 계층으로 취급하는 것입니다. 이를 통해 모든 를 고속 메모리에 상주시키지 않고도 필요한 지식만 스트리밍하여 모델을 구동할 수 있습니다.
Colibrì는 가중치에 대한 JIT(Just-In-Time) 컴파일러와 유사하게 작동합니다. 파라미터들을 단순히 '상주하는 상태'로 보는 것이 아니라, 라우터가 필요하다고 증명하는 순간마다 이종 저장 계층을 통해 스테이징되는 '데이터'로 간주합니다. 측정된 라우팅 열(routing heat)에 따라 전문가(experts)를 결정하고, 전처리(prefetch) 기능을 활용하여 디스크에서 데이터를 가져오는 지연 시간을 숨기면서 성능을 최적화하는 것이 주요 기술입니다.
이러한 다층 메모리 처리 방식을 통해 Colibrì는 값비싼 클라우드 나 하이퍼스케일러급 전용 하드웨어에 대한 의존도를 낮춥니다. 사용자는 자신이 소유한 장치에서 744B 파라미터 모델과 같은 거대 AI 모델을 직접 구동하고, 모든 전문가가 실시간으로 작동하는 과정을 측정하며 성능을 개선할 수 있습니다.
용어 풀이
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- Mixture-of-Experts
- 여러 하위 모델 중 일부만 골라 계산하는 구조. 모델이 커도 실행 비용을 줄일 수 있어요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.