대규모 MoE 모델을 로컬 하드웨어에 최적화한 추론 엔진
JustVugg/colibri
GitHubColibrì는 744B~2.8T 규모의 거대 MoE 모델을 소비자급 및 이종 하드웨어에서 구동할 수 있도록 설계된 혁신적인 추론 엔진입니다.
- VRAM, RAM, 저장장치(NVMe)를 하나의 다층 메모리 계층으로 통합하여 가중치를 관리하며, 필요한 전문가 지식만 디스크에서 스트리밍합니다.
- 고가의 클라우드 인프라에 의존하지 않고도, 사용자가 보유한 일반 하드웨어에서 최첨단 대규모 AI 모델을 직접 구동하고 연구할 수 있게 합니다.
- 성능 극대화에 초점을 맞추었기에 빠른 메모리 부족 시 속도는 저하될 수 있으나, 모델의 의미론적 정확성은 철저히 보장합니다.
Colibrì는 최대 744B부터 2.8T 에 달하는 거대한 (MoE) 모델들을 소비자 및 이종 하드웨어 환경에서 구동할 수 있도록 설계된 추론 엔진입니다. 이 엔진은 저장 공간(Storage), RAM, VRAM을 하나의 통합된 '추론 계층(inference hierarchy)'으로 취급합니다. Colibrì의 목표는 이 희소한 고가 하드웨어 자원에 덜 의존하고 구동 비용을 낮출 수 있도록 추론 성능 전반에 걸쳐 최적화를 수행하는 것입니다.
Colibrì의 핵심 기술은 VRAM, RAM, 저장장치를 단일 다층 계층으로 취급하며, (weights)를 메모리에 상주하는 상태가 아닌 '배치되어야 할 데이터'로 간주한다는 점입니다. 이는 마치 가중치에 대한 JIT 컴파일러처럼 작동하여, 라우터가 특정 전문가 지식이 필요하다고 판단할 때만 해당 데이터를 디스크에서 스트리밍합니다. 이 과정에서 속도 저하는 발생할 수 있으나, 모델의 의미론적 정확성은 철저히 보장됩니다.
이러한 다층 메모리 처리 방식은 사용자가 고가의 클라우드 인프라에 의존하지 않고도, 자신이 보유한 일반 하드웨어 환경에서 최첨단 대규모 AI 모델을 직접 구동하고 연구할 수 있는 접근성을 제공합니다. Colibrì는 단순히 를 통해 지능을 임대하는 것이 아니라, 모델 자체를 로컬에서 측정하고 개선하며 깊이 있게 탐구할 수 있도록 설계되었습니다.
용어 풀이
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- Mixture-of-Experts
- 여러 하위 모델 중 일부만 골라 계산하는 구조. 모델이 커도 실행 비용을 줄일 수 있어요.
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.