개인 PC에서 초대형 AI 모델 구동하는 Strata 소개
Niko1221/Strata
GitHub서버 환경이 필요한 초대형 AI 모델을 개인용 게이밍 PC에서도 구동 가능하게 만든 오픈소스 도구 'Strata'가 화제입니다.
- 이 도구는 모델 연산을 VRAM, 시스템 RAM, 심지어 SSD까지 분산 처리해 대규모 AI 구동을 구현하며, 속도는 하드웨어 성능에 따라 매우 빠릅니다.
- 값비싼 서버 인프라 없이도 일반 사용자 PC만으로 최신 LLM의 강력한 성능을 직접 경험하고 활용할 수 있다는 점이 가장 큰 장점입니다.
- 다만, 원활한 사용을 위해 최소 12GB 이상 VRAM의 NVIDIA GPU와 충분한 시스템 RAM이 필요하며, 첫 실행 시에는 상당한 시간이 소요됩니다.
Strata는 서버 환경이 필요한 대규모 인공지능(AI) 모델을 일반 개인용 게이밍 PC에서도 구동할 수 있게 하는 도구입니다. 이 도구는 모델 연산을 VRAM, 시스템 RAM, SSD 등 PC 전체 자원을 공유하여 분산 처리하는 방식을 사용합니다. 이를 통해 값비싼 서버 인프라 없이도 최신 의 강력한 성능을 로컬 환경에서 직접 경험하고 활용할 수 있다는 것이 핵심 특징입니다.
Strata는 다양한 크기의 모델(예: Q2_0, IQ2_XS, IQ3_S 등)을 제공하며, 각 모델은 요구되는 RAM+VRAM 용량과 속도, 품질 면에서 차이를 보입니다. 예를 들어, RTX 5070 (12 GB) 환경에서는 IQ3_S 모델이 짧은 채팅 응답 시 초당 53 의 속도를 기록했습니다. 또한 VRAM 용량이 클수록 성능에 유리하며, RTX 3090(24 GB)과 같은 카드는 시간당 약 100~140 토큰 수준으로 측정되었습니다.
사용을 위해서는 최소 12 GB 이상의 VRAM을 가진 NVIDIA RTX 20, 30, 40 또는 50 시리즈 카드와 충분한 시스템 RAM이 필요합니다. 사용자는 `START-HERE.bat` 등의 스크립트를 통해 프로젝트를 다운로드하고 실행할 수 있으며, 첫 실행 시에는 모델 로딩 과정으로 인해 PC가 느려지거나 응답하지 않을 수 있으나 이는 정상적인 현상입니다.
용어 풀이
- 오픈 소스
- 소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.