모델 연구
GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving
ARarXiv
LLM의 긴 추론 과정에서 발생하는 메모리 병목 현상(KV 캐시)을 해결하는 동적 할당 프레임워크 'GrowPage'가 개발되었습니다.
세 줄 요약
- 기존 방식과 달리, GrowPage는 KV 캐시 용량을 고정된 것이 아닌 '런타임 자원'으로 간주하여 수요 변화에 따라 페이지를 동적으로 관리합니다.
- 이 기술은 복잡하고 긴 추론 능력이 필요한 LLM 서비스의 메모리 한계를 극복하여 시스템 처리량(Throughput)을 획기적으로 개선할 수 있습니다.
- PagedAttention과 같은 페이지 기반 메모리 시스템에 통합되어 연속 배치 및 접두사 캐싱 기능을 유지하며 높은 효율성을 보장합니다.
LLM의 긴 추론 과정에서 발생하는 메모리 병목 현상(KV 캐시)을 해결하는 동적 할당 프레임워크 'GrowPage'가 개발되었습니다.