모델 연구

GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving

ARarXiv9월 4일 발표 · 1분 · 심사 전 논문

LLM의 긴 추론 과정에서 발생하는 메모리 병목 현상(KV 캐시)을 해결하는 동적 할당 프레임워크 'GrowPage'가 개발되었습니다.

세 줄 요약arXiv 원문 기반
  1. 기존 방식과 달리, GrowPage는 KV 캐시 용량을 고정된 것이 아닌 '런타임 자원'으로 간주하여 수요 변화에 따라 페이지를 동적으로 관리합니다.
  2. 이 기술은 복잡하고 긴 추론 능력이 필요한 LLM 서비스의 메모리 한계를 극복하여 시스템 처리량(Throughput)을 획기적으로 개선할 수 있습니다.
  3. PagedAttention과 같은 페이지 기반 메모리 시스템에 통합되어 연속 배치 및 접두사 캐싱 기능을 유지하며 높은 효율성을 보장합니다.

LLM의 긴 추론 과정에서 발생하는 메모리 병목 현상(KV 캐시)을 해결하는 동적 할당 프레임워크 'GrowPage'가 개발되었습니다.

원문arXiv · GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기