모델 연구
PuzzleKV: Page-Wise Low-Rank Decomposition for KV Cache Compression
ARarXiv
PuzzleKV는 대규모 언어 모델(LLMs)의 KV 캐시 메모리 한계를 극복하고자 페이지별 저랭크 분해 기법을 적용한다.
세 줄 요약
- 이 방법은 각 헤드의 KV 캐시를 고정 길이 논리 페이지로 나누고, 완성된 페이지를 독립적인 압축 단위로 처리하며 어텐션을 계산한다.
- 기존의 저랭크 방식들이 모델 가중치나 보정 활성화 값에서 투영 공간을 도출하는 것과 달리 상세 정보를 포착한다. 양자화와 결합 시 원본 저장 공간의 18.7%만 사용하며 성능은 93% 이상 유지한다.
- PuzzleKV는 별도의 훈련 및 보정이 필요 없는 방법이며, 평가 결과는 RULER나 LongBench 등 여러 벤치마크에서 확인했다.
PuzzleKV는 대규모 언어 모델(LLMs)의 KV 캐시 메모리 한계를 극복하고자 페이지별 저랭크 분해 기법을 적용한다.