모델 연구

PuzzleKV: Page-Wise Low-Rank Decomposition for KV Cache Compression

ARarXiv8월 26일 발표 · 1분 · 심사 전 논문

PuzzleKV는 대규모 언어 모델(LLMs)의 KV 캐시 메모리 한계를 극복하고자 페이지별 저랭크 분해 기법을 적용한다.

세 줄 요약arXiv 원문 기반
  1. 이 방법은 각 헤드의 KV 캐시를 고정 길이 논리 페이지로 나누고, 완성된 페이지를 독립적인 압축 단위로 처리하며 어텐션을 계산한다.
  2. 기존의 저랭크 방식들이 모델 가중치나 보정 활성화 값에서 투영 공간을 도출하는 것과 달리 상세 정보를 포착한다. 양자화와 결합 시 원본 저장 공간의 18.7%만 사용하며 성능은 93% 이상 유지한다.
  3. PuzzleKV는 별도의 훈련 및 보정이 필요 없는 방법이며, 평가 결과는 RULER나 LongBench 등 여러 벤치마크에서 확인했다.

PuzzleKV는 대규모 언어 모델(LLMs)의 KV 캐시 메모리 한계를 극복하고자 페이지별 저랭크 분해 기법을 적용한다.

원문arXiv · PuzzleKV: Page-Wise Low-Rank Decomposition for KV Cache Compression같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기