모델 연구
What Matters for Aggressive Decoding-Time KV Eviction? Temporal Aggregation and Ranking Preservation
ARarXiv
대규모 언어 모델(LLM)의 디코딩 과정에서 발생하는 방대한 KV 캐시를 효율적으로 압축하고 관리하는 새로운 방법을 제시했습니다.
세 줄 요약
- 연구 결과, 단순히 점수를 계산하는 것보다 시간 흐름에 따른 점수 집계 방식(Temporal Aggregation)이 성능 유지에 핵심적이며, EMA 기반 'InertiaKV'가 높은 처리량 개선을 보였습니다.
- 이는 캐시 정보를 어떻게 누적하고 집계할지가 모델의 실제 속도와 효율성에 더 큰 영향을 미치며, 점수 계산 방법론 자체를 재고해야 함을 의미합니다.
- 따라서 KV 압축 시에는 모든 스코어링 방식이 효과적인 것이 아니므로, 순위 변화나 성능 저하가 없는 안정적인 집계 방식을 신중하게 선택하는 것이 중요합니다.
대규모 언어 모델(LLM)의 디코딩 과정에서 발생하는 방대한 KV 캐시를 효율적으로 압축하고 관리하는 새로운 방법을 제시했습니다.