리서치 연구
Affix Cache for Diffusion Large Language Models
ARarXiv
Diffusion Large Language Models(DLLMs)의 추론 효율성 문제를 해결하기 위해 ACache라는 캐시 재사용 메커니즘을 제안했다.
세 줄 요약
- ACache는 공유 텍스트 구간에서 핵심 접사 토큰인 Anchor Tokens를 식별하고, 이들만 선택적으로 KV 상태를 재계산하여 나머지 접사 캐시는 재사용한다.
- 이 방법은 Nano-vLLM 엔진 기반 프로토타입에서 재계산 지연 시간을 최대 55.7% 줄이고 처리량은 최대 1.68배 개선했다.
- ACache는 Fast-dLLM을 기반으로 하며, 약 20%의 접사 토큰 재계산을 통해 다른 설정에서의 정확도 손실을 회복한다.
Diffusion Large Language Models(DLLMs)의 추론 효율성 문제를 해결하기 위해 ACache라는 캐시 재사용 메커니즘을 제안했다.