리서치 연구

Affix Cache for Diffusion Large Language Models

ARarXiv8월 28일 발표 · 1분 · 심사 전 논문

Diffusion Large Language Models(DLLMs)의 추론 효율성 문제를 해결하기 위해 ACache라는 캐시 재사용 메커니즘을 제안했다.

세 줄 요약arXiv 원문 기반
  1. ACache는 공유 텍스트 구간에서 핵심 접사 토큰인 Anchor Tokens를 식별하고, 이들만 선택적으로 KV 상태를 재계산하여 나머지 접사 캐시는 재사용한다.
  2. 이 방법은 Nano-vLLM 엔진 기반 프로토타입에서 재계산 지연 시간을 최대 55.7% 줄이고 처리량은 최대 1.68배 개선했다.
  3. ACache는 Fast-dLLM을 기반으로 하며, 약 20%의 접사 토큰 재계산을 통해 다른 설정에서의 정확도 손실을 회복한다.

Diffusion Large Language Models(DLLMs)의 추론 효율성 문제를 해결하기 위해 ACache라는 캐시 재사용 메커니즘을 제안했다.

원문arXiv · Affix Cache for Diffusion Large Language Models같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기