비전-언어 모델(VLM)용 KV 캐시 재사용 최적화 기술 CONDUIT
CONDUIT: A Unified Residual-Stream Restoration Framework for KV Cache Reuse in Vision-Language Models
arXiv비전-언어 모델(VLM)이 반복되는 시각 정보를 처리할 때 발생하는 KV 캐시 재사용의 정확도 저하 문제를 해결하는 'CONDUIT' 프레임워크가 제안되었습니다.
- CONDUIT은 잔여 스트림 복원 방식을 통해 단일 및 다중 이미지 재사용을 통합하며, 훈련 과정 없이도 높은 효율성을 보장합니다.
- 이 기술은 추론 시 계산량(FLOPs)을 대폭 줄이고, 최대 2.99배의 빠른 토큰 생성 속도를 달성하여 VLM의 실시간 처리 능력을 혁신합니다.
- 기존 모델 구조나 가중치 변경 없이, 오직 추론 과정에서 단일 점수 계산만 추가하는 방식으로 구현되어 적용이 매우 용이합니다.
비전-언어 모델()이 반복되는 시각 콘텐츠에 대해 새로운 질문을 처리할 때, 키-값(KV) 캐시를 재사용하는 것이 중요합니다. 기존의 정확한 접두사 재사용 방식은 동일한 시각적 내용이 변경된 접두사 아래 나타날 경우 실패하며, CONDUIT은 이러한 문제점을 해결하기 위해 제안되었습니다. 이 프레임워크는 훈련 과정 없이 단일 및 다중 이미지 재사용을 잔여 스트림 복원 방식으로 통합하는 정책입니다.
CONDUIT은 캐시된 키-쿼리 어텐션과 접근 가능한 사전 출력 캐시 값 노름 프록시를 활용하여 시각 의 순위를 매깁니다. 이후 임피리컬 이미지 레벨 관련성 증폭을 적용한 후 전역 선택을 수행합니다. 이 방법은 기존 모델 구조와 를 유지하며, 추론 과정에서 단일 쿼리 기반 점수 계산만 추가하는 방식으로 구현되어 적용이 용이합니다.
실험 결과에 따르면, CONDUIT은 10%의 리프레시 예산으로 세 가지 VLM 백본에 걸쳐 전체 프리필 평균의 97.0~99.5%를 달성하며, 예산 기반 방법 중 평균적으로 가장 높은 성능을 보였습니다. 특히 MMLongBench-Doc 지연 시간 하위 집합에서는 전체 프리필 FLOPs의 13.5%만을 사용하면서도 2.99배의 첫 토큰 생성 속도 향상을 달성했습니다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.