비전-언어 모델(VLM)용 KV 캐시 재사용 최적화 기술 CONDUIT — AI 생성 일러스트AI 일러스트
리서치 연구

비전-언어 모델(VLM)용 KV 캐시 재사용 최적화 기술 CONDUIT

CONDUIT: A Unified Residual-Stream Restoration Framework for KV Cache Reuse in Vision-Language Models

arXiv9월 9일 발표 · 2분 · 심사 전 논문

비전-언어 모델(VLM)이 반복되는 시각 정보를 처리할 때 발생하는 KV 캐시 재사용의 정확도 저하 문제를 해결하는 'CONDUIT' 프레임워크가 제안되었습니다.

세 줄 요약arXiv 원문 기반
  1. CONDUIT은 잔여 스트림 복원 방식을 통해 단일 및 다중 이미지 재사용을 통합하며, 훈련 과정 없이도 높은 효율성을 보장합니다.
  2. 이 기술은 추론 시 계산량(FLOPs)을 대폭 줄이고, 최대 2.99배의 빠른 토큰 생성 속도를 달성하여 VLM의 실시간 처리 능력을 혁신합니다.
  3. 기존 모델 구조나 가중치 변경 없이, 오직 추론 과정에서 단일 점수 계산만 추가하는 방식으로 구현되어 적용이 매우 용이합니다.

비전-언어 모델()이 반복되는 시각 콘텐츠에 대해 새로운 질문을 처리할 때, 키-값(KV) 캐시를 재사용하는 것이 중요합니다. 기존의 정확한 접두사 재사용 방식은 동일한 시각적 내용이 변경된 접두사 아래 나타날 경우 실패하며, CONDUIT은 이러한 문제점을 해결하기 위해 제안되었습니다. 이 프레임워크는 훈련 과정 없이 단일 및 다중 이미지 재사용을 잔여 스트림 복원 방식으로 통합하는 정책입니다.

CONDUIT은 캐시된 키-쿼리 어텐션과 접근 가능한 사전 출력 캐시 값 노름 프록시를 활용하여 시각 의 순위를 매깁니다. 이후 임피리컬 이미지 레벨 관련성 증폭을 적용한 후 전역 선택을 수행합니다. 이 방법은 기존 모델 구조와 를 유지하며, 추론 과정에서 단일 쿼리 기반 점수 계산만 추가하는 방식으로 구현되어 적용이 용이합니다.

실험 결과에 따르면, CONDUIT은 10%의 리프레시 예산으로 세 가지 VLM 백본에 걸쳐 전체 프리필 평균의 97.0~99.5%를 달성하며, 예산 기반 방법 중 평균적으로 가장 높은 성능을 보였습니다. 특히 MMLongBench-Doc 지연 시간 하위 집합에서는 전체 프리필 FLOPs의 13.5%만을 사용하면서도 2.99배의 첫 토큰 생성 속도 향상을 달성했습니다.

용어 풀이

VLM
이미지와 글을 함께 이해하는 모델.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
원문arXiv · CONDUIT: A Unified Residual-Stream Restoration Framework for KV Cache Reuse in Vision-Language Models같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기