모델 연구
PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference
ARarXiv
대규모 비전-언어 모델(VLM)의 높은 추론 비용 문제를 해결하기 위해, 연구진은 시각 인코더와 LLM 전체를 최적화하는 'PACE' 프레임워크를 제안했습니다.
세 줄 요약
- PACE는 입력 단계에서 불필요한 정보를 압축(Condense)하고, 중요한 시각 토큰만 선별적으로 추출(Extract)하여 처리 효율을 극대화합니다.
- 기존 방식의 한계를 넘어, 인코딩 전 단계부터 최적화하며 전체 맥락과 세부 정보를 동시에 보존하여 성능 저하를 막았습니다.
- 실제 테스트 결과, VLM의 시각 토큰 사용량을 10%로 줄이면서도 성능을 유지하여 추론 속도를 3.1배 향상시키는 효과를 입증했습니다.
대규모 비전-언어 모델(VLM)의 높은 추론 비용 문제를 해결하기 위해, 연구진은 시각 인코더와 LLM 전체를 최적화하는 'PACE' 프레임워크를 제안했습니다.