모델 연구
Accelerating LLM Inference via Vector Index Based Output Embeddings
ARarXiv
LLM의 자동 회귀 디코딩 과정에서 발생하는 거대한 출력 임베딩 행렬로 인한 메모리 대역폭 병목 현상을 해결하는 기술입니다.
세 줄 요약
- 출력 프로젝션을 최대 내적 검색으로 재정의하고 HNSW 벡터 인덱스를 적용하여, Gemma 3 등 모델에서 배치 크기 1 디코딩 처리량을 최대 82%까지 향상시켰습니다.
- 이 기술은 지연 시간에 민감한 환경에서 LLM 추론 속도를 획기적으로 높이면서도 높은 생성 품질을 유지할 수 있는 실용적인 대안을 제시합니다.
- 성능 개선은 CPU 환경의 배치 크기 1 디코딩에 초점을 맞췄으며, AlpacaEval 평가를 통해 전반적인 생성 품질이 유지됨을 검증했습니다.
LLM의 자동 회귀 디코딩 과정에서 발생하는 거대한 출력 임베딩 행렬로 인한 메모리 대역폭 병목 현상을 해결하는 기술입니다.