모델 연구

Accelerating LLM Inference via Vector Index Based Output Embeddings

ARarXiv8월 31일 발표 · 1분 · 프리프린트

LLM의 자동 회귀 디코딩 과정에서 발생하는 거대한 출력 임베딩 행렬로 인한 메모리 대역폭 병목 현상을 해결하는 기술입니다.

세 줄 요약arXiv 원문 기반
  1. 출력 프로젝션을 최대 내적 검색으로 재정의하고 HNSW 벡터 인덱스를 적용하여, Gemma 3 등 모델에서 배치 크기 1 디코딩 처리량을 최대 82%까지 향상시켰습니다.
  2. 이 기술은 지연 시간에 민감한 환경에서 LLM 추론 속도를 획기적으로 높이면서도 높은 생성 품질을 유지할 수 있는 실용적인 대안을 제시합니다.
  3. 성능 개선은 CPU 환경의 배치 크기 1 디코딩에 초점을 맞췄으며, AlpacaEval 평가를 통해 전반적인 생성 품질이 유지됨을 검증했습니다.

LLM의 자동 회귀 디코딩 과정에서 발생하는 거대한 출력 임베딩 행렬로 인한 메모리 대역폭 병목 현상을 해결하는 기술입니다.

원문arXiv · Accelerating LLM Inference via Vector Index Based Output Embeddings
원문 보기arXiv