LLM 추론 속도 높이는 'LayerRoute' 기술 공개 — AI 생성 일러스트
리서치 연구

LLM 추론 속도 높이는 'LayerRoute' 기술 공개

LayerRoute: Adaptive Layer-Skipping with LoRA-Preserved Quality for Efficient LLM Inference

arXiv9월 15일 발표 · 3분 · 프리프린트

LayerRoute는 LLM의 추론 효율을 높이기 위해 트랜스포머 구조 내에서 입력에 따라 불필요한 레이어를 적응적으로 건너뛰는(Skipping) 방식을 제안합니다.

세 줄 요약arXiv 원문 기반
  1. 각 레이어에 경량 라우터와 LoRA를 결합하여 학습시킨 결과, 평균 1.04배의 추론 속도 향상을 달성했으며 품질 저하 없이 성능이 개선됨을 입증했습니다.
  2. 이는 LLM 상용화 시 가장 큰 문제인 컴퓨팅 자원과 처리 시간을 획기적으로 절감하여, 고성능 AI 모델의 접근성과 효율성을 높입니다.
  3. 연구진은 이 라우터가 단순히 고정된 패턴이 아닌 입력별 게이트 결정을 내리는 진정한 처리를 수행하며, 학습 시간과 오버헤드도 매우 낮음을 확인했습니다.

연구진은 의 효율적인 추론을 위해 LayerRoute라는 적응형 레이어 건너뛰기(Adaptive Layer-Skipping) 방법을 제안했습니다. 이 방법은 구조 내 각 레이어에 경량 라우터와 어댑터를 결합하여 학습시키며, Qwen2.5-0.5B-Instruct 모델의 24개 블록을 대상으로 합니다. LayerRoute는 게이트 기반 라우팅과 LoRA 을 공동으로 수행하며, 이 과정에서 각 레이어별 라우터와 LoRA 어댑터를 추가합니다.

실험 결과에 따르면, LayerRoute를 적용했을 때 평균 1.04배의 추론 속도 향상을 달성했습니다. 또한, 품질 저하 없이 성능이 개선되었으며, 공동 LoRA 적응을 통해 백본 모델 대비 퍼플렉서티가 모두 개선되는 것이 확인되었습니다 (평균 delta = -1.16 및 -1.11). 10번의 독립적인 시드 학습에서도 일관되게 9개의 중간 레이어(8-16)가 건너뛰기 가능 영역으로 나타났습니다.

연구진은 이 라우터가 단순히 고정된 패턴이 아닌, 실제 입력에 따라 게이트 결정을 내리는 진정한 처리를 수행함을 검증했습니다. 이는 테스트 샘플의 87%에서 100%까지 건너뛰기/실행 결과에 변화를 주었습니다. LayerRoute는 단일 A100 환경에서 7시간 이내에 학습이 가능하며, 라우팅 결정 자체 외에는 무시할 만한 오버헤드만 추가합니다.

용어 풀이

LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
트랜스포머
오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
LoRA
모델 전체 대신 작은 추가 부분만 학습시켜 적은 비용으로 미세 조정하는 기법.
미세 조정
이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
원문arXiv · LayerRoute: Adaptive Layer-Skipping with LoRA-Preserved Quality for Efficient LLM Inference
원문 보기arXiv