LLM 추론 속도 높이는 'LayerRoute' 기술 공개
LayerRoute: Adaptive Layer-Skipping with LoRA-Preserved Quality for Efficient LLM Inference
arXivLayerRoute는 LLM의 추론 효율을 높이기 위해 트랜스포머 구조 내에서 입력에 따라 불필요한 레이어를 적응적으로 건너뛰는(Skipping) 방식을 제안합니다.
- 각 레이어에 경량 라우터와 LoRA를 결합하여 학습시킨 결과, 평균 1.04배의 추론 속도 향상을 달성했으며 품질 저하 없이 성능이 개선됨을 입증했습니다.
- 이는 LLM 상용화 시 가장 큰 문제인 컴퓨팅 자원과 처리 시간을 획기적으로 절감하여, 고성능 AI 모델의 접근성과 효율성을 높입니다.
- 연구진은 이 라우터가 단순히 고정된 패턴이 아닌 입력별 게이트 결정을 내리는 진정한 처리를 수행하며, 학습 시간과 오버헤드도 매우 낮음을 확인했습니다.
연구진은 의 효율적인 추론을 위해 LayerRoute라는 적응형 레이어 건너뛰기(Adaptive Layer-Skipping) 방법을 제안했습니다. 이 방법은 구조 내 각 레이어에 경량 라우터와 어댑터를 결합하여 학습시키며, Qwen2.5-0.5B-Instruct 모델의 24개 블록을 대상으로 합니다. LayerRoute는 게이트 기반 라우팅과 LoRA 을 공동으로 수행하며, 이 과정에서 각 레이어별 라우터와 LoRA 어댑터를 추가합니다.
실험 결과에 따르면, LayerRoute를 적용했을 때 평균 1.04배의 추론 속도 향상을 달성했습니다. 또한, 품질 저하 없이 성능이 개선되었으며, 공동 LoRA 적응을 통해 백본 모델 대비 퍼플렉서티가 모두 개선되는 것이 확인되었습니다 (평균 delta = -1.16 및 -1.11). 10번의 독립적인 시드 학습에서도 일관되게 9개의 중간 레이어(8-16)가 건너뛰기 가능 영역으로 나타났습니다.
연구진은 이 라우터가 단순히 고정된 패턴이 아닌, 실제 입력에 따라 게이트 결정을 내리는 진정한 처리를 수행함을 검증했습니다. 이는 테스트 샘플의 87%에서 100%까지 건너뛰기/실행 결과에 변화를 주었습니다. LayerRoute는 단일 A100 환경에서 7시간 이내에 학습이 가능하며, 라우팅 결정 자체 외에는 무시할 만한 오버헤드만 추가합니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 트랜스포머
- 오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
- LoRA
- 모델 전체 대신 작은 추가 부분만 학습시켜 적은 비용으로 미세 조정하는 기법.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.