리서치 연구
Osprey: 범용 사전 학습으로 추측 디코딩 성능 강화
Osprey: Target-agnostic Pre-training Makes Stronger Drafters in Speculative Decoding
arXivLLM 추론 속도 향상에 필수적인 '추측 디코딩(Speculative Decoding)'의 효율을 극대화하는 새로운 방법인 Osprey가 개발되었습니다.
세 줄 요약
- Osprey는 기존처럼 타겟 모델별로 재학습하던 드래프터를 범용 사전 학습 능력을 활용해 구축하여, 여러 대형 언어 모델에서 평균 수락 길이를 크게 개선했습니다.
- 모델 배포 시마다 개별적인 학습이 필요했던 비효율을 줄여주며, 특히 도메인 외나 다국어 데이터 처리 성능 향상에 큰 기여를 할 것으로 기대됩니다.
- 기술적으로는 깊은 구조의 작은 언어 모델을 사용하면서도 지연 시간 제약을 극복하기 위해 백본 가지치기 및 타겟 적응 과정을 거치는 것이 핵심입니다.
추론 속도 향상에 필수적인 '추측 디코딩(Speculative Decoding)'은 현재 드래프터가 단일 타겟 모델의 좁은 분포를 대상으로 훈련되기 때문에 그 가속 효과가 취약합니다. 이로 인해 작업 부하가 변화할 경우 수락률이 급격히 떨어지는 문제가 발생합니다.
Osprey는 이러한 문제를 해결하기 위해, 기존처럼 타겟별로 재학습하던 드래프터를 오프-더-쉘프의 사전 학습된 소형 언어 모델에서 부트스트랩하는 방식을 도입했습니다. 이는 광범위한 사전 학습을 범용적이고 타겟에 구애받지 않는 자산으로 취급하여, 개별 타겟에 대한 작업량을 경량화된 적응 단계로 줄입니다.
Osprey는 소형 모델의 깊은 구조와 지연 시간 제약이라는 두 가지 과제를 해결하기 위해 백본을 가지치기하고, 타겟 비종속적 다음 사전 학습 등을 수행합니다. 실험 결과, 단일 Osprey 백본이 여러 타겟에 걸쳐 전이되어 평균 수락 길이를 Qwen3-8B의 경우 16.1%, Llama-3.3-70B-Instruct의 경우 21.2%, MiniMax-M2.5의 경우 22.7%까지 개선하는 성능을 보였습니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.