TreeSpark: 적응형 드래프트 트리를 활용한 추론 속도 향상 기술
TreeSpark: Calibrated, Load-Adaptive Draft Trees for Semi-Autoregressive Speculative Decoding
arXivLLM 추론 속도 향상을 위한 'TreeSpark'가 제안되었습니다. 이 기법은 후보 토큰들을 효율적으로 탐색하는 드래프트 트리를 활용하여 디코딩 성능을 극대화합니다.
- TreeSpark는 부모 조건부 분포를 이용해 트리를 구성하고, 경로 생존 여부를 기준으로 확장 및 중지 정책을 결정합니다. 그 결과, 기존 방식 대비 15~25% 더 많은 토큰 처리가 가능하며 속도가 향상됩니다.
- 특히 서버 부하 변화에 따라 트리의 크기를 자동으로 조절하는 적응형 특성을 갖춰, 대규모 서비스 환경에서도 안정적이고 최적화된 성능을 유지할 수 있습니다.
- 온도 설정과 관계없이 디코딩 손실 없이 작동하며, 실제 성능은 드래프터 모델의 구조와 시스템 부하 조건에 따라 달라질 수 있다는 점을 참고해야 합니다.
Speculative decoding은 저렴한 드래프터가 제안하는 을 타겟 모델이 병렬로 검증하여 언어 모델의 추론 속도를 가속화합니다. 기존의 드래프트 트리는 후보 토큰들을 순위 매길 때 해당 후보가 어떤 부모를 확장했는지에 대한 정보를 무시하거나, 고정된 크기로 인해 각 디코딩 라운드나 서비스 부하 변화에 따른 최적화가 어려웠습니다.
TreeSpark는 드래프터의 기존 마르코프 헤드에서 부모 조건부 분포를 적은 비용으로 읽어와 이를 엣지 수용 추정치로 보정합니다. 이후 경로 생존 여부가 모든 것을 결정하며, 최적의 순서로 트리를 확장하고 라운드별 중지를 관리하며 서비스 부하에 맞춰 트리를 조정하는 방식을 사용합니다. 또한, 재귀적 거부(recursive rejection) 과정에서 일치하는 잔차를 유지하여 디코딩 손실 없이 작동하도록 설계되었습니다.
TreeSpark는 기존 방식 대비 라운드당 15~25% 더 많은 드래프트 토큰을 수용하며, 단일 요청의 벽시계 시간 기준으로 8~14% 빠르게 디코딩할 수 있습니다. 특히 부하가 증가하는 상황에서도 트리를 자동으로 축소하여 안정적인 성능을 유지하는 적응형 특성을 갖추고 있습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.