리서치 연구

LLM 추론 속도 향상 기술 CAST 소개

CAST: Cost-Aware Speculative Trees from One-Pass Block Drafters

ARarXiv10월 2일 발표 · 2분 · 프리프린트

대규모 언어 모델(LLM)의 추론 속도를 높이는 '추측 디코딩' 방식에 CAST가 제안되었습니다. 이 기술은 여러 후보 토큰을 트리 형태로 묶어 한 번의 검증으로 처리하는 것이 핵심입니다.

세 줄 요약arXiv 원문 기반
  1. 기존 방식이 최고 점수 경로만 검증했던 것과 달리, CAST는 다수의 후보군을 동시에 검증하여 연산 효율성을 극대화하며, 시스템 지연 시간에 맞춰 최적의 크기를 자동으로 조절합니다.
  2. 이 기술은 기존 대비 최대 43%까지 속도 향상을 기대할 수 있어, LLM 기반 서비스의 실시간 응답성과 사용자 경험 개선에 큰 도움이 될 것으로 예상됩니다.
  3. 다만, 검증 비용이 특정 경계에서 급격히 증가하는 환경에서는 성능 향상 폭이 줄어들 수 있으므로, 실제 배포 환경에 맞는 최적의 트리 크기 설정이 중요합니다.

(LLM)의 추론 가속화 기법인 '추측 디코딩(Speculative decoding)'은 미래 을 저렴하게 초안 작성하고 타겟 모델로 병렬 검증하는 방식입니다. 기존 방식에서는 최고 점수를 받은 단일 체인만 검증하고 다른 후보군은 폐기했지만, CAST는 이러한 여러 후보군들을 트리 형태로 묶어 단 한 번의 타겟 패스로 검증할 수 있도록 합니다.

CAST는 타겟 모델, 드래프터 , 디코딩 규칙을 변경하지 않으면서 이 기능을 구현합니다. 또한, 예상되는 이득이 추가하는 검증 시간보다 클 때까지 후보군을 추가하여 트리의 폭을 결정하며, 이는 지연 시간 측정에 따라 배포 환경별로 자동으로 조절됩니다.

평가 결과, CAST는 8가지 설정 모두에서 표준 체인 대비 최대 43%까지 빠르다는 것이 확인되었습니다. 다만, 검증 비용이 커널 경계에서 급격히 증가하는 경우 성능 향상 폭은 줄어들 수 있으며, 이 기술은 그리디 및 샘플링 디코딩 모두에서 타겟 출력 분포를 변경하지 않음을 증명했습니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
궁금한 점AI 정리 · 원문 기반
기존 추측 디코딩 방식과 CAST가 다른 점은 무엇인가요?

기존 방식에서는 최고 점수를 받은 단일 체인만 검증하고 다른 후보군은 폐기했지만, CAST는 여러 후보군들을 트리 형태로 묶어 단 한 번의 타겟 패스로 동시에 검증할 수 있게 해요. 이로써 연산 효율성을 높여요.

CAST는 트리의 크기를 어떻게 결정하나요?

예상되는 이득이 추가하는 검증 시간보다 클 때까지 후보군을 추가하여 트리의 폭을 정해요. 이 과정은 지연 시간을 측정하며 배포 환경별로 자동으로 조절돼요.

CAST 기술 사용 시 주의해야 할 점이 있나요?

검증 비용이 커널 경계에서 급격히 증가하는 경우에는 성능 향상 폭이 줄어들 수 있어요. 따라서 실제 배포 환경에 맞는 최적의 트리 크기 설정이 중요해요.

원문arXiv · CAST: Cost-Aware Speculative Trees from One-Pass Block Drafters
궁금한 점 3개AI 정리