긴 문맥 LLM 추론 속도를 높이는 RBS-Attention 기술 — AI 생성 일러스트
리서치 연구

긴 문맥 LLM 추론 속도를 높이는 RBS-Attention 기술

RBS-Attention: Radius-Bounded Sparse Prefill for Long-Context Large Language Models

arXiv9월 21일 발표 · 2분 · 프리프린트

긴 문맥 처리가 필수적인 LLM 추론 과정은 전체 프롬프트를 처리하는 '프리필' 단계에서 속도 병목 현상이 발생합니다. 본 연구는 이를 해결하기 위해 RBS-Attention이라는 새로운 희소 어텐션 방식을 제안했습니다.

세 줄 요약arXiv 원문 기반
  1. RBS-Attention은 평균 관련성을 포착하는 기본 블록과 과소평가 위험을 보강하는 '구조적(Rescue)' 블록 두 가지를 결합합니다. 이 방식은 H100 GPU에서 20배 이상의 프리필 속도 향상을 입증했습니다.
  2. 이 기술은 긴 문서나 대화 처리가 필요한 최신 LLM 서비스의 효율성을 극대화하여, 사용자에게 빠르고 안정적인 고성능 경험을 제공할 수 있다는 점에서 중요합니다.
  3. 속도 개선 효과가 매우 크지만, 밀집(dense) 어텐션 방식 대비 정확도가 약간 낮게 측정될 수 있습니다. 따라서 실제 적용 시 속도 향상과 정확도의 균형점을 면밀히 검토해야 합니다.

장문 컨텍스트를 처리하는 (LLM)의 추론 과정은 전체 를 미리 처리하는 '프리필' 단계에서 성능 병목 현상이 발생합니다. 본 연구는 이 문제를 해결하기 위해, 평균 관련성을 포착하는 기본 블록과 과소평가 위험을 보강하는 구조적(rescue) 블록 두 가지를 결합한 RBS-Attention이라는 학습 불필요한 희소 프리필 방식을 제안했습니다.

H100 환경에서 테스트된 결과, RBS-Attention은 128K 컨텍스트 길이의 Qwen3-30B 모델에 대해 독립적인 프리필 어텐션 대비 20.65배, vLLM 대비 11.92배, 그리고 엔드투엔드 첫 생성 시간(time-to-first-token)에서 5.97배의 속도 향상을 달성했습니다.

이 기술은 LongBench-v2, InfiniteBench, Video-MME 등 다양한 품질 평가를 통해 검증되었으며, 두 분기 선택 방식이 긴 컨텍스트 프리필에 효과적임을 입증했습니다. 밀집(dense) Qwen3-32B 모델과 비교했을 때 전반적인 RULER 정확도는 88.65를 기록하며 성능을 유지했습니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
프롬프트
AI에게 주는 지시나 질문 글.
GPU
많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
원문arXiv · RBS-Attention: Radius-Bounded Sparse Prefill for Long-Context Large Language Models
원문 보기arXiv