리서치 연구
긴 문맥 LLM 추론 속도를 높이는 RBS-Attention 기술
RBS-Attention: Radius-Bounded Sparse Prefill for Long-Context Large Language Models
arXiv긴 문맥 처리가 필수적인 LLM 추론 과정은 전체 프롬프트를 처리하는 '프리필' 단계에서 속도 병목 현상이 발생합니다. 본 연구는 이를 해결하기 위해 RBS-Attention이라는 새로운 희소 어텐션 방식을 제안했습니다.
세 줄 요약
- RBS-Attention은 평균 관련성을 포착하는 기본 블록과 과소평가 위험을 보강하는 '구조적(Rescue)' 블록 두 가지를 결합합니다. 이 방식은 H100 GPU에서 20배 이상의 프리필 속도 향상을 입증했습니다.
- 이 기술은 긴 문서나 대화 처리가 필요한 최신 LLM 서비스의 효율성을 극대화하여, 사용자에게 빠르고 안정적인 고성능 경험을 제공할 수 있다는 점에서 중요합니다.
- 속도 개선 효과가 매우 크지만, 밀집(dense) 어텐션 방식 대비 정확도가 약간 낮게 측정될 수 있습니다. 따라서 실제 적용 시 속도 향상과 정확도의 균형점을 면밀히 검토해야 합니다.
장문 컨텍스트를 처리하는 (LLM)의 추론 과정은 전체 를 미리 처리하는 '프리필' 단계에서 성능 병목 현상이 발생합니다. 본 연구는 이 문제를 해결하기 위해, 평균 관련성을 포착하는 기본 블록과 과소평가 위험을 보강하는 구조적(rescue) 블록 두 가지를 결합한 RBS-Attention이라는 학습 불필요한 희소 프리필 방식을 제안했습니다.
H100 환경에서 테스트된 결과, RBS-Attention은 128K 컨텍스트 길이의 Qwen3-30B 모델에 대해 독립적인 프리필 어텐션 대비 20.65배, vLLM 대비 11.92배, 그리고 엔드투엔드 첫 생성 시간(time-to-first-token)에서 5.97배의 속도 향상을 달성했습니다.
이 기술은 LongBench-v2, InfiniteBench, Video-MME 등 다양한 품질 평가를 통해 검증되었으며, 두 분기 선택 방식이 긴 컨텍스트 프리필에 효과적임을 입증했습니다. 밀집(dense) Qwen3-32B 모델과 비교했을 때 전반적인 RULER 정확도는 88.65를 기록하며 성능을 유지했습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 프롬프트
- AI에게 주는 지시나 질문 글.
- GPU
- 많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.