Elastic Threshold Attention: Learned Contextual Sparsity for Long-Context Decoding — AI 생성 일러스트AI 일러스트
모델 연구

Elastic Threshold Attention: Learned Contextual Sparsity for Long-Context Decoding

arXiv9월 21일 발표 · 1분 · 심사 전 논문

긴 문맥 처리 시 발생하는 메모리 대역폭 병목 현상을 해결하기 위해 'Elastic Threshold Attention(ETA)'가 개발되었습니다. 이 아키텍처는 쿼리 표현으로부터 동적인 임계값을 예측하여 필요한 정보만 집중적으로 계산합니다.

세 줄 요약arXiv 원문 기반
  1. ETA는 쿼리 기반의 동적 임계값 예측을 통해 불필요한 토큰은 제거하고, 어려운 추론 단계에는 밀집 모델 수준의 높은 집중도를 유지하는 것이 핵심입니다.
  2. 최대 512K 토큰까지 처리 가능한 초장문맥 환경에서, 기존 대비 최대 2.5배에 달하는 추론 속도 향상을 제공하여 대규모 언어 모델의 실용성을 극대화합니다.
  3. 훈련 과정에서 정보 손실 없이 높은 희소성(최대 85%)을 학습하며, 도메인별 배포 시 오프라인 보정 알고리즘으로 계산량을 추가 절감할 수 있습니다.

긴 문맥 처리 시 발생하는 메모리 대역폭 병목 현상을 해결하기 위해 'Elastic Threshold Attention(ETA)'가 개발되었습니다. 이 아키텍처는 쿼리 표현으로부터 동적인 임계값을 예측하여 필요한 정보만 집중적으로 계산합니다.

원문arXiv · Elastic Threshold Attention: Learned Contextual Sparsity for Long-Context Decoding같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv