SMat-Attention: 구조화된 장문맥 시퀀스 모델링
SMat-Attention: Structured Long-Context Sequence Modeling
arXiv긴 문맥 모델은 유연한 어텐션과 빠른 계산 속도 사이의 트레이드오프를 겪어왔습니다. 본 연구는 구조화된 행렬 어텐션(SMat-Attention)을 제안하여 이 간극을 메우고 효율적인 장문맥 처리를 가능하게 했습니다.
- 이 방법은 VC 차원($d$)이라는 매개변수를 도입해 계산 복잡도를 혁신적으로 개선했습니다. 시퀀스 길이 $T$에 대해 기존의 이차 시간보다 낮은 연산량으로 처리하며, 스트리밍 디코딩에서도 상수 시간 처리를 구현합니다.
- VC 차원($d$)을 조절하는 것이 접근 패턴의 복잡성, 초기 처리 비용(prefill), 메모리 사용량까지 직접 제어할 수 있게 합니다. 이는 모델 설계에 이전에 없던 높은 유연성을 제공합니다.
- SMat-Attention은 구조화된 마스크를 기반으로 작동하며, 원하는 성능 목표에 맞춰 $d$ 값을 설정함으로써 효율성과 표현력을 동시에 확보하는 것이 핵심입니다.
장문맥(Long-context) 시퀀스 모델은 근본적인 트레이드오프에 직면해왔습니다. 소프트맥스 어텐션은 유연한 수준 상호작용을 제공하지만 이차 시간 복잡도를 가지며, 선형 어텐션은 히스토리를 고정 크기 상태로 압축하여 선형 시간 훈련과 상수 시간 디코딩을 얻는 방식입니다. 본 연구에서는 이러한 두 영역을 구조화된(Structured) 개념으로 연결하는 Structured Matrix Attention (SMat-Attention)을 제안했습니다.
SMat-Attention은 VC 차원($d$)을 가진 구조화된 장거리 라우팅을 갖는 인과 마스크 계열을 통해 구현됩니다. 이 구조를 활용하여 시퀀스 길이 $T$에 대해 하드 라우팅 구성이 $O(T^{2-3/d}+T)$의 연산량을 가지며, 이는 마스크가 밀집되어 있음에도 불구하고 효율성을 보장합니다. 또한 고정 호라이즌 스트리밍 환경에서 원거리 접두사 디코딩은 $O(T^{1-1/d})$ 크기의 캐시된 상태를 사용하여 토큰당 상수 시간 처리가 가능합니다.
SMat-Attention의 핵심은 VC 차원($d$)을 명시적인 조절기(knob)로 활용하여 접근 패턴 복잡도, 초기 처리 비용(prefill cost), 그리고 디코딩 메모리 사용량을 제어할 수 있다는 점입니다. 연구진들은 이 구조화된 마스크를 기반으로 subset-routing 및 규칙 지원 다중 키 검색 실험을 수행했으며, Mamba-2와 Gated DeltaNet에 학습된 라우팅을 확장하여 서브-이차(subquadratic)의 초기 처리 성능을 유지하고 재현율 정확도를 개선하는 결과를 얻었습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.