필요할 때만 작동하는 LLM의 주의 집중 방식 연구 — AI 생성 일러스트AI 일러스트
리서치 연구

필요할 때만 작동하는 LLM의 주의 집중 방식 연구

On-Demand Attention: Language Models Know When to Recall

arXiv9월 17일 발표 · 3분 · 심사 전 논문

장문맥 추론 시 모든 과거 정보를 읽는 비효율성을 해결하기 위해, 모델이 필요할 때만 주의(Attention)를 사용하는 'On-Demand Attention (ODA)' 방식을 제안했습니다.

세 줄 요약arXiv 원문 기반
  1. ODA는 모델 내부 상태를 활용해 전역 어텐션 호출 시점을 예측하고, 이를 통해 정보 접근 횟수를 대폭 줄이면서도 성능 저하 없이 속도 향상을 입증했습니다.
  2. 이는 LLM이 자신이 보유한 방대한 정보에 접근하는 과정을 스스로 조절하게 함으로써, 장문맥 추론의 효율성과 실용성을 혁신적으로 높일 수 있음을 의미합니다.
  3. ODA는 기존 사전 학습 가중치를 유지하고 리콜 헤드만 훈련하며, vLLM 같은 환경에서 실제 디코딩 속도 향상을 구현할 수 있다는 점이 특징입니다.

장문맥 추론(long-context inference) 환경에서는 효율적인 정보 접근이 중요하지만, 기존의 전체 어텐션 디코딩 방식은 다음 예측에 이점이 있는지 여부와 관계없이 누적되는 모든 과거 기록을 매 단계마다 읽는 비효율성을 가집니다. 연구진은 이러한 문제를 해결하기 위해 'On-Demand Attention (ODA)'이라는 로컬 우선(local-first) 디코딩 방법을 제안했습니다. ODA는 경량의 리콜 헤드를 사용하여, 생성 과정 중 예측되는 정보적 이점에 따라 전역 어텐션 호출 시점을 선택적으로 활성화하는 것이 핵심입니다.

ODA 방식은 사전 학습된 모델 를 변경하지 않고 오직 리콜 헤드만 훈련합니다. 이를 통해 완전한 역사적 를 미래의 리콜을 위해 유지할 수 있습니다. 연구진은 이 방법을 vLLM 환경에서 측 조건부 실행으로 구현하여, 장문맥 길이에서 전체 어텐션 대비 실질적인 디코딩 속도 향상을 달성했습니다.

Qwen 및 Gemma 모델에 대한 실험 결과는 ODA의 효과를 입증합니다. 하이브리드 어텐션 백본을 포함한 테스트에서, 선택적 리콜(selective recall)은 로컬 어텐션으로 인해 손실되었던 성능 대부분을 회복하는 동시에 전역 읽기 횟수를 크게 줄이는 것으로 나타났습니다. 이는 사전 학습된 모델이 자신이 보유한 정보에 접근하는 과정을 스스로 조절할 수 있게 함으로써, 장문맥 추론의 효율성을 높임을 보여줍니다.

용어 풀이

가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
KV 캐시
모델이 앞에서 계산한 값을 저장해 두고 다음 토큰을 만들 때 다시 쓰는 메모리. 입력이 길수록 커져요.
GPU
많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
원문arXiv · On-Demand Attention: Language Models Know When to Recall같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기