RAG 효율성을 높이는 적응형 메모리 토큰 할당 기술 — AI 생성 일러스트AI 일러스트
리서치 연구

RAG 효율성을 높이는 적응형 메모리 토큰 할당 기술

AdaMem: Adaptive Memory Token Allocation for Soft Compression in Retrieval-Augmented Generation

arXiv9월 22일 발표 · 3분 · 심사 전 논문

기존 검색 증강 생성(RAG)은 모든 문서를 동일하게 처리하는 비효율성이 있었습니다. AdaMem은 질문과의 관련성을 측정하여 중요도가 높은 문서에만 메모리 토큰을 할당하는 방식을 제안합니다.

세 줄 요약arXiv 원문 기반
  1. 관련성 점수를 기반으로 토큰 배분을 최적화해 검색 정확도를 크게 높였으며, 전체 문맥 사용 대비 최대 4배 낮은 지연 시간으로 고성능을 유지합니다.
  2. 이 기술은 메모리 자원이 제한적이거나 검색해야 할 정보 풀이 방대한 대규모 LLM 시스템에 필수적입니다. 관련성 기반의 효율적인 정보 처리를 가능하게 합니다.
  3. 특히 검색할 문서가 방대하고 할당 가능한 메모리 토큰 예산이 빠듯한 환경에서 가장 큰 성능 향상과 자원 절감을 기대할 수 있습니다.

(RAG)은 검색된 증거를 통해 언어 모델의 성능을 향상시키지만, 많은 양의 긴 문단을 처리하는 과정은 비용이 많이 들고 방해되는 정보를 포함할 수 있습니다. 기존 방식들은 모든 보존된 문단에 동일한 수의 메모리 을 할당하는 경향이 있었습니다. 이에 연구진은 관련성 추정치를 활용하여, 고정된 메모리 토큰 예산을 쿼리에 따라 적응적으로 할당하는 'AdaMem'이라는 관련성 기반 소프트 압축 프레임워크를 제안했습니다.

AdaMem은 공유되는 쿼리 조건부 압축기(shared query-conditioned compressor)를 통해 연속적인 문단 메모리와 관련성 점수를 단일 패스에서 생성합니다. 이 결정론적 할당 규칙에 따라, 시스템은 높은 점수를 받은 문단에 더 많은 메모리 토큰을 할당하고 낮은 점수의 문단은 생략할 수 있습니다. 이 방식은 기존의 균일한 할당(uniform allocation) 대비 성능 향상을 보였으며, 특히 서브스트링 매치에서 최대 3.2점 (5.5%)까지 개선되는 결과를 나타냈습니다.

AdaMem은 메모리 자원이 제한적이거나 검색해야 하는 정보 풀이 방대한 대규모 시스템에 효과적입니다. 이 방법은 전체 문맥을 사용하는 기준선 대비 최대 4배 낮은 추론 지연 시간으로 답변 품질을 유지할 수 있습니다. 또한, AdaMem은 균일 압축 방식과 유사한 효율성 프로파일을 유지하면서도 높은 성능 향상을 달성하여, 관련성 기반 메모리 할당의 효과를 입증했습니다.

용어 풀이

검색 증강 생성
답하기 전에 관련 문서를 찾아 그 내용을 근거로 답하게 하는 방법.
임베딩
글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
원문arXiv · AdaMem: Adaptive Memory Token Allocation for Soft Compression in Retrieval-Augmented Generation같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv