Fathom: 희소 디코딩을 위한 쿼리별 읽기 깊이 기술 — AI 생성 일러스트AI 일러스트
리서치 연구

Fathom: 희소 디코딩을 위한 쿼리별 읽기 깊이 기술

Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches

arXiv9월 17일 발표 · 1분 · 심사 전 논문

Fathom은 장시간 에이전트 세션에서 발생하는 KV 캐시 검색 병목을 해결하기 위해, 각 쿼리가 필요한 채널별 비트 수를 스스로 결정하는 새로운 키 스캔 방식을 제안합니다.

세 줄 요약arXiv 원문 기반
  1. 100만 토큰 디코딩 단계에서 기존 방식 대비 GPU 시간이 1.67배 빨랐으며, 동일 시간 동안 데이터 읽기량을 18% 줄이면서도 낮은 오류율을 유지했습니다.
  2. 이는 LLM의 장시간 에이전트 작업이나 코딩 세션 등 대규모 메모리 병목 환경에서 실용성과 안정성을 획기적으로 높여줄 것으로 기대됩니다.
  3. Fathom은 4비트로 양자화된 캐시를 전제로 하며, 만약 인덱스 자체가 이미 GPU 메모리에 상주한다면 성능 향상을 기대하기 어렵다는 기술적 한계가 있습니다.

Fathom은 장시간 에이전트 세션에서 발생하는 KV 캐시 검색 병목을 해결하기 위해, 각 쿼리가 필요한 채널별 비트 수를 스스로 결정하는 새로운 키 스캔 방식을 제안합니다.

원문arXiv · Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv