리서치 연구
Fathom: 희소 디코딩을 위한 쿼리별 읽기 깊이 기술
Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches
arXivFathom은 장시간 에이전트 세션에서 발생하는 KV 캐시 검색 병목을 해결하기 위해, 각 쿼리가 필요한 채널별 비트 수를 스스로 결정하는 새로운 키 스캔 방식을 제안합니다.
세 줄 요약
- 100만 토큰 디코딩 단계에서 기존 방식 대비 GPU 시간이 1.67배 빨랐으며, 동일 시간 동안 데이터 읽기량을 18% 줄이면서도 낮은 오류율을 유지했습니다.
- 이는 LLM의 장시간 에이전트 작업이나 코딩 세션 등 대규모 메모리 병목 환경에서 실용성과 안정성을 획기적으로 높여줄 것으로 기대됩니다.
- Fathom은 4비트로 양자화된 캐시를 전제로 하며, 만약 인덱스 자체가 이미 GPU 메모리에 상주한다면 성능 향상을 기대하기 어렵다는 기술적 한계가 있습니다.
Fathom은 장시간 에이전트 세션에서 발생하는 KV 캐시 검색 병목을 해결하기 위해, 각 쿼리가 필요한 채널별 비트 수를 스스로 결정하는 새로운 키 스캔 방식을 제안합니다.