벡터 DB 없이 사람이 읽듯 추론하는 RAG 엔진 PageIndex 소개 — AI 생성 일러스트
개발도구 도구

벡터 DB 없이 사람이 읽듯 추론하는 RAG 엔진 PageIndex 소개

VectifyAI/PageIndex

GitHub9월 29일 발표 · 3분

복잡한 문서 분석에 혁신을 가져온 PageIndex는 기존의 벡터 DB 대신 계층적 트리 인덱스를 사용합니다. 이는 사람이 보고서를 읽듯, LLM이 추론 과정을 거쳐 정보를 검색하는 방식입니다.

세 줄 요약GitHub 원문 기반
  1. 단순히 단어의 유사성을 찾는 것이 아닌 '관련성'에 초점을 맞추기 때문에, 법률/재무 등 전문 문서에서 높은 정확도와 출처를 명확하게 추적할 수 있습니다.
  2. 방대한 양의 문서를 다룰 때 발생하는 컨텍스트 창 제한 및 과도한 비용 문제를 해결하며, 검색 과정 전체가 투명하고 신뢰성 높습니다.
  3. 텍스트 PDF는 로컬 모드로 사용 가능하지만, 스캔 이미지나 대규모 코퍼스 분석은 클라우드 서비스(PageIndex Cloud)를 통해 파일 시스템 레벨까지 확장할 수 있습니다.

PageIndex는 기존의 를 사용하지 않는(vectorless), 추론 기반 엔진입니다. 이 시스템은 단순한 의미적 유사성 검색에 의존하기보다, 사람이 보고서를 읽듯이 계층적 트리 인덱스를 구축하고 이 이를 따라 적으로 탐색하며 정보를 검색합니다. 이러한 접근 방식은 법률 문서나 재무 보고서와 같은 복잡하고 긴 전문 문서에서 높은 관련성을 확보할 수 있으며, 결과에 대한 출처를 명확하게 추적(traceable)하고 설명 가능하도록 만듭니다.

PageIndex는 문서를 인덱싱할 때 트리 구조를 생성하며, 검색 과정에서는 LLM이 이 트리를 따라 정보를 찾아냅니다. 따라서 금융 보고서, 법률 문서, 기술 매뉴얼 등 장문의 전문 자료에 특히 적합합니다. 사용 환경에 따라 로컬 모드에서 텍스트 기반 PDF 처리가 가능하지만, 스캔 이미지나 대규모 코퍼스 분석을 위해서는 클라우드 서비스(PageIndex Cloud)를 활용할 수 있습니다. 클라우드는 파싱, OCR, 이미지 이해 등 다양한 기능을 지원하며 파일 시스템 레벨까지 확장하여 전체 코퍼스를 추론할 수 있게 합니다.

성능 및 비용 효율성 측면에서도 강점을 보입니다. PageIndex는 FinanceBench 평가에서 98.7%의 정확도를 달성하며 벡터 기반 RAG(50%)를 크게 능가했습니다. 또한, 검색 시 전체 PDF 파일을 컨텍스트로 전달하는 방식과 비교했을 때, PageIndex는 추론 과정에서 도달한 노드만 읽기 때문에 비용 효율적이며, 문서 크기에 따른 과도한 비용 증가 문제를 해결합니다.

용어 풀이

벡터 데이터베이스
임베딩을 저장하고 의미가 비슷한 항목을 빠르게 찾아 주는 데이터베이스.
RAG
답하기 전에 관련 문서를 찾아 그 내용을 근거로 답하게 하는 방법.
LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
원문GitHub · VectifyAI/PageIndex
원문 보기GitHub