인도 정부 문서 기반 RAG 성능 분석: 파서-청킹 상호작용 연구
Parser, Chunking, and Embedding Interactions in Retrieval-Augmented Generation over Indian Government Regulatory Documents
arXiv검색 증강 생성(RAG)의 핵심 요소인 파서, 청킹 전략, 임베딩 모델을 결합하여 인도 정부 규정 문서에 대한 성능을 종합적으로 분석한 연구입니다.
- 특정 구성 요소가 절대적으로 우세하지 않으며, 파서와 청킹 전략 간의 상호작용이 성능에 결정적임을 밝혀냈습니다. 검색 결과는 정보 손실보다 순위 품질 차이에 의해 좌우됩니다.
- RAG 시스템을 설계할 때는 개별 컴포넌트 성능만 볼 것이 아니라 전체 조합 관점에서 평가해야 함을 시사하며, 실질적인 파이프라인 가이드라인을 제시합니다.
- MPNet-base 같은 일부 모델은 표 기반 질문에서 성능 저하가 관찰되었으며, 연구진이 상세한 평가 프레임워크와 벤치마크를 공개했습니다.
(RAG) 시스템은 일반적으로 문서 파서, 청킹 전략, 모델 등 개별 구성 요소로 조합되지만, 이들 선택이 종합적으로 평가되는 경우는 드뭅니다. 본 연구는 이러한 간극을 메우기 위해 3가지 파서, 3가지 청킹 전략, 그리고 5가지 밀집(dense) 임베딩 모델과 BM25 희소 검색기를 포함한 총 72,000개의 결과 세트를 구축했습니다. 이 평가는 네 가지 구조적으로 다른 인도 중앙 정부 규제 문서를 대상으로 하며, 각 문서에 대해 800개의 질문 인스턴스를 사용했습니다.
연구 결과, 단일 리트리버 계열이 모든 문서에서 지배적이라는 결론은 나오지 않았습니다. 특히 파서와 청킹 전략의 선택 간 상호작용(interaction)이 성능에 결정적인 영향을 미치는 것으로 나타났습니다. 또한, 검색 과정에서의 정보 손실률이 98%를 넘어서는 경우, 리트리버의 차이는 정보 손실보다는 순위 지정 품질(ranking quality)에 의해 주로 좌우됨을 확인했습니다.
세부 분석 결과로는 MPNet-base 모델이 표 기반 질문에서 심각한 성능 저하를 보이는 실패 모드가 관찰되었습니다. 연구진은 임베딩 차원 및 청크 크기/겹침(overlap)에 대한 제거 실험(ablation)과 효율성/품질 파레토 분석을 추가로 보고했습니다. 이와 함께 전체 평가 하네스, 코퍼스 매니페스트, 그리고 800개 질문 를 공개하여 연구의 재현성을 높였습니다.
용어 풀이
- 검색 증강 생성
- 답하기 전에 관련 문서를 찾아 그 내용을 근거로 답하게 하는 방법.
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.