리서치 연구
검색 증강 생성(RAG)을 위한 엔티티 인식 분할 접근법 EAR
EAR: Entity-Aware Partitioning Approach for Retrieval-Augmented Generation Development
arXiv검색 증강 생성(RAG)의 핵심 과제인 코퍼스 분할 방식을 개선하기 위해 엔티티 인식 분할 접근 방식(EAR)이 제안되었습니다.
세 줄 요약
- EAR은 질문, 선택지, 코퍼스에서 핵심 앵커를 추출하여 관련성 높은 국소적 창을 검색하고 이를 요약해 부모 구절에 연결하는 방식으로 작동합니다.
- 기존 고정 크기 청크 방식 대비 검색된 정보 단어 수를 최대 40%까지 줄여, 지식 기반 질문 답변 자료의 간결성을 높입니다.
- 다만, 성능 변화는 관찰되었으나 통계적 유의미성은 확인되지 않았으며, 핵심 앵커 추출기는 도메인 특화적이므로 별도 검증이 필수입니다.
지식 기반 질문 답변 능력을 향상시키는 (RAG)에서, 원본 코퍼스를 어떤 단위로 분할하는지가 중요한 설계 과제입니다. 기존의 고정 크기 청크 방식은 질문과의 관련성이 명시적이지 않은 긴 구절을 반환하는 경향이 있습니다. 이러한 한계를 극복하기 위해 EAR(Entity-Aware Partitioning) 접근법이 제안되었으며, 이는 다중 선택형 질문 답변(MCQA)에 초점을 맞춥니다.
EAR은 먼저 질문, 답변 옵션, 그리고 코퍼스에서 정규화된 표면 앵커를 추출합니다. 이후 이 앵커와 일치하는 코퍼스 주변의 국소적 창을 검색하고, 이를 추출 요약(extractive summary) 방식을 통해 더 큰 부모 구절에 연결할 수 있습니다.
연구진은 MMLU 스타일의 153개 질문으로 구성된 세트를 사용하여 EAR을 평가했습니다. 그 결과, 기존 청크 방식 대비 검색되는 단어 수를 최대 37.5%에서 40.2%까지 줄이는 효과를 확인했습니다. 다만, 관찰된 정확도 변화는 통계적으로 유의미하지 않았으며, EAR이 사용하는 규칙 기반 앵커 추출기는 도메인 특화적이므로 별도의 검증 과정이 필수적이라고 강조합니다.
용어 풀이
- 검색 증강 생성
- 답하기 전에 관련 문서를 찾아 그 내용을 근거로 답하게 하는 방법.