강력한 RAG 기반에서 질문 재작성 기법의 보완적 활용 연구
Better Together: Complementary Query Rewriting Under a Strong RAG Baseline
arXiv기존 검색 성능이 높은 RAG 시스템에서 사용자 질문을 여러 방식으로 재작성하여 검색하는 방식의 효과를 검증했습니다.
- 단일한 재작성 전략만으로는 개선 폭이 미미했으나, 서로 다른 방법들을 조합할 때 시너지가 발생하며 전반적인 성능 향상이 크게 나타났습니다.
- 모든 질문에 무조건 적용하기보다, 기본 검색 모델의 점수가 낮을 때만 보조적으로 활용하는 '비용 인식 라우팅'이 가장 효율적입니다.
- 결론적으로, 질문 재작성은 독립적인 대체재가 아닌, 부족한 부분을 채워주는 보완적 커버리지 소스로 접근해야 합니다.
Retrieval-Augmented Generation() 성능 향상을 위해 사용자 질문을 여러 변형으로 재작성하여 검색하는 방식이 효과적인지 검증했다. 본 연구는 BGE dense retrieval, cross-encoder reranking, MMR diversification 등 강력한 검색 파이프라인 위에서 네 가지 질의 재작성 전략(S1-S4)과 두 개의 기준 모델(HyDE, Query2Doc)을 세 데이터셋(HotpotQA, AmbigNQ, EnterpriseRAG-Bench)에 걸쳐 비교했다.
단일한 재작성 전략만으로는 개선 폭이 제한적이었으나, 여러 방법을 조합할 때 시너지가 발생함을 확인했다. 예를 들어, 네 가지 방법의 사후 통합(S1+S3+S4+HyDE)은 엔터프라이즈 데이터에서 HIT@10을 기준선 대비 +12.5 포인트 (51.70 vs 39.22) 향상시켰다. 이는 조합적 접근이 주요 성능 동인임을 보여준다.
비용 효율성을 고려하여, 기본 검색 모델의 top-1 점수가 낮을 때만 재작성 기능을 실행하는 '신뢰도 게이트 라우터'를 시뮬레이션했다. 이 라우터는 엔터프라이즈 전체 병합 이득 중 약 절반(+4.3 HIT@10)을 포착했으며, 재작성 비용은 쿼리의 <40%에서만 발생시켰다. 또한 F1 점수를 +1.92 (p<0.01) 개선하는 것이 확인되었다.
용어 풀이
- RAG
- 답하기 전에 관련 문서를 찾아 그 내용을 근거로 답하게 하는 방법.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.