강력한 RAG 기반에서 질문 재작성 기법의 보완적 활용 연구 — AI 생성 일러스트AI 일러스트
리서치 연구

강력한 RAG 기반에서 질문 재작성 기법의 보완적 활용 연구

Better Together: Complementary Query Rewriting Under a Strong RAG Baseline

arXiv9월 9일 발표 · 2분 · 심사 전 논문

기존 검색 성능이 높은 RAG 시스템에서 사용자 질문을 여러 방식으로 재작성하여 검색하는 방식의 효과를 검증했습니다.

세 줄 요약arXiv 원문 기반
  1. 단일한 재작성 전략만으로는 개선 폭이 미미했으나, 서로 다른 방법들을 조합할 때 시너지가 발생하며 전반적인 성능 향상이 크게 나타났습니다.
  2. 모든 질문에 무조건 적용하기보다, 기본 검색 모델의 점수가 낮을 때만 보조적으로 활용하는 '비용 인식 라우팅'이 가장 효율적입니다.
  3. 결론적으로, 질문 재작성은 독립적인 대체재가 아닌, 부족한 부분을 채워주는 보완적 커버리지 소스로 접근해야 합니다.

Retrieval-Augmented Generation() 성능 향상을 위해 사용자 질문을 여러 변형으로 재작성하여 검색하는 방식이 효과적인지 검증했다. 본 연구는 BGE dense retrieval, cross-encoder reranking, MMR diversification 등 강력한 검색 파이프라인 위에서 네 가지 질의 재작성 전략(S1-S4)과 두 개의 기준 모델(HyDE, Query2Doc)을 세 데이터셋(HotpotQA, AmbigNQ, EnterpriseRAG-Bench)에 걸쳐 비교했다.

단일한 재작성 전략만으로는 개선 폭이 제한적이었으나, 여러 방법을 조합할 때 시너지가 발생함을 확인했다. 예를 들어, 네 가지 방법의 사후 통합(S1+S3+S4+HyDE)은 엔터프라이즈 데이터에서 HIT@10을 기준선 대비 +12.5 포인트 (51.70 vs 39.22) 향상시켰다. 이는 조합적 접근이 주요 성능 동인임을 보여준다.

비용 효율성을 고려하여, 기본 검색 모델의 top-1 점수가 낮을 때만 재작성 기능을 실행하는 '신뢰도 게이트 라우터'를 시뮬레이션했다. 이 라우터는 엔터프라이즈 전체 병합 이득 중 약 절반(+4.3 HIT@10)을 포착했으며, 재작성 비용은 쿼리의 <40%에서만 발생시켰다. 또한 F1 점수를 +1.92 (p<0.01) 개선하는 것이 확인되었다.

용어 풀이

RAG
답하기 전에 관련 문서를 찾아 그 내용을 근거로 답하게 하는 방법.
LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
원문arXiv · Better Together: Complementary Query Rewriting Under a Strong RAG Baseline같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv