장문 QA 시스템에서 컨텍스트 계획과 검색 성능 비교 연구
When Learned Context Planning Fails to Beat Strong Retrieval: A Controlled Study of Planning, Routing, and Reranking for Long-Context QA
arXiv연구진이 긴 문맥 질의응답(QA) 시스템에서 '학습된 컨텍스트 계획' 기능이 강력한 정보 검색보다 우수한지 통제 실험으로 검증했습니다.
- 실험 결과, 높은 토큰 예산이나 분리된 테스트 데이터에서는 기존의 강력한 검색(Retrieval) 기반 방법들이 여전히 가장 높은 정확도를 보였습니다.
- 이는 장문 QA 시스템 설계 시 컨텍스트 선택 계획 기능이 검색 자체를 대체하기보다 보조적인 '약한 관련성 신호'로 활용되어야 함을 시사합니다.
- 계획 기법의 효과는 토큰 예산이나 데이터셋 구성에 따라 달라지므로, 강력한 정보 검색 방법론을 완전히 대체하기에는 명확한 한계가 있습니다.
본 연구는 학습된 컨텍스트 선택 계획(Learned Context Planning) 기능이 강력한 정보 검색(Retrieval), 라우팅, 재순위 지정 등 통제된 방법론보다 우수한지 검증하는 것을 목표로 합니다. 이 진단은 503개의 LongBench-v2 MCQ 질문을 사용하여 Qwen2.5-7B-Instruct 모델을 기반으로 진행되었습니다.
실험 결과에 따르면, 특정 조건에서 강력한 검색 기반 방법들이 여전히 높은 정확도를 유지했습니다. 예를 들어, 18k-character 예산에서는 앵커드 하이브리드 검색이 36.18%의 정확도를 기록했으며, 최적의 직접 계획 기반 방법은 34.19%를 달성했습니다. 특히 미사용 테스트 세트(152문제)에서는 앵커드 하이브리드가 42.11%로 더 높은 수치를 보였습니다.
연구진은 이러한 결과를 바탕으로, 학습된 계획 기능이 강력한 검색을 대체하기보다는 '약한 관련성 신호'로서의 역할을 하는 것이 적절하다고 결론지었습니다. 이는 장문 QA 시스템 설계 시 컨텍스트 선택 계획 기능을 보조적인 수단으로 활용해야 함을 시사합니다.