검색 에이전트의 추론 과정을 분석하는 'SearchAtlas' 프레임워크
SearchAtlas: Analyzing Agentic Search Strategies via Evidential Query Graphs
arXiv기존에는 LLM 검색 에이전트의 성능을 최종 답변 정확도로만 평가했지만, 이 연구는 복잡한 검색 과정 자체에 존재하는 문제점을 분석하는 새로운 방법을 제시합니다.
- 'SearchAtlas' 프레임워크를 도입하여 원시적인 검색 경로 전체를 구조적 그래프로 변환하고, 근거(증거)가 질문부터 최종 답변까지 어떻게 전파되는지 추적할 수 있습니다.
- 이 분석은 단순히 정답 여부를 넘어, 과정상의 논리적 오류나 근거 부족 같은 '프로세스 실패'를 진단하여 AI 결과물의 해석 가능성을 크게 높여줍니다.
- 특히 최종 답변의 정확도와는 별개로, 프로세스 단계에서 발견되는 문제점들을 포착하는 '진단 점수'가 유용하며 그 가치를 입증했습니다.
기존에는 검색 의 성능을 최종 답변 정확도에만 초점을 맞춰 평가해 왔으나, 본 연구는 질문에 대한 신뢰할 수 있는 근거(evidence)가 어떻게 검색되는지 과정을 분석하는 새로운 방법을 제시합니다. 이를 위해 'SearchAtlas'라는 프레임워크를 도입하여 원시적인 검색 경로 전체를 구조화된 그래프로 변환하며, 이 그래프의 엣지는 질의에서 증거가 최종 답변으로 전파되는 방식을 나타냅니다.
이 자동 파싱 파이프라인은 인간이 주석을 단 그래프와 비교했을 때 평균 엣지 F1 점수 86.0%를 달성하며 높은 일관성을 보였습니다. 연구진은 이 프레임워크를 활용하여 다섯 가지 검색 에이전트를 세 가지 에서 분석했으며, 이를 통해 각 에이전트별로 체계적인 검색 규모와 증거 집계 방식의 차이를 밝혀냈습니다.
SearchAtlas는 답변을 뒷받침하는 근거가 파편화되어 있거나(fragmented answer support), 질문 제약 조건이 답변에 도달하지 못했거나, 검증되지 않은 지식이 응답에 포함되는 등의 '프로세스 실패'를 노출합니다. 특히 이러한 프로세스 진단 점수가 최종 답변의 정확도와 불일치하는 사례들을 분석한 결과, 이 과정상의 문제점들이 단순히 정답 여부만으로 판단할 때보다 더 유용한 해석 가능성을 제공함을 입증했습니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.