장기 AI 에이전트 실패 원인 진단을 위한 지속적 검색 프레임워크 — AI 생성 일러스트AI 일러스트
리서치 연구

장기 AI 에이전트 실패 원인 진단을 위한 지속적 검색 프레임워크

Root-Cause Attribution Is a Search Problem: Continual Search for Long-Horizon Agent Failures

arXiv9월 15일 발표 · 2분 · 심사 전 논문

장기 AI 에이전트의 실패 원인(RCA) 진단은 방대한 로그 데이터 속에서 핵심 증거를 찾아내는 것이 필수적입니다. 기존 LLM 방식은 정보가 분산되어 있어 정확도가 낮다는 한계가 있습니다.

세 줄 요약arXiv 원문 기반
  1. 연구진은 'Continual Search'라는 반복 검색 프레임워크를 제안했습니다. 이는 진단기가 여러 차례에 걸쳐 미해결 증거를 지속적으로 탐색하도록 유도하여, 기존 방식 대비 높은 진단 성능을 입증합니다.
  2. 이 연구는 AI 신뢰성 확보 측면에서 단순히 거대한 모델 자체보다, 실패 원인을 깊이 있게 '탐색하는 메커니즘'의 중요성이 더 크다는 점을 시사합니다.
  3. 대규모 테스트베드 MegaRCA-Mix를 제시하며, 실제 산업 적용 시에도 장기 실행 과정과 실패 사례가 포함된 방대한 데이터셋 구축이 핵심 과제임을 강조합니다.

가 장기 작업을 수행하며 생성하는 방대한 실행 로그를 진단하여 신뢰성을 확보하는 것이 중요해졌다. 그러나 데이터 규모가 커지면서 수동 검토는 비현실적이며, 기존의 자동화된 근본 원인 분석(RCA) 방법은 관련 정보가 희소하고 여러 행동에 걸쳐 분산되어 있어 낮은 진단 정확도를 보이는 한계가 있다.

연구진은 이러한 문제를 해결하기 위해 'Continual Search'라는 반복적인 프레임워크를 제안했다. 이 방식은 진단기가 단일 판단에 의존하는 것이 아니라, 연속된 턴을 거치며 미해결된 진단 증거를 지속적으로 탐색하도록 유도하여 RCA 성능을 개선한다.

연구진은 대규모 테스트베드인 MegaRCA-Mix를 도입하여 RCA 성능을 평가했으며, 이 테스트베드는 장기 실행 과정과 실패 사례가 포함된 50개의 인간 주석화된 실패 시도를 제공한다. Continual Search는 GPT-5.5의 F1 점수를 $0.349$에서 $0.498$로 40% 이상 향상시키는 등 성능 개선을 입증했다.

용어 풀이

AI 에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
원문arXiv · Root-Cause Attribution Is a Search Problem: Continual Search for Long-Horizon Agent Failures같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv