데이터베이스와 웹 검색을 결합한 하이브리드 심층 연구 평가 — AI 생성 일러스트AI 일러스트
AI 에이전트 연구

데이터베이스와 웹 검색을 결합한 하이브리드 심층 연구 평가

Benchmarking Hybrid Deep Research Across Database Querying and Web Search

arXiv9월 10일 발표 · 3분 · 심사 전 논문

자율 에이전트의 심층 연구 능력을 측정하기 위해 웹 검색과 SQL을 결합한 새로운 벤치마크 'HybridDeepResearch'가 제시되었습니다.

세 줄 요약arXiv 원문 기반
  1. 최신 거대 모델들(GPT-5 등)도 이 복합 과제에서 약 50~54% 수준에 그쳤으며, 특히 방향성 추론이 가장 어려운 난제로 확인되었습니다.
  2. 실제 문제 해결을 위해서는 웹상의 비정형 정보와 데이터베이스의 정형 정보를 오가며 제약 조건을 유지하는 '정보 연결 능력' 확보가 필수적입니다.
  3. 본 연구는 구조화된 데이터와 비구조화 데이터를 통합할 때 발생하는 '제약 조건 손실(Constraint Loss)'이 현재 에이전트 시스템의 핵심 난제임을 보여줍니다.

자율 가 개방형 웹을 순환하며 정보를 종합하는 '심층 연구' 분야에서 큰 발전을 이루었지만, 실제 문제 해결은 단일 환경에 국한되지 않습니다. 복잡한 분석 과제는 모호한 비정형 텍스트(예: 웹)와 고도로 정밀한 구조화된 데이터(예: 관계형 데이터베이스)의 증거를 결합하는 능력을 요구합니다. 기존 들은 이러한 양식을 개별적으로 평가하여, 시스템 간에 증거를 이동할 때 제약 조건을 유지하는 핵심적인 '정보 연결 능력'을 포착하지 못했습니다.

이러한 문제를 해결하기 위해 HybridDeepResearch가 소개되었습니다. 이는 웹 검색과 SQL 사용을 모두 요구하며 완전하고 검증 가능한 답변을 도출해야 하는 최초의 심층 연구 벤치마크입니다. 이 벤치마크는 LiveSQLBench-Base-Lite 데이터베이스와 공개 웹 코퍼스를 기반으로 하며, 총 380개의 도구 의존형 과제를 포함합니다. 또한 SQL2S, S2SQL, 병렬(Parallel)의 세 가지 추론 패턴을 다룹니다.

다양한 에이전트 스캐폴드 하에서 진행된 평가 결과에 따르면, GLM-5.2, Claude-Sonne t-4.6, GPT-5와 같은 최신 모델들조차 어려운 부분 집합(hard subset)에서 약 50~54%의 Pass@8 점수에 그쳤습니다. 특히 병렬 교차보다 방향성 추론이 훨씬 어렵다는 결과가 나타나, 구조화된 정보 공간과 비구조화된 정보 공간을 제약 조건 손실 없이 연결하는 것이 에이전트 시스템의 주요 난제임을 보여줍니다.

용어 풀이

에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · Benchmarking Hybrid Deep Research Across Database Querying and Web Search같은 주제 가이드 · 바로 써 보기매일 아침 소식, 예약 작업으로 받기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv