데이터베이스와 웹 검색을 결합한 하이브리드 심층 연구 평가
Benchmarking Hybrid Deep Research Across Database Querying and Web Search
arXiv자율 에이전트의 심층 연구 능력을 측정하기 위해 웹 검색과 SQL을 결합한 새로운 벤치마크 'HybridDeepResearch'가 제시되었습니다.
- 최신 거대 모델들(GPT-5 등)도 이 복합 과제에서 약 50~54% 수준에 그쳤으며, 특히 방향성 추론이 가장 어려운 난제로 확인되었습니다.
- 실제 문제 해결을 위해서는 웹상의 비정형 정보와 데이터베이스의 정형 정보를 오가며 제약 조건을 유지하는 '정보 연결 능력' 확보가 필수적입니다.
- 본 연구는 구조화된 데이터와 비구조화 데이터를 통합할 때 발생하는 '제약 조건 손실(Constraint Loss)'이 현재 에이전트 시스템의 핵심 난제임을 보여줍니다.
자율 가 개방형 웹을 순환하며 정보를 종합하는 '심층 연구' 분야에서 큰 발전을 이루었지만, 실제 문제 해결은 단일 환경에 국한되지 않습니다. 복잡한 분석 과제는 모호한 비정형 텍스트(예: 웹)와 고도로 정밀한 구조화된 데이터(예: 관계형 데이터베이스)의 증거를 결합하는 능력을 요구합니다. 기존 들은 이러한 양식을 개별적으로 평가하여, 시스템 간에 증거를 이동할 때 제약 조건을 유지하는 핵심적인 '정보 연결 능력'을 포착하지 못했습니다.
이러한 문제를 해결하기 위해 HybridDeepResearch가 소개되었습니다. 이는 웹 검색과 SQL 사용을 모두 요구하며 완전하고 검증 가능한 답변을 도출해야 하는 최초의 심층 연구 벤치마크입니다. 이 벤치마크는 LiveSQLBench-Base-Lite 데이터베이스와 공개 웹 코퍼스를 기반으로 하며, 총 380개의 도구 의존형 과제를 포함합니다. 또한 SQL2S, S2SQL, 병렬(Parallel)의 세 가지 추론 패턴을 다룹니다.
다양한 에이전트 스캐폴드 하에서 진행된 평가 결과에 따르면, GLM-5.2, Claude-Sonne t-4.6, GPT-5와 같은 최신 모델들조차 어려운 부분 집합(hard subset)에서 약 50~54%의 Pass@8 점수에 그쳤습니다. 특히 병렬 교차보다 방향성 추론이 훨씬 어렵다는 결과가 나타나, 구조화된 정보 공간과 비구조화된 정보 공간을 제약 조건 손실 없이 연결하는 것이 에이전트 시스템의 주요 난제임을 보여줍니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.