모델 연구

ESQ-Bench: A Multi-Tier Enterprise Oracle Benchmark for Evaluating NL2SQL Dialect Generalization and Silent Semantic Divergence

ARarXiv8월 26일 발표 · 1분 · 심사 전 논문

기존 학술 환경의 한계를 넘어선 기업용 데이터베이스를 평가하는 새로운 벤치마크 ESQ-Bench가 공개되었다.

세 줄 요약arXiv 원문 기반
  1. ESQ-Bench는 오라클 기반으로 구축된 6개 스키마(465 테이블, 164,682 행)와 세 가지 복잡도 계층을 포함하며 네 가지 평가 지표를 사용한다.
  2. GPT-4o가 Tier-1에서 실행 정확도 79.8%를 기록한 반면, Claude Sonnet 4.6은 모든 계층에서 더 높은 성능을 달성했다.
  3. 로컬 Llama 3.2는 은행 전체에서 13.3%의 실행 정확도를 보여, 폐쇄형 API 모델과 오픈 가중치 기반 모델 간 격차를 드러낸다.

기존 학술 환경의 한계를 넘어선 기업용 데이터베이스를 평가하는 새로운 벤치마크 ESQ-Bench가 공개되었다.

원문arXiv · ESQ-Bench: A Multi-Tier Enterprise Oracle Benchmark for Evaluating NL2SQL Dialect Generalization and Silent Semantic Divergence같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기