리서치 연구
AI 벤치마크 평가를 위한 살아있는 데이터베이스, Benchmark Radar
Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation
arXivLLM 및 AI 시스템의 평가 자료를 체계적으로 찾고 점수 근거를 이해하기 위한 검색 엔진입니다.
세 줄 요약
- LLM 평가, 코딩, 추론 등 다양한 분야의 벤치마크를 포괄하며, 매일 37개 소스에서 정보를 수집합니다.
- 단순 점수 비교를 넘어, 평가 출처와 근거를 추적하고 포화도, 트렌드 등 심층 분석이 가능합니다.
- 웹 대시보드와 CLI를 통해 최신 연구 동향을 파악하고 새로운 평가 설계를 검증할 수 있습니다.
Radar는 및 기타 AI 시스템의 평가 자료를 검색하고 점수 근거를 이해할 수 있도록 설계된 살아있는 데이터베이스이자 검색 엔진입니다. 이 시스템은 LLM 평가, 사용 벤치마크, 코딩, 추론, 안전성, 도메인별 평가 등 광범위한 분야의 AI 벤치마크를 포괄합니다.
시스템은 매일 37개의 소스(13개 직접 커넥터 및 24개 연구/엔지니어링 피드)에서 벤치마크 논문, 저장소, 데이터셋 등의 정보를 발견하며 이를 통합합니다. 현재 카탈로그에는 4개의 벤치마크 카탈로그에서 추출된 1,283개의 소스 기록과 790개 기록에 대한 12,916개의 수치 관측치가 포함되어 있습니다.
사용자는 이 시스템을 통해 이전 기술(prior-art) 검색을 수행하여 새로운 평가를 설계할 때의 증거를 검사할 수 있습니다. 웹 대시보드는 벤치마크 리더보드, 측정된 사용 대비 점수의 파레토 프론티어 뷰, 포화도 및 트렌드 뷰 등을 제공하며, 오프라인 질의를 위한 명령줄 인터페이스(CLI)와 재현 가능한 분석 기능도 지원합니다.
용어 풀이
- Benchmark
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.