리서치 연구
CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge Bases
ARarXiv
기업 내부 문서 기반의 복잡한 Q&A 능력을 측정하는 대규모 벤치마크 'CorporateBench'가 공개되었습니다.
세 줄 요약
- 23만 건 이상의 문서와 시간적 변화를 반영한 지식 기반으로, 현실적인 기업 커뮤니케이션 환경을 재현합니다.
- 기존 벤치마크의 단순성을 넘어, 실제 기업 환경에서 요구되는 복합적이고 논리적인 추론 능력을 평가하는 핵심 지표입니다.
- 테스트 결과, 입력 데이터 크기가 커질수록 LLM의 성능이 점차 하락하는 경향을 보여, 모델 고도화가 필수적임을 입증했습니다.
기업 내부 문서 기반의 복잡한 Q&A 능력을 측정하는 대규모 벤치마크 'CorporateBench'가 공개되었습니다.