터키 개발, 유형별 의사결정 능력을 측정하는 벤치마크 'HakemBench'
HakemBench: A Turkish Benchmark of Typed Decisions
arXiv터키에서 개발된 'HakemBench'는 모델이 주어진 텍스트와 질문에 대해 여러 선택지별 확률을 계산하는 판단 능력을 측정하는 새로운 벤치마크입니다.
대규모 언어 모델이 사실 확인이나 법률 라우팅 같은 다양한 상황에서 얼마나 신뢰성 있고 안전하게 판단하는지 객관적으로 비교할 수 있는 기준을 제시해요.
- 사실 확인, 법률 라우팅, 스팸 방지 등 총 7가지 분야를 포괄하며, 결정 품질과 보정성 등을 종합적으로 평가하는 복합적인 시스템을 갖추고 있습니다.
- 다양한 유형의 질문에 대한 모델의 판단 능력을 객관적이고 체계적으로 비교할 수 있어, 대규모 언어 모델(LLM)의 신뢰성과 안전성을 검증하는 중요한 기준이 될 것입니다.
- 다만, 이 벤치마크의 정답은 사람이 직접 검증한 것이 아니라 AI 모델 간 비교를 통해 생성되었으며, 이전 테스트 결과가 데이터에 영향을 주어 편향성이 있을 수 있습니다.
HakemBench는 모델이 주어진 텍스트와 질문, 그리고 고정된 선택지 세트를 읽고 각 선택지에 대한 확률을 반환하도록 설계된 터키 기반의 유형별 의사결정(typed decisions) 입니다. 이 버전 1.0은 CC BY 4.0 하에 공개되었으며, 사실 확인 분류, 교육, 가드레일, 법률 라우팅, 중재, 스팸 및 피싱, 고객 지원 등 총 7가지 트랙에서 2,346개의 항목과 4,275개의 선택지, 예/아니오, 점수 질문으로 구성되어 있습니다.
이 벤치마크는 결정 품질(macro F1), 보정성(정규화된 Brier 점수), 그리고 선택적 자동화(정규화된 일반화 위험-커버리지 곡선 아래 면적)를 측정합니다. 이 세 가지 지표를 기하 평균으로 결합하여 결과를 보고하며, 2,000번의 부트스트랩 드로우에서 얻은 구간을 함께 제시합니다. 또한 선택지 순서나 패러프레이즈 등 다양한 변형에 대한 성능도 테스트할 수 있습니다.
다만, HakemBench의 골드 레이블(정답)은 사람이 직접 검증한 것이 아니라 한 AI 모델 계열의 블라인드 통과 결과와 다른 모델 계열의 패널 투표를 비교하여 생성되었습니다. 이로 인해 이전 테스트 결과가 학습 데이터에 영향을 주었을 수 있으며, 특정 트랙(예: 가드레일, 중재, 고객 지원)의 점수는 해당 트랙만으로 평가했을 때 0.678이라는 복합 점수를 기록하기도 했습니다.
용어 풀이
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
HakemBench는 어떤 종류의 벤치마크인가요?
주어진 텍스트와 질문, 그리고 선택지 세트를 읽고 각 선택지에 대한 확률을 반환하도록 설계된 터키 기반의 유형별 의사결정 벤치마크예요. 사실 확인 분류, 법률 라우팅, 스팸 및 피싱 등 총 7가지 트랙으로 구성되어 있어요.
모델의 성능은 어떤 지표들로 측정하나요?
결정 품질(macro F1), 보정성(Brier 점수), 선택적 자동화(일반화 위험-커버리지 곡선 아래 면적) 세 가지 지표를 기하 평균으로 결합하여 결과를 보고해요. 또한 다양한 변형에 대한 성능도 테스트할 수 있어요.
이 벤치마크의 정답은 누가 검증했나요?
정답(골드 레이블)은 사람이 직접 검증한 것이 아니라, 한 AI 모델 계열의 블라인드 통과 결과와 다른 대규모 언어 모델 패널 투표를 비교하여 생성되었어요. 이 때문에 이전 테스트 결과가 데이터에 영향을 주었을 수 있어요.