모델 연구
Evaluating Language Models in Realistic Conversational Contexts
ARarXiv
대규모 언어 모델(LLM)의 다중 턴 상호작용 평가를 위해 UPHELD라는 새로운 벤치마크를 제시했다.
세 줄 요약
- UPHELD는 전문 작가가 작성한 수백 개의 대화와 30,000개 이상의 전문가 생성 대화 턴을 포함한다.
- 기존 자동 지표나 LLM 기반 평가 방식은 전문가의 인간 판단과 상관관계가 낮아 신뢰하기 어렵다.
- UPHELD를 활용해 개발한 Mixture-of-Judges 프레임워크는 인간 평가와의 상관관계를 약 30% 개선했다.
대규모 언어 모델(LLM)의 다중 턴 상호작용 평가를 위해 UPHELD라는 새로운 벤치마크를 제시했다.