모델 연구

Evaluating Language Models in Realistic Conversational Contexts

ARarXiv8월 28일 발표 · 1분 · 심사 전 논문

대규모 언어 모델(LLM)의 다중 턴 상호작용 평가를 위해 UPHELD라는 새로운 벤치마크를 제시했다.

세 줄 요약arXiv 원문 기반
  1. UPHELD는 전문 작가가 작성한 수백 개의 대화와 30,000개 이상의 전문가 생성 대화 턴을 포함한다.
  2. 기존 자동 지표나 LLM 기반 평가 방식은 전문가의 인간 판단과 상관관계가 낮아 신뢰하기 어렵다.
  3. UPHELD를 활용해 개발한 Mixture-of-Judges 프레임워크는 인간 평가와의 상관관계를 약 30% 개선했다.

대규모 언어 모델(LLM)의 다중 턴 상호작용 평가를 위해 UPHELD라는 새로운 벤치마크를 제시했다.

원문arXiv · Evaluating Language Models in Realistic Conversational Contexts같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기