모델 연구
Judging LLM-as-a-Judge: Concerning Rubric Artifacts in LLM-based Automated Text Generation Evaluation
ARarXiv
AI가 생성한 텍스트를 평가할 때 LLM을 심사위원으로 활용하는 'LLM-as-a-Judge' 방식의 신뢰성 문제를 제기합니다.
세 줄 요약
- 연구 결과, 실제 응답 내용과 무관하게 루브릭만으로 점수 예측이 가능했고, 조건 반전 시 심사위원의 판단 일관성이 떨어지는 현상이 확인되었습니다.
- 이는 평가가 모델의 실제 능력이 아닌 '루브릭 형식'에 과도하게 의존할 위험이 있음을 보여주며, 측정 신뢰성에 근본적인 의문을 던집니다.
- 따라서 LLM 기반 자동 평가는 루브릭에만 의존하기보다, 평가 방법론 자체의 학술적 검토와 개선이 필수적으로 요구됩니다.
AI가 생성한 텍스트를 평가할 때 LLM을 심사위원으로 활용하는 'LLM-as-a-Judge' 방식의 신뢰성 문제를 제기합니다.