리서치 연구
LLM 평가자 활용 시 '언어화된 자신감' 점수 재조명
Rethinking Verbalized Confidence for LLM-as-a-Judge: A Compatibility Shift on Post-2025 Proprietary Models
arXivLLM을 평가자(Judge)로 활용할 때, 기존의 로그 확률 기반 점수보다 '언어화된 자신감' 점수가 최신 대형 언어 모델에서 더 신뢰성 높은 지표임이 밝혀졌습니다.
세 줄 요약
- 연구진은 이 변화를 '호환성 전환'이라 명명하며, 단순한 자신감 점수에 과신 경고나 자기 토론 과정을 추가하면 모델의 보정 능력과 안정성이 크게 향상됨을 입증했습니다.
- 특히 평가에 주관성이 개입되는 영역에서는 단순히 정답 여부만 판단하는 하드 예측보다 점수 분포를 측정하는 소프트 스코어링 방식이 훨씬 더 신뢰할 수 있는 지표입니다.
- 따라서 LLM 성능 평가 시에는 정확도(Accuracy)에만 의존하지 않고, 최신 독점 모델을 대상으로 소프트 스코어링 방식을 적극적으로 활용해야 합니다.
LLM을 평가자(Judge)로 활용할 때, 기존의 로그 확률 기반 점수보다 '언어화된 자신감' 점수가 최신 대형 언어 모델에서 더 신뢰성 높은 지표임이 밝혀졌습니다.