모델 연구
Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints
ARarXiv
연구진은 LLM 성능 측정의 신뢰성을 검증하기 위해 '판단 도구(judge)' 자체를 대규모로 감사했습니다.
세 줄 요약
- 동일한 요청을 반복하거나 다음 날 재실행해도 점수와 순위가 크게 달라지는 심각한 '측정 불안정성'이 확인되었습니다.
- 이는 현재 공개되는 LLM 벤치마크나 리더보드가 모델의 실제 성능을 정확히 반영하지 못할 수 있음을 시사합니다.
- 특히 공유 서버 환경에서는 모델 이름만으로는 성능이 고정되지 않으므로, 평가 전 측정 과정 자체를 반드시 검증해야 합니다.
연구진은 LLM 성능 측정의 신뢰성을 검증하기 위해 '판단 도구(judge)' 자체를 대규모로 감사했습니다.