모델 연구

Contamination Inflates Scores but Rarely Reorders Large Language Model Leaderboards

ARarXiv9월 4일 발표 · 1분 · 심사 전 논문

LLM 성능 평가에서 테스트 데이터가 학습에 유출되는 '오염(contamination)' 현상이 리더보드 신뢰성에 미치는 영향을 분석한 연구입니다.

세 줄 요약arXiv 원문 기반
  1. 연구 결과, 오염은 모델의 절대 점수를 부풀리지만, 실제 순위 자체를 뒤섞을 정도는 아니며 표준 리더보드와 수정된 리더보드의 순위 상관관계는 0.997로 높았습니다.
  2. 이는 오염에 대한 과도한 우려가 있을 수 있음을 시사하며, 모델의 실제 능력을 평가할 때는 '오염 통제' 방식을 적용하는 것이 중요함을 강조합니다.
  3. 따라서 리더보드는 순위 왜곡이 발생하는 경우는 매우 드물다는 점을 고려하여, 패러프레이즈 통제 방식의 점수를 함께 보고할 것을 권장합니다.

LLM 성능 평가에서 테스트 데이터가 학습에 유출되는 '오염(contamination)' 현상이 리더보드 신뢰성에 미치는 영향을 분석한 연구입니다.

원문arXiv · Contamination Inflates Scores but Rarely Reorders Large Language Model Leaderboards같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기