리서치 연구
업무 환경 적합성 측정을 위한 LLM 심사관 감사 연구
Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement
arXiv대규모 노동자 평가 데이터를 기반으로 개발된 O*NET-BENCH를 활용하여, 업무 환경 적합성을 판단하는 거대 언어 모델(LLM) 심사관들을 검증했습니다.
세 줄 요약
- 심사 결과, LLM 심사관들이 응답의 순위를 잘 매기더라도 실제 직업 현장에서 받아들여지는 수용률을 정확히 추정하지 못하는 문제가 발견되었습니다.
- 이는 단순히 AI 응답의 우열 비교만으로는 해당 모델이 실제 업무 환경에서 얼마나 유용한지 판단하기에 근본적으로 부족함을 의미합니다.
- 따라서 LLM 심사관을 활용할 때는 개별 순위뿐 아니라, 전체 수용률과 집계된 평균값 등 종합적인 지표로 반드시 검증해야 합니다.
대규모 노동자 평가 데이터를 기반으로 개발된 O*NET-BENCH를 활용하여, 업무 환경 적합성을 판단하는 거대 언어 모델(LLM) 심사관들을 검증했습니다.