모델 연구

The Limits of Automatic Evaluation of Creativity in Large Language Models

ARarXiv8월 26일 발표 · 1분 · 심사 전 논문

LLM이 생성한 창작물의 창의성을 현재 자동 평가 방식이 얼마나 신뢰성 있게 포착하는지 조사했다.

세 줄 요약arXiv 원문 기반
  1. WritingPrompts 데이터셋을 활용해 창의성의 11가지 차원을 측정했으며, LLM 기반 심사위원은 AI가 만든 이야기에 체계적으로 높은 점수를 주었다.
  2. 기존에 널리 쓰이던 자동 평가 지표들이 인간과 AI가 만든 이야기 모두에서 인간 판단과 거의 일치하지 않는다는 것을 알게 되었다.
  3. LLM 기반 심사위원은 인간이 작성한 텍스트의 예측 불가능성 같은 특성을 제대로 반영하지 못하는 근본적인 한계가 있다.

LLM이 생성한 창작물의 창의성을 현재 자동 평가 방식이 얼마나 신뢰성 있게 포착하는지 조사했다.

원문arXiv · The Limits of Automatic Evaluation of Creativity in Large Language Models같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기