모델 연구
The Limits of Automatic Evaluation of Creativity in Large Language Models
ARarXiv
LLM이 생성한 창작물의 창의성을 현재 자동 평가 방식이 얼마나 신뢰성 있게 포착하는지 조사했다.
세 줄 요약
- WritingPrompts 데이터셋을 활용해 창의성의 11가지 차원을 측정했으며, LLM 기반 심사위원은 AI가 만든 이야기에 체계적으로 높은 점수를 주었다.
- 기존에 널리 쓰이던 자동 평가 지표들이 인간과 AI가 만든 이야기 모두에서 인간 판단과 거의 일치하지 않는다는 것을 알게 되었다.
- LLM 기반 심사위원은 인간이 작성한 텍스트의 예측 불가능성 같은 특성을 제대로 반영하지 못하는 근본적인 한계가 있다.
LLM이 생성한 창작물의 창의성을 현재 자동 평가 방식이 얼마나 신뢰성 있게 포착하는지 조사했다.