리서치 연구
Do large language models scrutinise what they review? A multimodal audit of scoring calibration, error detection, and author-identity effects
ARarXiv
LLM의 학술 논문 리뷰 역량을 검증하기 위해, 연구진은 두 멀티모달 모델을 활용해 165편의 논문을 심사하며 성능을 분석했습니다.
세 줄 요약
- LLM이 매긴 점수는 인간 평균보다 높게 나타났으며, 삽입된 오류 중 78%는 탐지하지 못하는 등 명확한 한계가 발견되었습니다.
- AI가 학술 심사에 도입될 경우 점수 산정에는 참고할 수 있으나, 실제 오류 검출이나 비판적 평가 능력은 아직 인간의 판단이 필수적입니다.
- 특히 그림과 관련된 시각적 오류는 신뢰성 있게 검증되지 않았으며, 논문의 형식에 따라 성능 편차가 크게 나타나는 것이 확인되었습니다.
LLM의 학술 논문 리뷰 역량을 검증하기 위해, 연구진은 두 멀티모달 모델을 활용해 165편의 논문을 심사하며 성능을 분석했습니다.