리서치 연구

Do large language models scrutinise what they review? A multimodal audit of scoring calibration, error detection, and author-identity effects

ARarXiv9월 1일 발표 · 1분 · 심사 전 논문

LLM의 학술 논문 리뷰 역량을 검증하기 위해, 연구진은 두 멀티모달 모델을 활용해 165편의 논문을 심사하며 성능을 분석했습니다.

세 줄 요약arXiv 원문 기반
  1. LLM이 매긴 점수는 인간 평균보다 높게 나타났으며, 삽입된 오류 중 78%는 탐지하지 못하는 등 명확한 한계가 발견되었습니다.
  2. AI가 학술 심사에 도입될 경우 점수 산정에는 참고할 수 있으나, 실제 오류 검출이나 비판적 평가 능력은 아직 인간의 판단이 필수적입니다.
  3. 특히 그림과 관련된 시각적 오류는 신뢰성 있게 검증되지 않았으며, 논문의 형식에 따라 성능 편차가 크게 나타나는 것이 확인되었습니다.

LLM의 학술 논문 리뷰 역량을 검증하기 위해, 연구진은 두 멀티모달 모델을 활용해 165편의 논문을 심사하며 성능을 분석했습니다.

원문arXiv · Do large language models scrutinise what they review? A multimodal audit of scoring calibration, error detection, and author-identity effects같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기