리서치 연구

Beyond Blind Compliance: Benchmarking Task Verification in OCR Reasoning

ARarXiv9월 2일 발표 · 1분 · 심사 전 논문

기존 OCR 기반 추론 모델 평가는 모든 질문이 유효하고 답할 수 있다고 가정했지만, 실제 환경에서는 정보 부족이나 모순으로 인한 신뢰성 격차가 존재합니다.

세 줄 요약arXiv 원문 기반
  1. 연구진은 이 문제를 해결하기 위해 'VeriOCRBench'를 개발했습니다. 여기에는 과제 자체의 유효성을 검증하는 함정(trap)이 주입된 무효 과제가 대거 포함되어 있습니다.
  2. 최고 성능을 보이는 MLLM들조차 실제 환경에서 발생하는 모호하거나 불완전한 정보를 처리할 때 '맹목적 준수'와 같은 심각한 신뢰성 문제를 보였습니다.
  3. 따라서 모델 평가는 단순 정답률을 넘어, 주어진 과제 자체가 실행 가능한지 진단하고 적절하게 답변을 거부하는 능력이 필수적으로 요구됩니다.

기존 OCR 기반 추론 모델 평가는 모든 질문이 유효하고 답할 수 있다고 가정했지만, 실제 환경에서는 정보 부족이나 모순으로 인한 신뢰성 격차가 존재합니다.

원문arXiv · Beyond Blind Compliance: Benchmarking Task Verification in OCR Reasoning같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기