리서치 연구
Beyond Blind Compliance: Benchmarking Task Verification in OCR Reasoning
ARarXiv
기존 OCR 기반 추론 모델 평가는 모든 질문이 유효하고 답할 수 있다고 가정했지만, 실제 환경에서는 정보 부족이나 모순으로 인한 신뢰성 격차가 존재합니다.
세 줄 요약
- 연구진은 이 문제를 해결하기 위해 'VeriOCRBench'를 개발했습니다. 여기에는 과제 자체의 유효성을 검증하는 함정(trap)이 주입된 무효 과제가 대거 포함되어 있습니다.
- 최고 성능을 보이는 MLLM들조차 실제 환경에서 발생하는 모호하거나 불완전한 정보를 처리할 때 '맹목적 준수'와 같은 심각한 신뢰성 문제를 보였습니다.
- 따라서 모델 평가는 단순 정답률을 넘어, 주어진 과제 자체가 실행 가능한지 진단하고 적절하게 답변을 거부하는 능력이 필수적으로 요구됩니다.
기존 OCR 기반 추론 모델 평가는 모든 질문이 유효하고 답할 수 있다고 가정했지만, 실제 환경에서는 정보 부족이나 모순으로 인한 신뢰성 격차가 존재합니다.