리서치 연구

비전 언어 모델의 OCR 신뢰성 향상 방안 제시

Improving OCR Faithfulness via Gated and Attenuated On-Policy Distillation

ARarXiv10월 1일 발표 · 2분 · 프리프린트

비전 언어 모델이 이미지 속 오류 텍스트를 문법적으로 수정하며 OCR의 원본 충실도를 떨어뜨리는 문제를 해결하기 위해 GAD-RL을 제안했습니다.

왜 중요해요AI 정리

비전 언어 모델이 문법적으로 오류를 수정하는 과정에서 원본 문서의 정확한 정보를 훼손할 수 있기 때문에, 이 기술은 디지털화된 문서의 신뢰성을 높이는 데 중요해요.

세 줄 요약arXiv 원문 기반
  1. GAD-RL은 학생 모델의 현재 성능과 분포에 따라 교사 지도의 강도를 능동적으로 조절하여, 학습 효율성을 극대화하는 것이 핵심입니다.
  2. 이 방법론은 OCR 결과가 단순한 텍스트 변환을 넘어 원본 정보 충실도를 유지하며, 주요 벤치마크에서 기존 방식 대비 높은 성능 향상을 입증했습니다.
  3. 학생의 발전 단계에 맞춰 교사 지도를 조절하는 적응적 학습 방식이 복잡하고 오류가 많은 문서 디지털화 과정에서 OCR 신뢰성을 높이는 핵심 기술임을 알 수 있습니다.

비전-언어 모델()은 이미지 속 비정상적인 텍스트를 문법적으로 그럴듯한 표현으로 재작성하는 경향이 있어, 이는 광학 문자 인식(OCR)의 원본 충실도를 저해할 수 있습니다. 기존 연구에서 사용되던 시퀀스 레벨 과제 보상과 로컬 교사 지도는 상호보완적이지만, 학생 모델이 발전함에 따라 고정된 교사의 지도만으로는 충분한 효과를 유지하기 어렵다는 분석 결과가 있었습니다.

이에 본 논문은 GAD-RL을 제안하여, 학생의 현재 과제 성능과 로컬 분포에 따라 교사 지도의 강도를 능동적으로 조절합니다. 이 방법론은 고정된 교사가 참조 전사본과 학생이 생성한 접두사에 조건을 부여하며, 특히 과제 보상이 0.95 이상인 응답 그룹에 대해서는 증류()를 비활성화하고, 그룹 평균 보상이 증가함에 따라 증류 강도를 지속적으로 약화시킵니다.

실험 결과, Qwen3.5-2B 모델을 사용했을 때 GAD-RL은 CHAOS-Bench에서 59.92%의 마이크로 리콜을 달성하며, 기존 방식인 GRPO 및 GRPO+OPD (고정 ) 대비 각각 8.45%, 4.43% 포인트 높은 성능을 보였습니다. 또한 OmniDocBench v1.6에서는 전반적인 점수(Overall score)로 91.18점을 기록했습니다.

용어 풀이

VLM
이미지와 글을 함께 이해하는 모델.
distillation
큰 모델의 답을 작은 모델이 따라 배우게 해서 가볍고 빠른 모델을 만드는 방법.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
궁금한 점AI 정리 · 원문 기반
비전 언어 모델이 OCR 원본 충실도를 떨어뜨리는 이유는 무엇인가요?

비전-언어 모델이 이미지 속의 비정상적인 텍스트를 문법적으로 그럴듯한 표현으로 재작성하는 경향이 있기 때문이에요. 이로 인해 광학 문자 인식(OCR)을 통해 얻은 원본 정보가 왜곡될 수 있어요.

GAD-RL은 어떻게 작동하여 신뢰성을 높여주나요?

학생 모델의 현재 과제 성능과 로컬 분포에 맞춰 교사 지도의 강도를 능동적으로 조절해요. 특히 높은 보상을 받은 응답 그룹에서는 증류 과정을 비활성화하고, 그룹 평균 보상이 증가함에 따라 증류 강도를 점진적으로 약화시키는 것이 핵심이에요.

GAD-RL을 적용했을 때 성능 향상 정도가 궁금해요.

Qwen3.5-2B 모델을 사용했을 때, 기존 방식 대비 CHAOS-Bench에서 각각 8.45% 포인트와 4.43% 포인트 높은 성능을 보였어요. 또한 OmniDocBench v1.6에서는 전반적인 점수로 91.18점을 기록했어요.

원문arXiv · Improving OCR Faithfulness via Gated and Attenuated On-Policy Distillation
궁금한 점 3개AI 정리