샤오미의 문서 이해 모델 Xiaomi-OCR-0 기술 보고서 — AI 생성 일러스트AI 일러스트
리서치 연구

샤오미의 문서 이해 모델 Xiaomi-OCR-0 기술 보고서

Xiaomi-OCR-0 Technical Report

arXiv9월 30일 발표 · 3분 · 심사 전 논문

샤오미가 문서 파싱과 OCR 이해를 통합한 0.8B 모델 'Xiaomi-OCR-0'을 공개했습니다. 이 모델은 문서를 전반적으로 구조화하여 깊이 있게 이해하는 데 초점을 맞춘 것이 특징입니다.

세 줄 요약arXiv 원문 기반
  1. 약 1억 7천만 개의 OCR 중심 코퍼스를 구축하고, Q-Mask 기반 학습과 Mix-RL 등 진보된 트레이닝 기법을 적용했습니다. 이를 통해 주요 문서 파싱 및 VQA 벤치마크에서 높은 성능을 입증했습니다.
  2. 본 연구는 시각-언어 모델이 단순히 이미지 속 텍스트를 재구성하는 수준을 넘어, 복잡하고 비정형적인 문서의 구조적 의미와 맥락까지 깊이 있게 이해할 수 있음을 보여줍니다.
  3. 결과적으로 충분한 파싱 학습과 OCR 중심의 이해 감독(supervision)을 결합하는 것이 문서 처리 성능 향상에 결정적인 추가 이점을 제공함을 시사합니다.

Xiaomi는 문서 파싱과 OCR 중심의 이해를 통합한 0.8B 규모의 모델인 'Xiaomi-OCR-0'을 공개했습니다. 이 모델은 기존의 컴팩트 OCR 비전-언어 모델들이 비용이 많이 드는 감독 학습에 의존하며 주로 시각-텍스트 재구성에 초점을 맞추는 한계를 극복하고, 문서 파싱과 OCR 중심 이해를 통합하는 것을 목표로 합니다.

개발팀은 전문가 합의, 렌더링 기반 검증, 표적 합성 등을 결합한 자동 데이터 엔진을 활용하여 약 1억 7천만 개의 OCR 중심 코퍼스를 구축했습니다. 모델 학습은 Qwen3.5-0.8B를 시작점으로 하여, Q-Mask 기반 텍스트 앵커링, 지속적인 사전 학습, 그리고 혼합 작업 (Mix-RL)을 결합한 점진적 트레이닝 레시피를 적용했습니다.

Xiaomi-OCR-0은 다양한 문서 파싱 및 VQA 에서 높은 성능을 기록했습니다. 구체적으로 Real5-OmniDocBench에서 95.24, OmniDocBench v1.6에서 96.83, Wild-OmniDocBench에서 87.94를 달성했으며, 다섯 가지 OCR 지향 VQA 벤치마크 평균 점수는 83.2에 달했습니다. 연구 결과는 충분한 파싱 학습과 OCR 중심의 이해 감독이 문서 처리 성능 향상에 추가적인 이점을 제공함을 보여줍니다.

용어 풀이

강화 학습
행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · Xiaomi-OCR-0 Technical Report같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기