모델 도구
문서 파싱을 위한 경량 오픈소스 VLM 'TeleOCR' 공개
StarDoc-AI/TeleOCR
Hugging Face문서 파싱에 특화된 경량 오픈소스 VLM인 TeleOCR이 공개되었습니다. 이 모델은 디지털 문서와 카메라 촬영본 등 모든 형태의 문서를 통합적으로 처리할 수 있습니다.
세 줄 요약
- 다중 노드 합의 투표(MCV) 및 기하학적 모델링 같은 첨단 기술을 적용하여, 왜곡되거나 변형된 문서에서도 최고 수준의 파싱 성능을 입증했습니다.
- 경량화와 높은 정확도를 동시에 갖춰, 별도의 전처리 과정 없이도 현장 문서 분석 및 데이터 추출에 즉시 활용할 수 있다는 것이 강점입니다.
- OmniDocBench v1.6 등 주요 공인 벤치마크에서 최고 성능을 기록하며, 복잡한 문서 파싱 분야의 새로운 표준을 제시합니다.
TeleOCR은 문서 파싱에 특화된 경량의 Vision-Language Model()입니다. 이 모델은 기존 방식들이 디지털 문서 또는 카메라로 촬영한 문서 중 한 가지 유형만을 목표로 했던 것과 달리, 단일 프레임워크 내에서 두 가지 시나리오를 통합적으로 처리할 수 있도록 설계되었습니다.
TeleOCR은 성능 향상을 위해 여러 첨단 기술을 도입했습니다. 구체적으로는 자동 가짜 레이블 생성을 위한 Multi-node Consensus Voting (MCV), 카메라 촬영 문서에 적합한 Geometry-aware document modeling, Curvature-Guided Douglas-Peucker Sampling (CGDP) 등이 포함됩니다. 이러한 기법들은 경량화된 모델 크기를 유지하면서도 최신 성능을 달성할 수 있게 합니다.
모델은 복잡하게 변형되거나 왜곡된 문서에서도 강력한 파싱 능력을 보여줍니다. 별도의 전처리 과정이나 전용 보정 모델 없이도 레이아웃 및 콘텐츠 파싱이 가능합니다. 또한, OmniDocBench v1.6과 같은 주요 에서 전문화된 VLM들 사이에서 최고 수준의 성능을 기록하며 우수성을 입증했습니다.
용어 풀이
- 오픈소스
- 소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
- VLM
- 이미지와 글을 함께 이해하는 모델.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.