리서치 연구
비정형 텍스트 인식: 다중 인코더와 VLM 결합 기술
MEVL-STP: Multi-Encoder and Vision Language Model for Arbitrarily Shaped Scene Text Spotting
arXiv곡선 표지판 등 비정형적인 글자도 놓치지 않는, 고성능 장면 텍스트 인식(Scene Text Spotting) 기술이 개발되었습니다.
세 줄 요약
- 다중 인코더가 글자의 실제 모양에 맞는 정교한 '다각형 마스크'를 생성해 노이즈를 제거하고, LLM이 이를 인식하는 2단계 파이프라인을 사용합니다.
- 합성 데이터 없이도 최고 수준의 성능을 달성하여, 까다로운 실외 환경이나 다양한 형태의 텍스트 인식이 필요한 분야에 혁신적입니다.
- 주요 벤치마크에서 SOTA를 달성했으며, 관련 코드가 공개되어 있어 학술적 검증과 실제 산업 적용에 매우 용이합니다.
장면 텍스트 스팟팅은 곡선 표지판이나 밀집된 다방향 문자처럼 임의 형태로 된 텍스트를 처리하는 데 어려움이 있습니다. 본 연구는 이러한 문제를 해결하기 위해, 다중 인코더 기반 분할과 비전-언어 모델() 인식 기능을 결합한 2단계 파이프라인을 제시했습니다.
탐지 단계에서는 CLIP, DINOv2, SigLIP 등 여섯 개의 고정된 비전 인코더가 각각 의미론적, 공간적, 질감적 특징을 추출합니다. 이 특징들은 학습 가능한 계층적 Feature Pyramid Network(FPN)과 채널 어텐션을 통해 융합되어 정밀한 개체 수준의 텍스트 마스크를 생성하며, 이는 배경 콘텐츠를 포함하는 축 정렬 사각형이 아닌 실제 곡선 및 임의 방향에 맞는 다각형 형태입니다.
인식 단계에서는 이 다각형으로 잘라낸 영역을 활용하여 목표 텍스트를 주변 노이즈로부터 분리합니다. 이후 Qwen3-VL-8B-Instruct 모델을 사용하여 텍스트를 읽어내며, 합성 사전 학습 데이터 없이도 CTW1500에서 탐지 F-measure 91.99%, 종단 간 H-mean 85.86%의 성능을 달성하며 새로운 최고 기록()을 세웠습니다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.
- SOTA
- State of the Art의 줄임말. 해당 분야에서 현재 가장 좋은 성능을 뜻해요.