비정형 텍스트 인식: 다중 인코더와 VLM 결합 기술 — AI 생성 일러스트AI 일러스트
리서치 연구

비정형 텍스트 인식: 다중 인코더와 VLM 결합 기술

MEVL-STP: Multi-Encoder and Vision Language Model for Arbitrarily Shaped Scene Text Spotting

arXiv9월 25일 발표 · 2분 · 심사 전 논문

곡선 표지판 등 비정형적인 글자도 놓치지 않는, 고성능 장면 텍스트 인식(Scene Text Spotting) 기술이 개발되었습니다.

세 줄 요약arXiv 원문 기반
  1. 다중 인코더가 글자의 실제 모양에 맞는 정교한 '다각형 마스크'를 생성해 노이즈를 제거하고, LLM이 이를 인식하는 2단계 파이프라인을 사용합니다.
  2. 합성 데이터 없이도 최고 수준의 성능을 달성하여, 까다로운 실외 환경이나 다양한 형태의 텍스트 인식이 필요한 분야에 혁신적입니다.
  3. 주요 벤치마크에서 SOTA를 달성했으며, 관련 코드가 공개되어 있어 학술적 검증과 실제 산업 적용에 매우 용이합니다.

장면 텍스트 스팟팅은 곡선 표지판이나 밀집된 다방향 문자처럼 임의 형태로 된 텍스트를 처리하는 데 어려움이 있습니다. 본 연구는 이러한 문제를 해결하기 위해, 다중 인코더 기반 분할과 비전-언어 모델() 인식 기능을 결합한 2단계 파이프라인을 제시했습니다.

탐지 단계에서는 CLIP, DINOv2, SigLIP 등 여섯 개의 고정된 비전 인코더가 각각 의미론적, 공간적, 질감적 특징을 추출합니다. 이 특징들은 학습 가능한 계층적 Feature Pyramid Network(FPN)과 채널 어텐션을 통해 융합되어 정밀한 개체 수준의 텍스트 마스크를 생성하며, 이는 배경 콘텐츠를 포함하는 축 정렬 사각형이 아닌 실제 곡선 및 임의 방향에 맞는 다각형 형태입니다.

인식 단계에서는 이 다각형으로 잘라낸 영역을 활용하여 목표 텍스트를 주변 노이즈로부터 분리합니다. 이후 Qwen3-VL-8B-Instruct 모델을 사용하여 텍스트를 읽어내며, 합성 사전 학습 데이터 없이도 CTW1500에서 탐지 F-measure 91.99%, 종단 간 H-mean 85.86%의 성능을 달성하며 새로운 최고 기록()을 세웠습니다.

용어 풀이

VLM
이미지와 글을 함께 이해하는 모델.
SOTA
State of the Art의 줄임말. 해당 분야에서 현재 가장 좋은 성능을 뜻해요.
원문arXiv · MEVL-STP: Multi-Encoder and Vision Language Model for Arbitrarily Shaped Scene Text Spotting같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv