트랜스포머 기반 모델로 데바나가리 필기 문자 인식 시스템 개발 — AI 생성 일러스트AI 일러스트
리서치 연구

트랜스포머 기반 모델로 데바나가리 필기 문자 인식 시스템 개발

Devanagari Handwritten Character Recognition Using TrOCR: A Transformer-Based Model with Real-Time Web Deployment

arXiv9월 29일 발표 · 2분 · 심사 전 논문

인도 아대륙의 언어 데바나가리 필기 문자의 정확한 인식을 목표로, 트랜스포머 기반의 TrOCR 모델을 파인튜닝하여 적용하는 시스템을 개발했습니다.

세 줄 요약arXiv 원문 기반
  1. 개선된 모델은 캐릭터 오류율(CER) 3.95%, 정확도 96.05%를 달성하며 기존 CNN 방식보다 뛰어난 성능을 입증했고, 웹 서비스까지 구현했습니다.
  2. 개발된 웹 애플리케이션 덕분에 요청당 5초 미만의 낮은 지연 시간으로 실시간 문자 인식 서비스를 제공할 수 있어 높은 활용도가 기대됩니다.
  3. 본 연구는 데바나가리에 초점을 맞추었으나, 트랜스포머 모델을 이용한 복잡한 아시아 문자 스크립트 인식 기술 개발의 중요한 기반이 될 것입니다.

본 연구는 인도 아대륙의 고대 언어인 데바나가리의 복잡한 필기 문자를 정확하게 인식하는 방법을 제시합니다. 이 문제를 해결하기 위해 사전 학습된 TrOCR 모델을 하여 적용했습니다. 방법론적으로는 입력 이미지를 RGB 형식으로 표준화하고, Hugging Face Dataset과 통합하여 배치 단위로 화하는 전처리 메커니즘이 사용되었습니다.

모델은 약 5000개의 문자 이미지 데이터셋을 사용하여 학습되었으며, 이 데이터는 학습(8):평가(1):테스트(1) 비율로 분할되었습니다. 또한 혼합 정밀도 트레이닝, 그래디언트 체크포인팅, 조기 종료 메커니즘 등을 통해 모델 최적화 과정을 거쳤습니다. 그 결과, 캐릭터 오류율(CER) 3.95%와 캐릭터 레벨 정확도 96.05%를 달성하며 기존 CNN 기반 모델보다 우수한 성능을 입증했습니다.

개발된 시스템은 Golang과 FastAPI를 활용하여 확장 가능한 웹 애플리케이션으로 구현되었습니다. 이 OCR 모델은 실제 문자 인식 작업을 수행할 수 있도록 배포되었으며, 요청당 5초 미만의 낮은 지연 시간(latency)을 보여 높은 실용성을 갖추었습니다. 본 연구는 모델을 이용한 데바나가리 문자 인식 시스템 구축의 기반이 되며, 향후 복잡한 아시아 스크립트 인식 기술 개발에도 활용될 수 있습니다.

용어 풀이

파인튜닝
이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
트랜스포머
오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
원문arXiv · Devanagari Handwritten Character Recognition Using TrOCR: A Transformer-Based Model with Real-Time Web Deployment같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv