LLM 기반 문서 정보 추출, 노이즈 환경에서의 성능 분석 — AI 생성 일러스트AI 일러스트
리서치 연구

LLM 기반 문서 정보 추출, 노이즈 환경에서의 성능 분석

From Pixels to Pairs: A Comprehensive Benchmark of LLM-Based Key-Value Extraction in Noisy Document Settings

arXiv9월 17일 발표 · 3분 · 심사 전 논문

다양한 오픈소스 LLM을 활용하여 문서의 키-값 쌍(KVP) 추출 성능을 비교했습니다. 깨끗한 텍스트와 OCR 노이즈가 포함된 실제 환경 두 가지 조건에서 체계적으로 분석했습니다.

세 줄 요약arXiv 원문 기반
  1. LLM은 고품질 텍스트에서는 강력한 의미 추론 능력을 보였지만, OCR 노이즈가 추가되자 성능이 크게 저하되는 것이 확인되었습니다. 입력 데이터 오염도가 높아지면 모델 간의 성능 격차도 줄어듭니다.
  2. 이는 LLM 기반 정보 추출 기술이 실무에 적용될 때, 아무리 큰 모델이라 하더라도 OCR 품질 등 원본 입력 데이터의 신뢰도가 가장 중요한 결정적 요소임을 시사합니다.
  3. 추출 성능은 단순한 의미 이해력 외에 노이즈 환경에서의 '원본 텍스트 보존 능력'에 좌우됩니다. 따라서 OCR 기술, 구조적 추론, LLM 모델링의 통합적인 발전이 필수입니다.

(LLMs)은 문서에서 구조화된 정보를 추출하는 데 활용되지만, 실제 OCR 노이즈가 포함된 현실적인 환경에서의 동작 방식에 대한 이해는 여전히 부족합니다. 본 연구에서는 지침 조정(instruction-tuned) LLM들을 대상으로 깨끗한 텍스트 조건과 노이즈가 있는 OCR 출력 조건을 모두 아우르는 키-값 쌍(KVP) 추출의 체계적인 를 수행했습니다. 평가에는 FUNSD, CORD, SROIE 등 대표 데이터셋을 사용했으며, Gemma, Mistral, Qwen2.5, LLaMA 3, DeepSeek 같은 다양한 모델들을 비교 분석했습니다.

연구 결과에 따르면, 현대 LLM들은 고품질의 텍스트가 제공될 경우 강력한 의미 추출 능력을 보여 레이아웃 인식 기반 시스템에 근접하는 성능을 나타냈습니다. 하지만 OCR 노이즈 환경에서는 성능 저하가 크게 관찰되었으며, 입력 데이터의 오염도가 높아짐에 따라 모델 간의 성능 격차는 줄어드는 경향을 확인했습니다.

모든 데이터셋에서 추출 성능은 텍스트 자체에 대한 의미 추론 능력뿐만 아니라, OCR 노이즈 환경에서의 '원본 텍스트 충실도 보존' 능력에 의해 결정됩니다. 대형 모델들이 깨끗한 텍스트에서는 개선 효과를 보이더라도, 노이즈가 심할 때는 OCR 품질 자체가 가장 중요한 요소로 작용합니다. 따라서 실질적인 배포를 위해서는 OCR 기술, 구조적 추론, LLM 기반 의미 모델링의 통합적인 발전이 필요함을 강조했습니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
오픈소스
소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · From Pixels to Pairs: A Comprehensive Benchmark of LLM-Based Key-Value Extraction in Noisy Document Settings같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv