모델 연구

PACE: Publisher-Adaptive Content Extraction via Agentic Automation

ARarXiv8월 31일 발표 · 1분 · 프리프린트

LLM 데이터 파이프라인의 핵심 난제인 웹 콘텐츠 추출을 해결하기 위해, 에이전트 기반 자동화 프레임워크 'PACE'가 소개되었습니다.

세 줄 요약arXiv 원문 기반
  1. PACE는 학습된 설정을 고정된 결정론적 템플릿으로 구현하여, 추론 단계에서 추가 LLM 호출 없이도 높은 확장성을 확보했습니다.
  2. 단순 기사 본문 외에도 메타데이터, 이미지, 테이블 등 출판사별 특성에 맞는 다중 모드 정보를 자동 추출할 수 있습니다.
  3. 수작업 전문 파서에 근접한 성능을 보이지만, 초기에는 대표 페이지와 사용자 요구사항 학습 과정이 필요하다는 점을 참고해야 합니다.

LLM 데이터 파이프라인의 핵심 난제인 웹 콘텐츠 추출을 해결하기 위해, 에이전트 기반 자동화 프레임워크 'PACE'가 소개되었습니다.

원문arXiv · PACE: Publisher-Adaptive Content Extraction via Agentic Automation
원문 보기arXiv