모델 연구
PACE: Publisher-Adaptive Content Extraction via Agentic Automation
ARarXiv
LLM 데이터 파이프라인의 핵심 난제인 웹 콘텐츠 추출을 해결하기 위해, 에이전트 기반 자동화 프레임워크 'PACE'가 소개되었습니다.
세 줄 요약
- PACE는 학습된 설정을 고정된 결정론적 템플릿으로 구현하여, 추론 단계에서 추가 LLM 호출 없이도 높은 확장성을 확보했습니다.
- 단순 기사 본문 외에도 메타데이터, 이미지, 테이블 등 출판사별 특성에 맞는 다중 모드 정보를 자동 추출할 수 있습니다.
- 수작업 전문 파서에 근접한 성능을 보이지만, 초기에는 대표 페이지와 사용자 요구사항 학습 과정이 필요하다는 점을 참고해야 합니다.
LLM 데이터 파이프라인의 핵심 난제인 웹 콘텐츠 추출을 해결하기 위해, 에이전트 기반 자동화 프레임워크 'PACE'가 소개되었습니다.