문서 저장소의 버전 관리 및 중복 제거를 위한 GVD 프레임워크 — AI 생성 일러스트AI 일러스트
리서치 연구

문서 저장소의 버전 관리 및 중복 제거를 위한 GVD 프레임워크

GVD: Governed Versioning and Deduplication for Document Repositories

arXiv9월 17일 발표 · 3분 · 심사 전 논문

문서 저장소에서 발생하는 버전 충돌, 중복 문서, 모순된 정보 문제를 해결하기 위해 GVD(Governed Versioning and Deduplication)라는 통합 프레임워크가 개발되었습니다.

세 줄 요약arXiv 원문 기반
  1. GVD는 문서를 '버전 가족'으로 묶고 규칙 수준에서 충돌을 검사하여 높은 정확도(F1 점수 0.97/0.94)를 달성하며, 단순 분류 이상의 기능을 수행합니다.
  2. 기존에 분리되어 처리되던 버전 관리와 모순 감지 과정을 통합함으로써, 문서의 변경 이력을 감사 추적(audit trail)으로 남겨 신뢰도를 혁신적으로 높입니다.
  3. 대규모 언어 모델(LLM) 없이 완전히 로컬 환경에서 구동되며, 중요한 변화만 선별적으로 검토 대상으로 지정하는 효율성을 제공합니다.

문서 저장소가 지속적으로 변화함에 따라, 가이드라인이나 정책이 개정되거나 대체되고 재업로드되는 과정에서 동일한 내용이 다양한 방식으로 반복되어 기록됩니다. 기존 연구들은 버전 관리, 중복 감지, 모순 감지를 각각 독립적인 쌍별 작업으로 다루고 한 쌍을 분류하면 작업을 멈추는 경향이 있었습니다. 이에 본 논문은 GVD(Governed Versioning and Deduplication)라는 프레임워크를 제시하며, 감사 가능한 업데이트 정책 하에 교차 문서 버전 연결과 규칙 수준의 충돌 해결을 통합합니다.

GVD는 들어오는 문서를 양방향 규칙 정렬을 통해 '버전 가족'으로 할당하고, 해당 규칙들을 가족 메모리와 비교하여 중복, 모순, 비대칭적 개선점 및 새로운 지식을 식별합니다. 특히 Counterfactual Span Probing(CSP) 기법은 추론 과정에서 중립으로 오분류된 관련 쌍을 해결하는 역할을 합니다. 이 시스템은 관계별 정책을 통해 중복을 억제하고 중요한 변화만 검토 대상으로 상향 조정하며, 버전 계보를 감사 기록(audit trail)으로 유지합니다.

실험 결과에 따르면, GVD는 없이 완전히 로컬 환경에서 구동됩니다. 59개 버전 가족에 걸쳐 120개의 기업 문서가 140건의 수집 과정을 거치며 처리되었을 때, GVD는 버전 가족 구성에서 F1 점수 0.97, 규칙 수준 일관성에서 0.94를 달성했습니다. 특히 CSP를 적용했을 경우 규칙 일관성은 기존 0.90에서 0.94로 향상되었습니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
원문arXiv · GVD: Governed Versioning and Deduplication for Document Repositories같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv