데이터 에이전트의 복잡한 기업 데이터 이해를 위한 학습 프레임워크 — AI 생성 일러스트AI 일러스트
AI 에이전트 연구

데이터 에이전트의 복잡한 기업 데이터 이해를 위한 학습 프레임워크

Learned Enterprise Data Comprehension: Compression and Routing for Data Agents

arXiv9월 23일 발표 · 3분 · 심사 전 논문

본 시스템은 기업 환경의 데이터 에이전트가 복잡하고 분산된 데이터를 처리할 때, 지식 구조를 '지속적인 정체성(Identity)'으로 분해하여 효율적으로 이해하도록 설계되었습니다.

세 줄 요약arXiv 원문 기반
  1. 기존 메모리 방식과 달리, 핵심 지식 정체성을 추출하고 이를 기반으로 관련 증거를 찾아내어 에이전트가 이미 정리된 상태에서 추론하게 하며, 벤치마크 최고 성능을 달성했습니다.
  2. 데이터 에이전트가 매번 복잡한 구조를 재구성할 필요 없이 핵심 지식 관계에 집중하여 작동하므로, 기업의 의사결정 지원 속도와 정확도를 혁신적으로 높일 수 있습니다.
  3. 제시된 방법론은 추론 능력을 크게 향상시키지만, 실제 현장 적용 시 다양한 스키마 변화나 정책 변경에 대한 지속적인 적응성 검증이 중요합니다.

기업 환경에서 작동하는 구조화된 데이터 는 스키마, 관계, 정책 등 여러 곳에 분산된 복잡한 데이터를 기반으로 추론해야 합니다. 본 연구는 이러한 문제를 해결하기 위해 잠재적 동등성 학습(latent equivalence learning)을 도입하여, 지속적인 작업 관련 정체성(persistent task-relevant identities)과 해당 데이터셋 상대의 실현(dataset-relative realizations)을 분리하는 프레임워크를 제시합니다.

이 시스템은 지원 및 반대 증거가 특정 정체성을 어떻게 표현하는지 학습하는 가우시안 프로토타입을 형성하며, 별도의 학습된 쿼리-프로토타입 시스템을 통해 반복적인 증거 요구사항을 지속적 정체성 구조에 매핑합니다. 이처럼 정체성 기반으로 분해되고 쿼리에 의해 조건화된 라우팅 메커니즘은 에이전트가 모든 질의마다 교차 스키마 구조를 재구성할 필요 없이 이미 조직화된 증거 상태 위에서 작동하도록 합니다.

데이터 에이전트 에 적용한 결과, 본 구현체는 12개의 이질적인 데이터셋에 걸친 54개 질의에 대해 5회 완전 시도 중 94.67%의 데이터셋-매크로 계층화된 Pass@1을 달성했습니다. 또한 270개 중 258개의 원본 질의를 성공적으로 처리했으며, 이는 비교 대상인 Claude Opus 4.6 참조 에이전트의 55.51% 대비 높은 성능입니다.

용어 풀이

에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · Learned Enterprise Data Comprehension: Compression and Routing for Data Agents같은 주제 가이드 · 바로 써 보기매일 아침 소식, 예약 작업으로 받기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv