기업 에이전트 학습 데이터, 자동 생성 및 검증 시스템 소개
AutoSynthData: Generating Training Data for Enterprise Agents
Hugging Face Blog서비스나우 코어AI가 개발한 AutoSynthData는 기업 환경에 특화된 AI 에이전트의 학습 데이터를 생성하는 시스템입니다. 모델의 실패 지점을 분석하여 이를 새로운 실행 과제로 변환해 고품질 데이터셋을 구축합니다.
기업의 복잡한 업무 환경에 특화된 데이터를 만들어, 일반적인 지식만 가진 모델이 아닌 실제 현업에서 작동하는 실무형 AI 에이전트 개발을 가능하게 해요.
- 단순히 오류를 반복하는 것을 넘어, 개별 후보 검증과 배치 단위의 메타 리뷰라는 이중 품질 관리 과정을 거칩니다. 이를 통해 학습 신호가 풍부하고 다양하며 균형 잡힌 데이터를 확보할 수 있습니다.
- 이 기술은 범용 AI 모델을 넘어, 기업 내부의 복잡한 시스템 규칙과 워크플로우를 정확히 이해하여 실제 업무에 적용 가능한 실무형 에이전트 개발을 가능하게 합니다.
- 생성되는 과제는 환경에서 반드시 실행 가능해야 하며(Feasibility), 현실적이어야 하고(Realism), 현재 모델의 약점을 드러낼 만큼 충분히 어려워야 하는 세 가지 조건을 충족합니다.
서비스나우 코어AI가 개발한 AutoSynthData는 기업 환경에 특화된 의 학습 데이터를 구축하는 시스템이다. 일반적인 모델은 범용적일지라도 특정 업무 환경이나 복잡한 워크플로우에서는 약점을 보일 수 있다. 이 시스템은 이러한 개별 실패 지점(capability gaps)을 분석하고, 이를 새로운 실행 과제(tasks)로 변환하여 고품질의 학습 데이터셋을 생성한다.
에이전트가 작동하는 환경은 관찰 가능한 상태, 호출할 수 있는 도구 및 , 그리고 행동으로 인해 발생하는 상태 변화를 정의한다. AutoSynthData는 이 환경 내에서 과제를 생성하며, 모든 생성된 과제는 반드시 세 가지 조건을 충족해야 한다. 첫째, 실행 가능성(Feasibility)을 가져야 하며, 둘째, 사용자가 실제로 요청할 법한 현실성(Realism)을 갖추어야 하고, 셋째, 현재 모델의 약점을 드러낼 만큼 충분히 어려워야 한다.
데이터 품질 확보를 위해 AutoSynthData는 다단계 검증 과정을 거친다. 개별 후보 샘플은 솔버 평가와 더불어 양성/음성 게이트(positive/negative gate)를 통과해야 하며, 실패한 경우 크리틱을 통해 진단 및 수정을 거치는 과정이 포함된다. 또한, 데이터셋 전체는 배치 단위의 메타 리뷰를 통해 특정 과제 유형의 과잉 대표 여부나 놓친 역량 영역 등을 검토하여 균형 잡힌 학습 신호를 유지한다.
이 시스템은 단순히 데이터를 생성하는 것을 넘어, 모델 개선에 따라 필요한 지식 경계(capability boundary) 근처에서 과제를 탐색하는 과정으로 작동한다. 초기 평가를 통해 발견된 약점을 기반으로 새로운 과제를 생성하고, 이 과정을 반복하며 업데이트된 모델을 다시 평가하여 다음 학습 라운드를 위한 목표를 설정하는 순환 구조를 갖는다.
용어 풀이
- AI 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
이 시스템은 어떤 방식으로 학습 데이터셋을 구축하나요?
AI가 실패한 지점(capability gaps)을 분석하여 이를 새로운 실행 과제로 변환해요. 생성된 개별 후보 샘플은 솔버 평가와 양성/음성 게이트를 통과해야 하며, 전체 데이터셋은 배치 단위의 메타 리뷰로 균형 잡힌 학습 신호를 유지해요.
새롭게 생성되는 과제는 어떤 조건을 충족해야 하나요?
생성된 모든 과제는 반드시 세 가지 조건을 만족해야 해요. 첫째, 환경에서 실행 가능성이 있어야 하고, 둘째, 사용자가 실제로 요청할 법한 현실성을 갖추어야 하며, 셋째, 현재 모델의 약점을 드러낼 만큼 충분히 어려워야 해요.
이 시스템은 어떻게 지속적으로 성능을 개선하나요?
초기 평가를 통해 발견된 약점이나 필요한 지식 경계 근처에서 과제를 탐색해요. 이 과정을 반복하며 업데이트된 모델을 다시 평가하여 다음 학습 라운드를 위한 목표를 설정하는 순환 구조로 작동해요.