기업용 소프트웨어 에이전트 평가를 위한 새로운 기준, ERPBench
ERPBench: A State-Grounded Evaluation Paradigm for Computer-Use Agents in Enterprise Software
arXivAI 에이전트의 기업 업무 능력을 평가하는 새로운 벤치마크 'ERPBench'가 공개되었습니다. 이 시스템은 실제 ERP 환경에서 스크린샷 기반 작업 후, 데이터베이스 기록까지 검증합니다.
- 일반적인 GUI 환경에서의 높은 성능이 실제 기업 업무에서 보장되지 않음을 입증했습니다. 에이전트가 데이터를 잘못 저장하여 핵심 비즈니스 기록을 오염시킬 수 있습니다.
- AI가 단순 반복 작업을 넘어 회사의 핵심 재무 및 운영 데이터베이스를 다룰 때는 기존 테스트만으로는 부족합니다. 전문적인 검증의 필요성을 강조하는 연구입니다.
- 기업 시스템(ERP)은 인터페이스가 복잡하고 여러 단계의 상호작용이 필수적입니다. 오류 발생 시 화면에 노출되지 않고 DB 기록만 변경될 위험을 고려해야 합니다.
스크린샷과 시뮬레이션된 액션을 통해 작동하는 컴퓨터 사용 가 빠르게 발전하고 있지만, 기존의 평가는 일반적인 데스크톱 및 웹 작업에만 초점을 맞추고 있습니다. 반면, 기업 자원 관리(ERP) 시스템은 조직의 재무, 조달, 재고, 고객 운영을 담당하며, 에이전트에게는 고밀도 인터페이스와 조정된 다단계 상호작용 등 독특한 난제를 제시합니다. 기존의 엔터프라이즈 들은 자체 플랫폼이나 소프트웨어의 시뮬레이션 근사치에 의존해왔습니다.
이에 연구진은 라이브하고 재현 가능한 ERP 시스템에서 스크린샷만을 기반으로 하는 에이전트를 평가하는 새로운 벤치마크인 'ERPBench'를 소개했습니다. 이 벤치마크는 각 작업을 데이터베이스의 정답 값(ground-truth values)과 비교하여 점수를 매깁니다. 또한, 안전한 배포를 위해 에이전트의 행동을 인간 승인 단계로 거치는 프로덕션 등급의 하네스도 함께 제공합니다.
실제 테스트 결과, 강력한 일반 GUI 성능이 기업 환경에서의 신뢰성으로 이어지지 않음을 입증했습니다. 일부 에이전트는 작업을 저장하는 데 성공하더라도 실제 기록은 잘못될 수 있습니다. 예를 들어, 특정 에이전트들은 최대 85%의 실행에서 데이터를 저장하지만, 정확한 값을 작성하는 비율은 최소 3%에 불과하다는 결과가 보고되었습니다. 이는 기업 워크플로우 특유의 실패 모드를 분석할 필요성을 보여줍니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.