AI 에이전트 연구
BTS-AgentBench: A Deterministic, Replayable Pipeline from Read-Only Telemetry Logs to Agent Benchmarks
ARarXiv
연구진은 산업 현장의 대용량 원격 측정 로그를 AI 에이전트가 수행할 수 있는 실행 가능한 다단계 작업으로 변환하는 파이프라인, BTS-AgentBench를 개발했습니다.
세 줄 요약
- 이 시스템은 원시 데이터를 표준화된 도구 저장소로 정규화하고, 이를 기반으로 금본위 답변과 증거가 포함된 에피소드를 체계적으로 컴파일합니다.
- 이 기술을 통해 기존에 활용하기 어려웠던 산업 현장의 방대한 데이터를 실제 AI 에이전트의 성능 평가 기준으로 삼아 실질적인 적용 가능성을 높였습니다.
- 검증 결과, 시스템은 원본 계산 과정을 완벽히 보존하며 GPT-5.5와 같은 고성능 모델을 통해 테스트 케이스를 성공적으로 재현하는 높은 신뢰도를 입증했습니다.
연구진은 산업 현장의 대용량 원격 측정 로그를 AI 에이전트가 수행할 수 있는 실행 가능한 다단계 작업으로 변환하는 파이프라인, BTS-AgentBench를 개발했습니다.