AI 에이전트 연구
Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation
ARarXiv
복잡하고 방대한 AI 에이전트 평가를 위해 통합 인프라 'Harbor Adapters'와 고난도 메타 벤치마크 'Harbor-Index'가 공개되었습니다.
세 줄 요약
- 특히 'Harbor-Index'는 난이도 필터링과 전문가 검토를 거쳐 구축되었으며, 최고 성능 모델조차 통과율 30% 미만이라는 높은 평가 기준을 제시합니다.
- 기존의 단편적인 테스트를 넘어, 광범위한 환경에서 에이전트가 가진 실제 역량과 실패 모드를 종합적으로 분석할 수 있게 합니다.
- 개발된 어댑터와 평가 결과는 모두 오픈소스로 공개되어 있어, 누구나 신뢰성 높고 포괄적인 에이전트 성능 검증에 활용할 수 있습니다.
복잡하고 방대한 AI 에이전트 평가를 위해 통합 인프라 'Harbor Adapters'와 고난도 메타 벤치마크 'Harbor-Index'가 공개되었습니다.