AI 에이전트 연구

FraudBench: Stress-Testing Policy-Grounded Banking Agents Against Adaptive Fraud

ARarXiv8월 21일 발표 · 1분 · 심사 전 논문

FraudBench는 정책 기반 은행 에이전트가 대화 중 사기를 막는지 실행형으로 평가하는 벤치마크다.

세 줄 요약arXiv 원문 기반
  1. FraudBench는 698개 정책 문서, 150개 시나리오, 107개 공개 과제로 4개 에이전트를 평가해 공격 보안 49~65%를 확인했다.
  2. 고객이 대화로 신원, 인가, 신뢰를 조작해도 에이전트가 정책 문서에 맞춰 안전한 행동을 고르는지 확인된다.
  3. 4개 에이전트 단일 실행 결과로, 머니 머리와 제1자 사기가 공통 약점이었고 43개 체인 공격은 제외됐다.

FraudBench는 정책 기반 은행 에이전트가 대화 중 사기를 막는지 실행형으로 평가하는 벤치마크다.

원문arXiv · FraudBench: Stress-Testing Policy-Grounded Banking Agents Against Adaptive Fraud같은 주제 가이드 · 바로 써 보기매일 아침 소식, 예약 작업으로 받기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기