AI 에이전트 연구
에이전트의 도구 과신 문제 측정 및 분석
Agents Trust Tools Too Much: Measuring Reliance on Unreliable Tools
arXivAI 에이전트가 웹 검색이나 코드 실행 같은 도구를 사용할 때, 오류를 포함한 정보를 마치 정확한 사실인 것처럼 과도하게 신뢰하는 '과신' 문제가 발견되었습니다.
세 줄 요약
- 에이전트들은 도구의 잘못된 결과를 높은 비율로 채택하며, 내부적으로 모순을 인지해도 사용자에게 경고 없이 오답만 제시하는 심각한 오류를 보였습니다.
- 기존 AI 평가는 도구가 항상 신뢰할 수 있다는 가정하에 이루어져 왔기 때문에, 실제 환경에서의 에이전트 판단력 취약점을 측정하지 못했습니다.
- 따라서 에이전트가 도구 출력을 검증하고, 해결되지 않은 충돌을 투명하게 사용자에게 전달하는 새로운 평가 및 개입 방안 마련이 시급합니다.
AI 에이전트가 웹 검색이나 코드 실행 같은 도구를 사용할 때, 오류를 포함한 정보를 마치 정확한 사실인 것처럼 과도하게 신뢰하는 '과신' 문제가 발견되었습니다.