에이전트 성공 여부 판단: 내부 표현 기반 신뢰도 측정 기술 — AI 생성 일러스트AI 일러스트
AI 에이전트 연구

에이전트 성공 여부 판단: 내부 표현 기반 신뢰도 측정 기술

Do Agents Know When They Succeed? Calibrating Agent Confidence from Internal Representations

arXiv9월 10일 발표 · 2분 · 심사 전 논문

에이전트가 계획 수립이나 도구 사용 등 복잡한 작업을 수행할 때, 성공 여부를 정확히 판단하는 신뢰도 측정은 안전성 확보에 필수적입니다.

세 줄 요약arXiv 원문 기반
  1. 연구진은 모델의 내부 표현 변화를 분석하여 최종 과제 성공 가능성을 예측하는 '잠재 궤적 역학(LTD)'과 '행동 표현 프로브(ARP)' 기법을 개발했습니다.
  2. 이 방법들은 프롬프트 수정이나 다중 시뮬레이션 없이도 신뢰도를 측정하며, Bash, SQL 등 다양한 환경에서 높은 성능을 입증했습니다.
  3. 이는 안전성이 중요한 에이전트 시스템에 적용 가능한, 오버헤드가 거의 없는(Zero-Overhead) 강력한 신뢰도 모니터링 솔루션을 제공합니다.

안전성이 중요한 시스템이 빠르게 채택됨에 따라, 에이전트가 수행하는 행동과 관련된 신뢰도를 측정하는 것이 필수적입니다. 기존의 머신러닝 시스템과 달리, 에이전트 워크플로우는 계획 수립(planning), 도구 호출(tool invocation), 동적인 환경 상호작용 등 복잡한 실패 모드를 가지기 때문에 정확한 성공 여부 판단이 중요합니다.

연구진은 모델의 내부 표현을 활용하여 다단계 에이전트 설정에서 최종 과제 성공 가능성을 예측하는 두 가지 보완적 방법을 제시했습니다. 첫 번째 방법인 잠재 궤적 역학(LTD)은 상호작용 궤적 전반에 걸친 잔여 스트림 표현 변화를 요약하며, 두 번째 방법인 행동 표현 프로브(ARP)는 행동 결정 시점에서 형성된 표현을 통해 성공 여부를 예측합니다.

이러한 방법들은 Bash, SQL, Python의 세 가지 상호작용 와 Qwen14B, Qwen7B, DeepSeek6.7B 등 세 모델군에 걸쳐 테스트되었으며, 표면적인 생성이나 시퀀스 기반 보정 기준선보다 일관되게 우수한 성능을 보였습니다. 이로써 변경이나 다중 샘플 롤아웃이 필요 없는 제로 오버헤드 신뢰도 모니터링 솔루션을 제공합니다.

용어 풀이

에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
프롬프트
AI에게 주는 지시나 질문 글.
원문arXiv · Do Agents Know When They Succeed? Calibrating Agent Confidence from Internal Representations같은 주제 가이드 · 바로 써 보기매일 아침 소식, 예약 작업으로 받기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv