리서치 연구

대리 모델의 로그 확률로 검증하는 블랙박스 LLM 에이전트 신뢰도 측정

Proxy Confidence: Auditing Black-Box LLM Agents with a Surrogate's Log-Probabilities

ARarXiv10월 6일 발표 · 3분 · 프리프린트

LLM 에이전트가 수행하는 도구 호출이나 코드는 오류를 포함할 수 있으나, 모델의 내부 확률을 알기 어려워 신뢰도 검증에 한계가 있었습니다.

왜 중요해요AI 정리

이 기술은 대규모 언어 모델 에이전트가 내놓는 결과의 신뢰도를 외부에서 검증하여, 실제 시스템의 오류를 줄이고 성공률을 높여준다는 점이 중요해요.

세 줄 요약arXiv 원문 기반
  1. 연구진은 저비용 오픈 가중치 대리 모델(Surrogate)을 병렬로 실행하여 여러 각도의 평가를 거쳐 높은 정확도의 신뢰도를 측정하는 방법을 제시했습니다.
  2. 이 기술은 신뢰도가 낮은 호출만 검토 단계로 넘기거나 점수를 피드백해 에이전트의 다음 단계를 개선함으로써 실제 시스템의 성공률을 높입니다.
  3. 내부 구조 접근 없이 도구 호출과 함께 최소한의 비용으로 작동하며, 오류 유형 불명 시에는 앙상블 방식이 가장 효과적입니다.

배포된 (LLM) 는 도구 호출, 쿼리, 코드를 생성할 수 있으나, 오류가 발생했을 때는 이미 행동이 실행되어 되돌리기 어렵습니다. 현재의 최신 들은 모델의 확률을 숨기고 있으며, 에이전트가 제시하는 신뢰도는 중요한 실수에 대해서는 우연 수준을 넘기지 못합니다.

연구진은 저비용 오픈 대리 모델(Surrogate)을 병렬로 실행하여 누락된 내부 신호를 복구하는 방법을 제안했습니다. 이 대리 모델은 에이전트와 동일한 컨텍스트, 스키마, 제안된 행동을 읽어낸 후, 교사 강제(teacher forcing), 요청-PMI(request-PMI) 등을 포함한 여러 보완적 판독기(readouts)를 통해 호출의 확률을 측정합니다. 이 과정은 에이전트 내부 구조에 접근할 필요가 없으며 도구 호출과 함께 최소 비용으로 작동합니다.

이 방법론은 어려운 코딩 작업에서 에이전트가 제시한 신뢰도(0.598)보다 높은 AUROC 0.825를 달성했습니다. 또한, 자체 일관성 검증 방식 대비 근접 결정론적 에이전트에서 1/K의 비용으로 +0.14에서 +0.19까지 성능 향상을 보였습니다. 이 신호는 실시간 게이트(least-trustworthy 호출을 검토 단계로 상향)나 신뢰도 피드백 방식으로 활용되어, 라이브 실행 에서 작업 성공률을 각각 +0.119 및 +0.137 높이는 데 기여했습니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
API
프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
궁금한 점AI 정리 · 원문 기반
LLM 에이전트가 제시하는 신뢰도 점수는 왜 믿기 어려워요?

현재 최신 API들은 모델의 토큰 확률을 숨기고 있어서, 에이전트가 스스로 제시하는 신뢰도는 중요한 실수에 대해서는 우연 수준을 넘지 못하기 때문이에요.

에이전트 내부 구조에 접근하지 않고 어떻게 신뢰도를 측정하나요?

연구진은 저비용 오픈 가중치 대리 모델을 병렬로 실행해요. 이 대리 모델이 에이전트와 동일한 컨텍스트, 스키마, 제안된 행동을 읽어낸 후 여러 판독기를 통해 호출의 확률을 측정하기 때문이에요.

이 신뢰도 검증 기술은 실제 시스템에서 어떤 도움을 주나요?

실시간 게이트나 신뢰도 피드백 방식으로 활용할 수 있어요. 이를 통해 가장 신뢰도가 낮은 호출만 별도로 검토 단계로 넘기거나 점수를 피드백하여, 작업 성공률을 높이는 데 기여해요.

원문arXiv · Proxy Confidence: Auditing Black-Box LLM Agents with a Surrogate's Log-Probabilities
궁금한 점 3개AI 정리