경험 기반 신뢰도 추정: LLM의 성능을 높이는 새로운 패러다임 — AI 생성 일러스트AI 일러스트
리서치 연구

경험 기반 신뢰도 추정: LLM의 성능을 높이는 새로운 패러다임

Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents

arXiv9월 17일 발표 · 2분 · 심사 전 논문

기존 언어 모델의 신뢰도 추정은 현재 진행되는 추론 과정에만 의존했지만, 이 연구는 모델이 축적한 과거 경험을 활용하는 XConf를 제안합니다.

세 줄 요약arXiv 원문 기반
  1. XConf는 유사 과제의 성공 기록을 회상(Recall)하고 이를 바탕으로 모델이 스스로 실패 패턴을 인식하며 신뢰도를 재조정하는 것이 핵심입니다.
  2. 답변의 신뢰도가 낮다고 판단되면 출력을 거부하는 '선택적 예측'이 가능해져, 특히 복잡한 에이전트 작업에서 성공률을 크게 높이는 실질적 가치가 있습니다.
  3. 로짓 접근이나 모델 업데이트가 필요 없는 형식 일반적 구조를 가지며, 성능은 과거 경험 데이터의 질과 유사 과제 검색 능력에 좌우됩니다.

기존 언어 모델의 신뢰도 추정 방식은 현재 진행되는 추론 과정 자체(인트로스펙션, 확률 점수화 등)에만 의존한다는 한계가 있다. 본 연구는 이러한 한계를 극복하기 위해 XConf (eXperiential Confidence)를 제안한다. 이는 모델이 축적한 과거 경험을 활용하여 신뢰도를 추정하는 방식이다. 이 경험은 과제, 모델의 성찰 기록, 명시된 신뢰도, 결과, 그리고 배운 교훈으로 구성되어 있다.

XConf는 새로운 과제가 주어지면 '회상(Recall)' 단계를 통해 유사한 과거 에피소드를 검색하고 그 역사적 성공률을 읽어낸다. 이후 '성찰(Reflect)' 단계에서 모델에게 이 기록을 제시하여 반복적인 실패 모드를 스스로 명명하게 하고, 이를 바탕으로 업데이트된 신뢰도를 재진술한다.

XConf는 로짓 접근이나 업데이트가 필요 없는 형식 일반적 구조를 가지며, 단 한 번의 답변 생성 비용만 발생한다. 아홉 개의 (추론, 코딩, QA 등)와 세 가족의 네 개 모델을 대상으로 테스트한 결과, XConf는 24개 비교 중 23개에서 기존 방식과 동등하거나 능가하는 성능을 보였다. 특히 신뢰도가 낮은 상위 10% 에피소드를 배제하는 선택적 예측은 작업의 성공률을 최대 8.7 포인트까지 높이는 효과를 가져왔다.

용어 풀이

토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
멀티모달
글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
원문arXiv · Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv