AI 에이전트의 자기 순환 오류 측정: 새로운 원시 요소와 평가 기준
Self-Cleaning and Captured Anyway: One Measured Primitive for Error in a Store an Agent Writes to Itself, and What a Falling Score Actually Measures
arXivAI 에이전트가 스스로 생성한 결론을 저장소에 기록하고 이를 다시 참조하는 '자기 순환' 과정을 분석하여, 기존의 일방적 오염 관점과는 다른 새로운 측정 기준을 제시했습니다.
- 무한 시간 축적 과정에서 성능 저하가 아닌 두 경계 사이의 선택 문제로 규명되었으며, 특히 핵심 원시 요소인 '복사 함수'가 모델 정보 드리프트 방향 예측에 결정적인 역할을 했습니다.
- AI 신뢰성 평가 시 단순히 결과물의 양(Count)을 측정하는 것을 넘어, 모델이 얼마나 구별 가능한 정보를 유지하는지(Distinguishability)를 분석해야 할 필요성을 강조합니다.
- 모델 성능 향상을 위해 규모 확장만으로는 근본적 한계를 극복하기 어려우며, 높은 정확도를 위해서는 내부 일관성 게이트와 같은 구조적 조건이 필수적임을 확인했습니다.
가 스스로 결론을 생성하여 저장소(store)에 기록하고 이를 다시 참조하는 '자기 순환' 과정은 기존에 알려진 일방적 오염 관점과는 다른 분석 틀을 제시합니다. 이 과정을 무한 지속 시간으로 확장하여 접근할 경우, 쓰기 행위가 삭제를 유발하지 않기 때문에 도달 가능한 상태 공간의 상한선이 (n-1)/n이라는 하드 에지(hard upper edge)를 가지며, 그 결과는 단순한 쇠퇴(decay)보다는 두 경계 사이의 선택 문제로 규명됩니다. 예를 들어, f_0 = 0.9일 때 두 모드의 간격은 220회 실행 중 3.6%를 차지하며, 이는 균일 분포가 예측하는 20.6%와 차이가 있습니다.
모델의 기여도는 가 조정되지 않은 단 하나의 측정 원시 요소인 복사 함수 \gamma(\phi)에 의해 전달됩니다. 이 함수는 36개의 Wikidata 사실을 기반으로 $\text{sign}(\hat{\gamma} - \gamma_{crit})$와 같은 지표를 통해 드리프트 방향을 예측합니다. 또한, AI 신뢰성 평가 시 단순히 결과물의 개수(Count)를 측정하는 것을 넘어, 모델이 얼마나 구별 가능한 정보(Distinguishability)를 유지하는지 분석해야 함을 강조하며, 실제 사실들에서 다중 값 실행은 나머지 실행보다 6.4배 높은 점유율을 보였습니다.
모델 성능 향상을 위해 단순히 규모 확장만으로는 근본적인 한계를 극복하기 어렵습니다. 높은 정확도를 달성하려면 일관성 게이트(consistency gate)와 같은 구조적 조건이 필수적이며, 이는 모든 모델을 0.993으로 이끌 수 있습니다. 또한, 재샘플링 단위인 시드를 기준으로 할 때, 통제된 44개의 시드를 사용하면 특정 순서에 대한 주장이 Spearman 상관계수 +0.98에서 +0.31~-0.80으로 급격히 감소하는 등 안정성 측면의 변화가 관찰되었습니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.