AI 에이전트의 일관성 확보를 위한 '습관 형성' 기법 연구 — AI 생성 일러스트AI 일러스트
AI 에이전트 연구

AI 에이전트의 일관성 확보를 위한 '습관 형성' 기법 연구

Making Agents More Consistent: Skills Should Form Habits for Repeat Tasks

arXiv9월 23일 발표 · 3분 · 심사 전 논문

AI 에이전트가 반복 작업에서 일관성이 떨어지고 불필요한 계산을 반복하는 비효율성을 보인다는 문제점을 지적하고, 이를 해결하기 위한 '스킬 습관 형성' 방식을 제안했습니다.

세 줄 요약arXiv 원문 기반
  1. 습관 형성을 거친 에이전트는 반복 질문에 대해 완벽하게 일관된 결과를 도출했으며, 기존 방식 대비 토큰 사용량을 획기적으로 줄이는 높은 효율성도 입증했습니다.
  2. 신뢰성이 필수적인 금융 감사나 규제 검토 등 고위험 분야에서 AI의 활용도를 높이고, 시스템 작동 과정을 투명하게 '감사(audit)'할 수 있는 기반을 마련합니다.
  3. 다만 일관성을 확보하는 대신 오류 발생 패턴이 매우 확실하고 반복된다는 단점이 있어, 에이전트의 신뢰성과 유연성 사이의 균형점 탐색이 중요합니다.

반복적인 작업 수행 시 는 일관성이 떨어지고 비효율성을 보이는 문제가 지적되었습니다. 실제로 42가지 작업을 세 번씩 테스트한 결과, 모델에 따라 38%에서 74%의 답변이 불일치하는 것으로 나타났습니다. 또한, 에이전트가 생성하는 출력 중 95.3%에서 97.2%는 시스템이 이미 알고 있는 계획을 재도출하는 데 사용되는 비효율적인 과정으로 확인되었습니다.

이를 해결하기 위해 '스킬 습관 형성(skill habit formation)' 방식이 제안됩니다. 이 방법은 에이전트가 자체 실행 기록에서 후보 스킬을 채굴하며, 이는 기존의 기능을 대체하기보다는 경쟁하는 결정론적 변형입니다. 후보 스킬은 자신이 주장하는 입력 공간 영역을 선언하고, 일반적인 경우는 스크립트로 처리되며 나머지는 추론 단계로 넘어갑니다. 이 과정에는 네 개의 비용 상승 게이트가 존재하며, 중앙 게이트는 후보의 실행 흔적을 보존된 참조와 비교하여 테스트합니다.

실제 텍스트-투-SQL 작업에 적용했을 때, 습관 형성 변형은 반복된 456개의 배포(dispatches) 모두에서 출력을 재현하는 높은 일관성을 보여주었습니다. 이는 기존의 추론 방식들이 각각 11~13개 또는 26개의 질문에서만 재현한 것과 비교됩니다. 또한, 이 방법은 14%에서 56% 적은 을 사용하며 순수하게는 7개부터 53개의 재사용 시점에서 긍정적인 효율성을 보였습니다.

이러한 구조적 개선은 정확도 측면에서도 효과를 입증했습니다. 라우팅과 추출을 분리하는 것만으로도 비용의 43%를 지불하고 종단 간(end-to-end) 정확도를 0.888에서 0.952로 높일 수 있었습니다. 다만, 일관성을 확보하는 대신 오류가 발생할 경우 그 패턴이 매우 확실하게 반복된다는 점은 시스템의 감사 가능성(auditable)을 높이는 대가입니다.

용어 풀이

AI 에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
매개변수
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
원문arXiv · Making Agents More Consistent: Skills Should Form Habits for Repeat Tasks같은 주제 가이드 · 바로 써 보기매일 아침 소식, 예약 작업으로 받기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv