에이전트 성능 향상을 위한 검색 공간 제어 기술 RobustSGPO — AI 생성 일러스트AI 일러스트
AI 에이전트 연구

에이전트 성능 향상을 위한 검색 공간 제어 기술 RobustSGPO

RobustSGPO: Search-Space Control for Agent Harness Evolution

arXiv9월 10일 발표 · 3분 · 심사 전 논문

AI 에이전트의 성능 개선을 위해 수정 범위와 탐색 과정을 명확히 제어하는 'RobustSGPO' 기술이 개발되었습니다.

세 줄 요약arXiv 원문 기반
  1. RobustSGPO는 패치 생성 및 검증 과정을 거쳐, 기존 상태와 보존된 스냅샷 중 원하는 지점부터 탐색을 이어가며 에이전트 성능을 크게 향상시킵니다.
  2. 에이전트가 스스로 수정 경로를 제어하고 다양한 대안적 시나리오를 탐색하게 함으로써, AI의 문제 해결 능력과 신뢰성을 근본적으로 끌어올릴 수 있습니다.
  3. 검색 공간 제어는 높은 성능을 보장하지만, 과정에서 추가적인 오버헤드가 발생할 수 있으므로 지식 유지(retention) 전략 관리가 중요합니다.

Semantic-gradient-based optimization(SGPO)는 실행 피드백을 활용하여 하네스를 개선하지만, 수정 범위와 작업 선택 문제가 해결되지 않는 한계가 있었습니다. 연구진은 이를 보완한 RobustSGPO를 도입하여 요청된 편집 사항을 명시하고 패치를 구성 및 검사하는 과정을 거칩니다. 이 기술은 기존 상태(incumbent) 또는 보존된 스냅샷 중 원하는 지점부터 탐색을 지속할 수 있도록 합니다.

이 시스템은 AgentX 브레인스토밍 워크플로우를 대상으로 120개 태스크, 95회 실행, 총 7,350개의 후보 시도를 통해 평가되었습니다. 그 결과, 주기적인 $1\to2\to3$ 스케줄링 방식이 고정 최대 권한 대비 0.28 테스트 점수 포인트의 증가를 보였습니다. 또한 RobustSGPO는 30개 홀드아웃 태스크에서 완료율을 60.0%에서 80.0%로 높였으며, 2천만 예산 하에 테스트 품질을 3.77에서 4.14로 개선하는 성과를 보였습니다.

검색 공간 제어는 실행 가능한 편집점과 대안적인 시작점을 제공하여 에이전트의 전반적인 품질 향상에 기여합니다. 특히, 카테고리 보존(Category retention)은 변화 이후 소스-태스크 성능 저하를 줄이는 반면, 무작위 보존(random retention) 전략을 사용했을 때는 더 높은 목적지 지점에 도달하는 경향이 관찰되었습니다.

용어 풀이

prompt
AI에게 주는 지시나 질문 글.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
원문arXiv · RobustSGPO: Search-Space Control for Agent Harness Evolution같은 주제 가이드 · 바로 써 보기매일 아침 소식, 예약 작업으로 받기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv