LLM 판정기를 활용한 코딩 에이전트 자가 개선 프레임워크 — AI 생성 일러스트AI 일러스트
리서치 연구

LLM 판정기를 활용한 코딩 에이전트 자가 개선 프레임워크

Self Improvement via Fast Tree-search

arXiv9월 18일 발표 · 2분 · 심사 전 논문

코딩 에이전트의 자가 개선 방식은 계산 비용과 시간이 많이 소요되는 것이 기존의 주요 문제였습니다.

세 줄 요약arXiv 원문 기반
  1. 연구진은 LLM 판정기(LLM-as-a-judge)를 활용하여 효율성을 극대화한 'SIFT'라는 새로운 자기 개선 프레임워크를 제안했습니다.
  2. SIFT는 느린 전체 벤치마크 대신, LLM의 쌍별 비교 점수를 중간 신호로 사용하여 자원 소모 없이 성능 향상을 유도합니다.
  3. 이는 AI 에이전트가 제한된 컴퓨팅 환경에서도 높은 수준으로 진화할 수 있음을 보여주며, 기존 방식 대비 우수한 효율성을 입증했습니다.

코딩 의 자가 개선(self-improvement)은 에이전트가 자신의 구현체를 재귀적으로 수정하는 과정을 통해 이루어지며, 이는 성능 향상을 가져올 수 있습니다. 하지만 기존 접근 방식들은 후보 패치에 대한 평가 과정 자체가 계산 비용과 시간이 많이 소요되는 주요 병목 지점이었습니다.

연구진은 이러한 문제를 해결하기 위해 'Recursive Self Improvement via Fast Tree-search (SIFT)'라는 프레임워크를 제안했습니다. SIFT는 느린 전체 재실행 대신, 을 판정기(LLM-as-a-judge)로 활용하여 후보 패치 간의 쌍별 비교 점수를 얻습니다. 이 승패 기록은 정규화된 Bradley-Terry 모델과 결합되어 강도 점수로 집계되며, 이 점수가 가벼운 분산형 트리 탐색 내부에서 순위 기반 부모 샘플링을 유도합니다.

이러한 방식으로 값비싼 다운스트림 태스크 평가는 가장 유망한 노드에만 할당됩니다. 그 결과, SIFT는 기존의 트리 검색 기반 자가 진화 프레임워크들보다 훨씬 낮은 리소스 요구 사항(CPU 시간, 벽시계 시간, 비용)으로 전체 Polyglot 벤치마크에서 우수한 성능을 입증했습니다.

용어 풀이

에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
API
프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
원문arXiv · Self Improvement via Fast Tree-search같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv