리서치 연구
LLM 판정기를 활용한 코딩 에이전트 자가 개선 프레임워크
Self Improvement via Fast Tree-search
arXiv코딩 에이전트의 자가 개선 방식은 계산 비용과 시간이 많이 소요되는 것이 기존의 주요 문제였습니다.
세 줄 요약
- 연구진은 LLM 판정기(LLM-as-a-judge)를 활용하여 효율성을 극대화한 'SIFT'라는 새로운 자기 개선 프레임워크를 제안했습니다.
- SIFT는 느린 전체 벤치마크 대신, LLM의 쌍별 비교 점수를 중간 신호로 사용하여 자원 소모 없이 성능 향상을 유도합니다.
- 이는 AI 에이전트가 제한된 컴퓨팅 환경에서도 높은 수준으로 진화할 수 있음을 보여주며, 기존 방식 대비 우수한 효율성을 입증했습니다.
코딩 의 자가 개선(self-improvement)은 에이전트가 자신의 구현체를 재귀적으로 수정하는 과정을 통해 이루어지며, 이는 성능 향상을 가져올 수 있습니다. 하지만 기존 접근 방식들은 후보 패치에 대한 평가 과정 자체가 계산 비용과 시간이 많이 소요되는 주요 병목 지점이었습니다.
연구진은 이러한 문제를 해결하기 위해 'Recursive Self Improvement via Fast Tree-search (SIFT)'라는 프레임워크를 제안했습니다. SIFT는 느린 전체 재실행 대신, 을 판정기(LLM-as-a-judge)로 활용하여 후보 패치 간의 쌍별 비교 점수를 얻습니다. 이 승패 기록은 정규화된 Bradley-Terry 모델과 결합되어 강도 점수로 집계되며, 이 점수가 가벼운 분산형 트리 탐색 내부에서 순위 기반 부모 샘플링을 유도합니다.
이러한 방식으로 값비싼 다운스트림 태스크 평가는 가장 유망한 노드에만 할당됩니다. 그 결과, SIFT는 기존의 트리 검색 기반 자가 진화 프레임워크들보다 훨씬 낮은 리소스 요구 사항(CPU 시간, 벽시계 시간, 비용)으로 전체 Polyglot 벤치마크에서 우수한 성능을 입증했습니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.