에이전트가 스스로 코드를 개선하는 자기 진화형 프레임워크 — AI 생성 일러스트
AI 에이전트 연구

에이전트가 스스로 코드를 개선하는 자기 진화형 프레임워크

Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer

arXiv10월 1일 발표 · 3분 · 프리프린트

AI 에이전트가 스스로 작업을 수행하는 코드 구조(harness)를 개선하는 '자기 진화형 프레임워크'를 제안했습니다. 모델이 문제 해결과 동시에 자신의 코드를 수정하며 성능을 향상시키는 원리입니다.

왜 중요해요AI 정리

이 기술은 에이전트가 스스로 코드를 개선하며 다양한 도메인의 복합적인 문제를 해결할 수 있게 하여 실제 산업 환경에서의 활용도를 높여줘요.

세 줄 요약arXiv 원문 기반
  1. 초기 버전 대비 평균 점수가 크게 상승했으며, 특히 학습에 사용되지 않은 외부(out-of-distribution) 벤치마크에서 높은 개선율을 보여 기존 최고 기록 모델의 성능을 능가했습니다.
  2. 이 기술은 특정 작업에 국한되지 않고 다양한 도메인의 복합적인 문제를 해결하는 범용성을 높여줍니다. 이는 실제 산업 환경에서 AI 에이전트의 활용도를 극대화할 수 있음을 의미합니다.
  3. 성능 검증을 위해 학습 데이터와 완전히 분리된 외부 벤치마크를 엄격하게 사용했으며, 진화 과정에서 나타난 출력 자르기 등 내부 메커니즘 분석도 함께 제공되었습니다.

는 구성, 도구 호출, 컨텍스트 관리 등을 담당하는 코드 구조인 '하네스'를 사용합니다. 본 연구는 에이전트가 자신의 하네스를 스스로 개선할 수 있는 '자기 진화형 하네스' 개념을 제시합니다. 기존 방법들이 별도의 제안자(proposer)와 해결사(solver)를 분리하여 각 별로 하네스를 진화시키는 방식이었다면, 본 연구는 동일한 고정 모델이 해결사 역할을 수행하며 실행 기록 전체를 읽어 직접 해당 하네스를 수정하는 순환적 자기 개선 프레임워크를 제안합니다. 이 과정은 다양한 도메인의 다섯 가지 벤치마크에서 작업을 추출하여 진행됩니다.

진화 과정은 다중 작업 사전 학습과 지속적인 학습의 두 단계로 구성되었습니다. 초기 49줄 분량의 시드 하네스로 시작한 결과, 첫 번째 단계를 거친 후에는 인-분포(in-distribution) 벤치마크에서 평균 점수가 4.48점 향상되었고, 아웃-오브-디스트리뷰션 벤치마크에서는 12.64점의 개선을 보여 Codex를 능가했습니다. 특히 두 번째 단계로 외부 벤치마크인 Claw-Eval에서 지속적으로 진화시킨 결과, 해당 벤치마크 점수는 66.17점에서 68.06점으로 상승하며 Codex 기록을 초과 달성하는 성과를 보였습니다.

용어 풀이

LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
프롬프트
AI에게 주는 지시나 질문 글.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
궁금한 점AI 정리 · 원문 기반
에이전트는 어떻게 코드를 스스로 개선하나요?

기존 방식과 달리, 이 연구는 동일한 고정 모델이 해결사 역할을 하면서 실행 기록 전체를 읽어 직접 하네스를 수정하는 순환적 자기 개선 프레임워크를 사용해요. 이 과정은 다양한 도메인의 다섯 가지 벤치마크에서 진행돼요.

성능 향상 정도가 어느 정도인가요?

초기 버전 대비 인-분포 벤치마크에서는 평균 점수가 크게 상승했고, 외부 벤치마크인 Claw-Eval 같은 곳에서도 기존 최고 기록을 초과 달성하는 성과를 보였어요.

원문arXiv · Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer
궁금한 점 2개AI 정리