에이전트 시스템 실행 구조 자동 발견 프레임워크 MILO — AI 생성 일러스트
리서치 연구

에이전트 시스템 실행 구조 자동 발견 프레임워크 MILO

MILO: Automated Harness Discovery via Orchestrated Multi-Agent Evolution

arXiv10월 1일 발표 · 3분 · 프리프린트

에이전트 시스템의 성능을 좌우하는 '하네스' 설계는 조합 탐색 공간이 방대하여 수작업 의존도가 높고 자동화가 어려웠습니다.

왜 중요해요AI 정리

이 기술은 AI가 단순히 주어진 작업을 수행하는 것을 넘어, 스스로 최적의 실행 구조를 설계하고 개선할 수 있는 자율적인 능력을 갖추었음을 의미해요.

세 줄 요약arXiv 원문 기반
  1. 연구진은 하네스 자체와 이를 발견하는 전략을 함께 공동 진화시키는 'MILO(Meta-evolutionary Island Orchestration)' 프레임워크를 제안했습니다.
  2. MILO는 여러 벤치마크에서 기존 최고 성능 기록과 검색 방법들을 모두 능가했으며, 특정 작업에서는 초기 대비 최대 28.3%의 개선을 입증했습니다.
  3. 이는 AI가 단순히 주어진 작업을 수행하는 것을 넘어, 스스로 최적의 실행 구조(하네스)를 설계하고 개선할 수 있는 자율적인 능력을 갖추었음을 의미합니다.

현대 시스템은 AI 모델과 환경 상호작용을 제어하는 '하네스'를 결합합니다. 이 하네스의 설계는 장기적인 성능에 큰 영향을 미치지만, 조합 탐색 공간이 방대하여 수동 작업 의존도가 높고 자동화가 어려웠습니다. 기존의 자동화된 방법들은 나 스킬 같은 특정 구성 요소만 좁게 탐색하거나 고정된 전략에 빠지는 한계가 있었습니다.

연구진은 하네스 자체와 이를 발견하는 전략을 함께 공동 진화시키는 'MILO(Meta-evolutionary Island Orchestration)'라는 프레임워크를 제안했습니다. MILO는 계층적 혈통 메모리(rejected mutations를 부정 증거로 사용), 전역 검색 이력과 부모별 피드백을 이용해 하네스를 재작성하는 개체군별 변이 유발 에이전트, 그리고 혈통 접합 및 종 분화 등을 통해 탐색을 조정하는 오케스트레이터의 세 가지 요소를 결합합니다.

MILO는 Opus 4.8 및 오픈 모델을 사용하여 Terminal-Bench 2.1, PaperBench, DeepSWE 등에서 테스트되었으며, 기존 최고 성능 기록과 검색 방법들을 모두 능가했습니다. 특히 초기 하네스 대비 최대 +28.3%의 개선율을 보였고, Terminal-Bench 2.1에서는 $86.1 \pm 2.0\%$를 달성하며 공식 리더보드 상위권($83.8 \pm 2.3\%$)을 초과하는 결과를 보여주었습니다.

용어 풀이

에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
프롬프트
AI에게 주는 지시나 질문 글.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
궁금한 점AI 정리 · 원문 기반
에이전트 시스템에서 하네스는 어떤 역할을 하나요?

하네스는 AI 모델과 환경의 상호작용을 제어하는 핵심 구조예요. 이 설계가 에이전트 시스템의 장기적인 성능에 큰 영향을 미치지만, 조합 탐색 공간이 방대해서 수동 작업 의존도가 높고 자동화하기 어려웠어요.

MILO 프레임워크는 어떤 요소들로 구성되어 있나요?

MILO는 세 가지 요소를 결합했어요. 첫째, 계층적 혈통 메모리를 사용하고, 둘째, 개체군별 변이 유발 에이전트가 하네스를 재작성하며, 셋째, 오케스트레이터가 혈통 접합이나 종 분화 등을 통해 탐색을 조정해요.

MILO는 어떤 성능 개선을 보여주었나요?

기존 최고 성능 기록과 검색 방법들을 모두 능가했어요. 특히 초기 하네스 대비 최대 28.3%의 개선율을 보였고, Terminal-Bench 2.1 같은 곳에서도 높은 점수를 달성했답니다.

원문arXiv · MILO: Automated Harness Discovery via Orchestrated Multi-Agent Evolution
궁금한 점 3개AI 정리