에이전트 시스템 실행 구조 자동 발견 프레임워크 MILO
MILO: Automated Harness Discovery via Orchestrated Multi-Agent Evolution
arXiv에이전트 시스템의 성능을 좌우하는 '하네스' 설계는 조합 탐색 공간이 방대하여 수작업 의존도가 높고 자동화가 어려웠습니다.
이 기술은 AI가 단순히 주어진 작업을 수행하는 것을 넘어, 스스로 최적의 실행 구조를 설계하고 개선할 수 있는 자율적인 능력을 갖추었음을 의미해요.
- 연구진은 하네스 자체와 이를 발견하는 전략을 함께 공동 진화시키는 'MILO(Meta-evolutionary Island Orchestration)' 프레임워크를 제안했습니다.
- MILO는 여러 벤치마크에서 기존 최고 성능 기록과 검색 방법들을 모두 능가했으며, 특정 작업에서는 초기 대비 최대 28.3%의 개선을 입증했습니다.
- 이는 AI가 단순히 주어진 작업을 수행하는 것을 넘어, 스스로 최적의 실행 구조(하네스)를 설계하고 개선할 수 있는 자율적인 능력을 갖추었음을 의미합니다.
현대 시스템은 AI 모델과 환경 상호작용을 제어하는 '하네스'를 결합합니다. 이 하네스의 설계는 장기적인 성능에 큰 영향을 미치지만, 조합 탐색 공간이 방대하여 수동 작업 의존도가 높고 자동화가 어려웠습니다. 기존의 자동화된 방법들은 나 스킬 같은 특정 구성 요소만 좁게 탐색하거나 고정된 전략에 빠지는 한계가 있었습니다.
연구진은 하네스 자체와 이를 발견하는 전략을 함께 공동 진화시키는 'MILO(Meta-evolutionary Island Orchestration)'라는 프레임워크를 제안했습니다. MILO는 계층적 혈통 메모리(rejected mutations를 부정 증거로 사용), 전역 검색 이력과 부모별 피드백을 이용해 하네스를 재작성하는 개체군별 변이 유발 에이전트, 그리고 혈통 접합 및 종 분화 등을 통해 탐색을 조정하는 오케스트레이터의 세 가지 요소를 결합합니다.
MILO는 Opus 4.8 및 오픈 모델을 사용하여 Terminal-Bench 2.1, PaperBench, DeepSWE 등에서 테스트되었으며, 기존 최고 성능 기록과 검색 방법들을 모두 능가했습니다. 특히 초기 하네스 대비 최대 +28.3%의 개선율을 보였고, Terminal-Bench 2.1에서는 $86.1 \pm 2.0\%$를 달성하며 공식 리더보드 상위권($83.8 \pm 2.3\%$)을 초과하는 결과를 보여주었습니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 프롬프트
- AI에게 주는 지시나 질문 글.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
에이전트 시스템에서 하네스는 어떤 역할을 하나요?
하네스는 AI 모델과 환경의 상호작용을 제어하는 핵심 구조예요. 이 설계가 에이전트 시스템의 장기적인 성능에 큰 영향을 미치지만, 조합 탐색 공간이 방대해서 수동 작업 의존도가 높고 자동화하기 어려웠어요.
MILO 프레임워크는 어떤 요소들로 구성되어 있나요?
MILO는 세 가지 요소를 결합했어요. 첫째, 계층적 혈통 메모리를 사용하고, 둘째, 개체군별 변이 유발 에이전트가 하네스를 재작성하며, 셋째, 오케스트레이터가 혈통 접합이나 종 분화 등을 통해 탐색을 조정해요.
MILO는 어떤 성능 개선을 보여주었나요?
기존 최고 성능 기록과 검색 방법들을 모두 능가했어요. 특히 초기 하네스 대비 최대 28.3%의 개선율을 보였고, Terminal-Bench 2.1 같은 곳에서도 높은 점수를 달성했답니다.