AREX-2를 활용한 자가 개선 LLM 에이전트 연구
AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks
LLM 에이전트가 테스트 과정에서 스스로 성능을 개선하는 '자가 개선 능력'을 구현하기 위해 AREX-2를 개발했습니다.
이 연구는 AI 에이전트가 단순히 정해진 작업을 수행하는 것을 넘어, 테스트 과정에서 스스로 성능을 개선하며 자율적으로 발전할 수 있는 새로운 방향성을 제시해요.
- 에이전트는 '반성(Reflection)'과 '장기 실행' 능력을 결합하고, 기계 학습 및 코딩 과제 데이터를 통해 훈련되어 높은 효과를 입증했습니다.
- 이번 연구는 장기간의 개선 과정이 담긴 데이터가 에이전트의 자율적이고 지속적인 성능 향상에 매우 효과적인 핵심 방법론임을 제시합니다.
- AREX-2는 BrowseComp, GAIA 등 다양한 전문 벤치마크에서 강력한 성능을 보여주며 범용 인공지능 개발의 새로운 방향성을 제시합니다.
AREX-2는 의 '자가 개선 능력'을 향상시키기 위한 노력으로, 이는 테스트 과정에서 솔루션을 반복적으로 정제하는 능력을 의미합니다. 이 능력은 현재보다 더 나은 솔루션을 생성하는 '반성(reflection)'과 여러 라운드에 걸쳐 반복적인 실행 효과를 유지하는 '장기 실행(long-horizon execution)'이라는 두 가지 상호 보완적 기능을 기반으로 합니다.
연구진은 이러한 기능들이 도메인에 구애받지 않는다고 가정하고, 검증 가능한 피드백을 제공하는 기계 학습 및 알고리즘 프로그래밍 과제에서 장기적인 개선 궤적 데이터를 합성하여 에이전트를 훈련시켰습니다. 이 접근 방식은 자가 개선 능력을 위한 효과적인 경로임을 보여줍니다.
Qwen3.8-27B 기반으로 구축된 AREX-2는 MLE-bench Lite(81.8)와 Frontier-CS(70.7)에서 강력한 성능을 달성했습니다. 또한, BrowseComp(84.0), HLE(52.6), GAIA(92.2), DeepSearchQA(93.8) 등 다양한 전문 에서도 높은 성능을 보였으며, 라운드 예산이 증가함에 따라 지속적으로 개선되는 모습을 입증했습니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
AREX-2가 목표로 하는 '자가 개선 능력'이란 무엇인가요?
테스트를 진행하는 과정에서 솔루션을 반복적으로 다듬고 정제할 수 있는 능력을 말해요. 이 능력은 현재보다 더 나은 결과물을 만들어내는 '반성(reflection)' 기능과 여러 라운드에 걸쳐 실행 효과를 유지하는 '장기 실행(long-horizon execution)'이라는 두 가지 기능을 기반으로 해요.
AREX-2는 어떤 데이터를 사용해 자가 개선 능력을 학습했나요?
연구진은 이 기능들이 특정 분야에 국한되지 않는다고 가정했어요. 그래서 검증 가능한 피드백을 제공하는 기계 학습이나 알고리즘 프로그래밍 과제에서 장기간의 개선 과정이 담긴 데이터를 합성하여 에이전트를 훈련시켰어요.
AREX-2는 어떤 전문 분야 벤치마크에서 높은 성능을 보였나요?
Qwen3.8-27B를 기반으로 구축된 AREX-2는 MLE-bench Lite, Frontier-CS 같은 곳뿐만 아니라 BrowseComp, HLE, GAIA 등 다양한 전문 벤치마크에서도 좋은 성과를 보여주었어요. 특히 라운드 예산이 늘어날수록 성능이 지속적으로 개선되는 모습을 입증했어요.