리서치 연구

AREX-2를 활용한 자가 개선 LLM 에이전트 연구

AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks

ARarXiv10월 1일 발표 · 2분 · 프리프린트

LLM 에이전트가 테스트 과정에서 스스로 성능을 개선하는 '자가 개선 능력'을 구현하기 위해 AREX-2를 개발했습니다.

왜 중요해요AI 정리

이 연구는 AI 에이전트가 단순히 정해진 작업을 수행하는 것을 넘어, 테스트 과정에서 스스로 성능을 개선하며 자율적으로 발전할 수 있는 새로운 방향성을 제시해요.

세 줄 요약arXiv 원문 기반
  1. 에이전트는 '반성(Reflection)'과 '장기 실행' 능력을 결합하고, 기계 학습 및 코딩 과제 데이터를 통해 훈련되어 높은 효과를 입증했습니다.
  2. 이번 연구는 장기간의 개선 과정이 담긴 데이터가 에이전트의 자율적이고 지속적인 성능 향상에 매우 효과적인 핵심 방법론임을 제시합니다.
  3. AREX-2는 BrowseComp, GAIA 등 다양한 전문 벤치마크에서 강력한 성능을 보여주며 범용 인공지능 개발의 새로운 방향성을 제시합니다.

AREX-2는 의 '자가 개선 능력'을 향상시키기 위한 노력으로, 이는 테스트 과정에서 솔루션을 반복적으로 정제하는 능력을 의미합니다. 이 능력은 현재보다 더 나은 솔루션을 생성하는 '반성(reflection)'과 여러 라운드에 걸쳐 반복적인 실행 효과를 유지하는 '장기 실행(long-horizon execution)'이라는 두 가지 상호 보완적 기능을 기반으로 합니다.

연구진은 이러한 기능들이 도메인에 구애받지 않는다고 가정하고, 검증 가능한 피드백을 제공하는 기계 학습 및 알고리즘 프로그래밍 과제에서 장기적인 개선 궤적 데이터를 합성하여 에이전트를 훈련시켰습니다. 이 접근 방식은 자가 개선 능력을 위한 효과적인 경로임을 보여줍니다.

Qwen3.8-27B 기반으로 구축된 AREX-2는 MLE-bench Lite(81.8)와 Frontier-CS(70.7)에서 강력한 성능을 달성했습니다. 또한, BrowseComp(84.0), HLE(52.6), GAIA(92.2), DeepSearchQA(93.8) 등 다양한 전문 에서도 높은 성능을 보였으며, 라운드 예산이 증가함에 따라 지속적으로 개선되는 모습을 입증했습니다.

용어 풀이

LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
궁금한 점AI 정리 · 원문 기반
AREX-2가 목표로 하는 '자가 개선 능력'이란 무엇인가요?

테스트를 진행하는 과정에서 솔루션을 반복적으로 다듬고 정제할 수 있는 능력을 말해요. 이 능력은 현재보다 더 나은 결과물을 만들어내는 '반성(reflection)' 기능과 여러 라운드에 걸쳐 실행 효과를 유지하는 '장기 실행(long-horizon execution)'이라는 두 가지 기능을 기반으로 해요.

AREX-2는 어떤 데이터를 사용해 자가 개선 능력을 학습했나요?

연구진은 이 기능들이 특정 분야에 국한되지 않는다고 가정했어요. 그래서 검증 가능한 피드백을 제공하는 기계 학습이나 알고리즘 프로그래밍 과제에서 장기간의 개선 과정이 담긴 데이터를 합성하여 에이전트를 훈련시켰어요.

AREX-2는 어떤 전문 분야 벤치마크에서 높은 성능을 보였나요?

Qwen3.8-27B를 기반으로 구축된 AREX-2는 MLE-bench Lite, Frontier-CS 같은 곳뿐만 아니라 BrowseComp, HLE, GAIA 등 다양한 전문 벤치마크에서도 좋은 성과를 보여주었어요. 특히 라운드 예산이 늘어날수록 성능이 지속적으로 개선되는 모습을 입증했어요.

원문arXiv · AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks
궁금한 점 3개AI 정리