에이전트 학습을 위한 실행 가능한 환경 합성 프레임워크 EnvCraft — AI 생성 일러스트AI 일러스트
AI 에이전트 연구

에이전트 학습을 위한 실행 가능한 환경 합성 프레임워크 EnvCraft

EnvCraft: Synthesizing Executable Environments in Agentic RL for Claw-like Agent

arXiv9월 9일 발표 · 3분 · 심사 전 논문

자율 에이전트가 복잡한 장기 작업을 수행하려면 상호작용하는 환경이 필수적이나, 기존 합성 환경은 도구 호출에 국한되어 실질적인 한계가 있었습니다.

세 줄 요약arXiv 원문 기반
  1. 연구진은 이를 해결하기 위해 'EnvCraft'라는 자동화 프레임워크를 개발하여, 샌드박스 기반의 139개 상호작용 환경과 약 2만 개의 복잡한 과제를 합성했습니다.
  2. 실험 결과, 이 방법은 에이전트 성능을 최대 +11.9%까지 향상시키며, 단순 도구 사용을 넘어선 일반화된 학습 신호를 제공함을 입증했습니다.
  3. 합성된 실행 가능한 환경은 모델에게 강력하고 일반화된 학습 기회를 제공하며, 추론 비용 절감 효과까지 가져오는 중요한 진전입니다.

의 패러다임은 수동적인 언어 인터페이스에서 자율적인 Claw-like 가 되어 상태를 가진 작업 공간 전반에 걸쳐 장기 작업을 수행하는 방향으로 빠르게 변화하고 있다. Agentic RL(에이전트 기반 )은 이러한 에이전트를 최적화할 유망한 경로를 제공하지만, 상호작용하는 훈련 환경의 심각한 부족으로 인해 확장에 병목 현상을 겪고 있다. 기존 합성 환경들은 도구 호출 엔드포인트로만 엄격하게 제한되어 있어, Claw-like 에이전트가 요구하는 실제 세계의 종단 간(end-to-end) 수요를 충족시키기에는 불충분했다.

이러한 격차를 해소하기 위해 연구진은 EnvCraft라는 자동화 프레임워크를 도입했다. EnvCraft는 환경 합성 엔진을 활용하여 격리 작업 공간을 구축하고, 토폴로지 인식 데이터 생성 엔진을 통해 일관성 있는 과제 궤적을 만들어낸다. 이를 통해 실행 가능한 환경과 확장 가능한 훈련 데이터를 종합적으로 합성하는 것이 가능하다.

EnvCraft를 이용해 총 139개의 상호작용 환경과 약 20K 개의 복잡한 과제가 합성되었다. Qwen3/3.5 모델(8B-32B)을 대상으로 한 실험 결과, 이 방법은 Claw 스타일 에서 최대 +11.9%의 성능 향상을 보였으며, 일반 도구 사용 벤치마크에서도 +8.0%의 개선과 더불어 추론 비용 감소를 동시에 달성했다. 이는 합성된 실행 가능한 환경이 강력하고 일반화 가능한 학습 신호를 제공함을 입증한다.

용어 풀이

LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
강화 학습
행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
샌드박스
프로그램을 바깥과 분리된 안전한 공간에서 실행하게 하는 환경.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
원문arXiv · EnvCraft: Synthesizing Executable Environments in Agentic RL for Claw-like Agent같은 주제 가이드 · 바로 써 보기매일 아침 소식, 예약 작업으로 받기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기