신뢰성 높은 AI 에이전트를 위한 DeReAct 아키텍처 연구
DeReAct: Decomposed Reasoning and Acting for Reliable AI Agents
arXiv기존 AI 에이전트가 추론과 행동을 하나의 정책으로 처리해 오류 제어가 어려웠는데, 연구진은 이를 해결하기 위해 모듈형 아키텍처 'DeReAct'를 제시했습니다.
DeReAct는 AI 에이전트가 복잡한 작업을 수행할 때 행동의 신뢰도를 높이고, 오류를 체계적으로 제어하여 결과의 근거를 강화하는 방법을 제시해요.
- DeReAct는 행동 실행 전 제안된 동작을 검증하는 '비평가(Critic)'와 환경 상태 및 작업 완료를 인증하는 '컨텍스트 매니저'라는 두 가지 외부 게이팅 정책을 도입했습니다.
- 이 구조는 특히 성능이 낮은 에이전트의 신뢰도를 크게 높이며, 최신 대형 모델을 사용하더라도 작업 완료 시점을 정교하게 제어하여 결과의 근거를 강화할 수 있습니다.
- 다만, DeReAct의 성능 개선 효과는 에이전트가 목표로 하는 실패 사례가 충분히 많을 때 가장 크며, 모델 자체 능력이 높아질수록 개선 폭은 점차 줄어드는 경향을 보였습니다.
기존 ReAct 기반 는 추론과 행동을 단일 정책에 의존하여, 행동 승인 및 완료 제어를 독립적으로 강제하기 어렵다는 한계가 있었습니다. 이로 인해 오류가 전파되거나 지원되지 않는 완료 주장이 실행을 종료시키는 문제가 발생했습니다. 연구진은 이러한 문제를 해결하고자 DeReAct라는 모듈형 에이전트 아키텍처를 제시했습니다.
DeReAct는 두 가지 게이팅 정책을 외부화하여 구조적 안정성을 높입니다. 첫째, 행동 실행 전에 제안된 동작의 유효성을 검증하는 '비평가(Critic)' 역할을 수행합니다. 둘째, 환경에서 지원되는 상태(State)를 재구성하고 작업 완료 자체를 인증하는 '컨텍스트 매니저'를 도입했습니다.
DeReAct는 GAIA 및 SWE-bench Verified 테스트에서 Pass@1 성능을 개선한 것으로 나타났습니다. 구체적으로 Qwen3-Coder-480B의 경우 6.5~7.0점, Claude Sonnet~4.5의 경우 4.2~5.2점의 향상을 보였습니다. 이러한 외부 게이팅은 목표로 하는 실패 사례가 충분히 많고 게이팅 정책 자체가 충분할 때 효과적이며, 모델 능력이 강해질수록 개선 폭은 점차 줄어드는 경향을 보입니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
기존 AI 에이전트는 어떤 한계점을 가지고 있었나요?
이전의 ReAct 기반 에이전트는 추론과 행동을 하나의 대규모 언어 모델(LLM) 정책에 의존했어요. 이 때문에 행동 승인이나 완료 제어를 독립적으로 강제하기 어려워 오류가 전파되거나 지원되지 않는 주장이 실행 종료를 유발하는 문제가 있었어요.
DeReAct 아키텍처는 어떤 두 가지 외부 게이팅 정책을 사용하나요?
DeReAct는 구조적 안정성을 높이기 위해 두 가지 외부 게이팅 정책을 도입했어요. 첫째, 행동 실행 전에 제안된 동작의 유효성을 검증하는 '비평가(Critic)' 역할을 해요. 둘째, 환경에서 지원되는 상태를 재구성하고 작업 완료 자체를 인증하는 '컨텍스트 매니저'예요.
DeReAct의 성능 개선 효과는 어떤 조건에서 가장 크게 나타나나요?
이 구조는 에이전트가 목표로 하는 실패 사례가 충분히 많고, 게이팅 정책 자체가 충분할 때 가장 효과적이에요. 다만, 모델 자체의 능력이 높아질수록 개선 폭은 점차 줄어드는 경향을 보인다고 해요.