리서치 연구
경험 기반 정책 개선을 통한 자가 진화형 LLM 트레이딩 에이전트
EvolveTrade: Experience-Driven Policy Refinement for Self-Evolving LLM Trading Agents
arXivLLM 트레이딩 에이전트가 가진 고정된 정책 한계를 극복하기 위해, 시스템 프롬프트를 진화시키는 'EvolveTrade'를 제안했습니다.
세 줄 요약
- 이 프레임워크는 백본 LLM은 유지한 채, 축적된 의사결정 기록과 포트폴리오 피드백을 활용해 정책 자체를 주기적으로 개선합니다.
- 실험 결과, EvolveTrade는 기존 방식 대비 샤프 비율 및 누적 수익률을 높이며 시장 변화에 강한 성능을 입증했습니다.
- 이는 LLM 에이전트가 도구 사용 절차(Procedure)를 스스로 진화시키는 것이 견고하고 적응력 높은 시스템 구축의 핵심임을 시사합니다.
(LLM) 트레이딩 는 시장 데이터, 뉴스 분석 등을 결합할 수 있지만, 현재는 배포 전에 고정된 수동 정책에 의해 행동이 통제되는 한계가 있습니다. 연구진은 이러한 문제를 해결하기 위해 EvolveTrade라는 자가 진화 프레임워크를 제안했습니다. 이 시스템은 트레이딩 에이전트의 를 텍스트로 화된 정책으로 간주하며, 백본 LLM을 고정한 상태에서 Policy Agent가 축적된 의사결정 기록과 실현 포트폴리오 피드백을 사용하여 주기적으로 이 정책 자체를 수정합니다.
이러한 과정을 통해 에이전트는 시간이 지남에 따라 정보 획득 및 포트폴리오 구성 절차를 개선할 수 있습니다. 여러 시장 국면과 두 가지 LLM 백본을 대상으로 한 실험 결과, EvolveTrade는 고정된 정책 기반의 LLM 기준선 대비 샤프 비율과 누적 수익률(Cumulative Return)을 향상시키는 경우가 대부분으로 나타났습니다. 또한, 자가 진화된 정책은 코드 매개 분석 및 국면 관련 계산을 증가시키며, 도구 사용을 관리하는 재사용 가능한 절차를 조정하는 것이 더욱 견고한 LLM 트레이딩 에이전트를 구축하는 핵심 방향임을 시사합니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 시스템 프롬프트
- 대화가 시작되기 전에 AI의 역할과 규칙을 정해 두는 지시문.
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.