장기 코딩 에이전트를 위한 조기 최종 보상 예측 방법 — AI 생성 일러스트AI 일러스트
리서치 연구

장기 코딩 에이전트를 위한 조기 최종 보상 예측 방법

Before the Rollout Ends: Early Terminal Reward Prediction for Long-horizon Coding Agents

arXiv9월 29일 발표 · 3분 · 심사 전 논문

장기적인 코딩 에이전트는 최종 결과가 나올 때까지 보상이 없어 학습과 추론 비용이 높고 불안정하다는 문제가 있었습니다. 이를 해결하기 위해, 초기 행동 증거만으로 최종 보상을 예측하는 'Contextual Early Reward (CER)' 방법이 제안되었습니다.

세 줄 요약arXiv 원문 기반
  1. CER은 기존 최고 성능 모델 대비 높은 정확도를 유지하면서도, 훨씬 적은 토큰과 계산 자원으로 작동합니다. 실제 테스트 환경에서 최대 4.2%p 이상의 성능 향상을 입증하며 효율성을 극대화했습니다.
  2. 이 기술은 장기 코딩 에이전트의 평가 방식을 근본적으로 변화시킵니다. 추론 단계에서 발생하는 높은 비용과 오류를 줄여주어 AI가 복잡한 작업을 더 안정적이고 효율적으로 수행하도록 돕는 중요한 진전입니다.
  3. CER은 현재 작업 및 단계에 특화된 적응형 평가 기준을 합성하여 보상을 예측합니다. 이는 관련 역사적 과제 경험 요약을 통해 높은 신뢰도와 해석 가능성을 확보하는 것이 핵심입니다.

장기적인 작업을 수행하는 코딩 들은 비용이 많이 드는 도구 호출 시퀀스를 완료한 후에야 검증 가능한 보상을 받게 됩니다. 이러한 구조적 문제는 추론 비용을 증가시키고, 초기 가설의 오류를 증폭시키며, 희소한 최종 보상과 불안정한 학습 환경을 초래하는 주요 원인이었습니다.

이러한 문제를 해결하기 위해 'Contextual Early Reward (CER)'가 제안되었습니다. CER은 에이전트의 궤적 접두사(trajectory prefix)에 나타나는 행동 증거를 통해 최종 보상을 예측합니다. 이 방법은 관련 역사적 과제 경험을 요약하여 현재 작업 및 단계에 특화된 적응형 평가 기준을 합성하는 것이 핵심입니다.

실제 테스트 환경인 SWE-bench Verified에서 CER의 성능이 입증되었습니다. Nemotron 3 Ultra에서는 최고 성능 기준선 대비 RM@8 지표를 4.2%p 향상시켰으며, Nemotron 모델에서는 최고의 기준선 성능을 달성하는 데 단지 15.3%의 만 사용했습니다. 또한 RL 학습 실험에서 CER은 기존 풀-롤아웃 TMax보다 1.9%p 높은 성능을 보이면서도 온라인 정책 및 심사(policy-and-judge) 토큰 사용량을 52.7% 절감하는 효율성을 보여주었습니다.

결론적으로, CER은 장기 코딩 에이전트를 위한 해석 가능하고 효율적이며 밀도가 높은 평가 방법을 제공하며, 복잡한 작업을 수행하는 AI 시스템의 안정성과 효율성을 높이는 중요한 진전을 제시합니다.

용어 풀이

에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
원문arXiv · Before the Rollout Ends: Early Terminal Reward Prediction for Long-horizon Coding Agents같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv