환경 관찰까지 지도 학습하는 에이전트 강화학습 방법론 — AI 생성 일러스트AI 일러스트
리서치 연구

환경 관찰까지 지도 학습하는 에이전트 강화학습 방법론

Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL

arXiv9월 17일 발표 · 2분 · 심사 전 논문

기존의 행동 토큰만 학습하던 방식에서 벗어나, 환경 관찰 정보까지 함께 지도 학습하는 ActObs 방법론이 제시되었습니다.

세 줄 요약arXiv 원문 기반
  1. ActObs는 에이전트가 단순히 행동을 예측하는 것을 넘어, 그 행동의 결과(consequence)를 모델링하도록 유도하여 강화학습 성능을 높입니다.
  2. 행동에만 치우치지 않고 환경 변화를 종합적으로 이해하는 견고한 정책을 구축함으로써, 범용적인 문제 해결 능력을 향상시키는 것이 핵심입니다.
  3. 행동과 관찰을 동시에 학습해 모델의 편향을 방지하고 환경 예측 능력을 유지하여, 에이전트가 다음 탐색 단계에 효과적으로 대비할 수 있습니다.

기존의 표준 지도 (SFT) 방식은 가 생성한 행동 에만 손실을 적용하고, 환경 관찰 정보는 단순히 컨텍스트로 사용하며 예측 대상으로는 삼지 않았습니다. 연구진은 이러한 관행이 (RL) 초기화에 최적인지에 의문을 제기하며 ActObs라는 방법론을 제시했습니다. ActObs는 트랙젝토리 내에 이미 존재하는 관찰 토큰까지 함께 지도 감독하는 것이 특징입니다.

ActObs를 통해 에이전트는 단순히 행동만 예측하는 것을 넘어, 환경의 변화(consequence)를 모델링하도록 학습됩니다. 이 결합된 감독은 행동과 관찰 그라디언트가 빠르게 직교화되는 현상을 방지하여, 한쪽으로 치우친 전문화를 막고 환경에 대한 예측 능력을 유지합니다. 이는 에이전트가 다운스트림 탐색 단계에 효과적으로 대비할 수 있도록 돕습니다.

실험 결과, ActObs는 다양한 성능 향상을 보였습니다. Qwen3-4B 모델에서 GRPO를 적용했을 때, 기존 행동 전용 방식보다 Terminal-Bench 2.0에서 모든 평가 샘플링 예산에서 더 높은 pass@k 값을 달성했습니다. 또한 Qwen3-8B에서는 pass@16에서 +3.4 pp의 향상을 보였으며, aider-polyglot을 사용한 교차 도메인 코드 편집에서도 pass@1에서 4B 모델 대비 +4.2 pp의 성능 개선을 입증했습니다.

용어 풀이

미세 조정
이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
강화 학습
행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
원문arXiv · Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기