AI 정책 연구
Shared Actors Need Not Share Critics: Effects of Value Mismatch in Parallel Reinforcement Learning
ARarXiv
단일 정책을 여러 환경에서 병렬 학습할 때, 구현체들은 보통 모든 샘플링된 환경에 하나의 비평가(critic)를 사용한다.
세 줄 요약
- 이러한 가치 불일치는 샘플링된 업데이트를 재분배하여 유용한 행동은 약화시키고 도움이 안 되는 행동을 강화시킨다.
- 비평가에게 로그된 환경 인덱스만 제공하는 개입은 더 안정적인 학습과 높은 수익을 가져온다.
- 이론적으로 가치 불일치는 비평가 공유로 인해 확률적 학습 역학을 저하시키는 직접적인 메커니즘이다.
단일 정책을 여러 환경에서 병렬 학습할 때, 구현체들은 보통 모든 샘플링된 환경에 하나의 비평가(critic)를 사용한다.