AI 정책 연구

Shared Actors Need Not Share Critics: Effects of Value Mismatch in Parallel Reinforcement Learning

ARarXiv8월 28일 발표 · 1분 · 심사 전 논문

단일 정책을 여러 환경에서 병렬 학습할 때, 구현체들은 보통 모든 샘플링된 환경에 하나의 비평가(critic)를 사용한다.

세 줄 요약arXiv 원문 기반
  1. 이러한 가치 불일치는 샘플링된 업데이트를 재분배하여 유용한 행동은 약화시키고 도움이 안 되는 행동을 강화시킨다.
  2. 비평가에게 로그된 환경 인덱스만 제공하는 개입은 더 안정적인 학습과 높은 수익을 가져온다.
  3. 이론적으로 가치 불일치는 비평가 공유로 인해 확률적 학습 역학을 저하시키는 직접적인 메커니즘이다.

단일 정책을 여러 환경에서 병렬 학습할 때, 구현체들은 보통 모든 샘플링된 환경에 하나의 비평가(critic)를 사용한다.

원문arXiv · Shared Actors Need Not Share Critics: Effects of Value Mismatch in Parallel Reinforcement Learning같은 주제 가이드 · 바로 써 보기회사 자료 넣기 전, 학습 설정부터 끄기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기