로보틱스 연구
SAC의 tanh 자코비안 문제 해결 시도와 부정적 결과
Unthrottling the Tanh Jacobian in SAC: A Negative Result on Bang-Bang Control and MetaDrive
arXiv강화학습 알고리즘 SAC가 연속 정책을 $\tanh$ 함수로 제한하는 과정에서, 행동의 극단적인 경계값 근처에서 학습 신호가 사라지는 'Jacobian 효과' 문제가 발생합니다.
세 줄 요약
- 연구진이 이 문제를 해결하기 위해 추가 신호를 복구하는 여러 방법을 테스트했으나, 실제 최소 시간 제어 및 자율주행 환경에서는 오히려 성능 저하가 확인되었습니다.
- 이는 행동 경계에서의 신호 손실 현상이 실제로 존재하며, 단순히 경계를 강제로 포화시키는 것이 문제 해결의 만능 열쇠가 아님을 보여줍니다.
- 따라서 행동 공간의 경계값을 무리하게 채우거나 우회 장치를 적용할 경우, 성능 개선보다 경로 이탈이나 비효율적인 움직임을 초래할 위험이 있습니다.
강화학습 알고리즘 SAC가 연속 정책을 $\tanh$ 함수로 제한하는 과정에서, 행동의 극단적인 경계값 근처에서 학습 신호가 사라지는 'Jacobian 효과' 문제가 발생합니다.