FERPO: 순방향 엔트로피 정규화 정책 최적화 알고리즘
FERPO: Forward Entropy-Regularized Policy Optimization
연속 제어 환경의 온라인 강화 학습에서 발생하는 크리틱 값 미분 오류로 인한 정책 업데이트 불안정성 문제를 해결한 새로운 알고리즘입니다.
이 알고리즘은 기존 강화 학습의 불안정성을 해결하여, 인공지능이 복잡한 환경에서 더 안정적이고 효율적으로 목표를 달성하도록 돕는 기술이에요.
- 제안된 FERPO는 크리틱을 액션에 대해 직접 미분하지 않고 정책 개선을 수행하며, 순방향 KL 목적 함수를 활용하여 탐색을 촉진하는 것이 핵심입니다.
- MuJoCo 및 ManiSkill 등 실제 환경 테스트에서 높은 성능과 샘플 효율성 개선을 입증했으며, 다른 최신 알고리즘 대비 빠른 액터 업데이트 속도를 보여줍니다.
- 목표 분포와 현재 정책 간의 편차를 제한하는 KL 정규화가 특정 영역에만 집중하기보다 넓은 범위의 고가치 모드를 균형 있게 탐색하도록 돕습니다.
기존의 온라인 방법들은 크리틱의 액션 기울기를 사용하여 정책을 개선하지만, 값 예측이 정확한 액션 미분을 보장하지 못해 신뢰할 수 없는 업데이트를 초래할 수 있습니다. 이에 FERPO(Forward Entropy-Regularized Policy Optimization)는 크리틱을 액션에 대해 직접 미분하지 않고도 정책 개선을 수행하는 온-폴리시 최대 엔트로피 강화 학습 알고리즘입니다.
FERPO는 엔트로피와 쿨백-라이블러(KL) 발산으로 정규화된 정책 개선 목적 함수로부터 최적의 목표 액션 분포를 도출합니다. 이후 이 목표 분포에 맞춰 액터가 스스로 정규화 중요 샘플링(SNIS)을 사용하여 추정된 순방향-KL 목적 함수를 최소화하도록 학습됩니다.
순방향-KL 목적 함수는 목표 분포와 현재 정책 간의 편차를 제한함으로써, 특정 모드에만 집중하기보다 여러 고가치 모드를 탐색하도록 촉진합니다. MuJoCo Playground 및 ManiSkill에서의 실험 결과 경쟁적인 성능과 샘플 효율성 향상을 입증했으며, 계산 에서는 REPPO 대비 더 빠른 액터 업데이트 속도를 보여주었습니다.
용어 풀이
- 강화 학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
기존 강화 학습 방법의 어떤 문제점을 해결했나요?
기존 방식은 크리틱의 액션 기울기를 사용해 정책을 개선하는데, 값 예측이 정확한 액션 미분을 보장하지 못해서 신뢰할 수 없는 업데이트가 발생했어요. FERPO는 크리틱을 액션에 대해 직접 미분하지 않고도 정책 개선을 수행하는 온-폴리시 최대 엔트로피 강화 학습 알고리즘이에요.
이 알고리즘은 어떻게 탐색(exploration)을 촉진하나요?
순방향-KL 목적 함수를 활용해서 목표 분포와 현재 정책 간의 편차를 제한해요. 이 덕분에 특정 모드에만 집중하기보다 여러 고가치 모드를 균형 있게 탐색하도록 돕는 것이 핵심이에요.
어떤 환경에서 성능을 테스트했나요?
MuJoCo Playground와 ManiSkill 같은 실제 환경에서 실험을 진행했어요. 이 결과, 경쟁적인 성능과 샘플 효율성 향상을 입증할 수 있었어요.