다중 목표 강화학습의 선호도 커버리지 붕괴 문제와 해결책
On Preference Coverage Collapse from Hindsight Relabeling in Multi-Objective Reinforcement Learning
arXiv다중 목표 강화학습(MORL)에서 경험 재설정 기법(HRL)을 적용하면 성능이 심각하게 저하되는 '선호도 커버리지 붕괴' 문제가 발생합니다.
- 이는 단순한 노이즈가 아닌 학습 과정의 문제이며, 연구진은 목표 방향을 원래 요청값으로 되돌리는 'her_mix' 기법으로 이를 성공적으로 복구했습니다.
- 본 연구는 MORL 환경에서 안정성을 확보하려면 단순히 노이즈를 걸러내는 것보다 전체 선호도 공간을 균형 있게 커버하는 것이 중요함을 입증합니다.
- 기존 지표로는 파악하기 어려웠던 손실을 '폐기된 선호도 질량(APM)'이라는 새로운 통계적 지표로 정량화하여 제시했습니다.
(RL)에서 경험을 사후적으로 재설정하는 기법인 하인드사이트 리레이블링은 샘플 효율성을 높이는 데 효과적입니다. 이를 선호도 기반 다중 목표 RL(MORL)에 확장 적용할 경우, 이 과정이 오히려 해로운 결과를 초래한다는 점을 보여주었습니다. 연구진은 36개의 알고리즘-환경 설정 중 19개에서 성능 저하가 발생했으며, 이는 단순한 노이즈 문제와는 다른 '선호도 커버리지 붕괴(Preference Coverage Collapse)' 현상 때문임을 밝혀냈습니다.
이러한 실패 모드는 반복적인 재설정 과정에서 크리틱의 커버리지가 가 우연히 방문한 좁은 선호도 영역에만 집중되면서 발생합니다. 연구진은 이 손실을 측정하기 위해 '폐기된 선호도 질량(Abandoned Preference Mass, APM)'이라는 새로운 통계적 지표를 도입하여 정량화했습니다. 이 지표는 구조적인 커버리지 카운트로는 파악할 수 없었던 실제 성능 저하($ ho = -0.73$)를 추적합니다.
이에 대한 해결책으로, 연구진은 'her_mix'라는 단일 볼록 조합 기법을 제안했습니다. 이 방법은 에이전트가 달성한 방향을 원래 요청된 선호도 방향 쪽으로 되돌리는 역할을 합니다. 실험 결과, her_mix는 19개의 손상된 설정 중 16개를 기준선(baseline) 수준으로 복구하는 데 성공했으며, APM 값을 $69\%$에서 $6\%$로 크게 줄여 안정적인 커버리지를 보호할 수 있음을 입증했습니다.
용어 풀이
- 강화학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.