리서치 연구
연결성 기반 보상 학습을 위한 방향성 상태 그래프 활용
From Connectivity to Rewards: Dense Reward Learning with Directed State Graphs
arXiv기존 그래프 기반 강화학습은 상태 전이의 비대칭성이 큰 환경에서 내재적 연결성 정보를 충분히 활용하지 못하는 한계가 있었습니다.
세 줄 요약
- 본 연구는 이러한 문제를 해결하기 위해, 상태 쌍별 연결 강도를 예측하여 이를 연속적인 보상(Dense Reward)으로 사용하는 G2QDR 프레임워크를 제안했습니다.
- G2QDR은 기존의 모든 계층적 강화학습 구조에 통합 가능하며, 희소한 보상 환경에서도 안정적인 가이드를 제공해 성능을 크게 향상시킵니다.
- 신경망으로 효율 구현이 가능하지만, 적용 시 일정 수준의 계산 오버헤드가 발생할 수 있으므로 이를 고려해야 합니다.
기존의 그래프 기반 목표 조건부 계층적 (GCHRL) 방법들은 상태 전이의 내재적 연결성 정보를 충분히 활용하지 못하는 한계가 있었습니다. 특히, 상태 전이가 비대칭적인 준거리 환경에서는 안정적인 정책 학습과 견고한 경로 계획에 근본적인 어려움이 발생합니다.
이에 본 연구는 이러한 문제를 해결하기 위해 상태 쌍별 연결 강도를 예측하는 상태 연결성 모델을 도입했습니다. 이 연결성 강도는 스칼라 보조 밀집 보상(auxiliary dense rewards)으로 변환되어 여러 계층에 걸쳐 연속적인 가이드를 제공하며, 이를 Graph-Guided Quasimetric Dense Reward (G2QDR) 프레임워크로 제안합니다.
제안된 G2QDR은 기존의 모든 GCHRL 구조에 통합될 수 있으며, 탐색 과정에서 생성된 방향성 상태 그래프를 통해 신경망으로 효율적으로 구현됩니다. 광범위한 희소 보상 환경에서의 실험 결과는 G2QDR이 기본적인 GCHRL 접근 방식의 성능을 향상시키며, 허용 가능한 계산 오버헤드를 가짐을 보여줍니다.
용어 풀이
- 강화학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.