리서치 연구
내재적 호기심 기반 강화 학습의 자발적 탐험 전략
Endogenous Exploration in Reinforcement Learning with Intrinsic Curiosity
arXiv희박하거나 비정상적인 환경에 대비하여, 내재적 호기심을 활용해 탐험 과정을 주도하는 강화 학습 프레임워크를 제안했습니다.
세 줄 요약
- 외부 보상과 에피스테믹 동기를 결합한 이 모델은 최적의 성능이 '중간 수준의 비일관성'에서 발현된다는 독특한 가설을 제시합니다.
- LunarLanderv2와 BipedalWalkerv3 등 표준 벤치마크에서 기존 알고리즘과 경쟁력을 입증했으며, 능동 추론 방식과는 다른 탐색 영역을 포착했습니다.
- 본 연구는 보상 신호가 부족한 복잡계 환경에서도 효과적인 자발적 탐험 전략을 설계하는 새로운 이론적 기반을 제공합니다.
본 연구는 환경이 비정상적이거나 보상이 희박하고 지연되거나 불분명한 시나리오를 위해, 내재적 호기심에 의해 탐험 과정이 주도되는 프레임워크를 제안합니다. 이 모델에서 행동 선택은 외부 보상과 에피스테믹 동기 메커니즘의 조합으로 안내되며, 이는 를 구조화된 탐색 방향으로 편향시키는 역할을 합니다.
제시된 핵심 가설에 따르면, 효과적인 탐험은 '중간 수준의 비일관성'에서 나타나며, 역동성이 지나치게 경직되거나 무질서할 경우 성능이 저하됩니다. 이 아이디어를 검증하기 위해 프레임워크를 Liquid State Machine (LSM) 기판 위에 구현하고, 이산 행동 LunarLanderv2와 연속 제어 BipedalWalkerv3 두 가지 표준 에서 평가했습니다.
제안된 방법은 PPO나 ICM을 포함한 기존의 심층 강화 학습 알고리즘 대비 두 작업 모두에서 경쟁력 있는 성능을 달성함을 보여줍니다. 또한, 동일 분석 하에 능동 추론(Active Inference) 에이전트에서는 호기심 창(curiosity window)이 회복되지 않음을 입증하여, 제안된 동역학이 별개의 탐험 영역을 포착하고 있음을 시사합니다.
용어 풀이
- 강화 학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.