활용 사례 연구
Mitigating Exploration Bias in RL for Multi-Instruction Following
ARarXiv
강화학습(RL)이 다중 지침 수행 능력을 향상시키는 데 강력한 패러다임으로 활용되지만, 기존 방식은 탐색 편향 문제를 겪는다.
세 줄 요약
- 연구진은 먼저 탐색 편향을 측정하는 두 가지 지표를 제안하고, 이를 완화하기 위해 행동 부트스트래핑과 희소성 인식 보상이라는 2단계 프레임워크를 도입했다.
- 이 방법들은 정책 모델의 초기 능력이 낮은 문제와 모든 지침을 동일하게 취급하던 기존 방식의 한계를 극복하여 성능을 향상시킨다.
- 기존 RL 훈련은 누적 보상을 사용해 모든 지침을 동등하게 처리함으로써 쉬운 지침에 편향되는 문제가 있었다.
강화학습(RL)이 다중 지침 수행 능력을 향상시키는 데 강력한 패러다임으로 활용되지만, 기존 방식은 탐색 편향 문제를 겪는다.