적대적 교란 환경에서의 위험 민감형 강화학습 안전성 검증 연구
Certifying Lower Bounds for Risk-Sensitive Reinforcement Learning under Adversarial State Perturbations
arXiv실제 환경에서 사용되는 강화학습(RL) 에이전트의 적대적 교란 취약성을 해결하기 위해, 기존 위험 중립 방식보다 정교한 '위험 민감형' 안전성 검증 방법을 제시했습니다.
- 연구 결과, 일반적인 훈련 대비 위험 회피(risk-averse) 방식을 적용했을 때 더 높은 수준의 안전 보장 범위(certified lower bounds)를 확보할 수 있음이 확인되었습니다.
- 이는 자율주행이나 의료 기기 등 안전성이 최우선인 분야에서 AI 시스템의 성능을 수학적으로 입증하고 외부 공격에 강건하게 설계하는 데 중요한 기술적 진보입니다.
- 다만, 위험 회피 정도를 지나치게 높이면 정책이 과도하게 보수적이 되어 오히려 성능이 저하될 수 있으므로 적절한 매개변수 튜닝이 필수적입니다.
실제 환경에 배치되는 (RL) 는 상태 관측의 적대적 교란에 취약하여 안전성이 중요한 응용 분야에서 위험을 초래할 수 있습니다. 기존의 안전성 검증 방법들은 주로 위험 중립 목표에 집중되어 왔으나, 본 연구는 이를 확장하여 위험 민감형 목적 함수를 다룹니다. 이 연구는 $l_{p}$-norm으로 경계 지어진 상태 적대적 교란 하에서 누적 보상의 지수 유틸리티에 대한 하한을 설정하는 방법을 제시합니다.
연구진은 교란 집합에 $\phi$-divergence 완화(relaxation)를 도입하여 위험 민감성 검증 문제를 볼록 최적화 문제로 공식화하고, 이를 통해 추적 가능한 근사 하한을 얻기 위해 쌍대 방정식을 도출했습니다. 또한, 훈련 시의 위험 회피 $eta$를 평가에 사용되는 위험 수준과 독립적으로 선택하여 검증 하한을 개선하는 경험적 방법도 제안합니다.
실험 결과, 위험 회피(risk-averse) 방식으로 훈련된 정책은 특히 큰 교란 예산 하에서 위험 중립 훈련 대비 더 높은 검증 하한을 보이는 경향이 있습니다. 다만, 위험 회피 정도를 높일수록 초기에는 검증 성능이 개선되지만, 지나치게 보수적인 정책으로 인해 결국 감소하는 비단조적(non-monotonic) 패턴이 관찰되었습니다.
용어 풀이
- 강화학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.