ASGARD: 강화학습 기반 UAV의 액션 공간 공격 방어 기술
ASGARD: Action-Space Guard for UAV Resilience via Reinforcement Learning
arXiv무인항공기(UAV) 제어에 사용되는 강화학습 방식은 정책 생성 후 액션 명령을 조작하는 '액션 공간 공격'에 취약하다는 문제가 있었습니다.
- 연구진이 개발한 ASGARD는 교사-학생 구조를 활용하여, 외부 공격에도 불구하고 UAV의 물리적 상태만으로 오작동을 감지하고 수정된 명령을 출력합니다.
- 본 기술은 자율 비행 시스템이 악의적인 조작이나 예상치 못한 상황에서도 안정적으로 임무를 완수할 수 있게 하여 신뢰성을 크게 높일 수 있습니다.
- ASGARD는 공격에 대한 일반화 능력을 입증했으며, 오직 UAV 자체의 물리적 상태 이력만을 사용하여 온보드 구동이 가능하도록 설계되었습니다.
(RL) 컨트롤러는 무인항공기(UAV) 항법 및 제어에 최근 채택되고 있으나, 정책이 생성된 후 액추에이터가 명령을 실행하기 전에 액션 명령을 덮어쓰는 '액션 공간 공격'에 취약하다는 문제가 있습니다. 기존의 방어 기법들은 주로 정책 입력값에 대한 공격을 목표로 하거나, 런타임에서 손상된 액션을 처리할 수 없어 실질적인 대응이 어렵다는 한계가 있었습니다.
이에 연구진은 ASGARD라는 두 단계의 교사-학생 파이프라인을 제안하여 RL 기반 UAV 제어 시스템을 액션 공간 공격에 강건하게 만듭니다. 첫 번째 '교사(teacher)' 단계에서는 인코더가 UAV의 물리적 상태와 액션-공격 관련 특권 정보를 결합하여 액션-공격 인식 잠재 변수를 생성합니다. 이 과정은 RL 제어 정책과 수정된 명령을 출력하는 모니터를 훈련시키는 데 사용됩니다.
두 번째 '학생(student)' 단계에서는 인코더와 모니터가 교사 모델로부터 지도 학습을 통해 훈련되며, 이를 통해 UAV의 물리적 상태 이력만을 사용하여 온보드 구동이 가능하도록 설계되었습니다. 평가 결과에 따르면 ASGARD는 액션 공간 공격에 강건하며, 공격에도 불구하고 임무를 완수하는 것이 확인되었습니다. 또한, ASGARD는 미지의 공격이나 은밀한(stealthy) 공격에도 일반화되어 대응할 수 있음을 입증했습니다.
용어 풀이
- 강화학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.