이벤트 카메라 기반 보행자 횡단 감지: 비지도 학습 접근
Unsupervised spiking feature learning for event-based pedestrian crossing detection: approaching supervised accuracy without labelled training data
arXiv이벤트 카메라와 스파이킹 신경망(SNN)을 활용한 보행자 횡단 감지 시스템이 데이터 라벨링 없이도 높은 성능을 달성했습니다.
- 레이블 없는 특징 학습만으로 테스트 세트에서 90.3%의 정확도를 기록하며, 기존 지도학습 방식(92.0%)과 매우 근접한 성능을 입증했습니다.
- 데이터 수집 및 라벨링 비용이 큰 난제였던 분야에서, 레이블 없이도 높은 수준의 실시간 감지 능력을 구현할 가능성을 제시합니다.
- 성능은 학습 규칙 자체보다 '출력 해석 방식(readout protocol)'에 크게 의존하므로, 적절한 출력 처리가 시스템 성공의 핵심임을 확인해야 합니다.
이벤트 카메라와 스파이킹 신경망(SNN)은 보행자 횡단 감지에 적합하며, SNN은 이벤트 출력을 네이티브하게 처리할 수 있습니다. 기존의 SNN 탐지기는 지도학습 기반 역전파를 사용해 비용이 많이 드는 프레임 단위 라벨링을 요구했습니다. 본 연구에서는 특징 학습 과정에서 라벨 없이 횡단 감지를 시도했으며, 최근 DVS-PedX 보행자 횡단 에서 최초의 비지도 결과를 보고했습니다.
제안된 방법은 승자-최소(winner-take-all) 스파이크 타이밍 의존성 가소성(STDP)으로 학습된 단일 스파이킹 레이어를 사용하여 라벨 없는 이벤트 프레임 패치로부터 딕셔너리를 학습합니다. 이후 프레임은 코사인 유사도를 통해 인코딩되고, 선형 분류기만이 유일한 지도학습 구성 요소로 사용됩니다. 이 방법은 테스트 세트(24,454프레임)에서 정확도 90.3%, AUROC 0.936을 달성하여, 동일 프레임에 대해 종단 간지도 학습된 스파이킹 네트워크의 성능(정확도 92.0%, AUROC 0.943)과 근접한 결과를 보였습니다.
연구 결과는 적대적인 날씨 조건에서도 AUROC 0.913을 기록하며 안정성을 입증했습니다. 특히, 성능은 가소성 규칙 자체보다는 출력 해석 방식(readout protocol)에 크게 의존하는 것으로 나타났습니다. 기존의 뉴런 할당 방식과 비교했을 때, '리드아웃 리핏' 방식을 사용하면 실 변환 부분에서 성능이 우연값(0.53) 대비 0.67 AUROC까지 향상되어 지도학습 범위 내에 위치했습니다. 이는 특징 학습에서 라벨을 제거하는 것이 이 벤치마크에서는 작은 정확도 손실만을 가져오며, 기존 보고된 비지도 스파이킹 네트워크의 약점은 학습 규칙보다는 출력 해석 방식에 기인할 수 있음을 시사합니다.
용어 풀이
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.