보행자 횡단 의도 예측을 위한 트랜스포머 기반 모델 TrajFusionNet+
TrajFusionNet+: Transformer-Based Prediction of Pedestrian Crossing Intention via Fusion of Trajectory Representations and Scene Graphs
arXiv자율주행차가 보행자의 도로 횡단 의도를 예측하는 것은 핵심 과제이며, 연구진은 트랜스포머 기반의 TrajFusionNet+ 모델을 제안했습니다.
- 이 모델은 보행자 궤적의 순차 정보(SAM), 장면 이미지의 시각 정보(VAM), 그리고 주변 요소 간 관계를 담은 그래프 정보(GAM)를 결합합니다.
- 보행자 의도 예측의 정확도는 자율주행 안전성과 직결되므로, 복잡한 도시 환경에서 사람 행동 패턴을 신뢰성 있게 이해하는 데 기여할 전망입니다.
- 특히 PIE와 JAAD 데이터셋을 공동 학습 후 개별 검증하는 새로운 프로토콜을 적용하여 기존 방식 대비 뛰어난 일반화 능력을 입증했습니다.
자율주행차의 관점에서 보행자가 도로를 횡단할 가능성을 예측하는 것이 핵심 과제입니다. 연구진은 이러한 의도 예측을 위해 기반 모델인 TrajFusionNet+를 제안했습니다. 이 모델은 보행자의 궤적에 대한 순차 정보, 장면 이미지의 시각적 표현, 그리고 주변 요소 간 관계를 담는 그래프 정보를 결합하여 보행자 횡단 의도를 예측합니다.
TrajFusionNet+ 아키텍처는 세 가지 분지로 구성됩니다. 첫째, 과거 및 예측된 보행자 궤적의 순차 정보를 처리하는 Sequence Attention Module (SAM); 둘째, 관찰되거나 예측된 경계 상자를 장면 이미지에 오버레이하여 시각적 표현을 활용하는 Visual Attention Module (VAM); 셋째, 분할된 장면 이미지에서 보행자 중심 그래프를 추출하고 보행자와 교통 요소 간의 관계 의존성을 포착하는 Graph Attention Module (GAM)입니다.
이 모델은 PIE 및 JAAD라는 두 가지 주요 보행자 의도 데이터셋에서 최신 성능을 달성했습니다. 특히, 연구진은 모델이 PIE와 JAAD 데이터셋에 공동으로 학습되지만 개별적으로 평가되는 새로운 평가 프로토콜을 도입했으며, 이 설정 하에서 TrajFusionNet+는 기존 접근 방식 대비 우수한 일반화 능력을 입증했습니다.
용어 풀이
- 트랜스포머
- 오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.