응급차량 대응을 위한 경량 비전-언어 신호 제어 모델 VLALight
VLALight: Lightweight Vision-Language-Action Models for Emergency-Aware Traffic Signal Control
arXiv교차로 관찰 정보와 신호 상태를 직접 연결하여 최적의 신호를 결정하는 'VLALight'라는 경량 비전-언어-행동 프레임워크입니다.
- 기존 모델들이 겪던 정보 손실 및 높은 지연 문제를 극복하고, 관찰 정보를 신호 조작까지 직접 매핑하는 엔드투엔드 방식이 특징입니다.
- 특히 응급차량 대기 시간을 획기적으로 줄이는 등 안전성을 높이며, 로컬 하드웨어에서도 실시간 작동이 가능한 것이 큰 강점입니다.
- 단 0.5B의 경량 모델임에도 다양한 교차로 구조와 교통 패턴에 대해 높은 일반화 성능을 입증하여 실용성이 뛰어납니다.
교통 신호 제어(TSC)는 도시 혼잡 완화에 필수적이며, 최근의 비전-언어 모델() 발전은 교차로 장면 해석 능력을 향상시켰습니다. 하지만 기존 VLM 기반 방식들은 모듈 간 느슨한 결합과 반복적인 정보 변환 과정에서 미세한 시각적 디테일 손실을 겪고, 순차적 추론으로 인해 상당한 지연 시간이 발생한다는 한계가 있었습니다. 이를 해결하기 위해 연구진은 VLALight라는 경량의 엔드투엔드 비전-언어-행동 프레임워크를 제안했습니다.
VLALight는 교차로 관찰 정보와 신호 단계 정보를 이산적인 신호 동작으로 직접 매핑하는 것이 특징입니다. 특히 다중 시점 카메라 뷰(multi-view)의 특성을 처리하기 위해, 여러 방향의 카메라 영상을 통합된 시각적 입력으로 결합하고 텍스트 지침을 활용하여 이를 교통 움직임 및 신호 단계와 연관시킵니다. 이 설계 덕분에 중간 이미지-텍스트 설명이나 수작업으로 만든 교통 상태 표현 없이도 단지 0.5 B 의 소형 모델만으로 직접적인 동작 예측이 가능합니다.
실험 결과, VLALight는 비교된 모든 방법 중 최고의 응급 차량 서비스 성능을 보여주었으며, 기존의 캐스케이드 방식 대비 응급 대기 시간을 21.1% 줄였습니다. 이 모델은 로컬 하드웨어에서 실시간으로 작동하는 것이 가능하며, 심지어 보지 못한 교차로 토폴로지나 교통 흐름 패턴에도 높은 일반화 성능을 입증하여 실용성이 뛰어남이 확인되었습니다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.