차량-인프라 기반 협력 주행 이해를 위한 새로운 벤치마크
CoVLM-Bench: A Real-World Benchmark for Cooperative Driving Question Answering and Planning
arXivCoVLM-Bench는 자율주행 분야에서 차량과 인프라 간의 협력 주행 상황을 다루며, 질문 답변(QA)과 경로 계획(Planning)을 동시에 평가하는 새로운 벤치마크입니다.
- 이 벤치마크를 기반으로 개발된 CoVLM-Drive 모델은 주변 인프라 시야 정보를 직접 통합하여 사용하며, 기존 시스템 대비 우수한 협력 주행 성능을 입증했습니다.
- 본 연구는 자율주행의 한계를 차량 중심 시야에서 벗어나 주변 환경 정보까지 종합적으로 이해하는 협력적 장면 이해 능력을 높이는 데 기여합니다.
- CoVLM-Bench는 2,196개의 쌍을 이루는 프레임과 35,136개 이상의 QA 주석 등 방대한 데이터를 포함하며, 모델 지원 및 인간 검증 과정을 거쳐 구축되었습니다.
기존의 비전-언어 모델() 연구는 자율주행 분야에서 상당한 발전을 이루었으나, 주로 차량 중심 시야(ego-centric scenes)에 초점을 맞추고 있습니다. 인프라 측 관측 정보는 차량 외부의 시야를 제공하지만, 기존 협력 주행 시스템들은 이를 단순히 기하학적 표현으로 변환하는 경향이 있었습니다. 본 연구에서는 이러한 한계를 극복하고, 질문 답변(CDQA)과 경로 계획(CP)을 실제 차량-인프라 쌍 프레임에서 공동으로 평가할 수 있는 CoVLM-Bench를 제시했습니다.
CoVLM-Bench는 협력 주행 관련 데이터셋으로서, 2,196개의 쌍을 이루는 프레임을 포함하며 총 35,136개의 CDQA 주석을 제공합니다. 이 주석은 모델 지원 초안 작성과 인간 검증 과정을 거쳐 구축되었으며, 추가적으로 세 부분으로 구성된 추론 근거(rationales)를 보조 감독 자료로 활용하고 기록된 자차 움직임으로부터 미래 궤적 목표를 도출했습니다.
이 를 기반으로 개발된 CoVLM-Drive는 쌍을 이루는 시야 정보를 CDQA와 CP 모두에 직접 사용하는 통합 VLM 기준 모델입니다. 실험 결과, CDQA 적응(adaptation)은 답변 정확도를 향상시켰으며, CoVLM-Drive가 비교된 V2X 플래너보다 낮은 FDE를 달성했습니다. 특히 QA 초기화 및 추론 근거 감독을 통해 계획 오류를 줄이는 효과가 입증되어, 협력적 장면 이해와 계획에 대한 VLM의 훈련과 비교를 지원합니다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.