차량-인프라 기반 협력 주행 이해를 위한 새로운 벤치마크 — AI 생성 일러스트
로보틱스 연구

차량-인프라 기반 협력 주행 이해를 위한 새로운 벤치마크

CoVLM-Bench: A Real-World Benchmark for Cooperative Driving Question Answering and Planning

arXiv9월 30일 발표 · 3분 · 프리프린트

CoVLM-Bench는 자율주행 분야에서 차량과 인프라 간의 협력 주행 상황을 다루며, 질문 답변(QA)과 경로 계획(Planning)을 동시에 평가하는 새로운 벤치마크입니다.

세 줄 요약arXiv 원문 기반
  1. 이 벤치마크를 기반으로 개발된 CoVLM-Drive 모델은 주변 인프라 시야 정보를 직접 통합하여 사용하며, 기존 시스템 대비 우수한 협력 주행 성능을 입증했습니다.
  2. 본 연구는 자율주행의 한계를 차량 중심 시야에서 벗어나 주변 환경 정보까지 종합적으로 이해하는 협력적 장면 이해 능력을 높이는 데 기여합니다.
  3. CoVLM-Bench는 2,196개의 쌍을 이루는 프레임과 35,136개 이상의 QA 주석 등 방대한 데이터를 포함하며, 모델 지원 및 인간 검증 과정을 거쳐 구축되었습니다.

기존의 비전-언어 모델() 연구는 자율주행 분야에서 상당한 발전을 이루었으나, 주로 차량 중심 시야(ego-centric scenes)에 초점을 맞추고 있습니다. 인프라 측 관측 정보는 차량 외부의 시야를 제공하지만, 기존 협력 주행 시스템들은 이를 단순히 기하학적 표현으로 변환하는 경향이 있었습니다. 본 연구에서는 이러한 한계를 극복하고, 질문 답변(CDQA)과 경로 계획(CP)을 실제 차량-인프라 쌍 프레임에서 공동으로 평가할 수 있는 CoVLM-Bench를 제시했습니다.

CoVLM-Bench는 협력 주행 관련 데이터셋으로서, 2,196개의 쌍을 이루는 프레임을 포함하며 총 35,136개의 CDQA 주석을 제공합니다. 이 주석은 모델 지원 초안 작성과 인간 검증 과정을 거쳐 구축되었으며, 추가적으로 세 부분으로 구성된 추론 근거(rationales)를 보조 감독 자료로 활용하고 기록된 자차 움직임으로부터 미래 궤적 목표를 도출했습니다.

이 를 기반으로 개발된 CoVLM-Drive는 쌍을 이루는 시야 정보를 CDQA와 CP 모두에 직접 사용하는 통합 VLM 기준 모델입니다. 실험 결과, CDQA 적응(adaptation)은 답변 정확도를 향상시켰으며, CoVLM-Drive가 비교된 V2X 플래너보다 낮은 FDE를 달성했습니다. 특히 QA 초기화 및 추론 근거 감독을 통해 계획 오류를 줄이는 효과가 입증되어, 협력적 장면 이해와 계획에 대한 VLM의 훈련과 비교를 지원합니다.

용어 풀이

VLM
이미지와 글을 함께 이해하는 모델.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · CoVLM-Bench: A Real-World Benchmark for Cooperative Driving Question Answering and Planning
원문 보기arXiv