VLM 자율주행 능력 진단 벤치마크 'DriveHierarchy' 개발
DriveHierarchy: A Benchmark for Diagnosing VLM Driving Capabilities from Open-Loop Understanding to Closed-Loop Execution
arXivVLM(Vision-Language Model) 기반 자율주행 시스템의 복합적인 능력을 종합적으로 진단하는 계층적 벤치마크 'DriveHierarchy'가 개발되었습니다.
- 이 벤치마크는 지각적 이해, 맥락 기억, 추론 능력, 그리고 실제 주행 실행까지 네 가지 단계로 자율주행 역량을 구조화하여 평가합니다.
- 기존에는 분리되어 평가되던 단순한 이론적 이해력과 폐쇄 루프의 실제 운전 능력을 연결해 모델 진단에 활용할 수 있습니다.
- DriveHierarchy는 VLM 기반 자율주행 시스템의 성능을 체계적으로 측정하고 개선 방향을 제시하는 통합적인 표준 프레임워크 역할을 합니다.
자율주행 분야에서 (Vision-Language Model) 기반 시스템의 역량을 평가하는 것은 복합적인 과정이기에 어렵습니다. 성공적인 시스템은 교통 참여자와 위험 요소를 정확히 파악하고, 다양한 시점과 시간 간 맥락을 통합하며, 미래 변화를 추론한 후 폐쇄 루프 상호작용 속에서 적절하게 행동해야 합니다. 기존의 들은 이러한 능력을 개방형 이해(open-loop understanding)나 폐쇄 루프 주행 중 하나만 평가하는 경향이 있어 구조적인 진단에 한계가 있었습니다.
이에 연구진은 VLM 기반 자율주행을 네 가지 단계로 구조화한 계층적 벤치마크인 \textsc{DriveHierarchy}를 제시했습니다. 이 벤치마크는 지각적 이해(perceptual grounding), 맥락 기억(contextual memory), 정신적 추론(mental reasoning), 그리고 폐쇄 루프 실행(closed-loop execution)의 네 가지 순위로 자율주행 능력을 체계적으로 조직하여 평가합니다.
\textsc{DriveHierarchy}를 구현하기 위해, 여러 자율주행 데이터셋을 통합하여 76,798개의 질의응답 쌍과 84,279프레임으로 구성된 통일된 개방형 벤치마크를 구축했습니다. 또한 실제 도로 네트워크 기반의 상호작용 시나리오를 갖춘 폐쇄 루프 시뮬레이션 플랫폼을 개발하여 총 100개의 주행 시나리오로 체계적인 평가가 가능합니다. 이 프레임워크는 개방형 이해와 폐쇄 루프 주행 능력을 연결하며, VLM 기반 자율주행 시스템의 진단 및 개선을 위한 통합적 표준 틀 역할을 합니다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 오픈 소스
- 소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.