주행 의미론 기반 비전-언어 모델 설명력 강화 방안
Grounding Vision-Language Models in Driving Semantics: A Multi-Dataset Predicate Framework for Explainable Reasoning
arXiv자율주행 상황 이해에 사용되는 비전-언어 모델의 의미 관계를 검증하기 위해, 측정 가능한 기하학적, 운동학적 증거 등을 활용하는 논리적 술어 프레임워크가 개발되었습니다.
- 이 프레임워크는 여러 데이터셋에서 공통의 '술어 지식 그래프(Predicate KG)'를 구축하여, 주요 자율주행 데이터셋 모두에서 0.93~0.94 수준의 높은 의미론적 검증 정확도를 달성했습니다.
- 이는 AI가 단순히 시각 정보에 의존하는 것을 넘어, 명확하게 추적 가능한 논리적 의미 표현을 제공하여 자율주행 시스템의 신뢰성과 추론 능력을 높일 수 있음을 보여줍니다.
- 다만, 이 방법은 '이상적인 조건(oracle grounding)' 하에서 가장 효과적이며, 모든 복잡한 추론 과제가 정의된 술어 어휘 범위 내에 있어야 한다는 기술적 한계가 있습니다.
비전-언어 모델()은 자율주행 상황 이해에 광범위하게 사용되고 있으나, 이들이 출력하는 의미 관계가 실제 교통 상황과 일치하는지 검증하기 어렵다는 문제가 제기됩니다. 본 연구는 이러한 문제를 해결하기 위해 측정 가능한 기하학적, 운동학적, 시간적 증거 등을 활용하여 주행 장면의 의미론을 도출하는 결정론적 다중 데이터셋 술어 프레임워크를 제시합니다.
이 프레임워크는 nuPlan과 nuScenes 같은 주요 자율주행 데이터셋 전반에 걸쳐 공통된 '술어 지식 그래프(Predicate KG)'를 구축하는 것을 목표로 합니다. 각 데이터셋별 인터페이스를 사용하여 필요한 장면 정보를 복구하지만, 술어 정의 자체는 변경되지 않고 공통의 Predicate KG에 구현됩니다.
이러한 접근 방식을 통해 수동으로 주석 처리된 술어 관계에 대한 정량적 의미론 검증을 수행했을 때, nuPlan에서는 0.94의 매크로 F1 점수, nuScenes에서는 0.93의 매크로 F1 점수를 달성했습니다. 또한, Predicate KG는 LLaVA-OneVision-7B 모델을 이용한 NuPlanQA 하위 과제에서 높은 정확도를 보여주었으며, 술어 지식 그래프 입력이 메타데이터만 사용한 입력보다 여러 하위 과제에서 우수한 성능을 보였습니다.
연구 결과는 결정론적 술어가 일관되고 추적 가능한 의미 표현을 제공함을 입증합니다. 특히 이상적인 조건(oracle grounding) 하에서는, 정의된 술어 어휘 범위 내의 추론 작업에 대해 시각 정보 의존도를 낮추고 신뢰성 있는 의미론적 추론이 가능함을 보여줍니다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.