모델 연구
Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
ARarXiv
자율주행을 목표로 하는 비전-언어 기반 모델(VLM) Qwen-Drive-1.0이 공개되었습니다. 이 모델은 3D 인식, 시각 질문 답변, 모션 플래닝 기능을 하나의 통합 프레임워크로 구현한 것이 특징입니다.
세 줄 요약
- 외부 BEV 인지 헤드를 활용하여 3D 객체 탐지와 환경 지도를 파악하며, 계획 전문가가 VLM 표현을 기반으로 미래 주행 경로를 생성합니다. 실험 결과는 높은 3D 인식 및 모션 플래닝 성능을 입증했습니다.
- 일반적인 시각-언어 이해 능력과 자율주행 특화 지능을 결합하여, 시스템의 범용성과 신뢰성을 동시에 확보할 수 있는 가능성을 제시합니다.
- 모델은 주행 감독 데이터와 일반 VLM 데이터를 단계적으로 학습시켜 성능을 검증했습니다. 이는 자율주행 분야에서 범용 AI가 적용될 수 있음을 보여주는 중요한 진전입니다.
자율주행을 목표로 하는 비전-언어 기반 모델(VLM) Qwen-Drive-1.0이 공개되었습니다. 이 모델은 3D 인식, 시각 질문 답변, 모션 플래닝 기능을 하나의 통합 프레임워크로 구현한 것이 특징입니다.