모델 도구
Qwen, 자율주행 특화 비전-언어 모델 Qwen-Drive-1.0 공개
Qwen/Qwen-Drive-1.0-4B
Hugging FaceQwen이 자율주행에 특화된 비전-언어 모델 'Qwen-Drive-1.0'을 공개했습니다. 이 모델은 3D 환경 인식, 시각 질문 답변(VQA), 주행 경로 계획 기능을 통합한 것이 특징입니다.
세 줄 요약
- 기존의 대규모 VLM 아키텍처를 유지하고 외부 BEV 인식 헤드와 계획 전문가 모듈을 추가하여, 3D 객체 감지부터 미래 주행 경로 예측까지 통합적으로 처리합니다.
- 자율주행 데이터와 일반 VLM 데이터를 결합 학습함으로써 도메인 전문성을 확보하면서도 광범위한 시각적 이해 능력을 유지했습니다. 이는 범용성과 안전성이 높은 AI 시스템 구축에 기여합니다.
- 공공 데이터셋을 활용해 다양한 주행 시나리오를 통합하고 SFT 및 RL 최적화를 거쳤습니다. 다만, 최종 성능은 평가 방식(오픈/폐쇄 루프)과 계획 모드에 따라 달라질 수 있습니다.
Qwen-Drive-1.0은 자율주행을 위해 설계된 비전-언어 기반의 파운데이션 모델입니다. 이 모델은 사전 학습된 Qwen3.5 아키텍처를 그대로 유지하면서, 3D 인식(BEV perception head), 시각 질문 답변(VQA), 그리고 모션 플래닝 기능을 통합했습니다. 공유되는 VLM을 중심으로 외부 BEV 인식 헤드가 3D 객체 감지 및 의미론적 점유 예측 등을 수행하며, 별도의 계획 전문가(Planning Expert)가 흐름 매칭(flow matching)을 통해 미래의 자차 궤적을 생성하는 구조입니다.
모델은 자율주행 감독 데이터와 일반 목적의 비전-언어 데이터를 결합하여 단계적으로 학습되었습니다. 이러한 통합적인 훈련 방식은 도메인 특화 역량을 확보하면서도 광범위한 시각적 이해 능력과 명령어 추종 능력을 보존하도록 설계되었습니다. Qwen-Drive-1.0은 공공 출처에서 수집된 주행 샘플을 활용하여 궤적 형식을 통일하고, 오픈 루프 예측부터 폐쇄 루프 자율주행까지 평가할 수 있도록 합니다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.