Qwen, 자율주행 특화 비전-언어 모델 Qwen-Drive-1.0 공개 — AI 생성 일러스트AI 일러스트
모델 도구

Qwen, 자율주행 특화 비전-언어 모델 Qwen-Drive-1.0 공개

Qwen/Qwen-Drive-1.0-4B

Hugging Face발표일 미상 · 2분

Qwen이 자율주행에 특화된 비전-언어 모델 'Qwen-Drive-1.0'을 공개했습니다. 이 모델은 3D 환경 인식, 시각 질문 답변(VQA), 주행 경로 계획 기능을 통합한 것이 특징입니다.

세 줄 요약Hugging Face 원문 기반
  1. 기존의 대규모 VLM 아키텍처를 유지하고 외부 BEV 인식 헤드와 계획 전문가 모듈을 추가하여, 3D 객체 감지부터 미래 주행 경로 예측까지 통합적으로 처리합니다.
  2. 자율주행 데이터와 일반 VLM 데이터를 결합 학습함으로써 도메인 전문성을 확보하면서도 광범위한 시각적 이해 능력을 유지했습니다. 이는 범용성과 안전성이 높은 AI 시스템 구축에 기여합니다.
  3. 공공 데이터셋을 활용해 다양한 주행 시나리오를 통합하고 SFT 및 RL 최적화를 거쳤습니다. 다만, 최종 성능은 평가 방식(오픈/폐쇄 루프)과 계획 모드에 따라 달라질 수 있습니다.

Qwen-Drive-1.0은 자율주행을 위해 설계된 비전-언어 기반의 파운데이션 모델입니다. 이 모델은 사전 학습된 Qwen3.5 아키텍처를 그대로 유지하면서, 3D 인식(BEV perception head), 시각 질문 답변(VQA), 그리고 모션 플래닝 기능을 통합했습니다. 공유되는 VLM을 중심으로 외부 BEV 인식 헤드가 3D 객체 감지 및 의미론적 점유 예측 등을 수행하며, 별도의 계획 전문가(Planning Expert)가 흐름 매칭(flow matching)을 통해 미래의 자차 궤적을 생성하는 구조입니다.

모델은 자율주행 감독 데이터와 일반 목적의 비전-언어 데이터를 결합하여 단계적으로 학습되었습니다. 이러한 통합적인 훈련 방식은 도메인 특화 역량을 확보하면서도 광범위한 시각적 이해 능력과 명령어 추종 능력을 보존하도록 설계되었습니다. Qwen-Drive-1.0은 공공 출처에서 수집된 주행 샘플을 활용하여 궤적 형식을 통일하고, 오픈 루프 예측부터 폐쇄 루프 자율주행까지 평가할 수 있도록 합니다.

용어 풀이

VLM
이미지와 글을 함께 이해하는 모델.
원문Hugging Face · Qwen/Qwen-Drive-1.0-4B같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기