참고Reddit
Qwen, 자율주행 특화 VLM 'Qwen-Drive-1.0' 공개
3D 인식 및 모션 플래닝을 통합한 오픈 가중치 모델. 자율주행 분야 AI 연구자라면 성능 확인 필요.
요약
알리바바의 Qwen 팀이 자율주행 특화 파인튜닝 모델인 Qwen-Drive-1.0-4B를 공개했다. 이 모델은 기존 사전 학습된 비전 언어 모델(VLM) 아키텍처를 유지하며, 3D 인식, 시각적 질의응답, 모션 계획을 단일 프레임워크 내에 통합했다. 외부 조감도(BEV) 인식 헤드를 탑재해 3D 객체 감지, 의미론적 점유 예측 등을 동시에 수행할 수 있다. 전체 Bf16 체크포인트 용량은 9B이며, 중국 AI 연구소들이 오픈 웨이트 모델을 활용해 자율주행 기술을 고도화하고 있음을 보여주는 중요한 사례로 평가받는다. 자세한 기술적 내용은 40페이지 분량의 기술 보고서를 통해 확인할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen/Qwen-Drive-1.0-4B · Hugging Face
원문 보기 ↗