AI News Watcher
Thursday, Sep 10, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Sep 10, 2026 · 2 min read · Alibaba ← Back to feed

Qwen-Drive-1.0 от Alibaba: универсальный VLM научили водить без перестройки ядра daily

К базовой модели зрения-языка добавили два внешних модуля: для 3D-восприятия и планирования движения, сохранив при этом её инспектируемость.

Qwen-Drive-1.0 от Alibaba: универсальный VLM научили водить без перестройки ядра
Редакция · Daily briefing

Когда речь заходит о системах автономного вождения, многие разработчики, как и Tesla, стремятся к полному сквозному обучению, где все компоненты интегрированы в одну нейросеть. Alibaba представила Qwen-Drive-1.0, показав альтернативный подход: адаптацию универсальной языковой модели зрения (VLM) для критически важных задач автономного вождения, добавляя специализированные внешние модули без изменения её ядра.

Qwen-Drive-1.0 — это первая унифицированная фундаментальная модель зрения-языка (VLM), предназначенная для автономного вождения. Она объединяет в себе три ключевые функции: 3D-восприятие окружающего мира, ответы на визуальные вопросы и планирование движения. Модель построена на базе уже существующей мультимодальной Qwen3.5-4B, при этом её основная архитектура осталась полностью нетронутой.

Для автономного вождения к базовой VLM добавили два внешних модуля:

Обучение модели проходило в несколько этапов, используя специальный подход к данным. Он объединяет метки из разных наборов данных, переписывает ответы и отфильтровывает образцы для согласованности. Такой метод позволяет совмещать данные для вождения с общими задачами VLM, адаптируясь к новой области и снижая риск «катастрофического забывания» ранее полученных знаний.

В тестах Qwen-Drive-1.0 показала средний результат 69.43 в задачах вопросов-ответов по сценариям вождения, превзойдя как универсальные VLM, так и специализированные модели для вождения. В задачах планирования движения модель также продемонстрировала высокую производительность в сценариях как с разомкнутым, так и с замкнутым циклом. Для обучения использовались только общедоступные данные, общим объёмом 2.83 миллиона образцов, с унифицированным форматом траекторий для стабильного прогнозирования на скорости 10 Гц.

Подход Alibaba с Qwen-Drive-1.0 демонстрирует, что для расширения возможностей универсальных моделей зрения-языка в таких сложных областях, как автономное вождение, не обязательно перестраивать их ядро. Добавление специализированных, но при этом прозрачных внешних модулей позволяет быстро адаптировать существующие технологии и даёт возможность проверять отдельные компоненты системы. Однако, как отмечают сами разработчики, предстоит ещё усилить согласованность между текстовыми рассуждениями модели и генерируемой траекторией движения.

Дополнительные источники

  1. https://qwen.ai/blog?id=qwen-drive-1.0
  2. https://arxiv.org/abs/2609.00111
  3. thinkautonomous.ai
  4. hyper.ai
  5. superpowerdaily.com

Источники

  1. https://www.alibabacloud.com/blog/qwen-drive-1-0-an-initial-step-towards-a-vision-language-foundation-model-for-autonomous-driving_603544 blog
→ Опубликовано в Telegram: @agentic_ai_news/1010