Автономный транспорт на ECCV 2026: несколько слов о долгосрочном развитии
На воркшопе Emerging Behaviors for Achieving Robust Autonomy обсуждали надёжность автономного транспорта. В нескольких докладах, как из индустрии, так и из академии, чётко прослеживались одни и те же тезисы по развитию планировщиков для автономных автомобилей:
🔴 Развитие ML-планировщиков движется в сторону end-to-end-моделей.
🔴 Уже сейчас индустрия активно использует RL для обучения ML-планировщиков: пока в варианте RL post-training в симуляции. Ресёрч идëт в сторону RL-обучения с нуля, в том числе и для end-to-end-сетей.
🔴 И в индустрии, и в академии интенсивно пытаются использовать Self-play RL. Это был один из важных ингредиентов успеха AlphaGo, которая тренировалась играть сама с собой в го и в итоге впервые обыграла человека в эту игру.
🔴 Чтобы RL для end-to-end планировщика заработал, нужен быстрый симулятор с достаточно высоким качеством имитации сенсоров: без sim-to-real gap. Это пока остается исследовательской задачей. Даже NVIDIA, которая довольно далеко продвинулась в задаче симуляции сенсоров для роботов, пишет о том, что sim-to-real gap все ещё частая проблема.
🔴 Надёжный планировщик не сделать только на основе записанных логов. Симулятор должен уметь генерировать сложные случаи для обучения и тестирования. Для этого нужна эффективная world model, созданием которой занимаются и в академии, и в индустрии.
Академические боли тоже остаются прежними. В докладе PRIX: Learning to Plan from Raw Pixels for End-to-End Autonomous Driving авторы добились SOTA на нескольких бенчмарках для планировщика в автономном транспорте. Но на последнем слайде честно написали, что не могут предсказать, как модель будет вести себя в реальности, на живом роботе или автомобиле с ограниченными вычислительными возможностями. Это общая проблема академических исследований: своего флота автомобилей у них нет, а открытые бенчмарки требуют дополнительной валидации.
Наблюдениями поделился❣️ Виктор Юрченко
404 driver not found
На воркшопе Emerging Behaviors for Achieving Robust Autonomy обсуждали надёжность автономного транспорта. В нескольких докладах, как из индустрии, так и из академии, чётко прослеживались одни и те же тезисы по развитию планировщиков для автономных автомобилей:
Академические боли тоже остаются прежними. В докладе PRIX: Learning to Plan from Raw Pixels for End-to-End Autonomous Driving авторы добились SOTA на нескольких бенчмарках для планировщика в автономном транспорте. Но на последнем слайде честно написали, что не могут предсказать, как модель будет вести себя в реальности, на живом роботе или автомобиле с ограниченными вычислительными возможностями. Это общая проблема академических исследований: своего флота автомобилей у них нет, а открытые бенчмарки требуют дополнительной валидации.
Наблюдениями поделился
404 driver not found
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤9❤🔥6👍5🔥2🤩1
Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
Современные подходы к автономному вождению часто разделяют восприятие, предсказание и планирование на отдельные модули. Но сейчас всё больше моделей переходят на end-to-end-предсказание с дообучением VLM под задачи вождения.
В частности, 31 августа команда Alibaba выпустила Qwen‑Drive‑1.0 — собственную модель в этой области. Это интересный релиз, потому что команда Qwen — один из безусловных лидеров в мире опенсорсных VLM, но это её первый заход в модели для вождения.
Авторы стартуют с Qwen3.5-4B и дообучают её, исходят из ключевых дизайн-принципов:
🔴 Для длинного хвоста ситуаций нужно минимально менять исходную VLM так, чтобы она при этом продолжала справляться с общими темами.
🔴 Для хорошего понимания сцены важны подзадачи 3D-реконструкции и разнообразный visual QA.
Чтобы достичь этого, предобученную VLM усилили двумя элементами:
🔴 BEV-голова для персепшна извлекает явную 3D-информацию: детекция объектов, предсказание occupancy, сегментация карты.
🔴 Planning Expert генерирует будущую траекторию эго-автомобиля на основе представлений VLM, используя flow matching.
Qwen‑Drive‑1.0 обучают в четыре стадии: первые две — для персепшна, следующие — для планнера.
1. Претрейн перспешна. Замораживают основную модель, обучают только новую BEV-голову на задачах 3D-детекции, occupancy, сегментации.
2. Совместное обучение персепшна и VQA. Размораживают визуальный энкодер и VLM. Обучают модель одновременно на данных для 3D-персепшна и «вопросах-ответах» по сцене вождения. Секретный ингредиент — микс данных: 64,3% составляют задачи вождения, 26% — общие задачи VAQ, 9,7% — 3D-персепшн. Это позволяет приобрести навыки вождения, не забывая общие знания.
3. Претрейн Planning Expert. Замораживают основную модель, обучают эксперта генерировать траектории.
4. Обучение с подкреплением (RL). Финально дотюнивают Planning Expert.
Собственные сырые данные почти не собирали, но смогли адаптировать широкий набор из примерно 30 публичных датасетов (включая nuScenes, Waymo WOD-E2E, NAVSIM). Многое пришлось унифицировать: например в таксономии классов объединили все типы автомобилей. Геометрию пришлось сгладить, чтобы получить одинаковую растеризацию карты и идентичные траектории на 50 точек. Для VQA-вождения многие запросы переформулировали большими умными VLM.
В итоге свои гипотезы авторы частично подтвердили: общие знания почти не проседают, бенчмарки очень близки к исходным. Понимание дорожной ситуации значительно улучшилось.
При этом Qwen-Drive-1.0 справляется с вождением так же хорошо, как специализированные end-to-end-модели. Новая модель получила PDMS 90,7 на NavSim. Это хороший результат, хотя и не SOTA: end-to-end SimWAM выбила 91,5, а модель со скорингом CLOVER — 94,5.
Интересно, что персепшн используют только для обучения, в инференсе планнера его нет. В аблэйшне авторы пробуют совсем исключить персепшн-стадию — планнер при этом работает не сильно хуже.
Модель выглядит симпатичной, авторы не бенч-максят, а честно валидируют общий подход.
Разбор подготовил❣️ Кирилл Федянин
404 driver not found
Современные подходы к автономному вождению часто разделяют восприятие, предсказание и планирование на отдельные модули. Но сейчас всё больше моделей переходят на end-to-end-предсказание с дообучением VLM под задачи вождения.
В частности, 31 августа команда Alibaba выпустила Qwen‑Drive‑1.0 — собственную модель в этой области. Это интересный релиз, потому что команда Qwen — один из безусловных лидеров в мире опенсорсных VLM, но это её первый заход в модели для вождения.
Авторы стартуют с Qwen3.5-4B и дообучают её, исходят из ключевых дизайн-принципов:
Чтобы достичь этого, предобученную VLM усилили двумя элементами:
Qwen‑Drive‑1.0 обучают в четыре стадии: первые две — для персепшна, следующие — для планнера.
1. Претрейн перспешна. Замораживают основную модель, обучают только новую BEV-голову на задачах 3D-детекции, occupancy, сегментации.
2. Совместное обучение персепшна и VQA. Размораживают визуальный энкодер и VLM. Обучают модель одновременно на данных для 3D-персепшна и «вопросах-ответах» по сцене вождения. Секретный ингредиент — микс данных: 64,3% составляют задачи вождения, 26% — общие задачи VAQ, 9,7% — 3D-персепшн. Это позволяет приобрести навыки вождения, не забывая общие знания.
3. Претрейн Planning Expert. Замораживают основную модель, обучают эксперта генерировать траектории.
4. Обучение с подкреплением (RL). Финально дотюнивают Planning Expert.
Собственные сырые данные почти не собирали, но смогли адаптировать широкий набор из примерно 30 публичных датасетов (включая nuScenes, Waymo WOD-E2E, NAVSIM). Многое пришлось унифицировать: например в таксономии классов объединили все типы автомобилей. Геометрию пришлось сгладить, чтобы получить одинаковую растеризацию карты и идентичные траектории на 50 точек. Для VQA-вождения многие запросы переформулировали большими умными VLM.
В итоге свои гипотезы авторы частично подтвердили: общие знания почти не проседают, бенчмарки очень близки к исходным. Понимание дорожной ситуации значительно улучшилось.
При этом Qwen-Drive-1.0 справляется с вождением так же хорошо, как специализированные end-to-end-модели. Новая модель получила PDMS 90,7 на NavSim. Это хороший результат, хотя и не SOTA: end-to-end SimWAM выбила 91,5, а модель со скорингом CLOVER — 94,5.
Интересно, что персепшн используют только для обучения, в инференсе планнера его нет. В аблэйшне авторы пробуют совсем исключить персепшн-стадию — планнер при этом работает не сильно хуже.
Модель выглядит симпатичной, авторы не бенч-максят, а честно валидируют общий подход.
Разбор подготовил
404 driver not found
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥10🤩7❤5👍1😱1
Mask2Map: Vectorized HD Map Construction Using Bird's Eye View Segmentation Masks
Что будет, если объединить лучшие практики из Deformable-DeTR, DN-DeTR, Mask2Former, MapTR и MapTR v2? Узнаем из статьи о Mask2Map — методе построения векторных HD-карт по данным автомобильных сенсоров.
Главная идея довольно проста: получить хорошее представление дорожной разметки в виде BEV-масок, а затем использовать эти маски как геометрическую подсказку для векторного декодера.
Mask2Map состоит из двух основных частей:
🔴 IMPNet строит instance-level сегментацию по BEV-фичам сенсоров и формирует маски вместе с соответствующими query.
🔴 MMPNet превращает эту информацию в векторные элементы карты: предсказывает их класс, геометрию и порядок точек.
Пайплайн начинается с построения BEV-представления. Фичи от сенсоров переводят в BEV и обрабатывают на нескольких масштабах. Дальше Mask2Former-подобная часть выполняет инстанс-сегментацию: получает собственную маску и эмбеддинг объекта для каждого элемента карты.
После этого плотную маску нужно превратить в компактное геометрическое представление. Для этого её бинаризуют, прореживают скользящим окном, оставляя репрезентативные точки, и в конце применяют Farthest Point Sampling (FPS). В результате вместо большого числа пикселей остаётся небольшой набор пространственных координат
Параллельно модули PQG и GFE формируют query и добавляют в них семантическую и геометрическую информацию из BEV. Идея в том, чтобы дать декодеру более осмысленную стартовую точку, чем полностью свободные обучаемые эмбеддинги.
Дальше всё это попадает в Mask-Guided Map Decoder. Полученные из масок точки используются как геометрические подсказки и опорные точки для деформируемого кросс-аттеншна, после чего декодер восстанавливает итоговую векторную геометрию элементов HD-карты.
Если совсем упростить, архитектуру можно представить так:
Вместо того чтобы заставлять DETR-подобный декодер полностью с нуля искать геометрию дорожных элементов, авторы сначала решают более простую задачу сегментации, а затем используют её результат для инициализации и направления векторного предсказания.
Отдельно во время обучения используется знакомая по DN-DETR идея расшумления queries: GT-объекты искусственно зашумляются, после чего модель учится восстанавливать исходную геометрию. Это помогает стабилизировать обучение и облегчает сопоставление query с объектами карты.
По результатам авторов Mask2Map на момент публикации заметно превосходил предыдущие методы на nuScenes и Argoverse2: прирост составлял до 10,1% mAP и 4,1% mAP. Познакомиться с кодом можно на GitHub проекта.
Разбор подготовил❣️ Денис Глазов
404 driver not found
Что будет, если объединить лучшие практики из Deformable-DeTR, DN-DeTR, Mask2Former, MapTR и MapTR v2? Узнаем из статьи о Mask2Map — методе построения векторных HD-карт по данным автомобильных сенсоров.
Главная идея довольно проста: получить хорошее представление дорожной разметки в виде BEV-масок, а затем использовать эти маски как геометрическую подсказку для векторного декодера.
Mask2Map состоит из двух основных частей:
Пайплайн начинается с построения BEV-представления. Фичи от сенсоров переводят в BEV и обрабатывают на нескольких масштабах. Дальше Mask2Former-подобная часть выполняет инстанс-сегментацию: получает собственную маску и эмбеддинг объекта для каждого элемента карты.
После этого плотную маску нужно превратить в компактное геометрическое представление. Для этого её бинаризуют, прореживают скользящим окном, оставляя репрезентативные точки, и в конце применяют Farthest Point Sampling (FPS). В результате вместо большого числа пикселей остаётся небольшой набор пространственных координат
(x, y).Параллельно модули PQG и GFE формируют query и добавляют в них семантическую и геометрическую информацию из BEV. Идея в том, чтобы дать декодеру более осмысленную стартовую точку, чем полностью свободные обучаемые эмбеддинги.
Дальше всё это попадает в Mask-Guided Map Decoder. Полученные из масок точки используются как геометрические подсказки и опорные точки для деформируемого кросс-аттеншна, после чего декодер восстанавливает итоговую векторную геометрию элементов HD-карты.
Если совсем упростить, архитектуру можно представить так:
сенсоры → BEV → instance masks → опорные точки → vector map. То есть левая часть Mask2Map во многом напоминает Mask2Former, а правая — MapTR/Deformable DETR, связанные BEV-масками, которые дают векторному декодеру сильный spatial prior.Вместо того чтобы заставлять DETR-подобный декодер полностью с нуля искать геометрию дорожных элементов, авторы сначала решают более простую задачу сегментации, а затем используют её результат для инициализации и направления векторного предсказания.
Отдельно во время обучения используется знакомая по DN-DETR идея расшумления queries: GT-объекты искусственно зашумляются, после чего модель учится восстанавливать исходную геометрию. Это помогает стабилизировать обучение и облегчает сопоставление query с объектами карты.
По результатам авторов Mask2Map на момент публикации заметно превосходил предыдущие методы на nuScenes и Argoverse2: прирост составлял до 10,1% mAP и 4,1% mAP. Познакомиться с кодом можно на GitHub проекта.
Разбор подготовил
404 driver not found
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9❤5👍4🤯2🎉1