404 Driver Not Found
1.53K subscribers
88 photos
2 videos
58 links
Канал об ML в автономном транспорте от специалистов из Яндекса: разбираем научные статьи, делимся интересными находками, обсуждаем горячие вопросы индустрии.

Вопросы и предложения > @yandex_ml_brand
Download Telegram
Автономный транспорт на ECCV 2026: несколько слов о долгосрочном развитии

На воркшопе Emerging Behaviors for Achieving Robust Autonomy обсуждали надёжность автономного транспорта. В нескольких докладах, как из индустрии, так и из академии, чётко прослеживались одни и те же тезисы по развитию планировщиков для автономных автомобилей:

🔴 Развитие ML-планировщиков движется в сторону end-to-end-моделей.
🔴 Уже сейчас индустрия активно использует RL для обучения ML-планировщиков: пока в варианте RL post-training в симуляции. Ресёрч идëт в сторону RL-обучения с нуля, в том числе и для end-to-end-сетей.
🔴 И в индустрии, и в академии интенсивно пытаются использовать Self-play RL. Это был один из важных ингредиентов успеха AlphaGo, которая тренировалась играть сама с собой в го и в итоге впервые обыграла человека в эту игру.
🔴 Чтобы RL для end-to-end планировщика заработал, нужен быстрый симулятор с достаточно высоким качеством имитации сенсоров: без sim-to-real gap. Это пока остается исследовательской задачей. Даже NVIDIA, которая довольно далеко продвинулась в задаче симуляции сенсоров для роботов, пишет о том, что sim-to-real gap все ещё частая проблема.
🔴 Надёжный планировщик не сделать только на основе записанных логов. Симулятор должен уметь генерировать сложные случаи для обучения и тестирования. Для этого нужна эффективная world model, созданием которой занимаются и в академии, и в индустрии.

Академические боли тоже остаются прежними. В докладе PRIX: Learning to Plan from Raw Pixels for End-to-End Autonomous Driving авторы добились SOTA на нескольких бенчмарках для планировщика в автономном транспорте. Но на последнем слайде честно написали, что не могут предсказать, как модель будет вести себя в реальности, на живом роботе или автомобиле с ограниченными вычислительными возможностями. Это общая проблема академических исследований: своего флота автомобилей у них нет, а открытые бенчмарки требуют дополнительной валидации.

Наблюдениями поделился ❣️ Виктор Юрченко
404 driver not found
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
9❤‍🔥6👍5🔥2🤩1
Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving

Современные подходы к автономному вождению часто разделяют восприятие, предсказание и планирование на отдельные модули. Но сейчас всё больше моделей переходят на end-to-end-предсказание с дообучением VLM под задачи вождения.

В частности, 31 августа команда Alibaba выпустила Qwen‑Drive‑1.0 — собственную модель в этой области. Это интересный релиз, потому что команда Qwen — один из безусловных лидеров в мире опенсорсных VLM, но это её первый заход в модели для вождения.

Авторы стартуют с Qwen3.5-4B и дообучают её, исходят из ключевых дизайн-принципов:

🔴 Для длинного хвоста ситуаций нужно минимально менять исходную VLM так, чтобы она при этом продолжала справляться с общими темами.
🔴 Для хорошего понимания сцены важны подзадачи 3D-реконструкции и разнообразный visual QA.

Чтобы достичь этого, предобученную VLM усилили двумя элементами:

🔴 BEV-голова для персепшна извлекает явную 3D-информацию: детекция объектов, предсказание occupancy, сегментация карты.
🔴 Planning Expert генерирует будущую траекторию эго-автомобиля на основе представлений VLM, используя flow matching.

Qwen‑Drive‑1.0 обучают в четыре стадии: первые две — для персепшна, следующие — для планнера.

1. Претрейн перспешна. Замораживают основную модель, обучают только новую BEV-голову на задачах 3D-детекции, occupancy, сегментации.
2. Совместное обучение персепшна и VQA. Размораживают визуальный энкодер и VLM. Обучают модель одновременно на данных для 3D-персепшна и «вопросах-ответах» по сцене вождения. Секретный ингредиент — микс данных: 64,3% составляют задачи вождения, 26% — общие задачи VAQ, 9,7% — 3D-персепшн. Это позволяет приобрести навыки вождения, не забывая общие знания.
3. Претрейн Planning Expert. Замораживают основную модель, обучают эксперта генерировать траектории.
4. Обучение с подкреплением (RL). Финально дотюнивают Planning Expert.

Собственные сырые данные почти не собирали, но смогли адаптировать широкий набор из примерно 30 публичных датасетов (включая nuScenes, Waymo WOD-E2E, NAVSIM). Многое пришлось унифицировать: например в таксономии классов объединили все типы автомобилей. Геометрию пришлось сгладить, чтобы получить одинаковую растеризацию карты и идентичные траектории на 50 точек. Для VQA-вождения многие запросы переформулировали большими умными VLM.

В итоге свои гипотезы авторы частично подтвердили: общие знания почти не проседают, бенчмарки очень близки к исходным. Понимание дорожной ситуации значительно улучшилось.

При этом Qwen-Drive-1.0 справляется с вождением так же хорошо, как специализированные end-to-end-модели. Новая модель получила PDMS 90,7 на NavSim. Это хороший результат, хотя и не SOTA: end-to-end SimWAM выбила 91,5, а модель со скорингом CLOVER — 94,5.

Интересно, что персепшн используют только для обучения, в инференсе планнера его нет. В аблэйшне авторы пробуют совсем исключить персепшн-стадию — планнер при этом работает не сильно хуже.

Модель выглядит симпатичной, авторы не бенч-максят, а честно валидируют общий подход.

Разбор подготовил ❣️ Кирилл Федянин
404 driver not found
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥10🤩75👍1😱1
Mask2Map: Vectorized HD Map Construction Using Bird's Eye View Segmentation Masks

Что будет, если объединить лучшие практики из Deformable-DeTR, DN-DeTR, Mask2Former, MapTR и MapTR v2? Узнаем из статьи о Mask2Map — методе построения векторных HD-карт по данным автомобильных сенсоров.

Главная идея довольно проста: получить хорошее представление дорожной разметки в виде BEV-масок, а затем использовать эти маски как геометрическую подсказку для векторного декодера.

Mask2Map состоит из двух основных частей:

🔴 IMPNet строит instance-level сегментацию по BEV-фичам сенсоров и формирует маски вместе с соответствующими query.

🔴 MMPNet превращает эту информацию в векторные элементы карты: предсказывает их класс, геометрию и порядок точек.

Пайплайн начинается с построения BEV-представления. Фичи от сенсоров переводят в BEV и обрабатывают на нескольких масштабах. Дальше Mask2Former-подобная часть выполняет инстанс-сегментацию: получает собственную маску и эмбеддинг объекта для каждого элемента карты.

После этого плотную маску нужно превратить в компактное геометрическое представление. Для этого её бинаризуют, прореживают скользящим окном, оставляя репрезентативные точки, и в конце применяют Farthest Point Sampling (FPS). В результате вместо большого числа пикселей остаётся небольшой набор пространственных координат (x, y).

Параллельно модули PQG и GFE формируют query и добавляют в них семантическую и геометрическую информацию из BEV. Идея в том, чтобы дать декодеру более осмысленную стартовую точку, чем полностью свободные обучаемые эмбеддинги.

Дальше всё это попадает в Mask-Guided Map Decoder. Полученные из масок точки используются как геометрические подсказки и опорные точки для деформируемого кросс-аттеншна, после чего декодер восстанавливает итоговую векторную геометрию элементов HD-карты.

Если совсем упростить, архитектуру можно представить так: сенсоры → BEV → instance masks → опорные точки → vector map. То есть левая часть Mask2Map во многом напоминает Mask2Former, а правая — MapTR/Deformable DETR, связанные BEV-масками, которые дают векторному декодеру сильный spatial prior.

Вместо того чтобы заставлять DETR-подобный декодер полностью с нуля искать геометрию дорожных элементов, авторы сначала решают более простую задачу сегментации, а затем используют её результат для инициализации и направления векторного предсказания.

Отдельно во время обучения используется знакомая по DN-DETR идея расшумления queries: GT-объекты искусственно зашумляются, после чего модель учится восстанавливать исходную геометрию. Это помогает стабилизировать обучение и облегчает сопоставление query с объектами карты.

По результатам авторов Mask2Map на момент публикации заметно превосходил предыдущие методы на nuScenes и Argoverse2: прирост составлял до 10,1% mAP и 4,1% mAP. Познакомиться с кодом можно на GitHub проекта.

Разбор подготовил ❣️ Денис Глазов
404 driver not found
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥95👍4🤯2🎉1