404 Driver Not Found
1.46K subscribers
73 photos
2 videos
52 links
Канал об ML в автономном транспорте от специалистов из Яндекса: разбираем научные статьи, делимся интересными находками, обсуждаем горячие вопросы индустрии.

Вопросы и предложения > @yandex_ml_brand
Download Telegram
Генерация реального города Seoul World Model, memory bias в RL, совместное обучение VLA и WM: что обсуждают на ICML 2026 [2/2]

Продолжаем всё ближе подбираться к автономному транспорту в продолжении обзора работ с ICML, которая прямо сейчас продолжается в Сеуле.

DriveWorld-VLA: Unified Latent-Space World Modeling with Vision–Language–Action for Autonomous Driving

К сожалению, не получилось пообщаться с авторами. В статье они предлагают совместно обучать VLA- и WM-модели, чтобы у них был общий latent state. То есть, чтобы можно было генерировать потенциальные развития событий без вычислительно тяжелых пиксельных симуляций.

Обучают в три этапа.

1. Совместно VLA и VM: с маппингом картинок c камер, текстовых инструкций и BEV в общее пространство фичей, из которого параллельно предсказывают будущие BEV и действия эго.

2. Энкодер и action-голова замораживаются, обучается генерация будущих стейтов, обусловленная на действие.

3. Размораживается action-голова, и добавляется reward-модель, которая учится скорить будущие стейты по предложенным действиям.

В итоге получается попытка сделать модель, которая «представляет» потенциальные развития событий и выбирает наиболее подходящее действие.

Position: RL Researchers Need to Distinguish Between Solving Simulators and Using Simulators as a Proxy

Интересная position-статья с весьма очевидным названием, в котором авторы напоминают RL-щикам про разницу между «решением симулятора» и «использованием симулятора как прокси».

Иными словами: политики, хакнувшие реворд, плохо ведут себя в реальном мире. Кажется, статья больше нацелена на ресёрчеров, которым нужно бить бенчмарки, чтобы их статьи принимались в журналы.

С практической точки зрения, когда модели уже ездят в реальном городе, пользы в этих советах немного. По сути, единственный прикладной совет, — хорошие аугментации, которые позволяют политике быстрее найти нужные стейты, ускоряют сходимость. Весьма очевидная мысль, но всё равно было интересно пообщаться с автором.

#YaICML2026

Запомнил и рассказал ❣️ Иван Дубровин
404 driver not found
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍10❤‍🔥42🥰2🔥1
Три статьи об автономном транспорте с ICML 2026

Продолжаем рассказ о тематических работах на крупнейшей международной конференции по машинному обучению. Впечателниями делится наш коллега из команды автономного транспорта Иван Дубровин.

CoIRL-AD: Collaborative-Competitive Imitation-Reinforcement Learning in Latent World Models for Autonomous Driving

Авторы пытаются решить главную проблему imitation learning — выход модели в out of distribution под накапливающимся влиянием расхождений предсказанных и GT-траекторий. Предлагают решать это через объединение IL и RL, чтобы добавить в обучение exploration и расширить распределение, которое модель видела на обучении, что само по себе не новая идея.

Реализуют с помощью collaborative-competitive-сетапа. IL и RL политики — это две разные модели, которые обучаются параллельно и раз в какое-то количество шагов «соревнуются» на валидационном сете. Веса проигравшего заменяются на линейную комбинацию с весами победителя, и обучение продолжается. Выходы обеих моделей также используются для обучения latent world model, которая нужна для скоринга действий RL-агента.

RL при этом не совсем настоящий, потому что использует GT. В качестве реворда — произведение L2-отклонения от GT-траектории, умноженное на collision score. Это же произведение используют как главную метрику.

Замеры, судя по всему, только в OL.

Motion Planning in Compressed Representation Spaces

Авторы сводят задачу guided-планирования к жадному поиску по квантизированным латентным токенам:

• Обучают токенизатор траекторий, обусловленный на окружение, с reconstruction-лоссом.
• Поверх выходов энкодера делают софт-квантизацию, из чего получают набор латентных токенов.
• К латетным токенам применяют nested dropout — случайно отбрасывают хвосты случайной длины, чтобы форсить coarse-to-fine иерархическую структуру. В таком случае каждый префикс декодируется в полную траекторию, и можно делать жадный поиск.

На постере — пример получения траектории левого поворота из найденных жадно трёх токенов. В качестве критерия поиска используют максимизацию суммарного изменения heading влево.

У токенов получается фиксированная семантика, которая переносится в разные ситуации. Любая последовательность токенов декодируется в валидную тракеторию. В частности, команда поворота влево не будет работать, если поворота налево нет.

SafeDec: Constrained Decoding for Safe Autoregressive Generalist Robot Navigation Policies

Авторы заносят контур безопасности на этап декодирования траектории. Используя Signal Temporal Logic (формальный язык для описания требований к сигналам), руками задают правила, которым должны соответствовать траектории.

Для каждого следующего токена результирующая траектория проверяется на соответствие правилам. Если есть нарушение, то токен, который приведёт к невалидному стейту, полностью маскируется (hard constained decoding). Или перевзвешивается распределение (robust constrained decoding).

HCD помогает обеспечить 100% безопасность, но иногда приводит к отсутствию валидных токенов и снижает success rate. RCD даёт трейд-офф между соблюдением STL и успехом.

#YaICML2026

404 driver not found
11🔥7❤‍🔥6
Безопасность, ускорение end-to-end, prediction в частотной области: чем запомнился ещё один день ICML 2026

В этом году конференция продолжает бить собственные рекорды по количеству участников. В основной программе — 168 устных докладов и почти 5900 постеров.

Рассказываем о трёх классных постерах про АТ.

CorrectionPlanner: Self-Correction Planner with Reinforcement Learning in Autonomous Driving

Авторы предлагают архитектуру планера, которая умеет корректировать траекторию во время декодинга. Если голова-критик утверждает, что предложенный токен небезопасен, то он добавляется в список невалидных. Авторы называют его correction trace. На этот список обуславливается следующая, исправляющая генерация.

Перегенерация продолжается до тех пор, пока не найдётся валидный токен или не достигнется заданное максимальное количество коррекций. В последнем случае дефолтный токен — «продожать делать то, что делаем сейчас».

Претрейн делают через imitation learning, а потом замораживают его и используют для интерактивности агентов. В то же время саму модель дообучают реагировать на небезопасные роллауты через RL с положительным ревордом за прогресс и отрицательным — за столкновения.

AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture -of-Transformers for End-to-End Autonomous Driving

Работа об архитектуре для ускорения end-to-end за счёт разделения и асинхронного инференса медленного VLM reasoner и быстрого action expert.

Большую предобученную VLM-модель замораживают: инференсят независимо и асинхронно от action-модели, с которой их объединяет общий attention. Между тяжёлыми пересчётами латентов используют KV-кеш.

Авторы по сути показали, что необязательно дообучать VLM на специфику задачи автономного вождения — достаточно улучшить action-часть. И за счёт независимого асинхронного инференса action-эксперта значительно снизили latency.

TF-FACE: Time-Frequency Fusion Learning via Frequency-Domain Adaptive and Controllable Enhancement for Trajectory Prediction

В этой статье предлагают делать предикшн в частотной области вместо временной, потому что в ней естественным образом разделены:

• Низкочастотные составляющие — тренды. Например, движение вперед.
• Высокочастотные сигналы. Например, локальный обгон или уступание пешеходу.

Предлагают новую архитектуру, которую называют Gated Frequency Domain Attention Mechanism. Она прогоняет Q, K и V через преобразование Фурье и attention, адаптированный для комплексных чисел.

Утверждают, что такое разделение позволяет локальным пертурбациям не влиять на глобальную цель, которая содержится в тренде.

#YaICML2026

Собрал лучшее ❣️ Иван Дубровин
404 driver not found
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
12🔥7👍3🤩1
RadarDistill: Boosting Radar-based Object Detection Performance via Knowledge Distillation from LiDAR Features

Lidar-only детекторы работают заметно лучше, чем radar-only. Причиной тому — разница в качестве данных. Лидар фиксирует более точные и многочисленные точки, в то время как радар склонен выдавать false-positive и false-negative результаты из-за переотражений и других физических тонкостей. Улучшить работу radar-only детекторов можно благодаря дистилляции.

Сегодня разберём статью о том, как получить мощный radar-only детектор с помощью lidar-only детектора. Авторы предложили несколько способов продвинутой дистилляции, учитывающих разную природу лидарных и радарных данных.

Наивная дистилляция путём матчинга фичей лидарного энкодера в фичи радарного работает плохо. Это происходит из-за особенностей радарных и лидарных данных: разной плотности точек, зашумлённости, рассинхронизации сенсоров.

Авторы предлагают три способа улучшения дистилляции:

1. Cross-Modality Alignment. Использование небольшой FPN-like сетки поверх радарной фичамапы, чтобы сделать радарные фичи такими же плотными, как лидарные.

2. Activation-based Feature Distillation. Перевзвешивание лосса в областях фичамапы с ранней стадии энкодера, где есть амплитудные лидарные фичи, помогает акцентировать внимание нейросети на релевантных областях BEV-а.

3. Proposal-based Feature Distillation. Перевзвешивание лосса в областях фичамапы с поздней стадии энкодера позволяет сфокусировать внимание нейросети на областях с GT.

Полная архитектура RadarDistill — на схеме выше. Обратите внимание, что лидары используются только на этапе обучения и не требуются для инференса.

Использование всех трёх улучшений одновременно позволяет увеличить mAP в 2 раза и NDS в 1,25 раз на nuScenes относительно radar-only from scratch.

Разбор подготовил ❣️ Владимир Филипенко
404 driver not found
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥85❤‍🔥4👍2
FutrTrack: A Camera-LiDAR Fusion Transformer for 3D Multiple Object Tracking

Сегодня разберём работу о модульном фреймворке для трёхмерного трекинга множества объектов. Подход основан на совместном использовании трёх типов информации:

📌BEV-фичей, извлечённых из данных камер и LiDAR;
📌detection queries, полученных при уточнении 3D-детекций;
📌track queries, перенесённых с предыдущего кадра.

BEV-фичи вычисляют с помощью стандартного пайплайна BEVFusion.

Detection queries получают из отдельного блока smoother. Это энкодер-декодерная архитектура, обученная на вспомогательной задаче временного уточнения исходных 3D-детекций. Энкодер собирает для каждой детекции контекст по нескольким кадрам. Декодер уточняет положение, размеры и класс объекта.

При этом в основной трекер передаются не сами итоговые детекции, а извлечённые из промежуточного слоя object-query-представления, сформированные в процессе решения задачи уточнения. Они и становятся detection queries текущего кадра.

Track queries — промежуточные query-представления, сформированные основным трекинговым декодером на предыдущем кадре. Для подтверждённых активных треков модель сохраняет связанные с ними скрытые представления и передаёт их на следующий кадр. Таким образом, между кадрами переносятся не сами предсказанные боксы, а признаки, аккумулирующие информацию о положении, классе и идентичности каждого отслеживаемого объекта.

После независимого кодирования все три типа информации объединяются с помощью трансформера с multi-head attention. Track queries предыдущего кадра выступают в роли queries, detection queries текущего кадра — keys, а BEV-фичи — values. Благодаря этому модель сопоставляет активные треки с новыми детекциями и извлекает из BEV-представления необходимый пространственный и семантический контекст.

Декодер предсказывает обновлённые координаты, размеры, классы, идентификаторы и значения уверенности объектов. Промежуточные query-представления подтверждённых треков рекуррентно передаются на следующий кадр, поэтому непрерывность трекинга поддерживается без отдельной модели движения или фильтра.

Система заточена на модульность: можно менять способ получения BEV‑фич, а также подключать разные детекторы, обучая их независимо или совместно.

Авторы показывают, что FutrTrack превосходит предыдущие трансформерные методы по основным метрикам 3D-трекинга. При этом он всё ещё уступает SOTA-трекерам, основанным на гибридных пайплайнах, в которых обучаемые нейросетевые компоненты сочетаются с явно заданными моделями движения или ассоциации объектов.

Таким образом, полностью data-driven подход на основе трансформеров пока не демонстрирует устойчивого преимущества над системами, использующими геометрические и вероятностные ограничения. Особенно важными такие ограничения остаются в ситуациях с неполными или неоднозначными наблюдениями. Например, при длительных перекрытиях, пропусках детекций или в плотном трафике.

Разбор подготовил ❣️ Олег Данилин
404 driver not found
Please open Telegram to view this post
VIEW IN TELEGRAM
13❤‍🔥5👍4🔥1
Long-Range 3D Perception — датасет и методы детекции отдалённых объектов

Сегодня вас ждёт подборка статей на тему детекции отдалённых объектов. Это важная задача, поскольку на скорости 100 км/ч автомобиль проезжает ~28 м/с, поэтому для безопасного торможения и перестроения нужно видеть препятствия на расстоянии 150–200 метров, а классические бенчмарки такую дальность обрезают. NuScenes размечен до 50–80 м, KITTI — до 70 м.

Дальние объекты — это отдельная боль: у лидара на 150 метрах на объект остаются единицы точек, на камере он занимает десятки пикселей, и в датасетах таких объектов на порядки меньше ближних, из-за чего модели переобучаются на ближнюю зону. Поэтому начнём с датасета — здесь лучше всего подходит Argoverse 2. Он содержит 1000 размеченных картиночных сцен с семью камерами, объекты размечены на удалении до 200 метров. Каждая сцена длится 30 секунд, частота — 20 fps. Датасет размечен по 30 категориям, причём почти все категории имеют более 10 000 боксов. Лидар работает на 10 Гц.

Основные методы для детекции отдалённых объектов:

LiDAR-only
FSD, FSDv2 — полностью sparse lidar-only модели. Основная идея: собрать точки в группы (соответствующие объектам) и процессить эти группы отдельно. Внутри каждой группы точки предсказывают центры объектов, которые далее используются для предсказания бокса. В v2 кластеризация в группы заменена на работу с виртуальными вокселями (локальное объединение точек). Основные результаты представлены на Argoverse 2 до 200 метров. FSDv2 показывает результаты, близкие к SoTA c latency < 100ms.

Camera-only (Far3D)
Far3Det — чтобы построить модель для отдалённых объектов, авторы решили «почистить» датасет NuScenes от сцен с неполной разметкой, оставив только те, в которых размечены все объекты вплоть до 80 метров. Также предложили вариант адаптивного NMS (AdaNMS) для изменения IoU threshold в зависимости от расстояния.

Far3D — SoTA на NuScenes в сетапе camera-only на момент публикации. Результаты на Argoverse 2 похуже, чем у FSDv2, но это sparse camera-only модель. На основе StreamPETR построена модель, в которой используются адаптивные query. Для их генерации на этапе LSS лучи кидаются на основе 2D-детекций.

Fusion
Towards Long-Range 3D Object Detection for Autonomous Vehicles — статья с двумя улучшениями для детекции отдалённых объектов. Во-первых, это использование двух отдельных сетей для ближних (до 110 м) и отдалённых (от 100 м) объектов с фьюзом детектов на пересечении. Во-вторых, авторы используют Multimodal Virtual Point для генерации псевдолидарных точек на основе 2D Instance Segmentation. Результаты посчитаны для Argoverse 2: каждый из фиксов улучшает FSDv2;

SparseFusion — по сути является sparse-версией BEVFusion. Для обеспечения разреженности все свёрточные операции заменены на sparse. На этапе LSS берутся только top K расстояний из распределения вдоль лучей. Сами лучи кидаются только внутри боксов 2D-детекций. Результаты сравниваются на Argoverse 2. По метрикам SparseFusion немного переигрывает BEVFusion, при этом по latency метод более чем в три раза быстрее. Но на срезе 100–200 метров результаты у BEVFusion чуть лучше.

Что в итоге выбрать?
• LiDAR-only — FSDv2: результаты близкие к SoTA на Argoverse 2 при latency < 100 мс, самый практичный вариант для продакшена.
• Camera-only — Far3D: SoTA на nuScenes, но на Argoverse 2 заметно уступает лидарным методам — камер пока недостаточно для надёжной детекции на 200 м.
• Fusion — SparseFusion: в 3+ раза быстрее BEVFusion при сопоставимом качестве, но на срезе 100–200 м dense-подход всё ещё чуть точнее — на дальности разреженность даёт о себе знать.

Общий тренд хорошо виден: работают sparse-архитектуры вкупе с адаптивными приёмами (AdaNMS, адаптивные query, отдельные головы для разных дальностей). А среди датасетов Argoverse 2 с разметкой до 200 м фактически стал стандартом для long-range задач.

Разбор подготовил ❣️ Иван Лунев
404 driver not found
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥85🔥5👍2
LISO: Lidar-only Self-Supervised 3D Object Detection

Разметка 3D-боксов очень дорогая, долгая и плохо масштабируется. А сырых LiDAR-логов, наоборот, очень много. Сегодня разберём статью о том, как использовать лидарные данные о движении объектов для разметки.

Сначала авторы готовят начальную разметку. Пайплайн такой:

1. По соседним LiDAR-кадрам считают ego motion — движение эго-агента.
2. Вычисляют scene flow — движение каждой точки между кадрами.
3. Вычитают ego motion из scene flow, чтобы получить residual motion — относительное движение.
4. Точки с ненулевым residual motion считают движущимися объектами.
5. Кластеризуют точки с ненулевым residual motion и собирают их в 3D-боксы.
6. Следят, как перемещаются боксы с течением времени, и чистят шум — так получается начальная разметка.

Следующий этап — итеративный self-training. Модель-детектор обучают на полученной разметке и прогоняют по начальной разметке, чтобы получить новые боксы. Потом снова строят треки, фильтруют шум, улучшают разметку и обновляют псевдо-GT. Обучение повторяется до тех пор, пока и псевдо-разметка и сама модель не улучшатся до требуемых пределов.

Хотя начальная разметка содержит только движущиеся объекты, детектор обучается на single-frame point cloud — поэтому постепенно начинает находить и способные двигаться объекты. Например, припаркованные машины. То есть движение используется только как bootstrap-сигнал, а дальше модель дообучается по геометрии сцены.

На момент публикации LISO стабильно обгонял другие self-supervised-подходы на WOD, KITTI, AV2 и nuScenes, хотя до fully-supervised-моделей ему ещё было куда расти.

Разбор подготовил ❣️ Фарух Яушев
404 driver not found
Please open Telegram to view this post
VIEW IN TELEGRAM
9🔥4🤩2❤‍🔥1