Генерация реального города Seoul World Model, memory bias в RL, совместное обучение VLA и WM: что обсуждают на ICML 2026 [1/2]
6 июля в Южной Корее стартовала одна из крупнейших конференций о машинном обучении — ICML. Участников очень много, работы охватывают самые разные тематики. Личным топом выступлений и постеров, полезных для автономного транспорта, делится наш коллега Иван Дубровин.
Seoul World Model
На Expo Talk авторы из Naver рассказали, как используют RAG поверх фотографий street view, чтобы генерировать настоящий Сеул, а не вооображать что-то похожее. Это позволяет эффективно обучаться, не запоминая весь мир, а также использовать постоянно обновляющиеся данные из карт без полного переобучения. Основной фокус — неперывная генерация на километровых масштабах.
На вход инференс получает глобальные координаты и текстовый промпт с описанием. В презентации приводили примеры генераций с разной погодой и временем суток, которые выглядели весьма правдоподобно, а также с наводнением, НЛО и Годзиллой, которые, ожидаемо, выглядели как кринж.
Во время инференса модель обращается к геобазе с картинками: проецирует виды на нужное положение камеры и использует их как основу для генерации. Чтобы бороться с окклюзиями, используют наборы фотографий, разнесённых во времени. Окружающие машины пока что просто бэкграунд, их ни на что не кондишнят.
Из зала спрашивали про SWM для обучения self-driving VLA моделей, но авторы подчеркнули, что пока сосредоточены на реалистичности и бесшовной генерации для больших расстояний.
Красиво, но хотелось бы больше деталей реализации.
Investigating Memory in RL with POPGym Arcade
Исследование моделей с памятью в MDP- и POMDP-сетапах. Для экспериментов авторы воссоздали на JAX популярные игрушечные среды с возможностью переключаться между полной и частичной наблюдаемостью.
Основной вывод — в полностью наблюдаемых средах, где вся информация содержится в последнем кадре, модели с памятью тратят капасити на историю и теряют из-за этого качество в настоящем. Авторы называют этот эффект memory bias.
Яркий пример: добавление шума в наблюдение 50 степов в прошлом значительно изменяет распределение на выходе. Другими словами, наблюдение out of distribution может заметно влиять на предсказания, пока остаётся в контексте.
DDP-WM: Disentangled Dynamics Prediction for Efficient World Models
Тоже не совсем про автономный транспорт, но уже ближе. Авторы оптимизируют WM для планирования роборуки через MPC.
Текущие SOTA-подходы применяют self-attention на все визуальные токены, не учитывая, происходит ли в соответствующих регионах какая-либо динамика. При этом динамика обычно содержится довольно разреженно.
Авторы предлагают добавить легковесный ViT, который предсказыват бинарную маску изменяющихся регионов. Основной тяжёлый трансформер работает только на «интересных» токенах, а с остальными потом считается cross-attention для восстановления деталей. Показывают бенчмарки, побитые как по скорости (вплоть до x9,2!), так и по точности.
В следующей части обзора обсудим ещё две яркие работы.
#YaICML2026
Запомнил и рассказал❣️ Иван Дубровин
404 driver not found
6 июля в Южной Корее стартовала одна из крупнейших конференций о машинном обучении — ICML. Участников очень много, работы охватывают самые разные тематики. Личным топом выступлений и постеров, полезных для автономного транспорта, делится наш коллега Иван Дубровин.
Seoul World Model
На Expo Talk авторы из Naver рассказали, как используют RAG поверх фотографий street view, чтобы генерировать настоящий Сеул, а не вооображать что-то похожее. Это позволяет эффективно обучаться, не запоминая весь мир, а также использовать постоянно обновляющиеся данные из карт без полного переобучения. Основной фокус — неперывная генерация на километровых масштабах.
На вход инференс получает глобальные координаты и текстовый промпт с описанием. В презентации приводили примеры генераций с разной погодой и временем суток, которые выглядели весьма правдоподобно, а также с наводнением, НЛО и Годзиллой, которые, ожидаемо, выглядели как кринж.
Во время инференса модель обращается к геобазе с картинками: проецирует виды на нужное положение камеры и использует их как основу для генерации. Чтобы бороться с окклюзиями, используют наборы фотографий, разнесённых во времени. Окружающие машины пока что просто бэкграунд, их ни на что не кондишнят.
Из зала спрашивали про SWM для обучения self-driving VLA моделей, но авторы подчеркнули, что пока сосредоточены на реалистичности и бесшовной генерации для больших расстояний.
Красиво, но хотелось бы больше деталей реализации.
Investigating Memory in RL with POPGym Arcade
Исследование моделей с памятью в MDP- и POMDP-сетапах. Для экспериментов авторы воссоздали на JAX популярные игрушечные среды с возможностью переключаться между полной и частичной наблюдаемостью.
Основной вывод — в полностью наблюдаемых средах, где вся информация содержится в последнем кадре, модели с памятью тратят капасити на историю и теряют из-за этого качество в настоящем. Авторы называют этот эффект memory bias.
Яркий пример: добавление шума в наблюдение 50 степов в прошлом значительно изменяет распределение на выходе. Другими словами, наблюдение out of distribution может заметно влиять на предсказания, пока остаётся в контексте.
DDP-WM: Disentangled Dynamics Prediction for Efficient World Models
Тоже не совсем про автономный транспорт, но уже ближе. Авторы оптимизируют WM для планирования роборуки через MPC.
Текущие SOTA-подходы применяют self-attention на все визуальные токены, не учитывая, происходит ли в соответствующих регионах какая-либо динамика. При этом динамика обычно содержится довольно разреженно.
Авторы предлагают добавить легковесный ViT, который предсказыват бинарную маску изменяющихся регионов. Основной тяжёлый трансформер работает только на «интересных» токенах, а с остальными потом считается cross-attention для восстановления деталей. Показывают бенчмарки, побитые как по скорости (вплоть до x9,2!), так и по точности.
В следующей части обзора обсудим ещё две яркие работы.
#YaICML2026
Запомнил и рассказал
404 driver not found
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥12❤4⚡3
Генерация реального города Seoul World Model, memory bias в RL, совместное обучение VLA и WM: что обсуждают на ICML 2026 [2/2]
Продолжаем всё ближе подбираться к автономному транспорту в продолжении обзора работ с ICML, которая прямо сейчас продолжается в Сеуле.
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision–Language–Action for Autonomous Driving
К сожалению, не получилось пообщаться с авторами. В статье они предлагают совместно обучать VLA- и WM-модели, чтобы у них был общий latent state. То есть, чтобы можно было генерировать потенциальные развития событий без вычислительно тяжелых пиксельных симуляций.
Обучают в три этапа.
1. Совместно VLA и VM: с маппингом картинок c камер, текстовых инструкций и BEV в общее пространство фичей, из которого параллельно предсказывают будущие BEV и действия эго.
2. Энкодер и action-голова замораживаются, обучается генерация будущих стейтов, обусловленная на действие.
3. Размораживается action-голова, и добавляется reward-модель, которая учится скорить будущие стейты по предложенным действиям.
В итоге получается попытка сделать модель, которая «представляет» потенциальные развития событий и выбирает наиболее подходящее действие.
Position: RL Researchers Need to Distinguish Between Solving Simulators and Using Simulators as a Proxy
Интересная position-статья с весьма очевидным названием, в котором авторы напоминают RL-щикам про разницу между «решением симулятора» и «использованием симулятора как прокси».
Иными словами: политики, хакнувшие реворд, плохо ведут себя в реальном мире. Кажется, статья больше нацелена на ресёрчеров, которым нужно бить бенчмарки, чтобы их статьи принимались в журналы.
С практической точки зрения, когда модели уже ездят в реальном городе, пользы в этих советах немного. По сути, единственный прикладной совет, — хорошие аугментации, которые позволяют политике быстрее найти нужные стейты, ускоряют сходимость. Весьма очевидная мысль, но всё равно было интересно пообщаться с автором.
#YaICML2026
Запомнил и рассказал❣️ Иван Дубровин
404 driver not found
Продолжаем всё ближе подбираться к автономному транспорту в продолжении обзора работ с ICML, которая прямо сейчас продолжается в Сеуле.
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision–Language–Action for Autonomous Driving
К сожалению, не получилось пообщаться с авторами. В статье они предлагают совместно обучать VLA- и WM-модели, чтобы у них был общий latent state. То есть, чтобы можно было генерировать потенциальные развития событий без вычислительно тяжелых пиксельных симуляций.
Обучают в три этапа.
1. Совместно VLA и VM: с маппингом картинок c камер, текстовых инструкций и BEV в общее пространство фичей, из которого параллельно предсказывают будущие BEV и действия эго.
2. Энкодер и action-голова замораживаются, обучается генерация будущих стейтов, обусловленная на действие.
3. Размораживается action-голова, и добавляется reward-модель, которая учится скорить будущие стейты по предложенным действиям.
В итоге получается попытка сделать модель, которая «представляет» потенциальные развития событий и выбирает наиболее подходящее действие.
Position: RL Researchers Need to Distinguish Between Solving Simulators and Using Simulators as a Proxy
Интересная position-статья с весьма очевидным названием, в котором авторы напоминают RL-щикам про разницу между «решением симулятора» и «использованием симулятора как прокси».
Иными словами: политики, хакнувшие реворд, плохо ведут себя в реальном мире. Кажется, статья больше нацелена на ресёрчеров, которым нужно бить бенчмарки, чтобы их статьи принимались в журналы.
С практической точки зрения, когда модели уже ездят в реальном городе, пользы в этих советах немного. По сути, единственный прикладной совет, — хорошие аугментации, которые позволяют политике быстрее найти нужные стейты, ускоряют сходимость. Весьма очевидная мысль, но всё равно было интересно пообщаться с автором.
#YaICML2026
Запомнил и рассказал
404 driver not found
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍9❤🔥4❤2🥰2🔥1
Три статьи об автономном транспорте с ICML 2026
Продолжаем рассказ о тематических работах на крупнейшей международной конференции по машинному обучению. Впечателниями делится наш коллега из команды автономного транспорта Иван Дубровин.
#YaICML2026
404 driver not found
Продолжаем рассказ о тематических работах на крупнейшей международной конференции по машинному обучению. Впечателниями делится наш коллега из команды автономного транспорта Иван Дубровин.
CoIRL-AD: Collaborative-Competitive Imitation-Reinforcement Learning in Latent World Models for Autonomous Driving
Авторы пытаются решить главную проблему imitation learning — выход модели в out of distribution под накапливающимся влиянием расхождений предсказанных и GT-траекторий. Предлагают решать это через объединение IL и RL, чтобы добавить в обучение exploration и расширить распределение, которое модель видела на обучении, что само по себе не новая идея.
Реализуют с помощью collaborative-competitive-сетапа. IL и RL политики — это две разные модели, которые обучаются параллельно и раз в какое-то количество шагов «соревнуются» на валидационном сете. Веса проигравшего заменяются на линейную комбинацию с весами победителя, и обучение продолжается. Выходы обеих моделей также используются для обучения latent world model, которая нужна для скоринга действий RL-агента.
RL при этом не совсем настоящий, потому что использует GT. В качестве реворда — произведение L2-отклонения от GT-траектории, умноженное на collision score. Это же произведение используют как главную метрику.
Замеры, судя по всему, только в OL.
Motion Planning in Compressed Representation Spaces
Авторы сводят задачу guided-планирования к жадному поиску по квантизированным латентным токенам:
• Обучают токенизатор траекторий, обусловленный на окружение, с reconstruction-лоссом.
• Поверх выходов энкодера делают софт-квантизацию, из чего получают набор латентных токенов.
• К латетным токенам применяют nested dropout — случайно отбрасывают хвосты случайной длины, чтобы форсить coarse-to-fine иерархическую структуру. В таком случае каждый префикс декодируется в полную траекторию, и можно делать жадный поиск.
На постере — пример получения траектории левого поворота из найденных жадно трёх токенов. В качестве критерия поиска используют максимизацию суммарного изменения heading влево.
У токенов получается фиксированная семантика, которая переносится в разные ситуации. Любая последовательность токенов декодируется в валидную тракеторию. В частности, команда поворота влево не будет работать, если поворота налево нет.
SafeDec: Constrained Decoding for Safe Autoregressive Generalist Robot Navigation Policies
Авторы заносят контур безопасности на этап декодирования траектории. Используя Signal Temporal Logic (формальный язык для описания требований к сигналам), руками задают правила, которым должны соответствовать траектории.
Для каждого следующего токена результирующая траектория проверяется на соответствие правилам. Если есть нарушение, то токен, который приведёт к невалидному стейту, полностью маскируется (hard constained decoding). Или перевзвешивается распределение (robust constrained decoding).
HCD помогает обеспечить 100% безопасность, но иногда приводит к отсутствию валидных токенов и снижает success rate. RCD даёт трейд-офф между соблюдением STL и успехом.
#YaICML2026
404 driver not found
❤10🔥7❤🔥6
Безопасность, ускорение end-to-end, prediction в частотной области: чем запомнился ещё один день ICML 2026
В этом году конференция продолжает бить собственные рекорды по количеству участников. В основной программе — 168 устных докладов и почти 5900 постеров.
Рассказываем о трёх классных постерах про АТ.
CorrectionPlanner: Self-Correction Planner with Reinforcement Learning in Autonomous Driving
Авторы предлагают архитектуру планера, которая умеет корректировать траекторию во время декодинга. Если голова-критик утверждает, что предложенный токен небезопасен, то он добавляется в список невалидных. Авторы называют его correction trace. На этот список обуславливается следующая, исправляющая генерация.
Перегенерация продолжается до тех пор, пока не найдётся валидный токен или не достигнется заданное максимальное количество коррекций. В последнем случае дефолтный токен — «продожать делать то, что делаем сейчас».
Претрейн делают через imitation learning, а потом замораживают его и используют для интерактивности агентов. В то же время саму модель дообучают реагировать на небезопасные роллауты через RL с положительным ревордом за прогресс и отрицательным — за столкновения.
AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture -of-Transformers for End-to-End Autonomous Driving
Работа об архитектуре для ускорения end-to-end за счёт разделения и асинхронного инференса медленного VLM reasoner и быстрого action expert.
Большую предобученную VLM-модель замораживают: инференсят независимо и асинхронно от action-модели, с которой их объединяет общий attention. Между тяжёлыми пересчётами латентов используют KV-кеш.
Авторы по сути показали, что необязательно дообучать VLM на специфику задачи автономного вождения — достаточно улучшить action-часть. И за счёт независимого асинхронного инференса action-эксперта значительно снизили latency.
TF-FACE: Time-Frequency Fusion Learning via Frequency-Domain Adaptive and Controllable Enhancement for Trajectory Prediction
В этой статье предлагают делать предикшн в частотной области вместо временной, потому что в ней естественным образом разделены:
• Низкочастотные составляющие — тренды. Например, движение вперед.
• Высокочастотные сигналы. Например, локальный обгон или уступание пешеходу.
Предлагают новую архитектуру, которую называют Gated Frequency Domain Attention Mechanism. Она прогоняет Q, K и V через преобразование Фурье и attention, адаптированный для комплексных чисел.
Утверждают, что такое разделение позволяет локальным пертурбациям не влиять на глобальную цель, которая содержится в тренде.
#YaICML2026
Собрал лучшее❣️ Иван Дубровин
404 driver not found
В этом году конференция продолжает бить собственные рекорды по количеству участников. В основной программе — 168 устных докладов и почти 5900 постеров.
Рассказываем о трёх классных постерах про АТ.
CorrectionPlanner: Self-Correction Planner with Reinforcement Learning in Autonomous Driving
Авторы предлагают архитектуру планера, которая умеет корректировать траекторию во время декодинга. Если голова-критик утверждает, что предложенный токен небезопасен, то он добавляется в список невалидных. Авторы называют его correction trace. На этот список обуславливается следующая, исправляющая генерация.
Перегенерация продолжается до тех пор, пока не найдётся валидный токен или не достигнется заданное максимальное количество коррекций. В последнем случае дефолтный токен — «продожать делать то, что делаем сейчас».
Претрейн делают через imitation learning, а потом замораживают его и используют для интерактивности агентов. В то же время саму модель дообучают реагировать на небезопасные роллауты через RL с положительным ревордом за прогресс и отрицательным — за столкновения.
AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture -of-Transformers for End-to-End Autonomous Driving
Работа об архитектуре для ускорения end-to-end за счёт разделения и асинхронного инференса медленного VLM reasoner и быстрого action expert.
Большую предобученную VLM-модель замораживают: инференсят независимо и асинхронно от action-модели, с которой их объединяет общий attention. Между тяжёлыми пересчётами латентов используют KV-кеш.
Авторы по сути показали, что необязательно дообучать VLM на специфику задачи автономного вождения — достаточно улучшить action-часть. И за счёт независимого асинхронного инференса action-эксперта значительно снизили latency.
TF-FACE: Time-Frequency Fusion Learning via Frequency-Domain Adaptive and Controllable Enhancement for Trajectory Prediction
В этой статье предлагают делать предикшн в частотной области вместо временной, потому что в ней естественным образом разделены:
• Низкочастотные составляющие — тренды. Например, движение вперед.
• Высокочастотные сигналы. Например, локальный обгон или уступание пешеходу.
Предлагают новую архитектуру, которую называют Gated Frequency Domain Attention Mechanism. Она прогоняет Q, K и V через преобразование Фурье и attention, адаптированный для комплексных чисел.
Утверждают, что такое разделение позволяет локальным пертурбациям не влиять на глобальную цель, которая содержится в тренде.
#YaICML2026
Собрал лучшее
404 driver not found
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤11🔥7👍3🤩1
This media is not supported in your browser
VIEW IN TELEGRAM
Вас посетил маленький, но очень громкий робот-рекламщик
Время сделать перерыв. Например, перечитать один из наших обзоров ICML 2026:
➡️ Генерация реального города Seoul World Model, memory bias в RL, совместное обучение VLA и WM: что обсуждают на ICML 2026 [1/2]
➡️ Генерация реального города Seoul World Model, memory bias в RL, совместное обучение VLA и WM: что обсуждают на ICML 2026 [2/2]
➡️ Три статьи об автономном транспорте с ICML 2026
➡️ Безопасность, ускорение end-to-end, prediction в частотной области: чем запомнился ещё один день ICML 2026
#YaICML2026
Поймал в объектив робота-рекламщика и лучшие моменты ICML 2026❣️ Иван Дубровин
404 driver not found
Время сделать перерыв. Например, перечитать один из наших обзоров ICML 2026:
#YaICML2026
Поймал в объектив робота-рекламщика и лучшие моменты ICML 2026
404 driver not found
Please open Telegram to view this post
VIEW IN TELEGRAM
❤10🥰5🔥4🤩2