На этой неделе в Сеуле прошла ICML 2026 — одна из сильнейших мировых конференций в области машинного обучения (категория А*).
KAGE-Bench: Fast Known-Axis Visual Generalization Evaluation for Reinforcement Learning — бенчмарк для быстрой и прозрачной оценки того, как алгоритмы обучения с подкреплением обобщают визуальные признаки по заданным осям (цвет, фон, форма объектов).
Авторы: Егор Черепанов, Даниил Зелезецкий, Алексей Ковалёв, Александр Панов.
Don’t Blind Your VLA: Aligning Visual Representations for OOD Generalization — метод выравнивания визуальных представлений, который заметно повышает устойчивость Vision-Language-Action моделей к данным вне распределения (out-of-distribution).
Авторы: Никита Качаев, Михаил Колосов, Даниил Зелезецкий, Алексей Ковалёв, Александр Панов.
VLA Grounder: Language-Conditioning Space Optimization for Black-Box VLA Models — подход к улучшению поведения уже обученных VLA-моделей за счёт оптимизации языковых условий в скрытом пространстве — без доступа к внутренним весам модели.
Авторы: Дамир Шодиев, Алексей Староверов, Никита Качаев, Алексей Ковалёв, Александр Панов.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥23❤9
Собрали для вас подборку свежих статей и разработок — от генерации 3D-сцен до новых подходов к вниманию в нейросетях и организации научного поиска.
3D и Генерация сцен
Метод Sage от команды NVIDIA — генерацию интерактивных 3D-сцен с помощью LLM/VLM тул-коллинга на базе Open3D (ранее упоминался как QUEN3-VL). В отличие от статичных мешей, объекты загружаются в Isaac Sim как интерактивные. Бонусом идет мощный датасет: 10 тыс. сцен, 50 типов комнат, более 500 тыс. уникальных объектов!
🔗 nvlabs.github.io/sage/ | arxiv.org/abs/2602.10116
ИИ для Науки
ORKG ASK — нейро-символическая система для поиска и анализа научной литературы. Она строит графы знаний из статей, чтобы отвечать на вопросы исследователей точнее обычного поиска.
🔗 arxiv.org/abs/2512.16425
RL и Рассуждения
Статья «Back to Basics» — про проблему исследования (exploration) в Reinforcement Learning для улучшения рассуждений LLM. Авторы предлагают пересмотреть генеративные вероятности для более эффективного RLVR.
🔗 arxiv.org/abs/2602.05281
Оптимизация архитектур
В Zyphra предложили Online Vector-Quantized Attention — модификацию векторного квантования, которая учит словарь «думать на лету». Вместо статичного словаря, который дает ошибки на новых данных, здесь каждый новый токен обновляет только один ближайший центроид. Это разреженное обновление защищает от забывания и сохраняет точность внимания.
🔗 arxiv.org/abs/2602.03922
Please open Telegram to view this post
VIEW IN TELEGRAM
❤11
Наш сотрудник Олег Буличев защитил свой проект TerraCognitaSLAM на программе Трансляционных Исследований от Центрального Университета. Проект родился благодаря участию Олега в археологическом конкурсе — он увидел пробел в технологиях и решил его закрыть.
TerraCognitaSLAM — это система навигации для роботов там, где GPS не работает: под кронами садов, в плотной застройке, на однородных полях. Вместо одного сенсора — связка георадара (видит под землёй), камер и инерциальных датчиков. Это позволяет агророботам работать в зонах глушения и картировать почву, а инженерам — искать трубы и провода без ручного труда.
Команда Олега уже провела полевые испытания, собрала синхронный датасет с эталонными GPS-позами, а решение отметили на конкурсе «Экспедиция.Земля». Экономия для хозяйств — до 2,6 млн ₽ на трактор в год, а предотвращение аварий на стройке — миллионы рублей.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥24❤10👏6👍1
🦾 — Запускаем дополнительный набор в магистратуру ФПМИ МФТИ по искусственному интеллекту и робототехнике!
Поступление проходит по 2 направлениям:
— “Фундаментальные методы искусственного интеллекта” – база ЦКМ, 25 мест
— “Мультимодальный искусственный интеллект”– база Институт AIRI, 10 мест
Для поступления необходимо:
🪼 Заполнить заявку на нашем в форме до 12:00 28 июля и пройти собеседование в Центре.
🪼 Подать документы на сайте приёмной комиссии МФТИ до 31 июля и успешно пройти вступительные испытания.
В Центре под руководством ведущих специалистов в своих областях вы сможете заниматься написанием статей на передовые конференции А* (NeurIPS, ICLR, ICML, IJCAI и др.), а также работать над прикладными проектами по тематикам:
🪼 После заполнения мы пригласим вас на собеседование. Рассылка со слотами, на которые можно будет записаться, будет отправлена 28 июля в 13:00 по почте!
🪼 Если вы уже заполняли форму, но не успели пройти собеседование, заполните форму повторно
Информация для поступающих есть на сайтах ЦКМ и приёмной комиссии.
Поступление проходит по 2 направлениям:
— “Фундаментальные методы искусственного интеллекта” – база ЦКМ, 25 мест
— “Мультимодальный искусственный интеллект”– база Институт AIRI, 10 мест
Для поступления необходимо:
В Центре под руководством ведущих специалистов в своих областях вы сможете заниматься написанием статей на передовые конференции А* (NeurIPS, ICLR, ICML, IJCAI и др.), а также работать над прикладными проектами по тематикам:
Программа по направлениям:
Общие курсы (1 семестр):
- Компьютерная лингвистика и обработка естественного языка
- Основы когнитивной психологии
- Методы общего искусственного интеллекта
- Нейросетевые фреймворки глубокого обучения
- Программные средства для задач искусственного интеллекта (2 практики)
- Методы искусственного интеллекта в анализе данных
- Научный семинар
Фундаментальные методы искусственного интеллекта (2 и 3 семестры):
- Новые нейросетевые архитектуры и продвинутые методы обработки естественного языка
- Продвинутые методы компьютерного зрения
- Введение в когнитивную нейронауку
- Продвинутые методы машинного обучения с подкреплением
- Интеллектуальная робототехника
- Нейроморфные вычесления
- Мультимодальные и поведенческие модели
лекции
Фундаментальные методы искусственного интеллекта. Мультимодальный искусственный интеллект (2 и 3 семестры):
- Введение в мультиагентные системы на основе LLM: от теории к практике
- Visual Generative AI (Современные методы генерации визуальных данных)
- Современные подходы проектирования рекомендательных систем
- Малоранговые тензорные методы
- LLM агенты
- Машинное обучение в задачах стурктурной биологии
Информация для поступающих есть на сайтах ЦКМ и приёмной комиссии.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9❤1
В администрации Долгопрудного прошло совещание по запуску беспилотного общественного транспорта в городе. Ключевыми технологическими центрами проекта стали сотрудники ЦКМ Института ИИ МФТИ и МАДИ — наша объединённая команда уже располагает комплексом разработок для автономного управления.
Команда планирует развивать и интегрировать целый комплекс модулей: распознавание и прогнозирование поведения окружающих объектов, распознавание сигналов светофоров, систему интеллектуальной навигации, а также технологии мониторинга пассажирского салона, включая обнаружение забытых предметов. Отдельное внимание уделяется тому, чтобы максимально использовать уже имеющуюся бортовую инфраструктуру автобусов и дополнять её необходимыми сенсорами, в том числе лидарами.
«У Института уже есть практический опыт создания систем автономного транспорта. Совместно с коллегами из МАДИ специалисты МФТИ разработали и испытали беспилотный автомобиль на базе электрической «Газели», для которого команда Физтеха создавала систему высокоточной локализации и ряд алгоритмов автономного управления. Решение прошло серию испытаний, а накопленные технологии и программные модули теперь могут быть адаптированы для более сложной задачи — беспилотных пассажирских перевозок»,
— заведующий лабораторией интеллектуального транспорта ЦКМ Дмитрий Юдин.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤25👍4🔥4
Ранее мы уже рассказывали о том, как команда TerraCognitaBot Олега Буличева разработывала решение для археологических раскопок в рамках конкурса Up Great «Экспедиция.Земля». Была проделана большая работа и мы готовы поделиться с вами результатами!
Нас обошли только крупные коммерческие компании с бóльшими ресурсами и опытом.
Для команды ЦКМ это отличный результат, подтверждающий, что наши разработки конкурентоспособны и против крупных индустриальных игроков. Но мы знаем, что это не предел, поддержите команду реакциями!
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥18👏4❤3
Пришли новости с ведущей конференции по обработке естественного языка — EMNLP 2026 (A*), которая состоится в Будапеште. У нашего Центра сразу несколько принятых работ!
Среди авторов: Юрий Куратов, Айдар Булатов
Про развитие линейки RMT-моделей в кооперации с коллегами из MBUZAI. Работа с историей — и она того стоила.
Среди авторов: Алексей Ковалёв, Дамир Шодиев, Алексей Староверов, Никита Качаев
Про ремпромпт VLA-моделей. Работа успела отметиться на воркшопе ICML и с первого раза прошла на конференцию!
Среди авторов: Алексей Ковалёв, Никита Качаев
Про смещённость знаний в VLA-моделях.
Среди авторов: Алсу Сагирова
Про мультиагентную эстафету для решения задач олимпиадного программирования.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤26
Собрали для вас подборку свежих инструментов и статей — от альтернатив ROS2 до генерации схем для научных статей. Смотрим, анализируем, берём в работу.
Физический ИИ от прототипа до продакшена
Foxglove.dev — аналог Rerun.io для визуализации и отладки робототехнических систем. Удобный инструмент, чтобы смотреть данные с сенсоров в реальном времени и не терять время на самописные дашборды.
🔗 foxglove.dev | docs.foxglove.dev
DORA RS: 100% Rust для роботов
Агентная архитектура с потоками данных. В 10–17 раз быстрее ROS2 благодаря zero-copy shared memory, 4 паттерна коммуникации и production-ready fault tolerance. Если вы устали от ROS — присмотритесь.
🔗 dora-rs.ai | github.com/dora-rs/dora
PaperBanana: генерация схем для статей
Независимая реализация метода для автоматической генерации академических иллюстраций. Помогает быстро сделать схему метода, не тратя часы на визуализацию вручную.
🔗 github.com/llmsresearch/paperbanana | arxiv.org/abs/2601.23265
Семантический RL для VLA
Adapting Generalist Robot Policies with Semantic Reinforcement Learning — для тех, кто следит за развитием VLA-моделей и обобщением политик.
🔗 arxiv.org/abs/2606.31958
Графы опыта для самоулучшающихся агентов
Experience Graphs: The Data Foundation for Self-Improving Agents. Как структурировать опыт агента, чтобы он учился на своих же действиях.
🔗 arxiv.org/abs/2606.29823
Please open Telegram to view this post
VIEW IN TELEGRAM
❤8🔥6👍4
Симуляция становится промышленной инфраструктурой.
#партнёрский_пост
Бизнес-школа МФТИ — о том, как принципы работы с симуляторами в робототехнике перекликаются с подходами к стратегическому планированию.
В робототехнике симулятор используют для обучения алгоритмов управления до переноса на физическую машину. Это ускоряет разработку, однако создаёт проблему sim‑to‑real: робот успешно работает в модели, затем сталкивается с другой динамикой в реальности.
Показательный пример — калибровка коллегами из МФТИ привода антропоморфного робота в дифференцируемом симуляторе MuJoCo. Настройка параметров трения и инерции по данным энкодера и истории управляющих команд заняла около полутора минут и снизила ошибку положения на 64% — без дополнительных датчиков и дорогих стендов.
В этой логике физический робот поставляет данные для калибровки цифрового двойника, а основной объём экспериментов проводится в симуляции. Так симулятор становится частью инженерного контура — от его достоверности зависит качество управления и успех проекта.
Похожий принцип используется сейчас в «Третьей ступени»: сначала строится модель новой индустрии и проверяется стратегическая ставка, затем она переводится в план реальных действий.
#партнёрский_пост
Бизнес-школа МФТИ — о том, как принципы работы с симуляторами в робототехнике перекликаются с подходами к стратегическому планированию.
В робототехнике симулятор используют для обучения алгоритмов управления до переноса на физическую машину. Это ускоряет разработку, однако создаёт проблему sim‑to‑real: робот успешно работает в модели, затем сталкивается с другой динамикой в реальности.
Показательный пример — калибровка коллегами из МФТИ привода антропоморфного робота в дифференцируемом симуляторе MuJoCo. Настройка параметров трения и инерции по данным энкодера и истории управляющих команд заняла около полутора минут и снизила ошибку положения на 64% — без дополнительных датчиков и дорогих стендов.
В этой логике физический робот поставляет данные для калибровки цифрового двойника, а основной объём экспериментов проводится в симуляции. Так симулятор становится частью инженерного контура — от его достоверности зависит качество управления и успех проекта.
Похожий принцип используется сейчас в «Третьей ступени»: сначала строится модель новой индустрии и проверяется стратегическая ставка, затем она переводится в план реальных действий.
🔥6
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥14❤7👏4👍2
Собрали для вас подборку интересных работ — от генерации поз схвата до универсальных моделей мира.
GraspGen-X: Cross-Embodiment 6-DOF Diffusion-based Grasping
Фундаментальная модель для генерации 6-DoF-позы схвата по геометрии объекта. Умеет адаптироваться к новым захватам через описание их рабочего объёма без отдельного переобучения. Ранжирует кандидатов по вероятности успешного схвата, используя опыт на миллиардах симуляционных примеров для тысяч объектов.
Быстрый тест на наших любимых объектах выдаёт вполне разумные позы для схвата.
🔗 статья| гитхаб
Hydra-0: Action Flow for Generalist World Modeling and Control
Универсальная модель мира, обусловленная последовательностью действий. Представляет действия робота в виде движения пикселей (action flow) — это позволяет моделировать последствия действий в разных воплощениях, задачах и средах.
Результаты впечатляют: на 90,4% меньшая погрешность при движении робота и на 60,2% — при движении объектов по сравнению с Cosmos-2.5.
🔗 сайт | статья
EmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation Trajectories
Авторы взяли датасет LIBERO-Spatial и построили для него графы пространственных отношений на основе состояния симулятора и геометрических эвристик. На полученных графах сравнили разные VLM по качеству предсказания триплетов. Также исследовали влияние графов на success rate VLA: во время evaluation графы генерировали из текущего состояния симулятора и добавляли к инструкции VLA, чтобы проверить, помогают ли они в задачах манипуляции.
🔗 статья
Q-Learning With World Models
Исследователи из Generalist представили GEN-1.5 — модель, которая способна обучаться новым физическим навыкам по одной демонстрации, без дообучения и градиентных обновлений.
Ключевые фишки:
— Physical prompting: в контекст передаётся полноценная сенсомоторная демонстрация (визуальные наблюдения, состояния робота и действия) — аналог in-context prompt для LLM.
— Масштаб претрейна: модель обучалась более 8 месяцев на большом объёме данных физического взаимодействия. Способность к one-shot in-context learning появилась как emergent property, а не была заложена в архитектуру.
Веса и pipeline пока закрыты, но blogpost уже есть.
🔗 blogpost
Похожее направление — In-Context Imitation Learning with Visual Reasoning (ICLR 2026)
Тоже in-context imitation learning по сенсомоторным демонстрациям, но с дополнительным visual reasoning: модель сначала предсказывает промежуточную визуальную траекторию движения робота в image space, а затем генерирует low-level actions. Reasoning выступает связующим звеном между наблюдением и действием.
Работа принята на IROS 2026, есть статья на arXiv и открытый код — в отличие от GEN-1.5, её уже можно изучать и воспроизводить.
🔗 статья | гитхаб
✏️Читаем, анализируем, берём в работу!
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥11🔥4
В Нижнем Новгороде прошла XI Международная конференция по когнитивной науке — это междисциплинарная конференция на стыке нейронауки, психологии, лингвистики, математического моделирования и искусственного интеллекта.
Сергей Парин — «В поисках сознания»
Обсуждал саму проблему определения сознания и предлагал искать не одно универсальное определение, а набор его признаков. Один из центральных тезисов состоял в том, что сознание можно рассматривать как механизм социального взаимодействия, а его отдельные предпосылки можно искать и у животных. В конце лекции эта проблема связывалась и с перспективой появления сознательных систем искусственного интеллекта.
Олег Кузнецов — «Может ли искусственный интеллект стать человекоподобным?»
Рассматривал различие между успешным решением интеллектуальных задач и настоящим пониманием. По его мнению, одних языковых моделей недостаточно для сильного ИИ: такая система должна быть автономным агентом, взаимодействовать со средой, формировать собственную картину мира и иметь собственные цели.
Татьяна Черниговская — лекция о языке как когнитивной способности
На примерах дельфинов, птиц и приматов она показывала, что животная коммуникация гораздо сложнее, чем принято считать: у некоторых видов есть индивидуальные «имена», они способны понимать человеческую речь и стоить достаточно сложные предложения. Поэтому граница между человеческим языком и коммуникацией других видов оказывается не такой однозначной, как долгое время предполагалось.
Скоро вторая часть, следите за обновлениями!
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6
🎓 — Семинар 1. Использование человеческих эгоцентричных данных для обучения VLA и WAM моделей | Даниил Зелезецкий
На данном семинаре аспирантом нашего Центра будут рассмотрены современные подходы к использованию человеческих эгоцентричных данных при обучении VLA и World Action Models (WAM).
Отдельное внимание будет уделено двум направлениям: масштабированию VLA за счёт совместного использования человеческих и роботизированных траекторий и обучению WAM, в которых человеческие видео используются для формирования представления о динамике среды и последствиях действий.
Будут рассмотрены преимущества такого подхода, способы переноса знаний между человеком и роботом, а также роль предсказания будущих состояний и латентной динамики в построении более универсальных роботизированных политик.
👉🏻 Дата: 10.09.26, четверг в 17:00
📹 Трансляция: YouTube или ВКонтакте
Подключайтесь к живому обсуждению и задавайте вопросы в прямом эфире! Ждем всех!
#семинары #rl
Архитектуры Vision-Language-Action (VLA) в последние годы показали высокую результативность в задачах роботизированной манипуляции, однако их дальнейшее масштабирование во многом ограничивается доступностью обучающих данных.
В отличие от языковых и визуальных моделей, для которых существуют массивные наборы данных, сбор роботизированных траекторий требует использования реального оборудования, телеоперации и значительных временных затрат. В связи с этим человеческие эгоцентричные видео рассматриваются как значительно более масштабируемый источник данных о взаимодействии с физическим миром.
При этом непосредственное использование человеческих данных для обучения робота осложняется различиями в кинематике, морфологии и пространстве действий человека и робота.
Современные подходы решают эту проблему либо за счёт преобразования человеческих движений и построения унифицированного представления действий, либо используя эгоцентричные видео для обучения более общих представлений о динамике окружающего мира, которые затем могут быть перенесены между различными embodiment.
На данном семинаре аспирантом нашего Центра будут рассмотрены современные подходы к использованию человеческих эгоцентричных данных при обучении VLA и World Action Models (WAM).
Отдельное внимание будет уделено двум направлениям: масштабированию VLA за счёт совместного использования человеческих и роботизированных траекторий и обучению WAM, в которых человеческие видео используются для формирования представления о динамике среды и последствиях действий.
Будут рассмотрены преимущества такого подхода, способы переноса знаний между человеком и роботом, а также роль предсказания будущих состояний и латентной динамики в построении более универсальных роботизированных политик.
👉🏻 Дата: 10.09.26, четверг в 17:00
📹 Трансляция: YouTube или ВКонтакте
Подключайтесь к живому обсуждению и задавайте вопросы в прямом эфире! Ждем всех!
#семинары #rl
❤11
Темы конференции — нейронаука, психология, лингвистика, математическое моделирование и ИИ. Если вам откликаются темы, то теперь у вас есть что почитать на выходных
Константин Анохин — гиперсетевая теория и когнитом
Представил гиперсетевую теорию высших функций мозга и понятие когнитома. В этой концепции сознание и субъективность возникают не в отдельной области мозга, а как системное свойство сети взаимодействующих нейронных ансамблей и следов индивидуального опыта. Ключевая идея состоит в том, что отдельные нейронные элементы и локальные сети объединяются в более сложную самоорганизующуюся архитектуру, способную формировать целостный субъективный опыт. Такой подход позволяет рассматривать сознание не как функцию одного «центра», а как результат организации и взаимодействия множества распределённых процессов в мозге.
🔗 Статья о когнитоме
Евгений Витяев — «Математически точный искусственный интеллект, основанный на моделях когнитивных процессов»
Представил работу «Математически точный искусственный интеллект, основанный на моделях когнитивных процессов». Его подход строится вокруг идеи, что мозг обнаруживает причинные связи во внешнем мире и использует их для прогнозирования. Автор формализует так называемые максимально специфические вероятностные правила и показывает, как из них можно получать непротиворечивые предсказания, устойчивые категории и модели восприятия и сознания.
🔗 Статья
Оксана Ещенко — межрегиональные взаимодействия мозга при пространственном обучении и навигации у крыс
Рассказывала о межрегиональных взаимодействиях мозга при пространственном обучении и навигации у крыс. В эксперименте одновременно регистрировали активность гиппокампа, префронтальной коры и таламического ядра reuniens; переход от исследования среды к целенаправленной навигации сопровождался усилением бета-синхронизации между гиппокампом и reuniens, а при навигационных ошибках эта связь ослабевала. Практически полная версия этой работы опубликована как препринт Hippocampus-reuniens beta coupling supports goal-directed spatial navigation, где показано, что сила этой связи растёт по мере повышения эффективности навигации.
🔗 Препринт
Булат Батуев и Сергей Сухов — управление направлением передачи активности между популяциями импульсных нейронов
Исследовали, как управлять направлением передачи активности между популяциями импульсных нейронов. Они моделировали LIF-нейроны и с помощью спектральных методов, включая partial directed coherence, оценивали, в каком направлении распространяется информация между популяциями. В опубликованной работе авторы показывают, что изменение режима внешнего воздействия и даже уровня фонового шума позволяет менять или инвертировать направление информационного потока в импульсной сети.
🔗 Статья
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5❤2