iMapDAY
358 subscribers
630 photos
74 videos
1 file
176 links
Сделал канал для размещения новостей от меня @yuddim и моей команды, занимающейся трехмерным компьютерным зрением роботов и автомобилей. Также давно хотелось собирать в одном месте интересные для меня научные публикации и технологические заметки.
Download Telegram
А также много времени провел на воркшопе по извлечению и использованию семантической информации для повышения автономии роботов https://www.dynsyslab.org/icra2026-workshop-on-semantics-for-reliable-robot-autonomy/

На этом воркшопе выступал Lukas Scmid (H-index 15, https://scholar.google.com/citations?hl=en&user=r79fGI0AAAAJ) автор полезного метода построения графов 4D-сцены DAAAM (Describe Anything Anywhere at Any Moment) (проект с кодом https://nicolasgorlo.com/DAAAM_25), а также метода Gaussian Mapping for Evolving Scenes https://arxiv.org/abs/2506.06909. Он достаточно активен и судя по аффилиациям, ушел из MIT и возглавил команду в Германии. Также он прорекламировал свежую книгу SLAM Handbook - https://github.com/SLAM-Handbook-contributors/slam-handbook-public-release/tree/main - она выглядит современной и полезной. Он также предствил масштабный онлайн-архив материалов по 3D-графам сцены https://3dscenegraphs.com (обязательно загляните!)

Аспирант Kush Hari и его руководитель Ken Goldberg рассказали о их свежем датасете и бенчмарке Robo2VLM (https://berkeleyautomation.github.io/robo2vlm/) и подходе RoboSQ: Semantic Queries for Task-Aligned Robot Training Data (https://autolab.berkeley.edu/assets/publications/media/2026_ICRA_Robo_SQ_final_version.pdf). Сам Ken Goldberg повторил кусок своей пленарной лекции про Code-as-Policy (https://arxiv.org/abs/2603.22435) и Graph-as-Policy для качественного и интерпретируемого управления роботами c помощью кодовых агентов.

Повторил кусок своего доклада и Manolis Savva из Simon Fraser University (H-index 53, https://scholar.google.com/citations?user=4D2vsdYAAAAJ&hl=en&oi=ao).

Выступала также Masha Itkina (H-index, https://scholar.google.com/citations?user=JAmTk5gAAAAJ), рассказывала про создание отказоустойчивых систем управления роботами, например, проект FAIL-Detect (https://cxu-tri.github.io/FAIL-Detect-Website/). Также она рассказывала про свои авторитетные публикации https://toyotaresearchinstitute.github.io/lbm1/, https://co-training-lbm.github.io, https://tri-ml.github.io/vla_foundry/
Из-за высокой релевантности этого воркшопа приведу полный список принятых докладов на него (там есть два доклада от коллег из ИТМО), ссылки работают если авторизоваться в openreview:
• Distributional Semantics for Robust Global Localization in Cluttered, Geometrically Aliased Environments (https://openreview.net/attachment?id=FjjDqommMK&name=pdf)
• IMPACT: Intelligent Motion Planning with Acceptable Contact Trajectories via Vision-Language Models (https://openreview.net/attachment?id=oMOpXYZJ8v&name=pdf)
• Introducing a framework to reduce foundation models hallucinations in robotics application (https://openreview.net/attachment?id=WGyXVAfAqR&name=pdf)
• HERMES: Habit- and Episode-aware Retrieval Memory for Embodied Systems (https://openreview.net/attachment?id=IkUhq9v0JX&name=pdf)
• 4D Latent Mapping for Mobile Manipulation Policy Learning (https://openreview.net/attachment?id=1aaWTejVLX&name=pdf)
• Efficient world models with tree-structured sparsity (https://openreview.net/attachment?id=xXrDiTMLH5&name=pdf)
• Occupancy-Aware Reasoning for Safe Quadrotor Navigation: Perception-Aware MPPI (https://openreview.net/attachment?id=aOrQSYmp9L&name=pdf)
• IFG: Internet-Scale Guidance for Functional Grasping Generation (https://openreview.net/attachment?id=rYOqxbLwyh&name=pdf)
• PoseRefer: Pathway-Local Parameters for Semantically Grounded Reference Resolution (https://openreview.net/attachment?id=PqZOaoqtso&name=pdf)
• BlabberSeg: Semantic Perception for Reliable Open-Vocabulary UAV Safe Landing (https://openreview.net/attachment?id=2oMctsz534&name=pdf)
• EVE: A Generator-Verifier System for Generative Policies (https://openreview.net/attachment?id=hKPbg5pu4q&name=pdf)
• NaviTrace: Evaluating Embodied Navigation of Vision-Language Models (https://openreview.net/attachment?id=rv6VhBMW7I&name=pdf)
• Ontology-Guided Reasoning for Affordance-Based Explanations of Robot Navigation (https://openreview.net/attachment?id=ZzABFRPCr9&name=pdf)
• From Exploration to Reuse: An Embodied Agent Framework for Manipulation Skill Learning (https://openreview.net/attachment?id=Dwya5QWvED&name=pdf)
• Affordance-based Robot Manipulation with Flow Matching (https://openreview.net/attachment?id=MmtkpTDfwN&name=pdf)
• Learning Compositional Symbolic Task Rules from Demonstrations with Inductive Logic Programming (https://openreview.net/attachment?id=OjVJRVwGS7&name=pdf)
• Flying with Style: Learning Agile Aerial Cinematography from Labeled Egocentric Video (https://openreview.net/attachment?id=Fjhagih2vV&name=pdf)
• Dynamic Control Barrier Function Regulation with Vision-Language Models for Safe, Adaptive, and Realtime Visual Navigation (https://openreview.net/attachment?id=uMoX27VOyY&name=pdf)
• Dream2Flow: Bridging Video Generation and Open-World Manipulation with 3D Object Flow (https://openreview.net/attachment?id=NMQ9Qw5j3i&name=pdf)
• Superhuman Safe and Agile Racing through Multi-Agent Reinforcement Learning (https://openreview.net/attachment?id=MqiKNCxZOu&name=pdf)
• RGB-only Active 3D Scene Graph Generation for Indoor Mobile Robots (https://openreview.net/attachment?id=6qkdDhfhWn&name=pdf)
• Integrating Topological Object Recognition into Semantic SLAM for Unseen Cluttered Environments (https://openreview.net/attachment?id=hnAp82m78m&name=pdf)
• Semantics-Guided Multimodal Masked Autoencoder Pretraining for 3D BEV Object Detection (https://openreview.net/attachment?id=G7NAwtCjdV&name=pdf)
• GovernorVLA: Adaptive Embodied Reasoning for Long-tail Autonomous Driving (https://openreview.net/attachment?id=tgZFh6O1xW&name=pdf)
• Towards Contextual Robot Intent Explanation for Hierarchical Vision–Language–Action Collaboration (https://openreview.net/attachment?id=NtTlOzgUkc&name=pdf)
• Latent Dynamics Modulation Guidance for Semantic Obstacle Avoidance in Diffusion Policies (https://openreview.net/attachment?id=w4rhh0VpES&name=pdf)
• TIGR: a Mixture-of-Foundation-Model-Experts for 3D-informed Task-Aware Grasping (https://openreview.net/attachment?id=XEB7wJSFbQ&name=pdf)
🔥2
И продолжение:
• Task-Aware Bimanual Affordance Prediction via VLM-Guided Semantic-Geometric Reasoning (https://openreview.net/attachment?id=05Zf4KJrRn&name=pdf)
• Semantic–Geometric Task Representations for Bimanual Manipulation from Human Demonstrations to Robot Action Planning (https://openreview.net/attachment?id=R2I0asfyZT&name=pdf)
• Towards Task Planning for Proactive Safety in Home Service Robots: A Scene Graph-Augmented LLM Approach (https://openreview.net/attachment?id=juTZvTVQvT&name=pdf)
• PEACE: A Planner–Executor Agent with Constraint Enforcement for UAVs (https://openreview.net/attachment?id=inQPnS3D75&name=pdf)
• Energy-Based Action Heads Know When They Don’t Know (https://openreview.net/attachment?id=PF9lhBseXQ&name=pdf)
• M2H-MX: Multi-Task Semantic and Geometric Perception for Real-Time Monocular 3D Scene Graph Construction (https://openreview.net/attachment?id=KG9QYhLIBV&name=pdf)
• Uncertainty-Aware Symbolic State Monitoring with Vision-Language Models and Gaussian Naive Bayes (https://openreview.net/attachment?id=9vqwDyFhDX&name=pdf)
• From Obstacles to Etiquette: Robot Social Navigation with VLM-Informed Path Selection (https://openreview.net/attachment?id=gnpxmJ3S2j&name=pdf)
• LiftNav: Path Planning via Semantic Lifting in TSDF-Guided Gaussian Splatting (https://openreview.net/attachment?id=s6rxtvo20o&name=pdf)
• R5DGS: Semantic-Aware 4D Gaussian Splatting with Rigid Body Constraints for Efficient Dynamic Scene Reconstruction (https://openreview.net/attachment?id=LFHg6tcn7e&name=pdf)
• Tool-Augmented VLM Agents for Zero-Shot 3D Visual Grounding on Point Clouds (https://openreview.net/attachment?id=Ft2t57khSZ&name=pdf)
• LLM Tool Workflows for Robot Explainability and Natural Language Commanding (https://openreview.net/attachment?id=NUu9P1LwbT&name=pdf)
• Unified Point Cloud Corruption-Aware Reasoning Engine (https://openreview.net/attachment?id=63dSwa83gC&name=pdf)
• Where Did I Leave My Glasses? Open-Vocabulary Semantic Exploration in Real-World Semi-Static Environments (https://openreview.net/attachment?id=4SSJXzXnxM&name=pdf)
🔥1
У нас радостная новость: +1 accept на IROS 🎉

На IROS 2026 приняли нашу статью с Чжаном, который сейчас работает в Shanghai AI Lab и собирается на повторную предзащиту кандидатской диссертации. Статья про бенчмаркинг различных симуляторов, в которых требуется работать с фотореалистичными и физически-правдоподобными средами с использованием GPU:

Huzhenyu Zhang, Shenghai Yuan, Wenrui Yan, LI MA, HengJie Li, Jing-Cheng Pang, Dmitry Yudin
GPUSimBench: Towards Scalable and Reliable GPU-Accelerated Simulators in Embodied AI

Немного подробностей об отборе статей из письма от организаторов:
This year the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026) received 4,348 contributed paper submissions. From these papers, we accepted 1,585, which represents an acceptance rate of 36%.
Managed by the IROS Conference Paper Review Board, each contributed paper submission was reviewed by at least two reviewers before receiving a summary report from an Associate Editor and a final report from an Editor. Based on these reviews and reports, the Senior Program Committee made the final decisions.

#Papers #IROS
🔥8😁1
Команда Qwen представила набор фундаментальных моделей для управления роботами и их моделирования Qwen-Robot Suite .

Модели RobotNav, RobotManip и RobotWorld отвечают соответственно за навигацию, манипуляцию и моделирование физического мира.

Давайте пробовать!

#News
❤3
Рассказали сегодня на семинаре про участие в конференции ICRA’2026, можно послушать и посмотреть в записи
🎓 — Семинар 20. Обзор конференции ICRA 2026 | Александр Панов, Дмитрий Юдин, Дмитрий Макаров, Юлия Даник

В начале июня наша команда выезжала в Вену на ICRA 2026. Это крупнейшая в мире конференция по робототехнике и автоматизации.

На конференцию прошло 3 наших статьи:
1) Dynamic Neural Potential Field: Online Trajectory Optimization in Presence of Moving Obstacles — представляет метод нейросетевой генерации траекторий для объезда динамических препятствий в реальном времени
2) Knowledge-Guided Manipulation Using Multi-Task Reinforcement Learning — представляет метод, объединяющий 3D-сцену, граф знаний и обучение с подкреплением для управления манипуляциями робота
3) TOCALib: Optimal control library with interpolation for bimanual manipulation and obstacles avoidance — представляет библиотеку оптимального управления с интерполяцией для бимануальных манипуляторов и избегания препятствий


Приходите послушать об этом мероприятии от первых лиц! Участники расскажут об интересных статьях, новых трендах и своих впечатлениях от поездки.

👉🏻 Дата: 18.06.26, пятница в 17:00
📹 Трансляция: YouTube или ВКонтакте

Подключайтесь к живому обсуждению и задавайте вопросы в прямом эфире! Ждем всех!

#семинары #robotics
❤1
Про нашу работу DyGenc вышла новость на Cnews https://www.cnews.ru/news/line/2026-06-19_uchenye_nauchili_nejroset

#News
❤1🔥1
Незаметно в этом месяце вышла SOTA модель детекции объектов на изображениях, работающая в реальном времени, YOLO26 от Ultralytics.

Статья: https://arxiv.org/abs/2606.03748
Код: https://github.com/ultralytics/ultralytics
🔥2🤔1
Поучаствовал сегодня вместе с Дмитрием Ватолиным и Владиславом Шахуро в комиссии по защите магистерских дипломов в AI Talent Hub ИТМО по темам, связанным с индустриальным компьютерным зрением.

У меня такой вывод, что защищавшимся ребятам, работающим в ведущих российских IT-компаниях, совсем не хватило времени написать нормальные дипломные работы!

#Activities
😁20💯2🤡1💔1
Еще одна полезная книга
Forwarded from Physical AI & Robotics
MIT Press выпустило учебник Introduction to Autonomous Robots — и авторы выложили его бесплатно на GitHub под лицензией Creative Commons.

Книга рассчитана на студентов и разбирает автономных роботов «с земли»: кинематику, сенсоры, приводы, планирование движения, локализацию, компьютерное зрение и нейросети. Материал вырос из лекций четырёх профессоров Университета Колорадо в Боулдере.

Ссылка на книгу

#news #robots #ai #engineering #blippost
🔥6
Сегодня принимаем дипломы наших магистров в МФТИ - есть трансляция
🎓 — Семинар 21. Защита магистерских диссертаций выпускников ЦКМ 2026

Ещё одна группа морских котиков ИИ готова к финальной миссии своего обучения — защите магистерской работы🏆

За два года мы постарались передать студентам самые актуальные и прикладные знания в области ИИ и робототехники, а ребята достигли больших успехов. Приглашаем всех присоединиться и послушать выступления!

📹 Трансляция ВК

#семинары #магистратура
Please open Telegram to view this post
VIEW IN TELEGRAM
Вышла VGGT Omega от Visual Geometry Group, University of Oxford и Meta AI - новая SOTA оценки карт глубин и поз камер по видео (CVPR 2026 Best Paper Finalist). Ну и это одно из самых кратких названий статей, которые я видел

Проект: https://vggt-omega.github.io/
Статья: VGGT-Ω https://arxiv.org/abs/2605.15195
Код: https://github.com/facebookresearch/vggt-omega

#Papers
🔥2