❤4🔥1
Напишу про воркшопы на конференции ICRA’2026. Их отобрали из 150 заявок целых 70 штук и они параллельно шли в первый и последний день конференции. Они как и на IROS являлись украшением конференции. Почти все пленарные докладчики и keynotes выступали (и иногда дублировали свои «большие» выступления) на воркшопах - сами или со своими студентами. И естественно, там было проще было задавать им вопросы, знакомиться и тп.
В первый день конференции мне удалось побывать на нескольких воркшопах:
На воркшопе по мультимодальному пространственному ИИ было много того, чем мы активно занимаемся в МФТИ и AIRI
Andrew Davison из Imperial College London (H-index 83) рассказывал актуальный свежий взгляд на проблему «From SLAM to Spatial Al». Он говорил о методах разработанных его командой: SuperPrimitives (CVPR 2024) (проект с кодом https://makezur.github.io/SuperPrimitive/), 4D Primitive Maché (4DPM) (CVPR 2026) (проект с кодом https://makezur.github.io/4DPM/), также он дал свой взгляд на структуру современного Spatial AI, высказал идею про graph-like процессор для анализа пространственной информации
Dezhen Song из Mbuzai (H-index 33 ) также рассказывал про графовые методы в пространственном ИИ и показал свой метод учета данных магнетометров для локализации: Proprioceptive Localization Assisted by Magnetoreception (PLAM), а также кооперативной локализации C-GBPL , которые оказались не такими уж и свежими.
Margarita Chli из ETH Zurich (H-index 46) рассказывала о своей свежей работе EllipseLIO: Adaptive LiDAR Inertial Odometry with an Ellipsoid Representation (код https://github.com/v4rl-ucy/ellipselio). Лидарные методы для локализации и построения карт сейчас набирают обороты, их было много на конференции.
Про будущее построения роботами карт рассказывал Hermann Blum из Uni Bonn & Lamarr Institute (H-index 21). Показал свою относительно свежую работу 2GO: Loop Closures from 2 Views , FrontierNet (код https://github.com/cvg/FrontierNet ), OpenFrontier: Reconstruction Free Open-Prompt Navigation (проект пока без кода https://boysun045.github.io/OpenFrontier-Project/), OsmAG-LLM: finding unknown and relocated objects (код https://anonymous.4open.science/r/osmAG-LLM), FunFact: Probabilistic Functional Scene Graphs (проект пока без кода https://funfact-scenegraph.github.io). Его стек работ очень близок к нашим работам, он также отмечается важность фундаментальных моделей для задач навигации и построения карт.
Alex Wong из Yale University (H-index 25) рассказывал про подходы к построению универсальных методов реконструкции карт глубин из монокулярного видео и с какими трудностями при этом встречаются исследователи на примере своей работы ProtoDepth: Unsupervised Continual Depth Completion with Prototypes (код https://github.com/patrickqrim/ProtoDepth)
Sebastian Scherer (H-index 64) много улыбался и шутил и говорил про мультимодальное очувствление, сфокусировавшись на создании универсальное сферическое представление изображений, который может повысить качество переноса моделей распознавания сцены между разными сенсорами.
#ICRA
В первый день конференции мне удалось побывать на нескольких воркшопах:
На воркшопе по мультимодальному пространственному ИИ было много того, чем мы активно занимаемся в МФТИ и AIRI
Andrew Davison из Imperial College London (H-index 83) рассказывал актуальный свежий взгляд на проблему «From SLAM to Spatial Al». Он говорил о методах разработанных его командой: SuperPrimitives (CVPR 2024) (проект с кодом https://makezur.github.io/SuperPrimitive/), 4D Primitive Maché (4DPM) (CVPR 2026) (проект с кодом https://makezur.github.io/4DPM/), также он дал свой взгляд на структуру современного Spatial AI, высказал идею про graph-like процессор для анализа пространственной информации
Dezhen Song из Mbuzai (H-index 33 ) также рассказывал про графовые методы в пространственном ИИ и показал свой метод учета данных магнетометров для локализации: Proprioceptive Localization Assisted by Magnetoreception (PLAM), а также кооперативной локализации C-GBPL , которые оказались не такими уж и свежими.
Margarita Chli из ETH Zurich (H-index 46) рассказывала о своей свежей работе EllipseLIO: Adaptive LiDAR Inertial Odometry with an Ellipsoid Representation (код https://github.com/v4rl-ucy/ellipselio). Лидарные методы для локализации и построения карт сейчас набирают обороты, их было много на конференции.
Про будущее построения роботами карт рассказывал Hermann Blum из Uni Bonn & Lamarr Institute (H-index 21). Показал свою относительно свежую работу 2GO: Loop Closures from 2 Views , FrontierNet (код https://github.com/cvg/FrontierNet ), OpenFrontier: Reconstruction Free Open-Prompt Navigation (проект пока без кода https://boysun045.github.io/OpenFrontier-Project/), OsmAG-LLM: finding unknown and relocated objects (код https://anonymous.4open.science/r/osmAG-LLM), FunFact: Probabilistic Functional Scene Graphs (проект пока без кода https://funfact-scenegraph.github.io). Его стек работ очень близок к нашим работам, он также отмечается важность фундаментальных моделей для задач навигации и построения карт.
Alex Wong из Yale University (H-index 25) рассказывал про подходы к построению универсальных методов реконструкции карт глубин из монокулярного видео и с какими трудностями при этом встречаются исследователи на примере своей работы ProtoDepth: Unsupervised Continual Depth Completion with Prototypes (код https://github.com/patrickqrim/ProtoDepth)
Sebastian Scherer (H-index 64) много улыбался и шутил и говорил про мультимодальное очувствление, сфокусировавшись на создании универсальное сферическое представление изображений, который может повысить качество переноса моделей распознавания сцены между разными сенсорами.
#ICRA
xingxingzuo.github.io
Web home for the Workshop for MMSpatialAI @ ICRA2026
👍1🔥1
На этом MM-SpatialAI-воркшопе были интересные постеры:
- Efficient Feature-Free Initialization for Monocular Visual-Inertial Systems Using a Feed-Forward 3D Model (проект пока без кода https://github.com/Yuantai-Z/FF-VIO-Init)
- FlowHOI: Flow-based Semantics-Grounded Generation of Hand-Object Interactions for Dexterous Robot Manipulation (проект с кодом https://huajian-zeng.github.io/projects/flowhoi/)
-RADIO-ViPE: Online Tightly Coupled Multi-Modal Fusion for Open-Vocabulary Semantic SLAM in Dynamic Environments (проект с кодом https://be2rlab.github.io/radio_vipe)
- DCReg: Decoupled Characterization for Efficient Degenerate LiDAR Registration (код https://github.com/JokerJohn/DCReg)
- ScaRF-SLAM: A Framework for Globally Consistent Online Visual Dense Reconstruction (код https://github.com/ori-drs/ScaRF-SLAM)
- Learning to Localize Reference Trajectories in Image-Space for Visual Navigation (проект с кодом https://finnbusch.com/lotis)
- ScanNet-SG: A Large-Scale Dataset for 3D Scene Graph Alignment (код и данные https://github.com/tud-amr/ScanNet-SG)
- UniFField: A Generalizable Unified Neural Feature Field for Visual, Semantic, and Spatial Uncertainties in Any Scene (проект пока без кода https://sites.google.com/view/uniffield)
- Efficient Feature-Free Initialization for Monocular Visual-Inertial Systems Using a Feed-Forward 3D Model (проект пока без кода https://github.com/Yuantai-Z/FF-VIO-Init)
- FlowHOI: Flow-based Semantics-Grounded Generation of Hand-Object Interactions for Dexterous Robot Manipulation (проект с кодом https://huajian-zeng.github.io/projects/flowhoi/)
-RADIO-ViPE: Online Tightly Coupled Multi-Modal Fusion for Open-Vocabulary Semantic SLAM in Dynamic Environments (проект с кодом https://be2rlab.github.io/radio_vipe)
- DCReg: Decoupled Characterization for Efficient Degenerate LiDAR Registration (код https://github.com/JokerJohn/DCReg)
- ScaRF-SLAM: A Framework for Globally Consistent Online Visual Dense Reconstruction (код https://github.com/ori-drs/ScaRF-SLAM)
- Learning to Localize Reference Trajectories in Image-Space for Visual Navigation (проект с кодом https://finnbusch.com/lotis)
- ScanNet-SG: A Large-Scale Dataset for 3D Scene Graph Alignment (код и данные https://github.com/tud-amr/ScanNet-SG)
- UniFField: A Generalizable Unified Neural Feature Field for Visual, Semantic, and Spatial Uncertainties in Any Scene (проект пока без кода https://sites.google.com/view/uniffield)
arXiv.org
Efficient Feature-Free Initialization for Monocular...
Fast and reliable initialization is critical for monocular visual-inertial navigation systems (VINS), as it establishes the starting conditions for subsequent state estimation. Despite steady...
Немного фото и видео с этого воркшопа