На этом MM-SpatialAI-воркшопе были интересные постеры:
- Efficient Feature-Free Initialization for Monocular Visual-Inertial Systems Using a Feed-Forward 3D Model (проект пока без кода https://github.com/Yuantai-Z/FF-VIO-Init)
- FlowHOI: Flow-based Semantics-Grounded Generation of Hand-Object Interactions for Dexterous Robot Manipulation (проект с кодом https://huajian-zeng.github.io/projects/flowhoi/)
-RADIO-ViPE: Online Tightly Coupled Multi-Modal Fusion for Open-Vocabulary Semantic SLAM in Dynamic Environments (проект с кодом https://be2rlab.github.io/radio_vipe)
- DCReg: Decoupled Characterization for Efficient Degenerate LiDAR Registration (код https://github.com/JokerJohn/DCReg)
- ScaRF-SLAM: A Framework for Globally Consistent Online Visual Dense Reconstruction (код https://github.com/ori-drs/ScaRF-SLAM)
- Learning to Localize Reference Trajectories in Image-Space for Visual Navigation (проект с кодом https://finnbusch.com/lotis)
- ScanNet-SG: A Large-Scale Dataset for 3D Scene Graph Alignment (код и данные https://github.com/tud-amr/ScanNet-SG)
- UniFField: A Generalizable Unified Neural Feature Field for Visual, Semantic, and Spatial Uncertainties in Any Scene (проект пока без кода https://sites.google.com/view/uniffield)
- Efficient Feature-Free Initialization for Monocular Visual-Inertial Systems Using a Feed-Forward 3D Model (проект пока без кода https://github.com/Yuantai-Z/FF-VIO-Init)
- FlowHOI: Flow-based Semantics-Grounded Generation of Hand-Object Interactions for Dexterous Robot Manipulation (проект с кодом https://huajian-zeng.github.io/projects/flowhoi/)
-RADIO-ViPE: Online Tightly Coupled Multi-Modal Fusion for Open-Vocabulary Semantic SLAM in Dynamic Environments (проект с кодом https://be2rlab.github.io/radio_vipe)
- DCReg: Decoupled Characterization for Efficient Degenerate LiDAR Registration (код https://github.com/JokerJohn/DCReg)
- ScaRF-SLAM: A Framework for Globally Consistent Online Visual Dense Reconstruction (код https://github.com/ori-drs/ScaRF-SLAM)
- Learning to Localize Reference Trajectories in Image-Space for Visual Navigation (проект с кодом https://finnbusch.com/lotis)
- ScanNet-SG: A Large-Scale Dataset for 3D Scene Graph Alignment (код и данные https://github.com/tud-amr/ScanNet-SG)
- UniFField: A Generalizable Unified Neural Feature Field for Visual, Semantic, and Spatial Uncertainties in Any Scene (проект пока без кода https://sites.google.com/view/uniffield)
arXiv.org
Efficient Feature-Free Initialization for Monocular...
Fast and reliable initialization is critical for monocular visual-inertial navigation systems (VINS), as it establishes the starting conditions for subsequent state estimation. Despite steady...
Немного фото и видео с этого воркшопа
Смог попасть и на другой важный для нас воркшоп о создании цифровых двойников в симуляторах https://awesomedigitaltwin.github.io/2026_ICRA.html
Manolis Savva из Канадского Simon Fraser University (H-index 53) рассказывал про свои свежие разработки:
- SceneMotifCoder https://arxiv.org/abs/2408.02211 (проект с кодом и данными https://3dlg-hcvc.github.io/smc/),
- HSM: Hierarchical Scene Motifs for Multi-Scale Indoor Scene Generation https://arxiv.org/abs/2503.16848 (проект с кодом https://3dlg-hcvc.github.io/hsm),
- SINGAPO: Single Image Controlled Generation of Articulated Parts in Obiects https://arxiv.org/abs/2410.16499 (проект с кодом https://3dlg-hcvc.github.io/singapo),
- ITACO: 2-stage coarse prediction & refinement https://arxiv.org/html/2506.08334v2 (проект с кодом https://3dlg-hcvc.github.io/video2articulation/),
- EgoFun3D: benchmarking egocentric video to functional 3D digital twin reconstruction https://arxiv.org/abs/2604.11038 (проект с кодом и данными https://3dlg-hcvc.github.io/EgoFun3D/),
- Artiverse: A Diverse and Physically Grounded Dataset for Articulated Objects https://arxiv.org/abs/2605.24403 (проект с кодом и данными https://3dlg-hcvc.github.io/artiverse/)
Ingmar Posner из Oxford University (H-index 50) сделал базовый обзор различных моделей мира (World Models) и рассказал про свои работы VCD (Variational Causal Dynamics) , COMET и SPARTAN, про свежие результататы 2026 года правда ничего не рассказал
Ken Goldberg из UC Berkeley и UCSF (H-index 109) рассказывал про моделирование роста растений с помощью трехмерного гауссовского сплаттинга GrowSplat (проект с данными и пока без кода https://berkeleyautomation.github.io/GrowSplat/), а также про разумную концепцию, в которой рассматривался промежуточное синтетическое представление среды для обучения роботов: Real2Render2Real: Scaling Robot Data Without Dynamics Simulation or Robot Hardware (проект с кодом https://real2render2real.com)
Oier Mees из Microsoft (H-index 29), из его работ отмечу SteerVLA: Steering Vision-Language-Action Models in Long-Tail Driving Scenarios (проект пока без кода https://steervla.github.io) и mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs (проект с кодом https://mimic-video.github.io)
На этом воркшопе также выступал Jiajun Wu из Стэнфорда (H-index 94 ) c очень большим количеством публикаций на A*-конференциях в год - он входит в команду Fei-Fei Li. Отмечу его свежие работы про рассуждения на длинных видео и бенчмаркинг:
- Linear Scaling Video VLMs for Long Video Understanding https://arxiv.org/abs/2605.31598 (проект пока без кода https://ceyzaguirre4.github.io/StateKV/),
- GPIC: A Giant Permissive Image Corpus for Visual Generation https://arxiv.org/abs/2605.30341 (проект с данными https://gpic.stanford.edu/),
- ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop https://arxiv.org/abs/2605.18746 (проект с кодом https://esi-bench.github.io).
#ICRA
Manolis Savva из Канадского Simon Fraser University (H-index 53) рассказывал про свои свежие разработки:
- SceneMotifCoder https://arxiv.org/abs/2408.02211 (проект с кодом и данными https://3dlg-hcvc.github.io/smc/),
- HSM: Hierarchical Scene Motifs for Multi-Scale Indoor Scene Generation https://arxiv.org/abs/2503.16848 (проект с кодом https://3dlg-hcvc.github.io/hsm),
- SINGAPO: Single Image Controlled Generation of Articulated Parts in Obiects https://arxiv.org/abs/2410.16499 (проект с кодом https://3dlg-hcvc.github.io/singapo),
- ITACO: 2-stage coarse prediction & refinement https://arxiv.org/html/2506.08334v2 (проект с кодом https://3dlg-hcvc.github.io/video2articulation/),
- EgoFun3D: benchmarking egocentric video to functional 3D digital twin reconstruction https://arxiv.org/abs/2604.11038 (проект с кодом и данными https://3dlg-hcvc.github.io/EgoFun3D/),
- Artiverse: A Diverse and Physically Grounded Dataset for Articulated Objects https://arxiv.org/abs/2605.24403 (проект с кодом и данными https://3dlg-hcvc.github.io/artiverse/)
Ingmar Posner из Oxford University (H-index 50) сделал базовый обзор различных моделей мира (World Models) и рассказал про свои работы VCD (Variational Causal Dynamics) , COMET и SPARTAN, про свежие результататы 2026 года правда ничего не рассказал
Ken Goldberg из UC Berkeley и UCSF (H-index 109) рассказывал про моделирование роста растений с помощью трехмерного гауссовского сплаттинга GrowSplat (проект с данными и пока без кода https://berkeleyautomation.github.io/GrowSplat/), а также про разумную концепцию, в которой рассматривался промежуточное синтетическое представление среды для обучения роботов: Real2Render2Real: Scaling Robot Data Without Dynamics Simulation or Robot Hardware (проект с кодом https://real2render2real.com)
Oier Mees из Microsoft (H-index 29), из его работ отмечу SteerVLA: Steering Vision-Language-Action Models in Long-Tail Driving Scenarios (проект пока без кода https://steervla.github.io) и mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs (проект с кодом https://mimic-video.github.io)
На этом воркшопе также выступал Jiajun Wu из Стэнфорда (H-index 94 ) c очень большим количеством публикаций на A*-конференциях в год - он входит в команду Fei-Fei Li. Отмечу его свежие работы про рассуждения на длинных видео и бенчмаркинг:
- Linear Scaling Video VLMs for Long Video Understanding https://arxiv.org/abs/2605.31598 (проект пока без кода https://ceyzaguirre4.github.io/StateKV/),
- GPIC: A Giant Permissive Image Corpus for Visual Generation https://arxiv.org/abs/2605.30341 (проект с данными https://gpic.stanford.edu/),
- ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop https://arxiv.org/abs/2605.18746 (проект с кодом https://esi-bench.github.io).
#ICRA
awesomedigitaltwin.github.io
ICRA 2026 Workshop on Generative Digital Twins
Generative Digital Twins for Real2Sim and Sim2Real Transfer in Robotics at IEEE ICRA 2026.
❤1