Добавлю в ленту технологических новостей. В январе-феврале 2026 заметен прогресс в развитии технологий генерации видео для различных физических сред, которые могут быть использованы как источник данных для обучения самых разных алгоритмов - от распознавания редких событий, генерации графов сцен, до управления роботами и беспилотными автомобилями.
Google DeepMind выкатила в конце января Project Genie (попробовать его можно тут), который объединил в себе возможности Genie 3, Nano Banana Pro and Gemini. Вот здесь можно посмотреть подробности: (блог)
Робототехнический стартап из Китая Robbyant, входящий в Ant Group (дочерняя компания Alibaba) выпустил в открытый доступ "модель мира" LingBot-World (проект) (код) (модель). Подробности можно также посмотреть в статье "Advancing Open-source World Models" (arxiv)
Вообще, Robbyant сделала релиз целой экосистемы полезных открытых инструментов и моделей для "физического ИИ", в которую вошли LingBot-Depth (фундаментальная модель для генерации высококачественных карт глубин по видео и разреженным облакам точек с сенсоров при 3D-восприятии пространства), LingBot-VA (модель генерации видео с действиями для управления роботами - авторы назвали это casual video-action world model), и собственно LingBot-VLA - "прагматическую" фундаментальную визуально-языковую модель генерации действий для 9 различных типов роботов.
#References
Google DeepMind выкатила в конце января Project Genie (попробовать его можно тут), который объединил в себе возможности Genie 3, Nano Banana Pro and Gemini. Вот здесь можно посмотреть подробности: (блог)
Робототехнический стартап из Китая Robbyant, входящий в Ant Group (дочерняя компания Alibaba) выпустил в открытый доступ "модель мира" LingBot-World (проект) (код) (модель). Подробности можно также посмотреть в статье "Advancing Open-source World Models" (arxiv)
Вообще, Robbyant сделала релиз целой экосистемы полезных открытых инструментов и моделей для "физического ИИ", в которую вошли LingBot-Depth (фундаментальная модель для генерации высококачественных карт глубин по видео и разреженным облакам точек с сенсоров при 3D-восприятии пространства), LingBot-VA (модель генерации видео с действиями для управления роботами - авторы назвали это casual video-action world model), и собственно LingBot-VLA - "прагматическую" фундаментальную визуально-языковую модель генерации действий для 9 различных типов роботов.
#References
🔥3
Есть новости и у нашей команды, связанные с публикацией результатов применения графов 3D-сцен для планирования действий и управления роботами.
В конце января стало известно, что работа "Knowledge-Guided Manipulation Using Multi-Task Reinforcement Learning", в написании которой участвовала наша команда, была принята на A* конференцию ICRA'2026 в Вене. В марте планируем выложить ее на arxiv и сделаю про нее отдельный пост.
Ко Дню науки у нас приняли статью в хороший Q1-журнал Engineering Applications of Artificial Intelligence, которая называется "Scene graph-driven reasoning for action planning of humanoid robot". Она уже опубликована и смотреть ее можно тут.
#Papers #ICRA #EAAI
В конце января стало известно, что работа "Knowledge-Guided Manipulation Using Multi-Task Reinforcement Learning", в написании которой участвовала наша команда, была принята на A* конференцию ICRA'2026 в Вене. В марте планируем выложить ее на arxiv и сделаю про нее отдельный пост.
Ко Дню науки у нас приняли статью в хороший Q1-журнал Engineering Applications of Artificial Intelligence, которая называется "Scene graph-driven reasoning for action planning of humanoid robot". Она уже опубликована и смотреть ее можно тут.
#Papers #ICRA #EAAI
🔥9
Forwarded from Center for Cognitive Modeling
🚀— Ждем вас сегодня на нашем стенде на «Карьерном форсаже»!
Расскажем о Центре, поделимся отличным настроением и наклейками.
Расскажем о Центре, поделимся отличным настроением и наклейками.
Всем привет из Сербии из Белграда! Сегодня здесь началась открытая конференция OpenTalks.AI, завтра буду
выступать на ней с докладом
как графы сцены помогают улучшать пространственные рассуждения в современном ИИ. Видео-трансляция будет здесь
ТГ-группа события: https://t.me/OpenTalksAI
#Activities
выступать на ней с докладом
как графы сцены помогают улучшать пространственные рассуждения в современном ИИ. Видео-трансляция будет здесь
ТГ-группа события: https://t.me/OpenTalksAI
#Activities
🔥13❤1
Выступил сегодня на конференции OpenTalks.AI, сделал доклад «Scene Graph-driven Spatial Understanding and Reasoning». Рассказал в нем и про наши методы BBQ, 3DGraphLLM, DyGEnc, SG-RAPL, KG-M3PO. Зрителей было немного, но мне кажется, мы друг другу понравились! Слайды можно посмотреть по ссылке.
#Activities
#Activities
🔥15
OpenTalks.AI завершилась. Получились полезные контакты и интересные обсуждения.
Напишу краткие впечатления о том, какие доклады удалось послушать на конференции:
Татьяна Шаврина рассказала про интеллектуальных агентов для проведения научных исследований (AI Research Scientist), а также про разработки, которые для этого делает: AIRS-Bench, ML-Gym. Также было приятно понимать, что и у нас в AIRI/МФТИ эта тема AI Scientist тоже двигается.
Похожая тема про ИИ-исследователя была и у Андрея Устюжанина из Constructor University
Илья Макаров из AIRI выступил про кооперативных интеллектуальных агентов для автоматизации научных исследований
Александр Новиков из DeepMind онлайн рассказал про свою нашумевшую работу AlphaEvolve
Евгений Ижикевич из SpikeCore онлайн рассказывал про работу Spiking Manifesto про то как приводить трансформерные модели к спайковым моделям, отмечу, что это его первая статья после почти 10-летнего перерыва. Было мало практических примеров работы, но технология кажется перспективной. Какой-то код выложен https://github.com/izhikevich/SNN - можно проверять. Анатолий Старостин сделал более продвинутую программную реализацию, совместимую с PyTorch https://github.com/anatoli-starostin/spiky
Юрий Валентинович Визильтер из МФТИ и ГосНИАС сделал яркий доклад про будущее ИИ и робототехники. Запомнился робокоммунизм 😊
Сергей Николенко из ПОМИ РАН сделал обзорный доклад про Safety in AI
Евгений Бурнаев из Сколтеха рассказал про дистилляцию диффузионных генеративных моделей
Антон Конушин из AIRI и МГУ показал свою свежую работу CADReasoner, которой пока еще нет в открытом доступе и которая позволяет значительно улучшать качество генерируемых СAD моделей по сравнению с прошлогодней моделью Cadrille
Также я успел промодерировать секцию Visual Language Models, на которой выступили с интересными докладами Константин Веснин из Avito Tech, рассказавший про применение VLM в продуктах Авито, и Сергей Колюбин из ИТМО, представивший разработки команды, связанные с VLM для воплощенного ИИ.
Мы с Алексеем Ковалевым выступили на секции Vision for Robots and Autonomous Systems, где показали много разных разработок, деланных в AIRI и МФТИ
Много докладов не удалось послушать, поскольку параллельно шло три секции. В целом, на мой взгляд, конференция удалась, спасибо Игорю Пивоварову за грамотную организацию конференции!
#Activities
Напишу краткие впечатления о том, какие доклады удалось послушать на конференции:
Татьяна Шаврина рассказала про интеллектуальных агентов для проведения научных исследований (AI Research Scientist), а также про разработки, которые для этого делает: AIRS-Bench, ML-Gym. Также было приятно понимать, что и у нас в AIRI/МФТИ эта тема AI Scientist тоже двигается.
Похожая тема про ИИ-исследователя была и у Андрея Устюжанина из Constructor University
Илья Макаров из AIRI выступил про кооперативных интеллектуальных агентов для автоматизации научных исследований
Александр Новиков из DeepMind онлайн рассказал про свою нашумевшую работу AlphaEvolve
Евгений Ижикевич из SpikeCore онлайн рассказывал про работу Spiking Manifesto про то как приводить трансформерные модели к спайковым моделям, отмечу, что это его первая статья после почти 10-летнего перерыва. Было мало практических примеров работы, но технология кажется перспективной. Какой-то код выложен https://github.com/izhikevich/SNN - можно проверять. Анатолий Старостин сделал более продвинутую программную реализацию, совместимую с PyTorch https://github.com/anatoli-starostin/spiky
Юрий Валентинович Визильтер из МФТИ и ГосНИАС сделал яркий доклад про будущее ИИ и робототехники. Запомнился робокоммунизм 😊
Сергей Николенко из ПОМИ РАН сделал обзорный доклад про Safety in AI
Евгений Бурнаев из Сколтеха рассказал про дистилляцию диффузионных генеративных моделей
Антон Конушин из AIRI и МГУ показал свою свежую работу CADReasoner, которой пока еще нет в открытом доступе и которая позволяет значительно улучшать качество генерируемых СAD моделей по сравнению с прошлогодней моделью Cadrille
Также я успел промодерировать секцию Visual Language Models, на которой выступили с интересными докладами Константин Веснин из Avito Tech, рассказавший про применение VLM в продуктах Авито, и Сергей Колюбин из ИТМО, представивший разработки команды, связанные с VLM для воплощенного ИИ.
Мы с Алексеем Ковалевым выступили на секции Vision for Robots and Autonomous Systems, где показали много разных разработок, деланных в AIRI и МФТИ
Много докладов не удалось послушать, поскольку параллельно шло три секции. В целом, на мой взгляд, конференция удалась, спасибо Игорю Пивоварову за грамотную организацию конференции!
#Activities
🔥6❤2