Итак этот канал - прямое продолжение моего другого канала. К сожалению, Я понял что Я не могу позволить себе быть unhinged and crazy в канале и при этом параллельно писать там о своей профессиональной деятельности и сайд-активностях.
Так что здесь будет про мои интересы и деятельность , а старый канал останется для абсолютно первобытного нефильтрованного щитпостинга.
Так что здесь будет про мои интересы и деятельность , а старый канал останется для абсолютно первобытного нефильтрованного щитпостинга.
Рад поделиться тем, что у команды частью которой Я являюсь, на HuggingFace вышел ТехРепорт по VLA, которая работает на разных роботах в том числе и нашем антропоморфном роботе - Грине (не китайском!). Если вкратце: за последний год стало ясно, что просто «навалить данных» уже не помогает. Чтобы робот перестал тупить в реальных задачах, нужно копать в сторону качества, переносимости между воплощениями и адаптацией в реальном мире
Что в отчете:
Выстроили многоуровневый пайплайн обучения: VLM (L0) -> SFT VLM (L1) -> претрейн VLA (R0) → SFT VLA (R1) → RL finetune (R2), где каждая фаза последовательно адаптирует модель понимать и действовать в физическом мире.
Унифицировали действия (R64): Сделали единый интерфейс для разных роботов. Использовали маскированный loss, для того чтобы разнородные пространства действий у воплощений не путали модель
Выстроили жесткий пайплайн работы с данными: Выстроили пайплайны фильтрации данных, оценки качества и разнообразия датасетов, оценки и выравнивания скорости движений в данных.
RL, JPM и OOD-detector: Научили роботов не просто копировать движения, а восстанавливаться после ошибок + обобщаться на абсолютно новые предметы без переобучения. И главное — вовремя останавливаться, а не «суетиться» после того, как задача уже сделана.
В итоге — SOTA на бенчмарках и отличная работа вживую на том же ALOHA, и нашем антропоморфном роботе - Грине. Внутри много «скучной», но важной инженерки, благодаря которой всё это реально работает, а не просто красиво выглядит на видео.
📌 Почитать можно тут: https://huggingface.co/papers/2602.00919
Наш сайт: https://sber.ru/robocenter
Резюме и предложения: @alex_postnikov26
@pdemen
(Можно написать мне если ребята не доступны:@Alexander_Nutalapati)
Будем благодарны за апвоуты и поддержку! 🙏
Что в отчете:
Выстроили многоуровневый пайплайн обучения: VLM (L0) -> SFT VLM (L1) -> претрейн VLA (R0) → SFT VLA (R1) → RL finetune (R2), где каждая фаза последовательно адаптирует модель понимать и действовать в физическом мире.
Унифицировали действия (R64): Сделали единый интерфейс для разных роботов. Использовали маскированный loss, для того чтобы разнородные пространства действий у воплощений не путали модель
Выстроили жесткий пайплайн работы с данными: Выстроили пайплайны фильтрации данных, оценки качества и разнообразия датасетов, оценки и выравнивания скорости движений в данных.
RL, JPM и OOD-detector: Научили роботов не просто копировать движения, а восстанавливаться после ошибок + обобщаться на абсолютно новые предметы без переобучения. И главное — вовремя останавливаться, а не «суетиться» после того, как задача уже сделана.
В итоге — SOTA на бенчмарках и отличная работа вживую на том же ALOHA, и нашем антропоморфном роботе - Грине. Внутри много «скучной», но важной инженерки, благодаря которой всё это реально работает, а не просто красиво выглядит на видео.
📌 Почитать можно тут: https://huggingface.co/papers/2602.00919
Наш сайт: https://sber.ru/robocenter
Резюме и предложения: @alex_postnikov26
@pdemen
(Можно написать мне если ребята не доступны:@Alexander_Nutalapati)
Будем благодарны за апвоуты и поддержку! 🙏
huggingface.co
Paper page - Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
Join the discussion on this paper page
👍8❤5🔥4
Президент Трамп прокомментировал наш техрепорт!!!
Вот это успех!
Вот это успех!
Donald J. Trump @realDonaldTrump
Я только что увидел, что Сбер Роботикс выложили свой «ГРИН ВЛА» на Хаггинг Фейс. Очень впечатляюще, очень умно! Но почему это в России? Это должно быть в АМЕРИКЕ! 🇺🇸 Мы заберем эти технологии, сделаем их ЛУЧШЕ, БЫСТРЕЕ и БОЛЬШЕ. Мы будем выигрывать в ИИ так, как никто раньше! Никто не разбирается в Роботах лучше меня, поверьте. Грин ВЛА будет работать на нас! СДЕЛАЕМ РОБОТОТЕХНИКУ СНОВА ВЕЛИКОЙ! 🤖🦾
🔥11
Сегодня в онлайне на datafest буду рассказывать про world models. Приходите послушать. https://ods.ai/events/df2026-30-may-online
🍌3
Я запрещаю вам клодить.
П.C. gpt-image 2 очень хорош в мемогенерации
П.C. gpt-image 2 очень хорош в мемогенерации
❤1
Собрал слегка нишевую🥴 подборку работ о том, как научить world models сохранять геометрию, учитывать физику, предсказывать последствия действий и не разваливать сцену при движении камеры:
TesserAct — 4D-миры для embodied AI
PointWorld — динамика сцены через 3D point flow
Aether — генерация, планирование и 4D-реконструкция в одной модели
NeoVerse — обучение 4D world model на обычных видео из интернета
ABot-PhysWorld — физически правдоподобные манипуляции роботов
VGGT-World — VGGT как авторегрессионная модель геометрического мира
LingBot-World 2.0 — интерактивные миры, способные жить дольше нескольких секунд
Go-with-the-Track — точное управление движением в видео через трекинг точек
Robo3R — быстрая 3D-реконструкция для робототехники
VGGRPO — 4D-награда за стабильную геометрию и плавное движение камеры
Спасибо Гене за ликбез
TesserAct — 4D-миры для embodied AI
PointWorld — динамика сцены через 3D point flow
Aether — генерация, планирование и 4D-реконструкция в одной модели
NeoVerse — обучение 4D world model на обычных видео из интернета
ABot-PhysWorld — физически правдоподобные манипуляции роботов
VGGT-World — VGGT как авторегрессионная модель геометрического мира
LingBot-World 2.0 — интерактивные миры, способные жить дольше нескольких секунд
Go-with-the-Track — точное управление движением в видео через трекинг точек
Robo3R — быстрая 3D-реконструкция для робототехники
VGGRPO — 4D-награда за стабильную геометрию и плавное движение камеры
Спасибо Гене за ликбез
tesseractworld.github.io
Tesseract: Learning 4D Embodied World Models
We are excited to present Learning 4D Embodied World Models, which predict the dynamic evolution of 3D scenes over time in response to an embodied agent's actions, providing both spatial and temporal consistency.
👍1
This media is not supported in your browser
VIEW IN TELEGRAM
Ну штош оно работает!
(сегодня в китае)
(сегодня в китае)
❤1
У сомнения есть неприятное свойство: пока оно не получило имени, оно портит характер.
Последние недели я был, признаться, невыносим. Стоило разговору зайти об AGI или роботах, как я начинал спорить. Не потому, что отрицал прогресс. Напротив — прогресс стал настолько убедительным, что выводы из него начали казаться подозрительно лёгкими.
Это было «чувство Доукса» — детектива из «Декстера», который раньше остальных понял, что с главным героем что-то не так, но долго не мог этого доказать. Я смотрел на демонстрации, графики и всё более ловкие модели — и чувствовал: здесь что-то не сходится.
В какой-то момент я решил, что раздражение — плохая форма мысли, и начал долгий разговор с Солом, цифровым собеседником по ИИ и робототехнике.
Начали мы с одного вопроса: LLM спасают тесты, инструменты, память и верификаторы. Код можно прогнать через unit-тест. Но что спасёт робота? Кто проверит, что он действительно убрал комнату — не оставил пыль под диваном, не разбил бокал и не размазал по полу вино?
Из этого вопроса вырос разговор об AGI, причинности, автономности и цене последнего процента надёжности. А из разговора — эссе:
«Что-то не так с AGI и роботами
(но я не могу это доказать)»
Это не научная статья и не чья-либо официальная позиция. Это авторское эссе — попытка придать форму подозрению, прежде чем оно превратится в предубеждение.
Возможно, внутри нет окончательного ответа. Но иногда честно сформулированный вопрос ценнее ещё одного уверенного прогноза.
Последние недели я был, признаться, невыносим. Стоило разговору зайти об AGI или роботах, как я начинал спорить. Не потому, что отрицал прогресс. Напротив — прогресс стал настолько убедительным, что выводы из него начали казаться подозрительно лёгкими.
Это было «чувство Доукса» — детектива из «Декстера», который раньше остальных понял, что с главным героем что-то не так, но долго не мог этого доказать. Я смотрел на демонстрации, графики и всё более ловкие модели — и чувствовал: здесь что-то не сходится.
В какой-то момент я решил, что раздражение — плохая форма мысли, и начал долгий разговор с Солом, цифровым собеседником по ИИ и робототехнике.
Начали мы с одного вопроса: LLM спасают тесты, инструменты, память и верификаторы. Код можно прогнать через unit-тест. Но что спасёт робота? Кто проверит, что он действительно убрал комнату — не оставил пыль под диваном, не разбил бокал и не размазал по полу вино?
Из этого вопроса вырос разговор об AGI, причинности, автономности и цене последнего процента надёжности. А из разговора — эссе:
«Что-то не так с AGI и роботами
(но я не могу это доказать)»
Это не научная статья и не чья-либо официальная позиция. Это авторское эссе — попытка придать форму подозрению, прежде чем оно превратится в предубеждение.
Возможно, внутри нет окончательного ответа. Но иногда честно сформулированный вопрос ценнее ещё одного уверенного прогноза.
