Google планирует выпустить новую версию VEO – 3.2. И скорее всего это произойдет уже в этом месяце!
Я проверил, и да, всё верно, в коде google flow уже существует данный нейминг новой модели Veo.
Также стоит прояснить ситуацию с моделью Siren на LM Arena. Мои предыдущие догадки не подтвердились: вероятнее всего, это Grok Imagine, готовящийся к выходу в API.
Источник
#Новости
Я проверил, и да, всё верно, в коде google flow уже существует данный нейминг новой модели Veo.
Также стоит прояснить ситуацию с моделью Siren на LM Arena. Мои предыдущие догадки не подтвердились: вероятнее всего, это Grok Imagine, готовящийся к выходу в API.
Источник
#Новости
Светлый Уголок | ии
Google планирует выпустить новую версию VEO – 3.2. И скорее всего это произойдет уже в этом месяце! Я проверил, и да, всё верно, в коде google flow уже существует данный нейминг новой модели Veo. Также стоит прояснить ситуацию с моделью Siren на LM Arena.…
This media is not supported in your browser
VIEW IN TELEGRAM
Генерация предварительной версии Veo 3.2.
На данный момент я не могу подтвердить, что это оригинальная Veo 3.2
👀 DeepSeek R2 или V4 на подходе!
Такое обычно делают за 1–3 дня до релиза.
Плюс сегодня ровно год с выхода R1 — идеальный тайминг для выхода чего-то грандиозного.
#Новости
В репозитории FlashMLA (ядра для V3/V3.2) добавили поддержку MODEL1 как отдельной модели.
Ключевые изменения:
KV-cache stride: 576B (против 656B у V3.2) – это может означать, что архитектуру хорошо улучшили.
Такое обычно делают за 1–3 дня до релиза.
Плюс сегодня ровно год с выхода R1 — идеальный тайминг для выхода чего-то грандиозного.
#Новости
❤🔥1
Светлый Уголок | ии
🐇 Новая Gemini "Snowbunny" просто уничтожает конкурентов в бенчмарке "Heiroglyph Benchmark Results". Перед вами результаты теста новой контрольной точки Gemini. На удивление она набирает значительно больше, чем сама Gemini 3 Pro, Lithiumflow и даже GPT-5.…
Audio
Несколько исполнительных треков от Gemini "Snowbunny"
#Щитпост
#Щитпост
Google признает: Главный тормоз ИИ — это не отсутствие чипов. Проблема в энергосетях.
Google признали очень показательную вещь:
В некоторых регионах ожидание подключения растягивается на 10–12 лет. Представьте, один только этап «исследования возможности подключения» может занимать годы.
Чипы — проблему почти решили.
GPU можно купить. Да, это конские бюджеты, но это решаемый вопрос денег.
Электричество — тоже решаемо.
BigTech (Google, Microsoft, Amazon) уже вовсю заходит в атомку, строит свою генерацию и подписывает контракты на десятилетия вперёд.
Grid connection — Линии перегружены, а очереди на исследования и разрешения расписаны на десятилетия вперёд.
Тот, кто быстрее всех решит проблему с сетями, и будет диктовать правила в гонке.
Кстати, у Google сейчас большие проблемы с этим. Больше чем у OAI.
Источник
#Новости
Google признали очень показательную вещь:
Сейчас самое сложное в запуске новых дата-центров — не контракт на энергию подписать, а физически подключиться к магистральной сети.
В некоторых регионах ожидание подключения растягивается на 10–12 лет. Представьте, один только этап «исследования возможности подключения» может занимать годы.
Чипы — проблему почти решили.
GPU можно купить. Да, это конские бюджеты, но это решаемый вопрос денег.
Электричество — тоже решаемо.
BigTech (Google, Microsoft, Amazon) уже вовсю заходит в атомку, строит свою генерацию и подписывает контракты на десятилетия вперёд.
Grid connection — Линии перегружены, а очереди на исследования и разрешения расписаны на десятилетия вперёд.
Тот, кто быстрее всех решит проблему с сетями, и будет диктовать правила в гонке.
Кстати, у Google сейчас большие проблемы с этим. Больше чем у OAI.
Источник
#Новости
«Круто, когда у тебя есть 6-8 постов наперёд, но момент сейчас не идеальный. Не самое лучшее время, чтобы их выкладывать. 😏»
😁3
Светлый Уголок | ии
Google планирует выпустить новую версию VEO – 3.2. И скорее всего это произойдет уже в этом месяце! Я проверил, и да, всё верно, в коде google flow уже существует данный нейминг новой модели Veo. Также стоит прояснить ситуацию с моделью Siren на LM Arena.…
Получил генерацию Veo 3.2.
Left Veo 3.2 Right Veo 3.1
Получилось круто. Это лучше чем Veo 3.1.
Из изменений, кратко:
– Звук реалистичнее, тот самый роботизированный шум подавлен.
– Картинка куда натуральнее.
– Качество видео и исполнение промта явно лучшие.
Left Veo 3.2 Right Veo 3.1
Получилось круто. Это лучше чем Veo 3.1.
Из изменений, кратко:
– Звук реалистичнее, тот самый роботизированный шум подавлен.
– Картинка куда натуральнее.
– Качество видео и исполнение промта явно лучшие.
👍3
Светлый Уголок | ии
🌲 Новая Gemini 3.5 Flash Image (она же NANO BANANA V3) P.S. — Выяснилось, что это просто внутренняя модель для сотрудников Google. На данный момент никакой информации о Nano banana v3 нет. Это уровень выше Pro! Хотя мелкие огрехи в лицах и деталях текста…
Я протестировал эту модель.
Что это? NB 3? NB 2 (Update)?
Является ли эта модель основой Gemini 3.5 или нет?
Здесь мнения расходятся. Кто-то считает, что это Nano Banana Pro GA, но большинство склоняется к версии о Gemini 3.5. Лично я считаю, что возможно всё, но пока это лишь предположения.
– Скорость: В среднем генерация занимает 10–40 секунд.
– Работа с текстом: Пишет точнее, чем версия Pro.
– Графика интерфейсов: Скриншоты из различных игр в 4K делает определенно лучше и детальнее, чем NB Pro.
– Визуал: Работа с экспозицией и визуализацией на голову выше текущей Pro-версии.
– Энергичность: Модель «не ленивая», в плане проработки графики работает здорово.
– Понимание промтов: Реализует идеи заметно лучше. Она будто читает мысли и воплощает именно тот образ, который возник в голове. На мой взгляд, текущая NB Pro справляется с этим хуже.
– Редактирование: Улучшенное сохранение деталей и глубокое понимание контекста при правках.
– Актуальность данных: Дата отсечки знаний осталась той же, что и у NB Pro — примерно конец 2024 года.
– Мелкие детали: Всё ещё встречаются искажения в очень мелком тексте.
– Артефакты: Иногда их бывает даже больше, чем у NB Pro.
Что это? NB 3? NB 2 (Update)?
Для начала стоит определиться:
Является ли эта модель основой Gemini 3.5 или нет?
Здесь мнения расходятся. Кто-то считает, что это Nano Banana Pro GA, но большинство склоняется к версии о Gemini 3.5. Лично я считаю, что возможно всё, но пока это лишь предположения.
Из заметных улучшений:
– Скорость: В среднем генерация занимает 10–40 секунд.
– Работа с текстом: Пишет точнее, чем версия Pro.
– Графика интерфейсов: Скриншоты из различных игр в 4K делает определенно лучше и детальнее, чем NB Pro.
– Визуал: Работа с экспозицией и визуализацией на голову выше текущей Pro-версии.
– Энергичность: Модель «не ленивая», в плане проработки графики работает здорово.
– Понимание промтов: Реализует идеи заметно лучше. Она будто читает мысли и воплощает именно тот образ, который возник в голове. На мой взгляд, текущая NB Pro справляется с этим хуже.
– Редактирование: Улучшенное сохранение деталей и глубокое понимание контекста при правках.
Примечания и минусы:
– Актуальность данных: Дата отсечки знаний осталась той же, что и у NB Pro — примерно конец 2024 года.
– Мелкие детали: Всё ещё встречаются искажения в очень мелком тексте.
– Артефакты: Иногда их бывает даже больше, чем у NB Pro.
Итог: На сегодняшний день это, пожалуй, лучшая модель. Она кажется мне гораздо удачнее даже специальной версии NB Pro.
🤔3
👀 DeepMind ТОЛЬКО ЧТО выкатила D4RT — Veo точно будет классной.
В ЧЁМ СУТЬ: Раньше 3D-реконструкция динамики была диким мучением. Приходилось склеивать пачку разных моделей (глубина, трекинг, камера), которые вечно конфликтовали и выдавали «артефакты-призраки». Архитектура обучения видеомоделей примерно такова.
Это главная боль Sora, Veo и прочих. Но в Google нашли решение!!!
Скорость взлетела в 300 раз! Минутное видео обсчитывается за 5 секунд — это уже реал-тайм.
Самое крутое: трекинг не теряется, даже если объект временно исчез. Это честное понимание геометрии, а не угадывание пикселей.
Для меня это — фундамент для World Models. Без полноценного 4D физика у нейронок всегда будет «плыть».
Если технологию внедрят в Gemini или следующий Veo 4, проблемы с галлюцинациями наконец-то уйдут в прошлое, "возможно хотя бы с имитацией движений.
Такое комбо легко оставит Sora позади — конечно же, только если они не найдут своего решения.
А что думаете вы?
Источник
#Новости
Похоже, именно так ИИ должен был «видеть» мир изначально, а не через те костыли, что видеомодели юзали раньше.
В ЧЁМ СУТЬ: Раньше 3D-реконструкция динамики была диким мучением. Приходилось склеивать пачку разных моделей (глубина, трекинг, камера), которые вечно конфликтовали и выдавали «артефакты-призраки». Архитектура обучения видеомоделей примерно такова.
Это главная боль Sora, Veo и прочих. Но в Google нашли решение!!!
И знаете? Эту модель 100% сделают частью архитектуры Veo.
Скорость взлетела в 300 раз! Минутное видео обсчитывается за 5 секунд — это уже реал-тайм.
Самое крутое: трекинг не теряется, даже если объект временно исчез. Это честное понимание геометрии, а не угадывание пикселей.
Для меня это — фундамент для World Models. Без полноценного 4D физика у нейронок всегда будет «плыть».
Если технологию внедрят в Gemini или следующий Veo 4, проблемы с галлюцинациями наконец-то уйдут в прошлое, "возможно хотя бы с имитацией движений.
Такое комбо легко оставит Sora позади — конечно же, только если они не найдут своего решения.
А что думаете вы?
Источник
#Новости
X (formerly Twitter)
Google DeepMind (@GoogleDeepMind) on X
We're helping AI to see the 3D world in motion as humans do. 🌐
Enter D4RT: a unified model that turns video into 4D representations faster than previous methods - enabling it to understand space and time. This is how it works 🧵
Enter D4RT: a unified model that turns video into 4D representations faster than previous methods - enabling it to understand space and time. This is how it works 🧵
👍3
Светлый Уголок | ии
👀 DeepMind ТОЛЬКО ЧТО выкатила D4RT — Veo точно будет классной. Похоже, именно так ИИ должен был «видеть» мир изначально, а не через те костыли, что видеомодели юзали раньше. В ЧЁМ СУТЬ: Раньше 3D-реконструкция динамики была диким мучением. Приходилось склеивать…
This media is not supported in your browser
VIEW IN TELEGRAM
☄ Пример работы D4RT.
Что она умеет уже сейчас:
– Создавать 3D-сканы из видео: Превращать любое видео с прогулкой по комнате в точную 3D-модель (намного быстрее, чем старые методы фотограмметрии).
– Делать идеальный Slow-Mo: За счет понимания глубины модель может дорисовывать кадры с учетом физики движения, а не просто размывать их.
– Удалять объекты: Можно убрать человека из видео, и D4RT корректно «заполнит» пустоту тем, что находилось за ним в 3D-сцене.
– Реальный трекинг: Выделяете точку на плече спортсмена, и модель ведет её всё видео с точностью до миллиметра, игнорируя тени и блики.
Что она умеет уже сейчас:
– Создавать 3D-сканы из видео: Превращать любое видео с прогулкой по комнате в точную 3D-модель (намного быстрее, чем старые методы фотограмметрии).
– Делать идеальный Slow-Mo: За счет понимания глубины модель может дорисовывать кадры с учетом физики движения, а не просто размывать их.
– Удалять объекты: Можно убрать человека из видео, и D4RT корректно «заполнит» пустоту тем, что находилось за ним в 3D-сцене.
– Реальный трекинг: Выделяете точку на плече спортсмена, и модель ведет её всё видео с точностью до миллиметра, игнорируя тени и блики.
❤🔥3
Google Music появится в приложении Gemini.
Музыка, созданная вами с помощью Gemini, будет храниться вместе с остальным контентом в разделе «Мои материалы»
Lyria 3?
Музыка, созданная вами с помощью Gemini, будет храниться вместе с остальным контентом в разделе «Мои материалы»
Lyria 3?
🚧 У Google сейчас серьёзные проблемы с мощностями. Они явно не успели подготовить инфраструктуру к тем нагрузкам, которые существуют сегодня.
Только представьте, насколько тяжеловесна модель NB PRO. Это реально тяжёлая модель: огромный датасет изображений в связке с самой Gemini 3 Pro. Представьте, какую колоссальную нагрузку это создаёт.
1. В последнее время я замечаю постоянные сбои в работе:
Слишком частые ошибки генерации в приложении с уведомлением: "У нас сейчас большой спрос на эту модель, попробуйте позже".
2. Я уже видел жалобы в Твиттере. Видимо на сегодня — это массовая проблема. Модели Gemini 3 перестают генерировать ответ на полпути: просто зависают и обрывают мысль.
3. Nano Banana Pro невероятно отупела. У меня большие проблемы с редактированием, модель стала лишь немного лучше первой версии (Nano Banana 1).
Исходя из этого, можно предположить, что Genie 3 и другие проекты Google пока не могут представить публике именно из-за проблем с масштабированием.
Только представьте, насколько тяжеловесна модель NB PRO. Это реально тяжёлая модель: огромный датасет изображений в связке с самой Gemini 3 Pro. Представьте, какую колоссальную нагрузку это создаёт.
1. В последнее время я замечаю постоянные сбои в работе:
Слишком частые ошибки генерации в приложении с уведомлением: "У нас сейчас большой спрос на эту модель, попробуйте позже".
2. Я уже видел жалобы в Твиттере. Видимо на сегодня — это массовая проблема. Модели Gemini 3 перестают генерировать ответ на полпути: просто зависают и обрывают мысль.
3. Nano Banana Pro невероятно отупела. У меня большие проблемы с редактированием, модель стала лишь немного лучше первой версии (Nano Banana 1).
Исходя из этого, можно предположить, что Genie 3 и другие проекты Google пока не могут представить публике именно из-за проблем с масштабированием.
👀 В Gemini Live могут добавить Gemini Agent «phone use».
Это очень интересный шаг. Я даже как-то раз думал о том, что если это есть для сайтов и ПК, то найдется и для телефонов. Ведь верно?
#Инсайд
Это очень интересный шаг. Я даже как-то раз думал о том, что если это есть для сайтов и ПК, то найдется и для телефонов. Ведь верно?
#Инсайд
❤🔥3
🔔 DeepMind может представить что-то масштабное в следующем месяце. Это инсайд.
Поэтому я делаю ставку на
Еще один кандидат —
Также возможно появление
В феврале Google много чего приготовит для нас, может быть. Пока надежд высоких не ставлю, однако все модели Gemini 3 пока что вообще нестабильные. И всё же я дам вам точный прогноз: Google собирается сделать Gemini полностью мультимодальной, и скорее всего, вы это увидите уже в самой Veo 4.
#Щитпост
#Новости
Мое предположение: они не просто обновят свои передовые модели Gemini 3, а представят какой-то принципиально новый продукт. Если они имели в виду Veo 3.2, то делать такие громкие заявления было бы глупо. Я видел Veo 3.2 — это лишь минорное обновление.
Поэтому я делаю ставку на
Lyria 3. Серьезно думаю, что она уже готова. Учитывая тот самый инсайд: «Музыка, созданная вами с помощью Gemini», было бы странно ставить старую Lyria 2. Я уверен, что обновление выйдет совсем скоро.Еще один кандидат —
Gemma 4. Линейка Gemma давно не обновлялась, и пора выпускать 4 версию. Это очень важная модель: она много знает, но при этом достаточно мало весит.Также возможно появление
Gemini 3 TTS, ведь, по данным одного источника, Google уже вовсю тестирует новую Gemini Live. Вообще, Gemini Live должна получить крупное обновление в следующем месяце — это случится в феврале.В феврале Google много чего приготовит для нас, может быть. Пока надежд высоких не ставлю, однако все модели Gemini 3 пока что вообще нестабильные. И всё же я дам вам точный прогноз: Google собирается сделать Gemini полностью мультимодальной, и скорее всего, вы это увидите уже в самой Veo 4.
#Щитпост
#Новости
❤🔥1
