👀 DeepMind ТОЛЬКО ЧТО выкатила D4RT — Veo точно будет классной.
В ЧЁМ СУТЬ: Раньше 3D-реконструкция динамики была диким мучением. Приходилось склеивать пачку разных моделей (глубина, трекинг, камера), которые вечно конфликтовали и выдавали «артефакты-призраки». Архитектура обучения видеомоделей примерно такова.
Это главная боль Sora, Veo и прочих. Но в Google нашли решение!!!
Скорость взлетела в 300 раз! Минутное видео обсчитывается за 5 секунд — это уже реал-тайм.
Самое крутое: трекинг не теряется, даже если объект временно исчез. Это честное понимание геометрии, а не угадывание пикселей.
Для меня это — фундамент для World Models. Без полноценного 4D физика у нейронок всегда будет «плыть».
Если технологию внедрят в Gemini или следующий Veo 4, проблемы с галлюцинациями наконец-то уйдут в прошлое, "возможно хотя бы с имитацией движений.
Такое комбо легко оставит Sora позади — конечно же, только если они не найдут своего решения.
А что думаете вы?
Источник
#Новости
Похоже, именно так ИИ должен был «видеть» мир изначально, а не через те костыли, что видеомодели юзали раньше.
В ЧЁМ СУТЬ: Раньше 3D-реконструкция динамики была диким мучением. Приходилось склеивать пачку разных моделей (глубина, трекинг, камера), которые вечно конфликтовали и выдавали «артефакты-призраки». Архитектура обучения видеомоделей примерно такова.
Это главная боль Sora, Veo и прочих. Но в Google нашли решение!!!
И знаете? Эту модель 100% сделают частью архитектуры Veo.
Скорость взлетела в 300 раз! Минутное видео обсчитывается за 5 секунд — это уже реал-тайм.
Самое крутое: трекинг не теряется, даже если объект временно исчез. Это честное понимание геометрии, а не угадывание пикселей.
Для меня это — фундамент для World Models. Без полноценного 4D физика у нейронок всегда будет «плыть».
Если технологию внедрят в Gemini или следующий Veo 4, проблемы с галлюцинациями наконец-то уйдут в прошлое, "возможно хотя бы с имитацией движений.
Такое комбо легко оставит Sora позади — конечно же, только если они не найдут своего решения.
А что думаете вы?
Источник
#Новости
X (formerly Twitter)
Google DeepMind (@GoogleDeepMind) on X
We're helping AI to see the 3D world in motion as humans do. 🌐
Enter D4RT: a unified model that turns video into 4D representations faster than previous methods - enabling it to understand space and time. This is how it works 🧵
Enter D4RT: a unified model that turns video into 4D representations faster than previous methods - enabling it to understand space and time. This is how it works 🧵
👍3
Светлый Уголок | ии
👀 DeepMind ТОЛЬКО ЧТО выкатила D4RT — Veo точно будет классной. Похоже, именно так ИИ должен был «видеть» мир изначально, а не через те костыли, что видеомодели юзали раньше. В ЧЁМ СУТЬ: Раньше 3D-реконструкция динамики была диким мучением. Приходилось склеивать…
This media is not supported in your browser
VIEW IN TELEGRAM
☄ Пример работы D4RT.
Что она умеет уже сейчас:
– Создавать 3D-сканы из видео: Превращать любое видео с прогулкой по комнате в точную 3D-модель (намного быстрее, чем старые методы фотограмметрии).
– Делать идеальный Slow-Mo: За счет понимания глубины модель может дорисовывать кадры с учетом физики движения, а не просто размывать их.
– Удалять объекты: Можно убрать человека из видео, и D4RT корректно «заполнит» пустоту тем, что находилось за ним в 3D-сцене.
– Реальный трекинг: Выделяете точку на плече спортсмена, и модель ведет её всё видео с точностью до миллиметра, игнорируя тени и блики.
Что она умеет уже сейчас:
– Создавать 3D-сканы из видео: Превращать любое видео с прогулкой по комнате в точную 3D-модель (намного быстрее, чем старые методы фотограмметрии).
– Делать идеальный Slow-Mo: За счет понимания глубины модель может дорисовывать кадры с учетом физики движения, а не просто размывать их.
– Удалять объекты: Можно убрать человека из видео, и D4RT корректно «заполнит» пустоту тем, что находилось за ним в 3D-сцене.
– Реальный трекинг: Выделяете точку на плече спортсмена, и модель ведет её всё видео с точностью до миллиметра, игнорируя тени и блики.
❤🔥3
Google Music появится в приложении Gemini.
Музыка, созданная вами с помощью Gemini, будет храниться вместе с остальным контентом в разделе «Мои материалы»
Lyria 3?
Музыка, созданная вами с помощью Gemini, будет храниться вместе с остальным контентом в разделе «Мои материалы»
Lyria 3?
🚧 У Google сейчас серьёзные проблемы с мощностями. Они явно не успели подготовить инфраструктуру к тем нагрузкам, которые существуют сегодня.
Только представьте, насколько тяжеловесна модель NB PRO. Это реально тяжёлая модель: огромный датасет изображений в связке с самой Gemini 3 Pro. Представьте, какую колоссальную нагрузку это создаёт.
1. В последнее время я замечаю постоянные сбои в работе:
Слишком частые ошибки генерации в приложении с уведомлением: "У нас сейчас большой спрос на эту модель, попробуйте позже".
2. Я уже видел жалобы в Твиттере. Видимо на сегодня — это массовая проблема. Модели Gemini 3 перестают генерировать ответ на полпути: просто зависают и обрывают мысль.
3. Nano Banana Pro невероятно отупела. У меня большие проблемы с редактированием, модель стала лишь немного лучше первой версии (Nano Banana 1).
Исходя из этого, можно предположить, что Genie 3 и другие проекты Google пока не могут представить публике именно из-за проблем с масштабированием.
Только представьте, насколько тяжеловесна модель NB PRO. Это реально тяжёлая модель: огромный датасет изображений в связке с самой Gemini 3 Pro. Представьте, какую колоссальную нагрузку это создаёт.
1. В последнее время я замечаю постоянные сбои в работе:
Слишком частые ошибки генерации в приложении с уведомлением: "У нас сейчас большой спрос на эту модель, попробуйте позже".
2. Я уже видел жалобы в Твиттере. Видимо на сегодня — это массовая проблема. Модели Gemini 3 перестают генерировать ответ на полпути: просто зависают и обрывают мысль.
3. Nano Banana Pro невероятно отупела. У меня большие проблемы с редактированием, модель стала лишь немного лучше первой версии (Nano Banana 1).
Исходя из этого, можно предположить, что Genie 3 и другие проекты Google пока не могут представить публике именно из-за проблем с масштабированием.
👀 В Gemini Live могут добавить Gemini Agent «phone use».
Это очень интересный шаг. Я даже как-то раз думал о том, что если это есть для сайтов и ПК, то найдется и для телефонов. Ведь верно?
#Инсайд
Это очень интересный шаг. Я даже как-то раз думал о том, что если это есть для сайтов и ПК, то найдется и для телефонов. Ведь верно?
#Инсайд
❤🔥3
🔔 DeepMind может представить что-то масштабное в следующем месяце. Это инсайд.
Поэтому я делаю ставку на
Еще один кандидат —
Также возможно появление
В феврале Google много чего приготовит для нас, может быть. Пока надежд высоких не ставлю, однако все модели Gemini 3 пока что вообще нестабильные. И всё же я дам вам точный прогноз: Google собирается сделать Gemini полностью мультимодальной, и скорее всего, вы это увидите уже в самой Veo 4.
#Щитпост
#Новости
Мое предположение: они не просто обновят свои передовые модели Gemini 3, а представят какой-то принципиально новый продукт. Если они имели в виду Veo 3.2, то делать такие громкие заявления было бы глупо. Я видел Veo 3.2 — это лишь минорное обновление.
Поэтому я делаю ставку на
Lyria 3. Серьезно думаю, что она уже готова. Учитывая тот самый инсайд: «Музыка, созданная вами с помощью Gemini», было бы странно ставить старую Lyria 2. Я уверен, что обновление выйдет совсем скоро.Еще один кандидат —
Gemma 4. Линейка Gemma давно не обновлялась, и пора выпускать 4 версию. Это очень важная модель: она много знает, но при этом достаточно мало весит.Также возможно появление
Gemini 3 TTS, ведь, по данным одного источника, Google уже вовсю тестирует новую Gemini Live. Вообще, Gemini Live должна получить крупное обновление в следующем месяце — это случится в феврале.В феврале Google много чего приготовит для нас, может быть. Пока надежд высоких не ставлю, однако все модели Gemini 3 пока что вообще нестабильные. И всё же я дам вам точный прогноз: Google собирается сделать Gemini полностью мультимодальной, и скорее всего, вы это увидите уже в самой Veo 4.
#Щитпост
#Новости
❤🔥1
Forwarded from Menus AI | Новости
Какая модель лучшая на момент 2026 года?
Anonymous Poll
44%
Anthropic Opus 4.5
5%
Anthropic Sonnet 4.5
29%
OpenAI 5.2 Codex xhigh
4%
Z AI GLM 4.7
17%
Google Gemini 3 Pro
Светлый Уголок | ии
🚧 У Google сейчас серьёзные проблемы с мощностями. Они явно не успели подготовить инфраструктуру к тем нагрузкам, которые существуют сегодня. Только представьте, насколько тяжеловесна модель NB PRO. Это реально тяжёлая модель: огромный датасет изображений…
⚡️ DeepMind: всё железо на новые модели
В Google
Вот оно как. Теперь ясно почему. По сообщениям источников, приоритет отдан новым моделям, что вызвало дефицит ресурсов для текущей инфраструктуры.
Что происходит:
— Резко сокращены мощности для «некритичных» операций: отладки серверов и работы с текущими
— Инженерам поручили компенсировать нехватку железа через глубокую оптимизацию кода.
— Команда
Ситуация указывает на предельную нагрузку на вычислительную базу Google. В условиях гонки нейросетей мощностей не хватает даже гигантам.
#Новости
В Google
DeepMind произошло масштабное перераспределение мощностей ради обучения нейронок следующего поколения. Вот оно как. Теперь ясно почему. По сообщениям источников, приоритет отдан новым моделям, что вызвало дефицит ресурсов для текущей инфраструктуры.
Что происходит:
— Резко сокращены мощности для «некритичных» операций: отладки серверов и работы с текущими
LLM.— Инженерам поручили компенсировать нехватку железа через глубокую оптимизацию кода.
— Команда
DeepMind также помогает Anthropic разгребать технические проблемы с их TPU.Ограничение ресурсов осложнило даже базовую работу с железом внутри компании.
Ситуация указывает на предельную нагрузку на вычислительную базу Google. В условиях гонки нейросетей мощностей не хватает даже гигантам.
#Новости
❤🔥2
Ещё одна проблема почему Gemini 3 Pro теряет контекст. Спойлер: Google экономит. 🪙
Во-первых, KV Cache и его дикое сжатие. Кэш памяти в трансформерах жрет ресурсы линейно. Чтобы серверы не ложились, Google, судя по всему, перешла на INT2-квантование кэша. То есть данные сжимаются до 2 бит. В память влезает больше, но точность страдает фатально — отсюда и забытые куски кода или перепутанные цифры. Детали просто "мылятся" при сжатии.
Во-вторых, она реально не читает весь ваш текст. Используется механизм маршрутизации внимания. Модель сканирует контекст и выбирает, какие токены обрабатывать, а какие — пропустить, чтобы сэкономить вычислительный бюджет. Если алгоритм посчитал кусок вашего промпта "шумом", модель его физически не увидит при ответе.
Хорошая новость в том, что это, вероятно, временно? Не знаю. Этой проблеме уже 2 года. Все модели Gemini получают большой урон от этого. Но в любом случае, Google готовит архитектуру TITANS и систему MIRAS — это переход к нейронной долгосрочной памяти.
#Мысли
Автор — @Geometry90
Многие замечали, что после 10-20к токенов Gemini превращается в тыкву: забывает начало диалога, выдумывает факты и теряет нить. Я покопался в доках и профильных тредах, и, кажется, проблема не в "глюках", а в сознательной (и довольно жесткой) оптимизации.Тут работают два фактора:
Во-первых, KV Cache и его дикое сжатие. Кэш памяти в трансформерах жрет ресурсы линейно. Чтобы серверы не ложились, Google, судя по всему, перешла на INT2-квантование кэша. То есть данные сжимаются до 2 бит. В память влезает больше, но точность страдает фатально — отсюда и забытые куски кода или перепутанные цифры. Детали просто "мылятся" при сжатии.
Во-вторых, она реально не читает весь ваш текст. Используется механизм маршрутизации внимания. Модель сканирует контекст и выбирает, какие токены обрабатывать, а какие — пропустить, чтобы сэкономить вычислительный бюджет. Если алгоритм посчитал кусок вашего промпта "шумом", модель его физически не увидит при ответе.
Хорошая новость в том, что это, вероятно, временно? Не знаю. Этой проблеме уже 2 года. Все модели Gemini получают большой урон от этого. Но в любом случае, Google готовит архитектуру TITANS и систему MIRAS — это переход к нейронной долгосрочной памяти.
В общем, сейчас такое время, где Google пытается сэкономить на TPU. Ждем Gemini 3.5 и новой архитектуры, там это должны пофиксить. Чего ждать дальше не знаю
#Мысли
Автор — @Geometry90
🤔3
В ближайшее время выйдет много всего интересного!
Делюсь примерными сроками: они почти точные, хотя всегда стоит оставлять долю сомнения в источниках.
Делюсь примерными сроками: они почти точные, хотя всегда стоит оставлять долю сомнения в источниках.
Grok 4.20 — на этой неделе. Но разработчики могут снова замолчать и подвести всех, как это часто бывает. Все уже видели каким будет Grok 4.20. ТАК И ПРОИЗОШЛО БЛЯТЬ ПЕРЕНЕСЛИ ДО СЕРЕДИНЫ ФЕВРАЛЯ! ОТЛИЧНО НАХ! 🥳ChatGPT 5.3 — ставлю, что он станет лучше во всех аспектах: станет живее, а фронтенд сильно подтянут. Релиз будет скоро, ждём в течение двух недель (конец января — начало февраля).Claude 4.7 Sonnet — он должен быть во всём лучше Opus: дешевле, быстрее и круче. Срок — февраль.Gemini 3 Pro GA — особых надежд на них не питаю. Версия GA не стала толком лучше в тех аспектах, где сейчас лидируют Claude и ChatGPT (я про агентность и галлюцинации). Судя по всему, они не стремятся исправлять это и в Gemini 3.5. Дата — середина февраля.DeepSeek R2 и V4 — я просто верю в них. Ребята должны сделать что-то классное. Судя по их статьям и фактам, они много работали, так что фраза «релиз будет крутым» звучит вполне оправданно. Выход ожидается до 17 февраля.Вот так: у каждой компании и каждой модели свои причуды и своя история. Ждём.
X (formerly Twitter)
Chetaslua (@chetaslua) on X
So our team are working to get latest and finest information before anyone .\
> Sonnet
> Gemini 3.0 pro GA
> GPT 5.3
one good news < sonnet will be better , cheaper and faster than opus 4.5 > i mean in every criteria
follow @legit_api @Liam06972452…
> Sonnet
> Gemini 3.0 pro GA
> GPT 5.3
one good news < sonnet will be better , cheaper and faster than opus 4.5 > i mean in every criteria
follow @legit_api @Liam06972452…
❤🔥4
Google купил CSM: 3D в Gemini?
Google тихо поглотил стартап
Что это значит прямо сейчас:
— Google забрал себе топовую технологию 2D → 3D.
— Пока публичных фич нет, сделку провели без лишнего шума.
— В
После интеграции CSM из текста или фото можно будет получать не просто картинку, а готовую 3D-модель, которую можно скачать и сразу юзать.
Кстати, это лишь часть недели: ещё была лицензия от
Источник:
#Новости #Инсайд
Google тихо поглотил стартап
Common Sense Machines (CSM). Это небольшая команда из ~12 крутых спецов, которые делают одну из лучших технологий превращения 2D-картинок в полноценные 3D-модели.Что это значит прямо сейчас:
— Google забрал себе топовую технологию 2D → 3D.
— Пока публичных фич нет, сделку провели без лишнего шума.
— В
Gemini добавят генерацию 3D нативно. Скорее всего, это случится уже в следующих Nano Banana.После интеграции CSM из текста или фото можно будет получать не просто картинку, а готовую 3D-модель, которую можно скачать и сразу юзать.
От себя:
Думаю, увидим это в 2026 году или даже на Google I/O в мае в обновлениях Gemini app / AI Studio. Google обычно очень быстро внедряет такие штуки.
Кстати, это лишь часть недели: ещё была лицензия от
Hume AI (эмоциональный голос). Об этом напишу позже.Источник:
#Новости #Инсайд
❤🔥4👍1
🐰 Клон Windows XP за один промпт
Gemini
Прикольно? Прикольно.
Это сильное улучшение по сравнению с
Выкатят ли её в таком виде в GA — большой вопрос. Мы знаем любовь Google всё резать ради экономии ресурсов.
И кстати,
#Новости #Инсайд
Gemini
Snowbunny собрала интерфейс старой винды всего по одному запросу.Прикольно? Прикольно.
Это сильное улучшение по сравнению с
Gemini 3 pro — она такого не может.Выкатят ли её в таком виде в GA — большой вопрос. Мы знаем любовь Google всё резать ради экономии ресурсов.
И кстати,
Snowbunny уже понерфили, но даже так она крутая.#Новости #Инсайд
Светлый Уголок | ии
Grok в X генерит 183 млн картинок
Как это? 🤣 Ладно, ладно.
Статистика в день:
—
—
#Щитпост
Как это? 🤣 Ладно, ладно.
Grok интегрировали в X. Разница в цифрах обусловлена его распространением среди юзеров и бесшовной интеграцией.
Статистика в день:
—
Grok: около 183 млн изображений—
Nano Banana Pro: ~19 млн (1 млрд за 53 дня)#Щитпост
🤔1
Altman зовёт AI-разработчиков на town hall OpenAI
OpenAI проводит сбор отзывов перед релизом инструментов нового поколения. Тестирование проходит в экспериментальном формате, а результаты обсуждения будут опубликованы в открытом доступе.
Перевод:
Трансляция будет на YouTube 27 января 2026, 03:00 МСК если кому интересно
Ждёте новостей насчёт Gpt 5.3?
#Новости
OpenAI проводит сбор отзывов перед релизом инструментов нового поколения. Тестирование проходит в экспериментальном формате, а результаты обсуждения будут опубликованы в открытом доступе.
Перевод:
Завтра мы проведём town hall для AI-билдеров в OpenAI. Мы хотим фидбек, потому что начинаем создавать новое поколение инструментов.
Трансляция будет на YouTube 27 января 2026, 03:00 МСК если кому интересно
Ждёте новостей насчёт Gpt 5.3?
#Новости
