Светлый Уголок | ии
🌲 Новая Gemini 3.5 Flash Image (она же NANO BANANA V3) P.S. — Выяснилось, что это просто внутренняя модель для сотрудников Google. На данный момент никакой информации о Nano banana v3 нет. Это уровень выше Pro! Хотя мелкие огрехи в лицах и деталях текста…
Я протестировал эту модель.
Что это? NB 3? NB 2 (Update)?
Является ли эта модель основой Gemini 3.5 или нет?
Здесь мнения расходятся. Кто-то считает, что это Nano Banana Pro GA, но большинство склоняется к версии о Gemini 3.5. Лично я считаю, что возможно всё, но пока это лишь предположения.
– Скорость: В среднем генерация занимает 10–40 секунд.
– Работа с текстом: Пишет точнее, чем версия Pro.
– Графика интерфейсов: Скриншоты из различных игр в 4K делает определенно лучше и детальнее, чем NB Pro.
– Визуал: Работа с экспозицией и визуализацией на голову выше текущей Pro-версии.
– Энергичность: Модель «не ленивая», в плане проработки графики работает здорово.
– Понимание промтов: Реализует идеи заметно лучше. Она будто читает мысли и воплощает именно тот образ, который возник в голове. На мой взгляд, текущая NB Pro справляется с этим хуже.
– Редактирование: Улучшенное сохранение деталей и глубокое понимание контекста при правках.
– Актуальность данных: Дата отсечки знаний осталась той же, что и у NB Pro — примерно конец 2024 года.
– Мелкие детали: Всё ещё встречаются искажения в очень мелком тексте.
– Артефакты: Иногда их бывает даже больше, чем у NB Pro.
Что это? NB 3? NB 2 (Update)?
Для начала стоит определиться:
Является ли эта модель основой Gemini 3.5 или нет?
Здесь мнения расходятся. Кто-то считает, что это Nano Banana Pro GA, но большинство склоняется к версии о Gemini 3.5. Лично я считаю, что возможно всё, но пока это лишь предположения.
Из заметных улучшений:
– Скорость: В среднем генерация занимает 10–40 секунд.
– Работа с текстом: Пишет точнее, чем версия Pro.
– Графика интерфейсов: Скриншоты из различных игр в 4K делает определенно лучше и детальнее, чем NB Pro.
– Визуал: Работа с экспозицией и визуализацией на голову выше текущей Pro-версии.
– Энергичность: Модель «не ленивая», в плане проработки графики работает здорово.
– Понимание промтов: Реализует идеи заметно лучше. Она будто читает мысли и воплощает именно тот образ, который возник в голове. На мой взгляд, текущая NB Pro справляется с этим хуже.
– Редактирование: Улучшенное сохранение деталей и глубокое понимание контекста при правках.
Примечания и минусы:
– Актуальность данных: Дата отсечки знаний осталась той же, что и у NB Pro — примерно конец 2024 года.
– Мелкие детали: Всё ещё встречаются искажения в очень мелком тексте.
– Артефакты: Иногда их бывает даже больше, чем у NB Pro.
Итог: На сегодняшний день это, пожалуй, лучшая модель. Она кажется мне гораздо удачнее даже специальной версии NB Pro.
🤔3
👀 DeepMind ТОЛЬКО ЧТО выкатила D4RT — Veo точно будет классной.
В ЧЁМ СУТЬ: Раньше 3D-реконструкция динамики была диким мучением. Приходилось склеивать пачку разных моделей (глубина, трекинг, камера), которые вечно конфликтовали и выдавали «артефакты-призраки». Архитектура обучения видеомоделей примерно такова.
Это главная боль Sora, Veo и прочих. Но в Google нашли решение!!!
Скорость взлетела в 300 раз! Минутное видео обсчитывается за 5 секунд — это уже реал-тайм.
Самое крутое: трекинг не теряется, даже если объект временно исчез. Это честное понимание геометрии, а не угадывание пикселей.
Для меня это — фундамент для World Models. Без полноценного 4D физика у нейронок всегда будет «плыть».
Если технологию внедрят в Gemini или следующий Veo 4, проблемы с галлюцинациями наконец-то уйдут в прошлое, "возможно хотя бы с имитацией движений.
Такое комбо легко оставит Sora позади — конечно же, только если они не найдут своего решения.
А что думаете вы?
Источник
#Новости
Похоже, именно так ИИ должен был «видеть» мир изначально, а не через те костыли, что видеомодели юзали раньше.
В ЧЁМ СУТЬ: Раньше 3D-реконструкция динамики была диким мучением. Приходилось склеивать пачку разных моделей (глубина, трекинг, камера), которые вечно конфликтовали и выдавали «артефакты-призраки». Архитектура обучения видеомоделей примерно такова.
Это главная боль Sora, Veo и прочих. Но в Google нашли решение!!!
И знаете? Эту модель 100% сделают частью архитектуры Veo.
Скорость взлетела в 300 раз! Минутное видео обсчитывается за 5 секунд — это уже реал-тайм.
Самое крутое: трекинг не теряется, даже если объект временно исчез. Это честное понимание геометрии, а не угадывание пикселей.
Для меня это — фундамент для World Models. Без полноценного 4D физика у нейронок всегда будет «плыть».
Если технологию внедрят в Gemini или следующий Veo 4, проблемы с галлюцинациями наконец-то уйдут в прошлое, "возможно хотя бы с имитацией движений.
Такое комбо легко оставит Sora позади — конечно же, только если они не найдут своего решения.
А что думаете вы?
Источник
#Новости
X (formerly Twitter)
Google DeepMind (@GoogleDeepMind) on X
We're helping AI to see the 3D world in motion as humans do. 🌐
Enter D4RT: a unified model that turns video into 4D representations faster than previous methods - enabling it to understand space and time. This is how it works 🧵
Enter D4RT: a unified model that turns video into 4D representations faster than previous methods - enabling it to understand space and time. This is how it works 🧵
👍3
Светлый Уголок | ии
👀 DeepMind ТОЛЬКО ЧТО выкатила D4RT — Veo точно будет классной. Похоже, именно так ИИ должен был «видеть» мир изначально, а не через те костыли, что видеомодели юзали раньше. В ЧЁМ СУТЬ: Раньше 3D-реконструкция динамики была диким мучением. Приходилось склеивать…
This media is not supported in your browser
VIEW IN TELEGRAM
☄ Пример работы D4RT.
Что она умеет уже сейчас:
– Создавать 3D-сканы из видео: Превращать любое видео с прогулкой по комнате в точную 3D-модель (намного быстрее, чем старые методы фотограмметрии).
– Делать идеальный Slow-Mo: За счет понимания глубины модель может дорисовывать кадры с учетом физики движения, а не просто размывать их.
– Удалять объекты: Можно убрать человека из видео, и D4RT корректно «заполнит» пустоту тем, что находилось за ним в 3D-сцене.
– Реальный трекинг: Выделяете точку на плече спортсмена, и модель ведет её всё видео с точностью до миллиметра, игнорируя тени и блики.
Что она умеет уже сейчас:
– Создавать 3D-сканы из видео: Превращать любое видео с прогулкой по комнате в точную 3D-модель (намного быстрее, чем старые методы фотограмметрии).
– Делать идеальный Slow-Mo: За счет понимания глубины модель может дорисовывать кадры с учетом физики движения, а не просто размывать их.
– Удалять объекты: Можно убрать человека из видео, и D4RT корректно «заполнит» пустоту тем, что находилось за ним в 3D-сцене.
– Реальный трекинг: Выделяете точку на плече спортсмена, и модель ведет её всё видео с точностью до миллиметра, игнорируя тени и блики.
❤🔥3
Google Music появится в приложении Gemini.
Музыка, созданная вами с помощью Gemini, будет храниться вместе с остальным контентом в разделе «Мои материалы»
Lyria 3?
Музыка, созданная вами с помощью Gemini, будет храниться вместе с остальным контентом в разделе «Мои материалы»
Lyria 3?
🚧 У Google сейчас серьёзные проблемы с мощностями. Они явно не успели подготовить инфраструктуру к тем нагрузкам, которые существуют сегодня.
Только представьте, насколько тяжеловесна модель NB PRO. Это реально тяжёлая модель: огромный датасет изображений в связке с самой Gemini 3 Pro. Представьте, какую колоссальную нагрузку это создаёт.
1. В последнее время я замечаю постоянные сбои в работе:
Слишком частые ошибки генерации в приложении с уведомлением: "У нас сейчас большой спрос на эту модель, попробуйте позже".
2. Я уже видел жалобы в Твиттере. Видимо на сегодня — это массовая проблема. Модели Gemini 3 перестают генерировать ответ на полпути: просто зависают и обрывают мысль.
3. Nano Banana Pro невероятно отупела. У меня большие проблемы с редактированием, модель стала лишь немного лучше первой версии (Nano Banana 1).
Исходя из этого, можно предположить, что Genie 3 и другие проекты Google пока не могут представить публике именно из-за проблем с масштабированием.
Только представьте, насколько тяжеловесна модель NB PRO. Это реально тяжёлая модель: огромный датасет изображений в связке с самой Gemini 3 Pro. Представьте, какую колоссальную нагрузку это создаёт.
1. В последнее время я замечаю постоянные сбои в работе:
Слишком частые ошибки генерации в приложении с уведомлением: "У нас сейчас большой спрос на эту модель, попробуйте позже".
2. Я уже видел жалобы в Твиттере. Видимо на сегодня — это массовая проблема. Модели Gemini 3 перестают генерировать ответ на полпути: просто зависают и обрывают мысль.
3. Nano Banana Pro невероятно отупела. У меня большие проблемы с редактированием, модель стала лишь немного лучше первой версии (Nano Banana 1).
Исходя из этого, можно предположить, что Genie 3 и другие проекты Google пока не могут представить публике именно из-за проблем с масштабированием.
👀 В Gemini Live могут добавить Gemini Agent «phone use».
Это очень интересный шаг. Я даже как-то раз думал о том, что если это есть для сайтов и ПК, то найдется и для телефонов. Ведь верно?
#Инсайд
Это очень интересный шаг. Я даже как-то раз думал о том, что если это есть для сайтов и ПК, то найдется и для телефонов. Ведь верно?
#Инсайд
❤🔥3
🔔 DeepMind может представить что-то масштабное в следующем месяце. Это инсайд.
Поэтому я делаю ставку на
Еще один кандидат —
Также возможно появление
В феврале Google много чего приготовит для нас, может быть. Пока надежд высоких не ставлю, однако все модели Gemini 3 пока что вообще нестабильные. И всё же я дам вам точный прогноз: Google собирается сделать Gemini полностью мультимодальной, и скорее всего, вы это увидите уже в самой Veo 4.
#Щитпост
#Новости
Мое предположение: они не просто обновят свои передовые модели Gemini 3, а представят какой-то принципиально новый продукт. Если они имели в виду Veo 3.2, то делать такие громкие заявления было бы глупо. Я видел Veo 3.2 — это лишь минорное обновление.
Поэтому я делаю ставку на
Lyria 3. Серьезно думаю, что она уже готова. Учитывая тот самый инсайд: «Музыка, созданная вами с помощью Gemini», было бы странно ставить старую Lyria 2. Я уверен, что обновление выйдет совсем скоро.Еще один кандидат —
Gemma 4. Линейка Gemma давно не обновлялась, и пора выпускать 4 версию. Это очень важная модель: она много знает, но при этом достаточно мало весит.Также возможно появление
Gemini 3 TTS, ведь, по данным одного источника, Google уже вовсю тестирует новую Gemini Live. Вообще, Gemini Live должна получить крупное обновление в следующем месяце — это случится в феврале.В феврале Google много чего приготовит для нас, может быть. Пока надежд высоких не ставлю, однако все модели Gemini 3 пока что вообще нестабильные. И всё же я дам вам точный прогноз: Google собирается сделать Gemini полностью мультимодальной, и скорее всего, вы это увидите уже в самой Veo 4.
#Щитпост
#Новости
❤🔥1
Forwarded from Menus AI | Новости
Какая модель лучшая на момент 2026 года?
Anonymous Poll
44%
Anthropic Opus 4.5
5%
Anthropic Sonnet 4.5
29%
OpenAI 5.2 Codex xhigh
4%
Z AI GLM 4.7
17%
Google Gemini 3 Pro
Светлый Уголок | ии
🚧 У Google сейчас серьёзные проблемы с мощностями. Они явно не успели подготовить инфраструктуру к тем нагрузкам, которые существуют сегодня. Только представьте, насколько тяжеловесна модель NB PRO. Это реально тяжёлая модель: огромный датасет изображений…
⚡️ DeepMind: всё железо на новые модели
В Google
Вот оно как. Теперь ясно почему. По сообщениям источников, приоритет отдан новым моделям, что вызвало дефицит ресурсов для текущей инфраструктуры.
Что происходит:
— Резко сокращены мощности для «некритичных» операций: отладки серверов и работы с текущими
— Инженерам поручили компенсировать нехватку железа через глубокую оптимизацию кода.
— Команда
Ситуация указывает на предельную нагрузку на вычислительную базу Google. В условиях гонки нейросетей мощностей не хватает даже гигантам.
#Новости
В Google
DeepMind произошло масштабное перераспределение мощностей ради обучения нейронок следующего поколения. Вот оно как. Теперь ясно почему. По сообщениям источников, приоритет отдан новым моделям, что вызвало дефицит ресурсов для текущей инфраструктуры.
Что происходит:
— Резко сокращены мощности для «некритичных» операций: отладки серверов и работы с текущими
LLM.— Инженерам поручили компенсировать нехватку железа через глубокую оптимизацию кода.
— Команда
DeepMind также помогает Anthropic разгребать технические проблемы с их TPU.Ограничение ресурсов осложнило даже базовую работу с железом внутри компании.
Ситуация указывает на предельную нагрузку на вычислительную базу Google. В условиях гонки нейросетей мощностей не хватает даже гигантам.
#Новости
❤🔥2
Ещё одна проблема почему Gemini 3 Pro теряет контекст. Спойлер: Google экономит. 🪙
Во-первых, KV Cache и его дикое сжатие. Кэш памяти в трансформерах жрет ресурсы линейно. Чтобы серверы не ложились, Google, судя по всему, перешла на INT2-квантование кэша. То есть данные сжимаются до 2 бит. В память влезает больше, но точность страдает фатально — отсюда и забытые куски кода или перепутанные цифры. Детали просто "мылятся" при сжатии.
Во-вторых, она реально не читает весь ваш текст. Используется механизм маршрутизации внимания. Модель сканирует контекст и выбирает, какие токены обрабатывать, а какие — пропустить, чтобы сэкономить вычислительный бюджет. Если алгоритм посчитал кусок вашего промпта "шумом", модель его физически не увидит при ответе.
Хорошая новость в том, что это, вероятно, временно? Не знаю. Этой проблеме уже 2 года. Все модели Gemini получают большой урон от этого. Но в любом случае, Google готовит архитектуру TITANS и систему MIRAS — это переход к нейронной долгосрочной памяти.
#Мысли
Автор — @Geometry90
Многие замечали, что после 10-20к токенов Gemini превращается в тыкву: забывает начало диалога, выдумывает факты и теряет нить. Я покопался в доках и профильных тредах, и, кажется, проблема не в "глюках", а в сознательной (и довольно жесткой) оптимизации.Тут работают два фактора:
Во-первых, KV Cache и его дикое сжатие. Кэш памяти в трансформерах жрет ресурсы линейно. Чтобы серверы не ложились, Google, судя по всему, перешла на INT2-квантование кэша. То есть данные сжимаются до 2 бит. В память влезает больше, но точность страдает фатально — отсюда и забытые куски кода или перепутанные цифры. Детали просто "мылятся" при сжатии.
Во-вторых, она реально не читает весь ваш текст. Используется механизм маршрутизации внимания. Модель сканирует контекст и выбирает, какие токены обрабатывать, а какие — пропустить, чтобы сэкономить вычислительный бюджет. Если алгоритм посчитал кусок вашего промпта "шумом", модель его физически не увидит при ответе.
Хорошая новость в том, что это, вероятно, временно? Не знаю. Этой проблеме уже 2 года. Все модели Gemini получают большой урон от этого. Но в любом случае, Google готовит архитектуру TITANS и систему MIRAS — это переход к нейронной долгосрочной памяти.
В общем, сейчас такое время, где Google пытается сэкономить на TPU. Ждем Gemini 3.5 и новой архитектуры, там это должны пофиксить. Чего ждать дальше не знаю
#Мысли
Автор — @Geometry90
🤔3
В ближайшее время выйдет много всего интересного!
Делюсь примерными сроками: они почти точные, хотя всегда стоит оставлять долю сомнения в источниках.
Делюсь примерными сроками: они почти точные, хотя всегда стоит оставлять долю сомнения в источниках.
Grok 4.20 — на этой неделе. Но разработчики могут снова замолчать и подвести всех, как это часто бывает. Все уже видели каким будет Grok 4.20. ТАК И ПРОИЗОШЛО БЛЯТЬ ПЕРЕНЕСЛИ ДО СЕРЕДИНЫ ФЕВРАЛЯ! ОТЛИЧНО НАХ! 🥳ChatGPT 5.3 — ставлю, что он станет лучше во всех аспектах: станет живее, а фронтенд сильно подтянут. Релиз будет скоро, ждём в течение двух недель (конец января — начало февраля).Claude 4.7 Sonnet — он должен быть во всём лучше Opus: дешевле, быстрее и круче. Срок — февраль.Gemini 3 Pro GA — особых надежд на них не питаю. Версия GA не стала толком лучше в тех аспектах, где сейчас лидируют Claude и ChatGPT (я про агентность и галлюцинации). Судя по всему, они не стремятся исправлять это и в Gemini 3.5. Дата — середина февраля.DeepSeek R2 и V4 — я просто верю в них. Ребята должны сделать что-то классное. Судя по их статьям и фактам, они много работали, так что фраза «релиз будет крутым» звучит вполне оправданно. Выход ожидается до 17 февраля.Вот так: у каждой компании и каждой модели свои причуды и своя история. Ждём.
X (formerly Twitter)
Chetaslua (@chetaslua) on X
So our team are working to get latest and finest information before anyone .\
> Sonnet
> Gemini 3.0 pro GA
> GPT 5.3
one good news < sonnet will be better , cheaper and faster than opus 4.5 > i mean in every criteria
follow @legit_api @Liam06972452…
> Sonnet
> Gemini 3.0 pro GA
> GPT 5.3
one good news < sonnet will be better , cheaper and faster than opus 4.5 > i mean in every criteria
follow @legit_api @Liam06972452…
❤🔥4
Google купил CSM: 3D в Gemini?
Google тихо поглотил стартап
Что это значит прямо сейчас:
— Google забрал себе топовую технологию 2D → 3D.
— Пока публичных фич нет, сделку провели без лишнего шума.
— В
После интеграции CSM из текста или фото можно будет получать не просто картинку, а готовую 3D-модель, которую можно скачать и сразу юзать.
Кстати, это лишь часть недели: ещё была лицензия от
Источник:
#Новости #Инсайд
Google тихо поглотил стартап
Common Sense Machines (CSM). Это небольшая команда из ~12 крутых спецов, которые делают одну из лучших технологий превращения 2D-картинок в полноценные 3D-модели.Что это значит прямо сейчас:
— Google забрал себе топовую технологию 2D → 3D.
— Пока публичных фич нет, сделку провели без лишнего шума.
— В
Gemini добавят генерацию 3D нативно. Скорее всего, это случится уже в следующих Nano Banana.После интеграции CSM из текста или фото можно будет получать не просто картинку, а готовую 3D-модель, которую можно скачать и сразу юзать.
От себя:
Думаю, увидим это в 2026 году или даже на Google I/O в мае в обновлениях Gemini app / AI Studio. Google обычно очень быстро внедряет такие штуки.
Кстати, это лишь часть недели: ещё была лицензия от
Hume AI (эмоциональный голос). Об этом напишу позже.Источник:
#Новости #Инсайд
❤🔥4👍1
🐰 Клон Windows XP за один промпт
Gemini
Прикольно? Прикольно.
Это сильное улучшение по сравнению с
Выкатят ли её в таком виде в GA — большой вопрос. Мы знаем любовь Google всё резать ради экономии ресурсов.
И кстати,
#Новости #Инсайд
Gemini
Snowbunny собрала интерфейс старой винды всего по одному запросу.Прикольно? Прикольно.
Это сильное улучшение по сравнению с
Gemini 3 pro — она такого не может.Выкатят ли её в таком виде в GA — большой вопрос. Мы знаем любовь Google всё резать ради экономии ресурсов.
И кстати,
Snowbunny уже понерфили, но даже так она крутая.#Новости #Инсайд
Светлый Уголок | ии
Grok в X генерит 183 млн картинок
Как это? 🤣 Ладно, ладно.
Статистика в день:
—
—
#Щитпост
Как это? 🤣 Ладно, ладно.
Grok интегрировали в X. Разница в цифрах обусловлена его распространением среди юзеров и бесшовной интеграцией.
Статистика в день:
—
Grok: около 183 млн изображений—
Nano Banana Pro: ~19 млн (1 млрд за 53 дня)#Щитпост
🤔1
