🫆 Светлый Уголок | ии
526 subscribers
896 photos
190 videos
10 files
516 links
Тут сначала замечают, потом обсуждают.
AI-инсайды, свежие сигналы, честные мнения и свои инструменты.
Светлый уголок — авторский канал про ИИ без скуки.
Download Telegram
🫆 Светлый Уголок | ии
Google планирует выпустить новую версию VEO – 3.2. И скорее всего это произойдет уже в этом месяце! Я проверил, и да, всё верно, в коде google flow уже существует данный нейминг новой модели Veo. Также стоит прояснить ситуацию с моделью Siren на LM Arena.…
Получил генерацию Veo 3.2.

Left Veo 3.2 Right Veo 3.1

Получилось круто. Это лучше чем Veo 3.1.
Из изменений, кратко:

– Звук реалистичнее, тот самый роботизированный шум подавлен.
– Картинка куда натуральнее.
– Качество видео и исполнение промта явно лучшие.
👍3
🫆 Светлый Уголок | ии
🌲 Новая Gemini 3.5 Flash Image (она же NANO BANANA V3) P.S. — Выяснилось, что это просто внутренняя модель для сотрудников Google. На данный момент никакой информации о Nano banana v3 нет. Это уровень выше Pro! Хотя мелкие огрехи в лицах и деталях текста…
Я протестировал эту модель.

Что это? NB 3? NB 2 (Update)?

Для начала стоит определиться:

Является ли эта модель основой Gemini 3.5 или нет?

Здесь мнения расходятся. Кто-то считает, что это Nano Banana Pro GA, но большинство склоняется к версии о Gemini 3.5. Лично я считаю, что возможно всё, но пока это лишь предположения.

Из заметных улучшений:


– Скорость: В среднем генерация занимает 10–40 секунд.
– Работа с текстом: Пишет точнее, чем версия Pro.
– Графика интерфейсов: Скриншоты из различных игр в 4K делает определенно лучше и детальнее, чем NB Pro.
– Визуал: Работа с экспозицией и визуализацией на голову выше текущей Pro-версии.
– Энергичность: Модель «не ленивая», в плане проработки графики работает здорово.
– Понимание промтов: Реализует идеи заметно лучше. Она будто читает мысли и воплощает именно тот образ, который возник в голове. На мой взгляд, текущая NB Pro справляется с этим хуже.
– Редактирование: Улучшенное сохранение деталей и глубокое понимание контекста при правках.

Примечания и минусы:


– Актуальность данных: Дата отсечки знаний осталась той же, что и у NB Pro — примерно конец 2024 года.
– Мелкие детали: Всё ещё встречаются искажения в очень мелком тексте.
– Артефакты: Иногда их бывает даже больше, чем у NB Pro.


Итог: На сегодняшний день это, пожалуй, лучшая модель. Она кажется мне гораздо удачнее даже специальной версии NB Pro.
🤔3
👀 DeepMind ТОЛЬКО ЧТО выкатила D4RT — Veo точно будет классной.

Похоже, именно так ИИ должен был «видеть» мир изначально, а не через те костыли, что видеомодели юзали раньше.


В ЧЁМ СУТЬ: Раньше 3D-реконструкция динамики была диким мучением. Приходилось склеивать пачку разных моделей (глубина, трекинг, камера), которые вечно конфликтовали и выдавали «артефакты-призраки». Архитектура обучения видеомоделей примерно такова.

Это главная боль Sora, Veo и прочих. Но в Google нашли решение!!!

И знаете? Эту модель 100% сделают частью архитектуры Veo.


Скорость взлетела в 300 раз! Минутное видео обсчитывается за 5 секунд — это уже реал-тайм.

Самое крутое: трекинг не теряется, даже если объект временно исчез. Это честное понимание геометрии, а не угадывание пикселей.
Для меня это — фундамент для World Models. Без полноценного 4D физика у нейронок всегда будет «плыть».

Если технологию внедрят в Gemini или следующий Veo 4, проблемы с галлюцинациями наконец-то уйдут в прошлое, "возможно хотя бы с имитацией движений.

Такое комбо легко оставит Sora позади — конечно же, только если они не найдут своего решения.

А что думаете вы?

Источник
#Новости
👍3
🫆 Светлый Уголок | ии
👀 DeepMind ТОЛЬКО ЧТО выкатила D4RT — Veo точно будет классной. Похоже, именно так ИИ должен был «видеть» мир изначально, а не через те костыли, что видеомодели юзали раньше. В ЧЁМ СУТЬ: Раньше 3D-реконструкция динамики была диким мучением. Приходилось склеивать…
This media is not supported in your browser
VIEW IN TELEGRAM
Пример работы D4RT.

Что она умеет уже сейчас:

– Создавать 3D-сканы из видео: Превращать любое видео с прогулкой по комнате в точную 3D-модель (намного быстрее, чем старые методы фотограмметрии).

– Делать идеальный Slow-Mo: За счет понимания глубины модель может дорисовывать кадры с учетом физики движения, а не просто размывать их.

– Удалять объекты: Можно убрать человека из видео, и D4RT корректно «заполнит» пустоту тем, что находилось за ним в 3D-сцене.

– Реальный трекинг: Выделяете точку на плече спортсмена, и модель ведет её всё видео с точностью до миллиметра, игнорируя тени и блики.
❤‍🔥3
Google Music появится в приложении Gemini.

Музыка, созданная вами с помощью Gemini, будет храниться вместе с остальным контентом в разделе «Мои материалы»

Lyria 3?
🚧 У Google сейчас серьёзные проблемы с мощностями. Они явно не успели подготовить инфраструктуру к тем нагрузкам, которые существуют сегодня.

Только представьте, насколько тяжеловесна модель NB PRO. Это реально тяжёлая модель: огромный датасет изображений в связке с самой Gemini 3 Pro. Представьте, какую колоссальную нагрузку это создаёт.

1. В последнее время я замечаю постоянные сбои в работе:
Слишком частые ошибки генерации в приложении с уведомлением: "У нас сейчас большой спрос на эту модель, попробуйте позже".

2. Я уже видел жалобы в Твиттере. Видимо на сегодня — это массовая проблема. Модели Gemini 3 перестают генерировать ответ на полпути: просто зависают и обрывают мысль.

3. Nano Banana Pro невероятно отупела. У меня большие проблемы с редактированием, модель стала лишь немного лучше первой версии (Nano Banana 1).

Исходя из этого, можно предположить, что Genie 3 и другие проекты Google пока не могут представить публике именно из-за проблем с масштабированием.
👀 В Gemini Live могут добавить Gemini Agent «phone use».

Это очень интересный шаг. Я даже как-то раз думал о том, что если это есть для сайтов и ПК, то найдется и для телефонов. Ведь верно?
#Инсайд
❤‍🔥3
🔔 DeepMind может представить что-то масштабное в следующем месяце. Это инсайд.

Мое предположение: они не просто обновят свои передовые модели Gemini 3, а представят какой-то принципиально новый продукт. Если они имели в виду Veo 3.2, то делать такие громкие заявления было бы глупо. Я видел Veo 3.2 — это лишь минорное обновление.


Поэтому я делаю ставку на Lyria 3. Серьезно думаю, что она уже готова. Учитывая тот самый инсайд: «Музыка, созданная вами с помощью Gemini», было бы странно ставить старую Lyria 2. Я уверен, что обновление выйдет совсем скоро.

Еще один кандидат — Gemma 4. Линейка Gemma давно не обновлялась, и пора выпускать 4 версию. Это очень важная модель: она много знает, но при этом достаточно мало весит.

Также возможно появление Gemini 3 TTS, ведь, по данным одного источника, Google уже вовсю тестирует новую Gemini Live. Вообще, Gemini Live должна получить крупное обновление в следующем месяце — это случится в феврале.

В феврале Google много чего приготовит для нас, может быть. Пока надежд высоких не ставлю, однако все модели Gemini 3 пока что вообще нестабильные. И всё же я дам вам точный прогноз: Google собирается сделать Gemini полностью мультимодальной, и скорее всего, вы это увидите уже в самой Veo 4.
#Щитпост
#Новости
❤‍🔥1
Forwarded from Menus AI | Новости
Какая модель лучшая на момент 2026 года?
Anonymous Poll
44%
Anthropic Opus 4.5
5%
Anthropic Sonnet 4.5
29%
OpenAI 5.2 Codex xhigh
4%
Z AI GLM 4.7
17%
Google Gemini 3 Pro
🫆 Светлый Уголок | ии
🚧 У Google сейчас серьёзные проблемы с мощностями. Они явно не успели подготовить инфраструктуру к тем нагрузкам, которые существуют сегодня. Только представьте, насколько тяжеловесна модель NB PRO. Это реально тяжёлая модель: огромный датасет изображений…
⚡️ DeepMind: всё железо на новые модели

В Google DeepMind произошло масштабное перераспределение мощностей ради обучения нейронок следующего поколения.

Вот оно как. Теперь ясно почему. По сообщениям источников, приоритет отдан новым моделям, что вызвало дефицит ресурсов для текущей инфраструктуры.

Что происходит:
— Резко сокращены мощности для «некритичных» операций: отладки серверов и работы с текущими LLM.
— Инженерам поручили компенсировать нехватку железа через глубокую оптимизацию кода.
— Команда DeepMind также помогает Anthropic разгребать технические проблемы с их TPU.

Ограничение ресурсов осложнило даже базовую работу с железом внутри компании.


Ситуация указывает на предельную нагрузку на вычислительную базу Google. В условиях гонки нейросетей мощностей не хватает даже гигантам.

#Новости
❤‍🔥2
🪐 Grok 4.20 на подходе?

Официальный X-канал Tesla Owners Silicon Valley пишет, что Grok 4.20 выйдет уже скоро. Думаю, релиз случится на следующей неделе.

От себя:
Ждем всем селом хотя бы что-то в этом месяце, бл*ть!

Источник:
#Новости #Щитпост
😁3
Ещё одна проблема почему Gemini 3 Pro теряет контекст. Спойлер: Google экономит. 🪙
Многие замечали, что после 10-20к токенов Gemini превращается в тыкву: забывает начало диалога, выдумывает факты и теряет нить. Я покопался в доках и профильных тредах, и, кажется, проблема не в "глюках", а в сознательной (и довольно жесткой) оптимизации.
Тут работают два фактора:

Во-первых, KV Cache и его дикое сжатие. Кэш памяти в трансформерах жрет ресурсы линейно. Чтобы серверы не ложились, Google, судя по всему, перешла на INT2-квантование кэша. То есть данные сжимаются до 2 бит. В память влезает больше, но точность страдает фатально — отсюда и забытые куски кода или перепутанные цифры. Детали просто "мылятся" при сжатии.

Во-вторых, она реально не читает весь ваш текст. Используется механизм маршрутизации внимания. Модель сканирует контекст и выбирает, какие токены обрабатывать, а какие — пропустить, чтобы сэкономить вычислительный бюджет. Если алгоритм посчитал кусок вашего промпта "шумом", модель его физически не увидит при ответе.

Хорошая новость в том, что это, вероятно, временно? Не знаю. Этой проблеме уже 2 года. Все модели Gemini получают большой урон от этого. Но в любом случае, Google готовит архитектуру TITANS и систему MIRAS — это переход к нейронной долгосрочной памяти.

В общем, сейчас такое время, где Google пытается сэкономить на TPU. Ждем Gemini 3.5 и новой архитектуры, там это должны пофиксить. Чего ждать дальше не знаю


#Мысли
Автор — @Geometry90
🤔3
В ближайшее время выйдет много всего интересного!

Делюсь примерными сроками: они почти точные, хотя всегда стоит оставлять долю сомнения в источниках.

Grok 4.20 — на этой неделе. Но разработчики могут снова замолчать и подвести всех, как это часто бывает. Все уже видели каким будет Grok 4.20. ТАК И ПРОИЗОШЛО БЛЯТЬ ПЕРЕНЕСЛИ ДО СЕРЕДИНЫ ФЕВРАЛЯ! ОТЛИЧНО НАХ! 🥳

ChatGPT 5.3 — ставлю, что он станет лучше во всех аспектах: станет живее, а фронтенд сильно подтянут. Релиз будет скоро, ждём в течение двух недель (конец января — начало февраля).

Claude 4.7 Sonnet — он должен быть во всём лучше Opus: дешевле, быстрее и круче. Срок — февраль.

Gemini 3 Pro GA — особых надежд на них не питаю. Версия GA не стала толком лучше в тех аспектах, где сейчас лидируют Claude и ChatGPT (я про агентность и галлюцинации). Судя по всему, они не стремятся исправлять это и в Gemini 3.5. Дата — середина февраля.

DeepSeek R2 и V4 — я просто верю в них. Ребята должны сделать что-то классное. Судя по их статьям и фактам, они много работали, так что фраза «релиз будет крутым» звучит вполне оправданно. Выход ожидается до 17 февраля.

Вот так: у каждой компании и каждой модели свои причуды и своя история. Ждём.
❤‍🔥4
Google купил CSM: 3D в Gemini?

Google тихо поглотил стартап Common Sense Machines (CSM). Это небольшая команда из ~12 крутых спецов, которые делают одну из лучших технологий превращения 2D-картинок в полноценные 3D-модели.

Что это значит прямо сейчас:
— Google забрал себе топовую технологию 2D → 3D.
— Пока публичных фич нет, сделку провели без лишнего шума.
— В Gemini добавят генерацию 3D нативно. Скорее всего, это случится уже в следующих Nano Banana.

После интеграции CSM из текста или фото можно будет получать не просто картинку, а готовую 3D-модель, которую можно скачать и сразу юзать.

От себя:
Думаю, увидим это в 2026 году или даже на Google I/O в мае в обновлениях Gemini app / AI Studio. Google обычно очень быстро внедряет такие штуки.


Кстати, это лишь часть недели: ещё была лицензия от Hume AI (эмоциональный голос). Об этом напишу позже.

Источник:
#Новости #Инсайд
❤‍🔥4👍1
А что если...
🤔2
🐰 Клон Windows XP за один промпт

Gemini Snowbunny собрала интерфейс старой винды всего по одному запросу.
Прикольно? Прикольно.

Это сильное улучшение по сравнению с Gemini 3 pro — она такого не может.

Выкатят ли её в таком виде в GA — большой вопрос. Мы знаем любовь Google всё резать ради экономии ресурсов.

И кстати, Snowbunny уже понерфили, но даже так она крутая.

#Новости #Инсайд