VAI
5.09K subscribers
552 photos
111 videos
4 files
184 links
16 лет в компьютерной графике, 6 лет - арт-директор.
Работал над десятками проектов.
Изучаю ИИ для развития и собираю здесь свой опыт, находки и эксперименты.
Присоединяйтесь!
Личный контакт - @AlexBakakin
Boosty - boosty.to/vai_art

AI l ИИ
Download Telegram
Давненько не было практики. 🫡

Я разработал небольшой и простой пайплайн для текстурирования моделей. Ни на что не претендую, но способ реально рабочий и помогал мне уже не раз. К слову, недавно нужно было перетекстурировать часть объектов для локации, которые были в бэкграйнде, и этим методом я сделал это за пару часов. В старые времена мне бы потребовалось несколько дней.

Сразу скажу, что, как и многие вещи с ИИ, способ не идеальный: есть артефакты, и чем сложнее модель, тем их становится больше. Но даже так загрузить потом модель в Substance, Coat и другие аналоги и подправить руками - намного быстрее, чем делать с нуля.

Сам пайплайн строится с пониманием того, что модель с развёрткой уже есть.

🔹 Делаю скрин/скрины модели с нужных ракурсов
🔹 Загружаю их в Imagen от GPT и прошу сделать нужную текстуру поверх модели или вариацию текстуры от существующей. Тут всё зависит от ситуации: могу подгрузить лёгкий драфт поверх или пару референсов
🔹 Получаю модель с нужной текстурой или вариации текстуры
🔹 Загружаю модель в Tripo. Тут есть оговорка: Tripo у меня куплен, и у меня полный карт-бланш с ним (там есть и некоторое количество бесплатных попыток), загружаю референс с сгенерированным изображением. Из-за того что силуэты и формы совпадают, он хорошо понимает, что нужно сделать. Также большим плюсом является то, что Tripo сохраняет развёртку загруженной модели. Могу ошибаться, но аналогов я не встречал - сервисы, которые работают с заданной развёрткой, зачастую игнорируют её и перегенерируют новую, что не очень удобно, но в целом не критично, так как это просто добавляет одну лишнюю итерацию, где нужно будет перепечь текстуру с одной модели на другую или с канала на канал в развёртке
🔹 Проделываем этот цикл столько раз, сколько нужно, чтобы получить нужные варианты текстур

Пробуйте и экономьте своё время для более интересных вещей. 🔥🔥🔥

@VAI_ART
#VAI_Practice
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥12👍821
Неделю LLM объявляю закрытой. Быстро пробежимся по самому интересному.

🔹 LTX-2.5 — Lightricks выложили открытую видеомодель, которая едет на домашней карте
Веса открыты, минимум 16 GB VRAM, ComfyUI с первого дня. Коммерция бесплатна до $10 млн выручки. API — $0.09/с за 720p, $0.15/с за 1080p, $0.37/с за 4K.
— нативный multishot: связанные шоты идут одной генерацией, персонаж, свет и голос держатся на склейках
— модель сама решает длительность сцены, а не режет по фиксированному лимиту
— новый видеодекодер даёт меньше артефактов в движении, заявлены 4K HDR и редактирование готового ролика


Видео в комментариях.

🔹 Seedream 5.0 Pro Layer Separation — ByteDance научили модель разбирать картинку на слои
Работает на fal в Playground и API. $0.034 за слой до 1536×1536 и $0.068 выше — разбор на 10 слоёв ≈ $0.34.
— на выходе от 2 до 17 PNG с прозрачностью: персонажей, предметы и фон двигаете независимо
— промптом указываете, что именно отделять, а не получаете фиксированную нарезку
— фон дорисовывается за объектом, который его закрывал — дырки не остаётся


Видео в комментариях.

🔹 Meshy 7 — image-to-3D, который точнее попадает в референс
На всех тарифах, скачивание — с Pro. Генерация меньше минуты, на выходе FBX, GLB, OBJ или USDZ.
— лучше понимает форму, но еще есть вопросики
— появился режим Smart Topology: чистая сетка, части модели разделены сразу, полигонаж от 100 до 15 000
— ultra_mode за +5 кредитов вытягивает мелкий рельеф поверхности
— полный PBR-набор albedo/normal/metallic/roughness, текстуры до 4K


Примеры в комментариях.

🔹 Gemini 3.7 Flash — Google выпустили рабочую модель под код и агентов
В Gemini API, AI Studio и Spark. До конца 2026 — $0.75/$3.75 за 1М токенов, в 2.5–3 раза дешевле Sonnet 5 и GPT-5.6 Terra. С января вдвое дороже.
— код в реальных репозиториях: закрывает две трети задач вместо половины у 3.6 Flash
— рутину в бизнес-процессах доводит до конца почти втрое чаще
— а в терминале и за компьютером работать толком не умеет: тут GPT-5.6 впереди


Графики в комментариях.

🔹 Grok 4.6 — xAI обновили флагман и целят в долгие агенты
$2/$6 за 1М токенов. Доступ сразу везде: API, Cursor, Grok Build, OpenRouter.
— за месяц догнала топовые модели по общему уровню, оставшись втрое дешевле
— лучше всех разбирает документы: на юридических задачах отрыв от GPT-5.6 шестикратный
— а код пишет слабее конкурентов — за этим идти не сюда


Презентация и график в комментариях.

🔹 GLM-5.3Z.ai вытянули модель одним post-training
База та же, что у 5.2 — весь прирост из дообучения. Пока в GLM Coding Plan и ZCode, веса позже.
— работа в терминале выросла в шесть раз — из демо в рабочий инструмент
— думает короче: на сложные задачи тратит меньше токенов, чем 5.2
— сильнее всего прибавила в поиске уязвимостей: было четверть задач, стало половина


Графики в комментариях.

🔹 Qwen3.8-27B — Alibaba выложили компактную модель под Apache 2.0
27B, контекст 262K с расширением до 1М, на вход текст, картинки и видео.
— правит код в живых проектах на уровне платных флагманов, и это всего 27B
— умеет работать за компьютером и в Android: щёлкает интерфейсы, а не только пишет текст
— заводится локально: llama.cpp, Ollama, LM Studio

Графики в комментариях.

🔹 GPT-5.6 Sol Ultrafast mode — OpenAI показали инференс на чипах Cerebras
Пока для избранных в API. До 750 токенов в секунду, ускорение до 14 раз: веса лежат прямо на огромных wafer-чипах и не гоняются между памятью и хранилищем. Прогон HLE занял 11 часов против 80 у Fable.

Презентация в комментариях.

🔹 Suno Studio 2.0 — браузерная студия дотянулась до полноценной DAW
Только подписчикам Premier: 10 000 кредитов в месяц и экспорт стемов в 32-bit / 48 kHz.
— нормальный MIDI на таймлайне: импорт, запись, редактирование, подключение контроллеров
— MIDI-клип можно скормить как промпт: сыграли аккорды — модель продолжает партию
— Chat Bar в бете: словами заказываете новый звук, обработку вокала или собственный плагин


Видео в комментариях.

@VAI_ART
#VAI_News
👍721
Media is too big
VIEW IN TELEGRAM
Моя любимая рубрика. Посты подписчиков. 🦄

На этот раз Александр прислал пост, демонстрирующий способ рендера поверх болванки.

Workflow для генерации оружия (и не только) в заданном стиле в ComfyUI.

Тут применяются две модели: Krea 2 для создания шейпа оружия и Klein Edit для наложения материалов. В случае с Klein участвует и собственная лора (Klein LoRA - это LoRA-адаптер, натренированный поверх FLUX.2 [klein]) для этой edit модели.

Krea 2 берет за основу 3D блокуат и детальный промпт, делает первую итерацию - оружие. Потом картинка из Krea 2 прогоняется через Klein. Klein лоре нужен лишь промпт, он может быть детальный, а может и простой - "примени такие-то материалы". Но лучше детальный. В итоге получается оружие в нужном стиле, в данном случае реалистичном, CoD стиле.

Материалы накладываются безупречно, все косяки приходят с формы оружия, то есть с модели Krea 2. Если натренировать лору и для модели Krea 2, то и формы объектов попадут в стиль. Что открывает возможность генерации огромного количества объектов в каком нужно стиле, чтобы, например, наполнять уже существующую вселенную.

Данный воркфлоу презентует оружие, но что им генерить зависит от лоры, что вы тренируете. Это, конечно, могут быть и пропсы, персонажи, локации и ui.

Исходники можно взять тут.

@VAI_ART
#VAI_Authors
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7🔥21
Media is too big
VIEW IN TELEGRAM
В продолжение темы создания игр в одной непрерывной сессии.

Мэтт Шумер написал статью How to run a Gauntlet Loop, где рассказывает, как именно подходит к своим one-shot промптам.

Много полезных идей - можно подсмотреть, как писать промпт для больших проектов, чтобы он работал.

До этого еще показывал как он сделал Claude of Duty - клон Call of Duty за 1 промпт в Opus 5.

Upd. Докинул перевод в комментарии.

@VAI_ART
#VAI_Notes
👍6👎1👌1
Рубрика самых интересных новостей в ИИ за неделю. Все по плану.

🔹 FLUX Video Upscale — Black Forest Labs сделали отдельную модель под апскейл видео
Пробовать можно прямо в браузерном Playground.Десять секунд в 1080p выходят примерно в $1.4–2.
— это не резкость поверх пикселей,а перегенерация: чинит размазанные лица,глаза и разваленные текстуры травы и воды
— заточен под артефакты именно генеративного видео и знает внутреннюю кухню FLUX 3,но принимает любое видео от 480p
— множители 1.5x, 2x и 3x — на выходе 1080p,2K или 4K,звуковая дорожка сохраняется
— Precise держит исходную внешность персонажа,Creative дорисовывает детали агрессивнее и может её поменять


Видео в комментариях.

🔹 HappyShrimp 1.0 — Alibaba выпустили генератор песен целиком
Бета работает в браузере,в том числе за пределами Китая.
— сначала большая модель планирует структуру всей песни и только потом рендерится аудио:мелодия и аранжировка не разъезжаются к третьей минуте
— на вход можно дать жанр,темп,тональность,инструменты,тип вокала и настроение,а не только текст
— есть свои слова,инструментал,референсный трек и перенос музыкального стиля


🔹 Pika Audio — четыре звуковые модели по цене, которой раньше не было
Pika выкатила сразу Music,SFX,Speech и Soundtrack.Пока через API Club,но там есть нормальный веб-Playground.Главное здесь — $0.015 за минуту музыки: четырёхминутная песня стоит около шести центов.
— Music выдаёт законченный трек до шести минут по промпту,своему тексту,референсу голоса или музыки
— 90-секундный трек генерится в среднем за 6 секунд,это примерно в 14 раз быстрее реального времени
— Soundtrack подкладывает музыку под готовое видео,SFX и Speech закрывают шумы и озвучку


🔹 DeepSeek-V4-Flash-Vision-Exp — дешёвая модель,которая наконец видит картинку
Экспериментальная надстройка над V4-Flash.По тексту и ризонингу не просела,а на мультимодальных агентских задачах подошла вплотную к Opus 4.8.
— читает скриншоты, интерфейсы и графики, а не просто описывает фото
— картинка стоит максимум 384 токена: всё, что больше 800×800,ужимается до него
— при $0.14 за миллион входных токенов это около 18 тысяч изображений на доллар,ночью вдвое дешевле
— до 600 изображений в одном запросе и бесплатный Files API


🔹 luna-lisa-alpha — на арене засветился неанонсированный чекпоинт GPT Image
OpenAI выкатили в слепое тестирование новую версию генератора картинок,официального анонса пока нет.
— обновили знание о мире: модель в курсе более поздних событий
— заметно меньше зерна и характерной желтизны,за которую ругали GPT Image
— чище держит текст на картинке и внешность персонажа между генерациями


🔹 Ox Alpha — на OpenRouter бесплатно раздают неизвестную frontier-модель
Появилась под меткой stealth: разработчик не назван.Заточена под код и агентов,на превью бесплатна — квота 100 триллионов токенов в сутки.
— контекст 1М токенов,до 131К на выходе,принимает текст,картинки и видео
— по сети разошлось, что она обгоняет Fable и Sol на коде,но это был беглый замер и он не подтвердился
— полная проверка от автора бенчмарка поставила её на уровень Sol medium: модель хорошая,но не рекордсмен
— зато она заметно экономнее по токенам,чем модели того же уровня
— по косвенным признакам это GLM: подозревают Z.ai


Графиков никто не показал. Все что нашел в комментариях.

🔹 Cursor Origin — свой GitHub, рассчитанный на темп агентов
Пока бета для платных тарифов. Репозитории синкаются с GitHub за минуту,комментарии к PR ходят в обе стороны,но источником правды остаётся GitHub.
— GitHub рассчитан на человеческий ритм,а Cursor показывал 22.6 коммита в секунду в один репозиторий
— Vercel поднимает превью-деплой на каждый PR,а автоматического разрешения конфликтов пока нет


Видео в комментариях.

🔹 Claude Academy — Anthropic выложили своё внутреннее обучение бесплатно
Учат не промпт-инжинирингу под конкретную модель,а общей логике работы с ИИ — тому же,что дают своим сотрудникам на онбординге.
— курсы с практикой, разборы кейсов и трекинг прогресса
— отдельно выложили Academy Skill: Claude сам подсказывает подходящий курс во время работы


Презентация в комментариях.

@VAI_ART
#VAI_News
👍3🔥3
This media is not supported in your browser
VIEW IN TELEGRAM
Когда нужно заапрувить концепт персонажа во времена ИИ.😁

Отгадайте какой выбрали?)

Всем хорошей недели!

@VAI_ART
#VAI_Notes
Please open Telegram to view this post
VIEW IN TELEGRAM
😁11👍3👾1
Писал недавно про то, что Claude неплохо справляется с FX через MCP. Способ хороший, хотя и там нужно всё немного дорабатывать «напильником».

В данном случае основная проблема - это описать визуал, а значит, нужно найти правильный референс, что не всегда реально. Когда я обдумывал, как сделать так, чтобы референсы было найти проще, одним из вариантов, который пришёл, стала генерация нужного через видеогенераторы. Задаёшь первый кадр, при необходимости последний, описываешь, что должно происходить и вот у тебя готовый референс, который можно потом закинуть в Claude и попросить перенести в движок.

На днях подглядел ещё подобный пайплайн, но под другую реализацию - на выходе с секвенцией спрайтов. Суть та же: генерируешь первый, последний и при необходимости промежуточный кадр (для полного контроля). Как минимум нужен первый кадр для того, чтобы модель понимала стилистику. Описываешь поведение и генерируешь нужный FX в видеогенераторе, а дальше либо сам делишь на секвенции, но мы-то уже прошаренные и просим LLM, чтобы она составила из нужного видеоряда атлас секвенций, который по итогу и будет тем самым FX, который потом можно будет применить у себя в игре. Либо делаем в After Effects или вот Антон завайбкодил инструмент, который сам удаляет фон и подгоняет ключи/кадры.

Работает не только с VFX. Спрайтовые анимации персонажей, вращение элементов и т.д.

Основной пайплайн здесь, как и во многих других процессах - Imagen 2 и Seedance 2/2.5. На самом деле генераторов видео, особенно в последнее время вышло очень много и надо все тестировать на разные возможности. В данных тестах я так же пробовал Wan 3.0 и результаты были достаточно хорошие.

В общем, способ работает и в том, и в том направлении - можете как угодно крутить и упрощать свои процессы.

@VAI_ART
#VAI_Notes
4👍3🔥2
Продублирую еще. Антон навайбкодил классный инструмент для работы с спрайтами. Может пропустили.
This media is not supported in your browser
VIEW IN TELEGRAM
Всем привет!

Встречайте обновленный Atlas Converter и его исходный код.
Это программа, позволяющая удобно получать спрайт атлас из сгенерированного видео и вырезать зеленый фон для получения альфы. Параллельно можно пакетно обработать отдельные спрайты: подогнать размер, сдвинуть, наложить на фон и экспортировать. Всё в одном окне, без установки.

В новой версии гораздо более удобный интерфейс, контроль ключевых кадров и возможность запуска на маке.

Atlas Converter [Win 64]

Исходники.

Запуск на маке: скачать исходники, запустить build_mac.py
В папке /dist появится версия для мака.


Ближе к концу недели еще отдам жутко шустрый генератор 2D эффектов.

Поставьте 🔥 за старания ;)
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥16👍51🥰1
Media is too big
VIEW IN TELEGRAM
Там трейлер с геймплэем GTA 6 вышел. Смотрели? Как вам?

@VAI_ART
#VAI_Notes
🔥43
Новости ИИ за неделю. Что особенно зацепило. Пробежимся.

🔹 Midjourney V8.2 Edit — у Midjourney наконец появился свой редактор изображений
Открыли массовое тестирование первой edit-модели для V8.2.Загружаете картинку в Editor и правите её обычными словами.Работает внутри подписки от $10 в месяц, отдельной цены за правку нет.
— до четырёх изображений-референсов за раз,этот механизм заменил прежний omni-reference
— inpainting по выделенной области и outpainting за границы кадра
— главное — сохраняется миджорниевская эстетика,чего не даёт ни Banana,ни GPT Image
— после нескольких проходов картинка начинает звенеть,а развернуть камеру почти невозможно


Примеры в комментариях.

🔹 Gemini Omni 1.1 Flash — видеомодель Google вышла из превью
27 августа Google перевела Omni 1.1 Flash в стабильный релиз для Gemini API и AI Studio.Ориентир по цене прежний — около $0,10 за секунду в 720p.
— продление готовой сцены блоками по 10 секунд,суммарно до 40 — модель смотрит на предыдущие 10 секунд,а не на один последний кадр
— первый и последний кадр: даёте две картинки и получаете управляемый переход между ними
— черновой режим 360p на 60% быстрее и втрое дешевле 720p: прототипируете дёшево,апскейлите только удачное
— 1080p и 4K получаются апскейлом,нативной генерации в этих разрешениях нет


Примеры в комментариях.

🔹 MiniMax H3 Max — fal дообучили H3 и разогнали её в 36 раз
Своя post-trained версия открытой MiniMax H3,собранная под инференс-стек fal. Ролик 15 секунд в 720p: обычный H3 — около 6 минут,H3 Max — около 10 секунд.
— пять бесплатных генераций в день
— 480p и 768p, 24 fps,ролики 5–15 секунд,нативное стерео — но 2K, который умеет обычный H3,здесь пока нет
— ускорение не за счёт квантизации: fal делали модель и движок одновременно
— веса обещают выложить

В общем,видео теперь генерируется быстрее скорость проигрывания видео.

Пример бесконечного слопа.О дивный новый мир.

🔹 Unreal Engine 5.9 — Epic передумали и делают ещё один релиз UE5, весь ради ИИ
В июне 5.8 называли последней версией перед UE6.Теперь Epic подтвердили выход 5.9 и тащат в неё часть будущего стека UE6.Даты релиза пока нет.
— уже в 5.8 внутри редактора работает локальный MCP-сервер: Claude Code,Codex,Gemini и Cursor могут создавать объекты, менять свет и материалы,гонять тесты и работать с PCG. В 5.9 агентам откроют ещё больше движка
— генеративные модели становятся дополнительным render pass: Unreal держит камеру, геометрию и композицию сцены, а внешняя модель поверх реального рендера меняет стиль, погоду и время суток
— ставка не на свою модель,а на открытую инфраструктуру: подключать можно любую.UE6 Early Access намечен на конец 2027


Презентация в комментариях.

🔹 Recraft V4 Styles — стиль по референсам, который можно переиспользовать
Модели Recraft научились собирать визуальный стиль по картинкам и держать его в серии генераций.$0,05 за изображение плюс $0,005 за создание стиля.
— от 1 до 10 референсов: похожие сужают попадание, разные расширяют диапазон
— Precise держит стиль максимально точно,Flexible ловит общее направление и оставляет модели свободу
— стиль сохраняется как Style ID и подключается к следующим генерациям, работает и на растре и на редактируемых SVG


Примеры в комментариях.

🔹 ElevenMusic Composer — песню теперь можно править по частям
ElevenLabs открыли редактор,который разбирает сгенерированный трек на куплет,припев,бридж и аутро.Работает на Music v2,бесплатный план даёт 5 треков в день.
— переписать текст одного куплета и перегенерировать только его,не трогая остальное
— поменять темп,тональность и длительность выбранной секции
— переставить части местами,продублировать припев,дописать аутро


Презентация в комментариях.

🔹 Gemini 3.5 Transcribe — расшифровка речи,которая понимает смысл
Две модели в Gemini API: одна для готовых файлов,вторая для потока в реальном времени.Публичное превью.
— сама выкидывает слова-паразиты и оговорки,за которыми говорящий себя поправил
— 85+ языков,акценты и диалекты,определение языка на лету
— ошибается примерно в 2,6% слов на файлах и в 4% в реальном времени


Пример в комментариях.

@VAI_ART
#VAI_News
🔥43👍2🙏1
Media is too big
VIEW IN TELEGRAM
Я сделал новую модель и записал вам таймлапс...

Сказал бы я,если бы у меня было больше времени поскульптить. 😁

А этот таймлапс сделал не я, а видеогенератор.В данном случае MiniMax H3.

Пример промпта.

Create a 15-second fast-paced 3D character sculpting timelapse inside a professional digital sculpting application (ZBrush-style interface: dark grey viewport, tool shelves on the left and right, subtool stack, no readable text).

Use the provided character reference only as the final target for the sculpt's silhouette, proportions, costume, feather layout and distinctive features. The process must visibly start from a single primitive sphere and rebuild the referenced character from scratch. The whole sculpt stays in a monochrome grey clay / matcap material — no color, no textures.

Show a visible mouse cursor actively controlling the entire process. Every major change must feel caused by cursor strokes on the mesh surface. The model is frequently rotated by dragging in the viewport, so the sculpt is always read as a real 3D object, not a drawing.

0:00-0:02
Start on an empty grey viewport with one smooth low-resolution sphere. The cursor pulls and drags the mass out into a rough humanoid blockout — torso, head, limbs, digitigrade bird legs — using large Move-brush strokes. Blobby, low-poly, no detail.

0:02-0:04
Remesh pass. The wireframe briefly flashes on, the mesh becomes denser and cleaner, then the wireframe disappears. The cursor refines proportions, defines the shoulder mass, hunched posture, arm length and the raven skull with a long curved beak. Rotate the model 90 degrees to check the profile.

0:04-0:06
Anatomy and costume blockout. The cursor masks regions and extracts new subtools: hood, shoulder cape, tunic, belts, wrapped shins. New objects visibly pop into the subtool stack as separate grey pieces. Clay build-up strokes thicken forms, TrimDynamic-style strokes flatten planes.

0:06-0:09
Hard-surface and prop pass. Insert-mesh strokes place straps, buckles, pouches, small blades and the recurve bow across the back. The cursor drags each piece into position, scales and rotates it. Continuous slow orbiting of the model between placements.

0:09-0:12
Feather pass — the most dramatic stage. Using an alpha/insert-brush, the cursor rapidly stamps overlapping feathers layer by layer over the shoulders, chest ruff, forearms and the long ragged cape. Feathers accumulate in fast successive passes from broad to fine, building the shaggy silhouette from the reference.

0:12-0:14
High-frequency detail and polish. Sharp carving strokes cut cloth folds, torn hems, stitching, leather grain and scale texture on the legs and talons. The viewport briefly zooms into the beak and hood to refine the face, then pulls back out. Subdivision level rises one more time, surface noise appears on the fabric.

0:14-0:15
The UI panels fade away. The finished sculpt is presented on a clean white background, centered, in the same standing pose and framing as the reference, slowly rotating and settling into the exact frontal reference view. End on the final beauty render.

STYLE:
High-speed 3D sculpting timelapse, professional digital sculpting workflow, believable sculpting software UI, matte grey clay material with soft studio lighting, smooth cursor movement, rapid but readable operations, no random text, no fake dialogue, no unrelated popups.

MOTION:
Continuously productive for the full 15 seconds. No long pauses. Compress many hours of sculpting into an energetic timelapse while keeping the progression clearly readable: sphere → rough blockout → refined anatomy → costume subtools → props and straps → layered feathers → fine detail → final render. Mesh density and surface complexity must visibly increase over time, never jump instantly.

CAMERA:
Screen-recording style. Camera navigation is 3D viewport orbiting — the model rotates around its vertical axis while being worked on, with occasional dolly-zooms toward the head, hands or feather clusters and back out. Keep the UI stable and readable. No cinematic cuts


@VAI_ART
#VAI_Notes
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥84😁31
Нам обещали, что ИИ заберёт рутину и освободит время. Он и правда освободил. Только отдыхать в это время никто не пошёл - все пошли работать ещё больше. 🥹

Последнее время много общаюсь с людьми, которые сидят в агентах каждый день. Картинка везде одна: рабочий день по 16-18 часов, в голове бесконечная очередь идей и фич. Не потому что кто-то заставляет. Потому что стало можно.

Раньше узким местом были руки. Сейчас руки почти бесплатные, на что уходила неделя, собирается за вечер. Узкое место переехало в голову. А голова, в отличие от агента, не запускается в двадцати параллельных сессиях.
Я сам работаю немало. Но глядя на людей вокруг, понимаю - это ещё мало. И вот это “мало” настораживает меня больше всего.

Потому что выгорание, переутомление и хроническая усталость никуда не делись. Их просто перестали замечать. На этом кураже кажется, что ты не устаёшь. Но психика не масштабируется.

И вот здесь самое неприятное. ИИ сгенерит картинку за пять секунд, соберёт пайплайн, напишет код. Но он не вернёт интерес к работе, нормальный сон и желание вообще что-то делать. Это чинится годами и не всегда до конца.

Поэтому отдых - это обязательный этап пайплайна, а не потеря темпа.

Гонка длинная. Выигрывает не тот, кто бежит быстрее, а тот, кто добежит.

Не забывайте отдыхать!🦄

@VAI_ART
#VAI_Notes
Please open Telegram to view this post
VIEW IN TELEGRAM
21👍14💯8👎3🔥2🌚2
Неделя была достаточно жаркой, но судя по анонсам до конца года наша жизнь станет еще более интересной. Пробежимся.

🔹 GPT-6 Astra — OpenAI выпустили модель,которая работает за компьютером вместо вас
Новый флагман.$10 и $50 за миллион токенов,контекст 1 млн.На Plus доступна только в Codex и Work,в обычном чате её там нет.
— сама водит мышкой и браузером: собирает презентации, таблицы,сайты и целые игры по одному запросу и вдвое быстрее прошлой модели
— держит длинную задачу целиком: ищет референсы,делает,проверяет результат и переделывает, не бросая на середине
— для меня одним из главных - 3D: в связке с Blender MCP сама собирает сцену, рендерит тестовые кадры,сверяет их с рефами и правит ошибки


Пример — архвиз целиком: дом от планировки до 30-секундного тура и интерактивной сборки в Unreal Engine 5.

Графики презентация,примеры в комментариях.

🔹 Claude Fable 5.1 — Anthropic обновили флагман и сделали его дешевле
Доступна всем в API и подписке. Цена прежняя, но реальный счёт за задачу падает на 25–45%.
— чтение из кэша подешевело на 75%, до $0,25 за миллион - а именно на кэш уходит основная часть денег в агентных задачах
— вдвое лучше тянет длинные технические задачи в терминале: 55,8% против 42% у прошлой версии
— и наконец пишет нормальным языком,без нагромождения терминов


Графики в комментариях.

🔹 Gemini 3.8 Flash — дешёвая модель Google подобралась к дорогим
Уже в API, AI Studio и приложении Gemini для Pro и Ultra. $0,75 и $3,75 за миллион токенов - вводная цена до конца года,потом вдвое дороже.
— апгрейд в коде и многошаговых задачах: планировать,дёргать инструменты,править свои ошибки
— Google разрешила ей думать дольше на сложном: токен дешёвый,а задача целиком может выйти дороже прошлой версии


График в комментариях.

🔹 World Labs Atlas — камера в генерации наконец стала управляемой
Работает сразу с текстом,картинками, видео и 3D.Ранний доступ по заявке,цены пока нет.
— траектория камеры задаётся заранее, до генерации: облёты, рефрейминг, bullet time внутри сцены
— до минуты видео в 1440p
— собирает 3D-сцену от одной картинки до десятков ракурсов, на выходе облако точек или гауссовы сплаты


Примеры в комментариях.

🔹 Runway GWM Worlds 2 — мир, который генерируется на лету и слушается вас
— 720p, 24 кадра в секунду со звуком, и генерация не заканчивается: мир продолжается, пока вы в нём
— задаёте окружение, персонажей, стиль и правила мира, дальше командуете ими, меняете погоду и свет, водите камеру
— постоянного 3D-состояния она не хранит: на долгой сессии геометрия и текстуры плывут


Пример в комментариях.

🔹 Hyper3D WorldGen — одна картинка превращается в разбираемую 3D-сцену
Deemos, авторы Rodin, выпустили генератор не объектов, а сцен целиком.
— ключевые предметы становятся отдельными мешами: стол подвинуть, стул заменить; окружение восстанавливается гауссовыми сплатами
— под игры масштаб пока маловат, авторы сами это признают; целятся в кино, XR и симуляции роботов


Пример в комментариях.

🔹 Viggle-Animate — замена персонажа в видео, впервые с открытыми весами
Берёте кадр из ролика, перерисовываете в нём персонажа - модель протягивает замену через всё видео, сохраняя движение и камеру. Никаких скелетов и масок, и в шесть раз быстрее Wan2.2-Animate. Аппетиты соответствующие: рекомендуют 96 ГБ видеопамяти.

Пример в комментариях.

🔹 OpenClaw 2.0 — самое крупное обновление опенсорсного личного ассистента
Собрал примерно половину всех правок за историю проекта.
— установка цепляется к тому, что уже стоит: подписка ChatGPT или Claude, ключи, локальные модели - час в конфигах больше не нужен
— появились общие облачные сессии: подключаете второго человека или передаёте ему задачу со всем контекстом


🔹 Gemini 4 — утекла таблица с цифрами, и они выше всего,что сейчас есть
Google подтвердил только сам факт обучения - "самый амбициозный pre-training run" в истории компании. В самой таблице столбец Gemini 4 помечен как предсказанный, а не измеренный, так что пока это слух.

Если верить, то это отличный комбэк. А то смотреть на Гугл было уже печально

Таблица в комментариях.

@VAI_ART
#VAI_News
👍5🔥2
С тем, насколько сейчас выходят крутые модели, лично у меня есть ощущение, что через год нам не нужна будет куча нейронок. Будет достаточно одной LLM, которая будет полностью мультимодальной. Нужно сделать модель - сделает, нужно сгенерировать видео - сгенерирует и т.д. Я уже давно заметил, еще в достаточно старых моделях того же GPT, что она хорошо понимала топологию сетки. Достаточно было попросить наложить сетку на объект или персонажа, и она это делала, но на тот момент у нее не было рук, того же MCP. Или как Claude с помощью математики делает видеоролики, с сюжетом. Т.е. там даже нет и близко модели для генерации видео, но он настолько умный, что она ему и не нужна. Или как сейчас уже можно генерировать звуки через те же LLM-модели, и многое, многое другое. В общем, звоночки были уже давно.

На прошлой неделе вышла новая модель GPT Astra, и с помощью своих мозгов и имеющихся рук ее спокойно подключают к тому же Blender - она очень хорошо понимает форму, сетку и т.д. Понятно, что еще есть косяки, но интернет заполонили модели в достаточно хорошем качестве, которые сделала Astra в Blender. Настройку рендера, материалов - все уже можно делать руками агентов.

Я думаю, что это еще не все. Пока модели недостаточно умные и используют вспомогательные программы для работы. Через год моделям уже будут не нужны эти прокладки и они сами будут делать все внутри себя.

@VAI_ART
#VAI_Notes
👍11😱4🫡1
Думаю, все уже знают, что вышла Imagen 2.5, но поделюсь.

Зачем осенью 2026 года расписывать, что может модель, если она это может сделать сама.

@VAI_ART
#VAI_News
👍8🔥4