В общем, я тут за вечерок небольшой проект сделал. Решил новую рубрику открыть. В которой будут полезные инструменты и сервисы.
Вижу, что у многих сейчас проблемы с поиском работы, так как индустрию штормит, поэтому решил сделать сайт, на котором собираются вакансии от работодателей. Парсится всё, что можно, из доступных сервисов, сайтов, тг-каналов, и на сайт выводится общий список вакансий, которые есть в открытом доступе.
Пока просто для теста, но хочется, чтобы объявления обновлялись каждый день, закрытые архивировались и т. д. Работы еще много. Сейчас есть деление по вакансиям и рынкам.
Надеюсь, кому-то поможет. Если зайдёт, то доработаю по дизайну и функционалу, ну и поставлю агентов на постоянную поддержку, чтобы самому не возиться)
По сути, сейчас сделать можно всё что угодно, нужна только идея и чутка желания. И уже выбираешь, на что потратить своё время, чтобы это было действительно чем-то нужным.
Заодно хотел попрактиковаться с мультиагентными системами в работе.
Если кому-то поможет, то будет достаточно спасибо.
Ставьте/пишите что-нибудь, чтобы было понятно, нужно ли.
@VAI_ART
#VAI_TOOLS
Вижу, что у многих сейчас проблемы с поиском работы, так как индустрию штормит, поэтому решил сделать сайт, на котором собираются вакансии от работодателей. Парсится всё, что можно, из доступных сервисов, сайтов, тг-каналов, и на сайт выводится общий список вакансий, которые есть в открытом доступе.
Пока просто для теста, но хочется, чтобы объявления обновлялись каждый день, закрытые архивировались и т. д. Работы еще много. Сейчас есть деление по вакансиям и рынкам.
Надеюсь, кому-то поможет. Если зайдёт, то доработаю по дизайну и функционалу, ну и поставлю агентов на постоянную поддержку, чтобы самому не возиться)
По сути, сейчас сделать можно всё что угодно, нужна только идея и чутка желания. И уже выбираешь, на что потратить своё время, чтобы это было действительно чем-то нужным.
Заодно хотел попрактиковаться с мультиагентными системами в работе.
Если кому-то поможет, то будет достаточно спасибо.
Ставьте/пишите что-нибудь, чтобы было понятно, нужно ли.
@VAI_ART
#VAI_TOOLS
2🔥21👍12🤗4
Пробежимся по новостям за неделю.
🔹 MiniMax H3 — видеомодель с 2K и звуком, которую обещают выложить в открытый доступ
Вышла 30 июля, уже крутится на fal и OpenRouter. Веса обещают в ближайшие дни — если сдержат слово, это будет самая сильная открытая видеомодель.
Пример в комментариях.
🔹 Seedance 2.5 — ByteDance наконец официально запустили модель
Релиз 31 июля: Dreamina по всему миру, Jimeng и Doubao в Китае. API обещают 7 августа.
Презентации и сравнения со второй версией в комментариях.
🔹 Grok Imagine 1.5 — добавили референсы персонажей и голос
Апдейт от 1 августа для видеомодели Imagine 1.5: уже на сайте и в iOS, референсы стартовали в США на SuperGrok Plus и Heavy.
Презентация в комментариях.
🔹 Lyria 3.5 — Google переписали генератор музыки в Flow Music
Вышла 29 июля, доступна в Flow Music всем, включая бесплатный тариф. Обучена на лицензированных данных — в отличие от Suno и Udio, которые судятся с Sony.
🔹 Kimi K3 — Moonshot всё-таки выложили веса флагмана
Обещали до 27 июля — успели впритык. Лицензия разрешает коммерческое использование.
🔹 Nano Banana 2 в Google Earth — любую точку планеты можно перерисовать промптом
Кнопка Create image в веб-версии Google Earth, раскатывают глобально.
Пример в комментариях.
🔹 GPT-5.6 подешевел — OpenAI срезали цены через три недели после релиза
Цены в API снизили 30 июля.
График по ценам в комментариях.
🔹 Обновили MCP — подключать ИИ-агента к сервисам стало проще
MCP — стандарт, по которому агент ходит в вашу почту, календарь, Notion или базу: под каждый сервис пишется переходник, MCP-сервер. 28 июля вышла новая версия — крупнейшая с запуска.
🔹DeepSeek V4-Flash — вышла из превью и подтянулась в агентных задачах
Официальный релиз 31 июля. Архитектуру не трогали, весь прирост — за счёт дообучения. Цена $0.14/$0.28 за 1М токенов.
График в комментариях.
@VAI_ART
#VAI_News
🔹 MiniMax H3 — видеомодель с 2K и звуком, которую обещают выложить в открытый доступ
Вышла 30 июля, уже крутится на fal и OpenRouter. Веса обещают в ближайшие дни — если сдержат слово, это будет самая сильная открытая видеомодель.
— ролики 5-15 секунд в 2K, со стереозвуком: голоса, музыка и эффекты генерируются вместе с картинкой
— в одном промпте принимает текст, картинки, видео и аудио — смешивайте референсы персонажей и сцен
— умеет редактировать готовое видео и переносить движение с одного ролика на другой
Пример в комментариях.
🔹 Seedance 2.5 — ByteDance наконец официально запустили модель
Релиз 31 июля: Dreamina по всему миру, Jimeng и Doubao в Китае. API обещают 7 августа.
— 30 секунд видео со звуком одним дублем, без склеек; в бете растягивается до трёх минут
— до 50 референсов в одной генерации: персонажи, объекты, стиль
— появились плагины для Blender и Maya — черновой превиз из 3D превращается в готовый кадр
Презентации и сравнения со второй версией в комментариях.
🔹 Grok Imagine 1.5 — добавили референсы персонажей и голос
Апдейт от 1 августа для видеомодели Imagine 1.5: уже на сайте и в iOS, референсы стартовали в США на SuperGrok Plus и Heavy.
— до семи картинок-референсов сразу: персонаж, окружение, реквизит — сериал не разваливается от кадра к кадру
— если дать вместе фото и образец голоса, персонаж звучит одинаково во всех сценах
— 1080p генерится нативно, без апскейла на выходе
Презентация в комментариях.
🔹 Lyria 3.5 — Google переписали генератор музыки в Flow Music
Вышла 29 июля, доступна в Flow Music всем, включая бесплатный тариф. Обучена на лицензированных данных — в отличие от Suno и Udio, которые судятся с Sony.
— вокал стал выразительнее, слова проговариваются внятно
— держит структуру текста: куплет остаётся куплетом, припев припевом
— темп и длительность песни теперь задаются вручную
🔹 Kimi K3 — Moonshot всё-таки выложили веса флагмана
Обещали до 27 июля — успели впритык. Лицензия разрешает коммерческое использование.
— скачать может кто угодно, но файл весит 1.4 ТБ и для запуска нужны сотни гигабайт видеопамяти
— важнее другое: теперь модель может поднять у себя любой провайдер, и цена за токены пойдёт вниз
🔹 Nano Banana 2 в Google Earth — любую точку планеты можно перерисовать промптом
Кнопка Create image в веб-версии Google Earth, раскатывают глобально.
— опирается на реальные спутниковые и 3D-данные, поэтому геометрия места сохраняется
— работает и в прошлое, и в будущее: реконструкция руин или концепт застройки на пустыре
Пример в комментариях.
🔹 GPT-5.6 подешевел — OpenAI срезали цены через три недели после релиза
Цены в API снизили 30 июля.
— Luna дешевле в пять раз: $0.20/$1.20 за 1М токенов вместо $1/$6
— Terra минус 20%: $2/$12
— у Sol цена прежняя, но появился Fast mode — вдвое дороже, до 2.5 раз быстрее
График по ценам в комментариях.
🔹 Обновили MCP — подключать ИИ-агента к сервисам стало проще
MCP — стандарт, по которому агент ходит в вашу почту, календарь, Notion или базу: под каждый сервис пишется переходник, MCP-сервер. 28 июля вышла новая версия — крупнейшая с запуска.
— раньше переходник держал постоянное соединение и помнил всю сессию, поэтому его приходилось круглосуточно крутить на своём сервере
— теперь каждый запрос самодостаточный: переходник можно повесить на дешёвый облачный сервис, который просыпается на вызов
— в итоге свой MCP-сервер стало дешевле держать и проще написать
🔹DeepSeek V4-Flash — вышла из превью и подтянулась в агентных задачах
Официальный релиз 31 июля. Архитектуру не трогали, весь прирост — за счёт дообучения. Цена $0.14/$0.28 за 1М токенов.
— на агентном кодинге обходит собственную старшую V4-Pro-Preview
— контекст 1М токенов, параллельные вызовы инструментов, три уровня размышлений
— нативно поддерживает Responses API — подключается в Codex как родная
График в комментариях.
@VAI_ART
#VAI_News
👍5❤3
Сегодня добавили новые фишки в GPT. Сейчас генерировать концепты/изображения можно достаточно легко. Уже давно можно попросить сгенерировать сразу 10 вариантов, и он сделает. А вот сегодня заметил, что он сам начал себя править. Отправил запрос на генерацию, и он сделал не так, как я хотел. Он, не дожидаясь конца, сразу написал, что ошибся в некоторых местах и сейчас всё исправит, и что самое интересное - правда исправил). Это круто, что они встроили проверку перед тем, как отдать результат. Получить желаемый вариант теперь намного проще.
@VAI_ART
#VAI_Notes
@VAI_ART
#VAI_Notes
👍11❤2🤔1🙈1
Forwarded from AI-Шипучка
Всем пшшшш, мои шипучие, наконец то выложила оставшиеся переводы и адаптации курсов Anthropic на русском языке.
Гайд по всем шести курсам: что где лежит и в каком порядке это брать.
48 уроков, все бесплатно и без регистрации. Прогресс сохраняется прямо в браузере, так что можно бросить на середине и вернуться через неделю.
Сначала маршруты, потом что внутри каждого.
———
ЕСЛИ ВЫ НЕ ПИШЕТЕ КОД
Первый, второй, третий. Примерно десять часов, и вы закрываете весь путь от «я не понимаю, как с ним разговаривать» до «я собираю рабочие промпты под свои задачи».
ЕСЛИ ВЫ РАЗРАБОТЧИК
Второй, четвёртый, пятый. База по промптам, потом API, потом инструменты. Первый курс можно пролистать, но не пропускайте четвёртый ради пятого: агенты без понимания messages разваливаются в первый же вечер.
ЕСЛИ ВЫ УЖЕ ЧТО-ТО ВЫКАТИЛИ НА ЛЮДЕЙ
Сразу шестой. Он неприятный и самый полезный.
———
1. Свободное владение ИИ
13 уроков, без кода
Про то, как вообще устроена работа с ИИ: что ему отдавать, а что делать самой, как объяснять, чему верить и что перепроверять. Тот случай, когда после курса меняется не набор приёмов, а привычка думать. Начинать с нуля - отсюда.
aishipuchka.com/courses/ai-fluency/
2. Промпт-инжиниринг
9 глав, ≈20 минут на главу, без кода
Курс, по которому промптингу учатся сами инженеры Anthropic. Устройство запроса, роли, XML-теги, примеры, пошаговое рассуждение, борьба с галлюцинациями, сборка сложных промптов с нуля. Скелет, на котором держится всё остальное.
aishipuchka.com/courses/prompt-engineering/
3. Промптинг на реальных задачах
5 уроков, ≈30 минут, без кода
Три настоящие задачи целиком: данные из медицинской карты, саммари телефонного разговора, бот поддержки по своей базе. Первая версия промпта, что сломалось, что дописали. Про то, что хороший промпт не пишется, а отлаживается.
aishipuchka.com/courses/real-world-prompting/
4. Основы Claude API
6 уроков, ≈25 минут, Python
Выход из окна чата в код. Первый запрос, формат messages, почему модель ничего не помнит, чем модели отличаются, параметры, стриминг, картинки. Скучно ровно настолько, насколько обязательно.
aishipuchka.com/courses/api-fundamentals/
5. Инструменты для Claude
6 уроков, ≈30 минут, Python
Как модель вызывает ваш код. Вы описываете функции, она говорит какую позвать, выполняете вы. Из этого цикла собраны все агенты и MCP. После курса «агент» перестаёт быть магией и становится архитектурой.
aishipuchka.com/courses/tool-use/
6. Оценка промптов
9 уроков, ≈25 минут, Python
Как понять, что промпт стал лучше, а не «вроде лучше». Тестовые наборы, проверка ответов кодом, оценка моделью по вашей рубрике, автоматический прогон при каждом изменении. Самый пролистываемый и самый важный курс из шести.
aishipuchka.com/courses/prompt-evaluations/
———
Все бесплатно, потому что лицензия прямо запрещает на этом зарабатывать. Единственная просьба - если пригодилось, перешлите тому, кто до сих пор говорит нейросети «сделай красиво».
Все курсы: aishipuchka.com/courses/
🤩 - сохранил(а) гайд
🔥 - иду проходить шестой
Гайд по всем шести курсам: что где лежит и в каком порядке это брать.
48 уроков, все бесплатно и без регистрации. Прогресс сохраняется прямо в браузере, так что можно бросить на середине и вернуться через неделю.
Сначала маршруты, потом что внутри каждого.
———
ЕСЛИ ВЫ НЕ ПИШЕТЕ КОД
Первый, второй, третий. Примерно десять часов, и вы закрываете весь путь от «я не понимаю, как с ним разговаривать» до «я собираю рабочие промпты под свои задачи».
ЕСЛИ ВЫ РАЗРАБОТЧИК
Второй, четвёртый, пятый. База по промптам, потом API, потом инструменты. Первый курс можно пролистать, но не пропускайте четвёртый ради пятого: агенты без понимания messages разваливаются в первый же вечер.
ЕСЛИ ВЫ УЖЕ ЧТО-ТО ВЫКАТИЛИ НА ЛЮДЕЙ
Сразу шестой. Он неприятный и самый полезный.
———
1. Свободное владение ИИ
13 уроков, без кода
Про то, как вообще устроена работа с ИИ: что ему отдавать, а что делать самой, как объяснять, чему верить и что перепроверять. Тот случай, когда после курса меняется не набор приёмов, а привычка думать. Начинать с нуля - отсюда.
aishipuchka.com/courses/ai-fluency/
2. Промпт-инжиниринг
9 глав, ≈20 минут на главу, без кода
Курс, по которому промптингу учатся сами инженеры Anthropic. Устройство запроса, роли, XML-теги, примеры, пошаговое рассуждение, борьба с галлюцинациями, сборка сложных промптов с нуля. Скелет, на котором держится всё остальное.
aishipuchka.com/courses/prompt-engineering/
3. Промптинг на реальных задачах
5 уроков, ≈30 минут, без кода
Три настоящие задачи целиком: данные из медицинской карты, саммари телефонного разговора, бот поддержки по своей базе. Первая версия промпта, что сломалось, что дописали. Про то, что хороший промпт не пишется, а отлаживается.
aishipuchka.com/courses/real-world-prompting/
4. Основы Claude API
6 уроков, ≈25 минут, Python
Выход из окна чата в код. Первый запрос, формат messages, почему модель ничего не помнит, чем модели отличаются, параметры, стриминг, картинки. Скучно ровно настолько, насколько обязательно.
aishipuchka.com/courses/api-fundamentals/
5. Инструменты для Claude
6 уроков, ≈30 минут, Python
Как модель вызывает ваш код. Вы описываете функции, она говорит какую позвать, выполняете вы. Из этого цикла собраны все агенты и MCP. После курса «агент» перестаёт быть магией и становится архитектурой.
aishipuchka.com/courses/tool-use/
6. Оценка промптов
9 уроков, ≈25 минут, Python
Как понять, что промпт стал лучше, а не «вроде лучше». Тестовые наборы, проверка ответов кодом, оценка моделью по вашей рубрике, автоматический прогон при каждом изменении. Самый пролистываемый и самый важный курс из шести.
aishipuchka.com/courses/prompt-evaluations/
———
Все бесплатно, потому что лицензия прямо запрещает на этом зарабатывать. Единственная просьба - если пригодилось, перешлите тому, кто до сих пор говорит нейросети «сделай красиво».
Все курсы: aishipuchka.com/courses/
🤩 - сохранил(а) гайд
🔥 - иду проходить шестой
Aishipuchka
Свободное владение ИИ — официальный курс Anthropic на русском
Как работать с ИИ эффективно, рационально, этично и безопасно. Перевод курса AI Fluency (Дакан, Феллер, Anthropic) на русский.
🔥12👍8❤5
Немного новостей в ИИ за неделю. Погнали!
🔹 Wan 3.0 — Alibaba научили видеомодель держать 30 секунд одним дублем
Публичная бета с 6 августа: Qwen Cloud и Alibaba Cloud Model Studio, полноценный API обещают позже. Весов пока не выкладывали.
Презентация и видео в комментариях.
🔹 Grok Imagine Image 2.0 — xAI выпустили генератор картинок с нормальным редактированием
Вышел 7 августа, работает как Quality Mode на grok.com/imagine и в приложениях. На обеих аренах второе место — после gpt-image-2. API обещают позже.
Презентация и примеры в комментариях.
🔹 FLUX 3 Video — Black Forest Labs открыли видеомодель всем
В июле она была по заявке избранным партнёрам, с 4 августа доступна через API BFL любому. По замерам BFL обходит конкурентов в text-to-video и идёт вровень с Seedance 2.0 в image-to-video.
Видео в комментариях.
🔹 Wan Animate 2 — Alibaba переносят движение с видео на персонажа без скелета
Открытая модель от Tongyi Lab, демо и код уже выложены, веса базовой версии обещают следом.
🔹 Qwen3.8-Max — Alibaba выкатили флагман на 2.4 триллиона параметров
Релиз 3 августа, пока только по API за $2/$6 за 1М токенов. На следующей неделе обещают выложить веса — впервые для Max-модели.
Как обычно побивает всех. Графики в комментариях.
🔹 Muse Spark 1.2 и Muse Code — у Meta появилась своя модель для кода и агент к ней
5 августа. Модель доступна через Meta Model API, агент в терминале — в бете. $1.25/$4.25 за 1М токенов.
Графики в комментариях.
🔹 Grok Voice Think Fast 2.0 — голосовая модель xAI стала дефолтной
Вышла 29 июля, а 5 августа на неё переключили grok-voice-latest — теперь её получают все, кто дёргает API по умолчанию. $0.08 за минуту разговора.
@VAI_ART
#VAI_News
🔹 Wan 3.0 — Alibaba научили видеомодель держать 30 секунд одним дублем
Публичная бета с 6 августа: Qwen Cloud и Alibaba Cloud Model Studio, полноценный API обещают позже. Весов пока не выкладывали.
— 30 секунд одной генерацией вместо 2-15 у прошлой версии: камера едет непрерывно, склеивать нечего
— на вход можно кинуть pdf, презентацию или таблицу — модель сама разбирает документ и собирает из него ролик
— звук пишется вместе с картинкой, а не подкладывается сверху
— 480p/720p/1080p по $0.05/$0.10/$0.20 за секунду — полный тридцатисекундный ролик в 1080p выходит около $6
Презентация и видео в комментариях.
🔹 Grok Imagine Image 2.0 — xAI выпустили генератор картинок с нормальным редактированием
Вышел 7 августа, работает как Quality Mode на grok.com/imagine и в приложениях. На обеих аренах второе место — после gpt-image-2. API обещают позже.
— «волшебная палочка» правит выделенный кусок картинки, не перерисовывая всё остальное
— вырезает объект и отдаёт с прозрачным фоном — можно сразу тащить в композ
— принимает до пяти референсов за раз: персонаж, фон и объект собираются в один кадр без ручной склейки
— Smart Resize перекомпоновывает картинку под девять пропорций, а не просто кропает
Презентация и примеры в комментариях.
🔹 FLUX 3 Video — Black Forest Labs открыли видеомодель всем
В июле она была по заявке избранным партнёрам, с 4 августа доступна через API BFL любому. По замерам BFL обходит конкурентов в text-to-video и идёт вровень с Seedance 2.0 в image-to-video.
— ролики до 20 секунд одной генерацией: HD нативно, Full HD через апскейл
— звук и диалоги генерируются вместе с картинкой, липсинк на 14 языках
— есть черновой режим — прогоняете идею дёшево и рендерите в качестве только финал
— умеет продолжать готовый ролик и собирать несколько сцен подряд, не теряя связность
Видео в комментариях.
🔹 Wan Animate 2 — Alibaba переносят движение с видео на персонажа без скелета
Открытая модель от Tongyi Lab, демо и код уже выложены, веса базовой версии обещают следом.
— раньше движение сначала превращали в скелет и теряли детали; теперь модель ест исходное видео целиком — мимика и пальцы остаются на месте
— ракурс камеры задаётся текстом отдельно от исходника: та же сцена с другой точки
— тянет несколько персонажей в кадре, а версия Lite считает почти в реальном времени
🔹 Qwen3.8-Max — Alibaba выкатили флагман на 2.4 триллиона параметров
Релиз 3 августа, пока только по API за $2/$6 за 1М токенов. На следующей неделе обещают выложить веса — впервые для Max-модели.
— контекст 1М токенов, на вход идут текст, картинки и видео
— заточена под длинные задачи: сама планирует, пишет код, запускает инструменты и правит свои ошибки
— на тесте работы за компьютером OSWorld-Verified — 86.1, выше GPT-5.6 Sol Max и Claude Fable 5
Как обычно побивает всех. Графики в комментариях.
🔹 Muse Spark 1.2 и Muse Code — у Meta появилась своя модель для кода и агент к ней
5 августа. Модель доступна через Meta Model API, агент в терминале — в бете. $1.25/$4.25 за 1М токенов.
— контекст 1М, обучали на целых репозиториях, а не на отдельных файлах
— агент пишет все свои действия в локальный лог: прогон можно точно повторить или продолжить после падения
— есть тариф в десять раз дешевле, если разрешить обучать модель на ваших запросах
Графики в комментариях.
🔹 Grok Voice Think Fast 2.0 — голосовая модель xAI стала дефолтной
Вышла 29 июля, а 5 августа на неё переключили grok-voice-latest — теперь её получают все, кто дёргает API по умолчанию. $0.08 за минуту разговора.
— отвечает через 0.7 секунды вместо 1.25 — пауза перестаёт быть заметной в живом диалоге
— распознаёт речь в полтора-два раза точнее Deepgram Nova 3 и ElevenLabs Scribe v2, а в шуме разрыв доходит до десяти раз
— успевает вызвать нужный инструмент до того, как договорит первую фразу
@VAI_ART
#VAI_News
✍2👍2
VAI
В общем, я тут за вечерок небольшой проект сделал. Решил новую рубрику открыть. В которой будут полезные инструменты и сервисы. Вижу, что у многих сейчас проблемы с поиском работы, так как индустрию штормит, поэтому решил сделать сайт, на котором собираются…
В общем, ещё пару вечеров посидел и более-менее довёл до ума.
Из сделанного:
— сильно расширился поиск, а по итогу стало намного больше вакансий
— у вакансии появилась своя страница
— стало понятно, что где искать (новая сортировка)
— сайт стал быстрым
и многое другое.
Дизайн трогать не стал: чёрно-белый минимализм, что может быть лучше для подобного продукта😎
Потыкайте, если ещё что-то нужно - добавлю и пойду дальше, а так он полностью автономный, вакансии будут пополняться и закрываться автоматически.
@VAI_ART
#VAI_TOOLS
Из сделанного:
— сильно расширился поиск, а по итогу стало намного больше вакансий
— у вакансии появилась своя страница
— стало понятно, что где искать (новая сортировка)
— сайт стал быстрым
и многое другое.
Дизайн трогать не стал: чёрно-белый минимализм, что может быть лучше для подобного продукта
Потыкайте, если ещё что-то нужно - добавлю и пойду дальше, а так он полностью автономный, вакансии будут пополняться и закрываться автоматически.
@VAI_ART
#VAI_TOOLS
Please open Telegram to view this post
VIEW IN TELEGRAM
gamedev-jobs.vercel.app
GameDev Jobs — вакансии геймдева РФ, СНГ и зарубежья
Агрегатор вакансий игровой индустрии: разработка, арт, геймдизайн, QA. Только живые вакансии.
👍15🔥2
Давненько не было практики. 🫡
Я разработал небольшой и простой пайплайн для текстурирования моделей. Ни на что не претендую, но способ реально рабочий и помогал мне уже не раз. К слову, недавно нужно было перетекстурировать часть объектов для локации, которые были в бэкграйнде, и этим методом я сделал это за пару часов. В старые времена мне бы потребовалось несколько дней.
Сразу скажу, что, как и многие вещи с ИИ, способ не идеальный: есть артефакты, и чем сложнее модель, тем их становится больше. Но даже так загрузить потом модель в Substance, Coat и другие аналоги и подправить руками - намного быстрее, чем делать с нуля.
Сам пайплайн строится с пониманием того, что модель с развёрткой уже есть.
🔹 Делаю скрин/скрины модели с нужных ракурсов
🔹 Загружаю их в Imagen от GPT и прошу сделать нужную текстуру поверх модели или вариацию текстуры от существующей. Тут всё зависит от ситуации: могу подгрузить лёгкий драфт поверх или пару референсов
🔹 Получаю модель с нужной текстурой или вариации текстуры
🔹 Загружаю модель в Tripo. Тут есть оговорка: Tripo у меня куплен, и у меня полный карт-бланш с ним (там есть и некоторое количество бесплатных попыток), загружаю референс с сгенерированным изображением. Из-за того что силуэты и формы совпадают, он хорошо понимает, что нужно сделать. Также большим плюсом является то, что Tripo сохраняет развёртку загруженной модели. Могу ошибаться, но аналогов я не встречал - сервисы, которые работают с заданной развёрткой, зачастую игнорируют её и перегенерируют новую, что не очень удобно, но в целом не критично, так как это просто добавляет одну лишнюю итерацию, где нужно будет перепечь текстуру с одной модели на другую или с канала на канал в развёртке
🔹 Проделываем этот цикл столько раз, сколько нужно, чтобы получить нужные варианты текстур
Пробуйте и экономьте своё время для более интересных вещей.🔥 🔥 🔥
@VAI_ART
#VAI_Practice
Я разработал небольшой и простой пайплайн для текстурирования моделей. Ни на что не претендую, но способ реально рабочий и помогал мне уже не раз. К слову, недавно нужно было перетекстурировать часть объектов для локации, которые были в бэкграйнде, и этим методом я сделал это за пару часов. В старые времена мне бы потребовалось несколько дней.
Сразу скажу, что, как и многие вещи с ИИ, способ не идеальный: есть артефакты, и чем сложнее модель, тем их становится больше. Но даже так загрузить потом модель в Substance, Coat и другие аналоги и подправить руками - намного быстрее, чем делать с нуля.
Сам пайплайн строится с пониманием того, что модель с развёрткой уже есть.
🔹 Делаю скрин/скрины модели с нужных ракурсов
🔹 Загружаю их в Imagen от GPT и прошу сделать нужную текстуру поверх модели или вариацию текстуры от существующей. Тут всё зависит от ситуации: могу подгрузить лёгкий драфт поверх или пару референсов
🔹 Получаю модель с нужной текстурой или вариации текстуры
🔹 Загружаю модель в Tripo. Тут есть оговорка: Tripo у меня куплен, и у меня полный карт-бланш с ним (там есть и некоторое количество бесплатных попыток), загружаю референс с сгенерированным изображением. Из-за того что силуэты и формы совпадают, он хорошо понимает, что нужно сделать. Также большим плюсом является то, что Tripo сохраняет развёртку загруженной модели. Могу ошибаться, но аналогов я не встречал - сервисы, которые работают с заданной развёрткой, зачастую игнорируют её и перегенерируют новую, что не очень удобно, но в целом не критично, так как это просто добавляет одну лишнюю итерацию, где нужно будет перепечь текстуру с одной модели на другую или с канала на канал в развёртке
🔹 Проделываем этот цикл столько раз, сколько нужно, чтобы получить нужные варианты текстур
Пробуйте и экономьте своё время для более интересных вещей.
@VAI_ART
#VAI_Practice
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥12👍8❤2✍1
Неделю LLM объявляю закрытой. Быстро пробежимся по самому интересному.
🔹 LTX-2.5 — Lightricks выложили открытую видеомодель, которая едет на домашней карте
Веса открыты, минимум 16 GB VRAM, ComfyUI с первого дня. Коммерция бесплатна до $10 млн выручки. API — $0.09/с за 720p, $0.15/с за 1080p, $0.37/с за 4K.
Видео в комментариях.
🔹 Seedream 5.0 Pro Layer Separation — ByteDance научили модель разбирать картинку на слои
Работает на fal в Playground и API. $0.034 за слой до 1536×1536 и $0.068 выше — разбор на 10 слоёв ≈ $0.34.
Видео в комментариях.
🔹 Meshy 7 — image-to-3D, который точнее попадает в референс
На всех тарифах, скачивание — с Pro. Генерация меньше минуты, на выходе FBX, GLB, OBJ или USDZ.
Примеры в комментариях.
🔹 Gemini 3.7 Flash — Google выпустили рабочую модель под код и агентов
В Gemini API, AI Studio и Spark. До конца 2026 — $0.75/$3.75 за 1М токенов, в 2.5–3 раза дешевле Sonnet 5 и GPT-5.6 Terra. С января вдвое дороже.
Графики в комментариях.
🔹 Grok 4.6 — xAI обновили флагман и целят в долгие агенты
$2/$6 за 1М токенов. Доступ сразу везде: API, Cursor, Grok Build, OpenRouter.
Презентация и график в комментариях.
🔹 GLM-5.3 — Z.ai вытянули модель одним post-training
База та же, что у 5.2 — весь прирост из дообучения. Пока в GLM Coding Plan и ZCode, веса позже.
Графики в комментариях.
🔹 Qwen3.8-27B — Alibaba выложили компактную модель под Apache 2.0
27B, контекст 262K с расширением до 1М, на вход текст, картинки и видео.
Графики в комментариях.
🔹 GPT-5.6 Sol Ultrafast mode — OpenAI показали инференс на чипах Cerebras
Пока для избранных в API. До 750 токенов в секунду, ускорение до 14 раз: веса лежат прямо на огромных wafer-чипах и не гоняются между памятью и хранилищем. Прогон HLE занял 11 часов против 80 у Fable.
Презентация в комментариях.
🔹 Suno Studio 2.0 — браузерная студия дотянулась до полноценной DAW
Только подписчикам Premier: 10 000 кредитов в месяц и экспорт стемов в 32-bit / 48 kHz.
Видео в комментариях.
@VAI_ART
#VAI_News
🔹 LTX-2.5 — Lightricks выложили открытую видеомодель, которая едет на домашней карте
Веса открыты, минимум 16 GB VRAM, ComfyUI с первого дня. Коммерция бесплатна до $10 млн выручки. API — $0.09/с за 720p, $0.15/с за 1080p, $0.37/с за 4K.
— нативный multishot: связанные шоты идут одной генерацией, персонаж, свет и голос держатся на склейках
— модель сама решает длительность сцены, а не режет по фиксированному лимиту
— новый видеодекодер даёт меньше артефактов в движении, заявлены 4K HDR и редактирование готового ролика
Видео в комментариях.
🔹 Seedream 5.0 Pro Layer Separation — ByteDance научили модель разбирать картинку на слои
Работает на fal в Playground и API. $0.034 за слой до 1536×1536 и $0.068 выше — разбор на 10 слоёв ≈ $0.34.
— на выходе от 2 до 17 PNG с прозрачностью: персонажей, предметы и фон двигаете независимо
— промптом указываете, что именно отделять, а не получаете фиксированную нарезку
— фон дорисовывается за объектом, который его закрывал — дырки не остаётся
Видео в комментариях.
🔹 Meshy 7 — image-to-3D, который точнее попадает в референс
На всех тарифах, скачивание — с Pro. Генерация меньше минуты, на выходе FBX, GLB, OBJ или USDZ.
— лучше понимает форму, но еще есть вопросики
— появился режим Smart Topology: чистая сетка, части модели разделены сразу, полигонаж от 100 до 15 000
— ultra_mode за +5 кредитов вытягивает мелкий рельеф поверхности
— полный PBR-набор albedo/normal/metallic/roughness, текстуры до 4K
Примеры в комментариях.
🔹 Gemini 3.7 Flash — Google выпустили рабочую модель под код и агентов
В Gemini API, AI Studio и Spark. До конца 2026 — $0.75/$3.75 за 1М токенов, в 2.5–3 раза дешевле Sonnet 5 и GPT-5.6 Terra. С января вдвое дороже.
— код в реальных репозиториях: закрывает две трети задач вместо половины у 3.6 Flash
— рутину в бизнес-процессах доводит до конца почти втрое чаще
— а в терминале и за компьютером работать толком не умеет: тут GPT-5.6 впереди
Графики в комментариях.
🔹 Grok 4.6 — xAI обновили флагман и целят в долгие агенты
$2/$6 за 1М токенов. Доступ сразу везде: API, Cursor, Grok Build, OpenRouter.
— за месяц догнала топовые модели по общему уровню, оставшись втрое дешевле
— лучше всех разбирает документы: на юридических задачах отрыв от GPT-5.6 шестикратный
— а код пишет слабее конкурентов — за этим идти не сюда
Презентация и график в комментариях.
🔹 GLM-5.3 — Z.ai вытянули модель одним post-training
База та же, что у 5.2 — весь прирост из дообучения. Пока в GLM Coding Plan и ZCode, веса позже.
— работа в терминале выросла в шесть раз — из демо в рабочий инструмент
— думает короче: на сложные задачи тратит меньше токенов, чем 5.2
— сильнее всего прибавила в поиске уязвимостей: было четверть задач, стало половина
Графики в комментариях.
🔹 Qwen3.8-27B — Alibaba выложили компактную модель под Apache 2.0
27B, контекст 262K с расширением до 1М, на вход текст, картинки и видео.
— правит код в живых проектах на уровне платных флагманов, и это всего 27B
— умеет работать за компьютером и в Android: щёлкает интерфейсы, а не только пишет текст
— заводится локально: llama.cpp, Ollama, LM Studio
Графики в комментариях.
🔹 GPT-5.6 Sol Ultrafast mode — OpenAI показали инференс на чипах Cerebras
Пока для избранных в API. До 750 токенов в секунду, ускорение до 14 раз: веса лежат прямо на огромных wafer-чипах и не гоняются между памятью и хранилищем. Прогон HLE занял 11 часов против 80 у Fable.
Презентация в комментариях.
🔹 Suno Studio 2.0 — браузерная студия дотянулась до полноценной DAW
Только подписчикам Premier: 10 000 кредитов в месяц и экспорт стемов в 32-bit / 48 kHz.
— нормальный MIDI на таймлайне: импорт, запись, редактирование, подключение контроллеров
— MIDI-клип можно скормить как промпт: сыграли аккорды — модель продолжает партию
— Chat Bar в бете: словами заказываете новый звук, обработку вокала или собственный плагин
Видео в комментариях.
@VAI_ART
#VAI_News
👍7❤2✍1
Media is too big
VIEW IN TELEGRAM
Моя любимая рубрика. Посты подписчиков. 🦄
На этот раз Александр прислал пост, демонстрирующий способ рендера поверх болванки.
Workflow для генерации оружия (и не только) в заданном стиле в ComfyUI.
Тут применяются две модели: Krea 2 для создания шейпа оружия и Klein Edit для наложения материалов. В случае с Klein участвует и собственная лора (Klein LoRA - это LoRA-адаптер, натренированный поверх FLUX.2 [klein]) для этой edit модели.
Krea 2 берет за основу 3D блокуат и детальный промпт, делает первую итерацию - оружие. Потом картинка из Krea 2 прогоняется через Klein. Klein лоре нужен лишь промпт, он может быть детальный, а может и простой - "примени такие-то материалы". Но лучше детальный. В итоге получается оружие в нужном стиле, в данном случае реалистичном, CoD стиле.
Материалы накладываются безупречно, все косяки приходят с формы оружия, то есть с модели Krea 2. Если натренировать лору и для модели Krea 2, то и формы объектов попадут в стиль. Что открывает возможность генерации огромного количества объектов в каком нужно стиле, чтобы, например, наполнять уже существующую вселенную.
Данный воркфлоу презентует оружие, но что им генерить зависит от лоры, что вы тренируете. Это, конечно, могут быть и пропсы, персонажи, локации и ui.
Исходники можно взять тут.
@VAI_ART
#VAI_Authors
На этот раз Александр прислал пост, демонстрирующий способ рендера поверх болванки.
Workflow для генерации оружия (и не только) в заданном стиле в ComfyUI.
Тут применяются две модели: Krea 2 для создания шейпа оружия и Klein Edit для наложения материалов. В случае с Klein участвует и собственная лора (Klein LoRA - это LoRA-адаптер, натренированный поверх FLUX.2 [klein]) для этой edit модели.
Krea 2 берет за основу 3D блокуат и детальный промпт, делает первую итерацию - оружие. Потом картинка из Krea 2 прогоняется через Klein. Klein лоре нужен лишь промпт, он может быть детальный, а может и простой - "примени такие-то материалы". Но лучше детальный. В итоге получается оружие в нужном стиле, в данном случае реалистичном, CoD стиле.
Материалы накладываются безупречно, все косяки приходят с формы оружия, то есть с модели Krea 2. Если натренировать лору и для модели Krea 2, то и формы объектов попадут в стиль. Что открывает возможность генерации огромного количества объектов в каком нужно стиле, чтобы, например, наполнять уже существующую вселенную.
Данный воркфлоу презентует оружие, но что им генерить зависит от лоры, что вы тренируете. Это, конечно, могут быть и пропсы, персонажи, локации и ui.
Исходники можно взять тут.
@VAI_ART
#VAI_Authors
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7🔥2❤1
Media is too big
VIEW IN TELEGRAM
В продолжение темы создания игр в одной непрерывной сессии.
Мэтт Шумер написал статью How to run a Gauntlet Loop, где рассказывает, как именно подходит к своим one-shot промптам.
Много полезных идей - можно подсмотреть, как писать промпт для больших проектов, чтобы он работал.
До этого еще показывал как он сделал Claude of Duty - клон Call of Duty за 1 промпт в Opus 5.
Upd. Докинул перевод в комментарии.
@VAI_ART
#VAI_Notes
Мэтт Шумер написал статью How to run a Gauntlet Loop, где рассказывает, как именно подходит к своим one-shot промптам.
Много полезных идей - можно подсмотреть, как писать промпт для больших проектов, чтобы он работал.
До этого еще показывал как он сделал Claude of Duty - клон Call of Duty за 1 промпт в Opus 5.
Upd. Докинул перевод в комментарии.
@VAI_ART
#VAI_Notes
👍6👎1👌1
Рубрика самых интересных новостей в ИИ за неделю. Все по плану.
🔹 FLUX Video Upscale — Black Forest Labs сделали отдельную модель под апскейл видео
Пробовать можно прямо в браузерном Playground.Десять секунд в 1080p выходят примерно в $1.4–2.
Видео в комментариях.
🔹 HappyShrimp 1.0 — Alibaba выпустили генератор песен целиком
Бета работает в браузере,в том числе за пределами Китая.
🔹 Pika Audio — четыре звуковые модели по цене, которой раньше не было
Pika выкатила сразу Music,SFX,Speech и Soundtrack.Пока через API Club,но там есть нормальный веб-Playground.Главное здесь — $0.015 за минуту музыки: четырёхминутная песня стоит около шести центов.
🔹 DeepSeek-V4-Flash-Vision-Exp — дешёвая модель,которая наконец видит картинку
Экспериментальная надстройка над V4-Flash.По тексту и ризонингу не просела,а на мультимодальных агентских задачах подошла вплотную к Opus 4.8.
🔹 luna-lisa-alpha — на арене засветился неанонсированный чекпоинт GPT Image
OpenAI выкатили в слепое тестирование новую версию генератора картинок,официального анонса пока нет.
🔹 Ox Alpha — на OpenRouter бесплатно раздают неизвестную frontier-модель
Появилась под меткой stealth: разработчик не назван.Заточена под код и агентов,на превью бесплатна — квота 100 триллионов токенов в сутки.
Графиков никто не показал. Все что нашел в комментариях.
🔹 Cursor Origin — свой GitHub, рассчитанный на темп агентов
Пока бета для платных тарифов. Репозитории синкаются с GitHub за минуту,комментарии к PR ходят в обе стороны,но источником правды остаётся GitHub.
Видео в комментариях.
🔹 Claude Academy — Anthropic выложили своё внутреннее обучение бесплатно
Учат не промпт-инжинирингу под конкретную модель,а общей логике работы с ИИ — тому же,что дают своим сотрудникам на онбординге.
Презентация в комментариях.
@VAI_ART
#VAI_News
🔹 FLUX Video Upscale — Black Forest Labs сделали отдельную модель под апскейл видео
Пробовать можно прямо в браузерном Playground.Десять секунд в 1080p выходят примерно в $1.4–2.
— это не резкость поверх пикселей,а перегенерация: чинит размазанные лица,глаза и разваленные текстуры травы и воды
— заточен под артефакты именно генеративного видео и знает внутреннюю кухню FLUX 3,но принимает любое видео от 480p
— множители 1.5x, 2x и 3x — на выходе 1080p,2K или 4K,звуковая дорожка сохраняется
— Precise держит исходную внешность персонажа,Creative дорисовывает детали агрессивнее и может её поменять
Видео в комментариях.
🔹 HappyShrimp 1.0 — Alibaba выпустили генератор песен целиком
Бета работает в браузере,в том числе за пределами Китая.
— сначала большая модель планирует структуру всей песни и только потом рендерится аудио:мелодия и аранжировка не разъезжаются к третьей минуте
— на вход можно дать жанр,темп,тональность,инструменты,тип вокала и настроение,а не только текст
— есть свои слова,инструментал,референсный трек и перенос музыкального стиля
🔹 Pika Audio — четыре звуковые модели по цене, которой раньше не было
Pika выкатила сразу Music,SFX,Speech и Soundtrack.Пока через API Club,но там есть нормальный веб-Playground.Главное здесь — $0.015 за минуту музыки: четырёхминутная песня стоит около шести центов.
— Music выдаёт законченный трек до шести минут по промпту,своему тексту,референсу голоса или музыки
— 90-секундный трек генерится в среднем за 6 секунд,это примерно в 14 раз быстрее реального времени
— Soundtrack подкладывает музыку под готовое видео,SFX и Speech закрывают шумы и озвучку
🔹 DeepSeek-V4-Flash-Vision-Exp — дешёвая модель,которая наконец видит картинку
Экспериментальная надстройка над V4-Flash.По тексту и ризонингу не просела,а на мультимодальных агентских задачах подошла вплотную к Opus 4.8.
— читает скриншоты, интерфейсы и графики, а не просто описывает фото
— картинка стоит максимум 384 токена: всё, что больше 800×800,ужимается до него
— при $0.14 за миллион входных токенов это около 18 тысяч изображений на доллар,ночью вдвое дешевле
— до 600 изображений в одном запросе и бесплатный Files API
🔹 luna-lisa-alpha — на арене засветился неанонсированный чекпоинт GPT Image
OpenAI выкатили в слепое тестирование новую версию генератора картинок,официального анонса пока нет.
— обновили знание о мире: модель в курсе более поздних событий
— заметно меньше зерна и характерной желтизны,за которую ругали GPT Image
— чище держит текст на картинке и внешность персонажа между генерациями
🔹 Ox Alpha — на OpenRouter бесплатно раздают неизвестную frontier-модель
Появилась под меткой stealth: разработчик не назван.Заточена под код и агентов,на превью бесплатна — квота 100 триллионов токенов в сутки.
— контекст 1М токенов,до 131К на выходе,принимает текст,картинки и видео
— по сети разошлось, что она обгоняет Fable и Sol на коде,но это был беглый замер и он не подтвердился
— полная проверка от автора бенчмарка поставила её на уровень Sol medium: модель хорошая,но не рекордсмен
— зато она заметно экономнее по токенам,чем модели того же уровня
— по косвенным признакам это GLM: подозревают Z.ai
Графиков никто не показал. Все что нашел в комментариях.
🔹 Cursor Origin — свой GitHub, рассчитанный на темп агентов
Пока бета для платных тарифов. Репозитории синкаются с GitHub за минуту,комментарии к PR ходят в обе стороны,но источником правды остаётся GitHub.
— GitHub рассчитан на человеческий ритм,а Cursor показывал 22.6 коммита в секунду в один репозиторий
— Vercel поднимает превью-деплой на каждый PR,а автоматического разрешения конфликтов пока нет
Видео в комментариях.
🔹 Claude Academy — Anthropic выложили своё внутреннее обучение бесплатно
Учат не промпт-инжинирингу под конкретную модель,а общей логике работы с ИИ — тому же,что дают своим сотрудникам на онбординге.
— курсы с практикой, разборы кейсов и трекинг прогресса
— отдельно выложили Academy Skill: Claude сам подсказывает подходящий курс во время работы
Презентация в комментариях.
@VAI_ART
#VAI_News
👍3🔥3
This media is not supported in your browser
VIEW IN TELEGRAM
Когда нужно заапрувить концепт персонажа во времена ИИ.😁
Отгадайте какой выбрали?)
Всем хорошей недели!
@VAI_ART
#VAI_Notes
Отгадайте какой выбрали?)
Всем хорошей недели!
@VAI_ART
#VAI_Notes
Please open Telegram to view this post
VIEW IN TELEGRAM
😁11👍3👾1
Писал недавно про то, что Claude неплохо справляется с FX через MCP. Способ хороший, хотя и там нужно всё немного дорабатывать «напильником».
В данном случае основная проблема - это описать визуал, а значит, нужно найти правильный референс, что не всегда реально. Когда я обдумывал, как сделать так, чтобы референсы было найти проще, одним из вариантов, который пришёл, стала генерация нужного через видеогенераторы. Задаёшь первый кадр, при необходимости последний, описываешь, что должно происходить и вот у тебя готовый референс, который можно потом закинуть в Claude и попросить перенести в движок.
На днях подглядел ещё подобный пайплайн, но под другую реализацию - на выходе с секвенцией спрайтов. Суть та же: генерируешь первый, последний и при необходимости промежуточный кадр (для полного контроля). Как минимум нужен первый кадр для того, чтобы модель понимала стилистику. Описываешь поведение и генерируешь нужный FX в видеогенераторе, а дальше либо сам делишь на секвенции, но мы-то уже прошаренные и просим LLM, чтобы она составила из нужного видеоряда атлас секвенций, который по итогу и будет тем самым FX, который потом можно будет применить у себя в игре. Либо делаем в After Effects или вот Антон завайбкодил инструмент, который сам удаляет фон и подгоняет ключи/кадры.
Работает не только с VFX. Спрайтовые анимации персонажей, вращение элементов и т.д.
Основной пайплайн здесь, как и во многих других процессах - Imagen 2 и Seedance 2/2.5. На самом деле генераторов видео, особенно в последнее время вышло очень много и надо все тестировать на разные возможности. В данных тестах я так же пробовал Wan 3.0 и результаты были достаточно хорошие.
В общем, способ работает и в том, и в том направлении - можете как угодно крутить и упрощать свои процессы.
@VAI_ART
#VAI_Notes
В данном случае основная проблема - это описать визуал, а значит, нужно найти правильный референс, что не всегда реально. Когда я обдумывал, как сделать так, чтобы референсы было найти проще, одним из вариантов, который пришёл, стала генерация нужного через видеогенераторы. Задаёшь первый кадр, при необходимости последний, описываешь, что должно происходить и вот у тебя готовый референс, который можно потом закинуть в Claude и попросить перенести в движок.
На днях подглядел ещё подобный пайплайн, но под другую реализацию - на выходе с секвенцией спрайтов. Суть та же: генерируешь первый, последний и при необходимости промежуточный кадр (для полного контроля). Как минимум нужен первый кадр для того, чтобы модель понимала стилистику. Описываешь поведение и генерируешь нужный FX в видеогенераторе, а дальше либо сам делишь на секвенции, но мы-то уже прошаренные и просим LLM, чтобы она составила из нужного видеоряда атлас секвенций, который по итогу и будет тем самым FX, который потом можно будет применить у себя в игре. Либо делаем в After Effects или вот Антон завайбкодил инструмент, который сам удаляет фон и подгоняет ключи/кадры.
Работает не только с VFX. Спрайтовые анимации персонажей, вращение элементов и т.д.
Основной пайплайн здесь, как и во многих других процессах - Imagen 2 и Seedance 2/2.5. На самом деле генераторов видео, особенно в последнее время вышло очень много и надо все тестировать на разные возможности. В данных тестах я так же пробовал Wan 3.0 и результаты были достаточно хорошие.
В общем, способ работает и в том, и в том направлении - можете как угодно крутить и упрощать свои процессы.
@VAI_ART
#VAI_Notes
❤4👍3🔥2
Продублирую еще. Антон навайбкодил классный инструмент для работы с спрайтами. Может пропустили.
Forwarded from Революция Чайных Пакетиков
This media is not supported in your browser
VIEW IN TELEGRAM
Всем привет!
Встречайте обновленный Atlas Converter и его исходный код.
Это программа, позволяющая удобно получать спрайт атлас из сгенерированного видео и вырезать зеленый фон для получения альфы. Параллельно можно пакетно обработать отдельные спрайты: подогнать размер, сдвинуть, наложить на фон и экспортировать. Всё в одном окне, без установки.
В новой версии гораздо более удобный интерфейс, контроль ключевых кадров и возможность запуска на маке.
Atlas Converter [Win 64]
Исходники.
Запуск на маке: скачать исходники, запустить build_mac.py
В папке /dist появится версия для мака.
Ближе к концу недели еще отдам жутко шустрый генератор 2D эффектов.
Поставьте🔥 за старания ;)
Встречайте обновленный Atlas Converter и его исходный код.
Это программа, позволяющая удобно получать спрайт атлас из сгенерированного видео и вырезать зеленый фон для получения альфы. Параллельно можно пакетно обработать отдельные спрайты: подогнать размер, сдвинуть, наложить на фон и экспортировать. Всё в одном окне, без установки.
В новой версии гораздо более удобный интерфейс, контроль ключевых кадров и возможность запуска на маке.
Atlas Converter [Win 64]
Исходники.
Запуск на маке: скачать исходники, запустить build_mac.py
В папке /dist появится версия для мака.
Ближе к концу недели еще отдам жутко шустрый генератор 2D эффектов.
Поставьте
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥16👍5❤1🥰1
Новости ИИ за неделю. Что особенно зацепило. Пробежимся.
🔹 Midjourney V8.2 Edit — у Midjourney наконец появился свой редактор изображений
Открыли массовое тестирование первой edit-модели для V8.2.Загружаете картинку в Editor и правите её обычными словами.Работает внутри подписки от $10 в месяц, отдельной цены за правку нет.
Примеры в комментариях.
🔹 Gemini Omni 1.1 Flash — видеомодель Google вышла из превью
27 августа Google перевела Omni 1.1 Flash в стабильный релиз для Gemini API и AI Studio.Ориентир по цене прежний — около $0,10 за секунду в 720p.
Примеры в комментариях.
🔹 MiniMax H3 Max — fal дообучили H3 и разогнали её в 36 раз
Своя post-trained версия открытой MiniMax H3,собранная под инференс-стек fal. Ролик 15 секунд в 720p: обычный H3 — около 6 минут,H3 Max — около 10 секунд.
В общем,видео теперь генерируется быстрее скорость проигрывания видео.
Пример бесконечного слопа.О дивный новый мир.
🔹 Unreal Engine 5.9 — Epic передумали и делают ещё один релиз UE5, весь ради ИИ
В июне 5.8 называли последней версией перед UE6.Теперь Epic подтвердили выход 5.9 и тащат в неё часть будущего стека UE6.Даты релиза пока нет.
Презентация в комментариях.
🔹 Recraft V4 Styles — стиль по референсам, который можно переиспользовать
Модели Recraft научились собирать визуальный стиль по картинкам и держать его в серии генераций.$0,05 за изображение плюс $0,005 за создание стиля.
Примеры в комментариях.
🔹 ElevenMusic Composer — песню теперь можно править по частям
ElevenLabs открыли редактор,который разбирает сгенерированный трек на куплет,припев,бридж и аутро.Работает на Music v2,бесплатный план даёт 5 треков в день.
Презентация в комментариях.
🔹 Gemini 3.5 Transcribe — расшифровка речи,которая понимает смысл
Две модели в Gemini API: одна для готовых файлов,вторая для потока в реальном времени.Публичное превью.
Пример в комментариях.
@VAI_ART
#VAI_News
🔹 Midjourney V8.2 Edit — у Midjourney наконец появился свой редактор изображений
Открыли массовое тестирование первой edit-модели для V8.2.Загружаете картинку в Editor и правите её обычными словами.Работает внутри подписки от $10 в месяц, отдельной цены за правку нет.
— до четырёх изображений-референсов за раз,этот механизм заменил прежний omni-reference
— inpainting по выделенной области и outpainting за границы кадра
— главное — сохраняется миджорниевская эстетика,чего не даёт ни Banana,ни GPT Image
— после нескольких проходов картинка начинает звенеть,а развернуть камеру почти невозможно
Примеры в комментариях.
🔹 Gemini Omni 1.1 Flash — видеомодель Google вышла из превью
27 августа Google перевела Omni 1.1 Flash в стабильный релиз для Gemini API и AI Studio.Ориентир по цене прежний — около $0,10 за секунду в 720p.
— продление готовой сцены блоками по 10 секунд,суммарно до 40 — модель смотрит на предыдущие 10 секунд,а не на один последний кадр
— первый и последний кадр: даёте две картинки и получаете управляемый переход между ними
— черновой режим 360p на 60% быстрее и втрое дешевле 720p: прототипируете дёшево,апскейлите только удачное
— 1080p и 4K получаются апскейлом,нативной генерации в этих разрешениях нет
Примеры в комментариях.
🔹 MiniMax H3 Max — fal дообучили H3 и разогнали её в 36 раз
Своя post-trained версия открытой MiniMax H3,собранная под инференс-стек fal. Ролик 15 секунд в 720p: обычный H3 — около 6 минут,H3 Max — около 10 секунд.
— пять бесплатных генераций в день
— 480p и 768p, 24 fps,ролики 5–15 секунд,нативное стерео — но 2K, который умеет обычный H3,здесь пока нет
— ускорение не за счёт квантизации: fal делали модель и движок одновременно
— веса обещают выложить
В общем,видео теперь генерируется быстрее скорость проигрывания видео.
Пример бесконечного слопа.О дивный новый мир.
🔹 Unreal Engine 5.9 — Epic передумали и делают ещё один релиз UE5, весь ради ИИ
В июне 5.8 называли последней версией перед UE6.Теперь Epic подтвердили выход 5.9 и тащат в неё часть будущего стека UE6.Даты релиза пока нет.
— уже в 5.8 внутри редактора работает локальный MCP-сервер: Claude Code,Codex,Gemini и Cursor могут создавать объекты, менять свет и материалы,гонять тесты и работать с PCG. В 5.9 агентам откроют ещё больше движка
— генеративные модели становятся дополнительным render pass: Unreal держит камеру, геометрию и композицию сцены, а внешняя модель поверх реального рендера меняет стиль, погоду и время суток
— ставка не на свою модель,а на открытую инфраструктуру: подключать можно любую.UE6 Early Access намечен на конец 2027
Презентация в комментариях.
🔹 Recraft V4 Styles — стиль по референсам, который можно переиспользовать
Модели Recraft научились собирать визуальный стиль по картинкам и держать его в серии генераций.$0,05 за изображение плюс $0,005 за создание стиля.
— от 1 до 10 референсов: похожие сужают попадание, разные расширяют диапазон
— Precise держит стиль максимально точно,Flexible ловит общее направление и оставляет модели свободу
— стиль сохраняется как Style ID и подключается к следующим генерациям, работает и на растре и на редактируемых SVG
Примеры в комментариях.
🔹 ElevenMusic Composer — песню теперь можно править по частям
ElevenLabs открыли редактор,который разбирает сгенерированный трек на куплет,припев,бридж и аутро.Работает на Music v2,бесплатный план даёт 5 треков в день.
— переписать текст одного куплета и перегенерировать только его,не трогая остальное
— поменять темп,тональность и длительность выбранной секции
— переставить части местами,продублировать припев,дописать аутро
Презентация в комментариях.
🔹 Gemini 3.5 Transcribe — расшифровка речи,которая понимает смысл
Две модели в Gemini API: одна для готовых файлов,вторая для потока в реальном времени.Публичное превью.
— сама выкидывает слова-паразиты и оговорки,за которыми говорящий себя поправил
— 85+ языков,акценты и диалекты,определение языка на лету
— ошибается примерно в 2,6% слов на файлах и в 4% в реальном времени
Пример в комментариях.
@VAI_ART
#VAI_News
🔥4❤3👍2🙏1
Media is too big
VIEW IN TELEGRAM
Я сделал новую модель и записал вам таймлапс...
Сказал бы я,если бы у меня было больше времени поскульптить.😁
А этот таймлапс сделал не я, а видеогенератор.В данном случае MiniMax H3.
Пример промпта.
@VAI_ART
#VAI_Notes
Сказал бы я,если бы у меня было больше времени поскульптить.
А этот таймлапс сделал не я, а видеогенератор.В данном случае MiniMax H3.
Пример промпта.
Create a 15-second fast-paced 3D character sculpting timelapse inside a professional digital sculpting application (ZBrush-style interface: dark grey viewport, tool shelves on the left and right, subtool stack, no readable text).
Use the provided character reference only as the final target for the sculpt's silhouette, proportions, costume, feather layout and distinctive features. The process must visibly start from a single primitive sphere and rebuild the referenced character from scratch. The whole sculpt stays in a monochrome grey clay / matcap material — no color, no textures.
Show a visible mouse cursor actively controlling the entire process. Every major change must feel caused by cursor strokes on the mesh surface. The model is frequently rotated by dragging in the viewport, so the sculpt is always read as a real 3D object, not a drawing.
0:00-0:02
Start on an empty grey viewport with one smooth low-resolution sphere. The cursor pulls and drags the mass out into a rough humanoid blockout — torso, head, limbs, digitigrade bird legs — using large Move-brush strokes. Blobby, low-poly, no detail.
0:02-0:04
Remesh pass. The wireframe briefly flashes on, the mesh becomes denser and cleaner, then the wireframe disappears. The cursor refines proportions, defines the shoulder mass, hunched posture, arm length and the raven skull with a long curved beak. Rotate the model 90 degrees to check the profile.
0:04-0:06
Anatomy and costume blockout. The cursor masks regions and extracts new subtools: hood, shoulder cape, tunic, belts, wrapped shins. New objects visibly pop into the subtool stack as separate grey pieces. Clay build-up strokes thicken forms, TrimDynamic-style strokes flatten planes.
0:06-0:09
Hard-surface and prop pass. Insert-mesh strokes place straps, buckles, pouches, small blades and the recurve bow across the back. The cursor drags each piece into position, scales and rotates it. Continuous slow orbiting of the model between placements.
0:09-0:12
Feather pass — the most dramatic stage. Using an alpha/insert-brush, the cursor rapidly stamps overlapping feathers layer by layer over the shoulders, chest ruff, forearms and the long ragged cape. Feathers accumulate in fast successive passes from broad to fine, building the shaggy silhouette from the reference.
0:12-0:14
High-frequency detail and polish. Sharp carving strokes cut cloth folds, torn hems, stitching, leather grain and scale texture on the legs and talons. The viewport briefly zooms into the beak and hood to refine the face, then pulls back out. Subdivision level rises one more time, surface noise appears on the fabric.
0:14-0:15
The UI panels fade away. The finished sculpt is presented on a clean white background, centered, in the same standing pose and framing as the reference, slowly rotating and settling into the exact frontal reference view. End on the final beauty render.
STYLE:
High-speed 3D sculpting timelapse, professional digital sculpting workflow, believable sculpting software UI, matte grey clay material with soft studio lighting, smooth cursor movement, rapid but readable operations, no random text, no fake dialogue, no unrelated popups.
MOTION:
Continuously productive for the full 15 seconds. No long pauses. Compress many hours of sculpting into an energetic timelapse while keeping the progression clearly readable: sphere → rough blockout → refined anatomy → costume subtools → props and straps → layered feathers → fine detail → final render. Mesh density and surface complexity must visibly increase over time, never jump instantly.
CAMERA:
Screen-recording style. Camera navigation is 3D viewport orbiting — the model rotates around its vertical axis while being worked on, with occasional dolly-zooms toward the head, hands or feather clusters and back out. Keep the UI stable and readable. No cinematic cuts
@VAI_ART
#VAI_Notes
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥8⚡4😁3❤1
Нам обещали, что ИИ заберёт рутину и освободит время. Он и правда освободил. Только отдыхать в это время никто не пошёл - все пошли работать ещё больше. 🥹
Последнее время много общаюсь с людьми, которые сидят в агентах каждый день. Картинка везде одна: рабочий день по 16-18 часов, в голове бесконечная очередь идей и фич. Не потому что кто-то заставляет. Потому что стало можно.
Раньше узким местом были руки. Сейчас руки почти бесплатные, на что уходила неделя, собирается за вечер. Узкое место переехало в голову. А голова, в отличие от агента, не запускается в двадцати параллельных сессиях.
Я сам работаю немало. Но глядя на людей вокруг, понимаю - это ещё мало. И вот это “мало” настораживает меня больше всего.
Потому что выгорание, переутомление и хроническая усталость никуда не делись. Их просто перестали замечать. На этом кураже кажется, что ты не устаёшь. Но психика не масштабируется.
И вот здесь самое неприятное. ИИ сгенерит картинку за пять секунд, соберёт пайплайн, напишет код. Но он не вернёт интерес к работе, нормальный сон и желание вообще что-то делать. Это чинится годами и не всегда до конца.
Поэтому отдых - это обязательный этап пайплайна, а не потеря темпа.
Гонка длинная. Выигрывает не тот, кто бежит быстрее, а тот, кто добежит.
Не забывайте отдыхать!🦄
@VAI_ART
#VAI_Notes
Последнее время много общаюсь с людьми, которые сидят в агентах каждый день. Картинка везде одна: рабочий день по 16-18 часов, в голове бесконечная очередь идей и фич. Не потому что кто-то заставляет. Потому что стало можно.
Раньше узким местом были руки. Сейчас руки почти бесплатные, на что уходила неделя, собирается за вечер. Узкое место переехало в голову. А голова, в отличие от агента, не запускается в двадцати параллельных сессиях.
Я сам работаю немало. Но глядя на людей вокруг, понимаю - это ещё мало. И вот это “мало” настораживает меня больше всего.
Потому что выгорание, переутомление и хроническая усталость никуда не делись. Их просто перестали замечать. На этом кураже кажется, что ты не устаёшь. Но психика не масштабируется.
И вот здесь самое неприятное. ИИ сгенерит картинку за пять секунд, соберёт пайплайн, напишет код. Но он не вернёт интерес к работе, нормальный сон и желание вообще что-то делать. Это чинится годами и не всегда до конца.
Поэтому отдых - это обязательный этап пайплайна, а не потеря темпа.
Гонка длинная. Выигрывает не тот, кто бежит быстрее, а тот, кто добежит.
Не забывайте отдыхать!
@VAI_ART
#VAI_Notes
Please open Telegram to view this post
VIEW IN TELEGRAM
❤21👍14💯8👎3🔥2🌚2
Неделя была достаточно жаркой, но судя по анонсам до конца года наша жизнь станет еще более интересной. Пробежимся.
🔹 GPT-6 Astra — OpenAI выпустили модель,которая работает за компьютером вместо вас
Новый флагман.$10 и $50 за миллион токенов,контекст 1 млн.На Plus доступна только в Codex и Work,в обычном чате её там нет.
Пример — архвиз целиком: дом от планировки до 30-секундного тура и интерактивной сборки в Unreal Engine 5.
Графики презентация,примеры в комментариях.
🔹 Claude Fable 5.1 — Anthropic обновили флагман и сделали его дешевле
Доступна всем в API и подписке. Цена прежняя, но реальный счёт за задачу падает на 25–45%.
Графики в комментариях.
🔹 Gemini 3.8 Flash — дешёвая модель Google подобралась к дорогим
Уже в API, AI Studio и приложении Gemini для Pro и Ultra. $0,75 и $3,75 за миллион токенов - вводная цена до конца года,потом вдвое дороже.
График в комментариях.
🔹 World Labs Atlas — камера в генерации наконец стала управляемой
Работает сразу с текстом,картинками, видео и 3D.Ранний доступ по заявке,цены пока нет.
Примеры в комментариях.
🔹 Runway GWM Worlds 2 — мир, который генерируется на лету и слушается вас
Пример в комментариях.
🔹 Hyper3D WorldGen — одна картинка превращается в разбираемую 3D-сцену
Deemos, авторы Rodin, выпустили генератор не объектов, а сцен целиком.
Пример в комментариях.
🔹 Viggle-Animate — замена персонажа в видео, впервые с открытыми весами
Берёте кадр из ролика, перерисовываете в нём персонажа - модель протягивает замену через всё видео, сохраняя движение и камеру. Никаких скелетов и масок, и в шесть раз быстрее Wan2.2-Animate. Аппетиты соответствующие: рекомендуют 96 ГБ видеопамяти.
Пример в комментариях.
🔹 OpenClaw 2.0 — самое крупное обновление опенсорсного личного ассистента
Собрал примерно половину всех правок за историю проекта.
🔹 Gemini 4 — утекла таблица с цифрами, и они выше всего,что сейчас есть
Google подтвердил только сам факт обучения - "самый амбициозный pre-training run" в истории компании. В самой таблице столбец Gemini 4 помечен как предсказанный, а не измеренный, так что пока это слух.
Если верить, то это отличный комбэк. А то смотреть на Гугл было уже печально
Таблица в комментариях.
@VAI_ART
#VAI_News
🔹 GPT-6 Astra — OpenAI выпустили модель,которая работает за компьютером вместо вас
Новый флагман.$10 и $50 за миллион токенов,контекст 1 млн.На Plus доступна только в Codex и Work,в обычном чате её там нет.
— сама водит мышкой и браузером: собирает презентации, таблицы,сайты и целые игры по одному запросу и вдвое быстрее прошлой модели
— держит длинную задачу целиком: ищет референсы,делает,проверяет результат и переделывает, не бросая на середине
— для меня одним из главных - 3D: в связке с Blender MCP сама собирает сцену, рендерит тестовые кадры,сверяет их с рефами и правит ошибки
Пример — архвиз целиком: дом от планировки до 30-секундного тура и интерактивной сборки в Unreal Engine 5.
Графики презентация,примеры в комментариях.
🔹 Claude Fable 5.1 — Anthropic обновили флагман и сделали его дешевле
Доступна всем в API и подписке. Цена прежняя, но реальный счёт за задачу падает на 25–45%.
— чтение из кэша подешевело на 75%, до $0,25 за миллион - а именно на кэш уходит основная часть денег в агентных задачах
— вдвое лучше тянет длинные технические задачи в терминале: 55,8% против 42% у прошлой версии
— и наконец пишет нормальным языком,без нагромождения терминов
Графики в комментариях.
🔹 Gemini 3.8 Flash — дешёвая модель Google подобралась к дорогим
Уже в API, AI Studio и приложении Gemini для Pro и Ultra. $0,75 и $3,75 за миллион токенов - вводная цена до конца года,потом вдвое дороже.
— апгрейд в коде и многошаговых задачах: планировать,дёргать инструменты,править свои ошибки
— Google разрешила ей думать дольше на сложном: токен дешёвый,а задача целиком может выйти дороже прошлой версии
График в комментариях.
🔹 World Labs Atlas — камера в генерации наконец стала управляемой
Работает сразу с текстом,картинками, видео и 3D.Ранний доступ по заявке,цены пока нет.
— траектория камеры задаётся заранее, до генерации: облёты, рефрейминг, bullet time внутри сцены
— до минуты видео в 1440p
— собирает 3D-сцену от одной картинки до десятков ракурсов, на выходе облако точек или гауссовы сплаты
Примеры в комментариях.
🔹 Runway GWM Worlds 2 — мир, который генерируется на лету и слушается вас
— 720p, 24 кадра в секунду со звуком, и генерация не заканчивается: мир продолжается, пока вы в нём
— задаёте окружение, персонажей, стиль и правила мира, дальше командуете ими, меняете погоду и свет, водите камеру
— постоянного 3D-состояния она не хранит: на долгой сессии геометрия и текстуры плывут
Пример в комментариях.
🔹 Hyper3D WorldGen — одна картинка превращается в разбираемую 3D-сцену
Deemos, авторы Rodin, выпустили генератор не объектов, а сцен целиком.
— ключевые предметы становятся отдельными мешами: стол подвинуть, стул заменить; окружение восстанавливается гауссовыми сплатами
— под игры масштаб пока маловат, авторы сами это признают; целятся в кино, XR и симуляции роботов
Пример в комментариях.
🔹 Viggle-Animate — замена персонажа в видео, впервые с открытыми весами
Берёте кадр из ролика, перерисовываете в нём персонажа - модель протягивает замену через всё видео, сохраняя движение и камеру. Никаких скелетов и масок, и в шесть раз быстрее Wan2.2-Animate. Аппетиты соответствующие: рекомендуют 96 ГБ видеопамяти.
Пример в комментариях.
🔹 OpenClaw 2.0 — самое крупное обновление опенсорсного личного ассистента
Собрал примерно половину всех правок за историю проекта.
— установка цепляется к тому, что уже стоит: подписка ChatGPT или Claude, ключи, локальные модели - час в конфигах больше не нужен
— появились общие облачные сессии: подключаете второго человека или передаёте ему задачу со всем контекстом
🔹 Gemini 4 — утекла таблица с цифрами, и они выше всего,что сейчас есть
Google подтвердил только сам факт обучения - "самый амбициозный pre-training run" в истории компании. В самой таблице столбец Gemini 4 помечен как предсказанный, а не измеренный, так что пока это слух.
Если верить, то это отличный комбэк. А то смотреть на Гугл было уже печально
Таблица в комментариях.
@VAI_ART
#VAI_News
👍5🔥2