Seedream 5.0 PRO
Если вы поиподустали от глюков Бананы в последнее время, держите новую игрушку.
Сидримский 5.0 Про - упор на инструменты редактирования:
Пользователь может указать нужную область точкой, рамкой, лассо, цветной пометкой или простым наброском. После этого модель способна добавить или удалить объект, изменить его цвет по HEX-коду, заменить материал или превратить грубый скетч в готовый дизайн.
Но о чем мало пишут - это слои! Причем в PNG и с прозрачностью.
"разделение готового изображения более чем на десять независимых слоёв - отдельно текст, фон, персонажи и декоративные элементы, включая восстановление ранее перекрытых участков фона"
Также много слов про инфографику и текст (14 языков, мелькает русский).
И странно, что максимально нативно только 2К.
Есть по АПИ как на самих byteplus, так уже и на всех аггрегаторах.
https://docs.byteplus.com/en/docs/ModelArk/1541523
Есть на магнифике, фал, вейвспид, Хиггс, далее везде.
По цене, если я правильно оценил - вполовину Бананы, но проверьте сами.
https://seed.bytedance.com/en/seedream5_0_pro
Техблог:
https://seed.bytedance.com/en/blog/beyond-generation-it-understands-design-introducing-seedream-5-0-pro
@cgevent
Если вы поиподустали от глюков Бананы в последнее время, держите новую игрушку.
Сидримский 5.0 Про - упор на инструменты редактирования:
Пользователь может указать нужную область точкой, рамкой, лассо, цветной пометкой или простым наброском. После этого модель способна добавить или удалить объект, изменить его цвет по HEX-коду, заменить материал или превратить грубый скетч в готовый дизайн.
Но о чем мало пишут - это слои! Причем в PNG и с прозрачностью.
"разделение готового изображения более чем на десять независимых слоёв - отдельно текст, фон, персонажи и декоративные элементы, включая восстановление ранее перекрытых участков фона"
Также много слов про инфографику и текст (14 языков, мелькает русский).
И странно, что максимально нативно только 2К.
Есть по АПИ как на самих byteplus, так уже и на всех аггрегаторах.
https://docs.byteplus.com/en/docs/ModelArk/1541523
Есть на магнифике, фал, вейвспид, Хиггс, далее везде.
По цене, если я правильно оценил - вполовину Бананы, но проверьте сами.
https://seed.bytedance.com/en/seedream5_0_pro
Техблог:
https://seed.bytedance.com/en/blog/beyond-generation-it-understands-design-introducing-seedream-5-0-pro
@cgevent
Media is too big
VIEW IN TELEGRAM
👍28❤10🔥8😁1
Seedream 5.0 Pro vs Gpt-Image-2
Там где белая машинка покрупнее - это Сидримский.
Выглядит все это красиво у обеих моделей.
И также бессмысленно технически.
A technical drawing of a futuristic sports car in blueprint style. Include line drawings of the sports car from the front, side, and rear views, exploded parts sketches, parts assembly diagrams, and structural diagrams of disassembled components. Use abundant lines and measurement values to indicate the dimensions of each part, with grayscale tones expressing the overall sketch relationship. In addition to the main design, also show scattered thumbnails from different angles.
@cgevent
Там где белая машинка покрупнее - это Сидримский.
Выглядит все это красиво у обеих моделей.
И также бессмысленно технически.
A technical drawing of a futuristic sports car in blueprint style. Include line drawings of the sports car from the front, side, and rear views, exploded parts sketches, parts assembly diagrams, and structural diagrams of disassembled components. Use abundant lines and measurement values to indicate the dimensions of each part, with grayscale tones expressing the overall sketch relationship. In addition to the main design, also show scattered thumbnails from different angles.
@cgevent
🔥15❤4👍4👎1
Seedream 5.0 Pro Nsfw
Он умеет ВсЁ прямо из коробки. И сверху и снизу. И вместе.
Конечно, если вы припретесь со своими богомерзкими промптами наперевес на какую-нибудь Креа или Магнифик или другой агрегаторный сервис, то вас пошлют подальше на этапе промпта.
Но если вы найдете правильного китайского или индийского API провайдера, то никто вас посылать не будет. Дергайте за вызовы с любыми промптами.
В коменты скину пожощще.
@cgevent
Он умеет ВсЁ прямо из коробки. И сверху и снизу. И вместе.
Конечно, если вы припретесь со своими богомерзкими промптами наперевес на какую-нибудь Креа или Магнифик или другой агрегаторный сервис, то вас пошлют подальше на этапе промпта.
Но если вы найдете правильного китайского или индийского API провайдера, то никто вас посылать не будет. Дергайте за вызовы с любыми промптами.
В коменты скину пожощще.
@cgevent
🔥46😁21👍5👎4❤3😱3🙏1
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка
Быть героем
Автор: Максим Асовский
Идея была в том, чтобы создать динамичную приключенческую историю с интересным сюжетом. Хотелось воплотить интересную идею Стимпанк в мире сказок на Руси. Пока что названия проекта нет, в процессе раздумья.
Эта история не только про взаимоотношение двух братьев, но и про личностный конфликт. Герой не любит себя, живет в вымышленном мире, где он - супергерой, а точнее мощный богатырь. Он хочет быть таким и наяву, в том числе для своего брата, но внутренняя неуверенность ему мешает. Как итог - его внутреннее ощущение доказать себе и окружающим, что он чего-то стоит, приводит к трагичным событиям.
В качестве референса для стиля изображений был выбран анимационный сериал "Аркейн".
🛠 Инструменты:
- Хиггсфилд. Итого было потрачено ~5800 кредитов, это вышло ~25к рублей. (вышло дороже, чем могло, из-за того что кредиты покупались после дополнительно к подписке, что выходит дороже).
- Генерация изображений происходила в Хигсфилде, а именно в Синема Студио. В ЧатГпт был сгенерирован единый стилевой промпт на основе пачки изображений. Так же генерация усиливалась визуальными референсами. Было сгенерировано около 600-700 изображений (в том числе генерации на редактирование изображений в НаноБанано).
- Ретушь изображений происходила в фотошопе.
- Генерация видео была на модели Сиданс 2, большинство кадров было сгенерировано в качестве 1080р для достижения более качественной и стабильной картинки. Можно было использовать Клинг, но он слишком мазал картинку, поэтому было решено не экономить и сделать более приемлемый результат. Сиданс хорошо понимает стиль Аркейна, держится хорошо даже в динамичных сценах. Есть проблемы с анимацией людей на фоне, пробовал множество вариантов - лучшие результаты в видео.
- Озвучка была сгенерирована в ElevenLabs. Считаю, это самой слабой стороной видео, не смотря на использование одного из самых топовых сервисов для генерации аудио. Нет знакомых, занимающихся озвучкой, при этом не было времени на поиск таких людей, так как сроки сдачи проекта имелись и я очень много времени потратил на генерацию статики и видео.
- Липсинг делал через описание в промпте фраз, которые необходимо персонажу произнести. При этом описывал какие должен испытать эмоции персонаж. После генерил озвучку и примерно подгонял под губы.
- Монтаж делал в Премьер про, в монтаж входит: склейка, чистка склеек, редактирование слегка кривых видеофрагментов, саунддизайн, музыка, наложение озвучки. Все было сделано своими силами, никого дополнительно не привлекал.
⌛️Сроки:
- Поиск идеи, сбор мудборда, написание сценария, редактирование написанного сценария, подготовка раскадровки - 2 недели.
- Создание всех статичных сцен - 2 недели (вместе с отбором, ретушью и фильтрацией).
- Анимация всех статичных сцен 3 дня.
- Финальная сборка: монтаж, звук, пост - 3 дня.
Все процессы выполнялись последовательно. Суммарно работа проводилась в период с 28 мая по 4 июля.
@cgevent
Быть героем
Автор: Максим Асовский
Идея была в том, чтобы создать динамичную приключенческую историю с интересным сюжетом. Хотелось воплотить интересную идею Стимпанк в мире сказок на Руси. Пока что названия проекта нет, в процессе раздумья.
Эта история не только про взаимоотношение двух братьев, но и про личностный конфликт. Герой не любит себя, живет в вымышленном мире, где он - супергерой, а точнее мощный богатырь. Он хочет быть таким и наяву, в том числе для своего брата, но внутренняя неуверенность ему мешает. Как итог - его внутреннее ощущение доказать себе и окружающим, что он чего-то стоит, приводит к трагичным событиям.
В качестве референса для стиля изображений был выбран анимационный сериал "Аркейн".
🛠 Инструменты:
- Хиггсфилд. Итого было потрачено ~5800 кредитов, это вышло ~25к рублей. (вышло дороже, чем могло, из-за того что кредиты покупались после дополнительно к подписке, что выходит дороже).
- Генерация изображений происходила в Хигсфилде, а именно в Синема Студио. В ЧатГпт был сгенерирован единый стилевой промпт на основе пачки изображений. Так же генерация усиливалась визуальными референсами. Было сгенерировано около 600-700 изображений (в том числе генерации на редактирование изображений в НаноБанано).
- Ретушь изображений происходила в фотошопе.
- Генерация видео была на модели Сиданс 2, большинство кадров было сгенерировано в качестве 1080р для достижения более качественной и стабильной картинки. Можно было использовать Клинг, но он слишком мазал картинку, поэтому было решено не экономить и сделать более приемлемый результат. Сиданс хорошо понимает стиль Аркейна, держится хорошо даже в динамичных сценах. Есть проблемы с анимацией людей на фоне, пробовал множество вариантов - лучшие результаты в видео.
- Озвучка была сгенерирована в ElevenLabs. Считаю, это самой слабой стороной видео, не смотря на использование одного из самых топовых сервисов для генерации аудио. Нет знакомых, занимающихся озвучкой, при этом не было времени на поиск таких людей, так как сроки сдачи проекта имелись и я очень много времени потратил на генерацию статики и видео.
- Липсинг делал через описание в промпте фраз, которые необходимо персонажу произнести. При этом описывал какие должен испытать эмоции персонаж. После генерил озвучку и примерно подгонял под губы.
- Монтаж делал в Премьер про, в монтаж входит: склейка, чистка склеек, редактирование слегка кривых видеофрагментов, саунддизайн, музыка, наложение озвучки. Все было сделано своими силами, никого дополнительно не привлекал.
⌛️Сроки:
- Поиск идеи, сбор мудборда, написание сценария, редактирование написанного сценария, подготовка раскадровки - 2 недели.
- Создание всех статичных сцен - 2 недели (вместе с отбором, ретушью и фильтрацией).
- Анимация всех статичных сцен 3 дня.
- Финальная сборка: монтаж, звук, пост - 3 дня.
Все процессы выполнялись последовательно. Суммарно работа проводилась в период с 28 мая по 4 июля.
@cgevent
1👍64👎34❤10🔥8😁1
This media is not supported in your browser
VIEW IN TELEGRAM
Вот он, настоящий киберпанк
Мы тут радостно смотрели, как робаты прыгают сальтухи или разбирают посудомойку. И гоготали, когда они падали на сцене или сходили с ума. Ибо кожаные их так научили.
Теперь все наоборот. ИИ говорит кожаному, что делать, и кожаный послушно делает: играет на пианино(хотя не умеет), рисует прямые линии (хотя криворукий по жизни), играет в камень-ножницы-бумага как ему говорит электрический сигнал (дилеры в казино - тема).
Короче, теперь кожаный превращается в робата, а его мышцы в приводы. Используется Electrical Muscle Stimulation, EMS - электрическая стимуляция мышц.
Как работает этот Human Operator:
Камера на голове видит сцену от первого лица.
Пользователь произносит команду, например: «Помоги сыграть мелодию».
Изображение и команда отправляются в ИИ через Claude API.
Модель выбирает последовательность доступных движений: указательный палец, средний палец, большой палец, движение запястья и так далее.
Компьютер превращает план в команды с временными метками.
Arduino и плата реле подключают нужный канал EMS.
Электроды стимулируют соответствующую мышцу, и палец нажимает клавишу.
И это не MIT как взвизгивает твиттор, а прототип, созданный командой из всего шести участников на 48(!)-часовом хакатоне MIT Hard Mode 2026. Он победил в категории Learn Track.
А дальше мы с вами представляем костюм Айрон Мена, когда вся поверхность отдана под управление.
Шутки про nsfw - отставить!
Короче, кожаные тренируют робатов, а ИИ - кожаных.
Ну и правда, зачем 7 лет ходить в музыкалку - надел перчатки и ну лабать на свадьбах и похоронах!
https://humanoperator.org/
@cgevent
Мы тут радостно смотрели, как робаты прыгают сальтухи или разбирают посудомойку. И гоготали, когда они падали на сцене или сходили с ума. Ибо кожаные их так научили.
Теперь все наоборот. ИИ говорит кожаному, что делать, и кожаный послушно делает: играет на пианино(хотя не умеет), рисует прямые линии (хотя криворукий по жизни), играет в камень-ножницы-бумага как ему говорит электрический сигнал (дилеры в казино - тема).
Короче, теперь кожаный превращается в робата, а его мышцы в приводы. Используется Electrical Muscle Stimulation, EMS - электрическая стимуляция мышц.
Как работает этот Human Operator:
Камера на голове видит сцену от первого лица.
Пользователь произносит команду, например: «Помоги сыграть мелодию».
Изображение и команда отправляются в ИИ через Claude API.
Модель выбирает последовательность доступных движений: указательный палец, средний палец, большой палец, движение запястья и так далее.
Компьютер превращает план в команды с временными метками.
Arduino и плата реле подключают нужный канал EMS.
Электроды стимулируют соответствующую мышцу, и палец нажимает клавишу.
И это не MIT как взвизгивает твиттор, а прототип, созданный командой из всего шести участников на 48(!)-часовом хакатоне MIT Hard Mode 2026. Он победил в категории Learn Track.
А дальше мы с вами представляем костюм Айрон Мена, когда вся поверхность отдана под управление.
Шутки про nsfw - отставить!
Короче, кожаные тренируют робатов, а ИИ - кожаных.
Ну и правда, зачем 7 лет ходить в музыкалку - надел перчатки и ну лабать на свадьбах и похоронах!
https://humanoperator.org/
@cgevent
🔥58😱36👍8😁8❤5👎4
Forwarded from Neural Shit
Media is too big
VIEW IN TELEGRAM
Кажется, в номинации "Сын года" у нас досрочный победитель.
Ютубер-инженер Джейк Лейзер смастерил для своего парализованного бати безумное инвалидное кресло-внедорожник. На основе промышленного робопса Unitree.
У его отца рассеянный склероз, из-за чего он уже много лет прикован к коляске. До болезни батя обожал туризм, поэтому сын решил во что бы то ни стало вернуть ему возможность выбраться на природу. Для этого он раздобыл огромного промышленного робопса Unitree за 100 тыщ баксов и использовал его как шасси. Ведь главная боль обычной инвалидной коляски это любые бордюры и неровности, которые превращают прогулку в квест. А обычная лесная тропа или большие камни зачастую вообще непреодолимое препятствие. Тут же база не просто на колёсах, а на ногах с колёсами. Может ехать, шагать, подниматься, переваливаться.
Яснопонятно, просто прикрутить стул к роботу не вышло бы: человек сверху сразу бы вылетел при первом шаге этой шайтан-машины. Изобретателю пришлось: полностью перепрошить мозги железной псины, чтобы она адекватно распределяла вес ездока, разработать режим "погрузки", в котором робот приседает до самой земли, чтобы в кресло было легко сесть, а так же сварить раму, установить само сиденье с ручками управления и всобачить мощную фару для ночных прогулок.
В итоге получился царь-трон. Эта штука гонзает по камням, проходит броды с водой, вззбирается на крутые холмы и даже поднимается по длинным каменным лестницам. А батя ютубера впервые за много лет смог выбраться на природу
Ютубер-инженер Джейк Лейзер смастерил для своего парализованного бати безумное инвалидное кресло-внедорожник. На основе промышленного робопса Unitree.
У его отца рассеянный склероз, из-за чего он уже много лет прикован к коляске. До болезни батя обожал туризм, поэтому сын решил во что бы то ни стало вернуть ему возможность выбраться на природу. Для этого он раздобыл огромного промышленного робопса Unitree за 100 тыщ баксов и использовал его как шасси. Ведь главная боль обычной инвалидной коляски это любые бордюры и неровности, которые превращают прогулку в квест. А обычная лесная тропа или большие камни зачастую вообще непреодолимое препятствие. Тут же база не просто на колёсах, а на ногах с колёсами. Может ехать, шагать, подниматься, переваливаться.
Яснопонятно, просто прикрутить стул к роботу не вышло бы: человек сверху сразу бы вылетел при первом шаге этой шайтан-машины. Изобретателю пришлось: полностью перепрошить мозги железной псины, чтобы она адекватно распределяла вес ездока, разработать режим "погрузки", в котором робот приседает до самой земли, чтобы в кресло было легко сесть, а так же сварить раму, установить само сиденье с ручками управления и всобачить мощную фару для ночных прогулок.
В итоге получился царь-трон. Эта штука гонзает по камням, проходит броды с водой, вззбирается на крутые холмы и даже поднимается по длинным каменным лестницам. А батя ютубера впервые за много лет смог выбраться на природу
2🔥111❤38👍10🙏1
This media is not supported in your browser
VIEW IN TELEGRAM
Когда потратил все лимиты на Клод Коде
Узнали себя? Пытаетесь потратить максимум на подписке, где халаява закроется 15 июля?
@cgevent
Узнали себя? Пытаетесь потратить максимум на подписке, где халаява закроется 15 июля?
@cgevent
😁80❤5😱5👎4
xAI выпустила Grok 4.5 - теперь ещё и для кодинга
xAI представила Grok 4.5 - новую модель для программирования и агентных задач. Разрабатывали её совместно с командой Cursor, которая в июне перешла под управление SpaceX. Теперь у Маска окончательно собралась вся вертикаль: ракеты, соцсеть, ИИ и редактор кода.
В Terminal Bench 2.1 Grok 4.5 почти сравнялась с GPT-5.5 и отстала от Fable 5 всего на один балл. Звучит, пока не смотришь на DeepSWE 1.1: в задачах из реальных GitHub-репозиториев модель всё ещё уступает остальным.
API стоит $2 за 1 млн входных токенов и $6 за 1 млн выходных. По заявлению xAI, в SWE Bench Pro Grok 4.5 расходует в 4.2 раза меньше токенов, чем Opus 4.8. Скорость генерации достигает 80 токенов в секунду.
Модель уже доступна в консоли xAI, среде Grok Build и редакторе Cursor.
В странах Евросоюза запуск отложен до середины июля. Европа, как обычно, получит новую революционную модель чуть позже - когда юристы закончат читать документацию.
https://x.ai/news/grok-4-5
@cgevent
xAI представила Grok 4.5 - новую модель для программирования и агентных задач. Разрабатывали её совместно с командой Cursor, которая в июне перешла под управление SpaceX. Теперь у Маска окончательно собралась вся вертикаль: ракеты, соцсеть, ИИ и редактор кода.
В Terminal Bench 2.1 Grok 4.5 почти сравнялась с GPT-5.5 и отстала от Fable 5 всего на один балл. Звучит, пока не смотришь на DeepSWE 1.1: в задачах из реальных GitHub-репозиториев модель всё ещё уступает остальным.
API стоит $2 за 1 млн входных токенов и $6 за 1 млн выходных. По заявлению xAI, в SWE Bench Pro Grok 4.5 расходует в 4.2 раза меньше токенов, чем Opus 4.8. Скорость генерации достигает 80 токенов в секунду.
Модель уже доступна в консоли xAI, среде Grok Build и редакторе Cursor.
В странах Евросоюза запуск отложен до середины июля. Европа, как обычно, получит новую революционную модель чуть позже - когда юристы закончат читать документацию.
https://x.ai/news/grok-4-5
@cgevent
x.ai
Introducing Grok 4.5
Grok 4.5 is SpaceXAI's smartest model built for coding, agentic tasks, and knowledge work.
1❤16😱7😁3
OpenAI выкатила GPT-Live - новый голосовой режим ChatGPT
Что изменилось:
* GPT-Live умеет слушать и говорить одновременно. Предыдущий Advanced Voice Mode уже работал напрямую со звуком, но всё равно ждал окончания реплики пользователя. Теперь модель может поддакивать, выдерживать паузы, не перебивать собеседника и реагировать прямо во время его речи. Особенно убедительно это работает на английском и в режиме синхронного перевода.
* В основе лежит full-duplex-архитектура. Вместо привычной цепочки «услышать - обработать - ответить» модель непрерывно принимает аудио и одновременно генерирует собственную речь. Несколько раз в секунду она решает, что делать дальше: продолжать слушать, начать говорить, замолчать, перебить пользователя или вызвать внешний инструмент.
* Сложные вопросы могут передаваться большой модели. Сам GPT-Live отвечает за живой разговор, а поиск, глубокие рассуждения и агентные задачи делегирует GPT-5.5. Пока старшая модель думает или ищет информацию, голосовой ассистент может продолжать беседу, а не зависать. На старте используются GPT-5.5 Instant либо GPT-5.5 Thinking с уровнями рассуждения Medium и High.
* Обновили все девять голосов ChatGPT. Модель также лучше отделяет голос пользователя от уличного шума и разговоров на фоне. А во время голосового диалога интерфейс теперь может показывать карточки с погодой, спортом, котировками и другой визуальной информацией.
Развёртывание уже началось по всему миру. Пользователи бесплатного тарифа получают GPT-Live-1 mini, а на планах Go, Plus и Pro основной голосовой моделью станет GPT-Live-1. Версия для API пока не вышла, но OpenAI обещает открыть её разработчикам позднее.
Новый режим пока не поддерживает видео и демонстрацию экрана - ради них придётся временно переключаться на старые версии Voice Mode.
https://openai.com/index/introducing-gpt-live/
@cgevent
Что изменилось:
* GPT-Live умеет слушать и говорить одновременно. Предыдущий Advanced Voice Mode уже работал напрямую со звуком, но всё равно ждал окончания реплики пользователя. Теперь модель может поддакивать, выдерживать паузы, не перебивать собеседника и реагировать прямо во время его речи. Особенно убедительно это работает на английском и в режиме синхронного перевода.
* В основе лежит full-duplex-архитектура. Вместо привычной цепочки «услышать - обработать - ответить» модель непрерывно принимает аудио и одновременно генерирует собственную речь. Несколько раз в секунду она решает, что делать дальше: продолжать слушать, начать говорить, замолчать, перебить пользователя или вызвать внешний инструмент.
* Сложные вопросы могут передаваться большой модели. Сам GPT-Live отвечает за живой разговор, а поиск, глубокие рассуждения и агентные задачи делегирует GPT-5.5. Пока старшая модель думает или ищет информацию, голосовой ассистент может продолжать беседу, а не зависать. На старте используются GPT-5.5 Instant либо GPT-5.5 Thinking с уровнями рассуждения Medium и High.
* Обновили все девять голосов ChatGPT. Модель также лучше отделяет голос пользователя от уличного шума и разговоров на фоне. А во время голосового диалога интерфейс теперь может показывать карточки с погодой, спортом, котировками и другой визуальной информацией.
Развёртывание уже началось по всему миру. Пользователи бесплатного тарифа получают GPT-Live-1 mini, а на планах Go, Plus и Pro основной голосовой моделью станет GPT-Live-1. Версия для API пока не вышла, но OpenAI обещает открыть её разработчикам позднее.
Новый режим пока не поддерживает видео и демонстрацию экрана - ради них придётся временно переключаться на старые версии Voice Mode.
https://openai.com/index/introducing-gpt-live/
@cgevent
OpenAI
Introducing GPT-Live
A new generation of voice models for natural human-AI interaction, now powering ChatGPT Voice.
🔥31❤8
Режиссерский софт
Перейдем от робатов к делам насущным. Поднял архивы постов и нашел, что больше трех лет назад писал:
"Интересно будет посмотреть на трушные нейропайплайны, когда chatGPT наговаривает промпты, по ним генерятся картинки для раскадровок, chatGPT дополняет это динамикой переходов, одновременно подгружаются видео-референсы со стоков, из которых достается движение камеры и оптики, по дороге пристегивается controlNet с персонажами, и весь этот компот идет на вход compot2Video."
https://t.me/cgevent/5165
Хех, и что мы видим в твитторах сегодня? Накаркал.
Тогда же в 2023 году писал:
"А к тому, что с видео и с анимацией все не так сладко, как с картинками. И на входе генерации видео будет тонна "гайдов" и референсов, а не только текст и кнопка "Генерить шедевр".
И эти гайды будут наследоваться из традиционных пайплайнов. Концепты и даже раскадровки можно генерить, а вот описывать движение камеры, персонажа, света, оптики словами - ну такое..."
https://t.me/cgevent/5281
Еще я упорно ныл, что видео - оно само по себе сложное. Там не просто пиксели бегают по картинке, там шевелятся десятки сущностей: персонажи, фоны, освещение, тени, фокусное расстояние, текстуры и еще много всего. Разметить картинку и разметить видео - немного разные задачи. Описать движение? Попробуйте сами двух словах. Промпты должны быть величиной с дом для попадания в замысел сам себе режиссера.
https://t.me/cgevent/7315
Это как бы затравка для небольшого марафона по тем инструментам, которые генеративная братия изобретает прямо сейчас, ибо с приходом Сиданского до всех наконец-то дошло, что видео словами не опишешь и нужны новые способы управления камерой, анимацией, светом, оптикой и что-там еще есть в этом бесовском видео.
Одно из решений - блокинг. Или превиз. Поэтому я так много постил за нейрорендер. Болваны в блендоре - рендер в Сиденском.
Теперь пошла новая волна - сохранение консистентности и стилей через глубину (видео идет путем контролнета).
И уже пошли софты типа LTX Director.
Об этом и поговорим.
@cgevent
Перейдем от робатов к делам насущным. Поднял архивы постов и нашел, что больше трех лет назад писал:
"Интересно будет посмотреть на трушные нейропайплайны, когда chatGPT наговаривает промпты, по ним генерятся картинки для раскадровок, chatGPT дополняет это динамикой переходов, одновременно подгружаются видео-референсы со стоков, из которых достается движение камеры и оптики, по дороге пристегивается controlNet с персонажами, и весь этот компот идет на вход compot2Video."
https://t.me/cgevent/5165
Хех, и что мы видим в твитторах сегодня? Накаркал.
Тогда же в 2023 году писал:
"А к тому, что с видео и с анимацией все не так сладко, как с картинками. И на входе генерации видео будет тонна "гайдов" и референсов, а не только текст и кнопка "Генерить шедевр".
И эти гайды будут наследоваться из традиционных пайплайнов. Концепты и даже раскадровки можно генерить, а вот описывать движение камеры, персонажа, света, оптики словами - ну такое..."
https://t.me/cgevent/5281
Еще я упорно ныл, что видео - оно само по себе сложное. Там не просто пиксели бегают по картинке, там шевелятся десятки сущностей: персонажи, фоны, освещение, тени, фокусное расстояние, текстуры и еще много всего. Разметить картинку и разметить видео - немного разные задачи. Описать движение? Попробуйте сами двух словах. Промпты должны быть величиной с дом для попадания в замысел сам себе режиссера.
https://t.me/cgevent/7315
Это как бы затравка для небольшого марафона по тем инструментам, которые генеративная братия изобретает прямо сейчас, ибо с приходом Сиданского до всех наконец-то дошло, что видео словами не опишешь и нужны новые способы управления камерой, анимацией, светом, оптикой и что-там еще есть в этом бесовском видео.
Одно из решений - блокинг. Или превиз. Поэтому я так много постил за нейрорендер. Болваны в блендоре - рендер в Сиденском.
Теперь пошла новая волна - сохранение консистентности и стилей через глубину (видео идет путем контролнета).
И уже пошли софты типа LTX Director.
Об этом и поговорим.
@cgevent
🔥21❤7😁5👍2
This media is not supported in your browser
VIEW IN TELEGRAM
MCP в Комфи. Автоглубина и автоконтролнет.
Как разминочный частный пример использования глубины для переноса Video2Video приведу очень интересный кейс использования MCP для комфи. Грубо говоря, оно все делает само.
Claude Fable запускает воркфлоу ComfyUI через Comfy MCP:
→ Claude сам нашёл нужный фрагмент видео в интернете, автоматически определил смены сцен и обрезал видео
→ запустил сохранённый воркфлоу с Depth Anything V3 и OpenPose, чтобы собрать референсное видео с движением
→ просмотрел каждый кадр, выбрал самый чёткий, а затем с помощью GPT Image 2 заменил персонажа на нужного точно по указаниям: смокинг, лиминальное пространство, никаких людей на фоне
→ написал промпты для Seedance 2.0 и запустил генерации
→ собрал итоговое сравнение из трёх панелей
Обычно именно препроцессинг и написание промптов занимают большую часть работы над таким роликом. А с MCP даже не пришлось открывать ни одну ноду.
Сорс
@cgevent
Как разминочный частный пример использования глубины для переноса Video2Video приведу очень интересный кейс использования MCP для комфи. Грубо говоря, оно все делает само.
Claude Fable запускает воркфлоу ComfyUI через Comfy MCP:
→ Claude сам нашёл нужный фрагмент видео в интернете, автоматически определил смены сцен и обрезал видео
→ запустил сохранённый воркфлоу с Depth Anything V3 и OpenPose, чтобы собрать референсное видео с движением
→ просмотрел каждый кадр, выбрал самый чёткий, а затем с помощью GPT Image 2 заменил персонажа на нужного точно по указаниям: смокинг, лиминальное пространство, никаких людей на фоне
→ написал промпты для Seedance 2.0 и запустил генерации
→ собрал итоговое сравнение из трёх панелей
Обычно именно препроцессинг и написание промптов занимают большую часть работы над таким роликом. А с MCP даже не пришлось открывать ни одну ноду.
Сорс
@cgevent
❤19👍16😱3
Media is too big
VIEW IN TELEGRAM
Framethrower
Из последних интересных инструментов выделю Framethrower: video-to-depthmap converter.
Достаете глубину из реального или нереального видео, используете как управляющий гайд для генерации своего видео.
Почему-то бесплатно тут:
https://www.framethrower.ai/
Также можно вспомнить:
LingBot-Depth 2.0
DepthAnything
@cgevent
Из последних интересных инструментов выделю Framethrower: video-to-depthmap converter.
Достаете глубину из реального или нереального видео, используете как управляющий гайд для генерации своего видео.
Почему-то бесплатно тут:
https://www.framethrower.ai/
Также можно вспомнить:
LingBot-Depth 2.0
DepthAnything
@cgevent
🔥11👍6❤1
This media is not supported in your browser
VIEW IN TELEGRAM
Палладиум для Блендора
Следующий опенсорсный проект использует вместо глубины хитроумную конвертацию 2Д в 3Д и очень замороченный пайплайн:
Z-Image 2D > Pixal3D
360/HDRI dome + auto light alignment
3d > Klein Image > LTX video with Chatterbox speech - Pallaidium
Зато здесь подхватывается и освещение. И получается довольно крепкий управляющий контролНет.
И все опенсорсное, из говна и палок, как положено. Даже монтажка на базе Блендора.
Z-Image 2D > 3D: https://github.com/tin2tin/Asset_Generator-2D-3D
360/HDRI dome + auto light alignment: https://github.com/tin2tin/hdri_strip_to_3d_enviroment
3d > Klein Image > LTX video with Chatterbox speech - Pallaidium: https://github.com/tin2tin/Pallaidium
Подробнее:
https://www.reddit.com/r/StableDiffusion/comments/1uppqev/2d_3d_video_via_the_pallaidium_tools_for_blender/
А мы пойдем к более человеческим инструментам для режиссерского софта.
@cgevent
Следующий опенсорсный проект использует вместо глубины хитроумную конвертацию 2Д в 3Д и очень замороченный пайплайн:
Z-Image 2D > Pixal3D
360/HDRI dome + auto light alignment
3d > Klein Image > LTX video with Chatterbox speech - Pallaidium
Зато здесь подхватывается и освещение. И получается довольно крепкий управляющий контролНет.
И все опенсорсное, из говна и палок, как положено. Даже монтажка на базе Блендора.
Z-Image 2D > 3D: https://github.com/tin2tin/Asset_Generator-2D-3D
360/HDRI dome + auto light alignment: https://github.com/tin2tin/hdri_strip_to_3d_enviroment
3d > Klein Image > LTX video with Chatterbox speech - Pallaidium: https://github.com/tin2tin/Pallaidium
Подробнее:
https://www.reddit.com/r/StableDiffusion/comments/1uppqev/2d_3d_video_via_the_pallaidium_tools_for_blender/
А мы пойдем к более человеческим инструментам для режиссерского софта.
@cgevent
👍15❤2
This media is not supported in your browser
VIEW IN TELEGRAM
Pika Director’s Suite
Я уже писал про
LTX Director
LTX Cameraman v2 IC-LoRA
LTX 2.3 Video Builder UI for ComfyUI
Но похоже общая нейростарческая идея режиссерского софта начинает доходить до всех.
Тут Пика бахнула Режиссерский Набор! Пока в бете, но есть утечки по интерфейсу. Слева ассеты, внизу таймлайн.
Но сдается мне, что они не совсем понимают задачи такого софта. Там нет ничего про рефы и превизы. Снова кнопка сделать красиво. И упор на монтаж.
А вот про тех, кто понимает, поговорим в след посте.
https://experiment.pika.art/directors-suite
@cgevent
Я уже писал про
LTX Director
LTX Cameraman v2 IC-LoRA
LTX 2.3 Video Builder UI for ComfyUI
Но похоже общая нейростарческая идея режиссерского софта начинает доходить до всех.
Тут Пика бахнула Режиссерский Набор! Пока в бете, но есть утечки по интерфейсу. Слева ассеты, внизу таймлайн.
Но сдается мне, что они не совсем понимают задачи такого софта. Там нет ничего про рефы и превизы. Снова кнопка сделать красиво. И упор на монтаж.
А вот про тех, кто понимает, поговорим в след посте.
https://experiment.pika.art/directors-suite
@cgevent
👍13❤4
Motion Previs Studio v4
Это автономное настольное приложение, предназначенное для преобразования исходных видео в наборы данных для превизов и референсов. Оно разработано для режиссеров, которым требуется большая точность перед генерацией видео.
Можно выбрать эталонный кадр, извлечь данные о позе, глубине, движении камеры, масках, краях и управляющих слоях, а затем экспортировать данные для Seedance, ComfyUI, Blender, Runway, Kling и других.
Автор - 25 лет в индустрии кино и рекламы. С кем только не работал. А потом свичнулся в Creative Technologist and AI Systems Architect.
У него два софта:
https://github.com/wassermanproductions/motion-previs-studio
https://github.com/wassermanproductions/blockout
Второй - это как раз блокаут для нейрорендера, о котором я так люблю писать.
Причем для обоих софтов есть MCP.
Почитайте твиттор Сэма, там есть туторы.
https://x.com/SamJWasserman
Софт непростой - но а как вы хотели? Видео - это вам не картинки (возвращаясь в начало марафона).
В общем, процесс пошел, и потихоньку появляются профессиональные софты для превиза, рефов, режиссуры.
@cgevent
Это автономное настольное приложение, предназначенное для преобразования исходных видео в наборы данных для превизов и референсов. Оно разработано для режиссеров, которым требуется большая точность перед генерацией видео.
Можно выбрать эталонный кадр, извлечь данные о позе, глубине, движении камеры, масках, краях и управляющих слоях, а затем экспортировать данные для Seedance, ComfyUI, Blender, Runway, Kling и других.
Автор - 25 лет в индустрии кино и рекламы. С кем только не работал. А потом свичнулся в Creative Technologist and AI Systems Architect.
У него два софта:
https://github.com/wassermanproductions/motion-previs-studio
https://github.com/wassermanproductions/blockout
Второй - это как раз блокаут для нейрорендера, о котором я так люблю писать.
Причем для обоих софтов есть MCP.
Почитайте твиттор Сэма, там есть туторы.
https://x.com/SamJWasserman
Софт непростой - но а как вы хотели? Видео - это вам не картинки (возвращаясь в начало марафона).
В общем, процесс пошел, и потихоньку появляются профессиональные софты для превиза, рефов, режиссуры.
@cgevent
🔥21😱5❤4👍1👎1
This media is not supported in your browser
VIEW IN TELEGRAM
А закончим сегодняшний марафон небольшим ништячком от LTX.
Вы тут спрашивали про лупы.
Вот они:
https://huggingface.co/Lightricks/LTX-2.3-22b-LoRA-Cinemagraph
Transforms still images into smooth, looping cinemagraphs with selective motion while keeping the rest of the scene frozen.
@cgevent
Вы тут спрашивали про лупы.
Вот они:
https://huggingface.co/Lightricks/LTX-2.3-22b-LoRA-Cinemagraph
Transforms still images into smooth, looping cinemagraphs with selective motion while keeping the rest of the scene frozen.
@cgevent
1👍20👎3🔥2
Ошибок в тексте и коде у моделей маскированной диффузии теперь станет меньше
Исследователи из лаборатории научных исследований Т-Технологий и Института ИИ и цифровых наук ФКН НИУ ВШЭ представили G-Star+ — метод сэмплирования для моделей маскированной диффузии.
Работу представили на конференции ICML 2026 в Сеуле.
В маскированных диффузионных моделях генерация происходит через последовательное заполнение замаскированных токенов. Проблема в том, что уже выбранный токен часто фиксируется навсегда, и в случае ошибки на раннем этапе внести какие-либо исправления сложно.
G-Star+ работает как “внутренний редактор”. Он определяет токены с высокой вероятностью ошибки, повторно маскирует только их и переписывает подозрительные места позже. Вместо полного переобучения происходит дообучение одного дополнительного слоя – это экономит вычислительные ресурсы и позволяет фокусироваться на местах, где ошибка наиболее вероятна.
G-Star+ был оценен на семи бенчмарках, включая генерацию кода, текста и следование инструкциям, и показал эффективность в режимах быстрой генерации (64–256 шагов). Метод может улучшать качество генерации текста и кода в ИИ-ассистентах, чат-ботах и при автодополнении кода.
ссылка
@cgevent
Исследователи из лаборатории научных исследований Т-Технологий и Института ИИ и цифровых наук ФКН НИУ ВШЭ представили G-Star+ — метод сэмплирования для моделей маскированной диффузии.
Работу представили на конференции ICML 2026 в Сеуле.
В маскированных диффузионных моделях генерация происходит через последовательное заполнение замаскированных токенов. Проблема в том, что уже выбранный токен часто фиксируется навсегда, и в случае ошибки на раннем этапе внести какие-либо исправления сложно.
G-Star+ работает как “внутренний редактор”. Он определяет токены с высокой вероятностью ошибки, повторно маскирует только их и переписывает подозрительные места позже. Вместо полного переобучения происходит дообучение одного дополнительного слоя – это экономит вычислительные ресурсы и позволяет фокусироваться на местах, где ошибка наиболее вероятна.
G-Star+ был оценен на семи бенчмарках, включая генерацию кода, текста и следование инструкциям, и показал эффективность в режимах быстрой генерации (64–256 шагов). Метод может улучшать качество генерации текста и кода в ИИ-ассистентах, чат-ботах и при автодополнении кода.
ссылка
@cgevent
❤46👍9