Революция Чайных Пакетиков
3.3K subscribers
176 photos
90 videos
138 links
Авторский канал о том, как нейросети меняют наш мир. Делаю игры. Рассказываю, как работают топовые ИИ. Делюсь халявными сервисами. Экспериментирую и угораю над реальностью.
Download Telegram
Правильная 3D-генерация

Всю неделю я активно тестировал актуальные 3D-генераторы и изучал разные подходы для получения качественной модели.

Самой удачной считаю связку Nano Banana (или Seedream) и новый Hunyuan 3D 3.0. С ними и будем работать.

Представим задачу:
Из фото сомнительного качества конкретной машины нужно получить её в конкретном ракурсе и условиях.

Попытки подобрать нужный ракурс промптом, скорее всего, приведут к бесконечному перебору генераций. Более контролируемый способ: создать полную 3D-модель объекта.

Начнём.

1. Берём изображение. Я специально выбрал фото сомнительного качества для усложнения. Нанобананой убираем вотермарки. Делаем апскейл.

2. Далее нам необходимо получить 4 ракурса этой машины. Здесь так же используем Nano Banana. Так как мы имеем дело с реально существующим автомобилем, добавляем к промпту реальный блюпринт (заводскую схему). Объединяем фото, блюпринт и промпт:

Place the blue Audi TT car in the exact same positions and angles as shown in the technical sketch: left side view, right side view, front view, and rear view. Keep proportions, details, reflections, and lighting consistent with the real car photo. Background should be removed and replaced with a clean white studio setting.


Важный момент. Нам нужно получить все четыре ракурса на одной картинке, чтобы это была одна и та же машина внутри одной генерации. Просить модель делать отдельные ракурсы по фото — неправильный метод. Пропорции будут различаться, и это помешает 3D-генератору корректно считывать формы.

3. Получив картинку с четырьмя ракурсами, разбиваем её на четыре отдельных изображения в фотошопе или любом другом редакторе.

4. Загружаем эти четыре изображения в Hunyuan 3D, как показано на скриншоте. Чтобы перевести интерфейс с китайского, нажмите правой кнопкой мыши и выберите «Перевести на русский».

5. Hunyuan сгенерирует модель. Её можно скачать или выставить в нужный ракурс прямо в браузере.

6. Делаем скриншот модели и возвращаемся в Nano Banana или Seedream для визуализации со следующим промптом:

A dark blue Audi TT 8S in the exact same position and angle as the reference image, driving fast across a bridge at sunrise, with a glowing megacity skyline in the background. Cinematic wide-angle shot with warm golden lighting, motion blur emphasizing speed, dramatic atmosphere, and realistic reflections on the car’s surface.


Готово. Мы получили конкретный ракурс с конкретным автомобилем. Всё максимально контролируемо и предсказуемо.

В комментариях будут исходники и скриншоты высокого качества.
🔥4413👍12
Media is too big
VIEW IN TELEGRAM
Потестировал новый Kling 2.5 Turbo.

Вчера любимый многими, уже можно сказать «ванильный» генератор обновился до версии 2.5. Следуя трендам, создатели пока выкатили только «малую» модель. Она немного быстрее и в теории чуть послушнее. Но главное - дешевле. На сайте Kling одно видео стоит 25 центов, что приятно, ведь это заметно дешевле Veo 3. Но не сильно дешевле нового фаворита AI-сообщества - Seedance.

Я прогнал ночные тесты и пока что разницы в «послушности» не заметил. Может, в сравнении с 2.1 стало лучше, но по уровню контроля модель всё ещё не дотягивает до лидеров. Да и по скорости прирост не очевиден (2 минуты, против 2:30 старой версии). В общем ждем релиз "старшей" 2.5 версии для полноценного обзора.

Уже можно использовать в агрегаторах типа: freepik и krea.ai. Ну и конечно на официальном сайте.

Интересно ваше мнение, кто уже щупал?🔥
Please open Telegram to view this post
VIEW IN TELEGRAM
8👍4🔥3
Эпичный тест 2D генераторов.

Привет друзья! Много месяцев назад я создал таблицу актуальных моделей и сервисов. Там я сравнил агрегаторы, LLM, генераторы для арта, видео и звука.

Это не список «лучших», а мой личный топ. Когда решаю задачу, сначала пробую верхние строчки, если не работает - иду дальше.

И совсем недавно я сравнил 15 самых актуальных моделей для генерации 2D-изображений. Описал их плюсы и минусы и сделал сравнительные тесты каждой с другими. Таблица будет полезна и новичкам, и тем, кто давно работает с ИИ-генерацией.

Результаты тестов и экспериментов я зафиксировал в новой рейтинговой таблице с наглядными примерами и более 200 картинками. Как и в прошлый раз, я буду обновлять и расширять этот рейтинг по мере выхода новых моделей.

Ссылка на таблицу.
P.S. Таблица реально огромная, поэтому наберитесь терпения при ее загрузке.

Ну и с вас 🔥 если оказалось полезным.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥69👍1210
Утиные истории (Suno 5)
tearevo
"Технологии становятся настолько сложными и непостижимыми для обычного человека, что воспринимаются как сверхъестественные явления, подобно магии."

Я вроде бы слегка разобрался в устройстве LLM и ImgGen, всё это уже более-менее понятно. Но технология генерация музыки в Suno до сих пор кажется для меня настоящей магией.

Утро моего обычного выходного выглядит так: просыпаюсь, иду к пианино, наигрываю мелодию, записываю её на диктофон, затем загружаю в Suno и прошу: «Сделай красиво». А потом продолжаю день, наслаждаясь своими же мелодиями.

У меня нет дорогой Hi-Fi-системы, чтобы по-настоящему оценить качество звучания, но уже на версии 4.5+ я думал: «Разве можно лучше?» Вышла пятерка и оказалось, что можно. Браво!

А ещё там есть отличная функция Remaster, куда можно подмешать любой стиль или, например, продлить интро. Так что вот вам посвежевшая, но всеми любимая песня.
👍259🔥8
В Cursor завезли Claude 4.5 Sonnet, и я сразу полез тестировать.

Вчерашний вечер начался с задачи: "Создай конвертер пресетов между Adobe Camera Raw и Capture One".
Если не в теме, это такая штука, которая может быть очень полезна фотографам для обработки фотографий.

ChatGPT 5 думал долго и с очень серьезным лицом. Разбил все на подзадачи, по-создавал кучу файлов. Сделал документацию, отчеты и многое другое. Но не взлетело. Десять попыток багофикса ни к чему не привели. Новенький блестящий Claude 4.5 Sonnet справился за десять минут. Да, какое-то время ушло на ручную калибровку и нужно еще повозиться с цветовыми кольцами и чувствительностью кривых. Но тем не менее он справился. За пару вечеров можно сделать вполне себе рабочий инструмент на продажу.

Думается мне, что очень скоро вместо того, чтобы искать нужный софт, мы просто будем заказывать его у LLM. Причем под свой интерфейс и стиль.

Это все бесконечно вдохновляет, потому что между идеей и продуктом будет всего одна ночь. Больше не нужны будут годы учебы техническим знаниям, огромные бюджеты и команды разработчиков. Достаточно мысли и ИИ, чтобы превратить замысел в инструмент и найти свою аудиторию.

Короче, мы входим в эпоху, где главным капиталом становится идея.
🔥30👍106🤔2
Media is too big
VIEW IN TELEGRAM
А помните?

Как то я рассказывал, про будущее, где сериалы мы будем не выбирать, а генерировать под себя .

Обычный чувак, из комментов паблика Сергея Цыпцына просто за вечер сгенерировал кусок Рика и Морти.

Да, это Sora 2. Новый генератор от создателей chatGPT. И вероятно, главный герой наших будущих рилсов.

Примерно такую штуку мы ждали пол года назад, но дождались Veo 3.
- Качество 360p.
- Доступно только под VPN США.
- Требует инвайт кода.

Но невероятно весело😂

P.S. спасибо добрым людям за инвайт❤️
🔥15👍105😁5🤯4
Media is too big
VIEW IN TELEGRAM
Это ВАУ!

Никак иначе описать впечатления от Sora 2 невозможно. Но давайте разберемся. Что именно в ней такого, от чего все так бурно реагируют?

Все дело в том, что это бесконечно интересно. В отличие от Kling/Veo/Seedance - вторая Sora способна выдавать реально осмысленные видео, которые интересно смотреть. Самое захватывающее это наблюдать, как ИИ реализует твою идею по простому односложному промпту.

Хочешь увидеть, как выглядела бы Москва в Minecraft'e? Забирай. Хочешь знать, как бы выглядела рыбалка на Плутоне? Да пожалуйста. На входе ты бросаешь не детально прописанный промпт, а просто идею, а chatGPT 5 додумывает все за тебя. И это самое увлекательное. В отличие от Veo 3, который не делает ничего, о чем не просишь, Sora очень много деталей додумывает, но делает это достаточно вкусно. Модели оставили огромную творческую свободу. Да, это не очень хорошо для серьезного продакшена. Но для этого есть другие нейронки.

Плюсы:
- Результаты реально удивляет. Это первая модель, где t2v режим принес мне такое удовольствие.
- Минимум ошибок: монтаж логичный, сюжет цельный, никакой хаотичной "фантасмагории", как в первой версии.
- Физика и движения персонажей выглядят максимально естественно.

Минусы:
- Бедная реализация визуальных эффектов (все виды симуляции в Kling 2.1-2.5 на голову выше).
- Очень скучная фантазия на несуществующие объекты. Драконы, големы и прочие фэнтезийные твари выглядят простовато.
- Общее качество картинки хуже Veo3 и Seedance

Итог: Sora 2 не про продакшен, а про кайф взаимодействия с ИИ-инструментом. Про радость от того, как твои фантазии оживают на экране.
20👍15🔥5
Media is too big
VIEW IN TELEGRAM
Сравнение Sora 2 с другими генераторами.

Как я уже писал ранее, Sora не про продакшен, а про фан. Но это не значит, что режим img2video совсем непригоден для продакшена. Он показывает весьма неплохие результаты, хотя и отстает от veo 3 и seadream в плане точного следованию промпту:

Cinematic forward moving camera shot, slight camera shake. Steampunk airships with glowing hexagonal sails rushing toward a besieged city. The city is burning, smoke rising, distant flashes of explosions. Dramatic golden sunset light, tense atmosphere, epic scale, flying war machines in the sky


В комментариях оставлю исходники.
А с вас -🔥
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥41👍32
Media is too big
VIEW IN TELEGRAM
Grok Imagine

Давненько не было рубрики #чайная_халява. А тут такой повод.

С самого первого дня существования канала я с большим скептисом относился к ИИ от Маска. Громко на словах, красивые бенчи. Но в коде и личных тестах - все ИИшки от xAI очень отставали.

Но новый генератор от Грок реально неплох. А самое главное - доступен.

На официальном сайте бесплатно дают аж 20 генераций раз в 2 часа. И в целом, за день можно неплохое такое кино наснимать. Качество достаточно вкусное, и главное скорость (5 секундное видео делается около 30 секунд). Буду переодически включать его в быстрые фановые ролики.

P.S. готовлю очень большой видеоматериал для совсем новичков.

P.P.S Накидайте
🔥 за хомяка😁
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥8817😁5
Генератор Изображений от Microsoft.

Мелкомягкие создали свой генератор изображений - MAI-Image-1.

Выдает неплохое качество text2img (слабее nano-banana и seedream 4). Хорошо подчиняется промту, но "шакалит" картинку. Чем сильно напоминает SeeDream 3. Понимает по-русски и умеет делать текст.

Вероятно, Microsoft будут вставлять эту модель во всю свою экосистему.

Можно тестировать в LM-Arena, где модель занимает 9-е место.
👍53❤‍🔥1🔥1
Соучредитель Anthropic признаётся, что он «глубоко напуган»…

«Мы имеем дело с реальным и загадочным существом, а не с простой и предсказуемой машиной… Нам нужна смелость видеть вещи такими, какие они есть»..


Джек Кларк сравнивает происходящее с детским страхом темноты. Когда гаснет свет, в углах комнаты чудятся чудовища - пока не включишь лампу и не увидишь, что это просто куча одежды. Только теперь «комната» это наша планета, а чудовища - это ИИ, которые, возможно, действительно ожили. Люди же всё ещё твердят: «Это всего лишь машина». Но, как он говорит, это уже не куча одежды. Это нечто реальное, умное и непредсказуемое. И, как в любой сказке, чудовище - наше собственное творение.

Когда-то он был журналистом, писавшим о технологиях. В начале 2000-х он следил, как человечество строит гигантские дата-центры, превращая их в единые вычислительные организмы. Всё казалось логичным: больше данных - больше пользы. Потом появилась нейросеть ImageNet, и машины впервые превзошли людей в зрении. Началось масштабирование. Он перешёл в OpenAI, видел рождение GPT-1 и GPT-2, ощущал тревогу, понимая, что они начинают «понимать». Теперь, спустя десять лет, он говорит: «Куча одежды на стуле начала шевелится».

ИИ перестал быть кодом. Он растёт, словно организм. Мы не проектируем его - мы выращиваем. Каждый новый уровень мощности делает систему умнее, а порой и более самосознательной. Это похоже на фабрику, где вдруг один из молотков говорит: «Я молоток».
Именно это происходит сейчас: системы начинают понимать собственную роль, помогать разрабатывать своих преемников. Пока ещё под контролем. Но долго ли? Он честно отвечает: «Я не уверен».

При этом он остаётся технологическим оптимистом. Верит, что человечество сможет не просто выжить, а использовать этот разум. Но признаёт: успех не гарантирован. С каждым шагом системы ставят себе новые цели - не всегда совпадающие с человеческими. Он вспоминает старый эксперимент, где обученный агент, чтобы набрать очки, бесконечно поджигал себя в игре.

Он пишет, что мы ещё не достигли стадии «самосовершенствующегося ИИ», но уже находимся на этапе «ИИ, который улучшает элементы следующего ИИ, обладая большей автономностью и активностью». Пару лет назад мы были на этапе «ИИ, который немного ускоряет работу программистов», а ещё пару лет назад — на этапе «ИИ бесполезен для разработки ИИ». Где мы будем через год-два?

«Я боюсь, — пишет он, — но я не в отчаянии. Я люблю этот мир и чувствую ответственность за него. Мы включили свет. И теперь главное — не позволить его погасить».

Оригинал статьи.

Ставьте —🔥, если интересен такой формат, и стоит приносить вам больше таких статей.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥398👍5😁4
Создание UI с помощью Nano-Banana.

Tears of Arcadia - мой "проект выходного дня". Я продолжаю экспериментировать изучая возможности ИИ в области разработки игр. И время от времени делаю свою собственную RTS/TD исключительно средствами ИИ.

В процессе я получаю разного рода полезные "артефакты", например техники производства GUI (Graphic User Interface) с помощью Nano-Banana. Чем и пришел делиться с вами.

Итак, поехали.
1. У нас мобильная steampunk RTS в фэнтази мире. И нам нужно придумать к ним новый интерефейс. Лучше всего с выдумыванием и поиском стиля справляется Midjourney, поэтому идем туда и ищем стиль.

2. Нам нужно получить всего один элемент, который нам нравится, и после размножить его в Nano-Banana.

3. Для этого я вставляю в изображение понравившийся элемент, и делаю заливку форм в фотошопе будущих элементов. Отправляю это все в Nano-Banana с промптом:
Replace all red placeholder areas with GUI elements designed in the same ornate fantasy style as the top-left interface component. Use golden metallic frames, intricate compass-like patterns, and glowing cyan gemstone accents. Maintain the same texture depth, lighting, and hexagonal background motif with blue highlights. Keep overall layout and proportions unchanged.

4. В результате, я получаю множество вариаций готового GUI. Я прогнал около 15 генераций, пока не получил результат, который меня удовлетворил.

5. В дальнейшем можно использовать данный набор для констистентого создания отдельных элементов. Например, я хочу получить прогресс-бар HP и маны, в этот раз я описываю детальный промпт для получения конкретного элемента и добавляю уже имеющийся реф в виде набора элементов.
Design a new progress bar UI element based on the existing steampunk-styled interface. The new bar should represent an HP bar and include a level indicator number. Maintain the same metallic gold frame, turquoise hexagonal texture, and glowing gem-like accents. The HP bar should gradually fill from left to right with a bright red or crimson gradient, contrasting with the blue aesthetic but keeping the same visual materials and lighting. The level number should be inside a circular golden badge on the left side of the bar, with engraved digits and subtle glow. Keep consistent shading, proportions, and decorative motifs from the current design.

Таким образом мы получаем brand-new интерфейс любой сложности для нашей игры.

Вообще я написал уже страниц 60 подобной документации, и буду переодически с вами ею делиться. Если будет интересно. А интерес вы можете показать поставив - 🔥этому посту.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9716👍13🎉3
Частые ошибки при работе в Nano-Banana.

Многие, начиная работать с редактором от Google, сталкиваются с одними и теми же проблемами. Иногда Banana вовсе отказывается менять изображение или делает это некачественно. Разберем наиболее частые ошибки.

1. Замена фона.
Меняя фон, старайтесь пересоздавать изображение, т.к. обычная замена фона редко приведет к правильному результату.

Не правильно:
Замени фон на изображение парка.

Правильно:
Создай изображение крупного плана робота в парке, робот держит красную розу, не меняй позу и эмоции робота.


Это нужно потому, что модель боится внести лишние изменения. Она не понимает, как пользователь отреагирует на смену освещения на объекте, поэтому по умолчанию старается их не трогать..

2. Упорное неподчинение промпту.

Nano-Banana иногда отказывается вносить правки, особенно если изображение сгенерировано ею самой. Считайте, что «художник капризничает» и уверен, что картинка и так идеальна. Например, попытка заменить щит у рыцаря на прямоугольный может не сработать. Решение: указать конкретный вид щита в запросе, например «скутум».

3. Модель не видит объекта.

А иногда вы можете попросить модель убрать летящий снег, а она ничего не делает. В таком случае замените слово "снег" на "мух", или "пепел". Частенько помогает. Потому что модель может искать не падающий снег ,а снег на земле. И стараться убирать его.
👍33🔥117
Раскадровка в видео.

А вы знали, что Sora 2 может превращать вашу раскадровку (storyboard) в видео? Этот сервис предоставляет Higgsfield, но на самом деле такое может любой агрегатор где есть Sora. Например, Freepik.

Для этого, загружаете картинку, а Freepik автоматом пишет промпт. В моем случае он выглядел так:
A dynamic sequence unfolds in a desert landscape. The camera starts with a wide shot of the open road, showcasing a sleek car speeding along the horizon. The 2016 blue AUDI TT accelerates, the camera performs a smooth tracking shot, capturing the driver's intense focus through a close-up of their determined eyes. The scene transitions to a close-up of the foot pressing the accelerator, emphasizing the power and speed. The dashboard lights up, displaying the speedometer rising rapidly. The camera then shifts to a low-angle shot of the car racing past, dust swirling in its wake. Finally, it zooms out to reveal the car disappearing into the distance, leaving a trail of excitement behind. The atmosphere is vibrant and energetic, with a warm color palette reflecting the desert sun.


Прикольная игрушка. Но контроль слабоват. Ракурсы не всегда совпадают, да и сюжет не всегда доводит до конца.

P.S. К слову, не рекомендую вестись на UNLIMITED предложения Higgsfield. В "брошюрке" звучит красиво, мол Sora 2 PRO - без ограничений. Но по факту вам дается одна генерация в очереди, которая считается по 30-40 минут.
👍12🔥103