Tsuev | Blog
303 subscribers
455 photos
64 videos
5 files
297 links
Блог про Frontend и не только

По всем вопросам
https://t.me/Qarimansur
Download Telegram
Один энтузиаст, который недавно начал снимать контент вокруг GTA SA, разработал симуляцию мира в соответствии с заложенной логикой поведения NPC в самой игре.

Кстати блоггер имеет только прикладные знания программирования, т.е. буквально с 0 и вручную он ничего не делал, весь проект сгенерирован через Cluade Code.

Удивительно, что могут делать последние LLM-модели!

Ссылка на проект

#интересно
👍7
Tsuev | Blog
Продолжаю изучать локальные модели, на сей раз это qwen-image-2.1 Дня 2 пытался адекватно накатить все это дело на свой пк. Еле-еле завел... Поднял на RTX 3060 (12 ГБ) локальный генератор изображений Qwen-Image-2.1 - связка ComfyUI + GGUF-кванты Q4, вся…
В продолжение темы генерации картинок.

Мое удивление, когда эта локальная модель идеально сформировала буквы без каких-либо артефактов и ошибок.

A clean modern vector illustration on a pure white background. Large centered text reading exactly "NORTHWIND", with every letter spelled correctly and clearly separated. Bold geometric sans-serif type


Еще 1-2 года назад топовая модель от OpenAI не имела такой возможности, все мы помним размазанные буквы и несуразицы. А модель от яндекса (YandexArt) до сих пор страдает от этого.

#петопроект
👍4
Дам доступ первым 3-м, кто напишет мне в лс или под комменты. Доступ дается для исключительно для тестирования потоковой генерации. На пока что неопределенный срок.

Также уточню. Учитывая, что изображение в среднем генерируется за 100-120 сек. То для следующего кто делает запрос это время умножается на 2 так как он будет стоять в очереди, пока первый запрос не пройдет, ибо ресурсы видюхи не резиновые)

https://t.me/qwen_image_ts_bot

UPD: менее чем за 10 секунд, после поста все 3 места заняты…

#дорогие_подпищники
👍1
Самому сложно поверить, но скоро каналу будет 4 года. За это время я с вами прошел большой путь и получил ценный опыт.

Надеюсь я и дальше смогу быть полезным.
👍51
Пошли дальше: поставил себе локальнуюa LLM Qwen3:14B

Вы спросите зачем?

Из данных тестов, которые делались вместе с вами.
На данном этапе модель для генерации изображений имеет явный недостаток, она не умеет раскрывать ваш промпт.
Условно, если вы напишете "хочу самолет", с вероятностью 90% он выкинет какой-нибудь кривой артефакт.

А теперь я поставил между промптом юзера и результатом, прослойку ввиде локальной модели Qwen3 на 14 млрд параметров (это максимум, который комфортно поддерживает мое железо)

Теперь техническая сторона, на схеме все просто:
промпт ➡️ 
тг бот ➡️
Qwen3 (улучшает ✨) ➡️
nodejs-app (промежуточное ПО) ➡️
Qwen-Image (создает изображение✨) ➡️
тг бот (отправляет изображение в чат)


Но на деле, видюха не может одновременно держат в себе 2 модели, потому что просто не хватает ресурсов.
Поэтому в ollama через которую я открываю Qwen3 ставим переменную выгрузки llm из VRAM через 5 секунд после запроса, это чревато тем, что первый запуск будет долгим, но тут происходит интересная дилемма.

Если оставить Qwen3 для быстрой улучшения пропта в VRAM, то Qwen-image будет отдавать ваше изображение в 3 раза медленнее. Иначе быстрая выгрузка освобождает ресурсы видеокарты, а qwen-image может спокойно собрать ваше изображение.

Первый неоптимизированный запуск выдал порядка 6-7 минут в общем на результат по схеме выше
Второй оптимизированный в среднем 15-30 сек на улучшение промпта и 100-115 сек на картинку

Успех!

#петпроект
👍7
🤣7👍3
Смотрим дальше...

ollama run qwen3.5:9b
👍6
Tsuev | Blog
Смотрим дальше... ollama run qwen3.5:9b
✨ Улучшенный промпт (LLM: 13.2 с):
A lavish wooden table overflowing with a colorful mountain of various fruit snacks, including apples, oranges, grapes, berries, and dried fruits. The composition uses forced perspective to make the pile look massive and abundant. Soft, warm morning sunlight streams from the left side, creating gentle highlights on the shiny skins and deep shadows in the crevices of the food. High-key lighting with a clean background that reserves negative space for text placement. Photorealistic texture showing fruit pores, fabric weave of napkins, and natural gravity folds. Color palette: vibrant reds, yellows, greens, and warm wood tones. Framing: eye-level close-up focusing on the center pile. No text.

🚫 Негативный промпт:
plastic skin, extra fingers, deformed hands, distorted clothing, misspelled text, random logos, watermarks, cluttered background, dark gloomy lighting, oversaturation.
👍7
Tsuev | Blog
✨ Улучшенный промпт (LLM: 13.2 с): A lavish wooden table overflowing with a colorful mountain of various fruit snacks, including apples, oranges, grapes, berries, and dried fruits. The composition uses forced perspective to make the pile look massive and abundant.…
Итак Qwen3.5:9b лучше и быстрее генерирует улучшение промпта. В среднем 10-15 сек. на ответ.

Изначальный запрос был такой:
"Стол с кучей разных фруктов"
👍4
This media is not supported in your browser
VIEW IN TELEGRAM
Каждый раз когда ии-агент спрашивает разрешение
🤣5👍32
Далее на очереди VoiceStudio абсолютно бесплатный аналог ElevenLabs с открытым исходным кодом.

На примере мой клонированный голос, который читает введенный текст. Насколько это удивительно и точно.

Далее пришлю оригинал своего голоса, где вы сможете послушать и дать сравнительный фидбэк)

#петпроект

Единственное он сильно глушит мой кавказский акцент)
👍4
Tsuev | Blog
Voice message
Еле с третьей попытки записал 🤣😅
🤣5👍1
Итого за последние 2 недели мы смогли развернуть на локальной машине 3 типа ии-генераций: изображение, текст и звук.

Также поверх всех трех клиентских приложений, которые разворачивают эти модели, я написал тг ботов через которые я могу взаимодействовать со всеми из них с мобильного устройства.

Это был очень полезный и ценный опыт.

В будущем планирую написать полноценный курс по развертке таких моделей для вас!

Оставшийся гештальт – видео-генерация

#петпроект
👍9
Кидаю сюда понравившиеся мне генерации из локальной модели

@aigalleryart

#петпроект
👍6