Один энтузиаст, который недавно начал снимать контент вокруг GTA SA, разработал симуляцию мира в соответствии с заложенной логикой поведения NPC в самой игре.
Кстати блоггер имеет только прикладные знания программирования, т.е. буквально с 0 и вручную он ничего не делал, весь проект сгенерирован через Cluade Code.
Удивительно, что могут делать последние LLM-модели!
Ссылка на проект
#интересно
Кстати блоггер имеет только прикладные знания программирования, т.е. буквально с 0 и вручную он ничего не делал, весь проект сгенерирован через Cluade Code.
Удивительно, что могут делать последние LLM-модели!
Ссылка на проект
#интересно
👍7
Tsuev | Blog
Продолжаю изучать локальные модели, на сей раз это qwen-image-2.1 Дня 2 пытался адекватно накатить все это дело на свой пк. Еле-еле завел... Поднял на RTX 3060 (12 ГБ) локальный генератор изображений Qwen-Image-2.1 - связка ComfyUI + GGUF-кванты Q4, вся…
В продолжение темы генерации картинок.
Мое удивление, когда эта локальная модель идеально сформировала буквы без каких-либо артефактов и ошибок.
Еще 1-2 года назад топовая модель от OpenAI не имела такой возможности, все мы помним размазанные буквы и несуразицы. А модель от яндекса (YandexArt) до сих пор страдает от этого.
#петопроект
Мое удивление, когда эта локальная модель идеально сформировала буквы без каких-либо артефактов и ошибок.
A clean modern vector illustration on a pure white background. Large centered text reading exactly "NORTHWIND", with every letter spelled correctly and clearly separated. Bold geometric sans-serif type
Еще 1-2 года назад топовая модель от OpenAI не имела такой возможности, все мы помним размазанные буквы и несуразицы. А модель от яндекса (YandexArt) до сих пор страдает от этого.
#петопроект
👍4
Tsuev | Blog
В продолжение темы генерации картинок. Мое удивление, когда эта локальная модель идеально сформировала буквы без каких-либо артефактов и ошибок. A clean modern vector illustration on a pure white background. Large centered text reading exactly "NORTHWIND"…
Генерация от YandexArt v.2.5 с тем же промптом. Сверху еще можно различить слово North, но на второй строке творится какой-то артхаус
👍1
Дам доступ первым 3-м, кто напишет мне в лс или под комменты. Доступ дается для исключительно для тестирования потоковой генерации. На пока что неопределенный срок.
Также уточню. Учитывая, что изображение в среднем генерируется за 100-120 сек. То для следующего кто делает запрос это время умножается на 2 так как он будет стоять в очереди, пока первый запрос не пройдет, ибо ресурсы видюхи не резиновые)
https://t.me/qwen_image_ts_bot
UPD: менее чем за 10 секунд, после поста все 3 места заняты…
#дорогие_подпищники
Также уточню. Учитывая, что изображение в среднем генерируется за 100-120 сек. То для следующего кто делает запрос это время умножается на 2 так как он будет стоять в очереди, пока первый запрос не пройдет, ибо ресурсы видюхи не резиновые)
https://t.me/qwen_image_ts_bot
UPD: менее чем за 10 секунд, после поста все 3 места заняты…
#дорогие_подпищники
👍1
Пошли дальше: поставил себе локальнуюa LLM Qwen3:14B
Вы спросите зачем?
Из данных тестов, которые делались вместе с вами.
На данном этапе модель для генерации изображений имеет явный недостаток, она не умеет раскрывать ваш промпт.
Условно, если вы напишете "хочу самолет", с вероятностью 90% он выкинет какой-нибудь кривой артефакт.
А теперь я поставил между промптом юзера и результатом, прослойку ввиде локальной модели Qwen3 на 14 млрд параметров (это максимум, который комфортно поддерживает мое железо)
Теперь техническая сторона, на схеме все просто:
Но на деле, видюха не может одновременно держат в себе 2 модели, потому что просто не хватает ресурсов.
Поэтому в ollama через которую я открываю Qwen3 ставим переменную выгрузки llm из VRAM через 5 секунд после запроса, это чревато тем, что первый запуск будет долгим, но тут происходит интересная дилемма.
Если оставить Qwen3 для быстрой улучшения пропта в VRAM, то Qwen-image будет отдавать ваше изображение в 3 раза медленнее. Иначе быстрая выгрузка освобождает ресурсы видеокарты, а qwen-image может спокойно собрать ваше изображение.
Первый неоптимизированный запуск выдал порядка 6-7 минут в общем на результат по схеме выше
Второй оптимизированный в среднем 15-30 сек на улучшение промпта и 100-115 сек на картинку
Успех!
#петпроект
Вы спросите зачем?
Из данных тестов, которые делались вместе с вами.
На данном этапе модель для генерации изображений имеет явный недостаток, она не умеет раскрывать ваш промпт.
Условно, если вы напишете "хочу самолет", с вероятностью 90% он выкинет какой-нибудь кривой артефакт.
А теперь я поставил между промптом юзера и результатом, прослойку ввиде локальной модели Qwen3 на 14 млрд параметров (это максимум, который комфортно поддерживает мое железо)
Теперь техническая сторона, на схеме все просто:
промпт ➡️
тг бот ➡️
Qwen3 (улучшает ✨) ➡️
nodejs-app (промежуточное ПО) ➡️
Qwen-Image (создает изображение✨) ➡️
тг бот (отправляет изображение в чат)
Но на деле, видюха не может одновременно держат в себе 2 модели, потому что просто не хватает ресурсов.
Поэтому в ollama через которую я открываю Qwen3 ставим переменную выгрузки llm из VRAM через 5 секунд после запроса, это чревато тем, что первый запуск будет долгим, но тут происходит интересная дилемма.
Если оставить Qwen3 для быстрой улучшения пропта в VRAM, то Qwen-image будет отдавать ваше изображение в 3 раза медленнее. Иначе быстрая выгрузка освобождает ресурсы видеокарты, а qwen-image может спокойно собрать ваше изображение.
Первый неоптимизированный запуск выдал порядка 6-7 минут в общем на результат по схеме выше
Второй оптимизированный в среднем 15-30 сек на улучшение промпта и 100-115 сек на картинку
Успех!
#петпроект
👍7
Tsuev | Blog
Смотрим дальше... ollama run qwen3.5:9b
✨ Улучшенный промпт (LLM: 13.2 с):
A lavish wooden table overflowing with a colorful mountain of various fruit snacks, including apples, oranges, grapes, berries, and dried fruits. The composition uses forced perspective to make the pile look massive and abundant. Soft, warm morning sunlight streams from the left side, creating gentle highlights on the shiny skins and deep shadows in the crevices of the food. High-key lighting with a clean background that reserves negative space for text placement. Photorealistic texture showing fruit pores, fabric weave of napkins, and natural gravity folds. Color palette: vibrant reds, yellows, greens, and warm wood tones. Framing: eye-level close-up focusing on the center pile. No text.
🚫 Негативный промпт:
plastic skin, extra fingers, deformed hands, distorted clothing, misspelled text, random logos, watermarks, cluttered background, dark gloomy lighting, oversaturation.
👍7
Tsuev | Blog
✨ Улучшенный промпт (LLM: 13.2 с): A lavish wooden table overflowing with a colorful mountain of various fruit snacks, including apples, oranges, grapes, berries, and dried fruits. The composition uses forced perspective to make the pile look massive and abundant.…
Итак Qwen3.5:9b лучше и быстрее генерирует улучшение промпта. В среднем 10-15 сек. на ответ.
Изначальный запрос был такой:
"Стол с кучей разных фруктов"
Изначальный запрос был такой:
"Стол с кучей разных фруктов"
👍4
This media is not supported in your browser
VIEW IN TELEGRAM
Каждый раз когда ии-агент спрашивает разрешение
🤣5👍3 2
Далее на очереди VoiceStudio абсолютно бесплатный аналог ElevenLabs с открытым исходным кодом.
На примере мой клонированный голос, который читает введенный текст. Насколько это удивительно и точно.
Далее пришлю оригинал своего голоса, где вы сможете послушать и дать сравнительный фидбэк)
#петпроект
Единственное он сильно глушит мой кавказский акцент)
На примере мой клонированный голос, который читает введенный текст. Насколько это удивительно и точно.
Далее пришлю оригинал своего голоса, где вы сможете послушать и дать сравнительный фидбэк)
#петпроект
Единственное он сильно глушит мой кавказский акцент)
👍4
Tsuev | Blog
Далее на очереди VoiceStudio абсолютно бесплатный аналог ElevenLabs с открытым исходным кодом. На примере мой клонированный голос, который читает введенный текст. Насколько это удивительно и точно. Далее пришлю оригинал своего голоса, где вы сможете послушать…
VoiceStudio-Clone-Test.wav
511.9 KB
Клонированный голос
👍7
Итого за последние 2 недели мы смогли развернуть на локальной машине 3 типа ии-генераций: изображение, текст и звук.
Также поверх всех трех клиентских приложений, которые разворачивают эти модели, я написал тг ботов через которые я могу взаимодействовать со всеми из них с мобильного устройства.
Это был очень полезный и ценный опыт.
В будущем планирую написать полноценный курс по развертке таких моделей для вас!
Оставшийся гештальт –видео-генерация
#петпроект
Также поверх всех трех клиентских приложений, которые разворачивают эти модели, я написал тг ботов через которые я могу взаимодействовать со всеми из них с мобильного устройства.
Это был очень полезный и ценный опыт.
В будущем планирую написать полноценный курс по развертке таких моделей для вас!
Оставшийся гештальт –
#петпроект
👍9