This media is not supported in your browser
VIEW IN TELEGRAM
Opus 5.5 + Blender + Unreal Engine
У меня нет идей на игры, поэтому делаю прототип разборки ходовки с реальными каталожными номерами и 3D запчастями. Зачем? Не могу остановиться 🤷♂️
Все это добро засунул в Unreal Engine и прикрепил примитивную анимацию и вращение.
3D модели запчастей делал (только передняя ходовка готова) Opus 5.5, пока у него лимит, GPT-6 Astra засунула это всё в анрил.
Может будет видео про это, а может нет.
MrGips • Про LLM / НАШ ЧАТ
У меня нет идей на игры, поэтому делаю прототип разборки ходовки с реальными каталожными номерами и 3D запчастями. Зачем? Не могу остановиться 🤷♂️
Все это добро засунул в Unreal Engine и прикрепил примитивную анимацию и вращение.
3D модели запчастей делал (только передняя ходовка готова) Opus 5.5, пока у него лимит, GPT-6 Astra засунула это всё в анрил.
Может будет видео про это, а может нет.
MrGips • Про LLM / НАШ ЧАТ
👍14😁2👎1🔥1😍1
Qwen Image 2.1 - несколько примеров как работает режим редактирования
Промты:
Утащил с реддита для вас.
MrGips • Про LLM / НАШ ЧАТ
Промты:
Change all Coca Cola cans of <image1> by the can of <image2>. Keep then cans crushed as in <image1>. Make the white surface reflects the blue and pink colors of <image2>Keep the character and pose in <image1> unchanged, put this Rolex wristwatch from <image2> on the character, preserve the original body shape and pose, the wristwatch fits naturally on wrist, keep the original background and original lighting, high fashion editorial photography, sharp detailsУтащил с реддита для вас.
MrGips • Про LLM / НАШ ЧАТ
🔥15👍4
This media is not supported in your browser
VIEW IN TELEGRAM
Попробовал повторить тренд из инстаграма
Делал в Minimax H3, стандартный ворк Ref2V. Руки еще помнят ComfyUI.
Как же приятно, когда можно сделать локально не хуже, чем в распиаренном сидансе.
MrGips • Про LLM / НАШ ЧАТ
Делал в Minimax H3, стандартный ворк Ref2V. Руки еще помнят ComfyUI.
Как же приятно, когда можно сделать локально не хуже, чем в распиаренном сидансе.
MrGips • Про LLM / НАШ ЧАТ
😁18🔥7👍3🤣1
🚀 Появился новый движок Strata, который запускает огромную Qwen3.8 Flash Next даже на видеокартах с 12 GB VRAM
Думаю вы уже знаете что Qwen3.8 Flash Next большая MoE-модель, которая требует очень много памяти. Но разработчик нового inference-движка Strata смог распределить её между GPU, оперативной памятью и SSD.
В результате модель уже запускают даже на обычных игровых видеокартах.
На RTX 5070 12 GB при контексте 128K разработчик получил:
• Q2_0 - около 65 tok/s
• IQ2_XS - около 52 tok/s
• IQ3_XXS - около 45 tok/s
• IQ3_S - около 42 tok/s
На коротком контексте скорость ещё выше.
Появились и тесты от других пользователей:
• RTX 5070 Ti - около 86 tok/s на IQ3_XXS при 64K
• RTX 4090 - примерно 58–70 tok/s на IQ3_S при 262K
• даже RTX 2070 8 GB удалось запустить примерно на 20 tok/s
Как это работает?
Strata не пытается полностью загрузить огромную модель в видеопамять.
Самые востребованные части модели находятся на GPU, остальные MoE-эксперты - в RAM, а большая PLE/n-gram память может храниться на SSD.
Таким образом, Flash Next можно запускать даже при относительно небольшом объёме VRAM.
Ещё одна важная функция — кеширование диалога. После первого запроса Strata сохраняет состояние и при следующих обращениях обрабатывает только новый контекст, что особенно важно для AI-агентов и программирования.
Пока у проекта есть ограничения: нет полноценного multi-GPU.
Но сам факт уже интересный: Qwen3.8 Flash Next постепенно превращается из огромной модели для дорогих серверов в LLM, которую можно запускать на обычном домашнем ПК.
Я сам еще не пробовал, но в НАШЕМ ЧАТЕ люди потихоньку запускают, скорость реально повыше.
Линк на движок: https://github.com/Niko1221/Strata
Модели, которые нужны Страте: https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF
Пробовали уже?
MrGips • Про LLM / НАШ ЧАТ
Думаю вы уже знаете что Qwen3.8 Flash Next большая MoE-модель, которая требует очень много памяти. Но разработчик нового inference-движка Strata смог распределить её между GPU, оперативной памятью и SSD.
В результате модель уже запускают даже на обычных игровых видеокартах.
На RTX 5070 12 GB при контексте 128K разработчик получил:
• Q2_0 - около 65 tok/s
• IQ2_XS - около 52 tok/s
• IQ3_XXS - около 45 tok/s
• IQ3_S - около 42 tok/s
На коротком контексте скорость ещё выше.
Появились и тесты от других пользователей:
• RTX 5070 Ti - около 86 tok/s на IQ3_XXS при 64K
• RTX 4090 - примерно 58–70 tok/s на IQ3_S при 262K
• даже RTX 2070 8 GB удалось запустить примерно на 20 tok/s
Как это работает?
Strata не пытается полностью загрузить огромную модель в видеопамять.
Самые востребованные части модели находятся на GPU, остальные MoE-эксперты - в RAM, а большая PLE/n-gram память может храниться на SSD.
Таким образом, Flash Next можно запускать даже при относительно небольшом объёме VRAM.
Ещё одна важная функция — кеширование диалога. После первого запроса Strata сохраняет состояние и при следующих обращениях обрабатывает только новый контекст, что особенно важно для AI-агентов и программирования.
Пока у проекта есть ограничения: нет полноценного multi-GPU.
Но сам факт уже интересный: Qwen3.8 Flash Next постепенно превращается из огромной модели для дорогих серверов в LLM, которую можно запускать на обычном домашнем ПК.
Я сам еще не пробовал, но в НАШЕМ ЧАТЕ люди потихоньку запускают, скорость реально повыше.
Линк на движок: https://github.com/Niko1221/Strata
Модели, которые нужны Страте: https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF
Пробовали уже?
MrGips • Про LLM / НАШ ЧАТ
GitHub
GitHub - Niko1221/Strata: Qwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference…
Qwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input. - Niko1221/Strata
🔥24🤔6
MrGips • Про LLM
🚀 Появился новый движок Strata, который запускает огромную Qwen3.8 Flash Next даже на видеокартах с 12 GB VRAM Думаю вы уже знаете что Qwen3.8 Flash Next большая MoE-модель, которая требует очень много памяти. Но разработчик нового inference-движка Strata…
Qwen 3.8 Flash Next со скоростью 50+ ток/с в новом движке STRATA
Только сегодня делал пост про новый движок для запуска тяжелой MoE модели, как уже подоспели тесты.
Смотреть: https://www.youtube.com/watch?v=M0mMmUrHhP0
Приятного просмотра!
MrGips • Про LLM / НАШ ЧАТ
Только сегодня делал пост про новый движок для запуска тяжелой MoE модели, как уже подоспели тесты.
Смотреть: https://www.youtube.com/watch?v=M0mMmUrHhP0
Приятного просмотра!
MrGips • Про LLM / НАШ ЧАТ
YouTube
Qwen 3.8 Flash Next на новом движке Strata выдает 50+ ток/с на RTX 5090 - Установка, запуск и тесты
В этом видео я протестировал новый движок для запуска Qwen 3.8 Flash Next - Strata. И хочу сказать - это просто пушка!
Движок https://github.com/Niko1221/Strata
Подписывайтесь на телеграм-канал:
https://t.me/ProComfy
Характеристики ПК:
Процессор: Intel…
Движок https://github.com/Niko1221/Strata
Подписывайтесь на телеграм-канал:
https://t.me/ProComfy
Характеристики ПК:
Процессор: Intel…
🔥21❤5👍3
Велосипед в Blender на Strata и Qwen 3.8 Flash Next IQ3_S
Он немного корявый, потому что при генерации вылезла какая-то ошибка и генерация оборвалась.
Я делал через DeepSeek Harness, не особо его настраивал, видимо в контекст уперся раньше времени и не смог его сжать.
Но результат мне нравится. Очень много мелких деталей, которые Qwen 3.8 27B пропускал.
Держу в курсе!
MrGips • Про LLM / НАШ ЧАТ
Он немного корявый, потому что при генерации вылезла какая-то ошибка и генерация оборвалась.
Я делал через DeepSeek Harness, не особо его настраивал, видимо в контекст уперся раньше времени и не смог его сжать.
Но результат мне нравится. Очень много мелких деталей, которые Qwen 3.8 27B пропускал.
Держу в курсе!
MrGips • Про LLM / НАШ ЧАТ
👍25✍1🤔1
Strata добавила полноценный multi-GPU режим
Главная идея - не tensor parallelism, а разделение модели по слоям. Один GPU считает первые слои, второй - следующие, третий при необходимости - оставшиеся. При этом каждая карта держит expert cache только для своих слоёв, поэтому суммарно в VRAM помещается намного больше экспертов и модель реже обращается к CPU/RAM.
Что важно:
• NVLink не нужен;
• PCIe x4/x1 тоже допустим;
• поддерживаются RTX 30/40/50;
• каждая карта должна иметь минимум 8 ГБ VRAM;
• первая карта в списке считается основной;
• лучший режим —
• vision, KV streaming, checkpoints и control vectors работают и в multi-GPU.
Запуск простой:
или вообще без параметров - установщик сам покажет подходящие GPU и предложит объединить их.
По тестам авторов на RTX 5080 + RTX 3090:
• обработка prompt ускорилась примерно на 18–20%;
• decode остался примерно на уровне более быстрой карты;
• генерация кода стала быстрее, потому что почти все нужные routed experts помещались в GPU-кэш.
То есть multi-GPU здесь - это не «в 2 раза быстрее». Основной выигрыш в том, что больше expert weights остаётся в VRAM, меньше данных приходится брать из CPU pool, а длинные prompt’ы обрабатываются быстрее.
Ещё важный момент: добавлять много слабых карт не всегда полезно. В тестах дополнительная медленная GPU, наоборот, ухудшила decode - каждый новый pipeline stage добавляет свои накладные расходы.
Итог: multi-GPU в Strata имеет смысл прежде всего тогда, когда routed experts одной большой MoE-модели не помещаются в VRAM одной карты. Тогда вторая карта может заметно снизить зависимость от RAM/CPU и ускорить работу без необходимости иметь одинаковые GPU.
Линк: https://github.com/Niko1221/Strata/blob/main/docs/MULTI_GPU.md
MrGips • Про LLM / НАШ ЧАТ
Главная идея - не tensor parallelism, а разделение модели по слоям. Один GPU считает первые слои, второй - следующие, третий при необходимости - оставшиеся. При этом каждая карта держит expert cache только для своих слоёв, поэтому суммарно в VRAM помещается намного больше экспертов и модель реже обращается к CPU/RAM.
Что важно:
• NVLink не нужен;
• PCIe x4/x1 тоже допустим;
• поддерживаются RTX 30/40/50;
• каждая карта должна иметь минимум 8 ГБ VRAM;
• первая карта в списке считается основной;
• лучший режим —
--layer-split auto, Strata сама подбирает оптимальное распределение слоёв;• vision, KV streaming, checkpoints и control vectors работают и в multi-GPU.
Запуск простой:
START-HERE.bat --gpus 0,1 --layer-split auto
или вообще без параметров - установщик сам покажет подходящие GPU и предложит объединить их.
По тестам авторов на RTX 5080 + RTX 3090:
• обработка prompt ускорилась примерно на 18–20%;
• decode остался примерно на уровне более быстрой карты;
• генерация кода стала быстрее, потому что почти все нужные routed experts помещались в GPU-кэш.
То есть multi-GPU здесь - это не «в 2 раза быстрее». Основной выигрыш в том, что больше expert weights остаётся в VRAM, меньше данных приходится брать из CPU pool, а длинные prompt’ы обрабатываются быстрее.
Ещё важный момент: добавлять много слабых карт не всегда полезно. В тестах дополнительная медленная GPU, наоборот, ухудшила decode - каждый новый pipeline stage добавляет свои накладные расходы.
Итог: multi-GPU в Strata имеет смысл прежде всего тогда, когда routed experts одной большой MoE-модели не помещаются в VRAM одной карты. Тогда вторая карта может заметно снизить зависимость от RAM/CPU и ускорить работу без необходимости иметь одинаковые GPU.
Линк: https://github.com/Niko1221/Strata/blob/main/docs/MULTI_GPU.md
MrGips • Про LLM / НАШ ЧАТ
GitHub
Strata/docs/MULTI_GPU.md at main · Niko1221/Strata
Qwen3.8-Flash-Next (125B MoE) on a 8GB+ NVIDIA GPU: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input. - Niko1221/Strata
🔥14👍3🤔1
MrGips • Про LLM
Немного увлекся в Блендере с Opus'ом 5.5 А как вы проводите выходные? MrGips • Про LLM / НАШ ЧАТ
Немного увлекся в Blender с Opus'ом [продолжение]
Зачем я это всё делаю? Хочу проверить, насколько точно опус воспроизведет детали автомобиля вплоть до каждого болта в 3D моделировании.
Здесь не только нужно повторить примерную форму запчастей, но и их расположение в подкапотном пространстве.
Держу в курсе!
MrGips • Про LLM / НАШ ЧАТ
Зачем я это всё делаю? Хочу проверить, насколько точно опус воспроизведет детали автомобиля вплоть до каждого болта в 3D моделировании.
Здесь не только нужно повторить примерную форму запчастей, но и их расположение в подкапотном пространстве.
Держу в курсе!
MrGips • Про LLM / НАШ ЧАТ
🔥22👍7
Strata снова ускорили - Qwen3.8 Flash Next уже выходит на 100+ т.с
Подрезал с реддита пост про новую обнову Strata, где еще больше ускорили движок.
Кто здесь новенький, то Strata - это движок для запуска чисто Qwen 3.8 Flash Next (огромной МоЕ модели) на потребительских ПК-шниках.
Он бьет рекорды не только в decode, но и в prompt processing.
Подъехали новые результаты.
На RTX 5070 12 GB:
• ~51 tok/s на IQ3_XXS
• до 1500 tok/s prompt processing
Для сравнения, тот же квант через llama.cpp у меня выдавал около 23 t/s на особом форке, который мне подсказал человек в комметариях. Без этого форка было 16 т/с на 5090.
А в комметах на реддите пользователи уже сообщают:
• RTX 3060 - ~60 tok/s
• RTX 4090 - ~70 tok/s
• RX 7900 XTX - 45–60 tok/s
• RTX 5090 - 100–130 tok/s и до 4–4.5K tok/s prefill
Появился и форк StrataGP, где huge pages дали около +15% скорости на RTX 3060.
Заодно Strata получила 262K контекст, multi-GPU, vision, кеширование диалога и OpenAI/Anthropic API.
Пару недель назад Flash Next на 12 GB VRAM выглядела как эксперимент. Сейчас это уже вполне рабочая локальная MoE-модель с десятками, а на 5090 - сотней токенов в секунду. Но я еще не обновлялся, поэтому это пока отзывы других людей.
Вы уже обновились? Кидайте результаты в комменты!
MrGips • Про LLM / НАШ ЧАТ
Подрезал с реддита пост про новую обнову Strata, где еще больше ускорили движок.
Кто здесь новенький, то Strata - это движок для запуска чисто Qwen 3.8 Flash Next (огромной МоЕ модели) на потребительских ПК-шниках.
Он бьет рекорды не только в decode, но и в prompt processing.
Подъехали новые результаты.
На RTX 5070 12 GB:
• ~51 tok/s на IQ3_XXS
• до 1500 tok/s prompt processing
Для сравнения, тот же квант через llama.cpp у меня выдавал около 23 t/s на особом форке, который мне подсказал человек в комметариях. Без этого форка было 16 т/с на 5090.
А в комметах на реддите пользователи уже сообщают:
• RTX 3060 - ~60 tok/s
• RTX 4090 - ~70 tok/s
• RX 7900 XTX - 45–60 tok/s
• RTX 5090 - 100–130 tok/s и до 4–4.5K tok/s prefill
Появился и форк StrataGP, где huge pages дали около +15% скорости на RTX 3060.
Заодно Strata получила 262K контекст, multi-GPU, vision, кеширование диалога и OpenAI/Anthropic API.
Пару недель назад Flash Next на 12 GB VRAM выглядела как эксперимент. Сейчас это уже вполне рабочая локальная MoE-модель с десятками, а на 5090 - сотней токенов в секунду. Но я еще не обновлялся, поэтому это пока отзывы других людей.
Вы уже обновились? Кидайте результаты в комменты!
MrGips • Про LLM / НАШ ЧАТ
GitHub
GitHub - Niko1221/Strata: Qwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference…
Qwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input. - Niko1221/Strata
🔥25❤3
Strata v0.1.31 - большое обновление
Вышла новая версия Strata. Самое интересное:
• Unsloth UD-Q4_K_XL теперь можно запускать даже на ПК с 64 ГБ RAM, хотя сама модель занимает около 111 ГБ. Эксперты делятся на 3 уровня: самые используемые хранятся в VRAM, следующие - в RAM, редкие читаются прямо с SSD. На RTX 5070 12 ГБ + 64 ГБ RAM автор получил примерно 7-8.5 т/с.
• Появился
• Уважили также и АМДэшников. Для AMD RDNA4 decode ускорился до +15%. На Radeon AI PRO R9700 скорость выросла с 67 до 82 т/с.
• Для multi-GPU появился
• Новый экспериментальный
Multi-GPU теперь поддерживается и на нескольких AMD-картах.
Для обновления достаточно сделать
Остальные обновы можете почитать тут: https://github.com/Niko1221/Strata/releases/tag/v0.1.31
Испытали уже? Кидайте результаты в комменты!
MrGips • Про LLM / НАШ ЧАТ
Вышла новая версия Strata. Самое интересное:
• Unsloth UD-Q4_K_XL теперь можно запускать даже на ПК с 64 ГБ RAM, хотя сама модель занимает около 111 ГБ. Эксперты делятся на 3 уровня: самые используемые хранятся в VRAM, следующие - в RAM, редкие читаются прямо с SSD. На RTX 5070 12 ГБ + 64 ГБ RAM автор получил примерно 7-8.5 т/с.
• Появился
reasoning_budget_tokens — теперь можно жёстко ограничить количество токенов, которое модель тратит на thinking, после чего она переходит к ответу. Это прям мне нехватало.• Уважили также и АМДэшников. Для AMD RDNA4 decode ускорился до +15%. На Radeon AI PRO R9700 скорость выросла с 67 до 82 т/с.
• Для multi-GPU появился
"split_skip_if_fits": true — можно автоматически не делить модель, если первая карта и так вмещает все experts.• Новый экспериментальный
STRATA_GR_V3=1 даёт ещё примерно +2-4% decode.Multi-GPU теперь поддерживается и на нескольких AMD-картах.
Для обновления достаточно сделать
git pull и снова запустить START-HERE.bat. Setup сам установит engine 0.1.31.Остальные обновы можете почитать тут: https://github.com/Niko1221/Strata/releases/tag/v0.1.31
Испытали уже? Кидайте результаты в комменты!
MrGips • Про LLM / НАШ ЧАТ
GitHub
Release Strata v0.1.31 · Niko1221/Strata
Unsloth's Q4 model runs on a 64 GB PC (experimental), AMD decode up to 15% faster, models load twice as fast on Windows, and a batch of fixes.
Experimental: Unsloth UD-Q4_K_XL on a normal PC. S...
Experimental: Unsloth UD-Q4_K_XL on a normal PC. S...
👍19🔥11❤2⚡1🤡1