Лаборатория Лиса
80 subscribers
171 photos
6 videos
10 files
29 links
Ставлю эксперименты с Юнити C#
Download Telegram
Мне понравился Дали с его жидкими часами =D
👍3🤣3❤‍🔥2
Я уже давно рассматриваю Keycloak для своего маленького сервиса. Но все руки не доходили до просмотра более подробно что да как с ним там обстоят дела.

Для тех кто в танке, это REST приложение, которое разворачивается на сервере как СЕРВИС для авторизации, регистрации и аутентификации пользователей для чего угодно.

Но мало того, что сервис очень большой, я почитал недавние исправления ошибок и серьезных CVE что касается обхода авторизаций для изменений паролей и всякого такого прочего, например CVE-2026-18963 - БУКВАЛЬНО НОВАЯ УЯЗВИМОСТЬ, которая ну как бы немного даже глупая если честно.

Я решил все таки отказаться от этого монстра от которого можно ожидать что угодно.
Все таки я сервис буду выкатывать во внешний мир для того, что бы у моих пользователей была возможность управлять своими ресурсами и в случае чего восстановить доступ. Да и мне самому нужно это.

Я сочту правильным сделать свое решение. Кто бы что мне не говорил что то в духе "Не изобретай свою криптографию".
Все таки с крипто-примитивами я умею работать, а остальное это просто внимательность к деталям.
❤2❤‍🔥1🔥1🥰1👏1
Channel photo updated
Я только сейчас заметил одну прикольную странность, у меня моделька серверного шкафа буквально состоит из одних лишь коммутаторов без подключений куда либо 😁

Потом переделаю.
😁5❤‍🔥3
После большой волны блокировок и замедлений ВПН мой выжил. Пока живет.

Сейчас у меня каждый раз микроинсульт происходит когда мой ВПНчик лагат по тем или иным причинам (Чаще всего связаны лаги с клиентами socks5)

Лагает и платный ВПН (Не мой), он если и грузит то он замедлен как минимум.

Почему меня это тревожит? Потому что они сейчас банят вообще ВСЕ. Им пофигу что это и какой протокол (Им уже это как будто бы не важно абсолютно), им пофигу что хост может быть настоящий (Знакомый рассказывает что у него на работе айпишники отлетают корпоративные). Они банят все анонимное. Банят любой намек на socks5 прокси открытый или http или https прокси. Любой намек на VLESS Reality. Любая сетевая аномалия.

Я на германии ВПС неправильно настроил персистентность iptables и мне мою ВПС по айпи занесли в черный список по причине того что нашли открытый socks5. (Сейчас у меня стоит ansible для настройки и ошибок больше таких не будет)

Но сам факт что окно в европу умирает семимильными шагами.

Я не выживу без ВПНчика, даже просто пакеты для пайтона скачать уже без ВПН и прокси это сделать не представляется возможным.

Вот вот еще немного я начну пить успокоительные
🤔2
Ща на меня нашла мысль, она довольно очевидная, но пока ее не придумаешь, она не очевидная.

Ща попробую накатить докер образ pypiserver/pypiserver

Потом можно будет делать примерно что то такое:
pip install --index-url http://server:3141/root/pypi/+simple/ requests


Или через pip/pip.conf
[global]
index-url = http://server:3141/root/pypi/+simple/
trusted-host = server


Это что то типа docker registry, только для питоновских библиотек, но еще и сам умеет подтягивать нужные библиотеки откуда угодно.
Получится такое типа зеркало локальное.

Я пока еще не пробовал это делать, но вот как раз есть возможность. А то прокидывать прокси внутрь контейнеров тоже такая себе приколюха.
❤3
Ранее я недооценивал потенциал малых языковых моделей, полагая, что в умелых руках они способны демонстрировать впечатляющие результаты на русском языке с минимальным количеством ошибок генерации.

Мне довелось познакомиться с высококвалифицированным специалистом, обладающим глубокими знаниями в области нейронных сетей. Его экспертиза выходит за рамки простого ознакомления с существующими моделями и их разработчиками; он обладает детальной экспертизой, позволяющей глубоко анализировать внутреннее устройство и механизмы работы нейронных сетей. Даже показалось, что для этого человека LLM далеко не черный ящик, в отличие от моего восприятия

В связи с этим планирую приступить к изучению методов эффективного использования возможностей языковых моделей с учетом ограничений моего аппаратного обеспечения. Если ранее я был знаком с виртуозным применением моделей, методами манипуляции и построением пайплайнов, то информация, полученная за последние несколько дней, оказалась для меня совершенно новой и не подтвержденной ранее. Данный опыт стал источником значительного вдохновения.
❤‍🔥3👏2❤1
Может быть мне человек это сказал для успокоения, но тем не менее, он высказал свое мнение:
Рунет, несмотря на ограничения, более свободный, чем зарубежный. 


Как вы знаете у меня в последнее время паничка просто на фоне блокировок и ощущения дистанцирования от прогресса. Когда даже обычный pip install перестает работать без обхода ограничений не только с нашей НО и с их стороны (DOCKER).

Так же он добавил по поводу того, что рунет построен на пиратстве, незаконном обмене информации и торрентах. Все можно взять бесплатно, чем бы это нибыло. Когда как за бугром что бы пройти фейсконтроль нужно забашлять за вход.

И меня это мнение навело на интересную мыслю. Мы долго пользовались свободным интернетом, привыкли к свободе обмена информации игнорируя лицензионные соглашения (Если честно и сейчас это делаем, когда платим тому же ChatGPT игнорируя западные санции и ловим блокировки аккаунтов по причине нарушения соглашения по факту того, где мы родились, хотя звучит как бред из 60х годов, когда прессовали афроамериканцев)

Рано или поздно найдется какой нибудь-умный криптограф или инженер, который сможет сделать ВОИСТИНУ Децентрализованную сеть поверх централизованной. И это будет не какой то там ТОР с его луковицами, который лишь имитирует децентрализованность.

Мечтать не вредно...

Ну или ждем полномасштабного запуска IPv6
🤔3❤‍🔥1
Продолжаю эксперементировать с гнейронками, накатил относительно свежие модельки (До этого я юзал 2.5 только Квины, сейчас поставил 3.5 и обновил OLlama)

Просто зацените бенчмарки токенов в секунду. Это ашалеть можно. Прикольно. Тестил только скорость генерации, не качество!

Конфиг Докер контейнера:
vCPU: 15
Nvidia RTX3060 12GB
RAM: 40 GB


И вот результаты, они уивительны.
=== qwen3.5:4b ===
загрузка: 27.5 с, 100% на GPU
запуск 1: генерация 61.3 ток/с | промпт 851.3 ток/с | 256 токенов
запуск 2: генерация 60.8 ток/с | промпт 868.1 ток/с | 256 токенов
запуск 3: генерация 62.0 ток/с | промпт 860.3 ток/с | 256 токенов

=== qwen3.5:9b ===
загрузка: 43.3 с, 100% на GPU
запуск 1: генерация 41.9 ток/с | промпт 648.5 ток/с | 256 токенов
запуск 2: генерация 41.9 ток/с | промпт 673.1 ток/с | 256 токенов
запуск 3: генерация 42.0 ток/с | промпт 672.3 ток/с | 256 токенов

=== qwen3.5:27b ===
^[[A загрузка: 115.4 с, 59% на GPU
запуск 1: генерация 2.5 ток/с | промпт 32.1 ток/с | 256 токенов
запуск 2: генерация 2.7 ток/с | промпт 29.9 ток/с | 256 токенов
запуск 3: генерация 2.7 ток/с | промпт 30.4 ток/с | 256 токенов

=== qwen3.5:35b ===
загрузка: 176.6 с, 48% на GPU
запуск 1: генерация 18.7 ток/с | промпт 15.6 ток/с | 256 токенов
запуск 2: генерация 21.4 ток/с | промпт 55.0 ток/с | 256 токенов
запуск 3: генерация 21.2 ток/с | промпт 58.5 ток/с | 256 токенов

=== qwen3.6:35b-a3b ===
загрузка: 146.3 с, 45% на GPU
запуск 1: генерация 21.1 ток/с | промпт 25.9 ток/с | 256 токенов
запуск 2: генерация 20.8 ток/с | промпт 58.9 ток/с | 256 токенов
запуск 3: генерация 24.3 ток/с | промпт 58.5 ток/с | 256 токенов

модель генерация промпт загрузка GPU итог
----------------------------------------------------------------------------------
qwen3.5:4b 61.4 т/с 860 т/с 27.5 с 100% на GPU юзабельно
qwen3.5:9b 41.9 т/с 665 т/с 43.3 с 100% на GPU юзабельно
qwen3.5:27b 2.7 т/с 31 т/с 115.4 с 59% на GPU медленно
qwen3.5:35b 20.4 т/с 43 т/с 176.6 с 48% на GPU юзабельно
qwen3.6:35b-a3b 22.1 т/с 48 т/с 146.3 с 45% на GPU юзабельно


Да, я понимаю что Qwen 3.5 35B это MoE, а 27b это полноразмерная, но все равено прикольно.

Эксперементы продолжаются. Сейчас накачу еще квантованных моделей.
🔥2
Ну в общем
=== qwen3.8:27b ===
загрузка: 116.0 с, 52% на GPU
запуск 1: генерация 3.4 ток/с | промпт 26.3 ток/с | 256 токенов
запуск 2: генерация 3.1 ток/с | промпт 26.5 ток/с | 256 токенов
запуск 3: генерация 3.2 ток/с | промпт 24.4 ток/с | 256 токенов

=== qwen3.5:9b-q8_0 ===
загрузка: 64.9 с, 100% на GPU
запуск 1: генерация 30.8 ток/с | промпт 658.1 ток/с | 256 токенов
запуск 2: генерация 30.4 ток/с | промпт 665.0 ток/с | 256 токенов
запуск 3: генерация 30.6 ток/с | промпт 663.5 ток/с | 256 токенов

=== hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_XL ===
загрузка: 118.5 с, 57% на GPU
запуск 1: генерация 2.5 ток/с | промпт 2.4 ток/с | 256 токенов
запуск 2: генерация 2.5 ток/с | промпт 30.7 ток/с | 256 токенов
запуск 3: генерация 2.5 ток/с | промпт 30.1 ток/с | 256 токенов

=== hf.co/Abiray/Qwen3.6-35B-A3B-Q4_K_M-GGUF:Q4_K_M ===
загрузка: 148.4 с, 48% на GPU
запуск 1: генерация 20.3 ток/с | промпт 23.9 ток/с | 256 токенов
запуск 2: генерация 22.7 ток/с | промпт 63.9 ток/с | 256 токенов
запуск 3: генерация 22.7 ток/с | промпт 58.2 ток/с | 256 токенов

модель генерация промпт загрузка GPU итог
----------------------------------------------------------------------------------
qwen3.8:27b 3.2 т/с 26 т/с 116.0 с 52% на GPU медленно
qwen3.5:9b-q8_0 30.6 т/с 662 т/с 64.9 с 100% на GPU юзабельно
hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_XL 2.5 т/с 21 т/с 118.5 с 57% на GPU медленно
hf.co/Abiray/Qwen3.6-35B-A3B-Q4_K_M-GGUF:Q4_K_M 21.9 т/с 49 т/с 148.4 с 48% на GPU юзабельно

Выводы мщ этого можно сделать только после того, как проверю качество. Но скорость тут почти не отличима.

Я еще накачу разных квантований для 9b и можно будет закончить на этом на сегодня
Последние результаты
ГЕНЕРАЦИЯ, ток/с
модель 2k 8k 16k 32k 64k 128k
--------------------------------------------------------------------------------
Qwen3.5-9B:UD-Q2_K_XL 55.9 54.1 51.7 48.0 41.7 33.0
Qwen3.5-9B:UD-Q3_K_XL 48.6 47.8 45.9 42.4 37.4 30.2
qwen3.5:9b 38.1 42.6 40.8 39.7 35.2 28.7
Qwen3.5-9B:UD-Q4_K_XL 50.5 49.2 46.8 43.7 38.4 30.8
Qwen3.5-9B:Q5_K_M 44.5 46.2 44.5 41.5 36.7 22.9
Qwen3.5-9B:Q6_K 41.0 40.3 38.9 36.3 32.6 3.2
qwen3.5:9b-q8_0 30.9 30.4 29.8 28.8 13.8 1.6
qwen3.5:9b-bf16 2.1 2.9 1.7 1.1 1.2 0.6

ЧТЕНИЕ ПРОМПТА, ток/с
модель 2k 8k 16k 32k 64k 128k
--------------------------------------------------------------------------------
Qwen3.5-9B:UD-Q2_K_XL 1378 1461 1422 1350 1200 995
Qwen3.5-9B:UD-Q3_K_XL 1450 1628 1601 1494 1331 1086
qwen3.5:9b 1577 1688 1648 1526 1353 1100
Qwen3.5-9B:UD-Q4_K_XL 1486 1669 1643 1529 1359 1104
Qwen3.5-9B:Q5_K_M 1533 1614 1598 1481 1319 977
Qwen3.5-9B:Q6_K 1391 1558 1507 1423 1272 663
qwen3.5:9b-q8_0 1661 1749 1701 1602 962 440
qwen3.5:9b-bf16 401 497 436 383 402 309

ОЖИДАНИЕ ДО НАЧАЛА ОТВЕТА, с
модель 2k 8k 16k 32k 64k 128k
--------------------------------------------------------------------------------
Qwen3.5-9B:UD-Q2_K_XL 1.3 5.4 11.3 24.1 54.3 131.4
Qwen3.5-9B:UD-Q3_K_XL 1.3 4.9 10.1 21.7 49.0 120.4
qwen3.5:9b 1.2 4.7 9.8 21.3 48.2 118.9
Qwen3.5-9B:UD-Q4_K_XL 1.2 4.8 9.8 21.2 48.0 118.4
Qwen3.5-9B:Q5_K_M 1.2 4.9 10.1 21.9 49.5 133.9
Qwen3.5-9B:Q6_K 1.3 5.1 10.7 22.8 51.3 197.2
qwen3.5:9b-q8_0 1.1 4.5 9.5 20.3 67.8 296.9
qwen3.5:9b-bf16 4.6 16.0 36.9 84.8 162.1 422.9

ДОЛЯ МОДЕЛИ НА GPU, %
модель 2k 8k 16k 32k 64k 128k
--------------------------------------------------------------------------------
Qwen3.5-9B:UD-Q2_K_XL 100 100 100 100 100 100
Qwen3.5-9B:UD-Q3_K_XL 100 100 100 100 100 100
qwen3.5:9b 100 100 100 100 100 100
Qwen3.5-9B:UD-Q4_K_XL 100 100 100 100 100 100
Qwen3.5-9B:Q5_K_M 100 100 100 100 100 91
Qwen3.5-9B:Q6_K 100 100 100 100 100 81
qwen3.5:9b-q8_0 100 100 100 100 84 68
qwen3.5:9b-bf16 56 56 54 51 49 42


Выводы тут очевидные и говорят сами за себя.

Все равно очень круто, учитывая что я теперь знаю, что с 9b моделями можно делать интересные вещи.

В основном весь упор уходит в количество памяти у GPU, потому я сплю и вижу у себя что нибудь интересное на серваке.
report-heavy.html
4.7 MB
Я тут накатил еще моделей, самая большая которая мне понравилась по уму и качеству и по скорости, это gpt-oss-20b, это экспертная модель, MoE. Она на первый взгляд далеко не дура и на 3060 спокойно обрабатывается очень даже комфортно.

Я наверное уже задушил вас всех своими метриками. Похоже это очень мало кому интересно.

Но я тут сейчас тестирую нагрузку этой модели на одной карте 3060 и опубликую html файлик, представляющий собой отчет из k6

Кому будет интересно, там отчет нагрузка НА ОДНУ видеокарту 3060 с симуляцией в 600 одновременных пользователей. (Понарастающая нагрузка)

В отчете ошибка, модель GTP-OSS-20B, а не qwen 3.5 0.8b

Ну и да, она захлебнулась =)
❤1
report-oss-steps.html
4.7 MB
Вот более щедящий режим, тут хотя бы уже видно на каком моменте уже моделька начинает...

Я думаю с моей карточки хватит =)

Она хорошо поработала. Все равно прикольно посмотреть что да как.

Мне нравится этот результат, потом посмотрим как эта же модель будет работать с "Размазыванием" нагрузки через кое какой сервис.