топ 3 тула, для старта и ознакомления
https://huggingface.co/ - самый большой хаб, где хранят все доступные открытые модели и их веса, которые можно просто скачать
https://github.com/ - уже нам привычный гитхаб, огромная куча софта вокруг локального ии (и не только)
https://local.ai/ - сайт моего знакомого 0xSero который просто помешан на локальных моделях, методах их сжатия и так далее, на этом сайте легко можно глянуть как модели ведут себя на определенном железе, и что там вообще можно запустить, пока пара карт/боксов, но уже полезно
https://huggingface.co/ - самый большой хаб, где хранят все доступные открытые модели и их веса, которые можно просто скачать
https://github.com/ - уже нам привычный гитхаб, огромная куча софта вокруг локального ии (и не только)
https://local.ai/ - сайт моего знакомого 0xSero который просто помешан на локальных моделях, методах их сжатия и так далее, на этом сайте легко можно глянуть как модели ведут себя на определенном железе, и что там вообще можно запустить, пока пара карт/боксов, но уже полезно
❤9
облачный инференс
прежде чем покупать железо, сначала стоит поиграться с локал моделями на оренде
https://www.runpod.io/ - фронтир провайдер облачных гпу, удобный, надежный, цена адектваная (средняя) по духу ближе к AWS
https://vast.ai/ - это по духу ближе к маркетплейсу, индивиды или некие овнеры серверов выкладывают свое железо в аренду, вы покупаете прайс плавает - можно ловить очень выгодные цены, но больше возни с конектом
https://modal.com/ - интересный кандидат, потому-что он вам дает не просто видяху и вы платите за час использования, а дает вам серверлесс апи, и видяха просыпаеться чтобы обработать запрос, в некоторых кейсах оно выгодно, но основной интерес тут в том что их бесплатный план, дает нам $30 / month бесплатно, каждый месяц на их сервис. для халявных тестов топ
https://www.digitalocean.com/products/gpu-droplets - легендарный дигитал оушн, теперь хостит и видяхи, надежность на высоте (прайс тоже), тут интересно забрать 200 доларов фри кредитов на 60 дней поиграться, но чтобы получить возможность тратить их на Gpu Droplets -> нужно заполнить акету, написать что вы молодая ллм/мл лабаратория, сделать себе лендосик и почты на домен
https://www.kaggle.com/ - богом забытая платформа гугла, дают старое железо гпу, и свое новое тпу бесплатно, каждый месяц - еквивалентом в доларов 300
дальше поговорим про именно домашнее топ железо, там правда история довольно печальная
прежде чем покупать железо, сначала стоит поиграться с локал моделями на оренде
https://www.runpod.io/ - фронтир провайдер облачных гпу, удобный, надежный, цена адектваная (средняя) по духу ближе к AWS
https://vast.ai/ - это по духу ближе к маркетплейсу, индивиды или некие овнеры серверов выкладывают свое железо в аренду, вы покупаете прайс плавает - можно ловить очень выгодные цены, но больше возни с конектом
https://modal.com/ - интересный кандидат, потому-что он вам дает не просто видяху и вы платите за час использования, а дает вам серверлесс апи, и видяха просыпаеться чтобы обработать запрос, в некоторых кейсах оно выгодно, но основной интерес тут в том что их бесплатный план, дает нам $30 / month бесплатно, каждый месяц на их сервис. для халявных тестов топ
https://www.digitalocean.com/products/gpu-droplets - легендарный дигитал оушн, теперь хостит и видяхи, надежность на высоте (прайс тоже), тут интересно забрать 200 доларов фри кредитов на 60 дней поиграться, но чтобы получить возможность тратить их на Gpu Droplets -> нужно заполнить акету, написать что вы молодая ллм/мл лабаратория, сделать себе лендосик и почты на домен
https://www.kaggle.com/ - богом забытая платформа гугла, дают старое железо гпу, и свое новое тпу бесплатно, каждый месяц - еквивалентом в доларов 300
дальше поговорим про именно домашнее топ железо, там правда история довольно печальная
❤🔥6
>_< modelhost
Media is too big
VIEW IN TELEGRAM
примерно такой экспириенс мы получаем на железе за 1500$, это уже юзабельно для большинства задач
можно и дешевле RTX 2080TI 22gb за 500$ способна предоставить похожий перформенс, но это не все - люди кастомят её под свое железо выжимая скорость от 200 до 1000 ток/с при параллельности в 16 агентов ( 1000/16=62,5 на одного), на 8 видяхах. что уже даже очень юзабельно для какой-то команды
💀
можно и дешевле RTX 2080TI 22gb за 500$ способна предоставить похожий перформенс, но это не все - люди кастомят её под свое железо выжимая скорость от 200 до 1000 ток/с при параллельности в 16 агентов ( 1000/16=62,5 на одного), на 8 видяхах. что уже даже очень юзабельно для какой-то команды
💀
❤7👀3
>_< modelhost
такой лонг лонг рид, вышел с математикой облачных гпу против локальных
🤓
Please open Telegram to view this post
VIEW IN TELEGRAM
❤11
>_< modelhost
такой лонг лонг рид, вышел с математикой облачных гпу против локальных 🤓
https://gputable.dev/ агрегатор цен на гпу, 35+ провайдеров
можно ловить очень сладкие цны
можно ловить очень сладкие цны
GPUTable
GPUTable — Live Cloud GPU Prices
Live per-GPU hourly rental prices across 35+ cloud providers, refreshed every 5 minutes.
>_< modelhost
https://gputable.dev/ агрегатор цен на гпу, 35+ провайдеров можно ловить очень сладкие цны
например RTX 6000 PRO за 74 цента, вместо 2 баксов, ондеманд (что значит вас не может выбить), или спот с которого вас может выкинуть, но это чертовски дешево
👍2
если хорошо хантить такие скидки, экономика тут ломается ой как сильно в сторону оренды
Telegram
>_< modelhost
LOCAL GPU vs CLOUD: когда своё железо вообще окупается?
Я решил посчитать не «какая GPU быстрее», а более полезную вещь:
когда покупка локального железа экономически начинает выигрывать у RunPod / Vast.
И отдельно — что имеет смысл для больших локальных…
Я решил посчитать не «какая GPU быстрее», а более полезную вещь:
когда покупка локального железа экономически начинает выигрывать у RunPod / Vast.
И отдельно — что имеет смысл для больших локальных…
👍2
This media is not supported in your browser
VIEW IN TELEGRAM
qwen3.8 27b + A100, выдает 70ток/с
это стремно🤓
это стремно
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6
>_< modelhost
qwen3.8 27b + A100, выдает 70ток/с это стремно 🤓
он кстати запускается и на 3090, 4090, 5090, но тут вопрос в том сколько контекстного окна и скорости вы можете себе позволить, на 3090 и 4090 это около 4000 токенов чего маловато, вот на 5090 уже ближе к 100к, на А100 - полные 262к + запас чтобы она работала быстро
само по себе удивительно что модель этого класа на столько доступная
само по себе удивительно что модель этого класа на столько доступная
❤1
https://unsloth.ai/docs/models/qwen3.8-next
фрики из Unsloth, научились вжимать модель на 180млрд параметров в 4090 (24гб врам), хотя сама можель в оригинале весит порядка 160гигов
👀 👀
фрики из Unsloth, научились вжимать модель на 180млрд параметров в 4090 (24гб врам), хотя сама можель в оригинале весит порядка 160гигов
Please open Telegram to view this post
VIEW IN TELEGRAM
unsloth.ai
Qwen3.8-Flash-Next: How to Run Locally | Unsloth Documentation
Guide to run Qwen3.8-Flash-Next locally.
🤝3