>_< modelhost
191 subscribers
7 photos
1 video
5 links
local inference community.
by @borkiss_notes
Download Telegram
Channel created
Please open Telegram to view this post
VIEW IN TELEGRAM
Channel name was changed to «>_< modelhost»
топ 3 тула, для старта и ознакомления

https://huggingface.co/ - самый большой хаб, где хранят все доступные открытые модели и их веса, которые можно просто скачать

https://github.com/ - уже нам привычный гитхаб, огромная куча софта вокруг локального ии (и не только)

https://local.ai/ - сайт моего знакомого 0xSero который просто помешан на локальных моделях, методах их сжатия и так далее, на этом сайте легко можно глянуть как модели ведут себя на определенном железе, и что там вообще можно запустить, пока пара карт/боксов, но уже полезно
9
облачный инференс
прежде чем покупать железо, сначала стоит поиграться с локал моделями на оренде

https://www.runpod.io/ - фронтир провайдер облачных гпу, удобный, надежный, цена адектваная (средняя) по духу ближе к AWS

https://vast.ai/ - это по духу ближе к маркетплейсу, индивиды или некие овнеры серверов выкладывают свое железо в аренду, вы покупаете прайс плавает - можно ловить очень выгодные цены, но больше возни с конектом

https://modal.com/ - интересный кандидат, потому-что он вам дает не просто видяху и вы платите за час использования, а дает вам серверлесс апи, и видяха просыпаеться чтобы обработать запрос, в некоторых кейсах оно выгодно, но основной интерес тут в том что их бесплатный план, дает нам $30 / month бесплатно, каждый месяц на их сервис. для халявных тестов топ

https://www.digitalocean.com/products/gpu-droplets - легендарный дигитал оушн, теперь хостит и видяхи, надежность на высоте (прайс тоже), тут интересно забрать 200 доларов фри кредитов на 60 дней поиграться, но чтобы получить возможность тратить их на Gpu Droplets -> нужно заполнить акету, написать что вы молодая ллм/мл лабаратория, сделать себе лендосик и почты на домен

https://www.kaggle.com/ - богом забытая платформа гугла, дают старое железо гпу, и свое новое тпу бесплатно, каждый месяц - еквивалентом в доларов 300

дальше поговорим про именно домашнее топ железо, там правда история довольно печальная
❤‍🔥6
Please open Telegram to view this post
VIEW IN TELEGRAM
🌚4🤗3
Please open Telegram to view this post
VIEW IN TELEGRAM
8
>_< modelhost
Media is too big
VIEW IN TELEGRAM
примерно такой экспириенс мы получаем на железе за 1500$, это уже юзабельно для большинства задач

можно и дешевле RTX 2080TI 22gb за 500$ способна предоставить похожий перформенс, но это не все - люди кастомят её под свое железо выжимая скорость от 200 до 1000 ток/с при параллельности в 16 агентов ( 1000/16=62,5 на одного), на 8 видяхах. что уже даже очень юзабельно для какой-то команды

💀
7👀3
Please open Telegram to view this post
VIEW IN TELEGRAM
💔106👍1🔥1
>_< modelhost
такой лонг лонг рид, вышел с математикой облачных гпу против локальных
🤓
Please open Telegram to view this post
VIEW IN TELEGRAM
11
>_< modelhost
https://gputable.dev/ агрегатор цен на гпу, 35+ провайдеров можно ловить очень сладкие цны
например RTX 6000 PRO за 74 цента, вместо 2 баксов, ондеманд (что значит вас не может выбить), или спот с которого вас может выкинуть, но это чертовски дешево
👍2
или H200 у которой средний прайс по рынку - $4.59/ч, можно взять за $1.00 /ч (но вас может выбить), или за $2.63/ч но выбить вас не сможет, потому-что он деманд
👍3👀1
This media is not supported in your browser
VIEW IN TELEGRAM
qwen3.8 27b + A100, выдает 70ток/с
это стремно 🤓
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6
>_< modelhost
qwen3.8 27b + A100, выдает 70ток/с это стремно 🤓
он кстати запускается и на 3090, 4090, 5090, но тут вопрос в том сколько контекстного окна и скорости вы можете себе позволить, на 3090 и 4090 это около 4000 токенов чего маловато, вот на 5090 уже ближе к 100к, на А100 - полные 262к + запас чтобы она работала быстро

само по себе удивительно что модель этого класа на столько доступная
1
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
https://unsloth.ai/docs/models/qwen3.8-next

фрики из Unsloth, научились вжимать модель на 180млрд параметров в 4090 (24гб врам), хотя сама можель в оригинале весит порядка 160гигов

👀👀
Please open Telegram to view this post
VIEW IN TELEGRAM
🤝3