Gaperton's Tech Corner
372 subscribers
661 photos
47 videos
1 file
450 links
Технология, жизнь, и немного классической философии

https://gaperton.substack.com
Download Telegram
В общем, животные вполне себе говорят друг с другом.
❤2👍2
Антропик написал статью о том, что они вайбкодят свои модели. И поэтому, стоят триллион.
Пузырь это в сущности кризис перепроизводства.

С кризисом доткомов так же было.
😁2
https://www.reddit.com/r/unsloth/comments/1txpacy/google_releases_new_gemma_4_qat_models/

Хорошая новость для тех у кого мало VRAM, и кто хочет пускать локально модели.
🔥6
Bubble News
Вы че, бляди, совсем охуели?
Просто чтоб вы знали, какой кусок говна Грок.

А я пошел ставить гемму 31 qat.
Gaperton's Tech Corner
Просто чтоб вы знали, какой кусок говна Грок. А я пошел ставить гемму 31 qat.
Gemma 4 31B QAT
https://huggingface.co/unsloth/gemma-4-31B-it-qat-GGUF

Похоже, это становится моей основной локальной моделью.

Сравниваю с обычной Q5_K_XL на моей AMD R9700 с 32 GB VRAM.

Результат:

- скорость: 30 токенов/с против 25 токенов/с
То есть примерно на 20% быстрее. И быстрее, чем Qwen-27B, который у меня дает около 27 токенов/с.

- качество: на уровне Q8
То есть почти без заметной потери точности, несмотря на гораздо меньший размер.

- размер: примерно как Q4
А это критично для локального запуска, потому что при ограниченной VRAM размер модели напрямую конкурирует с размером контекста.

Near-Lossless Quality: The Gemma 4 31B QAT model is trained from day one to "practice" being smaller. This means that the 4-bit Unsloth Dynamic version retains virtually 100% of the intelligence, reasoning, and accuracy of the massive uncompressed bfloat16 master model.


Главный смысл QAT здесь не просто в том, что модель «меньше». Обычная пост-тренировочная квантизация берет уже обученную модель и сжимает веса, неизбежно теряя часть качества. QAT — quantization-aware training — делает модель устойчивой к квантизации еще во время обучения или дообучения. Поэтому она ведет себя ближе к более тяжелой квантизации вроде Q8, но занимает место ближе к Q4.

Для 32 GB VRAM это меняет практический баланс. Раньше выбор был неприятный: либо брать более точную модель, но жертвовать контекстом и скоростью; либо брать более легкую квантизацию, но мириться с падением качества. Здесь компромисс выглядит намного лучше: скорость выше, качество почти не проседает, а освобожденная память уходит в больший контекст.

И это еще для Gemma не сделали поддержки MTP, которая разгоняет Qwen-27B с 27 т.с до 40-45 на моем R9700. И так как Gemma тратит примерно втрое меньше thinking tokens на прохождение тех же тестов что Qwen, на практике она быстрее и без MTP.

В общем, Google с Gemma впереди планеты всей, а 32GB VRAM should be enough for everyone. Qwen тоже молодцы, а конкуренция это хорошо.
❤5👍2
А в Apple умные продакты, все-таки.
😁9
Gaperton's Tech Corner
Gemma 4 31B QAT https://huggingface.co/unsloth/gemma-4-31B-it-qat-GGUF Похоже, это становится моей основной локальной моделью. Сравниваю с обычной Q5_K_XL на моей AMD R9700 с 32 GB VRAM. Результат: - скорость: 30 токенов/с против 25 токенов/с То…
Из-за меньшей ошибки квантизации, модель QAT заметно лучше в кодировании, потому что ошибка в длинном контексте накапливается не так быстро.

Gemma и без этого была сильно лучше в кодировании чем Qwen. А теперь так вообще.
Понеслась. Быть религиозным вообще несет сплошные плюсы.
🥰1🤣1
Все облачные модели стали глупее. Грок до полной бесполезности. Гемини — почти полная, плюс там полно ошибок в самом веб-UI из-за которых пользоваться им почти неозможно.

Адекватны Qwen и ChatGPT.
Это комментарий об OpenAI и желании Трампа купить 50% долю за счет средств налогоплательщиков.

Человек, я думаю, это как жидкость в сосуде. Она мгновенно принимает форму того, во что ее налили. Роль сосуда играют внешние обстоятельства. Иногда так бывает что когда они меняются, вместе с ними стремительно меняется и человек.

Ну, это конечно так, если у человека нет никаких принципов.
Gaperton's Tech Corner
И это еще для Gemma не сделали поддержки MTP
Ну вот, для Gemma сделали MTP. Пробуем? Если сработает, Qwen станет не нужен.

Итак, Gemma 4 31B QAT + MTP, на AMD R9700 32GB VRAM.

Проверю с llama.cpp, на одном и на двух GPU, с Vulkan и ROCm.

UPD: замедляет обработку в 2 раза :). Ну ничего, подождем.