Gaperton's Tech Corner
Первый пошел. Copilot все. Как только компании уберут субсидированные подписки, а они их уберут — все выяснят, что люди прекрасно жили без генераторов слопа, и дальше проживут. Day one of GitHub Copilot token-based billing and the customers LOVE IT! They're…
Кто бы мог подумать :) Вой на болотах стоит адовый.
Пора снова тесты прогнать локальной модели, и потестировать vLLM.
Пора снова тесты прогнать локальной модели, и потестировать vLLM.
😁3❤1
Антропик написал статью о том, что они вайбкодят свои модели. И поэтому, стоят триллион.
https://www.reddit.com/r/unsloth/comments/1txpacy/google_releases_new_gemma_4_qat_models/
Хорошая новость для тех у кого мало VRAM, и кто хочет пускать локально модели.
Хорошая новость для тех у кого мало VRAM, и кто хочет пускать локально модели.
🔥6
Gaperton's Tech Corner
Просто чтоб вы знали, какой кусок говна Грок. А я пошел ставить гемму 31 qat.
Gemma 4 31B QAT
https://huggingface.co/unsloth/gemma-4-31B-it-qat-GGUF
Похоже, это становится моей основной локальной моделью.
Сравниваю с обычной Q5_K_XL на моей AMD R9700 с 32 GB VRAM.
Результат:
- скорость: 30 токенов/с против 25 токенов/с
То есть примерно на 20% быстрее. И быстрее, чем Qwen-27B, который у меня дает около 27 токенов/с.
- качество: на уровне Q8
То есть почти без заметной потери точности, несмотря на гораздо меньший размер.
- размер: примерно как Q4
А это критично для локального запуска, потому что при ограниченной VRAM размер модели напрямую конкурирует с размером контекста.
Главный смысл QAT здесь не просто в том, что модель «меньше». Обычная пост-тренировочная квантизация берет уже обученную модель и сжимает веса, неизбежно теряя часть качества. QAT — quantization-aware training — делает модель устойчивой к квантизации еще во время обучения или дообучения. Поэтому она ведет себя ближе к более тяжелой квантизации вроде Q8, но занимает место ближе к Q4.
Для 32 GB VRAM это меняет практический баланс. Раньше выбор был неприятный: либо брать более точную модель, но жертвовать контекстом и скоростью; либо брать более легкую квантизацию, но мириться с падением качества. Здесь компромисс выглядит намного лучше: скорость выше, качество почти не проседает, а освобожденная память уходит в больший контекст.
И это еще для Gemma не сделали поддержки MTP, которая разгоняет Qwen-27B с 27 т.с до 40-45 на моем R9700. И так как Gemma тратит примерно втрое меньше thinking tokens на прохождение тех же тестов что Qwen, на практике она быстрее и без MTP.
В общем, Google с Gemma впереди планеты всей, а 32GB VRAM should be enough for everyone. Qwen тоже молодцы, а конкуренция это хорошо.
https://huggingface.co/unsloth/gemma-4-31B-it-qat-GGUF
Похоже, это становится моей основной локальной моделью.
Сравниваю с обычной Q5_K_XL на моей AMD R9700 с 32 GB VRAM.
Результат:
- скорость: 30 токенов/с против 25 токенов/с
То есть примерно на 20% быстрее. И быстрее, чем Qwen-27B, который у меня дает около 27 токенов/с.
- качество: на уровне Q8
То есть почти без заметной потери точности, несмотря на гораздо меньший размер.
- размер: примерно как Q4
А это критично для локального запуска, потому что при ограниченной VRAM размер модели напрямую конкурирует с размером контекста.
Near-Lossless Quality: The Gemma 4 31B QAT model is trained from day one to "practice" being smaller. This means that the 4-bit Unsloth Dynamic version retains virtually 100% of the intelligence, reasoning, and accuracy of the massive uncompressed bfloat16 master model.
Главный смысл QAT здесь не просто в том, что модель «меньше». Обычная пост-тренировочная квантизация берет уже обученную модель и сжимает веса, неизбежно теряя часть качества. QAT — quantization-aware training — делает модель устойчивой к квантизации еще во время обучения или дообучения. Поэтому она ведет себя ближе к более тяжелой квантизации вроде Q8, но занимает место ближе к Q4.
Для 32 GB VRAM это меняет практический баланс. Раньше выбор был неприятный: либо брать более точную модель, но жертвовать контекстом и скоростью; либо брать более легкую квантизацию, но мириться с падением качества. Здесь компромисс выглядит намного лучше: скорость выше, качество почти не проседает, а освобожденная память уходит в больший контекст.
И это еще для Gemma не сделали поддержки MTP, которая разгоняет Qwen-27B с 27 т.с до 40-45 на моем R9700. И так как Gemma тратит примерно втрое меньше thinking tokens на прохождение тех же тестов что Qwen, на практике она быстрее и без MTP.
В общем, Google с Gemma впереди планеты всей, а 32GB VRAM should be enough for everyone. Qwen тоже молодцы, а конкуренция это хорошо.
huggingface.co
unsloth/gemma-4-31B-it-qat-GGUF · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
❤5👍2
Gaperton's Tech Corner
Gemma 4 31B QAT https://huggingface.co/unsloth/gemma-4-31B-it-qat-GGUF Похоже, это становится моей основной локальной моделью. Сравниваю с обычной Q5_K_XL на моей AMD R9700 с 32 GB VRAM. Результат: - скорость: 30 токенов/с против 25 токенов/с То…
Из-за меньшей ошибки квантизации, модель QAT заметно лучше в кодировании, потому что ошибка в длинном контексте накапливается не так быстро.
Gemma и без этого была сильно лучше в кодировании чем Qwen. А теперь так вообще.
Gemma и без этого была сильно лучше в кодировании чем Qwen. А теперь так вообще.