Первый пошел. Copilot все.
Как только компании уберут субсидированные подписки, а они их уберут — все выяснят, что люди прекрасно жили без генераторов слопа, и дальше проживут.
https://x.com/edzitron/status/2061453137500643384?s=46&t=PZ5puMvz2CBmpcjPAn_ihA
Как только компании уберут субсидированные подписки, а они их уберут — все выяснят, что люди прекрасно жили без генераторов слопа, и дальше проживут.
Day one of GitHub Copilot token-based billing and the customers LOVE IT! They're all celebrating the power and value of generative AI!
https://x.com/edzitron/status/2061453137500643384?s=46&t=PZ5puMvz2CBmpcjPAn_ihA
Gaperton's Tech Corner
Первый пошел. Copilot все. Как только компании уберут субсидированные подписки, а они их уберут — все выяснят, что люди прекрасно жили без генераторов слопа, и дальше проживут. Day one of GitHub Copilot token-based billing and the customers LOVE IT! They're…
Интересно все-таки, как все дружно закапывают деньги туда, откуда в принципе не может ничего вырасти.
Вся история держится на ненависти долбоебов СЕО к собственным сотрудникам и навязчивом желании избавиться от них, чтобы поправить цифры в отчете получив свой сраный бонус.
Вся история держится на ненависти долбоебов СЕО к собственным сотрудникам и навязчивом желании избавиться от них, чтобы поправить цифры в отчете получив свой сраный бонус.
💯9🔥2
Gaperton's Tech Corner
О, нарративчик меняться начал потихоньку. Пресса начинает готовиться сохранить лицо, чтобы когда все взорвется опять делать вид что это вовсе не они надували пузырь публикуя заведомый абсурд.
Началось массовое переобувание прессы. Все поняли что пузырь на пике. Пора делать разворот.
Gaperton's Tech Corner
Первый пошел. Copilot все. Как только компании уберут субсидированные подписки, а они их уберут — все выяснят, что люди прекрасно жили без генераторов слопа, и дальше проживут. Day one of GitHub Copilot token-based billing and the customers LOVE IT! They're…
Кто бы мог подумать :) Вой на болотах стоит адовый.
Пора снова тесты прогнать локальной модели, и потестировать vLLM.
Пора снова тесты прогнать локальной модели, и потестировать vLLM.
😁3❤1
Антропик написал статью о том, что они вайбкодят свои модели. И поэтому, стоят триллион.
https://www.reddit.com/r/unsloth/comments/1txpacy/google_releases_new_gemma_4_qat_models/
Хорошая новость для тех у кого мало VRAM, и кто хочет пускать локально модели.
Хорошая новость для тех у кого мало VRAM, и кто хочет пускать локально модели.
🔥6
Gaperton's Tech Corner
Просто чтоб вы знали, какой кусок говна Грок. А я пошел ставить гемму 31 qat.
Gemma 4 31B QAT
https://huggingface.co/unsloth/gemma-4-31B-it-qat-GGUF
Похоже, это становится моей основной локальной моделью.
Сравниваю с обычной Q5_K_XL на моей AMD R9700 с 32 GB VRAM.
Результат:
- скорость: 30 токенов/с против 25 токенов/с
То есть примерно на 20% быстрее. И быстрее, чем Qwen-27B, который у меня дает около 27 токенов/с.
- качество: на уровне Q8
То есть почти без заметной потери точности, несмотря на гораздо меньший размер.
- размер: примерно как Q4
А это критично для локального запуска, потому что при ограниченной VRAM размер модели напрямую конкурирует с размером контекста.
Главный смысл QAT здесь не просто в том, что модель «меньше». Обычная пост-тренировочная квантизация берет уже обученную модель и сжимает веса, неизбежно теряя часть качества. QAT — quantization-aware training — делает модель устойчивой к квантизации еще во время обучения или дообучения. Поэтому она ведет себя ближе к более тяжелой квантизации вроде Q8, но занимает место ближе к Q4.
Для 32 GB VRAM это меняет практический баланс. Раньше выбор был неприятный: либо брать более точную модель, но жертвовать контекстом и скоростью; либо брать более легкую квантизацию, но мириться с падением качества. Здесь компромисс выглядит намного лучше: скорость выше, качество почти не проседает, а освобожденная память уходит в больший контекст.
И это еще для Gemma не сделали поддержки MTP, которая разгоняет Qwen-27B с 27 т.с до 40-45 на моем R9700. И так как Gemma тратит примерно втрое меньше thinking tokens на прохождение тех же тестов что Qwen, на практике она быстрее и без MTP.
В общем, Google с Gemma впереди планеты всей, а 32GB VRAM should be enough for everyone. Qwen тоже молодцы, а конкуренция это хорошо.
https://huggingface.co/unsloth/gemma-4-31B-it-qat-GGUF
Похоже, это становится моей основной локальной моделью.
Сравниваю с обычной Q5_K_XL на моей AMD R9700 с 32 GB VRAM.
Результат:
- скорость: 30 токенов/с против 25 токенов/с
То есть примерно на 20% быстрее. И быстрее, чем Qwen-27B, который у меня дает около 27 токенов/с.
- качество: на уровне Q8
То есть почти без заметной потери точности, несмотря на гораздо меньший размер.
- размер: примерно как Q4
А это критично для локального запуска, потому что при ограниченной VRAM размер модели напрямую конкурирует с размером контекста.
Near-Lossless Quality: The Gemma 4 31B QAT model is trained from day one to "practice" being smaller. This means that the 4-bit Unsloth Dynamic version retains virtually 100% of the intelligence, reasoning, and accuracy of the massive uncompressed bfloat16 master model.
Главный смысл QAT здесь не просто в том, что модель «меньше». Обычная пост-тренировочная квантизация берет уже обученную модель и сжимает веса, неизбежно теряя часть качества. QAT — quantization-aware training — делает модель устойчивой к квантизации еще во время обучения или дообучения. Поэтому она ведет себя ближе к более тяжелой квантизации вроде Q8, но занимает место ближе к Q4.
Для 32 GB VRAM это меняет практический баланс. Раньше выбор был неприятный: либо брать более точную модель, но жертвовать контекстом и скоростью; либо брать более легкую квантизацию, но мириться с падением качества. Здесь компромисс выглядит намного лучше: скорость выше, качество почти не проседает, а освобожденная память уходит в больший контекст.
И это еще для Gemma не сделали поддержки MTP, которая разгоняет Qwen-27B с 27 т.с до 40-45 на моем R9700. И так как Gemma тратит примерно втрое меньше thinking tokens на прохождение тех же тестов что Qwen, на практике она быстрее и без MTP.
В общем, Google с Gemma впереди планеты всей, а 32GB VRAM should be enough for everyone. Qwen тоже молодцы, а конкуренция это хорошо.
huggingface.co
unsloth/gemma-4-31B-it-qat-GGUF · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
❤5👍2