Gaperton's Tech Corner
Просто чтоб вы знали, какой кусок говна Грок. А я пошел ставить гемму 31 qat.
Gemma 4 31B QAT
https://huggingface.co/unsloth/gemma-4-31B-it-qat-GGUF
Похоже, это становится моей основной локальной моделью.
Сравниваю с обычной Q5_K_XL на моей AMD R9700 с 32 GB VRAM.
Результат:
- скорость: 30 токенов/с против 25 токенов/с
То есть примерно на 20% быстрее. И быстрее, чем Qwen-27B, который у меня дает около 27 токенов/с.
- качество: на уровне Q8
То есть почти без заметной потери точности, несмотря на гораздо меньший размер.
- размер: примерно как Q4
А это критично для локального запуска, потому что при ограниченной VRAM размер модели напрямую конкурирует с размером контекста.
Главный смысл QAT здесь не просто в том, что модель «меньше». Обычная пост-тренировочная квантизация берет уже обученную модель и сжимает веса, неизбежно теряя часть качества. QAT — quantization-aware training — делает модель устойчивой к квантизации еще во время обучения или дообучения. Поэтому она ведет себя ближе к более тяжелой квантизации вроде Q8, но занимает место ближе к Q4.
Для 32 GB VRAM это меняет практический баланс. Раньше выбор был неприятный: либо брать более точную модель, но жертвовать контекстом и скоростью; либо брать более легкую квантизацию, но мириться с падением качества. Здесь компромисс выглядит намного лучше: скорость выше, качество почти не проседает, а освобожденная память уходит в больший контекст.
И это еще для Gemma не сделали поддержки MTP, которая разгоняет Qwen-27B с 27 т.с до 40-45 на моем R9700. И так как Gemma тратит примерно втрое меньше thinking tokens на прохождение тех же тестов что Qwen, на практике она быстрее и без MTP.
В общем, Google с Gemma впереди планеты всей, а 32GB VRAM should be enough for everyone. Qwen тоже молодцы, а конкуренция это хорошо.
https://huggingface.co/unsloth/gemma-4-31B-it-qat-GGUF
Похоже, это становится моей основной локальной моделью.
Сравниваю с обычной Q5_K_XL на моей AMD R9700 с 32 GB VRAM.
Результат:
- скорость: 30 токенов/с против 25 токенов/с
То есть примерно на 20% быстрее. И быстрее, чем Qwen-27B, который у меня дает около 27 токенов/с.
- качество: на уровне Q8
То есть почти без заметной потери точности, несмотря на гораздо меньший размер.
- размер: примерно как Q4
А это критично для локального запуска, потому что при ограниченной VRAM размер модели напрямую конкурирует с размером контекста.
Near-Lossless Quality: The Gemma 4 31B QAT model is trained from day one to "practice" being smaller. This means that the 4-bit Unsloth Dynamic version retains virtually 100% of the intelligence, reasoning, and accuracy of the massive uncompressed bfloat16 master model.
Главный смысл QAT здесь не просто в том, что модель «меньше». Обычная пост-тренировочная квантизация берет уже обученную модель и сжимает веса, неизбежно теряя часть качества. QAT — quantization-aware training — делает модель устойчивой к квантизации еще во время обучения или дообучения. Поэтому она ведет себя ближе к более тяжелой квантизации вроде Q8, но занимает место ближе к Q4.
Для 32 GB VRAM это меняет практический баланс. Раньше выбор был неприятный: либо брать более точную модель, но жертвовать контекстом и скоростью; либо брать более легкую квантизацию, но мириться с падением качества. Здесь компромисс выглядит намного лучше: скорость выше, качество почти не проседает, а освобожденная память уходит в больший контекст.
И это еще для Gemma не сделали поддержки MTP, которая разгоняет Qwen-27B с 27 т.с до 40-45 на моем R9700. И так как Gemma тратит примерно втрое меньше thinking tokens на прохождение тех же тестов что Qwen, на практике она быстрее и без MTP.
В общем, Google с Gemma впереди планеты всей, а 32GB VRAM should be enough for everyone. Qwen тоже молодцы, а конкуренция это хорошо.
huggingface.co
unsloth/gemma-4-31B-it-qat-GGUF · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
❤5👍2
Gaperton's Tech Corner
Gemma 4 31B QAT https://huggingface.co/unsloth/gemma-4-31B-it-qat-GGUF Похоже, это становится моей основной локальной моделью. Сравниваю с обычной Q5_K_XL на моей AMD R9700 с 32 GB VRAM. Результат: - скорость: 30 токенов/с против 25 токенов/с То…
Из-за меньшей ошибки квантизации, модель QAT заметно лучше в кодировании, потому что ошибка в длинном контексте накапливается не так быстро.
Gemma и без этого была сильно лучше в кодировании чем Qwen. А теперь так вообще.
Gemma и без этого была сильно лучше в кодировании чем Qwen. А теперь так вообще.
Gaperton's Tech Corner
Все облачные модели стали глупее. Грок до полной бесполезности. Гемини — почти полная, плюс там полно ошибок в самом веб-UI из-за которых пользоваться им почти неозможно. Адекватны Qwen и ChatGPT.
Грок поглупел потому, что xAI предпочитает сдавать датацентры в аренду тем, кто несет убытки от AI, а самим нести убытки от AI.
Это комментарий об OpenAI и желании Трампа купить 50% долю за счет средств налогоплательщиков.
Человек, я думаю, это как жидкость в сосуде. Она мгновенно принимает форму того, во что ее налили. Роль сосуда играют внешние обстоятельства. Иногда так бывает что когда они меняются, вместе с ними стремительно меняется и человек.
Ну, это конечно так, если у человека нет никаких принципов.
Человек, я думаю, это как жидкость в сосуде. Она мгновенно принимает форму того, во что ее налили. Роль сосуда играют внешние обстоятельства. Иногда так бывает что когда они меняются, вместе с ними стремительно меняется и человек.
Ну, это конечно так, если у человека нет никаких принципов.
Gaperton's Tech Corner
И это еще для Gemma не сделали поддержки MTP
Ну вот, для Gemma сделали MTP. Пробуем? Если сработает, Qwen станет не нужен.
Итак, Gemma 4 31B QAT + MTP, на AMD R9700 32GB VRAM.
Проверю с llama.cpp, на одном и на двух GPU, с Vulkan и ROCm.
UPD: замедляет обработку в 2 раза :). Ну ничего, подождем.
Итак, Gemma 4 31B QAT + MTP, на AMD R9700 32GB VRAM.
Проверю с llama.cpp, на одном и на двух GPU, с Vulkan и ROCm.
UPD: замедляет обработку в 2 раза :). Ну ничего, подождем.
Утренний кринж
https://x.com/harari_yuval/status/2063921976310210899?s=20
На прошлой неделе президент Аргентины Милей объявил о введении новой правовой категории для «нечеловеческих» корпораций — компаний, управляемых агентами искусственного интеллекта (#AI) или роботами. Как и традиционные корпорации, они получат статус юридического лица. Это может привести к появлению огромных новых богатств, но, что вызывает серьезную тревогу, также предоставит ИИ универсальный ключ, открывающий доступ к нашим финансовым, экономическим и политическим системам. Полная статья в сегодняшнем выпуске
@FT
https://x.com/harari_yuval/status/2063921976310210899?s=20
Богатые люди, которые раньше были слишком тупы, чтобы программировать, теперь стали суперзвездами. А по-настоящему блестящие инженеры вынуждены чувствовать себя тупыми и ненужными. Между тем программирование превратилось в бежевые липкие калорийные батончики, изготовленные из тараканов, и инженерам приходится выстраиваться в очередь с маленькими тарелками, выпрашивая свою долю у баронов токенов, которые, к счастью, в любой момент могут проявить достаточно щедрости, чтобы нажать кнопку, от которой токены вылетают, как струя рвоты. Инженеры в этих компаниях, сидящие всего в нескольких сантиметрах от крана, часто одаривают нас аналитическими статьями о том, что мы тоже должны делать то, что делают они, и что на самом деле не делать этого — совсем не модно. Конечно, все это — не столько инженерные советы, сколько финансовые.
Но, конечно, «почему люди ненавидят ИИ?»
https://x.com/atmoio/status/2063988888520036805?s=20
А ведь правда. Главный социальный эффект — AI внутри компаний сделал откровенных тупарей и мудаков суперзвездами.
X (formerly Twitter)
Mo (@atmoio) on X
Rich people who were too stupid to code before are now superstars. And actually brilliant engineers are made to feel stupid and redundant. Meanwhile coding has been synthesized into beige gooey calorie dense bars made from cockroaches and engineers have to…
😢3
Так вот, это говно в два раза быстрее чем Опус сжирает дневной лимит. Которого месяц назад хватало примерно на полдня ненапряжной работы в паре с AI.
Для 90% моей работы в которой полно рефактиронгов Sonnet 4.6 достаточно.
Please open Telegram to view this post
VIEW IN TELEGRAM
💯1
Буду читать сегодня. Military comms великолепно описано. Для офицеров — маленькая стрелка вниз, большая стрелка вверх.
FM 6-0 «Организация и ведение боевых действий командованием и штабом» — это полевое руководство Армии США, содержащее всеобъемлющую доктрину о том, как командиры армии и их штабы планируют, готовят, проводят и оценивают боевые действия. Оно служит основным справочным материалом по вопросам функций командования и штаба, принятия решений и организационных процессов на всех уровнях командования армии.
Документ ADP 6-0 определяет общую доктрину Сухопутных войск в области командования и управления, а также подход «командование по задаче» к руководству войсками. В нем описывается, как командиры сочетают искусство командования (суждение, лидерские качества, интуицию) с наукой управления (системы, процессы, информация) для планирования, подготовки, проведения и оценки операций.
👀3🔥2🤡1
Новая диффузионная модель. Не самая умная, но невероятно, адово быстрая.
https://x.com/unslothai/status/2064743714875220118?s=46&t=PZ5puMvz2CBmpcjPAn_ihA
И это только начало.
Кстати, эти новые диффузионные модели ставят шах и мат тем, кто говорит "это же просто машина предсказывающая следующее слово". Потому что а вот хуй. Диффузионная модель не предсказывает следующее слово.
https://x.com/unslothai/status/2064743714875220118?s=46&t=PZ5puMvz2CBmpcjPAn_ihA
И это только начало.
Кстати, эти новые диффузионные модели ставят шах и мат тем, кто говорит "это же просто машина предсказывающая следующее слово". Потому что а вот хуй. Диффузионная модель не предсказывает следующее слово.
🤯3