Gaperton's Tech Corner
372 subscribers
660 photos
47 videos
1 file
450 links
Технология, жизнь, и немного классической философии

https://gaperton.substack.com
Download Telegram
Вы че, бляди, совсем охуели?
Просто чтоб вы знали, какой кусок говна Грок.

А я пошел ставить гемму 31 qat.
Gaperton's Tech Corner
Просто чтоб вы знали, какой кусок говна Грок. А я пошел ставить гемму 31 qat.
Gemma 4 31B QAT
https://huggingface.co/unsloth/gemma-4-31B-it-qat-GGUF

Похоже, это становится моей основной локальной моделью.

Сравниваю с обычной Q5_K_XL на моей AMD R9700 с 32 GB VRAM.

Результат:

- скорость: 30 токенов/с против 25 токенов/с
То есть примерно на 20% быстрее. И быстрее, чем Qwen-27B, который у меня дает около 27 токенов/с.

- качество: на уровне Q8
То есть почти без заметной потери точности, несмотря на гораздо меньший размер.

- размер: примерно как Q4
А это критично для локального запуска, потому что при ограниченной VRAM размер модели напрямую конкурирует с размером контекста.

Near-Lossless Quality: The Gemma 4 31B QAT model is trained from day one to "practice" being smaller. This means that the 4-bit Unsloth Dynamic version retains virtually 100% of the intelligence, reasoning, and accuracy of the massive uncompressed bfloat16 master model.


Главный смысл QAT здесь не просто в том, что модель «меньше». Обычная пост-тренировочная квантизация берет уже обученную модель и сжимает веса, неизбежно теряя часть качества. QAT — quantization-aware training — делает модель устойчивой к квантизации еще во время обучения или дообучения. Поэтому она ведет себя ближе к более тяжелой квантизации вроде Q8, но занимает место ближе к Q4.

Для 32 GB VRAM это меняет практический баланс. Раньше выбор был неприятный: либо брать более точную модель, но жертвовать контекстом и скоростью; либо брать более легкую квантизацию, но мириться с падением качества. Здесь компромисс выглядит намного лучше: скорость выше, качество почти не проседает, а освобожденная память уходит в больший контекст.

И это еще для Gemma не сделали поддержки MTP, которая разгоняет Qwen-27B с 27 т.с до 40-45 на моем R9700. И так как Gemma тратит примерно втрое меньше thinking tokens на прохождение тех же тестов что Qwen, на практике она быстрее и без MTP.

В общем, Google с Gemma впереди планеты всей, а 32GB VRAM should be enough for everyone. Qwen тоже молодцы, а конкуренция это хорошо.
❤5👍2
А в Apple умные продакты, все-таки.
😁9
Gaperton's Tech Corner
Gemma 4 31B QAT https://huggingface.co/unsloth/gemma-4-31B-it-qat-GGUF Похоже, это становится моей основной локальной моделью. Сравниваю с обычной Q5_K_XL на моей AMD R9700 с 32 GB VRAM. Результат: - скорость: 30 токенов/с против 25 токенов/с То…
Из-за меньшей ошибки квантизации, модель QAT заметно лучше в кодировании, потому что ошибка в длинном контексте накапливается не так быстро.

Gemma и без этого была сильно лучше в кодировании чем Qwen. А теперь так вообще.
Понеслась. Быть религиозным вообще несет сплошные плюсы.
🥰1🤣1
Все облачные модели стали глупее. Грок до полной бесполезности. Гемини — почти полная, плюс там полно ошибок в самом веб-UI из-за которых пользоваться им почти неозможно.

Адекватны Qwen и ChatGPT.
Это комментарий об OpenAI и желании Трампа купить 50% долю за счет средств налогоплательщиков.

Человек, я думаю, это как жидкость в сосуде. Она мгновенно принимает форму того, во что ее налили. Роль сосуда играют внешние обстоятельства. Иногда так бывает что когда они меняются, вместе с ними стремительно меняется и человек.

Ну, это конечно так, если у человека нет никаких принципов.
Gaperton's Tech Corner
И это еще для Gemma не сделали поддержки MTP
Ну вот, для Gemma сделали MTP. Пробуем? Если сработает, Qwen станет не нужен.

Итак, Gemma 4 31B QAT + MTP, на AMD R9700 32GB VRAM.

Проверю с llama.cpp, на одном и на двух GPU, с Vulkan и ROCm.

UPD: замедляет обработку в 2 раза :). Ну ничего, подождем.
Два вопроса. Насколько хороши локальные модели сейчас? И что все-таки лучше — Gemma или Qwen.

Первое. Они гораздо лучше, чем gpt-4o, который все любили.

И второе. Гемма лучше чем Квен.
❤1
Atomic Heart. Наконец добрался. Ретрофутуризм штырит.
🔥5👍1
🔥5❤2👏2😁1
Утренний кринж

На прошлой неделе президент Аргентины Милей объявил о введении новой правовой категории для «нечеловеческих» корпораций — компаний, управляемых агентами искусственного интеллекта (#AI) или роботами. Как и традиционные корпорации, они получат статус юридического лица. Это может привести к появлению огромных новых богатств, но, что вызывает серьезную тревогу, также предоставит ИИ универсальный ключ, открывающий доступ к нашим финансовым, экономическим и политическим системам. Полная статья в сегодняшнем выпуске
@FT


https://x.com/harari_yuval/status/2063921976310210899?s=20
Богатые люди, которые раньше были слишком тупы, чтобы программировать, теперь стали суперзвездами. А по-настоящему блестящие инженеры вынуждены чувствовать себя тупыми и ненужными. Между тем программирование превратилось в бежевые липкие калорийные батончики, изготовленные из тараканов, и инженерам приходится выстраиваться в очередь с маленькими тарелками, выпрашивая свою долю у баронов токенов, которые, к счастью, в любой момент могут проявить достаточно щедрости, чтобы нажать кнопку, от которой токены вылетают, как струя рвоты. Инженеры в этих компаниях, сидящие всего в нескольких сантиметрах от крана, часто одаривают нас аналитическими статьями о том, что мы тоже должны делать то, что делают они, и что на самом деле не делать этого — совсем не модно. Конечно, все это — не столько инженерные советы, сколько финансовые.

Но, конечно, «почему люди ненавидят ИИ?»


https://x.com/atmoio/status/2063988888520036805?s=20

А ведь правда. Главный социальный эффект — AI внутри компаний сделал откровенных тупарей и мудаков суперзвездами.
😢3
👆 Видели?

Так вот, это говно в два раза быстрее чем Опус сжирает дневной лимит. Которого месяц назад хватало примерно на полдня ненапряжной работы в паре с AI.

Для 90% моей работы в которой полно рефактиронгов Sonnet 4.6 достаточно.
Please open Telegram to view this post
VIEW IN TELEGRAM
💯1
Буду читать сегодня. Military comms великолепно описано. Для офицеров — маленькая стрелка вниз, большая стрелка вверх.

FM 6-0 «Организация и ведение боевых действий командованием и штабом» — это полевое руководство Армии США, содержащее всеобъемлющую доктрину о том, как командиры армии и их штабы планируют, готовят, проводят и оценивают боевые действия. Оно служит основным справочным материалом по вопросам функций командования и штаба, принятия решений и организационных процессов на всех уровнях командования армии.


Документ ADP 6-0 определяет общую доктрину Сухопутных войск в области командования и управления, а также подход «командование по задаче» к руководству войсками. В нем описывается, как командиры сочетают искусство командования (суждение, лидерские качества, интуицию) с наукой управления (системы, процессы, информация) для планирования, подготовки, проведения и оценки операций.
👀3🔥2🤡1
Новая диффузионная модель. Не самая умная, но невероятно, адово быстрая.

https://x.com/unslothai/status/2064743714875220118?s=46&t=PZ5puMvz2CBmpcjPAn_ihA

И это только начало.

Кстати, эти новые диффузионные модели ставят шах и мат тем, кто говорит "это же просто машина предсказывающая следующее слово". Потому что а вот хуй. Диффузионная модель не предсказывает следующее слово.
🤯3