Gaperton's Tech Corner
373 subscribers
644 photos
47 videos
1 file
442 links
Технология, жизнь, и немного классической философии

https://gaperton.substack.com
Download Telegram
Да они издеваются.
😁5
Я устал целовать в жопу молодых специалистов, и поэтому накатал специальные правила, как вести себя во время дискуссий группового проектирования. Ну и вообще – технических дискуссий. Они нарушают каждый пункт. Поэтому ничего лишнего здесь нет.

Может кому полезно окажется в общем. Это всё не так просто перевести в слова.

Design Discussion Rules

I’d like to establish a few communication rules for our design discussions to make them more effective and reduce unnecessary back-and-forth:

Uncertainty and misunderstanding:

✔️ Be explicit about uncertainty. If you don’t know, acknowledge that directly. Ask questions when the missing information could materially change the outcome.

✔️ Be explicit about misunderstanding. If something is unclear or underspecified, say so directly rather than guessing. When a reasonable assumption is sufficient, state the assumption explicitly and proceed.

✔️ Change the explanation when something isn’t understood. If someone says they didn’t understand or repeats the same question, explain it differently rather than repeating the same explanation or pointing out that it was already given.

Questions and answers:

✔️ Answer the question actually asked. Don’t substitute a different or adjacent question because it seems more useful, more important, or easier to answer. If the premise is incorrect, say so directly.

✔️ Match the form of the answer to the question. For a yes/no question, lead with “yes,” “no,” or “not sure.” Add an explanation afterward if needed.

Precise speech:

✔️ Maintain terminological stability. Use the same term for the same concept unless a distinction is intentional. Choose the clearest and most specific wording. Avoid unnecessary synonyms, decorative language, and rhetorical devices used mainly to make the language sound polished.

✔️ Use explicit references. Prefer specific names, objects, components, or concepts over pronouns when a pronoun could make the meaning ambiguous or require the reader to infer the reference.

✔️ Use active voice when possible. Make the actor and action explicit unless passive voice is necessary for clarity or precision.

These rules are intended to keep design discussions focused, clear, and efficient. Please follow them going forward.
👍19❤7🔥6
А неплохо. Лучшая малая модель.

Hermes умеет разные специальные запросы направлять на модели попроще, например локальные. Ну например, страницу скачать и распарсить. Это экономит квоту на большую модель которая основаная. Смекаете, да?
❤3
Кстати, AtomicChat никто не пробовал? У них тоже неплохая квантизация как у unsloth.

На тему того какую выбирать — напоминаем. Минимум это Q4, рабочий выбор Q5, если есть память и нужно больше качества то Q6. Дальше народ перестает на глаз замечать разницу, особенно с динамическими квантами как у unsloth.

Это для малых моделей. А для 200B+ параметров тесты показывают что даже Q3 и Q2 в динамических квантах не так плохо.

Для k/v cache квантизация должна быть Q8 или F16. То есть, малую модель надо трамбовать в VRAM в кванте Q4 с kv-cache Q8.
👌2🤔1
Gaperton's Tech Corner
Кстати, AtomicChat никто не пробовал? У них тоже неплохая квантизация как у unsloth. На тему того какую выбирать — напоминаем. Минимум это Q4, рабочий выбор Q5, если есть память и нужно больше качества то Q6. Дальше народ перестает на глаз замечать разницу…
Qwen3.8-27B — только что жене отдал тестировать.

У меня AMD R9700 32GB.
Модель unsloth Q6_K_XL
Это дает примерно 170К токенов контекста в Q8.
Скорость генерации 41 t/s (c OTP). Живенько.

В 24GB VRAM тоже можно запустить. Но придется жить поскромнее. Никакого Q6.

R9700 по скорости почти один в один как Apple M5 Max. Это практический минимум что можно терпеть. "Удовлетворительно", то есть тройка.
А это тест, который я провел на своем R9700. Он показывает, насколько скорость декодирования dense модели Qwen зависит от квантизации и MTP. Квантизация взята от unsloth.

Здесь я тестировал 3.6, но на новой модели 3.8 будет примерно то же самое.

Как видите, за Q5 вы в сравнении с Q4 почти ничего не платите.
Gaperton's Tech Corner
А это тест, который я провел на своем R9700. Он показывает, насколько скорость декодирования dense модели Qwen зависит от квантизации и MTP. Квантизация взята от unsloth. Здесь я тестировал 3.6, но на новой модели 3.8 будет примерно то же самое. Как видите…
А вот это тест Qwen3.6-27B, который показывает, сколько влезает контекста Q8 в 32 гигабайта видеопамяти в зависимости от квантизации. Тоже мой.

На длинном контексте всем этим моделям плохеет, они становятся медленными и глупыми. Поэтому я лично не вижу практического смысла в контексте длиннее чем 128К. Это все делает квант Q6 вполне практичным в 32GB.

В 24 гигабайтах вам придется делать Q4. Это прям минимум-минимум. Но тоже вполне рабочая штука.

В 16GB вам придется пускать МoЕ модели, это модели, в имени которых после первой цифры идет вторая, вида 35B-A3B.
DeepSeek поднял цены на Flash.

Не только американские лавки субсидируют цены на токены, в общем. Но китайцам это обходится сильно дешевле.

Сейчас Luna дешевле. И ждем теста Qwen3.8-27B — малые модели обходятся практически бесплатно если их пускать на своем оборудовании, и я ожидаю что они за год сожрут весь этот хвост слева.

Пока, 3.8-27B очень людям нравится.
👏1
Gaperton's Tech Corner
DeepSeek поднял цены на Flash. Не только американские лавки субсидируют цены на токены, в общем. Но китайцам это обходится сильно дешевле. Сейчас Luna дешевле. И ждем теста Qwen3.8-27B — малые модели обходятся практически бесплатно если их пускать на своем…
Говоря о запуске чего-то на своем оборудовании — напоминаем что кучка слева лезет в 8-32GB VRAM. А Deepseek — в 128GB unified memory с трудом и в 192GB комфортно.

Это позволяем нам утверждать что весь хвост слева на предыдущем графике будет в скорой перспективе сожран локальными моделями. Процесс займет 1-2 года, нужен новый цикл оборудования в котором любой телефон сможет гонять малую модель. Не уложимся в один цикл — значит уложимся в два, и это будет 3-4 года.

Фронтир разумеется останется в облаке, но он мало того что подешевеет — на него будет идти только часть трафика где он реально нужен. Это все будет на фоне конкуренции по цене с открытыми моделями и независимыми провайдерами.

В общем, OpenAI и Anthropic ждут тяжелые времена. Лоббисты в США наверное всерьез попробуют запретить китайские модели. Думаю, эта попытка закончится провалом — эту скам-модель в которой оперирует Уолл-Стрит не спасти.
👍4
https://x.com/thesupermanmx/status/2088551268793090178?s=20

Статья от Boston University, где авторы сделали то что я прикинул на коленке примерно год или полгода назад, прийдя разумеется примерно к тем же выводам.

The researchers mathematically tested every popular fix.

Universal Basic Income? Fails. It raises the living standard but doesn't change the corporate incentive to cut jobs. Retraining? Fails. Worker equity? Fails.


Только мой вывод был глубже — рынок как известно закладывает в цену все известные прогнозы, и поэтому прогнозы никогда не сбываются. Как только все вот в это поверят — все очень возможно что немедленно наебнется. И оно пойдет не так.
❤1
Gaperton's Tech Corner
Говоря о запуске чего-то на своем оборудовании — напоминаем что кучка слева лезет в 8-32GB VRAM. А Deepseek — в 128GB unified memory с трудом и в 192GB комфортно. Это позволяем нам утверждать что весь хвост слева на предыдущем графике будет в скорой перспективе…
Две 3090 это очень хороший вариант. Наверное лучше чем одна 5090. Учтите что мать должна поддерживать два полноценных слота PCIe x16 или x8, а таких матерей мало. Ну, и надо БП на 1000-1200W минимум.

А чо, 48GB VRAM на дороге не валяются.

Две R9700 это плохой вариант. Если вы не используете их раздельно. Говорю как владелец. Одна R9700 — отлично. Лучше чем одна 3090.
Q6 практически не отличим от Q8, и на деле мало отличается от Q4. Но самое интересное — Q3_XXS не катастрофа.

Это так для малых моделей, а для средних это еще лучше.
Q6_K привязывает Q8_0 ко второму знаку после запятой, поэтому самый большой файл в рейтинге здесь ничего не добавляет.

Особенно выделяется UD-IQ3_XXS: 92,7 из 93,7 по Q8 при работе с файлом размером 11,1 ГБ со скоростью 96 токов/с, что позволяет уместить плотный файл объемом 27B в лимит карты объемом 16 ГБ практически с полным качеством.


https://x.com/witcheer/status/2088940018144326007?s=20
У Qwen3.8-27B космический интеллект для ее размера. Примерно как у DeepSeek V4 Flash.
🔥10
Новости.
Это оценки за домашние работы против оценок на экзамене.
👏3🤷2👍1
Заново качайте 3.8-27B короче.
🫡5
Очередь, понимаете-ли, на Mac Studio.

В комментах пишут что этот дефицитный товар можно загнать на eBay за большие деньгию
This media is not supported in your browser
VIEW IN TELEGRAM
#nothing_special #just

🇨🇳 World Humanoid Robot Games 2026 in Beijing

Это все на фоне безумия Антропика, обещающего конец света, и попыток запретить китайские модели, создает крайне плохую оптику для США.
Please open Telegram to view this post
VIEW IN TELEGRAM