А это тест, который я провел на своем R9700. Он показывает, насколько скорость декодирования dense модели Qwen зависит от квантизации и MTP. Квантизация взята от unsloth.
Здесь я тестировал 3.6, но на новой модели 3.8 будет примерно то же самое.
Как видите, за Q5 вы в сравнении с Q4 почти ничего не платите.
Здесь я тестировал 3.6, но на новой модели 3.8 будет примерно то же самое.
Как видите, за Q5 вы в сравнении с Q4 почти ничего не платите.
Gaperton's Tech Corner
А это тест, который я провел на своем R9700. Он показывает, насколько скорость декодирования dense модели Qwen зависит от квантизации и MTP. Квантизация взята от unsloth. Здесь я тестировал 3.6, но на новой модели 3.8 будет примерно то же самое. Как видите…
А вот это тест Qwen3.6-27B, который показывает, сколько влезает контекста Q8 в 32 гигабайта видеопамяти в зависимости от квантизации. Тоже мой.
На длинном контексте всем этим моделям плохеет, они становятся медленными и глупыми. Поэтому я лично не вижу практического смысла в контексте длиннее чем 128К. Это все делает квант Q6 вполне практичным в 32GB.
В 24 гигабайтах вам придется делать Q4. Это прям минимум-минимум. Но тоже вполне рабочая штука.
В 16GB вам придется пускать МoЕ модели, это модели, в имени которых после первой цифры идет вторая, вида 35B-A3B.
На длинном контексте всем этим моделям плохеет, они становятся медленными и глупыми. Поэтому я лично не вижу практического смысла в контексте длиннее чем 128К. Это все делает квант Q6 вполне практичным в 32GB.
В 24 гигабайтах вам придется делать Q4. Это прям минимум-минимум. Но тоже вполне рабочая штука.
В 16GB вам придется пускать МoЕ модели, это модели, в имени которых после первой цифры идет вторая, вида 35B-A3B.
DeepSeek поднял цены на Flash.
Не только американские лавки субсидируют цены на токены, в общем. Но китайцам это обходится сильно дешевле.
Сейчас Luna дешевле. И ждем теста Qwen3.8-27B — малые модели обходятся практически бесплатно если их пускать на своем оборудовании, и я ожидаю что они за год сожрут весь этот хвост слева.
Пока, 3.8-27B очень людям нравится.
Не только американские лавки субсидируют цены на токены, в общем. Но китайцам это обходится сильно дешевле.
Сейчас Luna дешевле. И ждем теста Qwen3.8-27B — малые модели обходятся практически бесплатно если их пускать на своем оборудовании, и я ожидаю что они за год сожрут весь этот хвост слева.
Пока, 3.8-27B очень людям нравится.
👏1
Gaperton's Tech Corner
DeepSeek поднял цены на Flash. Не только американские лавки субсидируют цены на токены, в общем. Но китайцам это обходится сильно дешевле. Сейчас Luna дешевле. И ждем теста Qwen3.8-27B — малые модели обходятся практически бесплатно если их пускать на своем…
Говоря о запуске чего-то на своем оборудовании — напоминаем что кучка слева лезет в 8-32GB VRAM. А Deepseek — в 128GB unified memory с трудом и в 192GB комфортно.
Это позволяем нам утверждать что весь хвост слева на предыдущем графике будет в скорой перспективе сожран локальными моделями. Процесс займет 1-2 года, нужен новый цикл оборудования в котором любой телефон сможет гонять малую модель. Не уложимся в один цикл — значит уложимся в два, и это будет 3-4 года.
Фронтир разумеется останется в облаке, но он мало того что подешевеет — на него будет идти только часть трафика где он реально нужен. Это все будет на фоне конкуренции по цене с открытыми моделями и независимыми провайдерами.
В общем, OpenAI и Anthropic ждут тяжелые времена. Лоббисты в США наверное всерьез попробуют запретить китайские модели. Думаю, эта попытка закончится провалом — эту скам-модель в которой оперирует Уолл-Стрит не спасти.
Это позволяем нам утверждать что весь хвост слева на предыдущем графике будет в скорой перспективе сожран локальными моделями. Процесс займет 1-2 года, нужен новый цикл оборудования в котором любой телефон сможет гонять малую модель. Не уложимся в один цикл — значит уложимся в два, и это будет 3-4 года.
Фронтир разумеется останется в облаке, но он мало того что подешевеет — на него будет идти только часть трафика где он реально нужен. Это все будет на фоне конкуренции по цене с открытыми моделями и независимыми провайдерами.
В общем, OpenAI и Anthropic ждут тяжелые времена. Лоббисты в США наверное всерьез попробуют запретить китайские модели. Думаю, эта попытка закончится провалом — эту скам-модель в которой оперирует Уолл-Стрит не спасти.
👍4
https://x.com/thesupermanmx/status/2088551268793090178?s=20
Статья от Boston University, где авторы сделали то что я прикинул на коленке примерно год или полгода назад, прийдя разумеется примерно к тем же выводам.
Только мой вывод был глубже — рынок как известно закладывает в цену все известные прогнозы, и поэтому прогнозы никогда не сбываются. Как только все вот в это поверят — все очень возможно что немедленно наебнется. И оно пойдет не так.
Статья от Boston University, где авторы сделали то что я прикинул на коленке примерно год или полгода назад, прийдя разумеется примерно к тем же выводам.
The researchers mathematically tested every popular fix.
Universal Basic Income? Fails. It raises the living standard but doesn't change the corporate incentive to cut jobs. Retraining? Fails. Worker equity? Fails.
Только мой вывод был глубже — рынок как известно закладывает в цену все известные прогнозы, и поэтому прогнозы никогда не сбываются. Как только все вот в это поверят — все очень возможно что немедленно наебнется. И оно пойдет не так.
X (formerly Twitter)
Superman (@thesupermanmx) on X
Two economists mathematically proved that AI will destroy the economy.
Researchers from Wharton and Boston University published a terryfiying paper called "The AI Layoff Trap."
They mapped out the economic end-game of the AI transition, and it exposes a…
Researchers from Wharton and Boston University published a terryfiying paper called "The AI Layoff Trap."
They mapped out the economic end-game of the AI transition, and it exposes a…
❤1
Gaperton's Tech Corner
Говоря о запуске чего-то на своем оборудовании — напоминаем что кучка слева лезет в 8-32GB VRAM. А Deepseek — в 128GB unified memory с трудом и в 192GB комфортно. Это позволяем нам утверждать что весь хвост слева на предыдущем графике будет в скорой перспективе…
Две 3090 это очень хороший вариант. Наверное лучше чем одна 5090. Учтите что мать должна поддерживать два полноценных слота PCIe x16 или x8, а таких матерей мало. Ну, и надо БП на 1000-1200W минимум.
А чо, 48GB VRAM на дороге не валяются.
Две R9700 это плохой вариант. Если вы не используете их раздельно. Говорю как владелец. Одна R9700 — отлично. Лучше чем одна 3090.
А чо, 48GB VRAM на дороге не валяются.
Две R9700 это плохой вариант. Если вы не используете их раздельно. Говорю как владелец. Одна R9700 — отлично. Лучше чем одна 3090.
Q6 практически не отличим от Q8, и на деле мало отличается от Q4. Но самое интересное — Q3_XXS не катастрофа.
Это так для малых моделей, а для средних это еще лучше.
https://x.com/witcheer/status/2088940018144326007?s=20
Это так для малых моделей, а для средних это еще лучше.
Q6_K привязывает Q8_0 ко второму знаку после запятой, поэтому самый большой файл в рейтинге здесь ничего не добавляет.
Особенно выделяется UD-IQ3_XXS: 92,7 из 93,7 по Q8 при работе с файлом размером 11,1 ГБ со скоростью 96 токов/с, что позволяет уместить плотный файл объемом 27B в лимит карты объемом 16 ГБ практически с полным качеством.
https://x.com/witcheer/status/2088940018144326007?s=20
Gaperton's Tech Corner
У Qwen3.8-27B космический интеллект для ее размера. Примерно как у DeepSeek V4 Flash.
Народ пытается отойти от шока. И не может.
Очередь, понимаете-ли, на Mac Studio.
В комментах пишут что этот дефицитный товар можно загнать на eBay за большие деньгию
В комментах пишут что этот дефицитный товар можно загнать на eBay за большие деньгию
This media is not supported in your browser
VIEW IN TELEGRAM
#nothing_special #just
🇨🇳 World Humanoid Robot Games 2026 in Beijing
Это все на фоне безумия Антропика, обещающего конец света, и попыток запретить китайские модели, создает крайне плохую оптику для США.
Это все на фоне безумия Антропика, обещающего конец света, и попыток запретить китайские модели, создает крайне плохую оптику для США.
Please open Telegram to view this post
VIEW IN TELEGRAM
Qwen 3.8 Low and Medium are goated
Artificial Analysis just benchmarked them and the scores are crazy good, proving the earlier success wasn't only enabled by overthinking.
Восторги вокруг Qwen 3.8-27B не только не утихают, но становятся больше.
Народ говорит это первая модель от которой есть прям реальная польза.
🔥4
Об опыте использования Hindsight
Ну в общем что. У меня достаточно практического опыта с Hermes + Hindsight чтобы заключить, что это прям из коробки довольно полезная штука. И я примерно научился ее готовить. Примерно.
Есть нюансы. Эта штука — по сути прототип. И заставить ее работать не так просто. Самое главное, конечно, даже не пытаться заменять gpt-oss-20b на что-то другое.
И второе — для ее работы нужен нехилый GPU чтобы завести там reranker и gpt-oss-20b (сопротивление бесполезно). Желательно конечно сами понимаете — R9700 32GB. В 3090 24GB наверное тоже можно упихать.
И третье — для нее нужен локальный агент, например Hermes Agent, и подписка на нормальную фронтир модель в облаке. Это всего лишь память.
В общем надо подумать с чего начать рассказывать. Тема агонь.
Ну в общем что. У меня достаточно практического опыта с Hermes + Hindsight чтобы заключить, что это прям из коробки довольно полезная штука. И я примерно научился ее готовить. Примерно.
Есть нюансы. Эта штука — по сути прототип. И заставить ее работать не так просто. Самое главное, конечно, даже не пытаться заменять gpt-oss-20b на что-то другое.
И второе — для ее работы нужен нехилый GPU чтобы завести там reranker и gpt-oss-20b (сопротивление бесполезно). Желательно конечно сами понимаете — R9700 32GB. В 3090 24GB наверное тоже можно упихать.
И третье — для нее нужен локальный агент, например Hermes Agent, и подписка на нормальную фронтир модель в облаке. Это всего лишь память.
В общем надо подумать с чего начать рассказывать. Тема агонь.
🔥11👀1
О дефиците памяти. Это, конечно, сговор. Когда поставки контролируют три компании, это не рынок.
https://x.com/hedgiemarkets/status/2091200243324911670?s=61
🦔Компании, занимающиеся искусственным интеллектом, предварительно заказали почти все мировое производство оперативной памяти на 2027 год. Цены выросли примерно на 500% за 12 месяцев: комплект DDR5 на 64 ГБ подскочил с 191 доллара до более чем 1100 долларов США, а комплект на 128 ГБ вырос с 329 до 3399 долларов США. Чипы DRAM теперь стоят более чем в два раза меньше за килограмм, чем золото. Производители ПК и смартфонов конкурируют за все, что осталось, и генеральный директор SK Hynix предупредил, что 2027 год будет худшим годом для поставок памяти в истории отрасли.
https://x.com/hedgiemarkets/status/2091200243324911670?s=61
Чем дороже становится ваше устройство, тем труднее иметь достаточно мощный, чтобы делать что-либо локально, и тем больше вы зависите от облачных сервисов и подписок на все. Игры, хранилище, программное обеспечение, вычисления, все арендовано, а не принадлежит. Компании, которые покупают всю оперативную память, - это те же самые, которые хотели бы продать вам подписку. Чем больше будет стоить ваш следующий ноутбук, тем легче уговорить вас арендовать все из облака. Нехватка искусственного интеллекта не создала эту игру, но она определенно ускорила ее.
Три компании контролируют около 90% глобальных DRAM, Samsung, SK Hynix и Micron. Samsung и Hynix имеют уголовные судимости за установление цен на оперативную память в начале 2000-х годов, они заплатили около 485 миллионов долларов штрафов, а руководители отсидели тюремное заключение. Общеотраслевые штрафы превысили 730 миллионов долларов. Микрон был частью этого, но выдал всех и ушел. Теперь новый коллективный иск утверждает, что те же три использовали сдвиг ИИ в качестве прикрытия для сокращения производства потребительской памяти и завышения цен. Дело не доказано, но когда компании с таким послужным списком в два-три раза превышают маржу, продавая центры обработки данных ИИ, в то время как вы платите на 500% больше за тот же продукт, "только спрос и предложение" - это сложная продажа.
Хеджи🤗
😱4
Gaperton's Tech Corner
Об опыте использования Hindsight Ну в общем что. У меня достаточно практического опыта с Hermes + Hindsight чтобы заключить, что это прям из коробки довольно полезная штука. И я примерно научился ее готовить. Примерно. Есть нюансы. Эта штука — по сути прототип.…
О веб-поиске для ИИ агентов
Как известно, языковые модели сами ничему не учатся, и если вы хотите чтобы они знали что происходит в мире, и поменьше галлюцинировали — они должны искать в сети. Прям как люди.
Однако поиск сети агентом — "Это другое" (тм). И если у вас локальный агент — это проблема.
Во-первых, он платный. Хотя, конечно, есть и бесплатный от DuckDuckGo.
Во-вторых, и это изумительно — к поиску нужна способность читать страницы которые найдены. И это тоже не бесплатно. Хотя можно поставить локально Fireclawl только для этого, и это станет бесплатно.
В-третьих, Brave это конечно лучший традиционный поиск доступный для агента, однако в реальных агентских сценариях он проигрывает, кроме того – он дорогой, и не дает этого самого чтения из пункта 2 (web_fetch).
Если вы пользуетесь Hermes, cамое простое и дешевое это Firecrawl, и дешевле его покупать у Nous, просто занеся денег на бесплатный план. Должно выйти на несколько чашек кофе в месяц. Модели и подписку у них покупать не надо, я во всяком случае не вижу зачем.
Такое в общем. Если кто жадный и принципиальный — DuckDuckGo + локальный Firecrawl.
Как известно, языковые модели сами ничему не учатся, и если вы хотите чтобы они знали что происходит в мире, и поменьше галлюцинировали — они должны искать в сети. Прям как люди.
Однако поиск сети агентом — "Это другое" (тм). И если у вас локальный агент — это проблема.
Во-первых, он платный. Хотя, конечно, есть и бесплатный от DuckDuckGo.
Во-вторых, и это изумительно — к поиску нужна способность читать страницы которые найдены. И это тоже не бесплатно. Хотя можно поставить локально Fireclawl только для этого, и это станет бесплатно.
В-третьих, Brave это конечно лучший традиционный поиск доступный для агента, однако в реальных агентских сценариях он проигрывает, кроме того – он дорогой, и не дает этого самого чтения из пункта 2 (web_fetch).
Если вы пользуетесь Hermes, cамое простое и дешевое это Firecrawl, и дешевле его покупать у Nous, просто занеся денег на бесплатный план. Должно выйти на несколько чашек кофе в месяц. Модели и подписку у них покупать не надо, я во всяком случае не вижу зачем.
Такое в общем. Если кто жадный и принципиальный — DuckDuckGo + локальный Firecrawl.
🔥1
Gaperton's Tech Corner
Об опыте использования Hindsight Ну в общем что. У меня достаточно практического опыта с Hermes + Hindsight чтобы заключить, что это прям из коробки довольно полезная штука. И я примерно научился ее готовить. Примерно. Есть нюансы. Эта штука — по сути прототип.…
Кстати, hindsight внутри неподдерживаемый кусок говна. Его, судя по всему, вайбкодят люди не очень хорошо знающие питон.
Я почему это понял? А я решил их промпты немного поправить. И там такое дело. Промпт для извлечения фактов из текста собирается конкатенацией в файле под 3 тысячи строк.
В принципе, рефакторинг в XP стиле делается с LLM на счет раз, так что привести это в порядок совсем не так трудно как кажется. Если умеешь читать код и знаешь что такое хорошо, а что такое плохо.
Да только боюсь не примут у меня такой PR. Но если разбить на мелкие шаги, то может кстати и примут. Первое, наверное, это чудовище тупо на модули попилить. Второе — новая архитектура промптов, чтоб они шаблонами собирались а не конкатенацией.
ЗЫ: Кстати, а это прикольно, что не каждый нищеброд может юнит-тесты прогнать к этой штуке, а только состоятельные кроты. :) Там каждый прогон тестов стоит бабла. Мне это нравится.
Боюсь только придется что-то вроде 5090 покупать или подобное если всерьез этим всем заниматься. Прогон тестов на моих R9700 небыстр. Последнее что я делал занимало по 16 часов на прогон, и это был фрагментик теста. В общем, ну, пиздец. Топовый M5 Max если что абсолютно идентичен R9700 по скорости но вчетверо больше памяти — и по скорости это минимум что можно терпеть.
Я почему это понял? А я решил их промпты немного поправить. И там такое дело. Промпт для извлечения фактов из текста собирается конкатенацией в файле под 3 тысячи строк.
В принципе, рефакторинг в XP стиле делается с LLM на счет раз, так что привести это в порядок совсем не так трудно как кажется. Если умеешь читать код и знаешь что такое хорошо, а что такое плохо.
Да только боюсь не примут у меня такой PR. Но если разбить на мелкие шаги, то может кстати и примут. Первое, наверное, это чудовище тупо на модули попилить. Второе — новая архитектура промптов, чтоб они шаблонами собирались а не конкатенацией.
ЗЫ: Кстати, а это прикольно, что не каждый нищеброд может юнит-тесты прогнать к этой штуке, а только состоятельные кроты. :) Там каждый прогон тестов стоит бабла. Мне это нравится.
Боюсь только придется что-то вроде 5090 покупать или подобное если всерьез этим всем заниматься. Прогон тестов на моих R9700 небыстр. Последнее что я делал занимало по 16 часов на прогон, и это был фрагментик теста. В общем, ну, пиздец. Топовый M5 Max если что абсолютно идентичен R9700 по скорости но вчетверо больше памяти — и по скорости это минимум что можно терпеть.
🤯2🤷♂1