Gaperton's Tech Corner
373 subscribers
646 photos
47 videos
1 file
443 links
Технология, жизнь, и немного классической философии

https://gaperton.substack.com
Download Telegram
Не очень понятно, с какого хуя языковая модель должна быть чьим-то моральным компасом, но ладно.
Обещают Qwen3.8-Flash-Next на обычной карте nVidia, и нормальную скорость. В пятницу приедет 3090, проверю. У меня второй компьютер будет 24GB 3090 + 64GB DDR4. Самая популярная бюджетная опция. Для зажиточных крестьян. Конфигурации с двумя GPU — это уже следующий класс.

Strata

Запустите модель искусственного интеллекта с 125 миллиардами параметров на обычном игровом ПК

Одна видеокарта NVIDIA (12–24 ГБ) + 64 ГБ оперативной памяти · Windows или Linux · установка в один клик

Strata запускает Qwen3.8-Flash-Next — крупную интеллектуальную модель искусственного интеллекта, для работы которой обычно требуется сервер, — прямо на вашем персональном компьютере. Она генерирует ответы со скоростью 60–95 токенов в секунду (один токен составляет примерно ¾ слова): быстрее, чем вы успеваете читать.


An AMD Radeon RX 7900 XT / XTX, RX 9070 / 9070 XT or Radeon AI PRO R9700 on Linux works too. И пишут, что поддерживается сплит на две карты. Проверим и это. Если будет нормально работать на двух R9700, то ничего больше и не нужно.

https://github.com/Niko1221/Strata
🔥6
Gaperton's Tech Corner
Обещают Qwen3.8-Flash-Next на обычной карте nVidia, и нормальную скорость. В пятницу приедет 3090, проверю. У меня второй компьютер будет 24GB 3090 + 64GB DDR4. Самая популярная бюджетная опция. Для зажиточных крестьян. Конфигурации с двумя GPU — это уже следующий…
Вы можете спросить, насколько плохая эта квантизация в предыдущем посте, а там максимум, что есть, это три бита. И у нас есть ответ.

https://x.com/bnjmn_marie/status/2105481856812740726/photo/1

Она далеко не так плоха, как может показаться. Q2_K_XL вполне на уровне, но тратит на четверть больше токенов на размышления.

Эти модели уже вполне реальная практическая замена облачным. Не надо ждать от них паритета с Opus 5.5, но для повседневных задач они более чем достаточны. Это уровень GLM/DeepSeek Flash. Примерно соответствует фронтиру прошлой зимы.
🤔3
Я думаю, что в интересах общества ограничить использование компьютеров в госсекторе. Пусть на пишущих машинках под копирку законы печатают, блять. А еще лучше перевести их на гусиные перья. Может, тогда начнут думать над каждым словом.
💯7
Gaperton's Tech Corner
AMD Radeon RX 7900 XT / XTX, RX 9070 / 9070 XT or Radeon AI PRO R9700
Qwen3.8 Flash Next — R9V / ROCm 10

R9V — это не отдельный движок, а подобранный и «пиннутый» стек для запуска ровно одного сценария: Qwen3.8-Flash-Next на двух Radeon AI PRO R9700 (RDNA4/gfx1201) с tensor-параллелизмом (TP2), 128K контекстом и OpenAI-совместимым API. Внутри: форк vLLM, есть отдельная GGUF-загрузка, спец-ядра под gfx1201, offload экспертов в RAM, и MTP-спекулятивное декодирование на 4 токена (MTP4).

А вот отчет о тестировании. 2× Radeon AI PRO R9700 32 GB, 64 GB host RAM

https://github.com/kyuz0/amd-r9700-ai-toolboxes/blob/main/docs/r9v-rocm-10.0.md

В общем, запустить эту модель на моем оборудовании можно уже сейчас.
👍4🔥1
Вот смотрите, фронтир-модели косячат с ответами, несмотря на то что все знания мира у них в весах.

У модели Qwen 27B не все знания мира в весах.

И тем, и другим нужен поиск, который опирается на знания, написанные людьми.

Ну а раз Qwen 27B уже достаточно умен, и всем все равно нужен поиск, так зачем нужно пихать все знания в веса модели?

А если не нужно, так почему не дистиллировать то, что реально нужно, в малую модель, которая влезает, ну, например, в 64 гигабайта VRAM? А все остальное делать поиском?
👍1
Media is too big
VIEW IN TELEGRAM
Продуктовые идеи.
😁3🤷‍♂1
НОВОСТЬ: Согласно сенсационному репортажу в «Нью-Йорк Таймс», соучредитель компании Anthropic Крис Олах пригрозил покинуть презентацию энциклики Папы Льва XIV по искусственному интеллекту, состоявшуюся в мае, поскольку папа отверг идею о том, что машины могут обладать сознанием.

Затем команда Олаха в частном порядке пыталась убедить советников папы «серьёзно отнестись к возможности существования сознания у моделей». Папа Лев XIV остался непреклонен.

В течение нескольких месяцев компания Anthropic устраивала теологам и религиоведам роскошные ужины и приёмы, заключая с ними соглашения о неразглашении, в надежде, что они одобрят идею о том, что модель «Клод» обладает моральным статусом.

https://x.com/ChristopherHale/status/2106011594182304234?s=20

Чем дальше смотрю на все это, тем больше у меня, на самом деле, появляется уважения к христианству. Потому что, когда все институты общества, которые, казалось бы, должны защищать человека, провернули его на хую, церковь стоит последним бастионом.
👍4
Надо тестировать свежекупленную RTX 3090. Агент Гермес отвечает, что из этого он может сделать сам. Утверждает, что почти все.

Пусть делает. А я пошел в бар пиво пить. Надо только настроить Telegram, чтобы он писал мне, как идет работа.
❤3
🤷‍♂3
Gaperton's Tech Corner
Надо тестировать свежекупленную RTX 3090. Агент Гермес отвечает, что из этого он может сделать сам. Утверждает, что почти все. Пусть делает. А я пошел в бар пиво пить. Надо только настроить Telegram, чтобы он писал мне, как идет работа.
Об энергопотреблении GPU и его влиянии на скорость LLM

Тест выдавал странные температуры, я даже забеспокоился. И совершенно случайно выяснил, что мой GPU имеет не стандартное для 3090 потребление 350W а оверлокнутое 420W. 😳

В сообществе есть на эту тему консенсус. Почти все, кто делает инференс, ограничивают потребление ниже заводского. Производительность инференса в основном упирается в память, а не в компьют, и поэтому такое ограничение значительно снижает энергопотребление, но практически не влияет на скорость. Это делают по ряду причин: начиная с экономии электричества и заканчивая тем, чтобы дать больше резерва блоку питания и снизить температурный режим GPU.

На слово мы давно никому не верим, даже себе, поэтому я прогнал тест: как скорость инференса Qwen-27B зависит от настроек энергопотребления. В целом, да, все правда. Особенно бессмысленным был заводской разгон с 350 до 420W.

Генерация
• 420 Вт: 41,58 ток/с
• 350 Вт: 40,71 (−2,1%)
• 300 Вт: 39,31 (−5,4%)

Промпт
• 420 Вт: 1394 ток/с
• 350 Вт: 1337 (−4,1%)
• 300 Вт: 1256 (−9,9%)

Ядро, макс
• 420 Вт: 82,5 °C
• 350 Вт: 71,3 °C
• 300 Вт: 65,5 °C

Память, макс
• 420 Вт: 96 °C
• 350 Вт: 90 °C
• 300 Вт: 88 °C

Hotspot, макс
• 420 Вт: 97,1 °C
• 350 Вт: 84,3 °C
• 300 Вт: 76,9 °C

Вентиляторы
• 420 Вт: ~78%
• 350 Вт: ~65%
• 300 Вт: ~58%

Ток/с на кВт
• 420 Вт: 100%
• 350 Вт: +17,5%
• 300 Вт: +32,4%

Что из этого следует:
- Память (самое уязвимое место 3090) почти не реагирует на лимит: 96 → 90 → 88 °C — её температуру на обоих пониженных лимитах держит вентиляция, а не ватты.
- Ядро реагирует сильно: −17 °C на 300 Вт — кулер FTW3 справляется с огромным запасом.
- Полная цена от 420 до 300 Вт — −5,4% скорости при одиночных запросах, а промпт-обработка (батчи токенов) режется ощутимее, как и предупреждали люди на r/LocalLLaMA: батч-режим пострадает сильнее.
- Если работа с LLM у тебя в основном одиночные запросы — 300–320 Вт разумный повседневный режим: карта на 17 °C холоднее и заметно тише, скорость на глаз неотличима.


Отдельно надо сказать, что я очень доволен тем, как агент Гермес организовал тест. Он сам скачал HWINFO. Он сказал, что мне с ним делать, чтобы, запустив его, агент смог снять нужные температуры. Он сам скачал все, что надо, запустил все, что надо, и собрал выводы.

По-хорошему, надо проверять, что он нигде в этом деле не косякнул. Хотя бы в общих чертах или выборочно по ключевым точкам. Потому что косячат они регулярно, но подают результаты, как будто всё нормально.
Please open Telegram to view this post
VIEW IN TELEGRAM
Сейчас делал простые административные задачи. Разобраться, почему ssh не работает при доступе к NAS. Проблема вот в чем: GLM 5.3 Flash и DeepSeek V4.1 Flash оба думают нереально долго. Их цикл — там буквально пять минут, семь минут. В логе thinking видно, что их циклит. Мне пришлось прерывать, до того как они выдают первую команду.

GPT 6.1 в режиме low отвечает почти моментально и решает проблему быстро. Более того, Qwen 27B тоже реагирует более-менее адекватно, гораздо лучше, чем эти модели, которые должны быть его умнее.

Это у меня лыжи не едут, или у всех так?

Это, в общем, был контрольный вопрос. А по существу могу сказать, что GPT-6.1 в режиме low круче, чем китайские модели Flash. И стоит в итоге дешевле просто потому, что тратит меньше токенов на те же задачи. Мои поздравления команде OpenAI, которая таки вырвала очко у китайцев.
👍2
Популярный пост от папы римского.
Gaperton's Tech Corner
Популярный пост от папы римского.
Надо отметить, что я не разделяю его опасений.

Разница, как он сам говорит, онтологическая.

Машина лишена агентности и, таким образом, не может быть автором ничего, и не может нести ответственность за свои поступки. У машины нет желаний, воли, и поступков.

Автор — не машина, а всегда человек, пользующийся или не пользующийся машиной.
👍7
Народ в Х обратил внимание, что в этом графике логарифмическая шкала по цене, и теперь все делятся картинками, чтобы осознать, что же это значит.
Gaperton's Tech Corner
Народ в Х обратил внимание, что в этом графике логарифмическая шкала по цене, и теперь все делятся картинками, чтобы осознать, что же это значит.
А значит это примерно вот что.

На практике, если вы платите за токены, вам не нужно ничего, кроме GPT-6.1 Sol High/XHigh. И Амадей идет в сад.

И, кстати, еще неизвестно, насколько субсидированная цена OpenAI. Очень может быть, что нет. У них модели тратят в десятки раз меньше токенов на ту же задачу.

Но одно можно сказать точно: конкуренция — это прекрасно.

И надо понимать, что это всё временно, и что через несколько лет примерно все будут делать это примерно одинаково. Что один человек создал, другой всегда сможет повторить. А поэтому совершенно не важно, насколько сейчас Китай отстает. Это не спринт, а марафон. И выигрывает его тот, у кого модель бесплатная.

Самое лучшее, что можно сделать в этой ситуации, — это избежать вендорлока. Пользуйтесь например Гермесом.
🔥2
Европа наносит ответный удар. Они выпустили новую модель.

Порванная на британский (или французский?) флаг жопа, для того чтобы сравняться с GPT-6 Luna и немного отстать от DeepSeek c бесплатным Qwen3.8-Flash-Next.

Я думаю, в конце этого месяца мы все с удовольствием посмотрим, как китайская Qwen4 на 27B параметров порвёт модель с 1T.
😁4
Forwarded from Андрей Зорин
https://codeberg.org/StillDeadcode/radiance - а вот на Radiance чистом, не vllm форке, Qwen3.8-flash-next завелся и полетел 140+ токенов в секунду декод, 6,5-7к префилл. На 2-х Radeon R9700