Gaperton's Tech Corner
373 subscribers
654 photos
47 videos
1 file
447 links
Технология, жизнь, и немного классической философии

https://gaperton.substack.com
Download Telegram
Media is too big
VIEW IN TELEGRAM
Продуктовые идеи.
😁3🤷‍♂1
НОВОСТЬ: Согласно сенсационному репортажу в «Нью-Йорк Таймс», соучредитель компании Anthropic Крис Олах пригрозил покинуть презентацию энциклики Папы Льва XIV по искусственному интеллекту, состоявшуюся в мае, поскольку папа отверг идею о том, что машины могут обладать сознанием.

Затем команда Олаха в частном порядке пыталась убедить советников папы «серьёзно отнестись к возможности существования сознания у моделей». Папа Лев XIV остался непреклонен.

В течение нескольких месяцев компания Anthropic устраивала теологам и религиоведам роскошные ужины и приёмы, заключая с ними соглашения о неразглашении, в надежде, что они одобрят идею о том, что модель «Клод» обладает моральным статусом.

https://x.com/ChristopherHale/status/2106011594182304234?s=20

Чем дальше смотрю на все это, тем больше у меня, на самом деле, появляется уважения к христианству. Потому что, когда все институты общества, которые, казалось бы, должны защищать человека, провернули его на хую, церковь стоит последним бастионом.
👍4
Надо тестировать свежекупленную RTX 3090. Агент Гермес отвечает, что из этого он может сделать сам. Утверждает, что почти все.

Пусть делает. А я пошел в бар пиво пить. Надо только настроить Telegram, чтобы он писал мне, как идет работа.
❤3
🤷‍♂3
Gaperton's Tech Corner
Надо тестировать свежекупленную RTX 3090. Агент Гермес отвечает, что из этого он может сделать сам. Утверждает, что почти все. Пусть делает. А я пошел в бар пиво пить. Надо только настроить Telegram, чтобы он писал мне, как идет работа.
Об энергопотреблении GPU и его влиянии на скорость LLM

Тест выдавал странные температуры, я даже забеспокоился. И совершенно случайно выяснил, что мой GPU имеет не стандартное для 3090 потребление 350W а оверлокнутое 420W. 😳

В сообществе есть на эту тему консенсус. Почти все, кто делает инференс, ограничивают потребление ниже заводского. Производительность инференса в основном упирается в память, а не в компьют, и поэтому такое ограничение значительно снижает энергопотребление, но практически не влияет на скорость. Это делают по ряду причин: начиная с экономии электричества и заканчивая тем, чтобы дать больше резерва блоку питания и снизить температурный режим GPU.

На слово мы давно никому не верим, даже себе, поэтому я прогнал тест: как скорость инференса Qwen-27B зависит от настроек энергопотребления. В целом, да, все правда. Особенно бессмысленным был заводской разгон с 350 до 420W.

Генерация
• 420 Вт: 41,58 ток/с
• 350 Вт: 40,71 (−2,1%)
• 300 Вт: 39,31 (−5,4%)

Промпт
• 420 Вт: 1394 ток/с
• 350 Вт: 1337 (−4,1%)
• 300 Вт: 1256 (−9,9%)

Ядро, макс
• 420 Вт: 82,5 °C
• 350 Вт: 71,3 °C
• 300 Вт: 65,5 °C

Память, макс
• 420 Вт: 96 °C
• 350 Вт: 90 °C
• 300 Вт: 88 °C

Hotspot, макс
• 420 Вт: 97,1 °C
• 350 Вт: 84,3 °C
• 300 Вт: 76,9 °C

Вентиляторы
• 420 Вт: ~78%
• 350 Вт: ~65%
• 300 Вт: ~58%

Ток/с на кВт
• 420 Вт: 100%
• 350 Вт: +17,5%
• 300 Вт: +32,4%

Что из этого следует:
- Память (самое уязвимое место 3090) почти не реагирует на лимит: 96 → 90 → 88 °C — её температуру на обоих пониженных лимитах держит вентиляция, а не ватты.
- Ядро реагирует сильно: −17 °C на 300 Вт — кулер FTW3 справляется с огромным запасом.
- Полная цена от 420 до 300 Вт — −5,4% скорости при одиночных запросах, а промпт-обработка (батчи токенов) режется ощутимее, как и предупреждали люди на r/LocalLLaMA: батч-режим пострадает сильнее.
- Если работа с LLM у тебя в основном одиночные запросы — 300–320 Вт разумный повседневный режим: карта на 17 °C холоднее и заметно тише, скорость на глаз неотличима.


Отдельно надо сказать, что я очень доволен тем, как агент Гермес организовал тест. Он сам скачал HWINFO. Он сказал, что мне с ним делать, чтобы, запустив его, агент смог снять нужные температуры. Он сам скачал все, что надо, запустил все, что надо, и собрал выводы.

По-хорошему, надо проверять, что он нигде в этом деле не косякнул. Хотя бы в общих чертах или выборочно по ключевым точкам. Потому что косячат они регулярно, но подают результаты, как будто всё нормально.
Please open Telegram to view this post
VIEW IN TELEGRAM
Сейчас делал простые административные задачи. Разобраться, почему ssh не работает при доступе к NAS. Проблема вот в чем: GLM 5.3 Flash и DeepSeek V4.1 Flash оба думают нереально долго. Их цикл — там буквально пять минут, семь минут. В логе thinking видно, что их циклит. Мне пришлось прерывать, до того как они выдают первую команду.

GPT 6.1 в режиме low отвечает почти моментально и решает проблему быстро. Более того, Qwen 27B тоже реагирует более-менее адекватно, гораздо лучше, чем эти модели, которые должны быть его умнее.

Это у меня лыжи не едут, или у всех так?

Это, в общем, был контрольный вопрос. А по существу могу сказать, что GPT-6.1 в режиме low круче, чем китайские модели Flash. И стоит в итоге дешевле просто потому, что тратит меньше токенов на те же задачи. Мои поздравления команде OpenAI, которая таки вырвала очко у китайцев.
👍2
Популярный пост от папы римского.
Gaperton's Tech Corner
Популярный пост от папы римского.
Надо отметить, что я не разделяю его опасений.

Разница, как он сам говорит, онтологическая.

Машина лишена агентности и, таким образом, не может быть автором ничего, и не может нести ответственность за свои поступки. У машины нет желаний, воли, и поступков.

Автор — не машина, а всегда человек, пользующийся или не пользующийся машиной.
👍7
Народ в Х обратил внимание, что в этом графике логарифмическая шкала по цене, и теперь все делятся картинками, чтобы осознать, что же это значит.
Gaperton's Tech Corner
Народ в Х обратил внимание, что в этом графике логарифмическая шкала по цене, и теперь все делятся картинками, чтобы осознать, что же это значит.
А значит это примерно вот что.

На практике, если вы платите за токены, вам не нужно ничего, кроме GPT-6.1 Sol High/XHigh. И Амадей идет в сад.

И, кстати, еще неизвестно, насколько субсидированная цена OpenAI. Очень может быть, что нет. У них модели тратят в десятки раз меньше токенов на ту же задачу.

Но одно можно сказать точно: конкуренция — это прекрасно.

И надо понимать, что это всё временно, и что через несколько лет примерно все будут делать это примерно одинаково. Что один человек создал, другой всегда сможет повторить. А поэтому совершенно не важно, насколько сейчас Китай отстает. Это не спринт, а марафон. И выигрывает его тот, у кого модель бесплатная.

Самое лучшее, что можно сделать в этой ситуации, — это избежать вендорлока. Пользуйтесь например Гермесом.
🔥2
Европа наносит ответный удар. Они выпустили новую модель.

Порванная на британский (или французский?) флаг жопа, для того чтобы сравняться с GPT-6 Luna и немного отстать от DeepSeek c бесплатным Qwen3.8-Flash-Next.

Я думаю, в конце этого месяца мы все с удовольствием посмотрим, как китайская Qwen4 на 27B параметров порвёт модель с 1T.
😁4
Forwarded from Андрей Зорин
https://codeberg.org/StillDeadcode/radiance - а вот на Radiance чистом, не vllm форке, Qwen3.8-flash-next завелся и полетел 140+ токенов в секунду декод, 6,5-7к префилл. На 2-х Radeon R9700
Gaperton's Tech Corner
https://codeberg.org/StillDeadcode/radiance - а вот на Radiance чистом, не vllm форке, Qwen3.8-flash-next завелся и полетел 140+ токенов в секунду декод, 6,5-7к префилл. На 2-х Radeon R9700
Теперь тестируем движок Radiance, который является отдельным движком для моделей Qwen. Это не vllm fork. Почти никто за пределами собственного трекера задач не писал о нем. Движок стал доступен публике около 12 дней назад, и я не нашел независимых обзоров, блог постов или обсуждений на Reddit.

Qwen3.8-Flash-Next: 4-bit experts, int8 trunk, MTP, vision.

Контекст: 200K токенов на запрос из пула около 1,0M токенов, примерно 5 полных сеансов, с 8 последовательностями одновременно.

Holy fuck, господа присяжные заседатели. Надо проверить, нет ли в этом подвоха, потому что если его нет, то мы это оставляем.
🔥5
Gaperton's Tech Corner
Все, будущее наступило. Пробуем. У меня Qwen3.8-Flash-Next в проде. Качество, конечно, пока с 27B FP8 не сравнивал.
🔥 Предварительные результаты испытаний Qwen3.8-Flash (Radiance) — НАПАЛМ.

Модель уровня DeepSeek V4.1 Flash, работает бесплатно и заметно быстрее большинства моделей на OpenCode Go. Качество квантизации при этом очень высокое — лучше чем Q4_K_XL от unsloth.

Оборудование, напоминаю: 128 ГБ DDR4 и 2xR9700 32 Гб. Мать Asus x570-f. Это оборудование предыдущего поколения. Не считая GPU.

Все, короче, ничего не трогаем. И переносим все остальные модели на второй компьютер, для которого я купил 3090. Это у нас модели синтеза речи, распознавание речи, реранкер. Ну ещё хуйню навесим, типа вижен-модели.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5
Минутка work in progress

Короткий спойлер того, что будет в ближайшей статье.

Исследование производительности Radeon AI PRO R9700 вылилось в сравнение кучи рантаймов, половины линейки RTX PRO и попытки все это визуализировать.

Пока статья дописывается, краткое превью в виде диаграммы по мотивам постов в ТГ канале. 70-75 токенов в секунду в 27B модели в FP8 это очень интересный результат.

Полная статья будет на Sponsr. Подписывайтесь
🙏1