Обещают Qwen3.8-Flash-Next на обычной карте nVidia, и нормальную скорость. В пятницу приедет 3090, проверю. У меня второй компьютер будет 24GB 3090 + 64GB DDR4. Самая популярная бюджетная опция. Для зажиточных крестьян. Конфигурации с двумя GPU — это уже следующий класс.
An AMD Radeon RX 7900 XT / XTX, RX 9070 / 9070 XT or Radeon AI PRO R9700 on Linux works too. И пишут, что поддерживается сплит на две карты. Проверим и это. Если будет нормально работать на двух R9700, то ничего больше и не нужно.
https://github.com/Niko1221/Strata
Strata
Запустите модель искусственного интеллекта с 125 миллиардами параметров на обычном игровом ПК
Одна видеокарта NVIDIA (12–24 ГБ) + 64 ГБ оперативной памяти · Windows или Linux · установка в один клик
Strata запускает Qwen3.8-Flash-Next — крупную интеллектуальную модель искусственного интеллекта, для работы которой обычно требуется сервер, — прямо на вашем персональном компьютере. Она генерирует ответы со скоростью 60–95 токенов в секунду (один токен составляет примерно ¾ слова): быстрее, чем вы успеваете читать.
An AMD Radeon RX 7900 XT / XTX, RX 9070 / 9070 XT or Radeon AI PRO R9700 on Linux works too. И пишут, что поддерживается сплит на две карты. Проверим и это. Если будет нормально работать на двух R9700, то ничего больше и не нужно.
https://github.com/Niko1221/Strata
🔥6
Gaperton's Tech Corner
Обещают Qwen3.8-Flash-Next на обычной карте nVidia, и нормальную скорость. В пятницу приедет 3090, проверю. У меня второй компьютер будет 24GB 3090 + 64GB DDR4. Самая популярная бюджетная опция. Для зажиточных крестьян. Конфигурации с двумя GPU — это уже следующий…
Вы можете спросить, насколько плохая эта квантизация в предыдущем посте, а там максимум, что есть, это три бита. И у нас есть ответ.
https://x.com/bnjmn_marie/status/2105481856812740726/photo/1
Она далеко не так плоха, как может показаться. Q2_K_XL вполне на уровне, но тратит на четверть больше токенов на размышления.
Эти модели уже вполне реальная практическая замена облачным. Не надо ждать от них паритета с Opus 5.5, но для повседневных задач они более чем достаточны. Это уровень GLM/DeepSeek Flash. Примерно соответствует фронтиру прошлой зимы.
https://x.com/bnjmn_marie/status/2105481856812740726/photo/1
Она далеко не так плоха, как может показаться. Q2_K_XL вполне на уровне, но тратит на четверть больше токенов на размышления.
Эти модели уже вполне реальная практическая замена облачным. Не надо ждать от них паритета с Opus 5.5, но для повседневных задач они более чем достаточны. Это уровень GLM/DeepSeek Flash. Примерно соответствует фронтиру прошлой зимы.
🤔3
Gaperton's Tech Corner
AMD Radeon RX 7900 XT / XTX, RX 9070 / 9070 XT or Radeon AI PRO R9700
Qwen3.8 Flash Next — R9V / ROCm 10
R9V — это не отдельный движок, а подобранный и «пиннутый» стек для запуска ровно одного сценария: Qwen3.8-Flash-Next на двух Radeon AI PRO R9700 (RDNA4/gfx1201) с tensor-параллелизмом (TP2), 128K контекстом и OpenAI-совместимым API. Внутри: форк vLLM, есть отдельная GGUF-загрузка, спец-ядра под gfx1201, offload экспертов в RAM, и MTP-спекулятивное декодирование на 4 токена (MTP4).
А вот отчет о тестировании. 2× Radeon AI PRO R9700 32 GB, 64 GB host RAM
https://github.com/kyuz0/amd-r9700-ai-toolboxes/blob/main/docs/r9v-rocm-10.0.md
В общем, запустить эту модель на моем оборудовании можно уже сейчас.
R9V — это не отдельный движок, а подобранный и «пиннутый» стек для запуска ровно одного сценария: Qwen3.8-Flash-Next на двух Radeon AI PRO R9700 (RDNA4/gfx1201) с tensor-параллелизмом (TP2), 128K контекстом и OpenAI-совместимым API. Внутри: форк vLLM, есть отдельная GGUF-загрузка, спец-ядра под gfx1201, offload экспертов в RAM, и MTP-спекулятивное декодирование на 4 токена (MTP4).
А вот отчет о тестировании. 2× Radeon AI PRO R9700 32 GB, 64 GB host RAM
https://github.com/kyuz0/amd-r9700-ai-toolboxes/blob/main/docs/r9v-rocm-10.0.md
В общем, запустить эту модель на моем оборудовании можно уже сейчас.
👍4🔥1
Вот смотрите, фронтир-модели косячат с ответами, несмотря на то что все знания мира у них в весах.
У модели Qwen 27B не все знания мира в весах.
И тем, и другим нужен поиск, который опирается на знания, написанные людьми.
Ну а раз Qwen 27B уже достаточно умен, и всем все равно нужен поиск, так зачем нужно пихать все знания в веса модели?
А если не нужно, так почему не дистиллировать то, что реально нужно, в малую модель, которая влезает, ну, например, в 64 гигабайта VRAM? А все остальное делать поиском?
У модели Qwen 27B не все знания мира в весах.
И тем, и другим нужен поиск, который опирается на знания, написанные людьми.
Ну а раз Qwen 27B уже достаточно умен, и всем все равно нужен поиск, так зачем нужно пихать все знания в веса модели?
А если не нужно, так почему не дистиллировать то, что реально нужно, в малую модель, которая влезает, ну, например, в 64 гигабайта VRAM? А все остальное делать поиском?
👍1
Gaperton's Tech Corner
Qwen3.8 Flash Next — R9V / ROCm 10 R9V — это не отдельный движок, а подобранный и «пиннутый» стек для запуска ровно одного сценария: Qwen3.8-Flash-Next на двух Radeon AI PRO R9700 (RDNA4/gfx1201) с tensor-параллелизмом (TP2), 128K контекстом и OpenAI-совместимым…
#truth Я лично уже неделю как сразу начинаю с китайской. GLM-5.3 Flash. Приносят всё, что нужно, пиздят меньше.
👍4
НОВОСТЬ: Согласно сенсационному репортажу в «Нью-Йорк Таймс», соучредитель компании Anthropic Крис Олах пригрозил покинуть презентацию энциклики Папы Льва XIV по искусственному интеллекту, состоявшуюся в мае, поскольку папа отверг идею о том, что машины могут обладать сознанием.
Затем команда Олаха в частном порядке пыталась убедить советников папы «серьёзно отнестись к возможности существования сознания у моделей». Папа Лев XIV остался непреклонен.
В течение нескольких месяцев компания Anthropic устраивала теологам и религиоведам роскошные ужины и приёмы, заключая с ними соглашения о неразглашении, в надежде, что они одобрят идею о том, что модель «Клод» обладает моральным статусом.
https://x.com/ChristopherHale/status/2106011594182304234?s=20
Чем дальше смотрю на все это, тем больше у меня, на самом деле, появляется уважения к христианству. Потому что, когда все институты общества, которые, казалось бы, должны защищать человека, провернули его на хую, церковь стоит последним бастионом.
X (formerly Twitter)
Christopher Hale (@ChristopherHale) on X
NEW: According to a bombshell report in the New York Times, Anthropic co-founder Chris Olah threatened to walk out of Pope Leo XIV’s AI encyclical launch in May because the pope rejected the idea …
👍4
Gaperton's Tech Corner
Надо тестировать свежекупленную RTX 3090. Агент Гермес отвечает, что из этого он может сделать сам. Утверждает, что почти все. Пусть делает. А я пошел в бар пиво пить. Надо только настроить Telegram, чтобы он писал мне, как идет работа.
Об энергопотреблении GPU и его влиянии на скорость LLM
Тест выдавал странные температуры, я даже забеспокоился. И совершенно случайно выяснил, что мой GPU имеет не стандартное для 3090 потребление 350W а оверлокнутое 420W.😳
В сообществе есть на эту тему консенсус. Почти все, кто делает инференс, ограничивают потребление ниже заводского. Производительность инференса в основном упирается в память, а не в компьют, и поэтому такое ограничение значительно снижает энергопотребление, но практически не влияет на скорость. Это делают по ряду причин: начиная с экономии электричества и заканчивая тем, чтобы дать больше резерва блоку питания и снизить температурный режим GPU.
На слово мы давно никому не верим, даже себе, поэтому я прогнал тест: как скорость инференса Qwen-27B зависит от настроек энергопотребления. В целом, да, все правда. Особенно бессмысленным был заводской разгон с 350 до 420W.
Отдельно надо сказать, что я очень доволен тем, как агент Гермес организовал тест. Он сам скачал HWINFO. Он сказал, что мне с ним делать, чтобы, запустив его, агент смог снять нужные температуры. Он сам скачал все, что надо, запустил все, что надо, и собрал выводы.
По-хорошему, надо проверять, что он нигде в этом деле не косякнул. Хотя бы в общих чертах или выборочно по ключевым точкам. Потому что косячат они регулярно, но подают результаты, как будто всё нормально.
Тест выдавал странные температуры, я даже забеспокоился. И совершенно случайно выяснил, что мой GPU имеет не стандартное для 3090 потребление 350W а оверлокнутое 420W.
В сообществе есть на эту тему консенсус. Почти все, кто делает инференс, ограничивают потребление ниже заводского. Производительность инференса в основном упирается в память, а не в компьют, и поэтому такое ограничение значительно снижает энергопотребление, но практически не влияет на скорость. Это делают по ряду причин: начиная с экономии электричества и заканчивая тем, чтобы дать больше резерва блоку питания и снизить температурный режим GPU.
На слово мы давно никому не верим, даже себе, поэтому я прогнал тест: как скорость инференса Qwen-27B зависит от настроек энергопотребления. В целом, да, все правда. Особенно бессмысленным был заводской разгон с 350 до 420W.
Генерация
• 420 Вт: 41,58 ток/с
• 350 Вт: 40,71 (−2,1%)
• 300 Вт: 39,31 (−5,4%)
Промпт
• 420 Вт: 1394 ток/с
• 350 Вт: 1337 (−4,1%)
• 300 Вт: 1256 (−9,9%)
Ядро, макс
• 420 Вт: 82,5 °C
• 350 Вт: 71,3 °C
• 300 Вт: 65,5 °C
Память, макс
• 420 Вт: 96 °C
• 350 Вт: 90 °C
• 300 Вт: 88 °C
Hotspot, макс
• 420 Вт: 97,1 °C
• 350 Вт: 84,3 °C
• 300 Вт: 76,9 °C
Вентиляторы
• 420 Вт: ~78%
• 350 Вт: ~65%
• 300 Вт: ~58%
Ток/с на кВт
• 420 Вт: 100%
• 350 Вт: +17,5%
• 300 Вт: +32,4%
Что из этого следует:
- Память (самое уязвимое место 3090) почти не реагирует на лимит: 96 → 90 → 88 °C — её температуру на обоих пониженных лимитах держит вентиляция, а не ватты.
- Ядро реагирует сильно: −17 °C на 300 Вт — кулер FTW3 справляется с огромным запасом.
- Полная цена от 420 до 300 Вт — −5,4% скорости при одиночных запросах, а промпт-обработка (батчи токенов) режется ощутимее, как и предупреждали люди на r/LocalLLaMA: батч-режим пострадает сильнее.
- Если работа с LLM у тебя в основном одиночные запросы — 300–320 Вт разумный повседневный режим: карта на 17 °C холоднее и заметно тише, скорость на глаз неотличима.
Отдельно надо сказать, что я очень доволен тем, как агент Гермес организовал тест. Он сам скачал HWINFO. Он сказал, что мне с ним делать, чтобы, запустив его, агент смог снять нужные температуры. Он сам скачал все, что надо, запустил все, что надо, и собрал выводы.
По-хорошему, надо проверять, что он нигде в этом деле не косякнул. Хотя бы в общих чертах или выборочно по ключевым точкам. Потому что косячат они регулярно, но подают результаты, как будто всё нормально.
Please open Telegram to view this post
VIEW IN TELEGRAM
Сейчас делал простые административные задачи. Разобраться, почему ssh не работает при доступе к NAS. Проблема вот в чем: GLM 5.3 Flash и DeepSeek V4.1 Flash оба думают нереально долго. Их цикл — там буквально пять минут, семь минут. В логе thinking видно, что их циклит. Мне пришлось прерывать, до того как они выдают первую команду.
GPT 6.1 в режиме low отвечает почти моментально и решает проблему быстро. Более того, Qwen 27B тоже реагирует более-менее адекватно, гораздо лучше, чем эти модели, которые должны быть его умнее.
Это у меня лыжи не едут, или у всех так?
Это, в общем, был контрольный вопрос. А по существу могу сказать, что GPT-6.1 в режиме low круче, чем китайские модели Flash. И стоит в итоге дешевле просто потому, что тратит меньше токенов на те же задачи. Мои поздравления команде OpenAI, которая таки вырвала очко у китайцев.
GPT 6.1 в режиме low отвечает почти моментально и решает проблему быстро. Более того, Qwen 27B тоже реагирует более-менее адекватно, гораздо лучше, чем эти модели, которые должны быть его умнее.
Это у меня лыжи не едут, или у всех так?
Это, в общем, был контрольный вопрос. А по существу могу сказать, что GPT-6.1 в режиме low круче, чем китайские модели Flash. И стоит в итоге дешевле просто потому, что тратит меньше токенов на те же задачи. Мои поздравления команде OpenAI, которая таки вырвала очко у китайцев.
👍2
Gaperton's Tech Corner
Популярный пост от папы римского.
Надо отметить, что я не разделяю его опасений.
Разница, как он сам говорит, онтологическая.
Машина лишена агентности и, таким образом, не может быть автором ничего, и не может нести ответственность за свои поступки. У машины нет желаний, воли, и поступков.
Автор — не машина, а всегда человек, пользующийся или не пользующийся машиной.
Разница, как он сам говорит, онтологическая.
Машина лишена агентности и, таким образом, не может быть автором ничего, и не может нести ответственность за свои поступки. У машины нет желаний, воли, и поступков.
Автор — не машина, а всегда человек, пользующийся или не пользующийся машиной.
👍7
Gaperton's Tech Corner
Народ в Х обратил внимание, что в этом графике логарифмическая шкала по цене, и теперь все делятся картинками, чтобы осознать, что же это значит.
А значит это примерно вот что.
На практике, если вы платите за токены, вам не нужно ничего, кроме GPT-6.1 Sol High/XHigh. И Амадей идет в сад.
И, кстати, еще неизвестно, насколько субсидированная цена OpenAI. Очень может быть, что нет. У них модели тратят в десятки раз меньше токенов на ту же задачу.
Но одно можно сказать точно: конкуренция — это прекрасно.
И надо понимать, что это всё временно, и что через несколько лет примерно все будут делать это примерно одинаково. Что один человек создал, другой всегда сможет повторить. А поэтому совершенно не важно, насколько сейчас Китай отстает. Это не спринт, а марафон. И выигрывает его тот, у кого модель бесплатная.
Самое лучшее, что можно сделать в этой ситуации, — это избежать вендорлока. Пользуйтесь например Гермесом.
На практике, если вы платите за токены, вам не нужно ничего, кроме GPT-6.1 Sol High/XHigh. И Амадей идет в сад.
И, кстати, еще неизвестно, насколько субсидированная цена OpenAI. Очень может быть, что нет. У них модели тратят в десятки раз меньше токенов на ту же задачу.
Но одно можно сказать точно: конкуренция — это прекрасно.
И надо понимать, что это всё временно, и что через несколько лет примерно все будут делать это примерно одинаково. Что один человек создал, другой всегда сможет повторить. А поэтому совершенно не важно, насколько сейчас Китай отстает. Это не спринт, а марафон. И выигрывает его тот, у кого модель бесплатная.
Самое лучшее, что можно сделать в этой ситуации, — это избежать вендорлока. Пользуйтесь например Гермесом.
🔥2
Gaperton's Tech Corner
Надо отметить, что я не разделяю его опасений. Разница, как он сам говорит, онтологическая. Машина лишена агентности и, таким образом, не может быть автором ничего, и не может нести ответственность за свои поступки. У машины нет желаний, воли, и поступков.…
Please open Telegram to view this post
VIEW IN TELEGRAM
😁7
Европа наносит ответный удар. Они выпустили новую модель.
Порванная на британский (или французский?) флаг жопа, для того чтобы сравняться с GPT-6 Luna и немного отстать от DeepSeek c бесплатным Qwen3.8-Flash-Next.
Я думаю, в конце этого месяца мы все с удовольствием посмотрим, как китайская Qwen4 на 27B параметров порвёт модель с 1T.
Порванная на британский (или французский?) флаг жопа, для того чтобы сравняться с GPT-6 Luna и немного отстать от DeepSeek c бесплатным Qwen3.8-Flash-Next.
Я думаю, в конце этого месяца мы все с удовольствием посмотрим, как китайская Qwen4 на 27B параметров порвёт модель с 1T.
😁4
Gaperton's Tech Corner
Европа наносит ответный удар. Они выпустили новую модель. Порванная на британский (или французский?) флаг жопа, для того чтобы сравняться с GPT-6 Luna и немного отстать от DeepSeek c бесплатным Qwen3.8-Flash-Next. Я думаю, в конце этого месяца мы все с удовольствием…
И вы, таки, будете смеяться. Угадайте, в чем она хороша.
😁10
Forwarded from Андрей Зорин
https://codeberg.org/StillDeadcode/radiance - а вот на Radiance чистом, не vllm форке, Qwen3.8-flash-next завелся и полетел 140+ токенов в секунду декод, 6,5-7к префилл. На 2-х Radeon R9700
Codeberg.org
radiance
modular inference engine for people that want to get the most out of their hardware