Gaperton's Tech Corner
373 subscribers
647 photos
47 videos
1 file
444 links
Технология, жизнь, и немного классической философии

https://gaperton.substack.com
Download Telegram
И опять об OpenCode Go

После примерной недельной практики использования выяснилось следующее.

1. GLM-5.3 Flash — крайне годная модель, которая отлично подходит в качестве основной для Гермес.
2. В OpenCode Go за 10 USD вы её покупаете в таком же объёме, как у Zai за 60 долларов.

А больше, в общем, ничего там и не нужно. Она лучше чем GPT-6 Luna в Codex (на которую всегда можно переключиться). Так что я оставляю подписку. И Codex GPT-6 Sol/Astra для тяжелых случаев. Grok отменил.
👍5
Сегодняшний релиз OpenAI

Это очень хороший релиз. Теперь модель GPT-6.1 Sol конкурентоспособна по цене. Не хуже китайских. Возникает, конечно, вопрос: не субсидированная ли эта цена?
Gaperton's Tech Corner
Сегодняшний релиз OpenAI Это очень хороший релиз. Теперь модель GPT-6.1 Sol конкурентоспособна по цене. Не хуже китайских. Возникает, конечно, вопрос: не субсидированная ли эта цена?
Вам может быть интересно, как так у них получилось. А вот как, посмотрите.

Нет, дело не только в субсидированной цене. Дело в том, что одна и та же задача решается в небольшом количестве токенов. Что на практике делает модель быстрее, а не только дешевле.

В общем, что я могу сказать? Конкуренция — это прекрасно. Продолжайте. Несмотря на это, я все равно не хочу зависеть от одного поставщика. Независимо от того, насколько хорошие у него модели. Так что OpenCode Go как способ дешевого доступа к китайским моделям остается.

Еще у меня, конечно же, есть яростно субсидированная подписка от anthropic за 20 долларов. Сугубо для того, чтобы разорить Амодея. Я старательно её выжигаю, когда могу. Дело принципа.
Долбоебы из антропик написали новую статью с рекламой GLM-5.3. Пишут, что крутая модель: эксплойт умеет делать не хуже, чем их Мифос.

GLM-5.3 and the spread of advanced cyber capabilities

https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities

Вы можете спросить, зачем они это делают. Ответ очень простой: они активно лоббируют лицензии на разработку ИИ. И запрет открытых моделей.
И, конечно, второе, что я сделал с новым MacBook, — это попробовал Qwen Image 2.1.

Самый простой способ это сделать, который известен мне, — это анслот десктоп. Вообще всё тупо.

Но вообще для этого Mac не нужен, там памяти надо совсем немного, восемь гигабайт VRAM пойдет.
👍1
Gaperton's Tech Corner
Пришел MacBook Pro M5 Max, 128 ГБ. Ну чё, скоро будем запускать на нем ВЕЩИ. Это у нас лучшее железо от Apple для запуска моделей еще на полтора года вперед. Не считая Maс Studio Ultra, конечно, которая уже стоит как автомобиль. P.S.: Он получил имя Aurelius.…
Импульсивная покупка прибывает в пятницу. Как я уже говорил, я считаю RTX 3090 24GB вполне нормальным бюджетным вариантом. Она мне нужна на замену старой RTX 2070, и цены на неё сейчас примерно полторы тысячи долларов на eBay.

Следующий бюджетный вариант от nVidia — это уже 4000 долларов, за A6000 48GB.

А за ним идет RTX 5090 32GB, которая стоит примерно 5000 долларов.
👍4
Не очень понятно, с какого хуя языковая модель должна быть чьим-то моральным компасом, но ладно.
Обещают Qwen3.8-Flash-Next на обычной карте nVidia, и нормальную скорость. В пятницу приедет 3090, проверю. У меня второй компьютер будет 24GB 3090 + 64GB DDR4. Самая популярная бюджетная опция. Для зажиточных крестьян. Конфигурации с двумя GPU — это уже следующий класс.

Strata

Запустите модель искусственного интеллекта с 125 миллиардами параметров на обычном игровом ПК

Одна видеокарта NVIDIA (12–24 ГБ) + 64 ГБ оперативной памяти · Windows или Linux · установка в один клик

Strata запускает Qwen3.8-Flash-Next — крупную интеллектуальную модель искусственного интеллекта, для работы которой обычно требуется сервер, — прямо на вашем персональном компьютере. Она генерирует ответы со скоростью 60–95 токенов в секунду (один токен составляет примерно ¾ слова): быстрее, чем вы успеваете читать.


An AMD Radeon RX 7900 XT / XTX, RX 9070 / 9070 XT or Radeon AI PRO R9700 on Linux works too. И пишут, что поддерживается сплит на две карты. Проверим и это. Если будет нормально работать на двух R9700, то ничего больше и не нужно.

https://github.com/Niko1221/Strata
🔥6
Gaperton's Tech Corner
Обещают Qwen3.8-Flash-Next на обычной карте nVidia, и нормальную скорость. В пятницу приедет 3090, проверю. У меня второй компьютер будет 24GB 3090 + 64GB DDR4. Самая популярная бюджетная опция. Для зажиточных крестьян. Конфигурации с двумя GPU — это уже следующий…
Вы можете спросить, насколько плохая эта квантизация в предыдущем посте, а там максимум, что есть, это три бита. И у нас есть ответ.

https://x.com/bnjmn_marie/status/2105481856812740726/photo/1

Она далеко не так плоха, как может показаться. Q2_K_XL вполне на уровне, но тратит на четверть больше токенов на размышления.

Эти модели уже вполне реальная практическая замена облачным. Не надо ждать от них паритета с Opus 5.5, но для повседневных задач они более чем достаточны. Это уровень GLM/DeepSeek Flash. Примерно соответствует фронтиру прошлой зимы.
🤔3
Я думаю, что в интересах общества ограничить использование компьютеров в госсекторе. Пусть на пишущих машинках под копирку законы печатают, блять. А еще лучше перевести их на гусиные перья. Может, тогда начнут думать над каждым словом.
💯7
Gaperton's Tech Corner
AMD Radeon RX 7900 XT / XTX, RX 9070 / 9070 XT or Radeon AI PRO R9700
Qwen3.8 Flash Next — R9V / ROCm 10

R9V — это не отдельный движок, а подобранный и «пиннутый» стек для запуска ровно одного сценария: Qwen3.8-Flash-Next на двух Radeon AI PRO R9700 (RDNA4/gfx1201) с tensor-параллелизмом (TP2), 128K контекстом и OpenAI-совместимым API. Внутри: форк vLLM, есть отдельная GGUF-загрузка, спец-ядра под gfx1201, offload экспертов в RAM, и MTP-спекулятивное декодирование на 4 токена (MTP4).

А вот отчет о тестировании. 2× Radeon AI PRO R9700 32 GB, 64 GB host RAM

https://github.com/kyuz0/amd-r9700-ai-toolboxes/blob/main/docs/r9v-rocm-10.0.md

В общем, запустить эту модель на моем оборудовании можно уже сейчас.
👍4🔥1
Вот смотрите, фронтир-модели косячат с ответами, несмотря на то что все знания мира у них в весах.

У модели Qwen 27B не все знания мира в весах.

И тем, и другим нужен поиск, который опирается на знания, написанные людьми.

Ну а раз Qwen 27B уже достаточно умен, и всем все равно нужен поиск, так зачем нужно пихать все знания в веса модели?

А если не нужно, так почему не дистиллировать то, что реально нужно, в малую модель, которая влезает, ну, например, в 64 гигабайта VRAM? А все остальное делать поиском?
👍1
Media is too big
VIEW IN TELEGRAM
Продуктовые идеи.
😁3🤷‍♂1
НОВОСТЬ: Согласно сенсационному репортажу в «Нью-Йорк Таймс», соучредитель компании Anthropic Крис Олах пригрозил покинуть презентацию энциклики Папы Льва XIV по искусственному интеллекту, состоявшуюся в мае, поскольку папа отверг идею о том, что машины могут обладать сознанием.

Затем команда Олаха в частном порядке пыталась убедить советников папы «серьёзно отнестись к возможности существования сознания у моделей». Папа Лев XIV остался непреклонен.

В течение нескольких месяцев компания Anthropic устраивала теологам и религиоведам роскошные ужины и приёмы, заключая с ними соглашения о неразглашении, в надежде, что они одобрят идею о том, что модель «Клод» обладает моральным статусом.

https://x.com/ChristopherHale/status/2106011594182304234?s=20

Чем дальше смотрю на все это, тем больше у меня, на самом деле, появляется уважения к христианству. Потому что, когда все институты общества, которые, казалось бы, должны защищать человека, провернули его на хую, церковь стоит последним бастионом.
👍4
Надо тестировать свежекупленную RTX 3090. Агент Гермес отвечает, что из этого он может сделать сам. Утверждает, что почти все.

Пусть делает. А я пошел в бар пиво пить. Надо только настроить Telegram, чтобы он писал мне, как идет работа.
❤3
🤷‍♂3
Gaperton's Tech Corner
Надо тестировать свежекупленную RTX 3090. Агент Гермес отвечает, что из этого он может сделать сам. Утверждает, что почти все. Пусть делает. А я пошел в бар пиво пить. Надо только настроить Telegram, чтобы он писал мне, как идет работа.
Об энергопотреблении GPU и его влиянии на скорость LLM

Тест выдавал странные температуры, я даже забеспокоился. И совершенно случайно выяснил, что мой GPU имеет не стандартное для 3090 потребление 350W а оверлокнутое 420W. 😳

В сообществе есть на эту тему консенсус. Почти все, кто делает инференс, ограничивают потребление ниже заводского. Производительность инференса в основном упирается в память, а не в компьют, и поэтому такое ограничение значительно снижает энергопотребление, но практически не влияет на скорость. Это делают по ряду причин: начиная с экономии электричества и заканчивая тем, чтобы дать больше резерва блоку питания и снизить температурный режим GPU.

На слово мы давно никому не верим, даже себе, поэтому я прогнал тест: как скорость инференса Qwen-27B зависит от настроек энергопотребления. В целом, да, все правда. Особенно бессмысленным был заводской разгон с 350 до 420W.

Генерация
• 420 Вт: 41,58 ток/с
• 350 Вт: 40,71 (−2,1%)
• 300 Вт: 39,31 (−5,4%)

Промпт
• 420 Вт: 1394 ток/с
• 350 Вт: 1337 (−4,1%)
• 300 Вт: 1256 (−9,9%)

Ядро, макс
• 420 Вт: 82,5 °C
• 350 Вт: 71,3 °C
• 300 Вт: 65,5 °C

Память, макс
• 420 Вт: 96 °C
• 350 Вт: 90 °C
• 300 Вт: 88 °C

Hotspot, макс
• 420 Вт: 97,1 °C
• 350 Вт: 84,3 °C
• 300 Вт: 76,9 °C

Вентиляторы
• 420 Вт: ~78%
• 350 Вт: ~65%
• 300 Вт: ~58%

Ток/с на кВт
• 420 Вт: 100%
• 350 Вт: +17,5%
• 300 Вт: +32,4%

Что из этого следует:
- Память (самое уязвимое место 3090) почти не реагирует на лимит: 96 → 90 → 88 °C — её температуру на обоих пониженных лимитах держит вентиляция, а не ватты.
- Ядро реагирует сильно: −17 °C на 300 Вт — кулер FTW3 справляется с огромным запасом.
- Полная цена от 420 до 300 Вт — −5,4% скорости при одиночных запросах, а промпт-обработка (батчи токенов) режется ощутимее, как и предупреждали люди на r/LocalLLaMA: батч-режим пострадает сильнее.
- Если работа с LLM у тебя в основном одиночные запросы — 300–320 Вт разумный повседневный режим: карта на 17 °C холоднее и заметно тише, скорость на глаз неотличима.


Отдельно надо сказать, что я очень доволен тем, как агент Гермес организовал тест. Он сам скачал HWINFO. Он сказал, что мне с ним делать, чтобы, запустив его, агент смог снять нужные температуры. Он сам скачал все, что надо, запустил все, что надо, и собрал выводы.

По-хорошему, надо проверять, что он нигде в этом деле не косякнул. Хотя бы в общих чертах или выборочно по ключевым точкам. Потому что косячат они регулярно, но подают результаты, как будто всё нормально.
Please open Telegram to view this post
VIEW IN TELEGRAM
Сейчас делал простые административные задачи. Разобраться, почему ssh не работает при доступе к NAS. Проблема вот в чем: GLM 5.3 Flash и DeepSeek V4.1 Flash оба думают нереально долго. Их цикл — там буквально пять минут, семь минут. В логе thinking видно, что их циклит. Мне пришлось прерывать, до того как они выдают первую команду.

GPT 6.1 в режиме low отвечает почти моментально и решает проблему быстро. Более того, Qwen 27B тоже реагирует более-менее адекватно, гораздо лучше, чем эти модели, которые должны быть его умнее.

Это у меня лыжи не едут, или у всех так?

Это, в общем, был контрольный вопрос. А по существу могу сказать, что GPT-6.1 в режиме low круче, чем китайские модели Flash. И стоит в итоге дешевле просто потому, что тратит меньше токенов на те же задачи. Мои поздравления команде OpenAI, которая таки вырвала очко у китайцев.
👍2
Популярный пост от папы римского.
Gaperton's Tech Corner
Популярный пост от папы римского.
Надо отметить, что я не разделяю его опасений.

Разница, как он сам говорит, онтологическая.

Машина лишена агентности и, таким образом, не может быть автором ничего, и не может нести ответственность за свои поступки. У машины нет желаний, воли, и поступков.

Автор — не машина, а всегда человек, пользующийся или не пользующийся машиной.
👍7