Gaperton's Tech Corner
И еще раз об агентской памяти 1. Я испытал Mem0. Она оказалась еще хуже, чем Хинсайд. Первая и, пожалуй, главная практическая проблема состоит в том, что её авторы в основном делают платный cloud-продукт, а open source-версии для них не настолько важен.…
https://hindsight.vectorize.io/developer/models#openai-codex-setup-chatgpt-pluspro
В качестве модели берете GPT-6 Luna.
С OpenRouter тоже можно, само собой. Но надо брать что-то реально дешевое. Там можно хорошо попасть на бабки. DeepSeek V4 Flash в принципе, пойдет.
В качестве локальной бесплатной модели пойдет Qwen3.6 35B-A3B. Но я теперь отношусь скептически к глупым моделям. Толку от памяти, которая галлюцинирует и не втыкает о чем и кто говорит, нет никакого, только вред.
Please open Telegram to view this post
VIEW IN TELEGRAM
hindsight.vectorize.io
Models | Hindsight
Hindsight uses several machine learning models for different tasks.
В основном я работаю с...
Anonymous Poll
46%
Windows
45%
macOS
53%
Linux
14%
iOS
18%
Android
2%
Другое
❤1
Пришел MacBook Pro M5 Max, 128 ГБ.
Ну чё, скоро будем запускать на нем ВЕЩИ.
Это у нас лучшее железо от Apple для запуска моделей еще на полтора года вперед. Не считая Maс Studio Ultra, конечно, которая уже стоит как автомобиль.
P.S.: Он получил имя Aurelius. В честь Марка Аврелия, "последнего хорошего императора Рима". А шел он почтой Америки два месяца.
Ну чё, скоро будем запускать на нем ВЕЩИ.
Это у нас лучшее железо от Apple для запуска моделей еще на полтора года вперед. Не считая Maс Studio Ultra, конечно, которая уже стоит как автомобиль.
P.S.: Он получил имя Aurelius. В честь Марка Аврелия, "последнего хорошего императора Рима". А шел он почтой Америки два месяца.
👍10🔥2
И опять об OpenCode Go
После примерной недельной практики использования выяснилось следующее.
1. GLM-5.3 Flash — крайне годная модель, которая отлично подходит в качестве основной для Гермес.
2. В OpenCode Go за 10 USD вы её покупаете в таком же объёме, как у Zai за 60 долларов.
А больше, в общем, ничего там и не нужно. Она лучше чем GPT-6 Luna в Codex (на которую всегда можно переключиться). Так что я оставляю подписку. И Codex GPT-6 Sol/Astra для тяжелых случаев. Grok отменил.
После примерной недельной практики использования выяснилось следующее.
1. GLM-5.3 Flash — крайне годная модель, которая отлично подходит в качестве основной для Гермес.
2. В OpenCode Go за 10 USD вы её покупаете в таком же объёме, как у Zai за 60 долларов.
А больше, в общем, ничего там и не нужно. Она лучше чем GPT-6 Luna в Codex (на которую всегда можно переключиться). Так что я оставляю подписку. И Codex GPT-6 Sol/Astra для тяжелых случаев. Grok отменил.
👍5
Gaperton's Tech Corner
Сегодняшний релиз OpenAI Это очень хороший релиз. Теперь модель GPT-6.1 Sol конкурентоспособна по цене. Не хуже китайских. Возникает, конечно, вопрос: не субсидированная ли эта цена?
Вам может быть интересно, как так у них получилось. А вот как, посмотрите.
Нет, дело не только в субсидированной цене. Дело в том, что одна и та же задача решается в небольшом количестве токенов. Что на практике делает модель быстрее, а не только дешевле.
В общем, что я могу сказать? Конкуренция — это прекрасно. Продолжайте. Несмотря на это, я все равно не хочу зависеть от одного поставщика. Независимо от того, насколько хорошие у него модели. Так что OpenCode Go как способ дешевого доступа к китайским моделям остается.
Еще у меня, конечно же, есть яростно субсидированная подписка от anthropic за 20 долларов. Сугубо для того, чтобы разорить Амодея. Я старательно её выжигаю, когда могу. Дело принципа.
Нет, дело не только в субсидированной цене. Дело в том, что одна и та же задача решается в небольшом количестве токенов. Что на практике делает модель быстрее, а не только дешевле.
В общем, что я могу сказать? Конкуренция — это прекрасно. Продолжайте. Несмотря на это, я все равно не хочу зависеть от одного поставщика. Независимо от того, насколько хорошие у него модели. Так что OpenCode Go как способ дешевого доступа к китайским моделям остается.
Еще у меня, конечно же, есть яростно субсидированная подписка от anthropic за 20 долларов. Сугубо для того, чтобы разорить Амодея. Я старательно её выжигаю, когда могу. Дело принципа.
Долбоебы из антропик написали новую статью с рекламой GLM-5.3. Пишут, что крутая модель: эксплойт умеет делать не хуже, чем их Мифос.
GLM-5.3 and the spread of advanced cyber capabilities
https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities
Вы можете спросить, зачем они это делают. Ответ очень простой: они активно лоббируют лицензии на разработку ИИ. И запрет открытых моделей.
GLM-5.3 and the spread of advanced cyber capabilities
https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities
Вы можете спросить, зачем они это делают. Ответ очень простой: они активно лоббируют лицензии на разработку ИИ. И запрет открытых моделей.
И, конечно, второе, что я сделал с новым MacBook, — это попробовал Qwen Image 2.1.
Самый простой способ это сделать, который известен мне, — это анслот десктоп. Вообще всё тупо.
Но вообще для этого Mac не нужен, там памяти надо совсем немного, восемь гигабайт VRAM пойдет.
Самый простой способ это сделать, который известен мне, — это анслот десктоп. Вообще всё тупо.
Но вообще для этого Mac не нужен, там памяти надо совсем немного, восемь гигабайт VRAM пойдет.
👍1
Gaperton's Tech Corner
Пришел MacBook Pro M5 Max, 128 ГБ. Ну чё, скоро будем запускать на нем ВЕЩИ. Это у нас лучшее железо от Apple для запуска моделей еще на полтора года вперед. Не считая Maс Studio Ultra, конечно, которая уже стоит как автомобиль. P.S.: Он получил имя Aurelius.…
Импульсивная покупка прибывает в пятницу. Как я уже говорил, я считаю RTX 3090 24GB вполне нормальным бюджетным вариантом. Она мне нужна на замену старой RTX 2070, и цены на неё сейчас примерно полторы тысячи долларов на eBay.
Следующий бюджетный вариант от nVidia — это уже 4000 долларов, за A6000 48GB.
А за ним идет RTX 5090 32GB, которая стоит примерно 5000 долларов.
Следующий бюджетный вариант от nVidia — это уже 4000 долларов, за A6000 48GB.
А за ним идет RTX 5090 32GB, которая стоит примерно 5000 долларов.
👍4
Обещают Qwen3.8-Flash-Next на обычной карте nVidia, и нормальную скорость. В пятницу приедет 3090, проверю. У меня второй компьютер будет 24GB 3090 + 64GB DDR4. Самая популярная бюджетная опция. Для зажиточных крестьян. Конфигурации с двумя GPU — это уже следующий класс.
An AMD Radeon RX 7900 XT / XTX, RX 9070 / 9070 XT or Radeon AI PRO R9700 on Linux works too. И пишут, что поддерживается сплит на две карты. Проверим и это. Если будет нормально работать на двух R9700, то ничего больше и не нужно.
https://github.com/Niko1221/Strata
Strata
Запустите модель искусственного интеллекта с 125 миллиардами параметров на обычном игровом ПК
Одна видеокарта NVIDIA (12–24 ГБ) + 64 ГБ оперативной памяти · Windows или Linux · установка в один клик
Strata запускает Qwen3.8-Flash-Next — крупную интеллектуальную модель искусственного интеллекта, для работы которой обычно требуется сервер, — прямо на вашем персональном компьютере. Она генерирует ответы со скоростью 60–95 токенов в секунду (один токен составляет примерно ¾ слова): быстрее, чем вы успеваете читать.
An AMD Radeon RX 7900 XT / XTX, RX 9070 / 9070 XT or Radeon AI PRO R9700 on Linux works too. И пишут, что поддерживается сплит на две карты. Проверим и это. Если будет нормально работать на двух R9700, то ничего больше и не нужно.
https://github.com/Niko1221/Strata
🔥6
Gaperton's Tech Corner
Обещают Qwen3.8-Flash-Next на обычной карте nVidia, и нормальную скорость. В пятницу приедет 3090, проверю. У меня второй компьютер будет 24GB 3090 + 64GB DDR4. Самая популярная бюджетная опция. Для зажиточных крестьян. Конфигурации с двумя GPU — это уже следующий…
Вы можете спросить, насколько плохая эта квантизация в предыдущем посте, а там максимум, что есть, это три бита. И у нас есть ответ.
https://x.com/bnjmn_marie/status/2105481856812740726/photo/1
Она далеко не так плоха, как может показаться. Q2_K_XL вполне на уровне, но тратит на четверть больше токенов на размышления.
Эти модели уже вполне реальная практическая замена облачным. Не надо ждать от них паритета с Opus 5.5, но для повседневных задач они более чем достаточны. Это уровень GLM/DeepSeek Flash. Примерно соответствует фронтиру прошлой зимы.
https://x.com/bnjmn_marie/status/2105481856812740726/photo/1
Она далеко не так плоха, как может показаться. Q2_K_XL вполне на уровне, но тратит на четверть больше токенов на размышления.
Эти модели уже вполне реальная практическая замена облачным. Не надо ждать от них паритета с Opus 5.5, но для повседневных задач они более чем достаточны. Это уровень GLM/DeepSeek Flash. Примерно соответствует фронтиру прошлой зимы.
🤔3
Gaperton's Tech Corner
AMD Radeon RX 7900 XT / XTX, RX 9070 / 9070 XT or Radeon AI PRO R9700
Qwen3.8 Flash Next — R9V / ROCm 10
R9V — это не отдельный движок, а подобранный и «пиннутый» стек для запуска ровно одного сценария: Qwen3.8-Flash-Next на двух Radeon AI PRO R9700 (RDNA4/gfx1201) с tensor-параллелизмом (TP2), 128K контекстом и OpenAI-совместимым API. Внутри: форк vLLM, есть отдельная GGUF-загрузка, спец-ядра под gfx1201, offload экспертов в RAM, и MTP-спекулятивное декодирование на 4 токена (MTP4).
А вот отчет о тестировании. 2× Radeon AI PRO R9700 32 GB, 64 GB host RAM
https://github.com/kyuz0/amd-r9700-ai-toolboxes/blob/main/docs/r9v-rocm-10.0.md
В общем, запустить эту модель на моем оборудовании можно уже сейчас.
R9V — это не отдельный движок, а подобранный и «пиннутый» стек для запуска ровно одного сценария: Qwen3.8-Flash-Next на двух Radeon AI PRO R9700 (RDNA4/gfx1201) с tensor-параллелизмом (TP2), 128K контекстом и OpenAI-совместимым API. Внутри: форк vLLM, есть отдельная GGUF-загрузка, спец-ядра под gfx1201, offload экспертов в RAM, и MTP-спекулятивное декодирование на 4 токена (MTP4).
А вот отчет о тестировании. 2× Radeon AI PRO R9700 32 GB, 64 GB host RAM
https://github.com/kyuz0/amd-r9700-ai-toolboxes/blob/main/docs/r9v-rocm-10.0.md
В общем, запустить эту модель на моем оборудовании можно уже сейчас.
👍4🔥1
Вот смотрите, фронтир-модели косячат с ответами, несмотря на то что все знания мира у них в весах.
У модели Qwen 27B не все знания мира в весах.
И тем, и другим нужен поиск, который опирается на знания, написанные людьми.
Ну а раз Qwen 27B уже достаточно умен, и всем все равно нужен поиск, так зачем нужно пихать все знания в веса модели?
А если не нужно, так почему не дистиллировать то, что реально нужно, в малую модель, которая влезает, ну, например, в 64 гигабайта VRAM? А все остальное делать поиском?
У модели Qwen 27B не все знания мира в весах.
И тем, и другим нужен поиск, который опирается на знания, написанные людьми.
Ну а раз Qwen 27B уже достаточно умен, и всем все равно нужен поиск, так зачем нужно пихать все знания в веса модели?
А если не нужно, так почему не дистиллировать то, что реально нужно, в малую модель, которая влезает, ну, например, в 64 гигабайта VRAM? А все остальное делать поиском?
👍1
Gaperton's Tech Corner
Qwen3.8 Flash Next — R9V / ROCm 10 R9V — это не отдельный движок, а подобранный и «пиннутый» стек для запуска ровно одного сценария: Qwen3.8-Flash-Next на двух Radeon AI PRO R9700 (RDNA4/gfx1201) с tensor-параллелизмом (TP2), 128K контекстом и OpenAI-совместимым…
#truth Я лично уже неделю как сразу начинаю с китайской. GLM-5.3 Flash. Приносят всё, что нужно, пиздят меньше.
👍4
НОВОСТЬ: Согласно сенсационному репортажу в «Нью-Йорк Таймс», соучредитель компании Anthropic Крис Олах пригрозил покинуть презентацию энциклики Папы Льва XIV по искусственному интеллекту, состоявшуюся в мае, поскольку папа отверг идею о том, что машины могут обладать сознанием.
Затем команда Олаха в частном порядке пыталась убедить советников папы «серьёзно отнестись к возможности существования сознания у моделей». Папа Лев XIV остался непреклонен.
В течение нескольких месяцев компания Anthropic устраивала теологам и религиоведам роскошные ужины и приёмы, заключая с ними соглашения о неразглашении, в надежде, что они одобрят идею о том, что модель «Клод» обладает моральным статусом.
https://x.com/ChristopherHale/status/2106011594182304234?s=20
Чем дальше смотрю на все это, тем больше у меня, на самом деле, появляется уважения к христианству. Потому что, когда все институты общества, которые, казалось бы, должны защищать человека, провернули его на хую, церковь стоит последним бастионом.
X (formerly Twitter)
Christopher Hale (@ChristopherHale) on X
NEW: According to a bombshell report in the New York Times, Anthropic co-founder Chris Olah threatened to walk out of Pope Leo XIV’s AI encyclical launch in May because the pope rejected the idea …
👍4
Gaperton's Tech Corner
Надо тестировать свежекупленную RTX 3090. Агент Гермес отвечает, что из этого он может сделать сам. Утверждает, что почти все. Пусть делает. А я пошел в бар пиво пить. Надо только настроить Telegram, чтобы он писал мне, как идет работа.
Об энергопотреблении GPU и его влиянии на скорость LLM
Тест выдавал странные температуры, я даже забеспокоился. И совершенно случайно выяснил, что мой GPU имеет не стандартное для 3090 потребление 350W а оверлокнутое 420W.😳
В сообществе есть на эту тему консенсус. Почти все, кто делает инференс, ограничивают потребление ниже заводского. Производительность инференса в основном упирается в память, а не в компьют, и поэтому такое ограничение значительно снижает энергопотребление, но практически не влияет на скорость. Это делают по ряду причин: начиная с экономии электричества и заканчивая тем, чтобы дать больше резерва блоку питания и снизить температурный режим GPU.
На слово мы давно никому не верим, даже себе, поэтому я прогнал тест: как скорость инференса Qwen-27B зависит от настроек энергопотребления. В целом, да, все правда. Особенно бессмысленным был заводской разгон с 350 до 420W.
Отдельно надо сказать, что я очень доволен тем, как агент Гермес организовал тест. Он сам скачал HWINFO. Он сказал, что мне с ним делать, чтобы, запустив его, агент смог снять нужные температуры. Он сам скачал все, что надо, запустил все, что надо, и собрал выводы.
По-хорошему, надо проверять, что он нигде в этом деле не косякнул. Хотя бы в общих чертах или выборочно по ключевым точкам. Потому что косячат они регулярно, но подают результаты, как будто всё нормально.
Тест выдавал странные температуры, я даже забеспокоился. И совершенно случайно выяснил, что мой GPU имеет не стандартное для 3090 потребление 350W а оверлокнутое 420W.
В сообществе есть на эту тему консенсус. Почти все, кто делает инференс, ограничивают потребление ниже заводского. Производительность инференса в основном упирается в память, а не в компьют, и поэтому такое ограничение значительно снижает энергопотребление, но практически не влияет на скорость. Это делают по ряду причин: начиная с экономии электричества и заканчивая тем, чтобы дать больше резерва блоку питания и снизить температурный режим GPU.
На слово мы давно никому не верим, даже себе, поэтому я прогнал тест: как скорость инференса Qwen-27B зависит от настроек энергопотребления. В целом, да, все правда. Особенно бессмысленным был заводской разгон с 350 до 420W.
Генерация
• 420 Вт: 41,58 ток/с
• 350 Вт: 40,71 (−2,1%)
• 300 Вт: 39,31 (−5,4%)
Промпт
• 420 Вт: 1394 ток/с
• 350 Вт: 1337 (−4,1%)
• 300 Вт: 1256 (−9,9%)
Ядро, макс
• 420 Вт: 82,5 °C
• 350 Вт: 71,3 °C
• 300 Вт: 65,5 °C
Память, макс
• 420 Вт: 96 °C
• 350 Вт: 90 °C
• 300 Вт: 88 °C
Hotspot, макс
• 420 Вт: 97,1 °C
• 350 Вт: 84,3 °C
• 300 Вт: 76,9 °C
Вентиляторы
• 420 Вт: ~78%
• 350 Вт: ~65%
• 300 Вт: ~58%
Ток/с на кВт
• 420 Вт: 100%
• 350 Вт: +17,5%
• 300 Вт: +32,4%
Что из этого следует:
- Память (самое уязвимое место 3090) почти не реагирует на лимит: 96 → 90 → 88 °C — её температуру на обоих пониженных лимитах держит вентиляция, а не ватты.
- Ядро реагирует сильно: −17 °C на 300 Вт — кулер FTW3 справляется с огромным запасом.
- Полная цена от 420 до 300 Вт — −5,4% скорости при одиночных запросах, а промпт-обработка (батчи токенов) режется ощутимее, как и предупреждали люди на r/LocalLLaMA: батч-режим пострадает сильнее.
- Если работа с LLM у тебя в основном одиночные запросы — 300–320 Вт разумный повседневный режим: карта на 17 °C холоднее и заметно тише, скорость на глаз неотличима.
Отдельно надо сказать, что я очень доволен тем, как агент Гермес организовал тест. Он сам скачал HWINFO. Он сказал, что мне с ним делать, чтобы, запустив его, агент смог снять нужные температуры. Он сам скачал все, что надо, запустил все, что надо, и собрал выводы.
По-хорошему, надо проверять, что он нигде в этом деле не косякнул. Хотя бы в общих чертах или выборочно по ключевым точкам. Потому что косячат они регулярно, но подают результаты, как будто всё нормально.
Please open Telegram to view this post
VIEW IN TELEGRAM