Gaperton's Tech Corner
373 subscribers
644 photos
47 videos
1 file
442 links
Технология, жизнь, и немного классической философии

https://gaperton.substack.com
Download Telegram
Gaperton's Tech Corner
ℹ️ Сел и пересчитал это по-нормальному. Взял OpenRouter и посмотрел, какие цены из Price коррелируют со ценой среднего размера сессии Hermes. Выяснилось, что цена входных токенов. Затем прикинул, какое из сравнений лучше всего коррелирует с нагрузкой Гермеса.…
И еще раз об агентской памяти

1. Я испытал Mem0. Она оказалась еще хуже, чем Хинсайд.

Первая и, пожалуй, главная практическая проблема состоит в том, что её авторы в основном делают платный cloud-продукт, а open source-версии для них не настолько важен. В целом в open source-версии недостаточно функций, чтобы нормально ей пользоваться, не говоря уже о том, что нужно приложить чрезмерные усилия, просто чтобы её завести.

Вторая проблема – это память все-таки слишком глупа в сравнении с Hindsight. В Hindsight целых три уровня памяти. Первый уровень — это факты, которые система извлекает из текста. Второй уровень — это выводы из этих фактов, полученные автоматически. И третий уровень — это анализ выводов, который делается прицельно по вашим вопросам.

В Mem0 есть всего лишь первый уровень: факты, извлеченные из текста. Как выяснилось, этого явно недостаточно для того, чтобы память давала вам то, что вы от нее ждете. Ожидаете вы все-таки не просто буквального воспоминания беседы в прошлом, а скорее все-таки общих выводов из нее.

2. Как я уже писал, я испытал Hindsight еще раз, используя Qwen 3.8 27B вместо OSS 20B.

Когда я посмотрел на извлеченные системой факты и выводы, разница была огромной. Qwen не путал время и гораздо реже путал факты. С oss 20b проблема была в том, что система не могла даже нормально извлечь фактов, и в итоге память превращалась в источник галлюцинаций.

После этого я направил рефлект, а это третий уровень рассуждений о воспоминаниях, на облачную модель GLM 5.3 Flash и выяснил, что в итоге с этими моделями система уже дает вполне осмысленный анализ.

Поэтому Hindsight рано сбрасывать со счетов. Самым главным фактором в оценке системы памяти является ваше знакомство с теми данными, которые вы в них закачиваете. В моем случае я просто сделал экспорт рабочего чата за год, загрузил в память и начал задавать вопросы, проверяя адекватность выводов в памяти о том, что было. Так как я это уже сам знаю, мне было легко понять, насколько память адекватна.

Они пишут вам. Hindsight Doesn't Need a Smart Model.

Bullshit. Ей нужны хорошие агентские модели со способностью рассуждать. Qwen3.8-27B и GLM 5.3 Flash подходят.
Gaperton's Tech Corner
И еще раз об агентской памяти 1. Я испытал Mem0. Она оказалась еще хуже, чем Хинсайд. Первая и, пожалуй, главная практическая проблема состоит в том, что её авторы в основном делают платный cloud-продукт, а open source-версии для них не настолько важен.…
🤔 Кстати, я только что выяснил, что для запуска Hindsight можно использовать подписку Codex. Так что на самом деле вы можете ее попробовать не имея дорогого оборудования.

https://hindsight.vectorize.io/developer/models#openai-codex-setup-chatgpt-pluspro

В качестве модели берете GPT-6 Luna.

С OpenRouter тоже можно, само собой. Но надо брать что-то реально дешевое. Там можно хорошо попасть на бабки. DeepSeek V4 Flash в принципе, пойдет.

В качестве локальной бесплатной модели пойдет Qwen3.6 35B-A3B. Но я теперь отношусь скептически к глупым моделям. Толку от памяти, которая галлюцинирует и не втыкает о чем и кто говорит, нет никакого, только вред.
Please open Telegram to view this post
VIEW IN TELEGRAM
В основном я работаю с...
Anonymous Poll
46%
Windows
45%
macOS
53%
Linux
14%
iOS
18%
Android
2%
Другое
❤1
Пришел MacBook Pro M5 Max, 128 ГБ.

Ну чё, скоро будем запускать на нем ВЕЩИ.

Это у нас лучшее железо от Apple для запуска моделей еще на полтора года вперед. Не считая Maс Studio Ultra, конечно, которая уже стоит как автомобиль.

P.S.: Он получил имя Aurelius. В честь Марка Аврелия, "последнего хорошего императора Рима". А шел он почтой Америки два месяца.
👍10🔥2
И опять об OpenCode Go

После примерной недельной практики использования выяснилось следующее.

1. GLM-5.3 Flash — крайне годная модель, которая отлично подходит в качестве основной для Гермес.
2. В OpenCode Go за 10 USD вы её покупаете в таком же объёме, как у Zai за 60 долларов.

А больше, в общем, ничего там и не нужно. Она лучше чем GPT-6 Luna в Codex (на которую всегда можно переключиться). Так что я оставляю подписку. И Codex GPT-6 Sol/Astra для тяжелых случаев. Grok отменил.
👍5
Сегодняшний релиз OpenAI

Это очень хороший релиз. Теперь модель GPT-6.1 Sol конкурентоспособна по цене. Не хуже китайских. Возникает, конечно, вопрос: не субсидированная ли эта цена?
Gaperton's Tech Corner
Сегодняшний релиз OpenAI Это очень хороший релиз. Теперь модель GPT-6.1 Sol конкурентоспособна по цене. Не хуже китайских. Возникает, конечно, вопрос: не субсидированная ли эта цена?
Вам может быть интересно, как так у них получилось. А вот как, посмотрите.

Нет, дело не только в субсидированной цене. Дело в том, что одна и та же задача решается в небольшом количестве токенов. Что на практике делает модель быстрее, а не только дешевле.

В общем, что я могу сказать? Конкуренция — это прекрасно. Продолжайте. Несмотря на это, я все равно не хочу зависеть от одного поставщика. Независимо от того, насколько хорошие у него модели. Так что OpenCode Go как способ дешевого доступа к китайским моделям остается.

Еще у меня, конечно же, есть яростно субсидированная подписка от anthropic за 20 долларов. Сугубо для того, чтобы разорить Амодея. Я старательно её выжигаю, когда могу. Дело принципа.
Долбоебы из антропик написали новую статью с рекламой GLM-5.3. Пишут, что крутая модель: эксплойт умеет делать не хуже, чем их Мифос.

GLM-5.3 and the spread of advanced cyber capabilities

https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities

Вы можете спросить, зачем они это делают. Ответ очень простой: они активно лоббируют лицензии на разработку ИИ. И запрет открытых моделей.
И, конечно, второе, что я сделал с новым MacBook, — это попробовал Qwen Image 2.1.

Самый простой способ это сделать, который известен мне, — это анслот десктоп. Вообще всё тупо.

Но вообще для этого Mac не нужен, там памяти надо совсем немного, восемь гигабайт VRAM пойдет.
👍1
Gaperton's Tech Corner
Пришел MacBook Pro M5 Max, 128 ГБ. Ну чё, скоро будем запускать на нем ВЕЩИ. Это у нас лучшее железо от Apple для запуска моделей еще на полтора года вперед. Не считая Maс Studio Ultra, конечно, которая уже стоит как автомобиль. P.S.: Он получил имя Aurelius.…
Импульсивная покупка прибывает в пятницу. Как я уже говорил, я считаю RTX 3090 24GB вполне нормальным бюджетным вариантом. Она мне нужна на замену старой RTX 2070, и цены на неё сейчас примерно полторы тысячи долларов на eBay.

Следующий бюджетный вариант от nVidia — это уже 4000 долларов, за A6000 48GB.

А за ним идет RTX 5090 32GB, которая стоит примерно 5000 долларов.
👍4
Не очень понятно, с какого хуя языковая модель должна быть чьим-то моральным компасом, но ладно.
Обещают Qwen3.8-Flash-Next на обычной карте nVidia, и нормальную скорость. В пятницу приедет 3090, проверю. У меня второй компьютер будет 24GB 3090 + 64GB DDR4. Самая популярная бюджетная опция. Для зажиточных крестьян. Конфигурации с двумя GPU — это уже следующий класс.

Strata

Запустите модель искусственного интеллекта с 125 миллиардами параметров на обычном игровом ПК

Одна видеокарта NVIDIA (12–24 ГБ) + 64 ГБ оперативной памяти · Windows или Linux · установка в один клик

Strata запускает Qwen3.8-Flash-Next — крупную интеллектуальную модель искусственного интеллекта, для работы которой обычно требуется сервер, — прямо на вашем персональном компьютере. Она генерирует ответы со скоростью 60–95 токенов в секунду (один токен составляет примерно ¾ слова): быстрее, чем вы успеваете читать.


An AMD Radeon RX 7900 XT / XTX, RX 9070 / 9070 XT or Radeon AI PRO R9700 on Linux works too. И пишут, что поддерживается сплит на две карты. Проверим и это. Если будет нормально работать на двух R9700, то ничего больше и не нужно.

https://github.com/Niko1221/Strata
🔥6
Gaperton's Tech Corner
Обещают Qwen3.8-Flash-Next на обычной карте nVidia, и нормальную скорость. В пятницу приедет 3090, проверю. У меня второй компьютер будет 24GB 3090 + 64GB DDR4. Самая популярная бюджетная опция. Для зажиточных крестьян. Конфигурации с двумя GPU — это уже следующий…
Вы можете спросить, насколько плохая эта квантизация в предыдущем посте, а там максимум, что есть, это три бита. И у нас есть ответ.

https://x.com/bnjmn_marie/status/2105481856812740726/photo/1

Она далеко не так плоха, как может показаться. Q2_K_XL вполне на уровне, но тратит на четверть больше токенов на размышления.

Эти модели уже вполне реальная практическая замена облачным. Не надо ждать от них паритета с Opus 5.5, но для повседневных задач они более чем достаточны. Это уровень GLM/DeepSeek Flash. Примерно соответствует фронтиру прошлой зимы.
🤔3
Я думаю, что в интересах общества ограничить использование компьютеров в госсекторе. Пусть на пишущих машинках под копирку законы печатают, блять. А еще лучше перевести их на гусиные перья. Может, тогда начнут думать над каждым словом.
💯7
Gaperton's Tech Corner
AMD Radeon RX 7900 XT / XTX, RX 9070 / 9070 XT or Radeon AI PRO R9700
Qwen3.8 Flash Next — R9V / ROCm 10

R9V — это не отдельный движок, а подобранный и «пиннутый» стек для запуска ровно одного сценария: Qwen3.8-Flash-Next на двух Radeon AI PRO R9700 (RDNA4/gfx1201) с tensor-параллелизмом (TP2), 128K контекстом и OpenAI-совместимым API. Внутри: форк vLLM, есть отдельная GGUF-загрузка, спец-ядра под gfx1201, offload экспертов в RAM, и MTP-спекулятивное декодирование на 4 токена (MTP4).

А вот отчет о тестировании. 2× Radeon AI PRO R9700 32 GB, 64 GB host RAM

https://github.com/kyuz0/amd-r9700-ai-toolboxes/blob/main/docs/r9v-rocm-10.0.md

В общем, запустить эту модель на моем оборудовании можно уже сейчас.
👍4🔥1
Вот смотрите, фронтир-модели косячат с ответами, несмотря на то что все знания мира у них в весах.

У модели Qwen 27B не все знания мира в весах.

И тем, и другим нужен поиск, который опирается на знания, написанные людьми.

Ну а раз Qwen 27B уже достаточно умен, и всем все равно нужен поиск, так зачем нужно пихать все знания в веса модели?

А если не нужно, так почему не дистиллировать то, что реально нужно, в малую модель, которая влезает, ну, например, в 64 гигабайта VRAM? А все остальное делать поиском?
👍1
Media is too big
VIEW IN TELEGRAM
Продуктовые идеи.
😁3🤷‍♂1
НОВОСТЬ: Согласно сенсационному репортажу в «Нью-Йорк Таймс», соучредитель компании Anthropic Крис Олах пригрозил покинуть презентацию энциклики Папы Льва XIV по искусственному интеллекту, состоявшуюся в мае, поскольку папа отверг идею о том, что машины могут обладать сознанием.

Затем команда Олаха в частном порядке пыталась убедить советников папы «серьёзно отнестись к возможности существования сознания у моделей». Папа Лев XIV остался непреклонен.

В течение нескольких месяцев компания Anthropic устраивала теологам и религиоведам роскошные ужины и приёмы, заключая с ними соглашения о неразглашении, в надежде, что они одобрят идею о том, что модель «Клод» обладает моральным статусом.

https://x.com/ChristopherHale/status/2106011594182304234?s=20

Чем дальше смотрю на все это, тем больше у меня, на самом деле, появляется уважения к христианству. Потому что, когда все институты общества, которые, казалось бы, должны защищать человека, провернули его на хую, церковь стоит последним бастионом.
👍4
Надо тестировать свежекупленную RTX 3090. Агент Гермес отвечает, что из этого он может сделать сам. Утверждает, что почти все.

Пусть делает. А я пошел в бар пиво пить. Надо только настроить Telegram, чтобы он писал мне, как идет работа.
❤3
🤷‍♂3