По поводу агентской памяти не на искусственном тесте, а на моей личной истории сообщений в Тимс.
После того как я убрал OSS 20B, заменив её на полноценную модель Qwen3.8-27B, я, интереса ради, проверил, как обе модели извлекают из одного и того же текста факты. Выяснилось, что OSS 20B пиздит, как дышит, переворачивая факты до наоборот, и делает это практически в половине сообщений. gpt-oss-20b быстрая, но преврала в общем примерно все.
Из-за этого вся память состояла практически целиком из галлюцинаций.
Так что мы пока не будем делать поспешных выводов. Я просто запустил перегенерацию фактов заново на нормальной модели. И мы посмотрим еще раз, как это на самом деле работает.
Вот так, короче, тестам верить-то. Все надо глазами смотреть.
Надо сказать, что плохое качество gpt-oss-20Б никак не отменяет других проблем, о которых мы уже писали. Память не решена даже близко, и плохие модели со сложными архитектурными наворотами ей не помогают. Требуется что-то очень простое поверх нормального RAG, которое не пиздит. Я бы рекомендовал пробовать mem0 с качественной моделью.
После того как я убрал OSS 20B, заменив её на полноценную модель Qwen3.8-27B, я, интереса ради, проверил, как обе модели извлекают из одного и того же текста факты. Выяснилось, что OSS 20B пиздит, как дышит, переворачивая факты до наоборот, и делает это практически в половине сообщений. gpt-oss-20b быстрая, но преврала в общем примерно все.
Из-за этого вся память состояла практически целиком из галлюцинаций.
Так что мы пока не будем делать поспешных выводов. Я просто запустил перегенерацию фактов заново на нормальной модели. И мы посмотрим еще раз, как это на самом деле работает.
Вот так, короче, тестам верить-то. Все надо глазами смотреть.
Надо сказать, что плохое качество gpt-oss-20Б никак не отменяет других проблем, о которых мы уже писали. Память не решена даже близко, и плохие модели со сложными архитектурными наворотами ей не помогают. Требуется что-то очень простое поверх нормального RAG, которое не пиздит. Я бы рекомендовал пробовать mem0 с качественной моделью.
✍5❤2
Пришло время испытать vLLM. Я понял что хочу нормальную Qwen-27B на своих 2xR9700. C быстрым prefill.
Для экспериментов заказал RTX 3090.
—
Так. Как говорил Обама, когда исламские террористы взрывали себя с криками "аллах акбар" — let's not jump to conclusions.
В смысле что мне конечно нравится префил, но. Пробуем комьюнити форки. Я ради этой модели готов на многое.
—
Here we fuckin go.
Fuck yeah.
Сукаблять. Шат ап энд тейк май мани.
MTP пробуем
Для экспериментов заказал RTX 3090.
—
Так. Как говорил Обама, когда исламские террористы взрывали себя с криками "аллах акбар" — let's not jump to conclusions.
В смысле что мне конечно нравится префил, но. Пробуем комьюнити форки. Я ради этой модели готов на многое.
Radiance. Hand-written RDNA4 kernels, including its own two-GPU all-reduce. Yes, that's its main point. Its published speeds without speculative decoding are about 54 tok/s single and 304 at 8, but those were measured on the MXFP4 checkpoint and on PCIe 5.0.
—
Radiance without speculative decoding does 34.8 tok/s for a single request, twice official vLLM's 17.0. That's close to the fork's own FP8 figure of about 38 on PCIe 5.0 hardware. Eight concurrent requests total 216 tok/s, against 142 on official vLLM without MTP and 185 with MTP 3. Prefill, mixed-load and tool-call results are still running.
Here we fuckin go.
Radiance prefill is 2,869 tok/s on a ~14K-token prompt and 3,072 on ~52K, about 20–45% faster than official vLLM. The ~4K-token result (1,371 tok/s) looks like a one-off, probably first-use kernel compilation; I'll re-check it. Mixed-load and tool-call results are next.
Fuck yeah.
All 15 tool calls passed, and the ~4K-token prefill re-check confirms 4,138 tok/s (0.94s to first token), showing the earlier 1,371 result was just first-use kernel compilation overhead.
Сукаблять. Шат ап энд тейк май мани.
MTP пробуем
👀3
Gaperton's Tech Corner
Пришло время испытать vLLM. Я понял что хочу нормальную Qwen-27B на своих 2xR9700. C быстрым prefill. Для экспериментов заказал RTX 3090. — Так. Как говорил Обама, когда исламские террористы взрывали себя с криками "аллах акбар" — let's not jump to conclusions.…
Короче пускать Qwen3.8-27B на моих R9700 надо вот так. Форк vLLM Radiance.
В жопу llama.cpp. Параметры этой штуки таковы, что и бэкап-подписки в жопу.
В жопу llama.cpp. Параметры этой штуки таковы, что и бэкап-подписки в жопу.
🔥3👨💻1
Gaperton's Tech Corner
Короче пускать Qwen3.8-27B на моих R9700 надо вот так. Форк vLLM Radiance. В жопу llama.cpp. Параметры этой штуки таковы, что и бэкап-подписки в жопу.
Сделал новый сервер для Qwen3.8-27B на базе vLLM, форк Radiance.
ТТХ на моем 2xR9700 совершенно адовые. Особенно prefill и многопоточная скорость — это близко к gpt-oss-20b на llama.cpp.
И это FP8 (почти нет потери точности).
В общем, софт у AMD наконец подтянулся до нормального уровня.
Вот саммари как он устроен — сделано Опусом 5.5. Я прочитал, и это на удивление неплохо. Оно в целом описывает всё, что я сделал за последние два дня.
ТТХ на моем 2xR9700 совершенно адовые. Особенно prefill и многопоточная скорость — это близко к gpt-oss-20b на llama.cpp.
И это FP8 (почти нет потери точности).
В общем, софт у AMD наконец подтянулся до нормального уровня.
Вот саммари как он устроен — сделано Опусом 5.5. Я прочитал, и это на удивление неплохо. Оно в целом описывает всё, что я сделал за последние два дня.
🔥7
Получается какая-то вот такая ситуация с моделями. Это мой личный парето фронтир.
Для работы с Hermes вместо Опуса будет Astra, и это достигается двумя подписками — OpenCode Go + Codex.
Ну и, конечно, домашний Qwen 27B, как фоллбек.
Если что-то из этого списка надо убрать, то это будет MiMo. Она в общем лишняя. Хотя на OpenRouter и OpenCode — неплохая замена ChatGPT Sol. Просто она медленная, и tool calling у неё плохой в сравнении с DeepSeek — для Hindsight, например, не подходит.
UPD: Нет, смотрим следующий пост.
Для работы с Hermes вместо Опуса будет Astra, и это достигается двумя подписками — OpenCode Go + Codex.
Ну и, конечно, домашний Qwen 27B, как фоллбек.
Если что-то из этого списка надо убрать, то это будет MiMo. Она в общем лишняя. Хотя на OpenRouter и OpenCode — неплохая замена ChatGPT Sol. Просто она медленная, и tool calling у неё плохой в сравнении с DeepSeek — для Hindsight, например, не подходит.
UPD: Нет, смотрим следующий пост.
✍3🔥1
Gaperton's Tech Corner
Получается какая-то вот такая ситуация с моделями. Это мой личный парето фронтир. Для работы с Hermes вместо Опуса будет Astra, и это достигается двумя подписками — OpenCode Go + Codex. Ну и, конечно, домашний Qwen 27B, как фоллбек. Если что-то из этого…
ℹ️ Сел и пересчитал это по-нормальному.
Взял OpenRouter и посмотрел, какие цены из Price коррелируют со ценой среднего размера сессии Hermes. Выяснилось, что цена входных токенов.
Затем прикинул, какое из сравнений лучше всего коррелирует с нагрузкой Гермеса. GDPVal.
А затем вытащил данные из OpenRouter и Artificial Intelligence и сделал парето-фронтир.
Получается, что для Гермес вы должны брать модель GLM 5.3 Flash. Или сидеть на бесплатном Qwen. Mimo того не стоит. Как и Grok.
Астра стоит того, но только из подписки Codex. Иначе дорого.
Итого — Qwen 27B ➡️ DeepSeek 4.1 Flash / GLM-5 Flash ➡️ Codex GPT-6 Astra
Первое бесплатно, второе дает вполне рабочее качество уровня примерно ChatGPT Sol по адекватной цене, а последнее — фронтир.
👆Это, в общем, отражает суть моей гибридной стратегии.
1. Данные должны быть локальными (Hermes).
2. Мы не должны зависеть от поставщика модели (Hermes + Codex + OpenRouter/Nous/OpenCode Go/...).
3. И должна быть возможность делать простые вещи локально (Qwen3.8 27B)
Взял OpenRouter и посмотрел, какие цены из Price коррелируют со ценой среднего размера сессии Hermes. Выяснилось, что цена входных токенов.
Затем прикинул, какое из сравнений лучше всего коррелирует с нагрузкой Гермеса. GDPVal.
А затем вытащил данные из OpenRouter и Artificial Intelligence и сделал парето-фронтир.
Получается, что для Гермес вы должны брать модель GLM 5.3 Flash. Или сидеть на бесплатном Qwen. Mimo того не стоит. Как и Grok.
Астра стоит того, но только из подписки Codex. Иначе дорого.
Итого — Qwen 27B ➡️ DeepSeek 4.1 Flash / GLM-5 Flash ➡️ Codex GPT-6 Astra
Первое бесплатно, второе дает вполне рабочее качество уровня примерно ChatGPT Sol по адекватной цене, а последнее — фронтир.
👆Это, в общем, отражает суть моей гибридной стратегии.
1. Данные должны быть локальными (Hermes).
2. Мы не должны зависеть от поставщика модели (Hermes + Codex + OpenRouter/Nous/OpenCode Go/...).
3. И должна быть возможность делать простые вещи локально (Qwen3.8 27B)
🔥5
Gaperton's Tech Corner
ℹ️ Сел и пересчитал это по-нормальному. Взял OpenRouter и посмотрел, какие цены из Price коррелируют со ценой среднего размера сессии Hermes. Выяснилось, что цена входных токенов. Затем прикинул, какое из сравнений лучше всего коррелирует с нагрузкой Гермеса.…
В общем, расчет показывает, что в этой подписке пользоваться чем-либо, кроме GLM 5.3 Flash, не имеет смысла.
Если пересчитать это в цены OpenRouter, OpenCode Go для данной модели обходится примерно в два раза дешевле. Но дешевле это будет только в случае, если вы тратите хотя бы половину месячного лимита. В противном случае дешевле брать это Open Router платя за токены. В общем, вы пять долларов экономите в лучшем случае.
❗️ Если дома будет работать Qwen 3.8 Flash, не будет никакого смысла платить Open Code и Open Router.
Qwen3.8 Flash это 1612 Elo. И все. До свидания. В облаке нужен только фронтир и только для сложных задач.
А он будет работать. Экспериментальные ветки vLLM уже показывают примерно сто токенов в секунду на моем железе. Это означает, что к концу года, когда выйдет Qwen 4, всё будет работать. И мы еще посмотрим на Qwen 4 27B.
Я, честно говоря, не понимаю, как амодеи собираются отбивать эти конские инвестиции в дата-центры.
Please open Telegram to view this post
VIEW IN TELEGRAM
Как раз сегодня думал о какой-то подобной клавиатуре. А вернее, маленьким микрофоном с кнопкой, чтобы говорить с моим ИИ. Что-то вроде радио.
То, как сейчас отвечают агенты, совершенно не подходит для голосового общения. Однако я не думаю, что нельзя ничего сделать. Мне кажется, нужна пара моделей. Одна из них будет поддерживать разговор, а вторая — думать.
Поддерживать разговор — это всё-таки очень непросто. Разговор — это обмен короткими фразами, и надо очень хорошо понимать, что и зачем ты говоришь.
То, как сейчас отвечают агенты, совершенно не подходит для голосового общения. Однако я не думаю, что нельзя ничего сделать. Мне кажется, нужна пара моделей. Одна из них будет поддерживать разговор, а вторая — думать.
Поддерживать разговор — это всё-таки очень непросто. Разговор — это обмен короткими фразами, и надо очень хорошо понимать, что и зачем ты говоришь.
Gaperton's Tech Corner
ℹ️ Сел и пересчитал это по-нормальному. Взял OpenRouter и посмотрел, какие цены из Price коррелируют со ценой среднего размера сессии Hermes. Выяснилось, что цена входных токенов. Затем прикинул, какое из сравнений лучше всего коррелирует с нагрузкой Гермеса.…
И еще раз об агентской памяти
1. Я испытал Mem0. Она оказалась еще хуже, чем Хинсайд.
Первая и, пожалуй, главная практическая проблема состоит в том, что её авторы в основном делают платный cloud-продукт, а open source-версии для них не настолько важен. В целом в open source-версии недостаточно функций, чтобы нормально ей пользоваться, не говоря уже о том, что нужно приложить чрезмерные усилия, просто чтобы её завести.
Вторая проблема – это память все-таки слишком глупа в сравнении с Hindsight. В Hindsight целых три уровня памяти. Первый уровень — это факты, которые система извлекает из текста. Второй уровень — это выводы из этих фактов, полученные автоматически. И третий уровень — это анализ выводов, который делается прицельно по вашим вопросам.
В Mem0 есть всего лишь первый уровень: факты, извлеченные из текста. Как выяснилось, этого явно недостаточно для того, чтобы память давала вам то, что вы от нее ждете. Ожидаете вы все-таки не просто буквального воспоминания беседы в прошлом, а скорее все-таки общих выводов из нее.
2. Как я уже писал, я испытал Hindsight еще раз, используя Qwen 3.8 27B вместо OSS 20B.
Когда я посмотрел на извлеченные системой факты и выводы, разница была огромной. Qwen не путал время и гораздо реже путал факты. С oss 20b проблема была в том, что система не могла даже нормально извлечь фактов, и в итоге память превращалась в источник галлюцинаций.
После этого я направил рефлект, а это третий уровень рассуждений о воспоминаниях, на облачную модель GLM 5.3 Flash и выяснил, что в итоге с этими моделями система уже дает вполне осмысленный анализ.
Поэтому Hindsight рано сбрасывать со счетов. Самым главным фактором в оценке системы памяти является ваше знакомство с теми данными, которые вы в них закачиваете. В моем случае я просто сделал экспорт рабочего чата за год, загрузил в память и начал задавать вопросы, проверяя адекватность выводов в памяти о том, что было. Так как я это уже сам знаю, мне было легко понять, насколько память адекватна.
Они пишут вам. Hindsight Doesn't Need a Smart Model.
Bullshit. Ей нужны хорошие агентские модели со способностью рассуждать. Qwen3.8-27B и GLM 5.3 Flash подходят.
1. Я испытал Mem0. Она оказалась еще хуже, чем Хинсайд.
Первая и, пожалуй, главная практическая проблема состоит в том, что её авторы в основном делают платный cloud-продукт, а open source-версии для них не настолько важен. В целом в open source-версии недостаточно функций, чтобы нормально ей пользоваться, не говоря уже о том, что нужно приложить чрезмерные усилия, просто чтобы её завести.
Вторая проблема – это память все-таки слишком глупа в сравнении с Hindsight. В Hindsight целых три уровня памяти. Первый уровень — это факты, которые система извлекает из текста. Второй уровень — это выводы из этих фактов, полученные автоматически. И третий уровень — это анализ выводов, который делается прицельно по вашим вопросам.
В Mem0 есть всего лишь первый уровень: факты, извлеченные из текста. Как выяснилось, этого явно недостаточно для того, чтобы память давала вам то, что вы от нее ждете. Ожидаете вы все-таки не просто буквального воспоминания беседы в прошлом, а скорее все-таки общих выводов из нее.
2. Как я уже писал, я испытал Hindsight еще раз, используя Qwen 3.8 27B вместо OSS 20B.
Когда я посмотрел на извлеченные системой факты и выводы, разница была огромной. Qwen не путал время и гораздо реже путал факты. С oss 20b проблема была в том, что система не могла даже нормально извлечь фактов, и в итоге память превращалась в источник галлюцинаций.
После этого я направил рефлект, а это третий уровень рассуждений о воспоминаниях, на облачную модель GLM 5.3 Flash и выяснил, что в итоге с этими моделями система уже дает вполне осмысленный анализ.
Поэтому Hindsight рано сбрасывать со счетов. Самым главным фактором в оценке системы памяти является ваше знакомство с теми данными, которые вы в них закачиваете. В моем случае я просто сделал экспорт рабочего чата за год, загрузил в память и начал задавать вопросы, проверяя адекватность выводов в памяти о том, что было. Так как я это уже сам знаю, мне было легко понять, насколько память адекватна.
Они пишут вам. Hindsight Doesn't Need a Smart Model.
Bullshit. Ей нужны хорошие агентские модели со способностью рассуждать. Qwen3.8-27B и GLM 5.3 Flash подходят.
hindsight.vectorize.io
Retain: How Hindsight Stores Memories | Hindsight
When you call retain(), Hindsight transforms conversations and documents into structured, searchable memories that preserve meaning and context.
Gaperton's Tech Corner
И еще раз об агентской памяти 1. Я испытал Mem0. Она оказалась еще хуже, чем Хинсайд. Первая и, пожалуй, главная практическая проблема состоит в том, что её авторы в основном делают платный cloud-продукт, а open source-версии для них не настолько важен.…
https://hindsight.vectorize.io/developer/models#openai-codex-setup-chatgpt-pluspro
В качестве модели берете GPT-6 Luna.
С OpenRouter тоже можно, само собой. Но надо брать что-то реально дешевое. Там можно хорошо попасть на бабки. DeepSeek V4 Flash в принципе, пойдет.
В качестве локальной бесплатной модели пойдет Qwen3.6 35B-A3B. Но я теперь отношусь скептически к глупым моделям. Толку от памяти, которая галлюцинирует и не втыкает о чем и кто говорит, нет никакого, только вред.
Please open Telegram to view this post
VIEW IN TELEGRAM
hindsight.vectorize.io
Models | Hindsight
Hindsight uses several machine learning models for different tasks.
В основном я работаю с...
Anonymous Poll
46%
Windows
45%
macOS
53%
Linux
14%
iOS
18%
Android
2%
Другое
❤1
Пришел MacBook Pro M5 Max, 128 ГБ.
Ну чё, скоро будем запускать на нем ВЕЩИ.
Это у нас лучшее железо от Apple для запуска моделей еще на полтора года вперед. Не считая Maс Studio Ultra, конечно, которая уже стоит как автомобиль.
P.S.: Он получил имя Aurelius. В честь Марка Аврелия, "последнего хорошего императора Рима". А шел он почтой Америки два месяца.
Ну чё, скоро будем запускать на нем ВЕЩИ.
Это у нас лучшее железо от Apple для запуска моделей еще на полтора года вперед. Не считая Maс Studio Ultra, конечно, которая уже стоит как автомобиль.
P.S.: Он получил имя Aurelius. В честь Марка Аврелия, "последнего хорошего императора Рима". А шел он почтой Америки два месяца.
👍10🔥2
И опять об OpenCode Go
После примерной недельной практики использования выяснилось следующее.
1. GLM-5.3 Flash — крайне годная модель, которая отлично подходит в качестве основной для Гермес.
2. В OpenCode Go за 10 USD вы её покупаете в таком же объёме, как у Zai за 60 долларов.
А больше, в общем, ничего там и не нужно. Она лучше чем GPT-6 Luna в Codex (на которую всегда можно переключиться). Так что я оставляю подписку. И Codex GPT-6 Sol/Astra для тяжелых случаев. Grok отменил.
После примерной недельной практики использования выяснилось следующее.
1. GLM-5.3 Flash — крайне годная модель, которая отлично подходит в качестве основной для Гермес.
2. В OpenCode Go за 10 USD вы её покупаете в таком же объёме, как у Zai за 60 долларов.
А больше, в общем, ничего там и не нужно. Она лучше чем GPT-6 Luna в Codex (на которую всегда можно переключиться). Так что я оставляю подписку. И Codex GPT-6 Sol/Astra для тяжелых случаев. Grok отменил.
👍5
Gaperton's Tech Corner
Сегодняшний релиз OpenAI Это очень хороший релиз. Теперь модель GPT-6.1 Sol конкурентоспособна по цене. Не хуже китайских. Возникает, конечно, вопрос: не субсидированная ли эта цена?
Вам может быть интересно, как так у них получилось. А вот как, посмотрите.
Нет, дело не только в субсидированной цене. Дело в том, что одна и та же задача решается в небольшом количестве токенов. Что на практике делает модель быстрее, а не только дешевле.
В общем, что я могу сказать? Конкуренция — это прекрасно. Продолжайте. Несмотря на это, я все равно не хочу зависеть от одного поставщика. Независимо от того, насколько хорошие у него модели. Так что OpenCode Go как способ дешевого доступа к китайским моделям остается.
Еще у меня, конечно же, есть яростно субсидированная подписка от anthropic за 20 долларов. Сугубо для того, чтобы разорить Амодея. Я старательно её выжигаю, когда могу. Дело принципа.
Нет, дело не только в субсидированной цене. Дело в том, что одна и та же задача решается в небольшом количестве токенов. Что на практике делает модель быстрее, а не только дешевле.
В общем, что я могу сказать? Конкуренция — это прекрасно. Продолжайте. Несмотря на это, я все равно не хочу зависеть от одного поставщика. Независимо от того, насколько хорошие у него модели. Так что OpenCode Go как способ дешевого доступа к китайским моделям остается.
Еще у меня, конечно же, есть яростно субсидированная подписка от anthropic за 20 долларов. Сугубо для того, чтобы разорить Амодея. Я старательно её выжигаю, когда могу. Дело принципа.
Долбоебы из антропик написали новую статью с рекламой GLM-5.3. Пишут, что крутая модель: эксплойт умеет делать не хуже, чем их Мифос.
GLM-5.3 and the spread of advanced cyber capabilities
https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities
Вы можете спросить, зачем они это делают. Ответ очень простой: они активно лоббируют лицензии на разработку ИИ. И запрет открытых моделей.
GLM-5.3 and the spread of advanced cyber capabilities
https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities
Вы можете спросить, зачем они это делают. Ответ очень простой: они активно лоббируют лицензии на разработку ИИ. И запрет открытых моделей.