Gaperton's Tech Corner
Короче пускать Qwen3.8-27B на моих R9700 надо вот так. Форк vLLM Radiance. В жопу llama.cpp. Параметры этой штуки таковы, что и бэкап-подписки в жопу.
Сделал новый сервер для Qwen3.8-27B на базе vLLM, форк Radiance.
ТТХ на моем 2xR9700 совершенно адовые. Особенно prefill и многопоточная скорость — это близко к gpt-oss-20b на llama.cpp.
И это FP8 (почти нет потери точности).
В общем, софт у AMD наконец подтянулся до нормального уровня.
Вот саммари как он устроен — сделано Опусом 5.5. Я прочитал, и это на удивление неплохо. Оно в целом описывает всё, что я сделал за последние два дня.
ТТХ на моем 2xR9700 совершенно адовые. Особенно prefill и многопоточная скорость — это близко к gpt-oss-20b на llama.cpp.
И это FP8 (почти нет потери точности).
В общем, софт у AMD наконец подтянулся до нормального уровня.
Вот саммари как он устроен — сделано Опусом 5.5. Я прочитал, и это на удивление неплохо. Оно в целом описывает всё, что я сделал за последние два дня.
🔥7
Получается какая-то вот такая ситуация с моделями. Это мой личный парето фронтир.
Для работы с Hermes вместо Опуса будет Astra, и это достигается двумя подписками — OpenCode Go + Codex.
Ну и, конечно, домашний Qwen 27B, как фоллбек.
Если что-то из этого списка надо убрать, то это будет MiMo. Она в общем лишняя. Хотя на OpenRouter и OpenCode — неплохая замена ChatGPT Sol. Просто она медленная, и tool calling у неё плохой в сравнении с DeepSeek — для Hindsight, например, не подходит.
UPD: Нет, смотрим следующий пост.
Для работы с Hermes вместо Опуса будет Astra, и это достигается двумя подписками — OpenCode Go + Codex.
Ну и, конечно, домашний Qwen 27B, как фоллбек.
Если что-то из этого списка надо убрать, то это будет MiMo. Она в общем лишняя. Хотя на OpenRouter и OpenCode — неплохая замена ChatGPT Sol. Просто она медленная, и tool calling у неё плохой в сравнении с DeepSeek — для Hindsight, например, не подходит.
UPD: Нет, смотрим следующий пост.
✍3🔥1
Gaperton's Tech Corner
Получается какая-то вот такая ситуация с моделями. Это мой личный парето фронтир. Для работы с Hermes вместо Опуса будет Astra, и это достигается двумя подписками — OpenCode Go + Codex. Ну и, конечно, домашний Qwen 27B, как фоллбек. Если что-то из этого…
ℹ️ Сел и пересчитал это по-нормальному.
Взял OpenRouter и посмотрел, какие цены из Price коррелируют со ценой среднего размера сессии Hermes. Выяснилось, что цена входных токенов.
Затем прикинул, какое из сравнений лучше всего коррелирует с нагрузкой Гермеса. GDPVal.
А затем вытащил данные из OpenRouter и Artificial Intelligence и сделал парето-фронтир.
Получается, что для Гермес вы должны брать модель GLM 5.3 Flash. Или сидеть на бесплатном Qwen. Mimo того не стоит. Как и Grok.
Астра стоит того, но только из подписки Codex. Иначе дорого.
Итого — Qwen 27B ➡️ DeepSeek 4.1 Flash / GLM-5 Flash ➡️ Codex GPT-6 Astra
Первое бесплатно, второе дает вполне рабочее качество уровня примерно ChatGPT Sol по адекватной цене, а последнее — фронтир.
👆Это, в общем, отражает суть моей гибридной стратегии.
1. Данные должны быть локальными (Hermes).
2. Мы не должны зависеть от поставщика модели (Hermes + Codex + OpenRouter/Nous/OpenCode Go/...).
3. И должна быть возможность делать простые вещи локально (Qwen3.8 27B)
Взял OpenRouter и посмотрел, какие цены из Price коррелируют со ценой среднего размера сессии Hermes. Выяснилось, что цена входных токенов.
Затем прикинул, какое из сравнений лучше всего коррелирует с нагрузкой Гермеса. GDPVal.
А затем вытащил данные из OpenRouter и Artificial Intelligence и сделал парето-фронтир.
Получается, что для Гермес вы должны брать модель GLM 5.3 Flash. Или сидеть на бесплатном Qwen. Mimo того не стоит. Как и Grok.
Астра стоит того, но только из подписки Codex. Иначе дорого.
Итого — Qwen 27B ➡️ DeepSeek 4.1 Flash / GLM-5 Flash ➡️ Codex GPT-6 Astra
Первое бесплатно, второе дает вполне рабочее качество уровня примерно ChatGPT Sol по адекватной цене, а последнее — фронтир.
👆Это, в общем, отражает суть моей гибридной стратегии.
1. Данные должны быть локальными (Hermes).
2. Мы не должны зависеть от поставщика модели (Hermes + Codex + OpenRouter/Nous/OpenCode Go/...).
3. И должна быть возможность делать простые вещи локально (Qwen3.8 27B)
🔥5
Gaperton's Tech Corner
ℹ️ Сел и пересчитал это по-нормальному. Взял OpenRouter и посмотрел, какие цены из Price коррелируют со ценой среднего размера сессии Hermes. Выяснилось, что цена входных токенов. Затем прикинул, какое из сравнений лучше всего коррелирует с нагрузкой Гермеса.…
В общем, расчет показывает, что в этой подписке пользоваться чем-либо, кроме GLM 5.3 Flash, не имеет смысла.
Если пересчитать это в цены OpenRouter, OpenCode Go для данной модели обходится примерно в два раза дешевле. Но дешевле это будет только в случае, если вы тратите хотя бы половину месячного лимита. В противном случае дешевле брать это Open Router платя за токены. В общем, вы пять долларов экономите в лучшем случае.
❗️ Если дома будет работать Qwen 3.8 Flash, не будет никакого смысла платить Open Code и Open Router.
Qwen3.8 Flash это 1612 Elo. И все. До свидания. В облаке нужен только фронтир и только для сложных задач.
А он будет работать. Экспериментальные ветки vLLM уже показывают примерно сто токенов в секунду на моем железе. Это означает, что к концу года, когда выйдет Qwen 4, всё будет работать. И мы еще посмотрим на Qwen 4 27B.
Я, честно говоря, не понимаю, как амодеи собираются отбивать эти конские инвестиции в дата-центры.
Please open Telegram to view this post
VIEW IN TELEGRAM
Как раз сегодня думал о какой-то подобной клавиатуре. А вернее, маленьким микрофоном с кнопкой, чтобы говорить с моим ИИ. Что-то вроде радио.
То, как сейчас отвечают агенты, совершенно не подходит для голосового общения. Однако я не думаю, что нельзя ничего сделать. Мне кажется, нужна пара моделей. Одна из них будет поддерживать разговор, а вторая — думать.
Поддерживать разговор — это всё-таки очень непросто. Разговор — это обмен короткими фразами, и надо очень хорошо понимать, что и зачем ты говоришь.
То, как сейчас отвечают агенты, совершенно не подходит для голосового общения. Однако я не думаю, что нельзя ничего сделать. Мне кажется, нужна пара моделей. Одна из них будет поддерживать разговор, а вторая — думать.
Поддерживать разговор — это всё-таки очень непросто. Разговор — это обмен короткими фразами, и надо очень хорошо понимать, что и зачем ты говоришь.
Gaperton's Tech Corner
ℹ️ Сел и пересчитал это по-нормальному. Взял OpenRouter и посмотрел, какие цены из Price коррелируют со ценой среднего размера сессии Hermes. Выяснилось, что цена входных токенов. Затем прикинул, какое из сравнений лучше всего коррелирует с нагрузкой Гермеса.…
И еще раз об агентской памяти
1. Я испытал Mem0. Она оказалась еще хуже, чем Хинсайд.
Первая и, пожалуй, главная практическая проблема состоит в том, что её авторы в основном делают платный cloud-продукт, а open source-версии для них не настолько важен. В целом в open source-версии недостаточно функций, чтобы нормально ей пользоваться, не говоря уже о том, что нужно приложить чрезмерные усилия, просто чтобы её завести.
Вторая проблема – это память все-таки слишком глупа в сравнении с Hindsight. В Hindsight целых три уровня памяти. Первый уровень — это факты, которые система извлекает из текста. Второй уровень — это выводы из этих фактов, полученные автоматически. И третий уровень — это анализ выводов, который делается прицельно по вашим вопросам.
В Mem0 есть всего лишь первый уровень: факты, извлеченные из текста. Как выяснилось, этого явно недостаточно для того, чтобы память давала вам то, что вы от нее ждете. Ожидаете вы все-таки не просто буквального воспоминания беседы в прошлом, а скорее все-таки общих выводов из нее.
2. Как я уже писал, я испытал Hindsight еще раз, используя Qwen 3.8 27B вместо OSS 20B.
Когда я посмотрел на извлеченные системой факты и выводы, разница была огромной. Qwen не путал время и гораздо реже путал факты. С oss 20b проблема была в том, что система не могла даже нормально извлечь фактов, и в итоге память превращалась в источник галлюцинаций.
После этого я направил рефлект, а это третий уровень рассуждений о воспоминаниях, на облачную модель GLM 5.3 Flash и выяснил, что в итоге с этими моделями система уже дает вполне осмысленный анализ.
Поэтому Hindsight рано сбрасывать со счетов. Самым главным фактором в оценке системы памяти является ваше знакомство с теми данными, которые вы в них закачиваете. В моем случае я просто сделал экспорт рабочего чата за год, загрузил в память и начал задавать вопросы, проверяя адекватность выводов в памяти о том, что было. Так как я это уже сам знаю, мне было легко понять, насколько память адекватна.
Они пишут вам. Hindsight Doesn't Need a Smart Model.
Bullshit. Ей нужны хорошие агентские модели со способностью рассуждать. Qwen3.8-27B и GLM 5.3 Flash подходят.
1. Я испытал Mem0. Она оказалась еще хуже, чем Хинсайд.
Первая и, пожалуй, главная практическая проблема состоит в том, что её авторы в основном делают платный cloud-продукт, а open source-версии для них не настолько важен. В целом в open source-версии недостаточно функций, чтобы нормально ей пользоваться, не говоря уже о том, что нужно приложить чрезмерные усилия, просто чтобы её завести.
Вторая проблема – это память все-таки слишком глупа в сравнении с Hindsight. В Hindsight целых три уровня памяти. Первый уровень — это факты, которые система извлекает из текста. Второй уровень — это выводы из этих фактов, полученные автоматически. И третий уровень — это анализ выводов, который делается прицельно по вашим вопросам.
В Mem0 есть всего лишь первый уровень: факты, извлеченные из текста. Как выяснилось, этого явно недостаточно для того, чтобы память давала вам то, что вы от нее ждете. Ожидаете вы все-таки не просто буквального воспоминания беседы в прошлом, а скорее все-таки общих выводов из нее.
2. Как я уже писал, я испытал Hindsight еще раз, используя Qwen 3.8 27B вместо OSS 20B.
Когда я посмотрел на извлеченные системой факты и выводы, разница была огромной. Qwen не путал время и гораздо реже путал факты. С oss 20b проблема была в том, что система не могла даже нормально извлечь фактов, и в итоге память превращалась в источник галлюцинаций.
После этого я направил рефлект, а это третий уровень рассуждений о воспоминаниях, на облачную модель GLM 5.3 Flash и выяснил, что в итоге с этими моделями система уже дает вполне осмысленный анализ.
Поэтому Hindsight рано сбрасывать со счетов. Самым главным фактором в оценке системы памяти является ваше знакомство с теми данными, которые вы в них закачиваете. В моем случае я просто сделал экспорт рабочего чата за год, загрузил в память и начал задавать вопросы, проверяя адекватность выводов в памяти о том, что было. Так как я это уже сам знаю, мне было легко понять, насколько память адекватна.
Они пишут вам. Hindsight Doesn't Need a Smart Model.
Bullshit. Ей нужны хорошие агентские модели со способностью рассуждать. Qwen3.8-27B и GLM 5.3 Flash подходят.
hindsight.vectorize.io
Retain: How Hindsight Stores Memories | Hindsight
When you call retain(), Hindsight transforms conversations and documents into structured, searchable memories that preserve meaning and context.
Gaperton's Tech Corner
И еще раз об агентской памяти 1. Я испытал Mem0. Она оказалась еще хуже, чем Хинсайд. Первая и, пожалуй, главная практическая проблема состоит в том, что её авторы в основном делают платный cloud-продукт, а open source-версии для них не настолько важен.…
https://hindsight.vectorize.io/developer/models#openai-codex-setup-chatgpt-pluspro
В качестве модели берете GPT-6 Luna.
С OpenRouter тоже можно, само собой. Но надо брать что-то реально дешевое. Там можно хорошо попасть на бабки. DeepSeek V4 Flash в принципе, пойдет.
В качестве локальной бесплатной модели пойдет Qwen3.6 35B-A3B. Но я теперь отношусь скептически к глупым моделям. Толку от памяти, которая галлюцинирует и не втыкает о чем и кто говорит, нет никакого, только вред.
Please open Telegram to view this post
VIEW IN TELEGRAM
hindsight.vectorize.io
Models | Hindsight
Hindsight uses several machine learning models for different tasks.
В основном я работаю с...
Anonymous Poll
46%
Windows
45%
macOS
53%
Linux
14%
iOS
18%
Android
2%
Другое
❤1
Пришел MacBook Pro M5 Max, 128 ГБ.
Ну чё, скоро будем запускать на нем ВЕЩИ.
Это у нас лучшее железо от Apple для запуска моделей еще на полтора года вперед. Не считая Maс Studio Ultra, конечно, которая уже стоит как автомобиль.
P.S.: Он получил имя Aurelius. В честь Марка Аврелия, "последнего хорошего императора Рима". А шел он почтой Америки два месяца.
Ну чё, скоро будем запускать на нем ВЕЩИ.
Это у нас лучшее железо от Apple для запуска моделей еще на полтора года вперед. Не считая Maс Studio Ultra, конечно, которая уже стоит как автомобиль.
P.S.: Он получил имя Aurelius. В честь Марка Аврелия, "последнего хорошего императора Рима". А шел он почтой Америки два месяца.
👍10🔥2
И опять об OpenCode Go
После примерной недельной практики использования выяснилось следующее.
1. GLM-5.3 Flash — крайне годная модель, которая отлично подходит в качестве основной для Гермес.
2. В OpenCode Go за 10 USD вы её покупаете в таком же объёме, как у Zai за 60 долларов.
А больше, в общем, ничего там и не нужно. Она лучше чем GPT-6 Luna в Codex (на которую всегда можно переключиться). Так что я оставляю подписку. И Codex GPT-6 Sol/Astra для тяжелых случаев. Grok отменил.
После примерной недельной практики использования выяснилось следующее.
1. GLM-5.3 Flash — крайне годная модель, которая отлично подходит в качестве основной для Гермес.
2. В OpenCode Go за 10 USD вы её покупаете в таком же объёме, как у Zai за 60 долларов.
А больше, в общем, ничего там и не нужно. Она лучше чем GPT-6 Luna в Codex (на которую всегда можно переключиться). Так что я оставляю подписку. И Codex GPT-6 Sol/Astra для тяжелых случаев. Grok отменил.
👍5
Gaperton's Tech Corner
Сегодняшний релиз OpenAI Это очень хороший релиз. Теперь модель GPT-6.1 Sol конкурентоспособна по цене. Не хуже китайских. Возникает, конечно, вопрос: не субсидированная ли эта цена?
Вам может быть интересно, как так у них получилось. А вот как, посмотрите.
Нет, дело не только в субсидированной цене. Дело в том, что одна и та же задача решается в небольшом количестве токенов. Что на практике делает модель быстрее, а не только дешевле.
В общем, что я могу сказать? Конкуренция — это прекрасно. Продолжайте. Несмотря на это, я все равно не хочу зависеть от одного поставщика. Независимо от того, насколько хорошие у него модели. Так что OpenCode Go как способ дешевого доступа к китайским моделям остается.
Еще у меня, конечно же, есть яростно субсидированная подписка от anthropic за 20 долларов. Сугубо для того, чтобы разорить Амодея. Я старательно её выжигаю, когда могу. Дело принципа.
Нет, дело не только в субсидированной цене. Дело в том, что одна и та же задача решается в небольшом количестве токенов. Что на практике делает модель быстрее, а не только дешевле.
В общем, что я могу сказать? Конкуренция — это прекрасно. Продолжайте. Несмотря на это, я все равно не хочу зависеть от одного поставщика. Независимо от того, насколько хорошие у него модели. Так что OpenCode Go как способ дешевого доступа к китайским моделям остается.
Еще у меня, конечно же, есть яростно субсидированная подписка от anthropic за 20 долларов. Сугубо для того, чтобы разорить Амодея. Я старательно её выжигаю, когда могу. Дело принципа.
Долбоебы из антропик написали новую статью с рекламой GLM-5.3. Пишут, что крутая модель: эксплойт умеет делать не хуже, чем их Мифос.
GLM-5.3 and the spread of advanced cyber capabilities
https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities
Вы можете спросить, зачем они это делают. Ответ очень простой: они активно лоббируют лицензии на разработку ИИ. И запрет открытых моделей.
GLM-5.3 and the spread of advanced cyber capabilities
https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities
Вы можете спросить, зачем они это делают. Ответ очень простой: они активно лоббируют лицензии на разработку ИИ. И запрет открытых моделей.
И, конечно, второе, что я сделал с новым MacBook, — это попробовал Qwen Image 2.1.
Самый простой способ это сделать, который известен мне, — это анслот десктоп. Вообще всё тупо.
Но вообще для этого Mac не нужен, там памяти надо совсем немного, восемь гигабайт VRAM пойдет.
Самый простой способ это сделать, который известен мне, — это анслот десктоп. Вообще всё тупо.
Но вообще для этого Mac не нужен, там памяти надо совсем немного, восемь гигабайт VRAM пойдет.
👍1
Gaperton's Tech Corner
Пришел MacBook Pro M5 Max, 128 ГБ. Ну чё, скоро будем запускать на нем ВЕЩИ. Это у нас лучшее железо от Apple для запуска моделей еще на полтора года вперед. Не считая Maс Studio Ultra, конечно, которая уже стоит как автомобиль. P.S.: Он получил имя Aurelius.…
Импульсивная покупка прибывает в пятницу. Как я уже говорил, я считаю RTX 3090 24GB вполне нормальным бюджетным вариантом. Она мне нужна на замену старой RTX 2070, и цены на неё сейчас примерно полторы тысячи долларов на eBay.
Следующий бюджетный вариант от nVidia — это уже 4000 долларов, за A6000 48GB.
А за ним идет RTX 5090 32GB, которая стоит примерно 5000 долларов.
Следующий бюджетный вариант от nVidia — это уже 4000 долларов, за A6000 48GB.
А за ним идет RTX 5090 32GB, которая стоит примерно 5000 долларов.
👍4
Обещают Qwen3.8-Flash-Next на обычной карте nVidia, и нормальную скорость. В пятницу приедет 3090, проверю. У меня второй компьютер будет 24GB 3090 + 64GB DDR4. Самая популярная бюджетная опция. Для зажиточных крестьян. Конфигурации с двумя GPU — это уже следующий класс.
An AMD Radeon RX 7900 XT / XTX, RX 9070 / 9070 XT or Radeon AI PRO R9700 on Linux works too. И пишут, что поддерживается сплит на две карты. Проверим и это. Если будет нормально работать на двух R9700, то ничего больше и не нужно.
https://github.com/Niko1221/Strata
Strata
Запустите модель искусственного интеллекта с 125 миллиардами параметров на обычном игровом ПК
Одна видеокарта NVIDIA (12–24 ГБ) + 64 ГБ оперативной памяти · Windows или Linux · установка в один клик
Strata запускает Qwen3.8-Flash-Next — крупную интеллектуальную модель искусственного интеллекта, для работы которой обычно требуется сервер, — прямо на вашем персональном компьютере. Она генерирует ответы со скоростью 60–95 токенов в секунду (один токен составляет примерно ¾ слова): быстрее, чем вы успеваете читать.
An AMD Radeon RX 7900 XT / XTX, RX 9070 / 9070 XT or Radeon AI PRO R9700 on Linux works too. И пишут, что поддерживается сплит на две карты. Проверим и это. Если будет нормально работать на двух R9700, то ничего больше и не нужно.
https://github.com/Niko1221/Strata
🔥6
Gaperton's Tech Corner
Обещают Qwen3.8-Flash-Next на обычной карте nVidia, и нормальную скорость. В пятницу приедет 3090, проверю. У меня второй компьютер будет 24GB 3090 + 64GB DDR4. Самая популярная бюджетная опция. Для зажиточных крестьян. Конфигурации с двумя GPU — это уже следующий…
Вы можете спросить, насколько плохая эта квантизация в предыдущем посте, а там максимум, что есть, это три бита. И у нас есть ответ.
https://x.com/bnjmn_marie/status/2105481856812740726/photo/1
Она далеко не так плоха, как может показаться. Q2_K_XL вполне на уровне, но тратит на четверть больше токенов на размышления.
Эти модели уже вполне реальная практическая замена облачным. Не надо ждать от них паритета с Opus 5.5, но для повседневных задач они более чем достаточны. Это уровень GLM/DeepSeek Flash. Примерно соответствует фронтиру прошлой зимы.
https://x.com/bnjmn_marie/status/2105481856812740726/photo/1
Она далеко не так плоха, как может показаться. Q2_K_XL вполне на уровне, но тратит на четверть больше токенов на размышления.
Эти модели уже вполне реальная практическая замена облачным. Не надо ждать от них паритета с Opus 5.5, но для повседневных задач они более чем достаточны. Это уровень GLM/DeepSeek Flash. Примерно соответствует фронтиру прошлой зимы.
🤔3