Gaperton's Tech Corner
Окей. Зря что-ли настраивал Hindsight? Попробуем выяснить можно-ли его в принципе правильно готовить. Для чего надо для начала почитать их ресерч.
Ага, таки Hindsight правильно готовить не только можно, но и нужно.
Там три промпта надо задавать, которые говорят что сохранять, как объединять, и как обрабатывать.
Ну что, попробуем.
Там три промпта надо задавать, которые говорят что сохранять, как объединять, и как обрабатывать.
Ну что, попробуем.
Хорошая конфигурация делает эти три уровня последовательными.
retain_mission
Сохраняй только долговременные факты, решения, предпочтения и проверенный опыт.
↓
observations_mission
Объединяй похожие факты в устойчивые закономерности и привычки. Не повторяй исходные факты.
↓
reflect_mission
Строй высокоуровневые модели поведения, принципы принятия решений, архитектурные закономерности и долговременные стратегии.
✍2🔥2👍1
Gaperton's Tech Corner
Ага, таки Hindsight правильно готовить не только можно, но и нужно. Там три промпта надо задавать, которые говорят что сохранять, как объединять, и как обрабатывать. Ну что, попробуем. Хорошая конфигурация делает эти три уровня последовательными. retain_mission…
Очень прикольная штука Hindsight.
Я воспроизвел результат локально на одном R9700. Она скорее работает чем нет. Прям, умная. Помнит вещи, реально.
Сейчас я примерно разобрался как она на самом деле работает, читая код, гоняя тесты, и анализируя базу. Закончу первую волну экспериментов, и расскажу. Там все довольно просто и симпатично. И вы поймете, что это такое и чем оно может быть полезно.
Да, я гонял его в паре с Hermes. Он может работать с Codex и Claude Code. Для работы с локальной базой нужен конечно локальный агент.
Я воспроизвел результат локально на одном R9700. Она скорее работает чем нет. Прям, умная. Помнит вещи, реально.
Сейчас я примерно разобрался как она на самом деле работает, читая код, гоняя тесты, и анализируя базу. Закончу первую волну экспериментов, и расскажу. Там все довольно просто и симпатично. И вы поймете, что это такое и чем оно может быть полезно.
Да, я гонял его в паре с Hermes. Он может работать с Codex и Claude Code. Для работы с локальной базой нужен конечно локальный агент.
👍5❤2👨💻1
https://x.com/TeksEdge/status/2085046568240197886?s=20
Наконец-то нормальный кэш экспертов в llama.cpp сделали. MoE не влезающие в память станут вдвое быстрее.
Это потрясающее дополнение к llama.cpp. «Горячий эксперт» может увеличить скорость декодирования MoE примерно в 2 раза.
В ходе эксперимента с llama.cpp был найден гораздо более эффективный способ использования небольших объемов VRAM с огромными моделями MoE.
Вместо того чтобы заранее определять, какие эксперты будут размещаться на CPU или GPU, новый кэш «горячих экспертов» отслеживает, какие эксперты MoE фактически используются.
Часто используемые эксперты → кэшируются в VRAM
Редкие эксперты → остаются в системной RAM / на CPU
По сути:
GPU становится кэшем для наиболее востребованных частей модели.
Результаты, представленные авторами, на модели Qwen3.6-35B-A3B с всего лишь 8 ГБ VRAM:
Q2_M
33,25 → 57,2 tok/s
В 1,72 раза быстрее
Q5_K_P
17,34 → 35,93 ток/с
В 2,07 раза быстрее
Самое интересное заключается в том, что вся модель не обязательно должна помещаться в VRAM. Системная оперативная память хранит «холодных» экспертов, в то время как ограниченная память графического процессора динамически выделяется на тех экспертов, которые в данный момент наиболее важны.
Наконец-то нормальный кэш экспертов в llama.cpp сделали. MoE не влезающие в память станут вдвое быстрее.
У меня жена только что заказала топовый макбук. Для музыкального продакшна надо.
Так вот — доставка на начало октября. Два месяца ждать. Дефицит RAM.
Так вот — доставка на начало октября. Два месяца ждать. Дефицит RAM.
🤯7💔3
Из правил llama.cpp.
Странно, правда? ИИ это же так хорошо.
Строго говоря, я не могу оправлять свой патч к llama.cpp пока до конца не пойму код который меняю. Я кстати горячо одобряю такой подход.
Да, я тут небольшой баг в грамматике gemma поправил чтоб Hindsight не циклило, две строки. В принципе я это исправление умею автоматом накладывать. llama.cpp все равно ставится компиляцией из исходников, элементарно сделать автоматическое наложение патча.
• AI-written PR descriptions, commit messages, or reviewer responses
→ immediate closure per AGENTS.md
• Undisclosed AI usage → possible permanent ban per CONTRIBUTING.md
• Contributors must "understand their code fully — able to explain any change to a reviewer without AI assistance"
Странно, правда? ИИ это же так хорошо.
Строго говоря, я не могу оправлять свой патч к llama.cpp пока до конца не пойму код который меняю. Я кстати горячо одобряю такой подход.
Да, я тут небольшой баг в грамматике gemma поправил чтоб Hindsight не циклило, две строки. В принципе я это исправление умею автоматом накладывать. llama.cpp все равно ставится компиляцией из исходников, элементарно сделать автоматическое наложение патча.
🔥7
Перед тем как перейти к вопросу памяти, давайте вернёмся к вопросу агента и архитектуры ИИ в целом.
1. Мы не хотим зависеть от провайдера LLM
Не зависеть от него просто – вы не должны хранить свои чаты и данные у этого провайдера. Этот провайдер должен давать вам услуги инференса, и ничего кроме них. В любую секунду вы должны иметь возможность заменить его на другого.
Это не обязательно означает что у вас должна быть своя личная модель дома. Это означает отсутствие зависимости от конкретной модели и её поставщика.
2. Значит, нам нужна программа, которая хранит чаты локально
Это и есть агент. Он должен работать у вас, и хранить данные у вас. Он не должен быть привязан к поставщику. Он должен иметь возможность работать с дешёвыми подписками. Он должен давать возможность переключаться на локальную модель если вы хотите.
3. Файлы и компьютер
Раз эта штука работает у вас на компьютере — она имеет принципиальную возможность менять файлы, запускать там команды, смотреть на экран, и пр. В общем – делать все что делаете вы.
И это гораздо круче чем просто онлайн-чат. Я уже давно администрирую все свои компьютеры агентами.
Но самое главное — файлы это память за пределами чат-сессии, которая доступна агенту и которой вы можете управлять.
4. Автоматическая Память
И вот тут мы приходим к самому интересному. Файлы это память агента, которой мы управляем вручную. А что если мы дадим ему память, которой он может управлять автоматически, как это делает человек со своей памятью?
То есть, что если он будет сам выделять важное, запоминать это, и вспоминать когда это полезно?
Работы над такой памятью сейчас ведутся очень активно, и наиболее перспективным мне кажется Hindsight. Я протестировал его локально. Он сырой и пока прототип, но реально скорее работает как заявлено, чем нет.
Подвох в том что Hindsight требует LLM API а не подписки, генерирует кратно больший траффик чем чат к которому он подключен, и легко вас разорит. Ему нужна локальная модель. И это самый сильный кейс для собственного ИИ сервера.
5. Но какой агент выбрать чтобы вот это все было?
Это просто. Hermes.
Работает с подписками OpenAI/Codex, xAI/Grok. Локальными моделами. И Hindsight.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍9🔥1
Gaperton's Tech Corner
То есть, говоря об агентской архитектуре, мы говорим о чем-то вот таком.
Нюанс — Hindsight-у необходима локальная модель. Фронтир ему не нужна — хватает Qwen 35B-A3B или даже gpt-oss-20b.
Под нужды Hindsight хватит 24-32GB VRAM. Macbook Pro потянет вообще без проблем.
Нюанс — Hindsight-у необходима локальная модель. Фронтир ему не нужна — хватает Qwen 35B-A3B или даже gpt-oss-20b.
Под нужды Hindsight хватит 24-32GB VRAM. Macbook Pro потянет вообще без проблем.
🔥4
Промежуточные выводы из экспериментов с Hindsight
Что вообще делает LLM в Hindsight? Две вещи:
• решает, что из потока сознания достойно запоминания, и разрезает это на набор фактов чтобы их запомнить.
• для каждого нового факта, обновляет набор относящих к нему убеждений.
По сути, это два промпта с довольно простой задачей, и для них не надо ни суперинтеллекта, ни знать все на свете. С ними вполне адекватно справляется малая модель. И эта модель должна быть быстрой. Там должен быть отключен thinking.
1. gpt-oss-20b неожиданно хороша
Эта старая модель крайне плохо выглядит в тестах. Но потрясающе хорошо в тестах Hindsight. Она дьявольски быстра, отлично следует инструкциям, и вполне адекватно понимает язык. А ничего больше в общем и не нужно.
Она маленькая — Q8_K_XL это 13GB. Она прекрасно параллелится на три потока в llama.cpp. Она отрабатывает за 2-3 секунды на запрос. Качество результатов на этой задаче на удивление высокое, и мало отличается от фронтир-моделей.
2. Gemma4-26B-A4B ничем не лучше, но вдвое медленнее
Представляете? Предварительные замеры показывают — вообще нет разницы в качестве. Есть в два раза разница в скорости, плюс необходим патч для llama.cpp чтобы оно вообще работало. Там проблемы с tool calling.
3. Qwen3.6-35A-A3B немного лучше, и немного медленнее
По качеству поиска, она лучше на полшишки. Но она при этом генерирует заметно меньше фактов и убеждений. Она медленнее, но не критично.
Эту модель можно пробовать как альтернативу. В целом, 35A-A3B это лучшая севременная быстрая модель для подобных применений.
4. Gemma4-31B на удивление неплоха (вы думали полное дерьмо, но нет)
Штука в том, что она генерирует втрое меньше токенов, чем Qwen-27B. Поэтому, в задаче judge в тестах (проверка ответов), она невероятно быстра. Qwen-27B это 10 секунд, Gemma-31B это 6, Qwen-35B это 4.
Я оставляю ее на judge просто потому, что она из другого семейства моделей. И не будет подсуживать Qwen.
Что вообще делает LLM в Hindsight? Две вещи:
• решает, что из потока сознания достойно запоминания, и разрезает это на набор фактов чтобы их запомнить.
• для каждого нового факта, обновляет набор относящих к нему убеждений.
По сути, это два промпта с довольно простой задачей, и для них не надо ни суперинтеллекта, ни знать все на свете. С ними вполне адекватно справляется малая модель. И эта модель должна быть быстрой. Там должен быть отключен thinking.
1. gpt-oss-20b неожиданно хороша
Эта старая модель крайне плохо выглядит в тестах. Но потрясающе хорошо в тестах Hindsight. Она дьявольски быстра, отлично следует инструкциям, и вполне адекватно понимает язык. А ничего больше в общем и не нужно.
Она маленькая — Q8_K_XL это 13GB. Она прекрасно параллелится на три потока в llama.cpp. Она отрабатывает за 2-3 секунды на запрос. Качество результатов на этой задаче на удивление высокое, и мало отличается от фронтир-моделей.
2. Gemma4-26B-A4B ничем не лучше, но вдвое медленнее
Представляете? Предварительные замеры показывают — вообще нет разницы в качестве. Есть в два раза разница в скорости, плюс необходим патч для llama.cpp чтобы оно вообще работало. Там проблемы с tool calling.
3. Qwen3.6-35A-A3B немного лучше, и немного медленнее
По качеству поиска, она лучше на полшишки. Но она при этом генерирует заметно меньше фактов и убеждений. Она медленнее, но не критично.
Эту модель можно пробовать как альтернативу. В целом, 35A-A3B это лучшая севременная быстрая модель для подобных применений.
4. Gemma4-31B на удивление неплоха (вы думали полное дерьмо, но нет)
Штука в том, что она генерирует втрое меньше токенов, чем Qwen-27B. Поэтому, в задаче judge в тестах (проверка ответов), она невероятно быстра. Qwen-27B это 10 секунд, Gemma-31B это 6, Qwen-35B это 4.
Я оставляю ее на judge просто потому, что она из другого семейства моделей. И не будет подсуживать Qwen.
huggingface.co
unsloth/gpt-oss-20b-GGUF · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
🔥4
https://x.com/rohanpaul_ai/status/2086769766937837777?s=20
Meta выпустила модель, которая на бумаге сильно лучше Gemma4-31B.
Qwen3.8-27B выходит через несколько дней. Все ждут что она вытрет этой моделью от меты пол.
Meta выпустила модель, которая на бумаге сильно лучше Gemma4-31B.
Qwen3.8-27B выходит через несколько дней. Все ждут что она вытрет этой моделью от меты пол.
🔥4
Если вам нужны дешевые и умные модели, то сейчас расклад такой, согласно Artificial Analysis.
При такой цене на DeepSeek V4 Flash его можно наверное покупать на вес, как бэкап, когда подписка кончается. Сделал подписку на OpenRouter чтобы брать его там. В принципе цена на него как на ChatGpt Luna.
При такой цене на DeepSeek V4 Flash его можно наверное покупать на вес, как бэкап, когда подписка кончается. Сделал подписку на OpenRouter чтобы брать его там. В принципе цена на него как на ChatGpt Luna.
Gaperton's Tech Corner
Если вам нужны дешевые и умные модели, то сейчас расклад такой, согласно Artificial Analysis. При такой цене на DeepSeek V4 Flash его можно наверное покупать на вес, как бэкап, когда подписка кончается. Сделал подписку на OpenRouter чтобы брать его там. В…
А для самостоятельного хостинга вот.
Gaperton's Tech Corner
#tomorrow
В Х массовая истерия по поводу 27B. Ждут чего-то не слабее чем Opus. От херни которая работает в 24GB VRAM.
👍4