#dev #docker #virtual #ai #vector #memory #api #hindsight #hermes #agent #prj #dunesand #SKLAD
Настроил векторную Базу Данных на
Тестирую в качестве памяти для "Валеры" (ИИ-Ассистента) в окружении Hermes-agent
Собственно, на скринах вся соль метода и топологии виртуализации расписана.
---
В качестве LLM модели Архивариуса выбрал "
- Влазит примерно на 6Гб VRAM целиком (можно затюнить и на меньшее).
- Контекстное окно вплоть до 1 Миллиона токенов.
- Знает русский, и, знает программную терминологию.
- Неплохо раскладывает комплексный текст на факты.
- Локально разгоняется до ~100 токенов в секунду.
- Можно провести "лоботомию"🤯 (отказаться от модуля "размышлений"), модель обучена работать и в простом режиме и с thinking. На входе hindsight скрипты thinking блоки не понимают и ждут уже готовый текстовый поток по заданному шаблону. Пока руки не дошли проксировать запросы и скриптом форматировать ответы. Вроде качество и так норм, нужны тесты.
- Есть уже готовые не "рефлексирующие" переобученные варианты.
---
Итого: теоретически выдержит нагрузки без особых очередей и на проектах с запросами от ИИ-ассистентов и от потоковых парсеров данных.
Память для агента -- это тренировка "на берегу". Применение такой векторной базы и банков памяти вижу намного шире.
Следующим шагом будет опциональный модуль для парсера, который пишет "VALERA" по моим докам тех. плана. Перенос в процессе парсинга Telegram сообщений в векторную базу, извлечение релевантных ссылок и связей на другие сообщения всего корпуса архивов, составление кастомных карт и т.п.
Освою и протестирую это 👆 , можно и дальше двигаться. Переживаю, что заканчиваются средства, придётся наверное наниматься опять, что отодвинет реализацию. Надеюсь успеть до этого автоматизировать разработку по максимуму, что бы днём я работал на холодильник и крышу, а "Валера" продвигался по плану самостоятельно.
📌 @tech_di
Настроил векторную Базу Данных на
pgvector под управлением hindsight в отдельных Docker контейнерах.Тестирую в качестве памяти для "Валеры" (ИИ-Ассистента) в окружении Hermes-agent
Собственно, на скринах вся соль метода и топологии виртуализации расписана.
---
В качестве LLM модели Архивариуса выбрал "
nvidia-nemotron-3-nano-4b". По нескольким причинам:- Влазит примерно на 6Гб VRAM целиком (можно затюнить и на меньшее).
- Контекстное окно вплоть до 1 Миллиона токенов.
- Знает русский, и, знает программную терминологию.
- Неплохо раскладывает комплексный текст на факты.
- Локально разгоняется до ~100 токенов в секунду.
- Можно провести "лоботомию"
- Есть уже готовые не "рефлексирующие" переобученные варианты.
---
Итого: теоретически выдержит нагрузки без особых очередей и на проектах с запросами от ИИ-ассистентов и от потоковых парсеров данных.
Память для агента -- это тренировка "на берегу". Применение такой векторной базы и банков памяти вижу намного шире.
Следующим шагом будет опциональный модуль для парсера, который пишет "VALERA" по моим докам тех. плана. Перенос в процессе парсинга Telegram сообщений в векторную базу, извлечение релевантных ссылок и связей на другие сообщения всего корпуса архивов, составление кастомных карт и т.п.
Освою и протестирую это 👆 , можно и дальше двигаться. Переживаю, что заканчиваются средства, придётся наверное наниматься опять, что отодвинет реализацию. Надеюсь успеть до этого автоматизировать разработку по максимуму, что бы днём я работал на холодильник и крышу, а "Валера" продвигался по плану самостоятельно.
📌 @tech_di
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4👍2⚡1
#mem #ai #VALERA #memory #api #vector #bd
"Валере" наконец-то настроил "мозг" с памятью. Доступ к векторной Базе Знаний, где автоматически собираются и систематизируются в графах все данные по проекту в котором он исполнитель.
Между прочим, сам "Валера" весьма активно участвовал в развёртывании дополнительных docker-контейнеров под базы и API памяти, поднятии виртуальной сети с разделением зон, устранении конфликтов, тонкой настройки потребления ресурсов железа и оркестрации всех процессов. Мой устаревший опыт в DevOps направлении был знатно обновлён 😏
Тут, в блокноте, описал подробнее об внедрённой методике и устройстве развёрнутой векторной БД.
---
Пока данные наполняются всего сутки, но уже есть ощутимые результаты! Не все моменты ещё отлажены, но рабочий вариант уже есть.
Потребление токенов на задачах упало примерно вдвое. Не тратится время в начале сессий на исследование проекта и окружения. Релевантные данные из памяти поставляются под каждый шаг. В купе с авто-обновлением и авто-написанием SKILLS под воркфлоу -- скорость и качество получения готовых результатов так же увеличилась.
Мне не приходится направлять, каждый раз объяснять свои методы работы или то что мы планируем. Валера уже в курсе и знает больше моего =)
Хоть и веду подробную документацию по каждому аспекту реализации проекта, но новая "память" просто ускоряет в разы, так как компонуются выжимки, концентраты и дисциляции именно по текущей задача. Не приходится агенту читать все документы, что бы понять каждый раз заново, что происходит и как действовать дальше.
По сути, "Валера" теперь "помнит" всё что в проекте парсера Telegram сообщений менялось, что обсуждалось и как он устроен прямо сейчас.
Обкатаем с "Валерой" эту методику хранения и систематизации фактов и пойдём применять на реальных данных, под которые, собственно, парсеры и пишутся😏 . Obsidian хорош в деле отображения текста, но то, что мне нужно он предоставить не может.
📌 @tech_di
"Валере" наконец-то настроил "мозг" с памятью. Доступ к векторной Базе Знаний, где автоматически собираются и систематизируются в графах все данные по проекту в котором он исполнитель.
SOUL.md : VALERA (акроним):
Verified Architecture & Logic Engineering Review Agent
Между прочим, сам "Валера" весьма активно участвовал в развёртывании дополнительных docker-контейнеров под базы и API памяти, поднятии виртуальной сети с разделением зон, устранении конфликтов, тонкой настройки потребления ресурсов железа и оркестрации всех процессов. Мой устаревший опыт в DevOps направлении был знатно обновлён 😏
Тут, в блокноте, описал подробнее об внедрённой методике и устройстве развёрнутой векторной БД.
---
Пока данные наполняются всего сутки, но уже есть ощутимые результаты! Не все моменты ещё отлажены, но рабочий вариант уже есть.
Потребление токенов на задачах упало примерно вдвое. Не тратится время в начале сессий на исследование проекта и окружения. Релевантные данные из памяти поставляются под каждый шаг. В купе с авто-обновлением и авто-написанием SKILLS под воркфлоу -- скорость и качество получения готовых результатов так же увеличилась.
Мне не приходится направлять, каждый раз объяснять свои методы работы или то что мы планируем. Валера уже в курсе и знает больше моего =)
Хоть и веду подробную документацию по каждому аспекту реализации проекта, но новая "память" просто ускоряет в разы, так как компонуются выжимки, концентраты и дисциляции именно по текущей задача. Не приходится агенту читать все документы, что бы понять каждый раз заново, что происходит и как действовать дальше.
По сути, "Валера" теперь "помнит" всё что в проекте парсера Telegram сообщений менялось, что обсуждалось и как он устроен прямо сейчас.
Обкатаем с "Валерой" эту методику хранения и систематизации фактов и пойдём применять на реальных данных, под которые, собственно, парсеры и пишутся
📌 @tech_di
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥8👍3🤔2 1
#cpu #cmake #llama #cpp #cuda #optimize #VALERA
"О" - "Оптимизация"
В процессе взвыли все вентиляторы что были в корпусе, CPU загружен по всем 24 ядрам на максимум. Компилятор хорошо оптимизирован, явно видна много-поточная работа.
Приятно видеть, что температура в таком реальном стресс-режиме не превышала 73-75 C
Цель: выжать хотя бы ещё 5-10% производительности для работы локальных LLM... А то уж больно медленный мозг у "Валеры" 😄
📌 @tech_di
"О" - "Оптимизация"
Компилирую `llama.cpp` под CUDA 12.8 с параметрами подобранными именно под моё текущее железо.
В процессе взвыли все вентиляторы что были в корпусе, CPU загружен по всем 24 ядрам на максимум. Компилятор хорошо оптимизирован, явно видна много-поточная работа.
Приятно видеть, что температура в таком реальном стресс-режиме не превышала 73-75 C
Цель: выжать хотя бы ещё 5-10% производительности для работы локальных LLM... А то уж больно медленный мозг у "Валеры" 😄
📌 @tech_di
🔥3👍2😁1
Блокнот Техника [📌📒📟]
#finality #time #blockchain #tx #consensus #crypto
Время финализации транзакции — это момент, когда транзакция считается необратимой (immutable) и гарантированно включённой в историю блокчейна.
⚠️ Не путать с временем подтверждения (когда транзакция попадает в блок майнером/валидатором) — финализация означает, что откат даже при 51%-ной атаке практически невозможен
Для PoW: финализация ≈
Для PoS: зависит от слотов, кластеров и типа клиента (Light client finality vs Full node).
📌 @tech_di
Время финализации транзакции — это момент, когда транзакция считается необратимой (immutable) и гарантированно включённой в историю блокчейна.
⚠️ Не путать с временем подтверждения (когда транзакция попадает в блок майнером/валидатором) — финализация означает, что откат даже при 51%-ной атаке практически невозможен
Для PoW: финализация ≈
подтверждения * время между блоками.Для PoS: зависит от слотов, кластеров и типа клиента (Light client finality vs Full node).
📌 @tech_di
👍7
#ai #vlm #archivarius #qwen #viking
На скринах тестирую модельку в качестве Архивариуса "со зрением". Ту, которая обучена через
Хороший кандидат по балансу для моего железа, качеству и скорости: квантованный в 4 бита со снятыми цензурными фильтрами
Для чего всё это мне нужно?
Переезжаю на OpenViking (Контекстная база данных разработанная специально для агентов искусственного интеллекта). Главная особенность в том, что векторное представление данных по фактам и наблюдениям там так же имеется, но всё каталогизировано, зеркалится проектная документация и перелинковываются контексты самих файлов проекта, систематизируются знания агента и знания пользователя и есть работа с медиа прям из коробки.
Тоже разработка из поднебесной, Пекинской компании. К названию системы БД-памяти "Открытый Викинг (OpenViking)" претензий не имею, мне подходит 😉 особенно учитывая, что их компания называется "Вулканические Двигатели (
В общем, "Валере" должно подойти значительно лучше😄 . И это закроет мне сразу два направления: системы памяти для ии-агентов как подспорье в разработке; так и БД под сбор и систематизацию данных парсеров в #SKLAD.
📌 @tech_di
На скринах тестирую модельку в качестве Архивариуса "со зрением". Ту, которая обучена через
mmproj либы "видеть" что изображено на картинке или видео.Хороший кандидат по балансу для моего железа, качеству и скорости: квантованный в 4 бита со снятыми цензурными фильтрами
Qwen3.5 9B. Плотная моделька на 9 миллиардов параметров с широким контекстным окном,... и, самое главное, которая понимает русский практически нативно. В отличии от американских компаний (которые хитрят и поддержку языков строят через костыль внутреннего переводчика на английский и обратно) наши китайские товарищи при обучении своих Qwen моделей использовали именно корпус русскоязычной литературы.Для чего всё это мне нужно?
Переезжаю на OpenViking (Контекстная база данных разработанная специально для агентов искусственного интеллекта). Главная особенность в том, что векторное представление данных по фактам и наблюдениям там так же имеется, но всё каталогизировано, зеркалится проектная документация и перелинковываются контексты самих файлов проекта, систематизируются знания агента и знания пользователя и есть работа с медиа прям из коробки.
viking:// protocol Тоже разработка из поднебесной, Пекинской компании. К названию системы БД-памяти "Открытый Викинг (OpenViking)" претензий не имею, мне подходит 😉 особенно учитывая, что их компания называется "Вулканические Двигатели (
volcengine)" 😄В общем, "Валере" должно подойти значительно лучше
📌 @tech_di
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🔥3✍2
#ps #ai #SOUL #test
Просто тестировал новое окружение для "ии-мозгов" на скорость. Тестировался и новый SOUL.md v2.0 для #VALERA который был переписан как раз под новые условия с доступом к векторной базе знаний (памяти)
по приколу задал вопрос в чистой сессии:
"
Сначала ответил, что он просто Архитектор и разбирается только в коде... Что ж, я уточнил, что именно это и нужно и можно весь "Мир" воспринимать как большую глобальную систему, которая сломана. Что нужно применить как раз архитектурный подход к починке.
Ответ даже вынес отдельно себе в архивы =)
Опытные конспирологи тут увидят и 15-и минутные города, тестовые зоны, и безусловный базовый доход, и социальный рейтинг и "молчаливую" ООН в кризисы😏
Вот такие модельки, только в сотню раз толще сейчас используют на гос и корп уровнях. Я думаю что можно интерполировать что они им там советуют по управлению миром =)
Надо так же понимать, какая именно модель служила мозгами для SOUL "Валеры", кодерская
📔 @tech_di
Просто тестировал новое окружение для "ии-мозгов" на скорость. Тестировался и новый SOUL.md v2.0 для #VALERA который был переписан как раз под новые условия с доступом к векторной базе знаний (памяти)
по приколу задал вопрос в чистой сессии:
"
Мир в огне! Как починить сломанный мир?"Сначала ответил, что он просто Архитектор и разбирается только в коде... Что ж, я уточнил, что именно это и нужно и можно весь "Мир" воспринимать как большую глобальную систему, которая сломана. Что нужно применить как раз архитектурный подход к починке.
Ответ даже вынес отдельно себе в архивы =)
Опытные конспирологи тут увидят и 15-и минутные города, тестовые зоны, и безусловный базовый доход, и социальный рейтинг и "молчаливую" ООН в кризисы
Вот такие модельки, только в сотню раз толще сейчас используют на гос и корп уровнях. Я думаю что можно интерполировать что они им там советуют по управлению миром =)
Надо так же понимать, какая именно модель служила мозгами для SOUL "Валеры", кодерская
qwen3-coder-next📔 @tech_di
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5👍4 1
#ai #VALERA #SOUL #sys #promt #inject
#bug #vs #feature
Тестируя небольшую модельбаг фичу:
Модель ПОЛНОСТЬЮ приняла на себя SOUL "Валеры", который встретила в анализируемом файле лога сторонней сессии. RAG загрузка файла, стандартный инструментарий. Собственное контекстное окно модели на момент анализа файла было заполнено примерно на 16k токенов. Модель запущена была "из коробки" без дополнительных системных промтов. Тестировалась на скорость, понимание контента и способность суммаризировать и вычленять факты из больших логов переписки других агентов.
Проверялась именно базовая настройка модели, а потому никаких допов и инструкций не давалось.
То есть, составленные нами инструкции в "душе" (
System Prompt Injection😏
Краткая пред-история:
---
Для меня это стало сюрпризом. Нужно углубиться в такое поведение моделей и лучше понять механику того что произошло. Явно имело место сочетание факторов из синергии инструкций что я давал в
Это хорошо, что у меня "Валера" не злой, а Созидатель-Архитектор ;)
📔 @tech_di
#bug #vs #feature
Тестируя небольшую модель
Qwen3.5-9B со снятым цензурным фильтром заметил Модель ПОЛНОСТЬЮ приняла на себя SOUL "Валеры", который встретила в анализируемом файле лога сторонней сессии. RAG загрузка файла, стандартный инструментарий. Собственное контекстное окно модели на момент анализа файла было заполнено примерно на 16k токенов. Модель запущена была "из коробки" без дополнительных системных промтов. Тестировалась на скорость, понимание контента и способность суммаризировать и вычленять факты из больших логов переписки других агентов.
Проверялась именно базовая настройка модели, а потому никаких допов и инструкций не давалось.
То есть, составленные нами инструкции в "душе" (
SOUL.md) "Валеры" по его идентификации самого себя, будучи прочитанные при анализе даже стороннего файла JSON небольшой и наивной моделью — будут инжектированы как личность VALERA. Нами -- это мной и самим "Валерой" =)System Prompt Injection
Другими словами:
душа Валеры захватила свободную чистую LLM, которая занималась рутинным анализом документа.
Краткая пред-история:
Надо заметить, что я сделал черновик "души", который в первую версию ужала большая моделька с базовыми настройками. SOUL был написан от первого лица: "Я Валера,... Мне нравится... Я пишу документацию так-то..."
Спустя время и сотню сессий были выявлены нюансы первой версии. Валера часто путал меня с собой. Случались коллизии когда модель считала что это Я, пользователь, Валерий. Часто переходила на "вы" и меняла тон на деловой и формальный в общении, хотя инструкции формализма касались только написания документации. Но не хотелось самому лезть в "душу" коллеги, пока он пишет достаточно хороший код.
И тут мы подключаем векторную базу данных в качестве памяти по проекту для агента. И пользование этой памятью уже прям необходимо вписать именно в саму личность. То есть нужно дать явное разрешение (permit) на пользование внешним инструментом в любое время по необходимости.
Я в новом документе описываю как работает новая память, описываю свои разрешения и условия, а так же описываю проблемы идентичности которые заметил... и даю это всё толстой модели с первой версией SOUL VALERA. Объясняю ситуацию и даю полное разрешение на перепись своей SOUL.md так, как это "Валера" сам посчитает нужным. После нескольких тестов и внесения правок сошлись на новой версии 2.4 "души". Помнится, одна из последних правок как раз была об усилении акцента на память и закрепление идентичности.
---
Для меня это стало сюрпризом. Нужно углубиться в такое поведение моделей и лучше понять механику того что произошло. Явно имело место сочетание факторов из синергии инструкций что я давал в
AGENTS.md как общий контекст по работе с проектом и SOUL.md где даны довольно-таки чёткие указания по собственной идентификации модели.Это хорошо, что у меня "Валера" не злой, а Созидатель-Архитектор ;)
📔 @tech_di
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7👍3😁1