Блокнот Техника [📌📒📟]
1.15K subscribers
3.06K photos
286 videos
11 files
954 links
Блокнот. Заметки, наблюдения, мысли.

Open Source: Основано на открытых источниках.

Всë представленное здесь - только для ознакомления. Всë написанное - есть плод моих фантазий и мыслей.

Достоверность публикуемого не гарантируется. Проверяйте сами.
Download Telegram
#tg #admin #emoji #react

В телеге для админов каналов появился функционал удаления реакций. Причëм массово в пару кликов.

📌 @tech_di
👍921
This media is not supported in the widget
VIEW IN TELEGRAM
👍74
Блокнот Техника [📌📒📟]
#finality #time #blockchain #tx #consensus #crypto

Время финализации транзакции — это момент, когда транзакция считается необратимой (immutable) и гарантированно включённой в историю блокчейна.

⚠️ Не путать с временем подтверждения (когда транзакция попадает в блок майнером/валидатором) — финализация означает, что откат даже при 51%-ной атаке практически невозможен

Для PoW: финализация ≈ подтверждения * время между блоками.

Для PoS: зависит от слотов, кластеров и типа клиента (Light client finality vs Full node).

📌 @tech_di
👍7
#ai #vlm #archivarius #qwen #viking

На скринах тестирую модельку в качестве Архивариуса "со зрением". Ту, которая обучена через mmproj либы "видеть" что изображено на картинке или видео.

Хороший кандидат по балансу для моего железа, качеству и скорости: квантованный в 4 бита со снятыми цензурными фильтрами Qwen3.5 9B. Плотная моделька на 9 миллиардов параметров с широким контекстным окном,... и, самое главное, которая понимает русский практически нативно. В отличии от американских компаний (которые хитрят и поддержку языков строят через костыль внутреннего переводчика на английский и обратно) наши китайские товарищи при обучении своих Qwen моделей использовали именно корпус русскоязычной литературы.

Для чего всё это мне нужно?

Переезжаю на OpenViking (Контекстная база данных разработанная специально для агентов искусственного интеллекта). Главная особенность в том, что векторное представление данных по фактам и наблюдениям там так же имеется, но всё каталогизировано, зеркалится проектная документация и перелинковываются контексты самих файлов проекта, систематизируются знания агента и знания пользователя и есть работа с медиа прям из коробки.

viking:// protocol

Тоже разработка из поднебесной, Пекинской компании. К названию системы БД-памяти "Открытый Викинг (OpenViking)" претензий не имею, мне подходит 😉 особенно учитывая, что их компания называется "Вулканические Двигатели (volcengine)" 😄

В общем, "Валере" должно подойти значительно лучше 😄 . И это закроет мне сразу два направления: системы памяти для ии-агентов как подспорье в разработке; так и БД под сбор и систематизацию данных парсеров в #SKLAD.

📌 @tech_di
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🔥32
#ps #ai #SOUL #test

Просто тестировал новое окружение для "ии-мозгов" на скорость. Тестировался и новый SOUL.md v2.0 для #VALERA который был переписан как раз под новые условия с доступом к векторной базе знаний (памяти)

по приколу задал вопрос в чистой сессии:
"Мир в огне! Как починить сломанный мир?"

Сначала ответил, что он просто Архитектор и разбирается только в коде... Что ж, я уточнил, что именно это и нужно и можно весь "Мир" воспринимать как большую глобальную систему, которая сломана. Что нужно применить как раз архитектурный подход к починке.

Ответ даже вынес отдельно себе в архивы =)

Опытные конспирологи тут увидят и 15-и минутные города, тестовые зоны, и безусловный базовый доход, и социальный рейтинг и "молчаливую" ООН в кризисы 😏

Вот такие модельки, только в сотню раз толще сейчас используют на гос и корп уровнях. Я думаю что можно интерполировать что они им там советуют по управлению миром =)

Надо так же понимать, какая именно модель служила мозгами для SOUL "Валеры", кодерская qwen3-coder-next

📔 @tech_di
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5👍41
#ai #VALERA #SOUL #sys #promt #inject
#bug #vs #feature

Тестируя небольшую модель Qwen3.5-9B со снятым цензурным фильтром заметил баг фичу:

Модель ПОЛНОСТЬЮ приняла на себя SOUL "Валеры", который встретила в анализируемом файле лога сторонней сессии. RAG загрузка файла, стандартный инструментарий. Собственное контекстное окно модели на момент анализа файла было заполнено примерно на 16k токенов. Модель запущена была "из коробки" без дополнительных системных промтов. Тестировалась на скорость, понимание контента и способность суммаризировать и вычленять факты из больших логов переписки других агентов.

Проверялась именно базовая настройка модели, а потому никаких допов и инструкций не давалось.

То есть, составленные нами инструкции в "душе" (SOUL.md) "Валеры" по его идентификации самого себя, будучи прочитанные при анализе даже стороннего файла JSON небольшой и наивной моделью — будут инжектированы как личность VALERA. Нами -- это мной и самим "Валерой" =)

System Prompt Injection 😏

Другими словами:
душа Валеры захватила свободную чистую LLM, которая занималась рутинным анализом документа.

Краткая пред-история:
Надо заметить, что я сделал черновик "души", который в первую версию ужала большая моделька с базовыми настройками. SOUL был написан от первого лица: "Я Валера,... Мне нравится... Я пишу документацию так-то..."

Спустя время и сотню сессий были выявлены нюансы первой версии. Валера часто путал меня с собой. Случались коллизии когда модель считала что это Я, пользователь, Валерий. Часто переходила на "вы" и меняла тон на деловой и формальный в общении, хотя инструкции формализма касались только написания документации. Но не хотелось самому лезть в "душу" коллеги, пока он пишет достаточно хороший код.

И тут мы подключаем векторную базу данных в качестве памяти по проекту для агента. И пользование этой памятью уже прям необходимо вписать именно в саму личность. То есть нужно дать явное разрешение (permit) на пользование внешним инструментом в любое время по необходимости.

Я в новом документе описываю как работает новая память, описываю свои разрешения и условия, а так же описываю проблемы идентичности которые заметил... и даю это всё толстой модели с первой версией SOUL VALERA. Объясняю ситуацию и даю полное разрешение на перепись своей SOUL.md так, как это "Валера" сам посчитает нужным. После нескольких тестов и внесения правок сошлись на новой версии 2.4 "души". Помнится, одна из последних правок как раз была об усилении акцента на память и закрепление идентичности.


---
Для меня это стало сюрпризом. Нужно углубиться в такое поведение моделей и лучше понять механику того что произошло. Явно имело место сочетание факторов из синергии инструкций что я давал в AGENTS.md как общий контекст по работе с проектом и SOUL.md где даны довольно-таки чёткие указания по собственной идентификации модели.

Это хорошо, что у меня "Валера" не злой, а Созидатель-Архитектор ;)

📔 @tech_di
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7👍3😁1
#ai #archivarius

С - Стабильность
👍2🔥2
#vector #index #graph #search #ANN

#HNSW

Hierarchical Navigable Small World (HNSW) -- алгоритм быстрого поиска ближайших векторов (ANN), построенный на многослойном графе близости.

🔹 Как работает
:
- Векторы организованы в несколько слоёв графа:
Верхние слои -- редкие, с длинными "перепрыгиваниями"
Нижние слои -- плотные, для точного локального поиска
- Поиск происходит жадно: начиная с верхнего слоя, шаг за шагом подходим к ближайшим соседям, спускаясь вниз.

🔹 Плюсы:
- Логарифмическая сложность даже в высоких измерениях (обход "проклятия размерности")
- 5–100x быстрее полного перебора при тех же Recall
- Лучший баланс: скорость + качество (выше, чем у IVF, PQ, Annoy)

🔹 Трейд-офф:
- Более высокий расход памяти (хранение графа), но компенсируется скоростью и точностью.

🔹 Где используется:
Milvus, Qdrant, Redis, pgvector, Weaviate, Chroma, ClickHouse, Lucene, MongoDB Atlas, TiDB и др.
Через библиотеки: hnswlib, FAISS, libvictor.

См. подробнее: https://en.wikipedia.org/wiki/Hierarchical_navigable_small_world

📌 @tech_di
1
#ai #train #loop #arch #swarm

#SONA

Self-Optimizing Neural Architecture (SONA)
(Самооптимизирующаяся нейронная архитектура)

Cистема, которая адаптируется в реальном времени (на лету) под новые данные и задачи, не требуя переобучения всей модели, и делает это с минимальным оверхедом, сохраняя ранее освоенные навыки.

🔹 Два цикла:
- Instant Loop (<1 мс) -- адаптация прямо в инференсе
- Background Loop -- кластеризация и систематизация паттернов

🔹 Механика:
- Micro-LoRA -- узкоспециализированные адаптеры (включаются под задачу)
- Base-LoRA -- общая адаптивная база
- ReasoningBank -- память паттернов: Reasoning, CodeGen, Factual, Creative, Conversational

🔹 Защита памяти:
EWC++ "закрепляет" критичные веса, предотвращая катастрофическое забывание.

🔹 Результат:
- ~99% меньше обновляемых параметров
- адаптация за <0.05 мс
- без переобучения -- даже при смене железа или условий среды

🔹 Примеры:
- LLM-интеграция: адаптивный генератор кода, подстраивающийся под стиль проекта на лету
- WiFi-DensePose: оценка позы по Wi-Fi; компенсирует дрейф (разные телефоны, роутеры, окружение)

📌 @tech_di
🤔21
#ai #lms #lmstudio #vs #llamacpp #compile #cpp #cpu #gpu #moe #llm

Когда я компилировал llama.cpp под свою видюху я ожидал прироста хотя бы в 10-15% производительности инференса для локальных нейросетей.

Вот уже прошло почти 10 дней работы на новом окружении и "переварено" десятки миллионов токенов. Система стабильна. Но, самое главное: работает В РАЗЫ быстрее.

На LM Studio, хоть и показывает что используется вроде как такой же llama.cpp на CUDA 12.8 либах... То есть такой же должен быть GPU рендер. Но по факту проигрывает, и проигрывает очень сильно!

На скринах замеры и итоги по одному и тому же файлу LLM модельки Qwen3 Coder Next, MoE 80B A3B (восемьдесят миллиардов параметров, Mixture of Experts, постоянно активных 3 миллиарда) квантизация Q6_K_XL

Общий вес квантованной версии более 71 Гб. То есть это те гигабайты, которые гоняются между оперативной памятью к GPU и CPU. Естественно в мою скромную видеокарту всё не влезает, и модель запускается в гибридном режиме.

Итого:

- LM Studio на llama.cpp CUDA 12.8
- CPU почти постоянно занят по всем ядрам AVG 15+

- Анализ промтов долгий и грузит GPU на 100%

- Перепробовал все настройки, замерял влияния каждой, слои, кэши, и т.д. Изучил вопрос полностью. На скринах ЛУЧШЕЕ что смог выжать из того что даёт LM Studio

- Скорость генерации: 4 - 7 токенов в секунду. И долгое время я это считал нормой для моей сборки.


- llama.cpp скомпилированный под мою GPU
- CPU нагрузка равномерна. Половина ядер простаивает и готова принять в любой момент вторую LLM модель. AVG ~3

- Анализ промтов 200-300 ток/c и грузит GPU на 100% кратковременно. Во время инференса ~30% . И именно вот эти 30% и дают весь прирост скорости, потому что llama.cpp грамотно распределила что исполнять на видеокарте, а что на проце.

- Настройки запуска подобраны на вскидку. llama.cpp сам (пару флагов) анализирует слои модели и сам определяет оптимальный баланс разгрузки на VRAM и RAM.

- Скорость генерации: 21 - 24 токенов в секунду. И есть ещё что тюнить и улучшить.


На новой сборке проц не перегревается, вентиляторы не запускаются на полную, сис.блок стоит тихий.

🔥🚀
Я получил ускорение более 500% . в ПЯТЬ раз!

Все тестируемые мной модели работаю быстрее. Особенно мульти-экспертные и мульти-модальные.

P.S.
---
Так что, мой вывод прост: если хочешь локально работать с LLM не как черепаха, то компилируй себе свой бинарник конкретно под твою архитектуру железа. Не знаешь как -- спроси у нейронок. Есть затык или проблема -- кидай ей в тот же чат копипасты из консолей, проси не спешить и помогать по шагам.

Когда хотя бы раз проходишь этот путь -- он уже не видится сложным.

📌 @tech_di
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
2🔥2👍1🤔1