Марковское состояние ⛓️‍💥
19 subscribers
13 photos
14 links
Я ML инженер. Это мой блог

Мои проекты:
🤖 Антиспам TAB: t.me/tantispam
LANCETNIC: https://github.com/Lancet52/lancetnic
Download Telegram
TAntispam Bot Блог разработчика
🔥 Обновление. Май 2026 Немного запоздалое обновление, обычно стараюсь сделать все к последнему дню месяца. Итак. 1. Произведено очередное дообучение. Структура модели не изменилась. Датасет обновлен. 2. Приятно удивлен тем, что количество ложных срабатываний…
Проблемы с памятью⚙️

При обучении модели антиспам бота на стационарном ПК впервые столкнулся с нехваткой оперативной памяти. Пришлось убить ряд процессов в системе, чтобы обучение прошло. Модель обучил. Но вот следующее "месячное обновление" под угрозой =)
Придётся отодвигать вправо срок выпуска новой версии LANCETNIC. Надо будет решать вопрос оптимизации обучения в части снижения расхода памяти.
В планах запустить сайт под проект. Но что то в этом месяце основной работы много, на все не хватает времени.

======================================
Я на Хабре | Марковское состояние | TAB
Марковское состояние ⛓️‍💥
В планах запустить сайт под проект
Сайту быть!
Закончу с обновленной версией LANCETNIC и будет релиз!
👍3
# Обновление LANCETNIC до версии v4.0.0

### ❗️ Важное замечание о совместимости

НЕ СОВМСТИМА С ПРЕДЫДУЩИМИ ВЕРСИЯМИ

---
Что нового в версии 4.0.0:
- Произведен рефакторинг кода
- Добавлены метрики precision и recall на валидации для задачи Классификации.
- Добавлена возможность выбрать устройство на котором будет происходить обучение: CUDA или CPU
- Добавлен информация в консоле об устройстве на котором происходит обучение
- Добавлен новый класс MultiTask

Что дает новый класс MultiTask:
- Одновременное решение задач классификации и регрессии на одном наборе данных.
- Совместное прогнозирование категории и числового значения
- Оптимизация нескольких целей одновременно
- Настраиваемое соотношение потерь для каждой задачи

---
## ➡️ Установка:
# Опционально: PyTorch с CUDA для ускорения
pip install torch==2.5.1+cu124 --index-url https://download.pytorch.org/whl/cu124

# Установка библиотеки
pip install lancetnic


🔗 Ссылки:
Github: https://github.com/Lancet52/lancetnic
PyPi: https://pypi.org/project/lancetnic/

Поддержите звездами в гитхабе!

===========
Я на Хабре | Марковское состояние | TAB
👍2
Марковское состояние ⛓️‍💥
Сайту быть! Закончу с обновленной версией LANCETNIC и будет релиз!
То о чем так долго мечтал - случилось! Представляю вашему вниманию сайт проекта LANCETNIC:

https://lancetnic.ru/
Конец июня. Я наконец доделал дашборд со статистикой работы бота с 01.06.2025.

https://tab.lancetnic.ru/

Теперь она доступна вам 24/7. Дашборд висит на моем недавно запущенном сайте библиотеки LANCETNIC. Именно на ней я обучал модель нейронной сети на которой работает бот.

Что касаемо дообучения модели на последних данных. Так как за месяц бота добавили с десяток групп, то объем данных существенно вырос. Выросли и потребности в мощностях дообучения. Пока этот вопрос решаю оптимизацией кода библиотеки. Так то дообучение на паузе) Отпишусь как обновиться модель
Марковское состояние ⛓️‍💥
# Обновление LANCETNIC до версии v4.0.0 ### ❗️ Важное замечание о совместимости НЕ СОВМСТИМА С ПРЕДЫДУЩИМИ ВЕРСИЯМИ --- Что нового в версии 4.0.0: - Произведен рефакторинг кода - Добавлены метрики precision и recall на валидации для задачи Классификации.…
Оптимизация потребления памяти в LANCETNIC

Недавно столкнулся с проблемой: моя библиотека lancetnic при обучении на больших текстовых датасетах просто перегружала оперативную память. На ноуте в 16 ГБ RAM модель не могла обучиться даже на 25 тыс. строк. Разбирался. Я начал разбираться и нашёл пару причин критического перерасхода памяти.

Все в пост не влезло, поэтому всё оформил в статью на Хабре:

https://habr.com/ru/articles/1055588/

Резюмируя
Теперь обучение на больших данных происходит и на относительно слабом железе. Это не все проблемы в моей библиотеке, но на одну проблему стало меньше.

Официальный сайт LANCETNIC: https://lancetnic.ru/
GitHub: https://github.com/Lancet52/lancetnic
===========
Я на Хабре | Марковское состояние | TAB
Обновление LANCETNIC до версии v4.1.0

❗️ Важное замечание о совместимости

Совместимость с предыдущей версией 4.0.0 не проверялась.

---
Что нового в версии 4.1.0:
- Изменен алгоритм векторизации текстовых данных.
- Исправлены проблемы с утечками данных при обучении валидации для задачи.

---
➡️ Установка:
Опционально: PyTorch с CUDA для ускорения
pip install torch==2.5.1+cu124 --index-url https://download.pytorch.org/whl/cu124


Установка библиотеки

pip install lancetnic

Обновление:

pip install --upgrade lancetnic==4.1.0



🔗 Ссылки:
Github: https://github.com/Lancet52/lancetnic
PyPi: https://pypi.org/project/lancetnic/
Сайт: lancetnic.ru

Поддержите звездами в гитхабе!

===========
Я на Хабре | Марковское состояние | TAB
Марковское состояние ⛓️‍💥 pinned «Обновление LANCETNIC до версии v4.1.0 ❗️ Важное замечание о совместимости Совместимость с предыдущей версией 4.0.0 не проверялась. --- Что нового в версии 4.1.0: - Изменен алгоритм векторизации текстовых данных. - Исправлены проблемы с утечками данных…»
🔥 Обновление. Июль 2026.

Два месяца не обновлял модель. Как показала практика - зря. Спамеры не сидят на месте и креатива им не занимать. За этот период участились случаи, пропуска откровенных спам сообщений, что меня порой очень удивляло, ибо я был уверен, что модель это отработает на пять. Реальность была иной.

Отдельное спасибо хочу выразить неравнодушным пользователям которые указывали на проблемы. Именно благодаря тестированию проект улучшается.

Итак, по обновлениям.

1. Дообучил модель на новых данных. В качестве "не спама" набрал комментарии из городских пабликов вконтакте. Это позволит разнообразить датасет.

2. Сообщения состоящие из смайликов теперь должны правильно обрабатываться моделью и выдавать более точный результат. Но тут пока ставлю звездочку. Надо тестировать.

3. Что касается спам-изображений (стикеров). Тестирование готовых решений показало, что ни Tesseract, ни модели типа EasyOCR, RapidOCR с задачей не справились.
Зато справились LLM модели (тестировался qwen). Однако, локально запускать эти модели не представляется возможным. Как вариант использовать API, но за это надо платить и сумма выйдет немалая в месяц.

Как вариант создать свою лёгкую модель наточеную на распознавание текста с подобных изображений... Но тут прям надо с нуля все писать. Ибо lancetnic тут не подойдет в качестве материнской библиотеки.

4. Проведен очередной рефакторинг кода в части обращения к модели и БД. Для пользователя это незаметно пока. Но при кратном увеличении количества чатов, где работает бот, это поможет ему работать без задержек.

Итог.
Свеженький датасет на 30000 строк. Дообучение. Повышение стабильности и снижение количества пропуска истинно положительных значений (спама).

Дашборд бота: tab.lancetnic.ru

======================================

Я на Хабре | Марковское состояние | TAB
👍3
Нет такого, что просто какой-то эксперт где-то нажимает кнопку, и потом оно улетает сразу непосредственно в модель. Это огромный процесс, где задействовано большое количество сотрудников, которые постоянно калибруются


Создание и подготовка данных для обучения это уже давно самостоятельное направление в машинном обучении. И сложность (как и ответственность) в подготовке хорошего датасета только растет.

Неоднократно как в пет проектах, так и в реальных задачах сталкивался с этим. Для обучения и получения точной модели - сборка, разметка датасета это 80% успеха

https://rg.ru/2026/09/10/v-moskve-proshla-pervaia-v-rossii-konferenciia-dlia-ii-trenerov.html
Небольшой спойлер: сегодня так)
🔥4
Посетил 4-ю ежегодную конференцию 🦾Practical ML Conf 2026 по машинному обучению от Яндекса.

Из интересного:
на конференции были представлены доклады по новым LLM моделям Alice AI Search T-35B-0.6A-Base и AliceAI-Foundation-80B-A3B-Base которые Яндекс выложил да HF в качестве базовых моделей для комерческих и опенсорс проектов (ссылочки я прикрепил). В AliceAI-Foundation-80B-A3B-Base за основу взяли архитектуру Qwen3-Next, претрейн был на собственном подготовленном корпусе данных. Бенчмарки, как по мне, ну такое... (пикча № 3). Забавно, что ни слова не упоминали про модели от Сбера типа GigaСhat и не сравнивали с ними. А было бы любопытно взглянуть.
Еще запомнился доклад Ивана Лунёва о query-based-детекции для автономного транспорта. Он подробно рассказывал про архитектуру и как это все работает с мультимодальными данными, ведь на вход модели подаются данные с камер и лидаров авто, а это несколько разных типов данных. Технически, задача была решена непростая у его команды.

Резюмируя, хочется отметить великолепную организацию и вкусный кофе🥤.

Тезисно: в мире тренд на маленькие модели 🔥

Я на Хабре | Марковское состояние | TAB
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2