TAntispam Bot ✨ Блог разработчика
🔥 Обновление. Май 2026 Немного запоздалое обновление, обычно стараюсь сделать все к последнему дню месяца. Итак. 1. Произведено очередное дообучение. Структура модели не изменилась. Датасет обновлен. 2. Приятно удивлен тем, что количество ложных срабатываний…
Проблемы с памятью⚙️
При обучении модели антиспам бота на стационарном ПК впервые столкнулся с нехваткой оперативной памяти. Пришлось убить ряд процессов в системе, чтобы обучение прошло. Модель обучил. Но вот следующее "месячное обновление" под угрозой =)
Придётся отодвигать вправо срок выпуска новой версии LANCETNIC. Надо будет решать вопрос оптимизации обучения в части снижения расхода памяти.
В планах запустить сайт под проект. Но что то в этом месяце основной работы много, на все не хватает времени.
======================================
Я на Хабре | Марковское состояние | TAB
При обучении модели антиспам бота на стационарном ПК впервые столкнулся с нехваткой оперативной памяти. Пришлось убить ряд процессов в системе, чтобы обучение прошло. Модель обучил. Но вот следующее "месячное обновление" под угрозой =)
Придётся отодвигать вправо срок выпуска новой версии LANCETNIC. Надо будет решать вопрос оптимизации обучения в части снижения расхода памяти.
В планах запустить сайт под проект. Но что то в этом месяце основной работы много, на все не хватает времени.
======================================
Я на Хабре | Марковское состояние | TAB
GitHub
GitHub - Lancet52/lancetnic: Интструмент для создания моделей нейронных сетей работающих с текстовыми данными
Интструмент для создания моделей нейронных сетей работающих с текстовыми данными - Lancet52/lancetnic
Марковское состояние ⛓️💥
В планах запустить сайт под проект
Сайту быть!
Закончу с обновленной версией LANCETNIC и будет релиз!
Закончу с обновленной версией LANCETNIC и будет релиз!
👍3
# Обновление LANCETNIC до версии v4.0.0
### ❗️ Важное замечание о совместимости
НЕ СОВМСТИМА С ПРЕДЫДУЩИМИ ВЕРСИЯМИ
---
Что нового в версии 4.0.0:
- Произведен рефакторинг кода
- Добавлены метрики
- Добавлена возможность выбрать устройство на котором будет происходить обучение: CUDA или CPU
- Добавлен информация в консоле об устройстве на котором происходит обучение
- Добавлен новый класс MultiTask
Что дает новый класс
- Одновременное решение задач классификации и регрессии на одном наборе данных.
- Совместное прогнозирование категории и числового значения
- Оптимизация нескольких целей одновременно
- Настраиваемое соотношение потерь для каждой задачи
---
## ➡️ Установка:
🔗 Ссылки:
Github: https://github.com/Lancet52/lancetnic
PyPi: https://pypi.org/project/lancetnic/
Поддержите звездами в гитхабе!
===========
Я на Хабре | Марковское состояние | TAB
### ❗️ Важное замечание о совместимости
НЕ СОВМСТИМА С ПРЕДЫДУЩИМИ ВЕРСИЯМИ
---
Что нового в версии 4.0.0:
- Произведен рефакторинг кода
- Добавлены метрики
precision и recall на валидации для задачи Классификации.- Добавлена возможность выбрать устройство на котором будет происходить обучение: CUDA или CPU
- Добавлен информация в консоле об устройстве на котором происходит обучение
- Добавлен новый класс MultiTask
Что дает новый класс
MultiTask:- Одновременное решение задач классификации и регрессии на одном наборе данных.
- Совместное прогнозирование категории и числового значения
- Оптимизация нескольких целей одновременно
- Настраиваемое соотношение потерь для каждой задачи
---
## ➡️ Установка:
# Опционально: PyTorch с CUDA для ускорения
pip install torch==2.5.1+cu124 --index-url https://download.pytorch.org/whl/cu124
# Установка библиотеки
pip install lancetnic
🔗 Ссылки:
Github: https://github.com/Lancet52/lancetnic
PyPi: https://pypi.org/project/lancetnic/
Поддержите звездами в гитхабе!
===========
Я на Хабре | Марковское состояние | TAB
👍2
Марковское состояние ⛓️💥
# Обновление LANCETNIC до версии v4.0.0 ### ❗️ Важное замечание о совместимости НЕ СОВМСТИМА С ПРЕДЫДУЩИМИ ВЕРСИЯМИ --- Что нового в версии 4.0.0: - Произведен рефакторинг кода - Добавлены метрики precision и recall на валидации для задачи Классификации.…
Работы проведено много. Постоянно то-то приходилось допиливать. Возможно есть косяки, так как писал и тестировал ее я в соло.
Обкатывать буду на TAB
Теперь полноценно займусь сайтом!
Обкатывать буду на TAB
Теперь полноценно займусь сайтом!
Telegram
TAntispam Bot ✨ Блог разработчика
🛡 Официальный канал TAntispam Bot (TAB)
Новости разработки, обновления и руководства по защите чатов от спама.
🤖 Бот: @tantispam_bot
Новости разработки, обновления и руководства по защите чатов от спама.
🤖 Бот: @tantispam_bot
👍1
Марковское состояние ⛓️💥
Сайту быть! Закончу с обновленной версией LANCETNIC и будет релиз!
То о чем так долго мечтал - случилось! Представляю вашему вниманию сайт проекта LANCETNIC:
https://lancetnic.ru/
https://lancetnic.ru/
Forwarded from TAntispam Bot ✨ Блог разработчика
Конец июня. Я наконец доделал дашборд со статистикой работы бота с 01.06.2025.
https://tab.lancetnic.ru/
Теперь она доступна вам 24/7. Дашборд висит на моем недавно запущенном сайте библиотеки LANCETNIC. Именно на ней я обучал модель нейронной сети на которой работает бот.
Что касаемо дообучения модели на последних данных. Так как за месяц бота добавили с десяток групп, то объем данных существенно вырос. Выросли и потребности в мощностях дообучения. Пока этот вопрос решаю оптимизацией кода библиотеки. Так то дообучение на паузе) Отпишусь как обновиться модель
https://tab.lancetnic.ru/
Теперь она доступна вам 24/7. Дашборд висит на моем недавно запущенном сайте библиотеки LANCETNIC. Именно на ней я обучал модель нейронной сети на которой работает бот.
Что касаемо дообучения модели на последних данных. Так как за месяц бота добавили с десяток групп, то объем данных существенно вырос. Выросли и потребности в мощностях дообучения. Пока этот вопрос решаю оптимизацией кода библиотеки. Так то дообучение на паузе) Отпишусь как обновиться модель
Марковское состояние ⛓️💥
# Обновление LANCETNIC до версии v4.0.0 ### ❗️ Важное замечание о совместимости НЕ СОВМСТИМА С ПРЕДЫДУЩИМИ ВЕРСИЯМИ --- Что нового в версии 4.0.0: - Произведен рефакторинг кода - Добавлены метрики precision и recall на валидации для задачи Классификации.…
Оптимизация потребления памяти в LANCETNIC
Недавно столкнулся с проблемой: моя библиотека
Все в пост не влезло, поэтому всё оформил в статью на Хабре:
https://habr.com/ru/articles/1055588/
Резюмируя
Теперь обучение на больших данных происходит и на относительно слабом железе. Это не все проблемы в моей библиотеке, но на одну проблему стало меньше.
Официальный сайт LANCETNIC: https://lancetnic.ru/
GitHub: https://github.com/Lancet52/lancetnic
===========
Я на Хабре | Марковское состояние | TAB
Недавно столкнулся с проблемой: моя библиотека
lancetnic при обучении на больших текстовых датасетах просто перегружала оперативную память. На ноуте в 16 ГБ RAM модель не могла обучиться даже на 25 тыс. строк. Разбирался. Я начал разбираться и нашёл пару причин критического перерасхода памяти.Все в пост не влезло, поэтому всё оформил в статью на Хабре:
https://habr.com/ru/articles/1055588/
Резюмируя
Теперь обучение на больших данных происходит и на относительно слабом железе. Это не все проблемы в моей библиотеке, но на одну проблему стало меньше.
Официальный сайт LANCETNIC: https://lancetnic.ru/
GitHub: https://github.com/Lancet52/lancetnic
===========
Я на Хабре | Марковское состояние | TAB
Хабр
Оптимизация потребления памяти в ML-библиотеке LANCETNIC
Немного о библиотеке LANCETNIC Логотип LANCETNIC это библиотека для поиска взаимосвязей между признаками объекта и целевой переменной. Классификация, регрессия и многозадачное обучение на размеченных...
Обновление LANCETNIC до версии v4.1.0
❗️ Важное замечание о совместимости
Совместимость с предыдущей версией 4.0.0 не проверялась.
---
Что нового в версии 4.1.0:
- Изменен алгоритм векторизации текстовых данных.
- Исправлены проблемы с утечками данных при обучении валидации для задачи.
---
➡️ Установка:
Опционально: PyTorch с CUDA для ускорения
Установка библиотеки
Обновление:
🔗 Ссылки:
Github: https://github.com/Lancet52/lancetnic
PyPi: https://pypi.org/project/lancetnic/
Сайт: lancetnic.ru
Поддержите звездами в гитхабе!
===========
Я на Хабре | Марковское состояние | TAB
❗️ Важное замечание о совместимости
Совместимость с предыдущей версией 4.0.0 не проверялась.
---
Что нового в версии 4.1.0:
- Изменен алгоритм векторизации текстовых данных.
- Исправлены проблемы с утечками данных при обучении валидации для задачи.
---
➡️ Установка:
Опционально: PyTorch с CUDA для ускорения
pip install torch==2.5.1+cu124 --index-url https://download.pytorch.org/whl/cu124
Установка библиотеки
pip install lancetnic
Обновление:
pip install --upgrade lancetnic==4.1.0
🔗 Ссылки:
Github: https://github.com/Lancet52/lancetnic
PyPi: https://pypi.org/project/lancetnic/
Сайт: lancetnic.ru
Поддержите звездами в гитхабе!
===========
Я на Хабре | Марковское состояние | TAB
GitHub
GitHub - Lancet52/lancetnic: Интструмент для создания моделей нейронных сетей работающих с текстовыми данными
Интструмент для создания моделей нейронных сетей работающих с текстовыми данными - Lancet52/lancetnic
Марковское состояние ⛓️💥 pinned «Обновление LANCETNIC до версии v4.1.0 ❗️ Важное замечание о совместимости Совместимость с предыдущей версией 4.0.0 не проверялась. --- Что нового в версии 4.1.0: - Изменен алгоритм векторизации текстовых данных. - Исправлены проблемы с утечками данных…»
Forwarded from TAntispam Bot ✨ Блог разработчика
🔥 Обновление. Июль 2026.
Два месяца не обновлял модель. Как показала практика - зря. Спамеры не сидят на месте и креатива им не занимать. За этот период участились случаи, пропуска откровенных спам сообщений, что меня порой очень удивляло, ибо я был уверен, что модель это отработает на пять. Реальность была иной.
Отдельное спасибо хочу выразить неравнодушным пользователям которые указывали на проблемы. Именно благодаря тестированию проект улучшается.
Итак, по обновлениям.
1. Дообучил модель на новых данных. В качестве "не спама" набрал комментарии из городских пабликов вконтакте. Это позволит разнообразить датасет.
2. Сообщения состоящие из смайликов теперь должны правильно обрабатываться моделью и выдавать более точный результат. Но тут пока ставлю звездочку. Надо тестировать.
3. Что касается спам-изображений (стикеров). Тестирование готовых решений показало, что ни Tesseract, ни модели типа EasyOCR, RapidOCR с задачей не справились.
Зато справились LLM модели (тестировался qwen). Однако, локально запускать эти модели не представляется возможным. Как вариант использовать API, но за это надо платить и сумма выйдет немалая в месяц.
Как вариант создать свою лёгкую модель наточеную на распознавание текста с подобных изображений... Но тут прям надо с нуля все писать. Ибо lancetnic тут не подойдет в качестве материнской библиотеки.
4. Проведен очередной рефакторинг кода в части обращения к модели и БД. Для пользователя это незаметно пока. Но при кратном увеличении количества чатов, где работает бот, это поможет ему работать без задержек.
Итог.
Свеженький датасет на 30000 строк. Дообучение. Повышение стабильности и снижение количества пропуска истинно положительных значений (спама).
Дашборд бота: tab.lancetnic.ru
======================================
Я на Хабре | Марковское состояние | TAB
Два месяца не обновлял модель. Как показала практика - зря. Спамеры не сидят на месте и креатива им не занимать. За этот период участились случаи, пропуска откровенных спам сообщений, что меня порой очень удивляло, ибо я был уверен, что модель это отработает на пять. Реальность была иной.
Отдельное спасибо хочу выразить неравнодушным пользователям которые указывали на проблемы. Именно благодаря тестированию проект улучшается.
Итак, по обновлениям.
1. Дообучил модель на новых данных. В качестве "не спама" набрал комментарии из городских пабликов вконтакте. Это позволит разнообразить датасет.
2. Сообщения состоящие из смайликов теперь должны правильно обрабатываться моделью и выдавать более точный результат. Но тут пока ставлю звездочку. Надо тестировать.
3. Что касается спам-изображений (стикеров). Тестирование готовых решений показало, что ни Tesseract, ни модели типа EasyOCR, RapidOCR с задачей не справились.
Зато справились LLM модели (тестировался qwen). Однако, локально запускать эти модели не представляется возможным. Как вариант использовать API, но за это надо платить и сумма выйдет немалая в месяц.
Как вариант создать свою лёгкую модель наточеную на распознавание текста с подобных изображений... Но тут прям надо с нуля все писать. Ибо lancetnic тут не подойдет в качестве материнской библиотеки.
4. Проведен очередной рефакторинг кода в части обращения к модели и БД. Для пользователя это незаметно пока. Но при кратном увеличении количества чатов, где работает бот, это поможет ему работать без задержек.
Итог.
Свеженький датасет на 30000 строк. Дообучение. Повышение стабильности и снижение количества пропуска истинно положительных значений (спама).
Дашборд бота: tab.lancetnic.ru
======================================
Я на Хабре | Марковское состояние | TAB
👍3
Нет такого, что просто какой-то эксперт где-то нажимает кнопку, и потом оно улетает сразу непосредственно в модель. Это огромный процесс, где задействовано большое количество сотрудников, которые постоянно калибруются
Создание и подготовка данных для обучения это уже давно самостоятельное направление в машинном обучении. И сложность (как и ответственность) в подготовке хорошего датасета только растет.
Неоднократно как в пет проектах, так и в реальных задачах сталкивался с этим. Для обучения и получения точной модели - сборка, разметка датасета это 80% успеха
https://rg.ru/2026/09/10/v-moskve-proshla-pervaia-v-rossii-konferenciia-dlia-ii-trenerov.html
Российская газета
В Москве прошла первая в России конференция для ИИ-тренеров
В столице 10 сентября прошла первая в России конференция для ИИ-тренеров - специалистов, которые участвуют в обучении и проверке нейросетей.
Марковское состояние ⛓️💥
Нет такого, что просто какой-то эксперт где-то нажимает кнопку, и потом оно улетает сразу непосредственно в модель. Это огромный процесс, где задействовано большое количество сотрудников, которые постоянно калибруются Создание и подготовка данных для обучения…
Немного профессионального юмора🙂
👍3
Посетил 4-ю ежегодную конференцию 🦾 Practical ML Conf 2026 по машинному обучению от Яндекса.
Из интересного:
на конференции были представлены доклады по новым LLM моделям Alice AI Search T-35B-0.6A-Base и AliceAI-Foundation-80B-A3B-Base которые Яндекс выложил да HF в качестве базовых моделей для комерческих и опенсорс проектов (ссылочки я прикрепил). В AliceAI-Foundation-80B-A3B-Base за основу взяли архитектуру Qwen3-Next, претрейн был на собственном подготовленном корпусе данных. Бенчмарки, как по мне, ну такое... (пикча № 3). Забавно, что ни слова не упоминали про модели от Сбера типа GigaСhat и не сравнивали с ними. А было бы любопытно взглянуть.
Еще запомнился доклад Ивана Лунёва о query-based-детекции для автономного транспорта. Он подробно рассказывал про архитектуру и как это все работает с мультимодальными данными, ведь на вход модели подаются данные с камер и лидаров авто, а это несколько разных типов данных. Технически, задача была решена непростая у его команды.
Резюмируя, хочется отметить великолепную организацию и вкусный кофе🥤 .
Тезисно: в мире тренд на маленькие модели🔥
Я на Хабре | Марковское состояние | TAB
Из интересного:
на конференции были представлены доклады по новым LLM моделям Alice AI Search T-35B-0.6A-Base и AliceAI-Foundation-80B-A3B-Base которые Яндекс выложил да HF в качестве базовых моделей для комерческих и опенсорс проектов (ссылочки я прикрепил). В AliceAI-Foundation-80B-A3B-Base за основу взяли архитектуру Qwen3-Next, претрейн был на собственном подготовленном корпусе данных. Бенчмарки, как по мне, ну такое... (пикча № 3). Забавно, что ни слова не упоминали про модели от Сбера типа GigaСhat и не сравнивали с ними. А было бы любопытно взглянуть.
Еще запомнился доклад Ивана Лунёва о query-based-детекции для автономного транспорта. Он подробно рассказывал про архитектуру и как это все работает с мультимодальными данными, ведь на вход модели подаются данные с камер и лидаров авто, а это несколько разных типов данных. Технически, задача была решена непростая у его команды.
Резюмируя, хочется отметить великолепную организацию и вкусный кофе
Тезисно: в мире тренд на маленькие модели
Я на Хабре | Марковское состояние | TAB
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2