Dmatryusофрения
42 subscribers
291 photos
10 videos
15 files
148 links
Пишу о книгах, лидерстве, технологиях, opensource, своих проектах и наверное чем-то ещё. Ну и репосты IT приколямб.
Download Telegram
Dmatryusофрения pinned «#stat_box Расскажу об ещё одном своём проекте: StatBox. Это минилиба, которая по большому счету является просто удобным интерфейсом для расчета статистики. Кроме того, там есть некоторая функциональность для работы с временными рядами, но она весьма ограничена…»
dmlab.pdf
1.1 MB
#dmml_lab
План развития проекта dmml-lib
#dmml_lab

Короткое резюме:
🎛 Добавил StatBoxAnalysis
Закончил модули аналитики данных
👁 Изменил концепцию визуализации
✂️ Отказался от OnModelAnalysis

Подробно:
Сегодня был продуктивный день: добавил в либу dmml_lab интеграцию stat_box, что в целом завершает набор аналитических Executor.

Изначально был план, что есть универсальный Pipeline, который включает в себя последовательность универсальных Executor, каждый из которых делает только атомарное действие. Визуализация так же изначально задумывалась, как Executor, но потом я понял, что такой подход значительно усложнит построение Pipeline и пришёл к мысли, что аналитические Executor должны сами знать, как визуализировать результат своей работы, что привело к мысли о наследниках с расширенным набором функций, но это опять же усложняет построение Pipeline, так как придётся выделять функциональные сегменты. Сейчас я пришёл к мысли, что каждый Executor должен иметь функцию визуализации, а Pipeline иметь отдельный режим работы.
Визуализация будет содержать множество параметров настройки отображения и возвращать объект визуализации. Кроме того будет возможность записать результаты визуализации в html файл. Так же предполагается возможность работы с разными бэкэндами. Пока в планах matplotlib и plotly.

Я решил отказаться от идеи анализа данных посредством модели. Реализовать такой подход можно будет посредством добавления в Pipeline Executor с моделью и последующим её анализом. Тут опять же конфликт с универсальностью, который я пока не придумал, как лучше разрешить, но склоняюсь к мысли о том, чтобы усложнить универсальный Executor и добавить больше режимов работы в Pipeline.
🔥2
#flood

Бывают дни, когда всё идёт не по плану и в логе нечего написать 😢
🤔1
#stat_box

Возникли мысли заняться ещё одной либой, интеграция которой планируется во все остальные, но решил, что прежде, чем браться за 5 проект нужно в бэту пустить какой-нибудь из текущих.

stat-box в плане базовой функциональности statistics закончен, поэтому в планах убрать оттуда time_series, причесать код с документацией и добавить несколько практических примеров анализа данных.

Когда бета версия будет готова, попробую собрать небольшую группу постоянных пользователей (коллег в основном), для сбора обратной связи.

0 цель - собрать хотя-бы 10 реальных звездочек ⭐️ на гитлабе. Если получится, буду пытаться распространить на более широкую аудиторию. После 100 ⭐️ буду пробовать рассказать об инструменте в крупных сообществах.

Если ничего из этого не получится, буду продолжать работать над этим и другими проектами в рамках небольшого комьюнити пользователей.

Апдейты будут тут и если кому-то зайдёт, буду рад 🤗
#flood

Апдейтнул описание и сделал канал публичным.
Адрес: https://t.me/dm_projects_log
🔥2
Текущие проекты


📖 Книга "Обучение без учителя. Искусство ориентации в энтропии " (#ul_book).
Книга задумывается, как лёгкое в освоении пособие по UL.

Библиотека для построения ML пайплайнов DmML-lab ( #dmml_lab).
Идея в том, чтобы разработать универсальные модули решения типичных задач DS, которые могут связываться друг с другом и последовательно выполняться. Будет библиотека готовых пайплайнов. Идеальное развитие проекта: гибкий AutoML инструмент.
Git: https://gitlab.com/dmatryus.sqrt49/dmml-lab

📊 Библиотека для простой работы с данными StatBox (#stat_box).
На данном этапе идея в расширении describe pandas.DataFrame. Планируется расширение спектра задач.
Git: https://gitlab.com/dmatryus.sqrt49/stat_box
PyPi: https://pypi.org/project/stat-box

Todo manager (#todo). В общем-то ничего особенного, но он ориентирован на анализ статистики активности.
Dmatryusофрения pinned «Текущие проекты 📖 Книга "Обучение без учителя. Искусство ориентации в энтропии " (#ul_book). Книга задумывается, как лёгкое в освоении пособие по UL. Библиотека для построения ML пайплайнов DmML-lab ( #dmml_lab). Идея в том, чтобы разработать универсальные…»
😢3😁1
#ul_lib

Слышали про semi-supervised learning?

Это способ машинного обучения, когда есть небольшое количество размеченных данных, обучаясь на которых нужно разметить много большее количество данных.

Чаще всего используют индуктивный подход:
1. Берём базовую модель (например knn или svc)
2. Обучаем её на известных данных
3. Предсказываем на этой модели неразмеченные данные
4. Отбираем предсказания
5. Переходим на шаг 2

Для отбора чаще всего используется порог по predict_proba, а алгоритм ограничивается количеством итераций или просто все точки размечаются с нужной уверенностью.

Сегодня я тоже завершил разработку такой модели, но на совсем другом принципе. В моей практике это будет уже вторая самописная semi-supervised модель.

Первую я использовал для поиска фродовых объявлений на рынке недвижимости. Но сегодня речь не о ней.

Сейчас я занимаюсь моделью эластичности клиентов. Особенность задачи в том, что истинных меток очень мало, а клиенты образуют довольно крупные кластера, поэтому классические semi-supervised подходы не решат бизнес задачу, так как зачастую реакция на разметку дорогостоящая. В антифроде, например, это затраты на ручную проверку объявления. А в случае эластичности - затраты на промо предложение.

О принципе работы своей модели расскажу в другой раз, но для затравки расскажу о предварительном тестировании:
Все знают датасет ирисов. 150 измерений. Модель на дефолтных параметрах, обучившись на 30, дала точность разметки в 0.86. Конечно, результат не показателен, да и проблемы ещё есть, но как минимум это доказывает, что концепт рабочий.
#ul_lib

Вчера весь день тестировал свой новый алгоритм. Пока рабочее название - Radius Density Classifier.

В ходе тестирования нашёл пару неприятных ошибок. После их исправления наблюдал именно такое поведение алгоритма, как задумывалось: на heatmap таргета он как бы сглаживает картинку с увеличением контраста. То есть те зоны, где таргет был плотным, он становится плотнее, а там, где был изрядно разбавлен, его становится меньше или вовсе исчезает. На этом принципе и строится предсказание.

Ключевая проблема текущей реализации... Она оооочень медленная 🐌

Большие пространства за адекватное время не разметишь. У меня уже куча идей для оптимизации, но это всё долго и требует тестов. Но бенчмарк уже выбран.
#ul_lib

Сейчас почти всё свободное время (когда есть внимание) трачу на развитие алгоритма Radius Density Classifier. Вот немного новостей.

Алгоритм хорошо справился с бизнес-задачей по разметке эластичных клиентов. Пока классическими SL (supervised learning) алгоритмами получить схожие по качеству результаты не получилось, но тесты продолжаются.

Проблема SSL (semi-supervised learning) алгоритмов в том, что они плохо интерпретируемы, так как они так или иначе построены на идее близости известных меток к неизвестным. Однако после разметки можно сделать каскад с SL алгоритмом, который лучше объясняет зависимость целевой переменной от признаков. Таким образом SSL модели можно использовать для подкрепления SL моделей. Такой же подход можно применять и в отношении интерпретации UL (unsupervised learning) алгоритмов. Не редко он работает, но не всегда.

На ближайшее время в планах изучить побольше оригинальных статей по SSL, чтобы убедиться в оригинальности моего подхода и лучше изучить существующие решения. Если всё хорошо сложится, то может получится достойная публикация.

Изучение статей так же может быть полезно для поиска методов оптимизации текущей реализации алгоритма и улучшения понимания того, как писать потенциальную научную статью.
👍1
Просто пафосная цитатка:


Иногда нужно отказываться от чего-то, что Вам хочется ради чего-то, к чему вы шли всю жизнь.


Я, конечно, не настолько целеустремлен, но почему-то это вдохновляет.
😁1
#ul_book #ul_lib

В ходе исследования SSL алгоритмов возникло желание осветить и эту тему тоже. Много думал о том, как это сделать. Решил посвятить этой теме отдельную главу в книге.

Проблема такого решения в том, что придётся менять название книги, так как она будет уже не только про обучение без учителя. Та же проблема у библиотеки.

Преимущество такого решения в том, что подходы UL и SSL похожи. А некоторые SSL алгоритмы основаны на методах кластеризации.
#ul_lib

Пуринг можно применять не только в ходе алгоритмической оптимизации, но и для коррекции своих планов.

Так я решил пока отложить оптимизацию через numpy. Там появились серьёзные проблемы с выделением подпространств из-за отсутствия индексации. Решить можно, через постоянное расширение матрицы признаков таргетом и убирание таргета. Такой костыль мне не очень по душе.

Пока попробую сосредочится на аппроксимационной оптимизации, оптимизации вычислений в pandas и распараллеливании.
#ul_lib

Удалось ускорить Radius Density Classifier. Маленькая, но победа.

На тестовом наборе данных
Обучение: 687 -> 341 сек (50.36% ускорение)
Инференс: 787 -> 594 сек (24.52% ускорение)

Ускорение достигнуто за счёт более оптимального использования pandas.
👍4🔥1
#ul_lib

В погоне за производительностью попробовал использовать в качестве бэкэнда scikit-learn NearestNeighbors. Результаты... Плачевные.

Я не разбирался как именно устроен NearestNeighbors. Но судя по тому, как он работает обучение - это просто запоминание точек, которые будут выступать соседями.

Помимо предполагаемого выигрыша в скорости NearestNeighbors сулил глубокую настройку и реализацию многопоточности.

Результаты:
1. Мгновенное обучение
2. Долгий инференс (17 минут)*
3. Инференс съел всю память, которую сумел обнаружить

* точного времени нет, так как на тестовом датасете алгоритм просто упал с ошибкой, то есть за 17 минут результат даже не был получен, а это дольше, чем обучение и инференс моей реализации вместе взятые
#ul_lib

Давненько не делился новостями. В общем-то пока новостей толком и нет.

Сейчас работаю над распараллеливанием алгоритма. Вроде получилось распараллелить процесс обучения, но пока не тестировал эффективность этого распараллеливания. Ну и в процессе пришлось отказаться от некоторых оптимизаций. Как распараллелю инференс, поделюсь результатами тестов.

В общем-то на этом планирую пока остановить разработку алгоритма и приступить к тестам на нескольких наборах данных со сравнением с другими алгоритмами.

// Буду стараться делать больше записей здесь, но по пустякам.
👌2
Нас уже 2^4 🎉
🎉8
#ul_book

Закончил черновые наброски по определению UL. Замечательно то, как авторство заставляет задуматься о вещах, которые давно не дают покоя, но ты ничего с этим не делаешь. Наверное отчасти поэтому я решил заняться книгой.
💯2