Машинное обучение от ИЦ "ГЕВИССТА"
616 subscribers
795 photos
25 videos
54 files
2.17K links
Download Telegram
Знакомство с тестами опровержения в DoWhy
Анализ робастности полученных оценок эффекта (через тесты опровержения - refuters)

Jupyter-тетрадка-гайд
Каузальный анализ с неск. воздействиями в DoWhy
Jupyter-тетрадка-гайд

Вычисляем суммарные эффекты нескольких воздействий в подгруппах, образованных модификаторами эффектов
(для медиков, рисковиков, специалистов, занимающихся "цифровыми двойниками")
Как видите, в реальных задачках графы уже выглядят не так приятно, здесь уже нужно строить очищенные графы, выделять только сильные лаговые связи. Здесь я сделал упор, как анализ графа оформить в короткие рекомендации для команды DS и более развернутые рекомендации для бизнеса
Разбираем TabPFN-TS - TabPFN  для рядов. https://boosty.to/gewissta/posts/58130135-9f45-43cb-a712-b45d0961aa93?share=post_link. Там вам останется только включить VPN (у меня Германия стоит), загрузить и запустить, во время первого запуска нужно создать акк, указать почту, ответить на 3-4 вопроса анкеты (кто вы, какие задачи решаете). Тетрадка сделана под облачный клиент tabpfn, так удобнее.
Промпт "Смесь экспертов" для Claude
Промпт"Смесь экспертов" и пример применения (результат отработки промпта)
TabPFN-TS на Walmart - 2500 (бустинг - 2180), на Store Sales - 0.43 (бустинг - 0.395)
В группе по каузальному анализу вас ждет новый материал
Ну и маненько мой вклад есть, хвастаюсь, с ваших донатов-постов https://www.threads.com/@el_couguar_fox/post/DZsmHMlktN7?xmt=AQG0hMyOLwnsU8wwKoFUmuhWxv8r-0GUco7qpQ5epGbdFw. В бедах людей виноваты только люди, и в бедах животных виноваты опять люди.
На следующей недельке разберем, как можно каузальный анализ применить в автомобильной индустрии, разберем один прикладной кейс с метамоделями. https://boosty.to/gewissta/posts/35e35e5f-aae4-417d-9dcd-3952e60efbc0?share=post_link
Кроссвалидация для рядов со сложн. предподготовкой
Мой собственный рабочий инструмент, эдакий "швейцарский нож" при валидации моделей для рядов. Умеет в лаги, скользящие, признаки на базе ETS, детрендинг, логарифмирование и прочее. Даже корректировать гиперпараметры на размер выборки. Может выкидывать периоды с сомнительными данными из валидации. Pdf-гайд, Jupyter-тетрадка и модуль utils.py.
Конформное прогнозирование в Python. Былое и думы
300-стр. гайд, Jupyter-тетрадки
Руководство по TabPFN-TS
Jupyter-тетрадка-гайд

Руководство по работе с фундаментальной моделью для временных рядов
Подборка постов по uplift-моделированию
https://web.tribute.tg/p/y2L
https://web.tribute.tg/p/xXs
https://web.tribute.tg/p/xSC
В третьем посте тоже про uplift-модель, но там она одна из моделей (сравниваем 4 стратегии), при чем не самая оптимальная.
Применение каузального анализа в финансах, часть 1
Марко Лопез де Прадо о каузальном факторном инвестировании, часть 1
Анализ чувствительности для causal inference
Jupyter-тетрадка-гайд

Placebo Treatment/Irrelevant Additional Confounder/Subset validation/Selection Bias/Random Replace

Гайд посвящен «опровергающим» проверкам (refutation checks) в кауз. анализе. Сами по себе они не доказывают, что оценка причинно-следственного эффекта верна, но позволяют проверить ее устойчивость к нарушению ключевых предположений (прежде всего — предположения об отсутствии скрытых конфаундеров, unconfoundedness). Если при разумных «возмущениях» данных и модели оценка эффекта (ATE) сохраняет знак, порядок величины и стат. значимость — мы считаем результат надежным.
Диагностика стационарности временных рядов
49-стр. pdf и Jupyter-тетрадка

Декомпозиция с помощью центрированного скользящего среднего, обычного скользящего среднего, полиномов, ящичковые диаграммы, матаппарат вычисления ACF/PACF, диаграммы рассеяния для лагов, тесты на единичные корни
Audio
Ну что, добрались руки до разбора библиотеки каузального вывода causalml от Uber https://boosty.to/gewissta/posts/c94cfe03-0e35-4afb-a70d-f46c57436f3c?share=post_link. Планирую около 6 прикладных тетрадок в формате "прочитал и применил". Не сидим!
Кластерный анализ (171-стр. pdf, 9 тетрадок)
I. Знакомство с КА; I.1. Методы КА; I.2. Преимущества и недостатки КА; I.3. Этапы проведения КА; I.4. Выбор переменных для КА; I.5. Выбор меры расстояния между объектами; I.6. Выбор меры расстояния между кластерами; I.7. Определение оптимального количества кластеров; I.7.1. «Метод локтя»; I.7.2. Силуэтный коэффициент; I.7.3. Гэп-статистика; I.8. Верификация; II. k-средних; III. DBSCAN; IV. Метод HDBSCAN; V. Метод BIRCH
👏1
Стекинг для временных рядов
3 Jupyter-тетрадки
Первый holdout-подход
Второй holdout-подход
Подход через cv