Как видите, в реальных задачках графы уже выглядят не так приятно, здесь уже нужно строить очищенные графы, выделять только сильные лаговые связи. Здесь я сделал упор, как анализ графа оформить в короткие рекомендации для команды DS и более развернутые рекомендации для бизнеса
Разбираем TabPFN-TS - TabPFN для рядов. https://boosty.to/gewissta/posts/58130135-9f45-43cb-a712-b45d0961aa93?share=post_link. Там вам останется только включить VPN (у меня Германия стоит), загрузить и запустить, во время первого запуска нужно создать акк, указать почту, ответить на 3-4 вопроса анкеты (кто вы, какие задачи решаете). Тетрадка сделана под облачный клиент tabpfn, так удобнее.
TabPFN-TS на Walmart - 2500 (бустинг - 2180), на Store Sales - 0.43 (бустинг - 0.395)
В группе по каузальному анализу вас ждет новый материал
Ну и маненько мой вклад есть, хвастаюсь, с ваших донатов-постов https://www.threads.com/@el_couguar_fox/post/DZsmHMlktN7?xmt=AQG0hMyOLwnsU8wwKoFUmuhWxv8r-0GUco7qpQ5epGbdFw. В бедах людей виноваты только люди, и в бедах животных виноваты опять люди.
На следующей недельке разберем, как можно каузальный анализ применить в автомобильной индустрии, разберем один прикладной кейс с метамоделями. https://boosty.to/gewissta/posts/35e35e5f-aae4-417d-9dcd-3952e60efbc0?share=post_link
Кроссвалидация для рядов со сложн. предподготовкой
Мой собственный рабочий инструмент, эдакий "швейцарский нож" при валидации моделей для рядов. Умеет в лаги, скользящие, признаки на базе ETS, детрендинг, логарифмирование и прочее. Даже корректировать гиперпараметры на размер выборки. Может выкидывать периоды с сомнительными данными из валидации. Pdf-гайд, Jupyter-тетрадка и модуль utils.py.
Мой собственный рабочий инструмент, эдакий "швейцарский нож" при валидации моделей для рядов. Умеет в лаги, скользящие, признаки на базе ETS, детрендинг, логарифмирование и прочее. Даже корректировать гиперпараметры на размер выборки. Может выкидывать периоды с сомнительными данными из валидации. Pdf-гайд, Jupyter-тетрадка и модуль utils.py.
Балую вас деликатесами https://boosty.to/gewissta/posts/14037397-ec9f-4101-8d4f-cb52bdca5d7e?share=post_link
Подборка постов по uplift-моделированию
https://web.tribute.tg/p/y2L
https://web.tribute.tg/p/xXs
https://web.tribute.tg/p/xSC
В третьем посте тоже про uplift-модель, но там она одна из моделей (сравниваем 4 стратегии), при чем не самая оптимальная.
https://web.tribute.tg/p/y2L
https://web.tribute.tg/p/xXs
https://web.tribute.tg/p/xSC
В третьем посте тоже про uplift-модель, но там она одна из моделей (сравниваем 4 стратегии), при чем не самая оптимальная.
Анализ чувствительности для causal inference
Jupyter-тетрадка-гайд
Placebo Treatment/Irrelevant Additional Confounder/Subset validation/Selection Bias/Random Replace
Гайд посвящен «опровергающим» проверкам (refutation checks) в кауз. анализе. Сами по себе они не доказывают, что оценка причинно-следственного эффекта верна, но позволяют проверить ее устойчивость к нарушению ключевых предположений (прежде всего — предположения об отсутствии скрытых конфаундеров, unconfoundedness). Если при разумных «возмущениях» данных и модели оценка эффекта (ATE) сохраняет знак, порядок величины и стат. значимость — мы считаем результат надежным.
Jupyter-тетрадка-гайд
Placebo Treatment/Irrelevant Additional Confounder/Subset validation/Selection Bias/Random Replace
Гайд посвящен «опровергающим» проверкам (refutation checks) в кауз. анализе. Сами по себе они не доказывают, что оценка причинно-следственного эффекта верна, но позволяют проверить ее устойчивость к нарушению ключевых предположений (прежде всего — предположения об отсутствии скрытых конфаундеров, unconfoundedness). Если при разумных «возмущениях» данных и модели оценка эффекта (ATE) сохраняет знак, порядок величины и стат. значимость — мы считаем результат надежным.
Audio
Ну что, добрались руки до разбора библиотеки каузального вывода causalml от Uber https://boosty.to/gewissta/posts/c94cfe03-0e35-4afb-a70d-f46c57436f3c?share=post_link. Планирую около 6 прикладных тетрадок в формате "прочитал и применил". Не сидим!
Кластерный анализ (171-стр. pdf, 9 тетрадок)
I. Знакомство с КА; I.1. Методы КА; I.2. Преимущества и недостатки КА; I.3. Этапы проведения КА; I.4. Выбор переменных для КА; I.5. Выбор меры расстояния между объектами; I.6. Выбор меры расстояния между кластерами; I.7. Определение оптимального количества кластеров; I.7.1. «Метод локтя»; I.7.2. Силуэтный коэффициент; I.7.3. Гэп-статистика; I.8. Верификация; II. k-средних; III. DBSCAN; IV. Метод HDBSCAN; V. Метод BIRCH
I. Знакомство с КА; I.1. Методы КА; I.2. Преимущества и недостатки КА; I.3. Этапы проведения КА; I.4. Выбор переменных для КА; I.5. Выбор меры расстояния между объектами; I.6. Выбор меры расстояния между кластерами; I.7. Определение оптимального количества кластеров; I.7.1. «Метод локтя»; I.7.2. Силуэтный коэффициент; I.7.3. Гэп-статистика; I.8. Верификация; II. k-средних; III. DBSCAN; IV. Метод HDBSCAN; V. Метод BIRCH
👏1