Big Data Science [RU]
1.62K subscribers
80 photos
9 videos
545 links
Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏 — https://t.me/bdscience — Big Data Science channel (english version)
💼 — https://t.me/bds_job — channel about Data Science jobs and career
Download Telegram
💥3 полезных Python-библиотеки для Data Science и не только
Сегодня познакомимся с 3-мя библиотеками, которые могут пригодиться в задачах Data Science:
• Fabric — высокоуровневая библиотека Python (2.7, 3.4+) для удаленного выполнения команд оболочки через SSH с получением полезных объектов Python. Она основана на API Invoke (выполнение команд подпроцесса и функции командной строки) и Paramiko (реализация протокола SSH). https://github.com/fabric/fabric
• TextDistance — библиотека для сравнения расстояния между двумя или более последовательностями с помощью более 30 алгоритмов. Пригодится в NLP-задачах для определения расстояния и сходства между последовательностями. https://github.com/life4/textdistance
• Watchdog - Python API (3.6+) и утилиты оболочки для мониторинга событий файловой системы. Пригодится для мониторинга каталогов, указанных в качестве аргументов командной строки, позволяет регистрировать сгенерированные события. https://github.com/gorakhargosh/watchdog
👍6
🤔PyPy vs CPython: под капотом Python
Каждый разработчик Python-скриптов знает про CPython — наиболее распространенную реализация виртуальной машины, которая интерпретирует написанный код. Кроме CPython есть также PyPy , построенный с использованием языка RPython. По сравнению с CPython, PyPy работает быстрее, реализуя Python 2.7.18, 3.9.15 и 3.8.15. PyPy поддерживает большинство часто используемых модулей стандартных Python-библиотек. Версия PyPy x86 работает в нескольких операционных системах, таких как Linux (32/64 бита), MacOS (64 бита), Windows (32 бита), OpenBSD, FreeBSD. Версии, отличные от x86, поддерживаются в Linux, а ARM64 — в MacOS.
Впрочем, PyPy не сможет ускорить код в кратковременных процессах, которые запускаются менее чем на пару секунд: JIT-компилятору не хватит времени на «разогрев». Также PyPy не даст выиграша в скорости, если все время выполнения проводится в runtime-библиотеках, т.е. в функциях C, а не в фактическом выполнении Python-кода. Поэтому PyPy работает лучше всего при выполнении долго выполняющихся программ, когда значительная часть времени тратится на выполнение кода Python.
С точки зрения потребления памяти, PyPy также может дать фору CPython: Python-программы с высоким потреблением ОЗУ (сотни МБ и более) могут в конечном итоге занимать меньше места в PyPy, чем в CPython.
https://www.pypy.org/features.html
👍5
🚀Ускоряем качество и повышаем скорость выполнения Python-кода с Refurb
Каждый Data Scientist знает, что Python — это интерпретируемый язык. Интерпретируемый код всегда медленнее, чем компилируемый в прямой машинный код, потому что для реализации интерпретируемой инструкции требуется гораздо больше времени. Поэтому то, как вы пишете свой код на Python, сильно влияет на скорость его выполнения. Наличие хорошей структуры кода и соблюдение языкового преобразования увеличат скорость Python-кода. Улучить качество Python-кода поможет библиотека Refurb. Она может модернизировать или изменить код Python с помощью одной единственной команды. Библиотека основана на идеях clippy, встроенного линтера для Rust.
Просто установите ее через менеджер пакетов pip
pip install refurb
И используйте подсказки, чтобы улучшить качество своего Python-кода и повысить скорость его выполнения.
https://github.com/dosisod/refurb
👍4🔥2🤔1
🤔SQLlite как встроенная база данных в Python
SQLite
— это встроенная реляционная файловая СУБД (RDBMS), которую можно использовать в Python- приложениях без установки дополнительного ПО. Достаточно импортировать встроенную Python-библиотеку sqlite3, чтобы использовать SQLite.
Сперва надо создать соединение с базой данных, импортировав sqlite3, а затем вызвать метод .connect, указав имя базы данных, которую надо создать, например, new_database.db.
import sqlite3
conn = sqlite3.connect(' new_database.db ')
Перед созданием таблицы нужно создать курсор – объект, который используется для создания соединения для выполнения SQL-запросов. При этом вызывается созданное соединение и метод .cursor():
c = conn.cursor()
После этого можно применить метод .execute() для создания новой таблицы в базе данных. Внутри кавычек пишется обычный синтаксис SQL-запросов, используемый для создания таблицы в большинстве СУБД. Например, создание таблицы через оператор CREATE TABLE:
c.execute("""CREATE TABLE new_table (
name TEXT,
weight INTEGER)""")
Наполнив таблицу данными, можно выполнять к ней типовые SQL-запросы на выборку и изменение значений.
https://towardsdatascience.com/yes-python-has-a-built-in-database-heres-how-to-use-it-b3c033f172d3
👍3🔥2
#тест
Векторизация может заменить циклы
Anonymous Quiz
57%
Да
43%
Нет
👍3🤔2
🤔ТОП-4 рисков embedding’ов в ML
Встраиваемые модели широко используются в машинном обучении чтобы перевести необработанные входные данные в низкоразмерный вектор, который фиксирует их семантическое значение и может использоваться для различных последующих моделей. Предварительно обученные встраивания в качестве экстракторов признаков используются для разработки фичей различных типов входных данных (текст, изображение, аудио, видео, мультимодальный) или категориальные признаки с высокой кардинальностью.
Главными рисками embedding’ов считаются:
• Высокая запутанность - изменение выходных данных восходящей модели встраивания влияет на производительность нижестоящей модели. Полагаясь на выходные данные embedding-модели, следует переобучать нижестоящие модели.
• Скрытые петли обратной связи. Предварительно обученные фичи встраивания часто используются как черный ящик. Но знание того, на чем обучалось встраивание необработанных входных данных, очень важно для качества модели и ее интерпретируемости.
• Высокие затраты на вывод в реальном времени требует больших затрат (хранение и обслуживание). Это напрямую влияет на рентабельность инвестиций в ML. Важно обеспечить качество во время сбоев в обслуживании встраивания, стоимость обучения и стоимость обслуживания за запрос.
• Высокая стоимость отладки - отладка и мониторинг встроенных фичей или основных причин сбоев обходится очень дорого. Поэтому следует отказаться от встроенных фичей, которые не имеют большого значения для модели.
https://medium.com/better-ml/embeddings-the-high-interest-credit-card-of-feature-engineering-414c00cb82e1
👍1
💥Не только Copilot: Codex от OpenAI
OpenAI выпустил бета-релиз модели Codex на базе GPT-3, которые могут понимать и генерировать код. Их обучающие данные содержат как естественный язык, так и миллиарды строк общедоступного кода из GitHub. Эти нейросетевые модели лучше всего разбираются в Python и владеют более чем дюжиной языков программирования, включая JavaScript, Go, Perl, PHP, Ruby, Swift, TypeScript, SQL и даже Shell. Codex пригодится в следующих задачах:
• Сделать код из комментариев
• Завершить следующую строку или функцию в контексте
• Найти полезную библиотеку или вызов API
• Добавить комментарии
• Сделать рефакторинг кода для повышения его эффективности
https://beta.openai.com/docs/guides/code
👍3
🤔Почему библиотека NumPy так популярна в Python?
NumPy — это библиотека языка Python, которая добавляет поддержку больших многомерных массивов и матриц, а также высокоуровневых (и очень быстро выполняющихся) математических функций для операций с этими массивами. У данной библиотеки есть несколько важных особенностей, которые сделали ее популярным инструментом.
Во-первых, исходный ее код в свободном доступе хранится на GitHub, поэтому NumPy называют open-source модулем для Python. https://github.com/numpy/numpy/tree/main/numpy
Во-вторых, NumPy написана на языке C. Данный язык является компилируемым, то есть конструкции на этом языке преобразуются в машинный код — набор инструкций для конкретного типа процессора. Преобразование происходит с помощью специальной программы-компилятора, благодаря чему все вычисления происходят достаточно быстро.
Для примера сравним производительность NumPy-массивов и стандартных Python-списков:
import numpy
import time
list1 = range(1000000)
list2 = range(1000000)
array1 = numpy.arange(1000000)
array2 = numpy.arange(1000000)
initialTime = time.time()
resultantList = [(a * b) for a, b in zip(list1, list2)]
print("Время, затраченное на создание списка Python:",(time.time() - initialTime),"сек")
initialTime = time.time()
resultantArray = array1 * array2
print("Время, затраченное на создание массива NumPy :", (time.time() - initialTime),"сек")
Как результат, мы можем полагать, что NumPy-массивы показали себя намного быстрее (0.002 сек), чем стандартные Python-списки (0.11 сек)
В целом, можно сказать, что производительность NumPy различается на разных платформах из-за различий в программном и аппаратном обеспечении. В качестве примеров были протестированы генераторы псевдослучайных чисел. Подробности можно узнать на официальном сайте NumPy здесь: https://numpy.org/doc/stable/reference/random/performance.html#performance-on-different-operating-systems
👍2🤔1
😎Топ 6 библиотек для анализа временных рядов
Временной ряд
— это упорядоченная последовательность точек или признаков, которые измеряются через определенные временные интервалы, и которая представляет характеристику процесса. В наше время существуют такие популярные библиотеки для работы с временными рядами, как:
• Statsmodels - это библиотека с открытым исходным кодом. Построена на основе NumPy и SciPy. Statsmodel позволяет строить и анализировать статистические модели, в том числе также модели временных рядов. Также включает в себя статистические тесты, возможность работы с большими данными и др.
• Sktime - библиотека с открытым исходным кодом для машинного обучения на Python. Она разработана специально для анализа временных рядов. Sktime включает специальные алгоритмы машинного обучения и хорошо подходит для задач прогнозирования и классификации временных рядов.
• tslearn - универсальная библиотека предназначена для анализа временных рядов с помощью языка Python. Она основана на библиотеках scikit-learn, numpy и scipy. Эта библиотека предлагает инструменты для предварительной обработки и извлечения признаков, а также специальные модели для кластеризации, классификации и регрессии.
• Tsfresh - данная библиотека отлично подходит для подготовки данных к классическому табличному виду с целью постановки и решения задач классификации, прогнозирования и пр. С ее помощью можно быстро выделить большое количество признаков временных рядов, а затем отобрать только необходимые.
• Merlion - является библиотекой с открытым исходным кодом. Она предназначена для работы с временными рядами, главным образом — прогнозирования и обнаружения коллективных аномалий. Имеет типовой интерфейс для большинства моделей и наборов данных. Позволяет быстро разработать модель для решения распространенных задач в области временных рядов и тестировать ее на различных наборах данных.
• PyOD (Python Outlier Detection или PyOD) — это Python-библиотека, которая помогает обнаружить в данных точечные аномалии или выбросы. В данной библиотеке реализовано более 30 алгоритмов, начиная с классических алгоритмов типа Isolation Forest и заканчивая недавно представленными в научных статьях методами, типа COPOD и другие. Также PyOD позволяет объединять модели поиска выбросов в ансамбли для повышения качества решения задачи. Библиотека проста и понятна, а примеры в документации подробно рассказывают, как ее можно использовать.
👍3🔥2
Совет на 2023 год — выучите актуальные DevOps инструменты. DevOps на сегодня являются самыми  высокооплачиваемыми и востребованными специалистами в ит-отрасли.

А для того, чтобы научиться за месяцев, а не лет — держите в подписках канал DevOPs. Там на пальцах рассказывают что учить, на что забить и что актуально в 2023 году.

С этим каналом вы пройдете путь от "гугл - что такое Docker" до богатого DevOps специалиста.

Начните свой 2023 год продуктивно — школа DevOps
🔥2🤔2❤1👍1
💡Топ 6 источников данных для глубокого погружения в Data Science
Chronic disease data. - источник, на котором можно найти данные о различных хронических заболеваниях на территории США.
IMF Data - Международный валютный фонд, который также публикует данные о международных финансах, показателях долгов, валютных резервах, инвестициях и так далее
Financial Times Market Data - здесь содержится информация о финансовых рынках всего мира, которая включает в себя такие показатели, как товары, валюту, индексы цен на акции
ImageNet - это данные изображений для новых алгоритмов, организованные в соответствии с иерархией WordNet, в которой сотни и тысячи изображений представляют каждый узел иерархии
Stanford Dogs Dataset - здесь содержится огромное количество изображений различных пород собак
HotspotQA Dataset - данные с вопросами-ответами, позволяющие создавать системы для ответов на вопросы наиболее понятным способом.
🔥2
💥Топ 5 причин использовать Apache Spark для обработки Big Data
Apache Spark
– популярный Big Data фреймворк с открытым исходным кодом для обработки больших массивов данных в распределенной среде. Он входит в экосистему проектов Apache Hadoop. Данный фреймворк хорош тем, что имеет в своем арсенале следующие элементы:
• Богатый API - Spark предоставляет разработчику довольно обширный API, что позволяет работать с разными языками программирования, например: Python, R, Scala и Java. Spark также предлагает пользователю абстракцию датафрейма (dataframe), для которых используются объектно-ориентированные методы преобразований, объединения данных, их фильтрации, а также много других полезных возможностей.
• Довольно широкий функционал - Spark обладает широкими функциональными возможностями за счет таких компонентов, как:
1. Spark SQL - модуль, который служит для аналитической обработки данных с помощью SQL-запросов
2. Spark Streaming – модуль, обеспечивающий надстройку для обработки потоковых данных в режиме онлайн
3. MLLib – модуль, предоставляющий набор библиотек машинного обучения в распределенной среде
• Ленивые вычисления - позволяют снизить общий объем вычислений и повысить производительность программы за счет снижений требований к памяти. Данный вид вычислений весьма полезен, так как это позволяет определять сложную структуру преобразований, представленных в виде объектов. Также существует возможность проверить структуру конечного результата, не выполняя какие-либо промежуточные шаги. Еще Spark автоматически проверяет план выполнения запросов или программы на наличие ошибок. Это позволяет быстро отловить баги и отладить их.
• Открытый исходный код - входя в линейку проектов Apache Software Foundation, Спарк продолжает активно развиваться за счет сообщества разработчиков. Также, несмотря на то, что Spark является бесплатным инструментом, у него весьма подробная документация: https://spark.apache.org/documentation.html
• Распределенная обработка данных - Apache Spark предусматривает распределенную обработку данных, включая концепцию распределенных датасетов RDD (resilient distributed dataset) – это распределенная структура данных, которая размещается в оперативной памяти. Каждый такой датасет содержит фрагмент данных, распределенных по узлам кластера. За счет этого он является отказоустойчивым: если раздел теряется в результате сбоя узла, он может быть восстановлен из исходных источников. Таким образом, Spark сам раскидывает код по всем узлам кластера, разбивает его на подзадачи, создает план выполнения и отслеживает успешность выполнения.
👍4❤1🔥1
😎Что такое Pandas и чем же он так хорош?
Pandas
— это Python-библиотека для обработки и анализа структурированных данных, её название происходит от «panel data» («панельные данные»). Панельными данными называют информацию, полученную в результате исследований и структурированную в виде таблиц. Для работы с такими массивами данных в Python создана библиотека Pandas.
В основе данной библиотеки лежит DataFrame – структура данных табличного типа. Любое табличное представление данных, например, электронные таблицы или базы данных, можно использовать как DataFrame. Объект DataFrame составлен из объектов типа Series — одномерных массивов, которые объединены под одним названием и типом данных. Series можно рассматривать как столбец таблицы. Pandas имеет в свое арсенале такие преимущества, как:
Простое управление беспорядочными данными в упорядоченной форме - в датафреймах предусмотрены индексы, обеспечивающий легкий доступ к любому элементу
Гибкое изменение форм: добавление, удаление, присоединение новых или старых данных.
Интеллектуальное индексирование, которое предусматривает манипулирование и управление столбцами и строками.
Быстрое слияние и объединение наборов данных за счет их индексации, например, два и более объектов Series в один DataFrame.
Поддержка иерархического индексирования - возможность объединения столбцов под общей категорией (MultiIndex).
Открытый доступ - Pandas является opensource-библиотекой, то есть ее исходный код находится в открытом доступе
Подробная документация - у Pandas есть свой официальный сайт, на котором располагается подробная документация с пояснениями. Подробнее можно узнать по следующей ссылке: https://pandas.pydata.org/docs/
👍3
😳Как изменился рынок Data Science за последнее время?
Data Science является одной из самых перспективных и быстрорастущих отраслей не только в России, но и в мире. Причем, данные изменения затронули самые различные отрасли:
Медицина. Британский стартап Babylon Health предложил новый подход к здравоохранению. В наше время ланное решение компании использует не только алгоритмы ИИ для анализа состояния пациента, но опыт и рекомендации реальных врачей. Это помогает выбрать оптимальный подход к диагностике проблем и заботе о здоровье. Сервис ориентирован на выявление потенциальных рисков, с которыми может столкнуться пациент. Российская разработка проекта «Цельс» производит анализ флюорографии, томографии и КТ при помощи алгоритмов ИИ. Данное решение помогает увеличить показатели выявляемости онкологических заболеваний и снизить стоимость затрат на медицинские услуги. Точность диагностики — 93–95%, к сегодняшнему дню компанией проведено и обработано около 20 млн исследований.
Телеком. Операторы связи также модернизируют оборудование и применяют новый подход при работе с данными. К примеру, компания «Tele2», как и многие международные компании, начала использование кластера Hadoop, увеличив тем самым емкость платформы почти на 40% и разделила пространство на два отдельных сегмента. В одном из них реализуются проекты, связанные с обработкой данных, в другом — Data Science. Благодаря подобной конфигурации увеличивается вычислительная мощность системы, что позволяет решать высоконагруженные задачи.
Банковская сфера. Цифровая трансформация — одно из главных направлений развития банковского сектора в наше время. Здесь уже давно используют современные технологии, обрабатывают огромные массивы данных, внедряют инновации и предлагают пользователям индивидуальные предложения. Например, Сингапурский банк UOB активно применяет алгоритмы ИИ для создания более персонализированного сервиса. Искусственный интеллект анализирует расходы клиента и на основе полученной информации формирует уникальные предложения для клиентов.
🔥Обрабатываем данные с помощью Elastic Stack
Elastic Stack
— обширная экосистема компонентов, которые служат для поиска и обработки больших данных. Данная экосистема является распределенной системой на основе JSON, которая сочетает в себе функции NoSQL-базы данных. Работу Elastic Stack обеспечивают такие компоненты, как:
• Elasticsearch - это большое, быстрое и хорошо масштабируемое нереляционное хранилище данных, которое стало отличным инструментом для поиска и аналитики журналов благодаря мощности, простоте, документам JSON без схем, поддержке разных языков и геолокации. Система может быстро обрабатывать большие объемы журналов, индексировать системные логи по мере поступления и выполнять запросы к ним в режиме реального времени. Выполнение операций в Elasticsearch, таких как чтение или запись данных, обычно занимает менее секунды, что позволяет использовать его в таких примерах, где необходимо реагировать почти в режиме реального времени, например, для мониторинга приложений и обнаружения каких-либо аномалий.
• Longstash - данная утилита помогает централизовать данные, связанные с событиями, такие как сведения из файлов регистрации (логов), разные показатели (метрики) или любые другие данные в любом формате. Она может выполнить обработку данных до того, как сформировать нужную вам выборку. Это ключевой компонент Elastic Stack, который используется для сбора и обработки ваших контейнеров данных. Logstash считается компонентом на стороне сервера. Его основная цель — выполнение сбора данных из обширного количества источников ввода в масштабируемом виде, а также обработатка информации и отправка ее по месту назначения. По умолчанию преобразованная информация поступает в Elasticsearch, также существует возможность выбрать один из многих других вариантов вывода. Архитектура Logstash основана на плагинах и легко расширяется. Поддерживаются три вида плагинов: ввода, фильтрации и вывода.
• Kibana - это инструмент для визуализации в Elastic Stack, который помогает наглядно представить данные в Elasticsearch. В Kibana предлагается множество вариантов визуализаций, таких как гистограмма, карта, линейные графики, временные ряды и др. Kibana позволяет создавать визуализации буквально парой щелчков кнопкой мыши и исследовать свои данные в интерактивном виде. Кроме того, есть возможность создавать красивые панели управления, состоящие из различных визуализаций, делиться ими, а также получать высококачественные отчеты.
• Beats - это платформа доставки данных с открытым исходным кодом, дополняющая Logstash. В отличие от Logstash, работающей на серверной стороне, Beats располагается на стороне клиента. В основе данной платформы лежит библиотека libbeat, которая предоставляет API для передачи данных от источника, настройки ввода и реализации сбора данных. Beats устанавливается на устройства, которые не являются частью серверных компонентов, таких как Elasticsearch, Logstash или Kibana. Они размещаются на не кластерных узлах, которые также иногда называют пограничными узлами.
Загрузить элементы Elastic Stack можно по следующей ссылке: https://www.elastic.co/elastic-stack/
👍2
👑Работаем с графами в Python с помощью NetWorkX
NetWorkX — библиотека, которая предназначена для создания, изучения и манипуляции графами и иными сетевыми структурами. Данная бибилиотека является бесплатной, распространяемой по лицензии BSD. NetworkX используется для обучения теории графов, а также научных исследований и решения прикладных задач, в которых она применяется. NetWorkX имеет ряд сильных преимуществ, среди которых:
Высокая производительность - NetworkX способна свободно оперировать крупными сетевыми системами, содержащими до 10 миллионов вершин и 100 миллионов ребер между ними. Это особенно полезно при анализе Big Data — например, выгрузки из социальных сетей, объединяющих миллионы пользователей.
Простота использования - так как библиотека NetworkX написана на языке Python, работа с ней не составляет особого труда как для профессиональных программистов, так и для любителей. А модули визуализации графов обеспечивают наглядность полученного результата, который можно корректировать в режиме реального времени. Для того, чтобы создать полноценный граф, необходимо всего 4 строчки кода (одна из них - это просто импорт😁):
import networkx as nx
G=nx.Graph()
G.add_edge(1,2) # # значение по умолчанию для дуги задаётся = 1
G.add_edge(2,3,weight=0.9) # # задаётся значение атрибута
Эффективность - из-за того, что библиотека реализована на низкоуровневой структуре данных языка программирования Python, обеспечивается эффективное расходование аппаратных и программных ресурсов компьютера. Это увеличивает возможности по масштабированию графов, а также уменьшает зависимость от особенностей аппаратной платформы и операционной системы.
Постоянная поддержка - для NetworkX разработана подробная документация, описывающая функционал и ограничения библиотеки. Репозитории постоянно обновляются. В них собраны готовые типовые решения для программистов, заметно облегчающие работу.
Открытый исходный код - пользователь получает большие возможности по настройке и расширению функционала библиотеки, ее адаптации под конкретные задачи. При желании пользователь сам может разработать дополнительное ПО для работы с этой библиотекой.
👍3
⛑Топ 7 DS-стартапов в медицине за 2022 год
SWORD Health – сервис для физиотерапии и реабилитации, включающий в себя ряд носимых устройств, которые способны считывать физиологические показатели, сигнализирующие о болевых ощущениях, что позволяет анализировать большие массивы данных и предлагать более эффективное лечение, а также корректировать движения для устранения боли
Cala Health - сервис, предлагающий на данный момент единственное рецептурное неинвазивное средство для лечения эссенциального тремора, основанное на данных измеряемых колебаний с помощью носимых устройств, которые на основе этого также способны осуществлять индивидуальную стимуляцию периферических нервов
AppliedVR – это платформа для лечения хронических болей посредством создания библиотеки с данными, которые влияют на болевые ощущения, что позволяет проводить иммерсивную терапию через VR
Digital Diagnostics – первый автономный ИИ, одобренный федеральной организацией FDA (Food and Drug Administration), основанный на данных изображений сетчатки глаза для диагностики глазных заболеваний, вызванных диабетом, без участия врача
Iterative Health – продукт, представляющий собой сервис для автоматизации процессов проведения и анализа результатов данных эндоскопии. Данная технология основана на интерпретации данных эндоскопических изображений, помогая тем самым врачам лучше оценивать пациентов с потенциальными желудочно-кишечными проблемами
Viz.ai – сервис для интеллектуальной координации и оказания медицинской помощи в радиологии. Данная платформа предназначена для анализа данных КТ-сканов мозга с целью нахождения закупорки в нем крупных сосудов. Все полученные результаты система транслирует специалисту в сфере нервно-сосудистых заболеваний с целью обеспечения терапевтического вмешательства на раннем этапе. Такие результаты система получает буквально за несколько минут, обеспечивая этим быстрое реагирование
Unlearn -стартап, который предлагает платформу для ускорения клинических испытаний с помощью искусственного интеллекта, цифровых двойников и различных статистических методов. Данный серсис сервис способен предлагает обработку исторических наборов данных клинических испытаний от пациентов для создания моделей машинного обучения «для конкретных заболеваний», которые, в свою очередь, можно было бы использовать для создания цифровых двойников с соответствующими виртуальными медицинскими записями.
👍1
📚Топ книг по Data Science на сегодняшний день
Этика и наука о данных - в этой книге автор знакомить нас с принципами работы с данными и что сделать, чтобы внедрить их уже сегодня.
Наука о данных для экономики и финансов - в данной книге рассматривается наука о данных, включая машинное обучение, анализ социальных сетей, веб аналитика, анализ временных рядов и другое применительно к сфере экономики и финансов.
Использование науки о данных в здравоохранении - в данной книге рассматриваются вопросы использования информационных технологий и машинного обучения для борьбы с болезнями и в укреплении здоровья.
Понимание статистики и экспериментального дизайна - книга предоставляет основы, необходимые для правильного понимания, интерпретации статистики. В данной книге - ключевые концепции, а также обсуждается вопрос, почему эксперименты часто не воспроизводятся.
Создание data science команд - в книге рассматриваются навыки, перспективы, инструменты, процессы, необходимые для роста команд
Математика для машинного обучения - в данной книге рассматриваются основы математики (линейная алгебра, геометрия, векторы и др), а также основные проблемы машинного обучения.
👍4🔥1
💯ТОП-7 мартовских ивентов в Data Science
2 марта -
ML Party Yerevan • Ереван, Армения https://events.yandex.ru/events/ml-party-02-03-2023/?from=tgdatagym
6-7 марта - OpenTalks.AI • Ереван, Армения https://opentalks.ai/
16 марта - КОНФЕРЕНЦИЯ ИСКУССТВЕННЫЙ ИНТЕЛЛЕКТ 2023 • Online https://events.cnews.ru/events/iskusstvennyi_intellekt_2023.shtml
21-23 марта - XXII Международный Customer Contacts World Forum • Москва, Россия https://ccwf.ru/
22 марта - Big Data и BI Day 2023 • Москва, Россия https://www.tadviser.ru/a/701611
29 марта - IV Специализированная конференция «Передовые Технологии Автоматизации. ПТА - Казань 2023» • Казань, Россия https://www.pta-expo.ru/kazan/
29 марта - IT RETAIL DAY 2023 • Москва, Россия https://www.tadviser.ru/a/701605
👍1
💥Топ источников различных датасетов для визуализации данных
FiveThirtyEight — это журналистский сайт, который делает наборы данных из своих статей общедоступными. Данный источник предоставляет исследовательские данные, подходящие для визуализации, и включает в себя такие наборы, как безопасность авиакомпаний, прогнозы выборов и историю погоды в США. Наборы легко доступны для поиска, и сайт постоянно обновляется.
Earth Data - предлагает исследователям различные датасеты в формате открытого доступа. Информация поступает из репозиториев данных NASA, и пользователи могут исследовать все, от климатических данных до конкретных регионов, таких как океаны, до экологических проблем, таких как лесные пожары. На сайте также есть учебные пособия и вебинары, а также статьи. Богатые данные предлагают визуализацию окружающей среды, а также содержат данные от научных партнеров.
The GDELT Project - глобальный набор данных о событиях в глобальном масштабе. Данный источник предлагает одно из крупнейших хранилищ данных для человеческой цивилизации. Исследователи могут исследовать людей, места, темы, организации и другие типы предметов. Данные бесплатны, и пользователи также могут загружать наборы данных RAW для уникальных вариантов использования. Сайт также предлагает множество инструментов для пользователей с меньшим опытом создания собственных визуализаций.
Singapore Public Data - данные, которые правительство Сингапура доступными для различных исследований. Пользователи могут осуществлять поиск по теме с помощью панели навигации или самостоятельно вводить условия поиска. Наборы данных охватывают такие темы, как окружающая среда, образование, инфраструктура и транспорт.
👍1🤔1
В продолжение предыдущего поста об отличиях senior аналитика от junior.👨‍💻

Одно из самых важных качеств senior’а - умение отличать важную задачу от неважной и отвечать на вопросы, которые не заданы в задаче.

Обычно аналитики загружены большим количеством задач, а времени на их решение не так много⏳️. Поэтому необходимо правильно разделять первостепенное и второстепенное.
Так вот, когда аналитикам приходит очередное задание, junior сразу берётся его делать, а senior пытается понять его ценность, нужно ли вообще уделять этому время.🤷
Грубо говоря, хороший аналитик пытается понять ценность задачи и делает в итоге только те действия, которые необходимы бизнесу (часто переформулируя задачу), минимизируя трудозатраты.
А очень хороший аналитик внедряет аналитическую культуру, создает такую обстановку в команде, что менеджер не приходит с запросом посчитать что-либо, а может самостоятельно находить нужные цифры на основе той инфраструктуры и тех отчетов, которые были ранее созданы аналитиками.🔝 Как правило, в таких командах аналитик решает сложные бизнес задачи, помогает в принятии решений.

Давайте рассмотрим на примере.
Запрос от менеджера: "Что будет, если мы сделаем бесплатную доставку, при условии, что в заказе будет один из товаров из выбранной категории? (список категорий прилагается) Сколько мы потеряем денег на субсидировании доставок?"
❗️Важный нюанс, что в выбранной категории есть очень дешевые товары за 10 рублей, например.

Junior аналитик сразу пошел бы считать, сколько стоили все доставки, где содержался один товар из выбранной категории, нашел все заказы из этой категории, посчитал совокупную цифру, сказав, какая была в прошлом месяце, и радостно бы рапортовал об этом заказчику. Потом нашел у себя ошибку в SQL, потому что нужен не один товар, а хотя бы один. :) Исправил, снова прислал цифру. Менеджер бы стал делать какие-то вывод на основе этого.
Senior сразу бы понял нюанс этой задачи, так как если пользователи знают о категории товаров, при добавлении которых в корзину доставка станет бесплатной, то они начнут докидывать самый дешевый товар из категории постоянно, и практически на всех заказах мы будем субсидировать доставку. И для оценки не нужно делать сложных запросов, а можно за 5 минут грубо оценить эту цифру.💡

Условно в первом случае аналитик потратил на это несколько часов и не помог бизнесу, хотя формально сделал все правильно. А senior решил задачу за 5 минут, потому что понял суть вопроса.😊
👍2