Data Science Links
558 subscribers
72 photos
157 links
Зеркало vk.com/datascience и vk.com/tensorflow (ссылки на самые интересные статьи и новости), чтобы предложить пишите @irinochka_ch.

Наши сообщества: @datasciencechat, @datasciencework, vk.com/datascience, vk.com/tensorflow.
Download Telegram
Как следить за тысячей метрик и не сойти с ума. Без программирования (почти).

Постройка и содержание системы метрик и алертов - очень затратная вещь и со временем ее поддержка становится трудоемкой и появляется риск забивания. С помощью ML ребята решили эту проблему.
https://habr.com/ru/post/599645/
Open-source решение, позволяющее до предела упростить процесс машинного обучения. Именно таким является FEDOT – фреймворк генеративного AutoML. С ним можно автоматически создавать и оптимизировать цепочки задач МО (пайплайны) или отдельные их элементы.

Первая статья: https://habr.com/ru/company/spbifmo/blog/558450/
Продолжение темы: https://habr.com/ru/post/559796/
👍1
Теорема CAP в распределенных системах

CAP — это аббревиатура от Consistency, Availability, Network Partition Tolerance. Концепция распределенных систем заключается в том, что только 2 из 3 вышеперечисленных могут быть достигнуты в любое время.

https://medium.com/@jadhavrajashri49/cap-theorem-cdfbf0372493
🔥1
Анализ 2k Data Scientist и Data Engineer Jobs

Вы когда-нибудь задумывались, в чем разница в требованиях к работе между специалистами по обработке и анализу данных и инженерами по обработке и анализу данных? Вместо того, чтобы проходить через множество требований к работе, чтобы выяснить это, почему бы не использовать инструмент для получения описаний всех работ специалистов по обработке и анализу данных сразу?

https://pub.towardsai.net/i-analyzed-2k-data-scientist-and-data-engineer-jobs-and-this-is-what-i-found-1ed37f98a704
👍1
Data Mining: Первичная обработка данных при помощи СУБД.

В задачах исследования больших объемов данных есть множество тонкостей и подводных камней. Особенно для тех, кто только начинает исследовать скрытые зависимости и внутренние связи внутри массивов информации. Дополнительной трудностью становится выбор примеров, на которых можно учиться и поиск сообщества для обмена мнениями и оценки своих успехов.
https://habr.com/ru/post/165001
Пять отличных Python-библиотек для data science

Python — это лучший друг специалистов по данным, а библиотеки значительно упрощают их жизнь. Работая над NLP-проектом, автор статьи открыл для себя пять отличных Python-библиотек, которые ему во многом помогли.
https://medium.com/nuances-of-programming/пять-отличных-python-библиотек-для-data-science-3b6c63758608
🔥1
Отбор признаков в машинном обучении

В реальном мире данные не всегда такие чистые, как порой думают бизнес-заказчики. Именно поэтому востребован интеллектуальный анализ данных (data mining и data wrangling). Он помогает выявлять недостающие значения и паттерны в структурированных с помощью запросов данных, которые не может определить человек.
https://pub.towardsai.net/feature-selection-in-machine-learning-3b2902852933
Data Scientist: самая сексуальная профессия 21 века

Статья Harvard Business Review о том, что организациям необходимо знать о специалистах по обработке и анализу данных: где их искать, как их привлекать и развивать, а также как найти хорошего специалиста.
https://hbr.org/2012/10/data-scientist-the-sexiest-job-of-the-21st-century
35 реальных рисков, убивающих data- и machine learning проекты

Эта статья - обобщение опыта 30+ проектов, связанных с обработкой данных и машинным обучением. Автор перечислил только наиболее частые “грабли” именно из data-специфики, с которыми приходилось сталкиваться за последние 7 лет.

https://habr.com/ru/post/649071/
👍1
В этой статье речь пойдет об общих и очень распространенных задачах очистки данных. Автор будет использовать несколько разных наборов данных, чтобы продемонстрировать различные процессы очистки данных.
https://pub.towardsai.net/data-analysis-91a38207c92b
80 практических вопросов по Python для собеседования

Многие специалисты в области данных начинали свое путешествие с изучения языка программирования Python. Почему Python? Потому что он легок в освоении и сегодня его используют многие компании.

https://nuancesprog.ru/p/11460/
Ускоряем работу с графами в 20000 раз

Периодически возникают задачи и проекты, где данные имеют структуру графа. Например, данные о компьютерных сетях, где узлы связаны между собой. А на узлах зарегистрированы пользователи и они связаны или не связаны между собой.
https://habr.com/ru/post/650007/
В последнее десятилетие наука о данных набрала обороты, развивается и меняет свою форму. Автор сегодняшней статьи рассказывает, как о хорошо известных, так и о менее известных (или скрытых) аспектах работы Data Scientist, основываясь на своем опыте.
https://pub.towardsai.net/hidden-aspect-about-being-a-data-scientist-aa4da669fbf6
Какие опасности таятся в Искусственном интеллекте на самом деле?

Когда люди думают о гипотетических опасностях ИИ, то почему-то сразу представляют себе терминатора, который рано или поздно сбежит из лаборатории и пойдет крушить все вокруг.
https://habr.com/ru/company/jetinfosystems/blog/650565/
Самый полный репозиторий библиотек Python для Data Science разработчика

Как и в любой другой области информационных технологий, разработчику важно иметь особенный инструментарий для быстрой, удобной и качественной работы. В этой статье представлен широкий диапазон библиотек и модулей Python для работы с данными.
https://analyticsindiamag.com/python-libraries-repository-for-data-science/
👍2🔥1
Где и как хранит данные западный бизнес?

Мы решили поделиться с вами результатами опроса, проведенного агентством S&P Global в начале 2022 года. Они позволяют узнать, какие поставщики систем хранения данных и какие технологии лидируют. Также вы узнаете о том, кто готов сменить свою СХД и почему. Опрос был проведен среди компаний США и ЕС.

https://habr.com/ru/company/hostkey/blog/660841/
🤔2❤1
О «Гипотезе Лотерейного Билета»
Глубокие нейронные сети добились ошеломительного успеха во множестве областей и применений благодаря способности улавливать самые сложные и нетривиальные закономерности в данных.

https://habr.com/ru/post/718748/
👍3🔥1
Clickhouse: сжимаем данные эффективно
В этой статье мы разберем один из способов оптимизации хранения данных и запросов, который поможет ускорить процесс выполнения задачи с помощью использования кодеков сжатия в колонках
https://habr.com/ru/post/718618/
🔥2👍1
Неудачный опыт: выявление аномалий в данных методами кластеризации
Проект представлял из себя идею предсказания влияния новости на финансовый рынок. Были получены новости из раздела "Бизнес" и "Технологии", подгруженные с New York Times.
https://habr.com/ru/post/718108/
🔥3