Data Science Links
558 subscribers
72 photos
157 links
Зеркало vk.com/datascience и vk.com/tensorflow (ссылки на самые интересные статьи и новости), чтобы предложить пишите @irinochka_ch.

Наши сообщества: @datasciencechat, @datasciencework, vk.com/datascience, vk.com/tensorflow.
Download Telegram
R и Python - самые популярные языки Data Science. Они оба имеют открытый исходный код и превосходно подходят для анализа данных. Несмотря на свою конкурентную популярность, R и Python на самом деле совершенно разные, и один может быть более подходящим, чем другой для определенных ситуаций.

В этой статье рассказывается о важности обоих языков для науки о данных. Кроме того, в нем описываются их ключевые различия в способностях работы с данными и приложениями машинного обучения. И последнее, но не менее важное: мы также объясняем, какой из них изучать и почему.
https://www.imaginarycloud.com/blog/r-vs-python/
Курс про проектирование, визуализацию и понимание глубоких нейронных сетей от Калифорнийского университета Berkeley https://www.youtube.com/playlist?list=PLuv1FSpHurUevSXe_k0S7Onh6ruL-_NNh
Компания DeepMind выложила новые лекции по обучению с подкреплением на английском языке.

https://deepmind.com/learning-resources/reinforcement-learning-series-2021
Автор статьи объясняет, что такое слабый контроль и почему, на его взгляд, в области аннотирования данных слабый контроль дополняет такие техники, как активное обучение.

https://humanloop.com/blog/why-i-changed-my-mind-about-weak-labelling-for-ml
Большая подборка полезных материалов для начинающих ML-специалистов.

Здесь вы найдете ссылки на проверенные автором статьи курсы, блоги, книги и другие хорошие источники, которые помогут лучше разобраться в области deep learning и компьютерного зрения.
https://blog.xperience.ai/machine-learning-dlia-nachinaiushchikh-s-chiegho-nachat/
Как следить за тысячей метрик и не сойти с ума. Без программирования (почти).

Постройка и содержание системы метрик и алертов - очень затратная вещь и со временем ее поддержка становится трудоемкой и появляется риск забивания. С помощью ML ребята решили эту проблему.
https://habr.com/ru/post/599645/
Open-source решение, позволяющее до предела упростить процесс машинного обучения. Именно таким является FEDOT – фреймворк генеративного AutoML. С ним можно автоматически создавать и оптимизировать цепочки задач МО (пайплайны) или отдельные их элементы.

Первая статья: https://habr.com/ru/company/spbifmo/blog/558450/
Продолжение темы: https://habr.com/ru/post/559796/
👍1
Теорема CAP в распределенных системах

CAP — это аббревиатура от Consistency, Availability, Network Partition Tolerance. Концепция распределенных систем заключается в том, что только 2 из 3 вышеперечисленных могут быть достигнуты в любое время.

https://medium.com/@jadhavrajashri49/cap-theorem-cdfbf0372493
🔥1
Анализ 2k Data Scientist и Data Engineer Jobs

Вы когда-нибудь задумывались, в чем разница в требованиях к работе между специалистами по обработке и анализу данных и инженерами по обработке и анализу данных? Вместо того, чтобы проходить через множество требований к работе, чтобы выяснить это, почему бы не использовать инструмент для получения описаний всех работ специалистов по обработке и анализу данных сразу?

https://pub.towardsai.net/i-analyzed-2k-data-scientist-and-data-engineer-jobs-and-this-is-what-i-found-1ed37f98a704
👍1
Data Mining: Первичная обработка данных при помощи СУБД.

В задачах исследования больших объемов данных есть множество тонкостей и подводных камней. Особенно для тех, кто только начинает исследовать скрытые зависимости и внутренние связи внутри массивов информации. Дополнительной трудностью становится выбор примеров, на которых можно учиться и поиск сообщества для обмена мнениями и оценки своих успехов.
https://habr.com/ru/post/165001
Пять отличных Python-библиотек для data science

Python — это лучший друг специалистов по данным, а библиотеки значительно упрощают их жизнь. Работая над NLP-проектом, автор статьи открыл для себя пять отличных Python-библиотек, которые ему во многом помогли.
https://medium.com/nuances-of-programming/пять-отличных-python-библиотек-для-data-science-3b6c63758608
🔥1
Отбор признаков в машинном обучении

В реальном мире данные не всегда такие чистые, как порой думают бизнес-заказчики. Именно поэтому востребован интеллектуальный анализ данных (data mining и data wrangling). Он помогает выявлять недостающие значения и паттерны в структурированных с помощью запросов данных, которые не может определить человек.
https://pub.towardsai.net/feature-selection-in-machine-learning-3b2902852933
Data Scientist: самая сексуальная профессия 21 века

Статья Harvard Business Review о том, что организациям необходимо знать о специалистах по обработке и анализу данных: где их искать, как их привлекать и развивать, а также как найти хорошего специалиста.
https://hbr.org/2012/10/data-scientist-the-sexiest-job-of-the-21st-century
35 реальных рисков, убивающих data- и machine learning проекты

Эта статья - обобщение опыта 30+ проектов, связанных с обработкой данных и машинным обучением. Автор перечислил только наиболее частые “грабли” именно из data-специфики, с которыми приходилось сталкиваться за последние 7 лет.

https://habr.com/ru/post/649071/
👍1
В этой статье речь пойдет об общих и очень распространенных задачах очистки данных. Автор будет использовать несколько разных наборов данных, чтобы продемонстрировать различные процессы очистки данных.
https://pub.towardsai.net/data-analysis-91a38207c92b
80 практических вопросов по Python для собеседования

Многие специалисты в области данных начинали свое путешествие с изучения языка программирования Python. Почему Python? Потому что он легок в освоении и сегодня его используют многие компании.

https://nuancesprog.ru/p/11460/
Ускоряем работу с графами в 20000 раз

Периодически возникают задачи и проекты, где данные имеют структуру графа. Например, данные о компьютерных сетях, где узлы связаны между собой. А на узлах зарегистрированы пользователи и они связаны или не связаны между собой.
https://habr.com/ru/post/650007/