Data Science Links
558 subscribers
72 photos
157 links
Зеркало vk.com/datascience и vk.com/tensorflow (ссылки на самые интересные статьи и новости), чтобы предложить пишите @irinochka_ch.

Наши сообщества: @datasciencechat, @datasciencework, vk.com/datascience, vk.com/tensorflow.
Download Telegram
Вышел пре-релиз TensorFlow 2.1

Поддержка GPU в pip теперь присутствует по умолчанию для Linux и Windows, для всех машин, как с наличием, так и с отсутствием Nvidia GPU.

Платформа глубогого обучения TensorRT 6 доступна и включена по умолчанию. Согласно Nvidia, TensorRT 6 ускоряет некоторые варианты использования, такие как разговорный AI и может использоваться внутри различных фреймворков, например, TensorFlow и ONNX Runtime (движок от Microsoft).

Появились новые фичи в tf.keras и tf.data

https://github.com/tensorflow/tensorflow/releases/tag/v2.1.0-rc0
Как обстоят дела с производительностью TensorFlow на видеокартах AMD Radeon VII ($500)? Если у вас получилось установить TensorFlow с поддержкой ROCM, то карта от AMD работает на 90% от мощности NVIDIA RTX 2080 Ti ($1,100) - использовался lambda-tensorflow-benchmark и FP32
https://github.com/ROCmSoftwarePlatform/tensorflow-upstream/issues/362
Статья объясняет все матричные вычисления, которые могут понадобиться, чтобы понять, как работает глубокое обучение. Предполагается, что читатель уже знает дифференциальное исчисление функции одной переменной и знаком на практике с нейронными сетями https://explained.ai/matrix-calculus/index.html
Инференс в продакшене с использованием Rust (по сравнению с Python и scikit-learn) может ускорить производительность в 26 раз, а тренировка K-Means модели на датасете в 1 миллион точек будет быстрее на 30% https://www.lpalmieri.com/posts/2019-12-01-taking-ml-to-production-with-rust-a-25x-speedup/
Нам часто пишут из крупных компаний, стартапов, и университетов с просьбами разместить вакансию, опубликовать хакатон, найти студентов на стажировку. Но такой контент не очень удобно часто публиковать в чате. Поэтому от нашей группы открылся канал в котором публикуются свежие вакансии и мероприятия в сфере Data Science и Machine Learning: @datasciencework.
Погружение в глубокое обучение: бесплатная интерактивная книга с кодом, математикой и обсуждениями http://d2l.ai
R и Python - самые популярные языки Data Science. Они оба имеют открытый исходный код и превосходно подходят для анализа данных. Несмотря на свою конкурентную популярность, R и Python на самом деле совершенно разные, и один может быть более подходящим, чем другой для определенных ситуаций.

В этой статье рассказывается о важности обоих языков для науки о данных. Кроме того, в нем описываются их ключевые различия в способностях работы с данными и приложениями машинного обучения. И последнее, но не менее важное: мы также объясняем, какой из них изучать и почему.
https://www.imaginarycloud.com/blog/r-vs-python/
Курс про проектирование, визуализацию и понимание глубоких нейронных сетей от Калифорнийского университета Berkeley https://www.youtube.com/playlist?list=PLuv1FSpHurUevSXe_k0S7Onh6ruL-_NNh
Компания DeepMind выложила новые лекции по обучению с подкреплением на английском языке.

https://deepmind.com/learning-resources/reinforcement-learning-series-2021
Автор статьи объясняет, что такое слабый контроль и почему, на его взгляд, в области аннотирования данных слабый контроль дополняет такие техники, как активное обучение.

https://humanloop.com/blog/why-i-changed-my-mind-about-weak-labelling-for-ml
Большая подборка полезных материалов для начинающих ML-специалистов.

Здесь вы найдете ссылки на проверенные автором статьи курсы, блоги, книги и другие хорошие источники, которые помогут лучше разобраться в области deep learning и компьютерного зрения.
https://blog.xperience.ai/machine-learning-dlia-nachinaiushchikh-s-chiegho-nachat/
Как следить за тысячей метрик и не сойти с ума. Без программирования (почти).

Постройка и содержание системы метрик и алертов - очень затратная вещь и со временем ее поддержка становится трудоемкой и появляется риск забивания. С помощью ML ребята решили эту проблему.
https://habr.com/ru/post/599645/
Open-source решение, позволяющее до предела упростить процесс машинного обучения. Именно таким является FEDOT – фреймворк генеративного AutoML. С ним можно автоматически создавать и оптимизировать цепочки задач МО (пайплайны) или отдельные их элементы.

Первая статья: https://habr.com/ru/company/spbifmo/blog/558450/
Продолжение темы: https://habr.com/ru/post/559796/
👍1
Теорема CAP в распределенных системах

CAP — это аббревиатура от Consistency, Availability, Network Partition Tolerance. Концепция распределенных систем заключается в том, что только 2 из 3 вышеперечисленных могут быть достигнуты в любое время.

https://medium.com/@jadhavrajashri49/cap-theorem-cdfbf0372493
🔥1
Анализ 2k Data Scientist и Data Engineer Jobs

Вы когда-нибудь задумывались, в чем разница в требованиях к работе между специалистами по обработке и анализу данных и инженерами по обработке и анализу данных? Вместо того, чтобы проходить через множество требований к работе, чтобы выяснить это, почему бы не использовать инструмент для получения описаний всех работ специалистов по обработке и анализу данных сразу?

https://pub.towardsai.net/i-analyzed-2k-data-scientist-and-data-engineer-jobs-and-this-is-what-i-found-1ed37f98a704
👍1