Автор статьи объясняет, что такое слабый контроль и почему, на его взгляд, в области аннотирования данных слабый контроль дополняет такие техники, как активное обучение.
https://humanloop.com/blog/why-i-changed-my-mind-about-weak-labelling-for-ml
https://humanloop.com/blog/why-i-changed-my-mind-about-weak-labelling-for-ml
Humanloop – Active Learning Platform for NLP
Why I changed my mind about weak labeling for ML
Weak labeling can replace manually annotated data with data created from heuristic rules written by domain experts. Here I want to explain what weak supervision is, what I learned and why I think it complements techniques like active learning for data annotation.
Большая подборка полезных материалов для начинающих ML-специалистов.
Здесь вы найдете ссылки на проверенные автором статьи курсы, блоги, книги и другие хорошие источники, которые помогут лучше разобраться в области deep learning и компьютерного зрения.
https://blog.xperience.ai/machine-learning-dlia-nachinaiushchikh-s-chiegho-nachat/
Здесь вы найдете ссылки на проверенные автором статьи курсы, блоги, книги и другие хорошие источники, которые помогут лучше разобраться в области deep learning и компьютерного зрения.
https://blog.xperience.ai/machine-learning-dlia-nachinaiushchikh-s-chiegho-nachat/
Подборка 23 влогов и каналов на YouTube, которые бесплатно знакомят зрителей с искусственным интеллектом, машинным обучением и data science.
https://dev.by/news/23-youtube-channels-ai-ml-data-science
https://dev.by/news/23-youtube-channels-ai-ml-data-science
dev.by
23 классных ютуб-канала про AI, машинное обучение и Data Science
Профессии аналитика данных и дата-сайентистов, специалистов по AI, машинному обучению и цифровой трансформации уже не один год делают престижные списки самых перспективных профессий LinkedIn, Всемирного экономического форума, Glassdoor и не только, а их роль…
Как следить за тысячей метрик и не сойти с ума. Без программирования (почти).
Постройка и содержание системы метрик и алертов - очень затратная вещь и со временем ее поддержка становится трудоемкой и появляется риск забивания. С помощью ML ребята решили эту проблему.
https://habr.com/ru/post/599645/
Постройка и содержание системы метрик и алертов - очень затратная вещь и со временем ее поддержка становится трудоемкой и появляется риск забивания. С помощью ML ребята решили эту проблему.
https://habr.com/ru/post/599645/
Хабр
Как следить за тысячей метрик и не сойти с ума. Без программирования (почти)
В нашей компании (GFN.ru) мы очень сильно опираемся на данные. По каждой игровой сессии мы анализируем десятки параметров. Постройка и содержание системы метрик и алертов - очень затратная вещь и со...
Что делать, если в датасете пропущены данные?
— 6 способов импутации данных с примерами
https://towardsdatascience.com/6-different-ways-to-compensate-for-missing-values-data-imputation-with-examples-6022d9ca0779
— 6 способов импутации данных с примерами
https://towardsdatascience.com/6-different-ways-to-compensate-for-missing-values-data-imputation-with-examples-6022d9ca0779
Towards Data Science
6 Different Ways to Compensate for Missing Data (Data Imputation with examples) | Towards Data Science
Popular strategies to statistically impute missing values in a dataset.
👍2
Open-source решение, позволяющее до предела упростить процесс машинного обучения. Именно таким является FEDOT – фреймворк генеративного AutoML. С ним можно автоматически создавать и оптимизировать цепочки задач МО (пайплайны) или отдельные их элементы.
Первая статья: https://habr.com/ru/company/spbifmo/blog/558450/
Продолжение темы: https://habr.com/ru/post/559796/
Первая статья: https://habr.com/ru/company/spbifmo/blog/558450/
Продолжение темы: https://habr.com/ru/post/559796/
Хабр
Как AutoML помогает создавать модели композитного ИИ — говорим о структурном обучении и фреймворке FEDOT
В лаборатории моделирования природных систем НЦКР ИТМО мы занимаемся разработкой и продвижением решений в области AutoML. Наши научные сотрудники Николай Никити...
👍1
Теорема CAP в распределенных системах
CAP — это аббревиатура от Consistency, Availability, Network Partition Tolerance. Концепция распределенных систем заключается в том, что только 2 из 3 вышеперечисленных могут быть достигнуты в любое время.
https://medium.com/@jadhavrajashri49/cap-theorem-cdfbf0372493
CAP — это аббревиатура от Consistency, Availability, Network Partition Tolerance. Концепция распределенных систем заключается в том, что только 2 из 3 вышеперечисленных могут быть достигнуты в любое время.
https://medium.com/@jadhavrajashri49/cap-theorem-cdfbf0372493
Medium
CAP Theorem
Before understanding what is CAP theorem it is important to understand importance of it.
🔥1
Анализ 2k Data Scientist и Data Engineer Jobs
Вы когда-нибудь задумывались, в чем разница в требованиях к работе между специалистами по обработке и анализу данных и инженерами по обработке и анализу данных? Вместо того, чтобы проходить через множество требований к работе, чтобы выяснить это, почему бы не использовать инструмент для получения описаний всех работ специалистов по обработке и анализу данных сразу?
https://pub.towardsai.net/i-analyzed-2k-data-scientist-and-data-engineer-jobs-and-this-is-what-i-found-1ed37f98a704
Вы когда-нибудь задумывались, в чем разница в требованиях к работе между специалистами по обработке и анализу данных и инженерами по обработке и анализу данных? Вместо того, чтобы проходить через множество требований к работе, чтобы выяснить это, почему бы не использовать инструмент для получения описаний всех работ специалистов по обработке и анализу данных сразу?
https://pub.towardsai.net/i-analyzed-2k-data-scientist-and-data-engineer-jobs-and-this-is-what-i-found-1ed37f98a704
Medium
I Analyzed 2k Data Scientist and Data Engineer Jobs and This is What I Found
Leverage your Python Skills to Understand the Skills and Requirements of your Dream Job
👍1
Data Mining: Первичная обработка данных при помощи СУБД.
В задачах исследования больших объемов данных есть множество тонкостей и подводных камней. Особенно для тех, кто только начинает исследовать скрытые зависимости и внутренние связи внутри массивов информации. Дополнительной трудностью становится выбор примеров, на которых можно учиться и поиск сообщества для обмена мнениями и оценки своих успехов.
https://habr.com/ru/post/165001
В задачах исследования больших объемов данных есть множество тонкостей и подводных камней. Особенно для тех, кто только начинает исследовать скрытые зависимости и внутренние связи внутри массивов информации. Дополнительной трудностью становится выбор примеров, на которых можно учиться и поиск сообщества для обмена мнениями и оценки своих успехов.
https://habr.com/ru/post/165001
Пять отличных Python-библиотек для data science
Python — это лучший друг специалистов по данным, а библиотеки значительно упрощают их жизнь. Работая над NLP-проектом, автор статьи открыл для себя пять отличных Python-библиотек, которые ему во многом помогли.
https://medium.com/nuances-of-programming/пять-отличных-python-библиотек-для-data-science-3b6c63758608
Python — это лучший друг специалистов по данным, а библиотеки значительно упрощают их жизнь. Работая над NLP-проектом, автор статьи открыл для себя пять отличных Python-библиотек, которые ему во многом помогли.
https://medium.com/nuances-of-programming/пять-отличных-python-библиотек-для-data-science-3b6c63758608
Medium
Пять отличных Python-библиотек для data science
Data science, или наука о данных, — это масштабная отрасль со своими ресурсами и инструментами, направленными на оптимизацию работы…
🔥1
Отбор признаков в машинном обучении
В реальном мире данные не всегда такие чистые, как порой думают бизнес-заказчики. Именно поэтому востребован интеллектуальный анализ данных (data mining и data wrangling). Он помогает выявлять недостающие значения и паттерны в структурированных с помощью запросов данных, которые не может определить человек.
https://pub.towardsai.net/feature-selection-in-machine-learning-3b2902852933
В реальном мире данные не всегда такие чистые, как порой думают бизнес-заказчики. Именно поэтому востребован интеллектуальный анализ данных (data mining и data wrangling). Он помогает выявлять недостающие значения и паттерны в структурированных с помощью запросов данных, которые не может определить человек.
https://pub.towardsai.net/feature-selection-in-machine-learning-3b2902852933
Medium
Feature Selection in Machine Learning
A conceptual guide to Feature Selection techniques in Machine Learning
Data Scientist: самая сексуальная профессия 21 века
Статья Harvard Business Review о том, что организациям необходимо знать о специалистах по обработке и анализу данных: где их искать, как их привлекать и развивать, а также как найти хорошего специалиста.
https://hbr.org/2012/10/data-scientist-the-sexiest-job-of-the-21st-century
Статья Harvard Business Review о том, что организациям необходимо знать о специалистах по обработке и анализу данных: где их искать, как их привлекать и развивать, а также как найти хорошего специалиста.
https://hbr.org/2012/10/data-scientist-the-sexiest-job-of-the-21st-century
Harvard Business Review
Data Scientist: The Sexiest Job of the 21st Century
Back in the 1990s, computer engineer and Wall Street “quant” were the hot occupations in business. Today data scientists are the hires firms are competing to make. As companies wrestle with unprecedented volumes and types of information, demand for these…
35 реальных рисков, убивающих data- и machine learning проекты
Эта статья - обобщение опыта 30+ проектов, связанных с обработкой данных и машинным обучением. Автор перечислил только наиболее частые “грабли” именно из data-специфики, с которыми приходилось сталкиваться за последние 7 лет.
https://habr.com/ru/post/649071/
Эта статья - обобщение опыта 30+ проектов, связанных с обработкой данных и машинным обучением. Автор перечислил только наиболее частые “грабли” именно из data-специфики, с которыми приходилось сталкиваться за последние 7 лет.
https://habr.com/ru/post/649071/
👍1
В этой статье речь пойдет об общих и очень распространенных задачах очистки данных. Автор будет использовать несколько разных наборов данных, чтобы продемонстрировать различные процессы очистки данных.
https://pub.towardsai.net/data-analysis-91a38207c92b
https://pub.towardsai.net/data-analysis-91a38207c92b
Medium
Common Data Cleaning Tasks in Everyday Work of a Data Scientist/Analyst in Python
Common Data Cleaning Tasks in Everyday Work of a Data Scientist/Analyst in Python
80 практических вопросов по Python для собеседования
Многие специалисты в области данных начинали свое путешествие с изучения языка программирования Python. Почему Python? Потому что он легок в освоении и сегодня его используют многие компании.
https://nuancesprog.ru/p/11460/
Многие специалисты в области данных начинали свое путешествие с изучения языка программирования Python. Почему Python? Потому что он легок в освоении и сегодня его используют многие компании.
https://nuancesprog.ru/p/11460/
NOP::Nuances of programming
80 практических вопросов по Python для собеседования
Многие начинающие ученые в области данных начали свое путешествие по науке о данных с языка программирования Python. Почему Python? Потому что он легок в освоении и сегодня его используют многие компании. Более того, этот язык универсальный и предназначен…
Ускоряем работу с графами в 20000 раз
Периодически возникают задачи и проекты, где данные имеют структуру графа. Например, данные о компьютерных сетях, где узлы связаны между собой. А на узлах зарегистрированы пользователи и они связаны или не связаны между собой.
https://habr.com/ru/post/650007/
Периодически возникают задачи и проекты, где данные имеют структуру графа. Например, данные о компьютерных сетях, где узлы связаны между собой. А на узлах зарегистрированы пользователи и они связаны или не связаны между собой.
https://habr.com/ru/post/650007/
Хабр
Ускоряем работу с графами в 20000 раз
Ссылка на статью в моем блоге Данные в виде графа. Как их хранить? Как с ними работать? Периодически возникают задачи и проекты, где данные имеют структуру графа. Например, данные о компьютерных...
В последнее десятилетие наука о данных набрала обороты, развивается и меняет свою форму. Автор сегодняшней статьи рассказывает, как о хорошо известных, так и о менее известных (или скрытых) аспектах работы Data Scientist, основываясь на своем опыте.
https://pub.towardsai.net/hidden-aspect-about-being-a-data-scientist-aa4da669fbf6
https://pub.towardsai.net/hidden-aspect-about-being-a-data-scientist-aa4da669fbf6
Medium
Hidden Aspect About Being a Data Scientist
The well-known and not-so-well-known aspects of working in the ‘sexiest’ job profile of our time.
Какие опасности таятся в Искусственном интеллекте на самом деле?
Когда люди думают о гипотетических опасностях ИИ, то почему-то сразу представляют себе терминатора, который рано или поздно сбежит из лаборатории и пойдет крушить все вокруг.
https://habr.com/ru/company/jetinfosystems/blog/650565/
Когда люди думают о гипотетических опасностях ИИ, то почему-то сразу представляют себе терминатора, который рано или поздно сбежит из лаборатории и пойдет крушить все вокруг.
https://habr.com/ru/company/jetinfosystems/blog/650565/
Хабр
Какие опасности таятся в Искусственном интеллекте на самом деле? Мнение дата-сайнтистов
Надежда, специалист машинного обучения «Инфосистемы Джет»: Когда люди думают о гипотетических опасностях ИИ, то почему-то сразу представляют себе эдакого терминатора, который внезапно сбежит из...
Самый полный репозиторий библиотек Python для Data Science разработчика
Как и в любой другой области информационных технологий, разработчику важно иметь особенный инструментарий для быстрой, удобной и качественной работы. В этой статье представлен широкий диапазон библиотек и модулей Python для работы с данными.
https://analyticsindiamag.com/python-libraries-repository-for-data-science/
Как и в любой другой области информационных технологий, разработчику важно иметь особенный инструментарий для быстрой, удобной и качественной работы. В этой статье представлен широкий диапазон библиотек и модулей Python для работы с данными.
https://analyticsindiamag.com/python-libraries-repository-for-data-science/
Analytics India Magazine
Analytics India Magazine | Analytics India Magazine
India's Leading AI & Data Science Media Platform. Get the latest news, research, and analysis on artificial intelligence, machine learning, and data science.
👍2🔥1
Где и как хранит данные западный бизнес?
Мы решили поделиться с вами результатами опроса, проведенного агентством S&P Global в начале 2022 года. Они позволяют узнать, какие поставщики систем хранения данных и какие технологии лидируют. Также вы узнаете о том, кто готов сменить свою СХД и почему. Опрос был проведен среди компаний США и ЕС.
https://habr.com/ru/company/hostkey/blog/660841/
Мы решили поделиться с вами результатами опроса, проведенного агентством S&P Global в начале 2022 года. Они позволяют узнать, какие поставщики систем хранения данных и какие технологии лидируют. Также вы узнаете о том, кто готов сменить свою СХД и почему. Опрос был проведен среди компаний США и ЕС.
https://habr.com/ru/company/hostkey/blog/660841/
🤔2❤1
Обработка естественного языка (NLP). Личный опыт — мой первый запуск BERT
https://habr.com/ru/post/718352/
https://habr.com/ru/post/718352/
Хабр
Обработка естественного языка (NLP). Личный опыт — мой первый запуск BERT
BERT — Bidirectional Encoder Representations from Transformers Здесь не будет рассказываться о том, что такое BERT, как это работает и для чего применяется —...
❤🔥2🔥1