👀Как оценить качество мультиобъектной ML-модели компьютерного зрения?
Слежение за несколькими объектами в реальной среде – сложная задача, в т.ч. из-за метрик оценки качества ML-модели, цель которой оценить точность слежения и проверить траекторию движущегося объекта. Предположим, для каждого кадра в видеопотоке система отслеживания выводит гипотезу 'n', а в кадре есть 'm' основных истинных объектов. Тогда процесс оценки показателей выглядит следующим образом:
• Найти и сопоставить наилучшее совпадение между гипотезой и основной истиной на основе их координат и с помощью различных алгоритмов сопоставления.
• Для каждой совпавшей пары найдите ошибку в положении объекта.
• Рассчитайте сумму нескольких ошибок, таких как промахи (трекер не смог выдвинуть гипотезу для объекта), ложные срабатывания (когда трекер выдал гипотезу, но объект отсутствовал) и ошибки несоответствия (когда гипотеза следящего за достоверной информацией изменила текущий кадр).
Так производительность ML-модели может быть выражена двумя метриками:
• MOTP (Multi-Object Tracking Precision) показывает, насколько точно оцениваются точные положения объекта. Это общая ошибка в оценке местоположения для совпадающих пар наземной истины-гипотезы по всем кадрам, усредненная по общему количеству сделанных совпадений. Эта метрика не отвечает за распознавание конфигураций объектов и оценку траекторий объектов. Метрика находится в диапазоне от 0 до 1. Если значение MOTP равно 1, то точность системы низкая. А если он близок к нулю, значит точность системы хорошая.
• MOTA (Multi-Object Tracking Accuracy) показывает, сколько ошибок система слежения сделала (промахи, ложные срабатывания, ошибок несоответствия). Метрика варьируется от –inf до 1. Если MOTA равен 1, то точность системы хорошая. Если MOTA около нуля или меньше нуля, то точность системы низкая.
https://pub.towardsai.net/multi-object-tracking-metrics-1e602f364c0c
Слежение за несколькими объектами в реальной среде – сложная задача, в т.ч. из-за метрик оценки качества ML-модели, цель которой оценить точность слежения и проверить траекторию движущегося объекта. Предположим, для каждого кадра в видеопотоке система отслеживания выводит гипотезу 'n', а в кадре есть 'm' основных истинных объектов. Тогда процесс оценки показателей выглядит следующим образом:
• Найти и сопоставить наилучшее совпадение между гипотезой и основной истиной на основе их координат и с помощью различных алгоритмов сопоставления.
• Для каждой совпавшей пары найдите ошибку в положении объекта.
• Рассчитайте сумму нескольких ошибок, таких как промахи (трекер не смог выдвинуть гипотезу для объекта), ложные срабатывания (когда трекер выдал гипотезу, но объект отсутствовал) и ошибки несоответствия (когда гипотеза следящего за достоверной информацией изменила текущий кадр).
Так производительность ML-модели может быть выражена двумя метриками:
• MOTP (Multi-Object Tracking Precision) показывает, насколько точно оцениваются точные положения объекта. Это общая ошибка в оценке местоположения для совпадающих пар наземной истины-гипотезы по всем кадрам, усредненная по общему количеству сделанных совпадений. Эта метрика не отвечает за распознавание конфигураций объектов и оценку траекторий объектов. Метрика находится в диапазоне от 0 до 1. Если значение MOTP равно 1, то точность системы низкая. А если он близок к нулю, значит точность системы хорошая.
• MOTA (Multi-Object Tracking Accuracy) показывает, сколько ошибок система слежения сделала (промахи, ложные срабатывания, ошибок несоответствия). Метрика варьируется от –inf до 1. Если MOTA равен 1, то точность системы хорошая. Если MOTA около нуля или меньше нуля, то точность системы низкая.
https://pub.towardsai.net/multi-object-tracking-metrics-1e602f364c0c
Medium
Multi-Object Tracking Metrics
The Evaluation process is one of the most important steps in build a Machine Learning Model. Especially when it comes to real-time…
😜Нужна аналитика настроений в комментариях на YouTube?
Более 2 миллиардов пользователей смотрят видео на YouTube хотя бы раз в месяц. Популярные ютуб-блогеры собирают миллиарды просмотров. Но всем подписчикам не угодишь и общественное мнение постоянно меняется. Постройте свою модель анализа пользовательских настроений с Youtube-Comment-Scraper - Python-библиотеки для получения комментариев к YouTube-роликам с помощью автоматизации браузера (пока работает только в Windows). Этот open-source проект поможет создать дэшборд, анализирующую отношение подписчиков к видеороликам популярных ютуберов. Работа сведется к следующим шагам:
• сбор нужных комментариев к видео от пользователей YouTube;
• использование предварительно обученной ML-модели, чтобы делать прогнозы по каждому комментарию;
• визуализация прогнозов модели на дэшборде, в т.ч. с помощью Dash на Python или Shiny на R.
Можно добавить интерактивности, позволив пользователям фильтровать результаты анализа настроений по времени выпуска, автору и жанру видео.
https://pypi.org/project/youtube-comment-scraper-python/
Более 2 миллиардов пользователей смотрят видео на YouTube хотя бы раз в месяц. Популярные ютуб-блогеры собирают миллиарды просмотров. Но всем подписчикам не угодишь и общественное мнение постоянно меняется. Постройте свою модель анализа пользовательских настроений с Youtube-Comment-Scraper - Python-библиотеки для получения комментариев к YouTube-роликам с помощью автоматизации браузера (пока работает только в Windows). Этот open-source проект поможет создать дэшборд, анализирующую отношение подписчиков к видеороликам популярных ютуберов. Работа сведется к следующим шагам:
• сбор нужных комментариев к видео от пользователей YouTube;
• использование предварительно обученной ML-модели, чтобы делать прогнозы по каждому комментарию;
• визуализация прогнозов модели на дэшборде, в т.ч. с помощью Dash на Python или Shiny на R.
Можно добавить интерактивности, позволив пользователям фильтровать результаты анализа настроений по времени выпуска, автору и жанру видео.
https://pypi.org/project/youtube-comment-scraper-python/
Регистрация на бесплатную международную онлайн-конференцию DataArt IT NonStop 2021 открыта!
IT NonStop продлится с 18 по 20 ноября. Главные темы: машинное обучение и искусственный интеллект, работа с данными, облачные технологии. Рабочий язык — английский, но секции, ориентированные на начинающих специалистов, — на русском. Программа одного дня полностью состоит из воркшопов и ознакомительных лекций для начинающих IT-специалистов.
В программе — более 30 докладов и воркшопов специалистов из Microsoft, AWS, Ocado, Codete, Ciklum, Eleks, SoftServe, Toloka, Yandex, DataArt и других компаний. Мы не смогли уместить в один пост всех, поэтому вот несколько тем воркшопов:
— "Creating Real-Time Data Streaming powered by SQL on Kubernetes" Albert Lewandowski, Big Data DevOps Engineer, GetInData.
— "Create your own cognitive portrait in 60 minutes", Dmitry Soshnikov, Cloud Developer Advocate, Microsoft.
— "Training unbiased and accurate AI models", Robert Yenokyan, AI Lead, Pinsight.
Все темы можно посмотреть на сайте. И да, мы все еще добавляем новых докладчиков.
Кратко про IT NonStop 2021:
Когда: 18–20 ноября.
Где: онлайн. Участие бесплатное.
Регистрация по ссылке: https://it-nonstop.net/register-to-the-conference/?utm_source=bdscience&utm_medium=referral
IT NonStop продлится с 18 по 20 ноября. Главные темы: машинное обучение и искусственный интеллект, работа с данными, облачные технологии. Рабочий язык — английский, но секции, ориентированные на начинающих специалистов, — на русском. Программа одного дня полностью состоит из воркшопов и ознакомительных лекций для начинающих IT-специалистов.
В программе — более 30 докладов и воркшопов специалистов из Microsoft, AWS, Ocado, Codete, Ciklum, Eleks, SoftServe, Toloka, Yandex, DataArt и других компаний. Мы не смогли уместить в один пост всех, поэтому вот несколько тем воркшопов:
— "Creating Real-Time Data Streaming powered by SQL on Kubernetes" Albert Lewandowski, Big Data DevOps Engineer, GetInData.
— "Create your own cognitive portrait in 60 minutes", Dmitry Soshnikov, Cloud Developer Advocate, Microsoft.
— "Training unbiased and accurate AI models", Robert Yenokyan, AI Lead, Pinsight.
Все темы можно посмотреть на сайте. И да, мы все еще добавляем новых докладчиков.
Кратко про IT NonStop 2021:
Когда: 18–20 ноября.
Где: онлайн. Участие бесплатное.
Регистрация по ссылке: https://it-nonstop.net/register-to-the-conference/?utm_source=bdscience&utm_medium=referral
🔥30 сентября 2021 г. в 10.00 (мск) состоится онлайн-мероприятие «Цифровой четверг X5 — открытый разговор». Спикеры из Яндекса, X5 Retail Group, Крок, Ростелекома и Мегафона расскажут, как и зачем становиться Data-Driven компанией, почему иногда кейсы работы с данными не приносят реальной пользы бизнесу и могут ли алгоритмы заменить людей или за цифрами все же нужен человек.
Регистрация https://x5-retail-group-event.timepad.ru/event/1743630/
Регистрация https://x5-retail-group-event.timepad.ru/event/1743630/
🍁ТОП-10 DS-событий в октябре:
1. 1 октября - Marketing Data Analytics 2021 – всероссийский форум по сбору и анализу данных в маркетинге https://interforums.ru/mda/registration
2. 2 октября 13:00 - 17:00 (МСК) – онлайн-митап Яндекса, посвященный библиотеке CatBoost https://events.yandex.ru/events/catboost/02-10-2021
3. 5 октября 19:00-21:00 (МСК) – онлайн ML-party от Яндекса https://events.yandex.ru/events/ml-party-05-10-2021
4. 6-7 октября – онлайн-конференция «Умные решения — умная страна: вызовы и перемены»: 36 спикеров из ВУЗов, правительства, ритейла и промышленных предприятий поделятся своим опытом построения Data-driven решений https://smart-conference.ru/
5. 8 октября - Х Отраслевая конференция «IT в ритейле: Большие перемены» http://infor-media.ru/events/111/2871/
6. 11-14 октября - Smart Data - конференция по Data Engineering –стриминговые технологии, СУБД и DWH, облачные решения, оркестрация data pipeline’ов на Kafka, Spark, Flink, NiFi, AirFlow и других технологиях Big Data https://smartdataconf.ru/
7. 15 октября - BiNE 2021: II Международная научно-практическая конференция «Большие данные в образовании: доказательное развитие образования» https://conferences.science/conferences/bine-2021.html
8. 19-21 октября – LoginomDay 2021 – практическая онлайн-конференция по анализу данных, Data Science и Machine Learning https://day.loginom.ru/
9. 28 октября – Citymobil Data Meetup №3 – очередной митап о Data science в городских и геосервисах, логистике и технологиях умных городов https://citymobil.timepad.ru/events/
10. 31 октября - I Открытый Чемпионат по искусственному интеллекту «SPb AI Champ'21» для студентов российских технических вузов https://spbaichamp.ru/
🍂
1. 1 октября - Marketing Data Analytics 2021 – всероссийский форум по сбору и анализу данных в маркетинге https://interforums.ru/mda/registration
2. 2 октября 13:00 - 17:00 (МСК) – онлайн-митап Яндекса, посвященный библиотеке CatBoost https://events.yandex.ru/events/catboost/02-10-2021
3. 5 октября 19:00-21:00 (МСК) – онлайн ML-party от Яндекса https://events.yandex.ru/events/ml-party-05-10-2021
4. 6-7 октября – онлайн-конференция «Умные решения — умная страна: вызовы и перемены»: 36 спикеров из ВУЗов, правительства, ритейла и промышленных предприятий поделятся своим опытом построения Data-driven решений https://smart-conference.ru/
5. 8 октября - Х Отраслевая конференция «IT в ритейле: Большие перемены» http://infor-media.ru/events/111/2871/
6. 11-14 октября - Smart Data - конференция по Data Engineering –стриминговые технологии, СУБД и DWH, облачные решения, оркестрация data pipeline’ов на Kafka, Spark, Flink, NiFi, AirFlow и других технологиях Big Data https://smartdataconf.ru/
7. 15 октября - BiNE 2021: II Международная научно-практическая конференция «Большие данные в образовании: доказательное развитие образования» https://conferences.science/conferences/bine-2021.html
8. 19-21 октября – LoginomDay 2021 – практическая онлайн-конференция по анализу данных, Data Science и Machine Learning https://day.loginom.ru/
9. 28 октября – Citymobil Data Meetup №3 – очередной митап о Data science в городских и геосервисах, логистике и технологиях умных городов https://citymobil.timepad.ru/events/
10. 31 октября - I Открытый Чемпионат по искусственному интеллекту «SPb AI Champ'21» для студентов российских технических вузов https://spbaichamp.ru/
🍂
interforums.ru
Marketing Data Analytics форум по сбору и анализу данных в маркетинге - Регистрация
Стоимость участия в Marketing Data Analytics форум по сбору и анализу данных в маркетинге, аналитика в контент маркетинге, персонализация
🗣3 факта об использовании памяти в Python, о которых вы не знали
Поскольку Python является основным языком программирования в задачах Data Science, каждому DS-специалисту пригодятся следующие особенности этого инструмента:
• Получение адреса объекта в памяти - для этого Python использует функция id(), которая возвращать адрес памяти для переменной в виде целого числа.
• Сборка мусора - Python использует метод подсчета ссылок, чтобы решить, когда объект должен быть удален из памяти. Python вычисляет количество ссылок на каждый объект, и когда объект не имеет ссылки, запускается Garbage Collection. Для сложных случаев, можно вручную изменить поведение сборки мусора с помощью модуля gc в Python.
• Интернирование или целочисленное кэширование - чтобы сэкономить время и затраты на память, Python всегда предварительно загружает все целые числа в диапазоне [-5, 256]. Когда объявляется новая целочисленная переменная в этом диапазоне, Python просто ссылается на нее кэшированное целое число и не создает никаких новых объектов. Поэтому независимо от того, сколько переменных было создано, если они относятся к целому числу 256 в диапазоне [-5, 256], все они будут указывать на один и тот же адрес памяти кэшированного целого числа. Аналогично в Python есть механизмы интернирования для коротких строк.
https://medium.com/techtofreedom/memory-management-in-python-3-popular-interview-questions-bce4bc69b69a
Поскольку Python является основным языком программирования в задачах Data Science, каждому DS-специалисту пригодятся следующие особенности этого инструмента:
• Получение адреса объекта в памяти - для этого Python использует функция id(), которая возвращать адрес памяти для переменной в виде целого числа.
• Сборка мусора - Python использует метод подсчета ссылок, чтобы решить, когда объект должен быть удален из памяти. Python вычисляет количество ссылок на каждый объект, и когда объект не имеет ссылки, запускается Garbage Collection. Для сложных случаев, можно вручную изменить поведение сборки мусора с помощью модуля gc в Python.
• Интернирование или целочисленное кэширование - чтобы сэкономить время и затраты на память, Python всегда предварительно загружает все целые числа в диапазоне [-5, 256]. Когда объявляется новая целочисленная переменная в этом диапазоне, Python просто ссылается на нее кэшированное целое число и не создает никаких новых объектов. Поэтому независимо от того, сколько переменных было создано, если они относятся к целому числу 256 в диапазоне [-5, 256], все они будут указывать на один и тот же адрес памяти кэшированного целого числа. Аналогично в Python есть механизмы интернирования для коротких строк.
https://medium.com/techtofreedom/memory-management-in-python-3-popular-interview-questions-bce4bc69b69a
Medium
Memory Management in Python: 3 Popular Interview Questions
Dive into the internal mechanisms
🕸Анализ американского рынка Data Science 2021: веб-скрейпинговый проект на Selenium по открытым вакансиям с наглядными результатами и выводами. Также в обзоре вы узнаете о популярности языков программирования и ML-фреймворков у работодателей США.
https://pub.towardsai.net/current-data-science-job-market-trend-analysis-future-4184f03a04ca
https://pub.towardsai.net/current-data-science-job-market-trend-analysis-future-4184f03a04ca
Medium
Data Science Job Market Trend Analysis for 2021
Know what employers are expecting for a data scientist role in 2021. Data analysis from over 3000+ data scientist job postings — extracted…
Всем привет!
В эту пятницу (1 октября) митап 'ml in marketing'
🔥 Будет доклад про аналитику зарплат :)
🔸19:00 - 20:00
🎤 Егор Борисов, Lead DS at DataWise
📋 Зарплаты и вакансии в Data Science: инсайты и тренды по данным чата ODS
📋 По мотивам этой статьи. Обзор рынка Data Science по данным из чатов ODS. Спрос на специалистов растет, или рынок уже насытился, какие технологии теряют, а какие набирают популярность, размер зарплатных вилок и от чего они зависят? Авторы исследования поделятся подходом, результатами и своими мыслями. Будет полезно каждому, кого волнует какие вакансии востребованы сегодня, куда и как расти.
— — —
🗓 1 октября, начало в 19:00 мск, Пятница
🌐 ОНЛАЙН
Регистрация на мероприятие тут
В эту пятницу (1 октября) митап 'ml in marketing'
🔥 Будет доклад про аналитику зарплат :)
🔸19:00 - 20:00
🎤 Егор Борисов, Lead DS at DataWise
📋 Зарплаты и вакансии в Data Science: инсайты и тренды по данным чата ODS
📋 По мотивам этой статьи. Обзор рынка Data Science по данным из чатов ODS. Спрос на специалистов растет, или рынок уже насытился, какие технологии теряют, а какие набирают популярность, размер зарплатных вилок и от чего они зависят? Авторы исследования поделятся подходом, результатами и своими мыслями. Будет полезно каждому, кого волнует какие вакансии востребованы сегодня, куда и как расти.
— — —
🗓 1 октября, начало в 19:00 мск, Пятница
🌐 ОНЛАЙН
Регистрация на мероприятие тут
Forwarded from Алексей Чернобровов
YouTube
Алексей Чернобровов о том, как Data Science приносит пользу бизнесу | Интервью | karpov.courses
Курс Start ML: https://bit.ly/408cUyk
Курс Hard ML: https://bit.ly/3TdYt9E
Все мы знаем, что основная задача аналитика в индустрии это приносить пользу бизнесу. Но что это значит на практике, как именно метрики машинного обучения конвертируются в деньги…
Курс Hard ML: https://bit.ly/3TdYt9E
Все мы знаем, что основная задача аналитика в индустрии это приносить пользу бизнесу. Но что это значит на практике, как именно метрики машинного обучения конвертируются в деньги…
🤦🏼♀️Машинное забывание– новая задача в ML
Иногда ML-алгоритмы должны забывать то, чему научились. Например, искусственный интеллект может разрушить конфиденциальность. Регулирующие органы по всему миру имеют право заставлять компании удалять неправомерно полученную информацию. Граждане ЕС и Калифорнии могут потребовать, чтобы компания удалила их данные. Недавно регулирующие органы США и Европы заявили, что владельцы систем искусственного интеллекта иногда должны удалять системы, обученные на конфиденциальных данных. А в 2020 году британский регулятор данных предупредил компании, что на некоторые ML-программы могут распространяться права GDPR, поскольку они содержат персональные данные. В начале 2021 года Федеральная торговая комиссия США вынудила стартап по распознаванию лиц Paravision удалить коллекцию неправильно полученных фотографий лиц и ML-алгоритмов, обученных на них.
Таким образом, мы приходим к новой области DS под названием машинного разучивания, которая ищет способы вызвать избирательную амнезию для ИИ, чтобы удалить все следы определенного человека или точки данных из ML-системы, не влияя на ее производительность. Некоторые исследования показали, что при определенных условиях можно заставить ML-алгоритмы забыть что-то, но этот метод еще не готов для использования в production. В частности, в 2019 году ученые из университетов Торонто и Висконсин-Мэдисон предложили разделять исходные данные для машинного обучения на несколько частей, каждая из которых обрабатывается отдельно, прежде чем результаты будут объединены в окончательную ML-модель. Если позднее потребуется забыть одну точку данных, нужно повторно обработать только часть исходного датасета. Тестирование показало, что подход работает с данными об онлайн-покупках и коллекцией из более чем миллиона фотографий. Однако, система разобучения выйдет из строя, если отправленные запросы на удаление будут поступать в определенной последовательности. Теперь исследователи ищут, как решить эту проблему. Впрочем, методы машинного разобучения являются скорее демонстрацией технической проницательности, чем серьезным сдвигом в защите данных. Ведь, даже если машины научатся забывать, пользователям придется помнить о том, с кем они делятся своими данными.
https://www.wired.com/story/machines-can-learn-can-they-unlearn/
Иногда ML-алгоритмы должны забывать то, чему научились. Например, искусственный интеллект может разрушить конфиденциальность. Регулирующие органы по всему миру имеют право заставлять компании удалять неправомерно полученную информацию. Граждане ЕС и Калифорнии могут потребовать, чтобы компания удалила их данные. Недавно регулирующие органы США и Европы заявили, что владельцы систем искусственного интеллекта иногда должны удалять системы, обученные на конфиденциальных данных. А в 2020 году британский регулятор данных предупредил компании, что на некоторые ML-программы могут распространяться права GDPR, поскольку они содержат персональные данные. В начале 2021 года Федеральная торговая комиссия США вынудила стартап по распознаванию лиц Paravision удалить коллекцию неправильно полученных фотографий лиц и ML-алгоритмов, обученных на них.
Таким образом, мы приходим к новой области DS под названием машинного разучивания, которая ищет способы вызвать избирательную амнезию для ИИ, чтобы удалить все следы определенного человека или точки данных из ML-системы, не влияя на ее производительность. Некоторые исследования показали, что при определенных условиях можно заставить ML-алгоритмы забыть что-то, но этот метод еще не готов для использования в production. В частности, в 2019 году ученые из университетов Торонто и Висконсин-Мэдисон предложили разделять исходные данные для машинного обучения на несколько частей, каждая из которых обрабатывается отдельно, прежде чем результаты будут объединены в окончательную ML-модель. Если позднее потребуется забыть одну точку данных, нужно повторно обработать только часть исходного датасета. Тестирование показало, что подход работает с данными об онлайн-покупках и коллекцией из более чем миллиона фотографий. Однако, система разобучения выйдет из строя, если отправленные запросы на удаление будут поступать в определенной последовательности. Теперь исследователи ищут, как решить эту проблему. Впрочем, методы машинного разобучения являются скорее демонстрацией технической проницательности, чем серьезным сдвигом в защите данных. Ведь, даже если машины научатся забывать, пользователям придется помнить о том, с кем они делятся своими данными.
https://www.wired.com/story/machines-can-learn-can-they-unlearn/
WIRED
Now That Machines Can Learn, Can They Unlearn?
Privacy concerns about AI systems are growing. So researchers are testing whether they can remove sensitive data without retraining the system from scratch.
Премиум-EDA с Lux
Продолжаем рассказывать о полезных DS-инструментах, которые пригодятся в ежедневной работе. Например, Python-библиотека Lux, которая упрощает и ускоряет исследование данных за счет автоматизации процесса визуализации и анализа данных. Для датафрейма в Jupyter Notebook, Lux рекомендует набор визуализаций, выделяющих интересные тенденции и закономерности в наборе данных. Визуализации отображаются с помощью интерактивного виджета, который позволяет быстро просматривать большие коллекции визуализаций и разбираться в данных. Будучи глубоко интегрированным с Pandas, Lux поддерживает различные типы географических и временных данных в этой библиотеке, а также SQL-запросы к Postgres.
Центральная часть модели данных Lux Dataframe – подкласс Pandas dataframe, который поддерживает все операции с данными, а также содержит другие переменные и функции для генерации визуальных рекомендаций.
https://github.com/lux-org/lux
https://lux-api.readthedocs.io/en/latest/source/getting_started/overview.html
Продолжаем рассказывать о полезных DS-инструментах, которые пригодятся в ежедневной работе. Например, Python-библиотека Lux, которая упрощает и ускоряет исследование данных за счет автоматизации процесса визуализации и анализа данных. Для датафрейма в Jupyter Notebook, Lux рекомендует набор визуализаций, выделяющих интересные тенденции и закономерности в наборе данных. Визуализации отображаются с помощью интерактивного виджета, который позволяет быстро просматривать большие коллекции визуализаций и разбираться в данных. Будучи глубоко интегрированным с Pandas, Lux поддерживает различные типы географических и временных данных в этой библиотеке, а также SQL-запросы к Postgres.
Центральная часть модели данных Lux Dataframe – подкласс Pandas dataframe, который поддерживает все операции с данными, а также содержит другие переменные и функции для генерации визуальных рекомендаций.
https://github.com/lux-org/lux
https://lux-api.readthedocs.io/en/latest/source/getting_started/overview.html
☂️Обратный ETL: что это и как использовать
Обратный ETL - это процесс копирования данных из хранилища данных в операционные системы, включая SaaS для маркетинга, продаж и поддержки. Это позволяет любой команде специалистов, от продавцов до инженеров, получить доступ к нужным данным в системах, которые они используют. Выделяют 3 основных варианта использования обратного ETL:
• Операционная аналитика - предоставление аналитических сведений бизнес-командам в их обычных рабочих процессах и инструментах, чтобы принимать решения на основе данных
• Автоматизация данных - автоматизация специальных запросов данных от других команд, например, когда финансисты запрашивают данные об использовании продуктов для выставления счетов
• Персонализация взаимодействия с клиентов в разных приложениях.
Сегодня наиболее популярными средствами обратного ETL можно назвать следующие:
• Hightouch - платформа данных, которая позволяет синхронизировать данные из хранилищ с инструментами CRM, маркетинга и клиентской поддержки https://hightouch.io/docs/
• Census - платформа оперативной аналитики, которая синхронизирует хранилище данных с разными приложениями https://www.getcensus.com/
• Octolis – облачный сервис, позволяющий отделам маркетинга и продаж легко развертывать сценарии использования, активируя свои данные в своих операционных инструментах, например, CRM или ПО для автоматизации маркетинга https://octolis.com/
• Grouparoo - обратный ETL с открытым исходным кодом, который легко запускается на ноутбуке или в облаке, позволяя разрабатывать локально, фиксировать изменения и развертывать https://www.grouparoo.com/docs/config
• Polytomic – ETL-решение, которое позволяет за пару минут создавать в реальном времени все необходимые данные о клиентах в Marketo, Salesforce, HubSpot и других бизнес-системах https://www.polytomic.com/
• RudderStack - платформа клиентских данных для разработчиков, где инструменты обратного ETL упрощают развертывание конвейеров, собирающих данные о клиентах из каждого приложения, веб-сайта и SaaS-платформ, чтобы активировать их в DWH и в прикладных системах https://rudderstack.com/
• Workato – средство автоматизации бизнес-процессов в облачных и локальных приложениях https://www.workato.com/
• Omnata – инструмент интеграции данных для современных архитектур https://omnata.com/
• Smart ETL Tool от Rivery – платформа автоматизации ETL-процессов с помощью любой облачной СУБД, включая Redshift, Oracle, BigQuery, Azure и Snowflake https://rivery.io/
Обратный ETL - это процесс копирования данных из хранилища данных в операционные системы, включая SaaS для маркетинга, продаж и поддержки. Это позволяет любой команде специалистов, от продавцов до инженеров, получить доступ к нужным данным в системах, которые они используют. Выделяют 3 основных варианта использования обратного ETL:
• Операционная аналитика - предоставление аналитических сведений бизнес-командам в их обычных рабочих процессах и инструментах, чтобы принимать решения на основе данных
• Автоматизация данных - автоматизация специальных запросов данных от других команд, например, когда финансисты запрашивают данные об использовании продуктов для выставления счетов
• Персонализация взаимодействия с клиентов в разных приложениях.
Сегодня наиболее популярными средствами обратного ETL можно назвать следующие:
• Hightouch - платформа данных, которая позволяет синхронизировать данные из хранилищ с инструментами CRM, маркетинга и клиентской поддержки https://hightouch.io/docs/
• Census - платформа оперативной аналитики, которая синхронизирует хранилище данных с разными приложениями https://www.getcensus.com/
• Octolis – облачный сервис, позволяющий отделам маркетинга и продаж легко развертывать сценарии использования, активируя свои данные в своих операционных инструментах, например, CRM или ПО для автоматизации маркетинга https://octolis.com/
• Grouparoo - обратный ETL с открытым исходным кодом, который легко запускается на ноутбуке или в облаке, позволяя разрабатывать локально, фиксировать изменения и развертывать https://www.grouparoo.com/docs/config
• Polytomic – ETL-решение, которое позволяет за пару минут создавать в реальном времени все необходимые данные о клиентах в Marketo, Salesforce, HubSpot и других бизнес-системах https://www.polytomic.com/
• RudderStack - платформа клиентских данных для разработчиков, где инструменты обратного ETL упрощают развертывание конвейеров, собирающих данные о клиентах из каждого приложения, веб-сайта и SaaS-платформ, чтобы активировать их в DWH и в прикладных системах https://rudderstack.com/
• Workato – средство автоматизации бизнес-процессов в облачных и локальных приложениях https://www.workato.com/
• Omnata – инструмент интеграции данных для современных архитектур https://omnata.com/
• Smart ETL Tool от Rivery – платформа автоматизации ETL-процессов с помощью любой облачной СУБД, включая Redshift, Oracle, BigQuery, Azure и Snowflake https://rivery.io/
Fivetran
Fivetran | Automated data movement platform
Effortlessly centralize all the data you need so your team can deliver better insights, faster. Start for free.
Forwarded from Алексей Чернобровов
Сегодня я расскажу о Cloud-провайдере Русоникс, точнее об одном из ее продуктов, который может пригодится для DS-задач: виртуальный дата-центр – облачный сервис по модели «Инфраструктура как услуга» (IaaS). https://www.rusonyx.ru/iaas/
Как и у прочих облачных провайдеров, стоимость использования зависит от потребляемых ресурсов и первичных настроек, стартуя от 1000 рублей в месяц на самой простой конфигурации (ОС Ubuntu на 1 виртуальный ЦП с 1ГБ памяти, 1 ГБ HDD и 5-ю IP-адресами). Максимальная стоимость около 87 тысяч в месяц для ОС Windows Server 2016, 24 виртуальных ЦП, 128 ГБ памяти, хранилище почти 4 терабайта SSD и 32 IP-адреса. Каждый дополнительный диск увеличивает цену и неудивительно, что SSD стоит дороже HDD. Также можно выбрать дополнительные опции: резервное копирование, VPN/L2 на Яндекс.Cloud и балансировщик нагрузки. Защита от DDoS-атак предоставляется по умолчанию.
По сравнению с Яндекс.Cloud работает быстрее для многих задач. В отношении Data Science стоит выделить тесты по распознаванию речи, детекции лиц и машинному обучению. Например, в одноядерном режиме Русоникс лидирует в детекции лиц, обрабатывая 5.26 изображений в секунду против 4.72 в Яндекс.Cloud. Распознавание речи выполняется на том же уровне, что и в облаке Яндекса (20.7 слов в секунду), а вот в ML-тестах результат несколько хуже: Русоникс обрабатывает 17.5 изображений в секунду против 20.7 в Яндекс.Cloud.
Впрочем, в многоядерном режиме Русоникс намного опережает конкурента, в секунду обрабатывая 9.27 изображений против 5.53 и почти 40 слов вместо 28.4. В ML-кейсах облако Русоникс также лидирует: 33.8 изображений в секунду, тогда как Яндекс.Cloud справляется только с 23.5.
Сравнение цен с другими конкурентами (Amazon Web Services, Microsoft Azure, Google Cloud Platform) не делает Русоникс самым дешевым вариантом, однако стоимость месячного использования сравнима с Yandex.Cloud (2 281, 69 руб/мес. для виртуальной машины с ОС Linux, 2-х ядерным ЦП, 4 Гб RAM и SSD 30 GB). А если вам нужны сервера с ОС Windows, например, для 1C и других специфических приложений, условия Русоникс для той же конфигурации виртуальной машины будут самыми выгодными (3 180, 25 руб/мес).
Точная стоимость использования облака Русоникс зависит от потребляемых ресурсов: расходы считаются каждые сутки. Оптимизировать затраты можно, настроив ресурсопотребление, прямо в разделе «Отчеты». Ежемесячный баланс определяется ежедневными расходами.
Виртуальный сервер Русоникс поддерживает 2 технологии виртуализации: контейнеры и гипервизор. Контейнеры работают чуть быстрее и обеспечивают гибкое масштабирование ресурсов. Однако, здесь есть ограничения на виды операционных систем: возможно выбрать только из представленных вариантов. Во втором случае можно загружать собственные образы операционных систем, хотя изменение ресурсов виртуальной машины может потребовать ее перезапуска.
С точки зрения пользователя стоит отметить достаточно удобный веб-интерфейс со всеми нужными в работе функциями: от создания виртуального сервера до управления пользователями и дэшборда с отчетами. В частности, создать свой сервер можно всего за 4 шага, настроив все необходимые параметры: конфигурацию, образ, диски и сети.
В заключение отмечу бесплатную голосовую поддержку 24/7 выделенным менеджером, безлимитный трафик и фиксированные цены в рублях, что особенно важно для российских проектов.
Протестировать сервис Русоникс можно бесплатно по запросу, а при переходе от другого Cloud-провайдера первый внесенный платеж удвоится.
Как и у прочих облачных провайдеров, стоимость использования зависит от потребляемых ресурсов и первичных настроек, стартуя от 1000 рублей в месяц на самой простой конфигурации (ОС Ubuntu на 1 виртуальный ЦП с 1ГБ памяти, 1 ГБ HDD и 5-ю IP-адресами). Максимальная стоимость около 87 тысяч в месяц для ОС Windows Server 2016, 24 виртуальных ЦП, 128 ГБ памяти, хранилище почти 4 терабайта SSD и 32 IP-адреса. Каждый дополнительный диск увеличивает цену и неудивительно, что SSD стоит дороже HDD. Также можно выбрать дополнительные опции: резервное копирование, VPN/L2 на Яндекс.Cloud и балансировщик нагрузки. Защита от DDoS-атак предоставляется по умолчанию.
По сравнению с Яндекс.Cloud работает быстрее для многих задач. В отношении Data Science стоит выделить тесты по распознаванию речи, детекции лиц и машинному обучению. Например, в одноядерном режиме Русоникс лидирует в детекции лиц, обрабатывая 5.26 изображений в секунду против 4.72 в Яндекс.Cloud. Распознавание речи выполняется на том же уровне, что и в облаке Яндекса (20.7 слов в секунду), а вот в ML-тестах результат несколько хуже: Русоникс обрабатывает 17.5 изображений в секунду против 20.7 в Яндекс.Cloud.
Впрочем, в многоядерном режиме Русоникс намного опережает конкурента, в секунду обрабатывая 9.27 изображений против 5.53 и почти 40 слов вместо 28.4. В ML-кейсах облако Русоникс также лидирует: 33.8 изображений в секунду, тогда как Яндекс.Cloud справляется только с 23.5.
Сравнение цен с другими конкурентами (Amazon Web Services, Microsoft Azure, Google Cloud Platform) не делает Русоникс самым дешевым вариантом, однако стоимость месячного использования сравнима с Yandex.Cloud (2 281, 69 руб/мес. для виртуальной машины с ОС Linux, 2-х ядерным ЦП, 4 Гб RAM и SSD 30 GB). А если вам нужны сервера с ОС Windows, например, для 1C и других специфических приложений, условия Русоникс для той же конфигурации виртуальной машины будут самыми выгодными (3 180, 25 руб/мес).
Точная стоимость использования облака Русоникс зависит от потребляемых ресурсов: расходы считаются каждые сутки. Оптимизировать затраты можно, настроив ресурсопотребление, прямо в разделе «Отчеты». Ежемесячный баланс определяется ежедневными расходами.
Виртуальный сервер Русоникс поддерживает 2 технологии виртуализации: контейнеры и гипервизор. Контейнеры работают чуть быстрее и обеспечивают гибкое масштабирование ресурсов. Однако, здесь есть ограничения на виды операционных систем: возможно выбрать только из представленных вариантов. Во втором случае можно загружать собственные образы операционных систем, хотя изменение ресурсов виртуальной машины может потребовать ее перезапуска.
С точки зрения пользователя стоит отметить достаточно удобный веб-интерфейс со всеми нужными в работе функциями: от создания виртуального сервера до управления пользователями и дэшборда с отчетами. В частности, создать свой сервер можно всего за 4 шага, настроив все необходимые параметры: конфигурацию, образ, диски и сети.
В заключение отмечу бесплатную голосовую поддержку 24/7 выделенным менеджером, безлимитный трафик и фиксированные цены в рублях, что особенно важно для российских проектов.
Протестировать сервис Русоникс можно бесплатно по запросу, а при переходе от другого Cloud-провайдера первый внесенный платеж удвоится.
www.rusonyx.ru
Аренда облачного сервера в виртуальном дата-центре
Облачный сервер в виртуальном дата-центре в аренду, от Rusonyx. Решаем задачи наших клиентов. Вдумчиво и индивидуально. Мы предлагаем одни из лучших цен на рынке!
Forwarded from Deep Dive 2 Deep Learning
👍🏻5 советов DL-разработчику по TensorFlow и Keras
• используйте правильные типы данных, чтобы сэкономить 50-90% памяти. Например, float32 вместо float64 или unit8 вместо int64.
• кодируйте метки с помощью моделей однократного кодирования (one-hot encoding) и авторов, которые выводят значение для каждого класса. Эта практика в целом безопасна и правильна. Для больших наборов данных или множеством классов используйте разреженные метки, хранящиеся в форме индекса: например, седьмой класс представлен числом семь, а не вектором нулей с седьмой позицией, установленной в единицу. Для задачи на 1000 классов это на несколько порядков компактнее. Число uint16 против тысячи чисел с плавающей запятой. Большинство наборов данных по умолчанию упакованы с разреженными метками, и мы заставляем их использовать горячие. Также полезна разреженная кросс-энтропия - вариант категориальной кросс-энтропии, который сравнивает выходные данные вашей модели в одном горячем формате с достоверными метками в формате индекса. Это тоже сэкономит много памяти.
• Eager-режим поможет отследить первоисточник ошибок или сосредоточиться на более широкой картине, прежде чем сузить их до проблем графического режима, например, с использованием правильных типов данных. Это актуально для внутренних ошибок TensorFlow с несовместимыми типами данных. Eager Mode пригодится и для tf.data, т.к. этот API всегда отслеживает все в графическом режиме. Хотя эта функция еще помечена как экспериментальная, начиная с TensorFlow 2.6, ее можно активировать и использовать для отладки в API tf.data.
• Используйте Lambda Callback для отслеживания прогресса обучения, чтобы внедрить код, который будет запускаться в конце эпохи. В случае «медленных» показателей можно параметр эпохи, чтобы пропустить выполнение кода в нечетные эпохи или выполнять его с большим шагом, например, каждые десять эпох.
• Сделайте свою библиотеку, например, в файле Layers.py со всеми пользовательскими данными, чтобы использовать их в текущих и будущих проектах.
https://towardsdatascience.com/taking-keras-and-tensorflow-to-the-next-level-c73466e829d3
• используйте правильные типы данных, чтобы сэкономить 50-90% памяти. Например, float32 вместо float64 или unit8 вместо int64.
• кодируйте метки с помощью моделей однократного кодирования (one-hot encoding) и авторов, которые выводят значение для каждого класса. Эта практика в целом безопасна и правильна. Для больших наборов данных или множеством классов используйте разреженные метки, хранящиеся в форме индекса: например, седьмой класс представлен числом семь, а не вектором нулей с седьмой позицией, установленной в единицу. Для задачи на 1000 классов это на несколько порядков компактнее. Число uint16 против тысячи чисел с плавающей запятой. Большинство наборов данных по умолчанию упакованы с разреженными метками, и мы заставляем их использовать горячие. Также полезна разреженная кросс-энтропия - вариант категориальной кросс-энтропии, который сравнивает выходные данные вашей модели в одном горячем формате с достоверными метками в формате индекса. Это тоже сэкономит много памяти.
• Eager-режим поможет отследить первоисточник ошибок или сосредоточиться на более широкой картине, прежде чем сузить их до проблем графического режима, например, с использованием правильных типов данных. Это актуально для внутренних ошибок TensorFlow с несовместимыми типами данных. Eager Mode пригодится и для tf.data, т.к. этот API всегда отслеживает все в графическом режиме. Хотя эта функция еще помечена как экспериментальная, начиная с TensorFlow 2.6, ее можно активировать и использовать для отладки в API tf.data.
• Используйте Lambda Callback для отслеживания прогресса обучения, чтобы внедрить код, который будет запускаться в конце эпохи. В случае «медленных» показателей можно параметр эпохи, чтобы пропустить выполнение кода в нечетные эпохи или выполнять его с большим шагом, например, каждые десять эпох.
• Сделайте свою библиотеку, например, в файле Layers.py со всеми пользовательскими данными, чтобы использовать их в текущих и будущих проектах.
https://towardsdatascience.com/taking-keras-and-tensorflow-to-the-next-level-c73466e829d3
Medium
Taking Keras and TensorFlow to the Next Level
11 tips and tricks to make the most out of Keras and TensorFlow
Как получать качественные данные?
У вас может быть высочайший уровень работы на всех этапах продвижения продукта, но если вы используете некачественные данные, хороших результатов вы не получите. Важнейшее свойство информации - консистентность, особенно для продуктовой аналитики. От неё напрямую зависит качество данных.
На Матемаркетинге Влад Харитонов и Олег Хомюк из Lamoda подробно расскажут о том, как эту консистентность обеспечить, в том числе в контексте масштабирования. Строгая типизация, основанная на контрактах, версионирование, кросс-платформенность, использование наследования для масштабирования - вот некоторые пункты их выступления.
Матемаркетинг - крупнейшая конференция по продуктовой и маркетинговой аналитике, монетизации и решениям, основанным на данных, в России и СНГ.
- - - -
✅ Матемаркетинг пройдет 18-19 ноября в Москве, а также будет доступен в онлайне.
↪️ Программа и все подробности доступны на нашем сайте.
- - - -
А пока делимся докладом Jordi Roura, InfoTrust Барселона, с прошлогоднего Матемаркетинга, из которого вы сможете подробнее узнать о том, как обеспечивать качество данных в целом и на конкретных примерах.
У вас может быть высочайший уровень работы на всех этапах продвижения продукта, но если вы используете некачественные данные, хороших результатов вы не получите. Важнейшее свойство информации - консистентность, особенно для продуктовой аналитики. От неё напрямую зависит качество данных.
На Матемаркетинге Влад Харитонов и Олег Хомюк из Lamoda подробно расскажут о том, как эту консистентность обеспечить, в том числе в контексте масштабирования. Строгая типизация, основанная на контрактах, версионирование, кросс-платформенность, использование наследования для масштабирования - вот некоторые пункты их выступления.
Матемаркетинг - крупнейшая конференция по продуктовой и маркетинговой аналитике, монетизации и решениям, основанным на данных, в России и СНГ.
- - - -
✅ Матемаркетинг пройдет 18-19 ноября в Москве, а также будет доступен в онлайне.
↪️ Программа и все подробности доступны на нашем сайте.
- - - -
А пока делимся докладом Jordi Roura, InfoTrust Барселона, с прошлогоднего Матемаркетинга, из которого вы сможете подробнее узнать о том, как обеспечивать качество данных в целом и на конкретных примерах.
matemarketing.ru
MM’26 — Конференция для аналитиков, performance-маркетологов и product-менеджеров
Крупнейшая конференция по маркетинговой и продуктовой аналитике в России, СНГ и Восточной Европе. Даты: 26–27 ноября 2026, онлайн-день — 17 ноября.
✍🏻5 советов Data Scientist’у по Scikit-learn
1. Заполнение пропусков с помощью итеративного заполнителя – IterativeImputer, который итеративно ищет и заполняет пропущенные значения, улучшая датасет с каждой итерацией. Для использования этой функции ее следует импортировать enable_iterative_imputer из пакета sklearn.experimental
2. Генерация случайных фиктивных данных, чтобы зарезервировать место, где должны присутствовать реальные или полезные данные. Фиктивные данные нужны для тестирования, поэтому они должны быть надежными. Для этого можно применить функции make_classification() в задаче классификации или make_regression() в задаче регрессии. Также можно установить количество образцов и фичей, чтобы контролировать поведение данных в отладке и тестировании.
3. Сохранение ML-моделей, чтобы повторно использовать их без переобучения. Чтобы сериализовать свои алгоритмы и сохранить их, пригодятся Python-библиотеки pickle и joblib.
4. Построение матрицы ошибок с помощью функции plot_confusion_matrix, которая отображает истинно положительные, ложноположительные, ложноотрицательные и истинно отрицательные значения.
5. Визуализация деревьев решений с помощью функции tree.plot_tree в пакете matplotlib без ручной установки зависимостей для создания простых визуализаций. Также можно сохранить дерево как графический png-файл.
https://www.educative.io/blog/scikit-learn-tricks-tips
1. Заполнение пропусков с помощью итеративного заполнителя – IterativeImputer, который итеративно ищет и заполняет пропущенные значения, улучшая датасет с каждой итерацией. Для использования этой функции ее следует импортировать enable_iterative_imputer из пакета sklearn.experimental
2. Генерация случайных фиктивных данных, чтобы зарезервировать место, где должны присутствовать реальные или полезные данные. Фиктивные данные нужны для тестирования, поэтому они должны быть надежными. Для этого можно применить функции make_classification() в задаче классификации или make_regression() в задаче регрессии. Также можно установить количество образцов и фичей, чтобы контролировать поведение данных в отладке и тестировании.
3. Сохранение ML-моделей, чтобы повторно использовать их без переобучения. Чтобы сериализовать свои алгоритмы и сохранить их, пригодятся Python-библиотеки pickle и joblib.
4. Построение матрицы ошибок с помощью функции plot_confusion_matrix, которая отображает истинно положительные, ложноположительные, ложноотрицательные и истинно отрицательные значения.
5. Визуализация деревьев решений с помощью функции tree.plot_tree в пакете matplotlib без ручной установки зависимостей для создания простых визуализаций. Также можно сохранить дерево как графический png-файл.
https://www.educative.io/blog/scikit-learn-tricks-tips
Educative: Interactive Courses for Software Developers
Data Science Made Simple: 5 essential Scikit-learn tricks
Scikit-learn is the most popular Python machine learning library for data science. Learn the top tips and tricks to take your Scikit skills to the next level.
Искусственный интеллект проверит надежность российских НКО ⚡️⚡️
С 15 по 17 октября в Перми состоится шестой из 116 хакатонов по искусственному интеллекту 😌
Кейс: разработка алгоритма, позволяющего автоматизировать процесс проверки документации и интернет-активности российских некоммерческих организаций с целью выявления мошенников, подозрительной активности и плохой репутации.
➕ Постановщик задачи: платформа интеллектуального волонтерства ProCharity.
Проект направлен на популяризацию технологий искусственного интеллекта в России среди молодых специалистов и студентов, формирование ИТ-сообщества с фокусом на ИИ, а также на генерацию решений для бизнеса и гос.сектора. Участники получат возможность внести свой вклад в развитие цифровой экономики страны, а также продемонстрировать свои навыки крупнейшим российским ИТ-компаниям.
Победители разделят между собой призовой фонд в 400 000 рублей!!
✌️ Встречаемся в Технопарке Morion Digital по адресу:
ш. Космонавтов, д. 111, корп. 10
Организатор проекта – Министерство экономического развития РФ, оператор – АНО «Россия – страна возможностей». Организационный партнер – Российская ассоциация электронных коммуникаций, технологический партнер – Яндекс.Облако.
⚡️ Регистрация открыта до 13 октября.
https://hacks-ai.ru/hakaton/perm
С 15 по 17 октября в Перми состоится шестой из 116 хакатонов по искусственному интеллекту 😌
Кейс: разработка алгоритма, позволяющего автоматизировать процесс проверки документации и интернет-активности российских некоммерческих организаций с целью выявления мошенников, подозрительной активности и плохой репутации.
➕ Постановщик задачи: платформа интеллектуального волонтерства ProCharity.
Проект направлен на популяризацию технологий искусственного интеллекта в России среди молодых специалистов и студентов, формирование ИТ-сообщества с фокусом на ИИ, а также на генерацию решений для бизнеса и гос.сектора. Участники получат возможность внести свой вклад в развитие цифровой экономики страны, а также продемонстрировать свои навыки крупнейшим российским ИТ-компаниям.
Победители разделят между собой призовой фонд в 400 000 рублей!!
✌️ Встречаемся в Технопарке Morion Digital по адресу:
ш. Космонавтов, д. 111, корп. 10
Организатор проекта – Министерство экономического развития РФ, оператор – АНО «Россия – страна возможностей». Организационный партнер – Российская ассоциация электронных коммуникаций, технологический партнер – Яндекс.Облако.
⚡️ Регистрация открыта до 13 октября.
https://hacks-ai.ru/hakaton/perm
📝Математика для Data Scientist’а: 3 меры расстояния, часть 1
• Евклидово расстояние (Euclidean Distance) – измеряет длину отрезка, соединяющего две точки. Самая распространенная мера, но не масштабируемая, т.к. вычисленные расстояния могут искажаться в зависимости от единиц измерения объектов. Поэтому перед использованием этой метры нужно нормализовать данные. По мере увеличения размерности данных полезность евклидова расстояния уменьшается. Но эта мера отлично работает для данные с низкой размерностью. Например, методы kNN и HDBSCAN показывают с этой мерой хорошие результаты. Наконец, евклидово расстояние интуитивно понятно в использовании и просто в реализации.
• Косинусное подобие (Cosine Similarity) - косинус угла между двумя векторами. Этот способ помогает устранить недостатки евклидова расстояния для высокой размерности. Два вектора с одинаковой ориентацией имеют косинусное сходство, равное 1, а векторы, диаметрально противоположные друг другу, имеют сходство, равное -1. Величина векторов не имеет значения, поскольку это мера ориентации. Поэтому данная мера не слишком подойдет для рекомендательных систем, т.к. косинусное сходство не учитывает разницу в шкале оценок между разными пользователями. Тем не менее, косинусное сходство пригодится, когда есть многомерные данные и величина векторов не имеет значения, например, для анализа текстов.
• Расстояние Хэмминга (Hamming distance ) - количество значений, которые отличаются в двух векторах. Обычно используется для сравнения двух двоичных строк одинаковой длины, например, чтобы сравнить, насколько они похожи друг на друга, путем вычисления количества отличающихся символов. Расстояние Хэмминга сложно применить, когда два вектора имеют разные длины. Например, для исправления или обнаружение ошибок при передаче данных по компьютерным сетям при определении количества искаженных битов в двоичном слове как способа оценки ошибки. Также можно использовать расстояние Хэмминга для измерения расстояния между категориальными переменными.
• Евклидово расстояние (Euclidean Distance) – измеряет длину отрезка, соединяющего две точки. Самая распространенная мера, но не масштабируемая, т.к. вычисленные расстояния могут искажаться в зависимости от единиц измерения объектов. Поэтому перед использованием этой метры нужно нормализовать данные. По мере увеличения размерности данных полезность евклидова расстояния уменьшается. Но эта мера отлично работает для данные с низкой размерностью. Например, методы kNN и HDBSCAN показывают с этой мерой хорошие результаты. Наконец, евклидово расстояние интуитивно понятно в использовании и просто в реализации.
• Косинусное подобие (Cosine Similarity) - косинус угла между двумя векторами. Этот способ помогает устранить недостатки евклидова расстояния для высокой размерности. Два вектора с одинаковой ориентацией имеют косинусное сходство, равное 1, а векторы, диаметрально противоположные друг другу, имеют сходство, равное -1. Величина векторов не имеет значения, поскольку это мера ориентации. Поэтому данная мера не слишком подойдет для рекомендательных систем, т.к. косинусное сходство не учитывает разницу в шкале оценок между разными пользователями. Тем не менее, косинусное сходство пригодится, когда есть многомерные данные и величина векторов не имеет значения, например, для анализа текстов.
• Расстояние Хэмминга (Hamming distance ) - количество значений, которые отличаются в двух векторах. Обычно используется для сравнения двух двоичных строк одинаковой длины, например, чтобы сравнить, насколько они похожи друг на друга, путем вычисления количества отличающихся символов. Расстояние Хэмминга сложно применить, когда два вектора имеют разные длины. Например, для исправления или обнаружение ошибок при передаче данных по компьютерным сетям при определении количества искаженных битов в двоичном слове как способа оценки ошибки. Также можно использовать расстояние Хэмминга для измерения расстояния между категориальными переменными.
🚀FLAN от Google AI: универсальные языковые модели с тонкой настройкой инструкций
Чтобы ML-модель могла генерировать осмысленный текст, она должна обладать большим объемом знаний о мире и способностью к абстрагированию. Хотя языковые модели, которые обучены этому, способны автоматически приобретать эти знания по мере их масштабирования, ML-модели их следует лучше раскрыть эти знания и применить их к конкретным реальным задачам.
Один из недавних популярных методов использования языковых моделей для решения задач называется подсказкой с нулевым выстрелом или подсказкой с несколькими выстрелами. Этот метод формулирует задачу на основе текста, который языковая модель могла видеть во время обучения, чтобы затем генерировать ответ, дополняя текст. Хотя этот метод имеет хорошую производительность для некоторых задач, он требует тщательного проектирования, чтобы задачи выглядели как данные, которые модель видела во время обучения. Этот подход хорошо работает с некоторыми задачами, но может быть не интуитивно понятным для практического взаимодействия с моделью. Например, создатели GPT-3 обнаружили, что такие методы подсказки не приводят к хорошей производительности в задачах вывода естественного языка (NLI).
Вместо этого FLAN настраивает модель на большом наборе разнообразных инструкций, которые используют простое и интуитивно понятное описание задачи, например, «Классифицируйте этот обзор фильма как положительный или отрицательный» или «Переведите это предложение на датский». Создание набора данных с инструкциями с нуля для точной настройки модели потребует значительных ресурсов. Поэтому можно использовать шаблоны для преобразования существующих наборов данных в учебный формат. Эксперименты исследователей Google AI показали успешность такого подхода, протестировав FLAN и GPT-3 на 25 задачах.
Примечательно, что в небольших масштабах метод FLAN фактически снижает производительность, и только в более крупных масштабах модель становится способной обобщать инструкции в обучающих данных до невидимых задач. Это связано с тем, что маленькие модели не имеют достаточного количества параметров для выполнения большого количества задач.
https://ai.googleblog.com/2021/10/introducing-flan-more-generalizable.html
Чтобы ML-модель могла генерировать осмысленный текст, она должна обладать большим объемом знаний о мире и способностью к абстрагированию. Хотя языковые модели, которые обучены этому, способны автоматически приобретать эти знания по мере их масштабирования, ML-модели их следует лучше раскрыть эти знания и применить их к конкретным реальным задачам.
Один из недавних популярных методов использования языковых моделей для решения задач называется подсказкой с нулевым выстрелом или подсказкой с несколькими выстрелами. Этот метод формулирует задачу на основе текста, который языковая модель могла видеть во время обучения, чтобы затем генерировать ответ, дополняя текст. Хотя этот метод имеет хорошую производительность для некоторых задач, он требует тщательного проектирования, чтобы задачи выглядели как данные, которые модель видела во время обучения. Этот подход хорошо работает с некоторыми задачами, но может быть не интуитивно понятным для практического взаимодействия с моделью. Например, создатели GPT-3 обнаружили, что такие методы подсказки не приводят к хорошей производительности в задачах вывода естественного языка (NLI).
Вместо этого FLAN настраивает модель на большом наборе разнообразных инструкций, которые используют простое и интуитивно понятное описание задачи, например, «Классифицируйте этот обзор фильма как положительный или отрицательный» или «Переведите это предложение на датский». Создание набора данных с инструкциями с нуля для точной настройки модели потребует значительных ресурсов. Поэтому можно использовать шаблоны для преобразования существующих наборов данных в учебный формат. Эксперименты исследователей Google AI показали успешность такого подхода, протестировав FLAN и GPT-3 на 25 задачах.
Примечательно, что в небольших масштабах метод FLAN фактически снижает производительность, и только в более крупных масштабах модель становится способной обобщать инструкции в обучающих данных до невидимых задач. Это связано с тем, что маленькие модели не имеют достаточного количества параметров для выполнения большого количества задач.
https://ai.googleblog.com/2021/10/introducing-flan-more-generalizable.html
research.google
Introducing FLAN: More generalizable Language Models with Instruction Fine-Tunin
Posted by Maarten Bosma, Research Engineer and Jason Wei, AI Resident, Google Research For a machine learning model to generate meaningful text, it...