Big Data Science [RU]
1.62K subscribers
78 photos
9 videos
543 links
Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏https://t.me/bdscience — Big Data Science channel (english version)
💼https://t.me/bds_job — channel about Data Science jobs and career
Download Telegram
💐В преддверии дня знаний мы снова собрали для вас подборку интересных DS-событий:
1 сентября - Huawei Cup 2021 — Евразийские соревнования для студентов и молодых специалистов. Регистрация открыта с 23 августа, викторина 1-го этапа будет проходить с 1 сентября по 31 октября. 6 номинаций: Модели и методы ИИ, Построение сетей хранения данных, Технологии и протоколы IP-сетей, Технологии и стандарты мобильной связи 5G, Проектирование мобильных приложений и номинация для начинающих журналистов ICT Observer. Главный приз в номинациях AI, Storage, IP и 5G — чек на 10 тысяч долларов, в номинациях ICT Observer и APP — флагманское устройство Huawei. Финалисты, занявшие вторые и третьи места во всех номинациях, получат топовые гаджеты Huawei. https://huaweicup.ru/
3-6 сентября – Риф.Юг - серия мероприятий по вопросам цифровизации экономики и государственного управления, образованиям и кадрам, интернет-бизнесу. Ставрополье, https://runet-id.com/event/rif-south21/
8 сентября - Онлайн-хакатон по разработке городских навыков Алисы для Санкт-Петербурга https://events.yandex.ru/events/online-hakathon-spb
16 сентября в 19:00 (мск) - онлайн-встреча по Azure: методы обнаружения начала сбоя в системах Microsoft Azure с помощью службы цифровых двойников и API обнаружения аномалий. https://community-z.com/events/ta-devops-azure-ru-community-meetup-ad
16 сентября – Технологии умного города – онлайн-конференция от CNews https://events.cnews.ru/events/tehnologii_umnogo_goroda_2021.shtml
20-21 сентября - Saint HighLoad++ 2021 - профессиональная конференция разработчиков высоконагруженных систем, Санкт-Петербург, https://www.highload.ru/spb/2021
21 сентября - AI Conference Kyiv, Киев https://aiconference.com.ua/ru
21 сентября - конференция CNews "ИКТ в госсекторе 2021: жизнь в новой реальности", Москва, https://events.cnews.ru/events/ikt_v_gossektore_2021_2021-09-23.shtml
21-24 сентября - Международный форум Kazan Digital Week 2021, Казань - https://kazandigitalweek.ru/
23 сентября – конференция CNews "Искусственный интеллект 2021" https://events.cnews.ru/events/iskusstvennyi_intellekt_2021.shtml
24 сентября - Yandex Scale - Большая конференция Yandex.Cloud https://scale.yandex.ru/
25 сентября - Yandex Self-Driving Meetup '21 - Большой митап по беспилотным технологиям Яндекса, Москва https://taxi.yandex.ru/action/ysdm
27-28 сентября - Moscow Python Conf++ 2021 - профессиональная конференция для Python-разработчиков, Москва, Radisson Slavyanskaya - https://conf.python.ru/moscow/2021
28-30 сентября - Big Data Days 2021 Online Edition - международная конференция по большим данным, науке о данных и искусственному интеллекту https://bigdatadays.ru/
• 30 сентября - 1 октября - Всероссийский форум по сбору и анализу данных в маркетинге (Marketing Data Analytics 2021) - Москва, https://interforums.ru/mda/home
30 сентября - 1 октября - VII Федеральный ИТ-форум нефтегазовой отрасли России «Smart Oil & Gas: Достоверные данные», Санкт-Петербург, https://www.comnews-conferences.ru/ru/conference/smartoilgas2021
🏸Что такое AIOps
Пока мы привыкли к MLOps, в ИТ случилось новое Ops-явление, необходимость которого на самом деле возникла достаточно давно. Встречайте AIOps – использование ИИ для упрощения управления ИТ-операциями, а также ускорения и автоматизации решения проблем в сложных современных ИТ-средах. AIOps использует возможности больших данных, аналитики и машинного обучения для следующих целей:
• Сбор и объединение огромных и постоянно растущих объемов операционных данных, генерируемых множеством компонентов ИТ-инфраструктуры, приложений и инструментов мониторинга производительности;
• Фильтрация полезных сигналов от шума, чтобы выявить действительно важные события и закономерности, связанные с производительностью и доступностью систем;
• определение первопричин и быстрая реакция на проблемы, иногда автоматически без без вмешательства человека.
Благодаря замене множества отдельных инструментов для ручного выполнения ИТ-операций на единую интеллектуальную и автоматизированную платформу, AIOps позволяет быстро и даже заблаговременно реагировать на замедление работы и сбои систем с гораздо меньшими усилиями. AIOps устраняет разрыв между все разнообразным, динамичным и сложным ИТ-ландшафтом без снижения производительности и доступности приложений. С учетом того, что все больше компаний сегодня переходят от традиционной ИТ-инфраструктуры к динамическому сочетанию локальных кластеров, частных облаков и общедоступных облачных сред, внедрение AIOps актуально для многих предприятий.
https://medium.com/geekculture/aiops-6e463cbe617a
👻Что такое обнаружение аномалий и как это работает
Обнаружение аномалий - это математический поиск отклонений в контролируемых и неконтролируемых числовых данных в зависимости от того, насколько конкретное значение отличается от окружающих или от стандартного отклонения в представленной выборке. Есть множество различных методов обнаружения аномалий, называемых алгоритмами обнаружения выбросов, каждый из которых имеет различные критерии их обнаружения и поэтому используется в разных сценариях. Чаще всего для обнаружения аномалий используются следующие методы:
Общие методы, основанные на плотности: метод K-ближайшего соседа (KNN), локальный фактор выброса (LOF), метод изолированных лесов (Isolation Forests) и прочие алгоритмы, которые могут применяться для сценариев регрессии или классификации. Каждый из них генерирует ожидаемое поведение, следуя линии наивысшей плотности точек данных. Точки, которые выпадают на статистически значимое количество за пределами этих плотных зон, помечаются как аномалия. Большинство этих методов основаны на расстоянии между точками, поэтому для получения точных результатов важно нормализовать единицы измерения и масштаб в датасете. Например, в KNN точки данных взвешиваются по значению 1 / k, где k - расстояние до ближайшего соседа. Поэтому, что точки, которые расположены ближе друг к другу, имеют большой вес, и влияют на то, что является стандартом, больше удаленных точек. Алгоритм отмечает точки с низким значением 1 / k как выбросы. Это подходит для нормализованных данных без меток, когда нет желания и возможности использовать алгоритмы с более сложными вычислениями.
Машина опорных векторов с 1 классом (One-class support vector machine) – алгоритм обучения с учителем, создающий надежную модель прогнозирования. Часто используется для классификации. Имеется обучающий набор примеров, каждый из которых помечен как часть одной из двух категорий. Система создает критерии для сортировки новых примеров по каждой категории, сопоставляет примеры с точками в пространстве, чтобы максимально различать обе категории. Система помечает выброс, если он выходит за пределы любой категории. При отсутствии размеченных данных, можно использовать метод обучения без учителя, который ищет кластеризацию среди примеров для определения категорий. Это подходит для работы с 2-мя категориями данных, когда нужно найти, какие точки данных лежат за пределами каждой из них.
Алгоритм кластеризации K-средних, сочетающий KNN-подходы, основанные на близости каждой точки данных к другим близлежащим точкам и SVM, т.к. он ориентирован на классификацию по различным категориям. Здесь каждая точка данных разделена на категории в зависимости от ее характеристик. Категория имеет центральную точку, которая служит прототипом для всех других точек данных в кластере. Все они сравниваются с этими прототипами, чтобы определить их k-среднее значение, которое играет роль показателя разницы между прототипом и текущей точкой данных. Точки данных с более высоким k-средним находятся ближе к прототипу, образуя кластер. Кластеризация K-средних может обнаруживать аномалии, отмечая точки, которые не соответствуют ни одной из установленных категорий. Это подходит для сценариев, когда есть немаркированные данные из множества различных типов, которые нужно организовать по аналогии с изученными прототипами.
Есть и другие более сложные алгоритмы для неконтролируемого обнаружения аномалий и работы с многомерными наборами данных. Например, гауссовский как альтернативная версия алгоритма K-средних с распределением Гаусса вместо стандартного отклонения. А байесовский использует байесовское понимание вероятности для обнаружения аномалий. Также для обнаружения аномалий могут применяться автоэнкодеры - нейросети, создающие закодированные правила для ожидаемого вывода в зависимости от входного значения. То, что выходит за рамки этих повторяющихся значений, считается аномалией и хорошо подходит для задач их обнаружения в размерности.
🏂Почему все GAN-сети работают одинаково, и зачем настраивать гиперпараметры
Генеративные состязательные сети, представляют собой структуру, способную изучать распределение на основе конкуренции между генератором и дискриминатором. Генератор учится генерировать образцы, неотличимые от реальных данных, а дискриминатор учится классифицировать, является ли данное изображение реальным или поддельным. Сегодня GAN-сети считаются мощным инструментом и активно используются в задачах генерации и реконструкции текстов, изображений и пр. При том, что есть множество разных архитектур и видов GAN-сетей, при достаточном гиперпараметрическом поиске почти все алгоритмы имеют случайные ранги, и даже самые последние работы работают аналогично оригинальной GAN, впервые предложенной Яном Гудфеллоу. Бенчмаркинговое сравнение различных GAN-сетей показало, что алгоритмические различия не так актуальны, а вот поиск по гиперпараметрам имеет большее влияние на результат. Однако, оптимальные гиперпараметры во многом зависят от набора данных и настройка гиперпараметров – одна из самых интересных и тонких задач ML-специалиста.
https://medium.com/codex/do-all-gans-perform-the-same-cc02055091af
💥ТОП-5 полезных Python-инструментов для дата-инженера и веб-разработчика
Requests – простая в использовании HTTP-библиотека для Python, которая позволяет делать запросы и взаимодействовать с API https://docs.python-requests.org/en/master/
Advanced Python Scheduler (APScheduler) – библиотека для отложенного выполнения Python-кода однократно или с периодическим повтором. При сохранении заданий в базе данных, сохранятся также их состояния и перезапуск планировщика. Также APScheduler можно использовать как кроссплатформенную замену для конкретных приложений планировщикам для конкретных платформ, таким как cron-демон или планировщик задач Windows. Однако, APScheduler не является демоном или сервисом, а потому не поставляется с инструментами командной строки, а предназначен для запуска внутри существующих приложений. Эта библиотека предоставляет некоторые готовые блоки для создания службы планировщика или для запуска его в отдельном процессе. https://apscheduler.readthedocs.io/en/stable/userguide.html
Watchdog – модуль для отслеживания событий файловой системы через Python API и служебные программы shell-оболочки https://pypi.org/project/watchdog/
Twilio – библиотека для автоматизации отправки текстовых сообщений и телефонных звонков. Очень удобно для автоматического мониторинга событий на сторонних сайтах, например, оперативного отслеживания скидок на нужные товары или появления новых продуктов https://pypi.org/project/twilio/
Random User Agent – библиотека для добавления в запросы случайных пользовательских агентов, что полезно при веб-парсинге данных или отправке большого количества запросов https://pypi.org/project/random-user-agent/
✈️ML-прогнозы в реальном времени с Vertex AI от Google
Одна из самых больших проблем при обслуживании ML-моделей - это предоставление прогнозов в режиме, близком к реальному времени. Некоторые бизнес-сценарии особенно чувствительны к временной задержке. Например, рекомендательные системы для пользователей интернет-магазина, оценка время доставки продуктов для фудтех-компаний и пр. 25 августа 2021 года Google объявила о возможности прямого взаимодействия с Vertex AI – своей объединеной ML-платформой через частные endpoint’ы. Vertex AI позволяет быстро подключить обученную и протестированную ML-модель к рабочему приложению, загрузить на специально подготовленный сервер в Google Cloud или экспортировать в нужный формат.
Vertex Predictions - это бессерверный способ обслуживания ML-моделей, которые можно разместить в облаке и делать прогнозы через REST API. При онлайн-прогнозах необходимо развернуть модель на конечной точке, что свяжет ее с физическими вычислительными ресурсами и позволит делать вычисления практически в реальном времени. С помощью VPC Peering можно настроить частное соединение для обращения к конечной точке. При этом пользовательские данные не будут проходить через общедоступный Интернет, что снижает задержку онлайн-прогнозов и повышает безопасность.
https://cloud.google.com/blog/products/ai-machine-learning/creating-a-private-endpoint-on-vertex-ai
🏂🏸Состязательные атаки для уточнения прогнозов молекулярной энергии
Исследователи из MIT нашли новый способ количественной оценки неопределенности молекулярных энергий с помощью нейросетей. Нейросети часто используются для прогнозирования новых материалов, скорости и выхода химических реакций, работая на порядки быстрее, чем традиционные методы, такие как квантово-механическое моделирование. Но полученные результаты могут быть ненадежными, поскольку ML-модели интерполируют, возможен сбой при их применении на рабочих данных вне обучающего датасета. Это особенно верно для предсказания «поверхностей потенциальной энергии» (ППЭ) или карты энергии молекулы во всех ее конфигурациях. Для решения этих проблем ученые предложили выделить безопасные зоны нейросети с помощью состязательных атак. Фактическое моделирование выполняется только для небольшой части молекул, а данные передаются в нейронную сеть, которая учится предсказывать те же свойства для остальных молекул. Эти методы были успешно протестированы на новых материалах, включая катализаторы для производства водорода из воды, более дешевые полимерные электролиты для электромобилей, магниты и пр. Однако, точность нейросетей зависит от корректности обучающих данных, а неверные прогнозы могут иметь катастрофические последствия.
Один из способов узнать неопределенность модели - прогнать одни и те же данные через несколько ее версий. Для этого у исследователей было несколько нейронных сетей, предсказывающих поверхность потенциальной энергии на основе одних и тех же данных. Если сеть уверена в предсказании, разница между выходными сигналами разных сетей минимальна, и поверхности в большей степени сходятся. Иначе прогнозы различных моделей сильно различаются, производя ряд выходных данных, любой из которых может быть правильной поверхностью.
Разброс прогнозов представляет собой неопределенность в конкретной точке. ML-модель должна указывать не только на лучший прогноз, но и на неопределенность каждого из них. Однако, каждая симуляция может занять от десятков до тысяч процессорных часов. А чтобы получить значимые результаты, необходимо запустить несколько моделей в достаточном количестве точек.
Поэтому новый подход отбирает только точки данных из областей с низкой достоверностью прогнозов, соответствующих определенной геометрии молекулы. Затем эти молекулы немного изменяются, чтобы повысить неопределенность. Дополнительные данные вычисляются для этих молекул посредством моделирования, а затем добавляются в исходный обучающий пул. Нейронные сети снова обучаются, и вычисляется новый набор неопределенностей. Этот процесс повторяется до тех пор, пока неопределенность, связанная с различными точками на поверхности, не станет четко определенной и не может быть уменьшена в дальнейшем.
Предлагаемый подход был протестирован на цеолитах - кавернозных кристаллах, которые действуют как молекулярные сита с высокой избирательностью формы и используются в катализе, разделении газов и ионном обмене. Моделирование больших структур цеолита очень дорого, исследователи показывают, как их метод может обеспечить значительную экономию при компьютерном моделировании. Но состязательный подход для переобучения нейронных сетей значительно повышает производительность без существенных вычислительных затрат.
https://news.mit.edu/2021/using-adversarial-attacks-refine-molecular-energy-predictions-0901
Forwarded from Data Science Jobs
16 сентября, Чт
Конференция по Machine Learning in production

Через неделю @selectelnews соберет сообщество специалистов, которых интересует все новое в сферах ML и AI, чтобы поговорить про MLOps-платформы, применение ML в работе технической поддержки, жизненный цикл моделей машинного обучения и другие направления.

В программе:
— Управление жизненным циклом моделей машинного обучения — возможности Polymatica ML
— От данных к модели: ML-платформа и ее эксплуатация с точки зрения DevOps
— Поддержка VK: как оставаться поддержкой с человеческим лицом, внедряя ML

Дата: 16 сентября в 10:30 МСК
Место проведения: online и offline (офис Selectel, Санкт-Петербург, ул. Цветочная, 19)

Регистрируйтесь бесплатно по ссылке: https://slc.tl/NNpkU
🕸Автоматизация веб-скрепинга: 3 популярных инструмента
Хотите отслеживать цены в интернет-магазине или автоматизировать заказ еды в ресторане? Попробуйте следующие средства:
Selenium – известный фреймворк для автоматизации тестирования, который можно использовать его имитации пользовательского поведения и выполнения действий на веб-сайтах, таких как заполнение форм, нажатие кнопок и пр. https://selenium-python.readthedocs.io/
Beautiful Soup – Python-пакет для анализа HTML- и XML-документов. Создает дерево синтаксического анализа, которое можно использовать для извлечения данных при парсинге веб-страниц. Очень хорош для простых проектов. https://pypi.org/project/beautifulsoup4/
Scrapy – быстрый высокоуровневый фреймворк для сканирования и сканирования веб-сайтов, используемый для извлечения структурированных данных с целью их интеллектуального анализа, мониторинга и автоматического тестирования. Он отлично подходит для сложных проектов и значительно быстрее вышеуказанных аналогов. https://docs.scrapy.org/en/latest/
😎Нужно разработать приложение распознавания эмоций по видео в реальном времени?
Используйте Face Recognition API! Open-source проект для распознавания лиц и управления ими из Python или командной строки. ML-модель создана с помощью DL-алгоритма распознавания лиц и имеет точность 99,38% в тесте Labeled Faces in the Wild.
С Face Recognition API разработка приложения состоит из 5 шагов:
• прием видео в реальном времени
• применение Python-функций готового API для обнаружения лиц и эмоций на объектах в видеопотоке;
• классификация эмоций по категориям;
• построение рекомендательной системы;
• сборка приложения и развертывание на Heroku, Dash или веб-сервере.
https://github.com/ageitgey/face_recognition
🗣4 практики повышения эффективности от использования Google Cloud Translation API
Веб-сервис, который динамически переводит между языками с помощью ML-моделей Google поддерживает более 100 языков и активно используется на практике. А если знать полезные лайфхаки, можно снизить затраты, повысить производительность и улучшить безопасность этого API для перевода на веб-сайтах.
1. Кэширование переведенного контента не только сокращает количество обращений к Google Cloud Translation API, но и снижает нагрузку и использование вычислений на внутренних веб-серверах и базах данных. Это оптимизирует производительность приложений и снижает стоимость доставки. Настроить кэширование в архитектуре приложения можно на разных уровнях приложения. Например, на уровне прокси-сервера (NGINX или HAProxy), самого приложения в памяти на веб-серверах или внешнюю службу кэширования памяти, а также через CDN.
2. Безопасный доступ по принципу наименьших привилегий. В случае доступа к Google Cloud Translation API, рекомендуется использовать учетную запись Google Cloud Service, а не ключи api. Учетная запись сервиса - это особый тип аутентификации, который представляет собой пользователя, не являющегося человеком, и может быть авторизован для доступа к данным в API Google. Учетным записям служб не назначаются пароли, и они не могут использоваться для входа в систему через браузер, сводя к минимуму этот вектор угрозы. Следуя принципу минимальных привилегий, можно предоставить роль с минимальными привилегиями и набором разрешений для доступа к API перевода.
3. Настройка переводов. Если контент включает термины предметной области и контекста, Google Cloud Translation API Advanced поддерживает настраиваемую терминологию с помощью глоссария. Можно создавать и использовать собственные модели перевода с помощью Google AutoML Translation. Благодаря предупреждению, которое Google выводит пользователям, о том, что контент был переведен автоматически, клиенты понимают потенциальные риски наличия ошибок и неточностей.
4. Контроль бюджета. Затраты, связанные с Google Cloud Translation API, в основном зависят от количества символов, отправленных в API. Например, по прейскуранту $10 за миллион символов, если веб-страница включает из 20 миллионов символов и нужно перевести на 10 языков, затраты составят $10*20 = $200. Следить за бюджетом поможет настойка оповещений в рабочей среде.
https://cloud.google.com/blog/products/ai-machine-learning/four-best-practices-for-translating-your-website
Forwarded from Big Data Science
🚀Data Science в городе: продолжаем серию митапов Ситимобила про Data Science в геосервисах, логистике, приложениях Smart City и т.д. Приглашаем на 2-ю онлайн-встречу 23 сентября в 18:00 МСК. Вас ждут интересные доклады DS-практиков из Ситимобила, Optimate AI и Яндекс.Маршрутизации:
🚕Максим Шаланкин (Data Scientist в гео-сервисе Ситимобил) расскажет о жизненном цикле ML-модели прогнозирования времени в пути с учетом большой нагрузки
🚚Сергей Свиридов (CTO из Optimate AI) объяснит, что не так с классическими эвристиками и методами комбинаторной оптимизации для построения оптимальных маршрутов, и как их можно заменить динамическим программированием
🚛Даниил Тарарухин (Руководитель группы аналитики в Яндекс.Маршрутизации) поделится, как автомобильные пробки влияют на поиск оптимального маршрута и имитационное моделирование этой задачи.
После докладов спикеры ответят на вопросы слушателей.
Ведущий мероприятия – Алексей Чернобровов🛸
Регистрация для бесплатного участия: https://citymobil.timepad.ru/event/1773649/
🍏Еще 3 полезных Python-библиотеки для Data Scientist’а
JMESPath - библиотека, которая помогает запрашивать JSON. Пригодится в работе с большим многоуровневым JSON-документом или словарем. JMESPath дает доступ к объекту доступу в стиле «JavaScript», упрощая разработку и тестирование кода. Это также безопасно - если какой-либо из путей не существует, функция поиска JMESPath вернет None. https://github.com/jmespath/jmespath.py
Inflection - это библиотека, пришедшая из Ruby, которая помогает обрабатывать сложную логику обработки строк. Она переводит английские слова в единственное и множественное число, а также преобразует строки из CamelCase в строку с подчеркиванием. Пригодится, когда есть имена переменных или точек данных, сгенерированы на другом языке или в другой системе, которые нужно перевести в питонический стиль в соответствии со стандартами PEP. https://github.com/jpvanhal/inflection
more-itertools – библиотека, включающая целый набор полезных функций, которые можно использовать в разных задачах разработки. Например, быстро и изящно написать код разделения одного словаря на несколько списков на основе общего повторяющегося ключа или циклически объединить несколько списков. Эта библиотека автоматически организует реализацию регулярных выражений и настроит рекурсивные ограничения. https://github.com/more-itertools/more-itertools
Forwarded from Data Science Jobs
«Лидеры цифровой трансформации» 2021 - больше, чем хакатон!

Выбирай одну из 10 актуальных задач и разрабатывай новые цифровые продукты для города!

Что ждет участников?
🏆Призовой фонд - 10 000 000 рублей

🌐 Online-формат
10 интересных задач
Доступ к датасетам для команд c 10 октября
⚡️ Дополнительные подарки партнеров: промокоды на пиццу, мерч для лучших команд, гранты на обучение и многое другое.

👤Если команды нет, то организаторы тебе помогут ее найти!
⚠️Cейчас участники активно ищут к себе в команды разработчиков.

Выбирай задачу и регистрируйся прямо сейчас:
🔗 https://bit.ly/3tY2pi9
И вступай в наш телеграмм-чат:
🔗 https://t.me/leaders21
С 24 по 26 сентября пройдет пятый хакатон по искусственному интеллекту в городе Ростов-на-Дону. Участники хакатона имеют шанс внести свой вклад в борьбу с незаконным выловом водных биологических ресурсов в территориальных водах России.

Основная задача - создание алгоритма, способного фиксировать данные о положении рыболовного трала - поднят или опущен - в момент получения спутникового снимка.

Эта информация позволит специалистам сделать вывод о характере деятельности конкретного судна (группы судов) в момент времени, либо временной интервал, а также о законности её осуществления.

Результаты хакатона будут использованы для разработки моделей прогнозирования
потенциальных мест правонарушений и выработке рекомендаций по оптимизации маршрута работы контрольно-надзорных органов, сокращению числа правонарушений,
уменьшению экологического ущерба.

🚀Спешите зарегистрироваться https://hacks-ai.ru/hakaton/rostov-na-donu
25 сентября в Москве (ресторан Ketch Up, м.Кузнецкий мост) пройдет первый в этом году офлайн-митап от Яндекс.Дзена. Поговорим про объяснимость рекомендаций.

К сожалению, количество мест ограничено, поэтому пригласим тех, кому мероприятие ближе всего по интересам и опыту. Подать заявку на участие можно здесь: https://events.yandex.ru/events/zen-meetup-exploration

Для всех, кто не сможет присоединиться офлайн, будут специальные записи докладов, но для этого нужно зарегистрироваться.
👀Как оценить качество мультиобъектной ML-модели компьютерного зрения?
Слежение за несколькими объектами в реальной среде – сложная задача, в т.ч. из-за метрик оценки качества ML-модели, цель которой оценить точность слежения и проверить траекторию движущегося объекта. Предположим, для каждого кадра в видеопотоке система отслеживания выводит гипотезу 'n', а в кадре есть 'm' основных истинных объектов. Тогда процесс оценки показателей выглядит следующим образом:
• Найти и сопоставить наилучшее совпадение между гипотезой и основной истиной на основе их координат и с помощью различных алгоритмов сопоставления.
• Для каждой совпавшей пары найдите ошибку в положении объекта.
• Рассчитайте сумму нескольких ошибок, таких как промахи (трекер не смог выдвинуть гипотезу для объекта), ложные срабатывания (когда трекер выдал гипотезу, но объект отсутствовал) и ошибки несоответствия (когда гипотеза следящего за достоверной информацией изменила текущий кадр).
Так производительность ML-модели может быть выражена двумя метриками:
MOTP (Multi-Object Tracking Precision) показывает, насколько точно оцениваются точные положения объекта. Это общая ошибка в оценке местоположения для совпадающих пар наземной истины-гипотезы по всем кадрам, усредненная по общему количеству сделанных совпадений. Эта метрика не отвечает за распознавание конфигураций объектов и оценку траекторий объектов. Метрика находится в диапазоне от 0 до 1. Если значение MOTP равно 1, то точность системы низкая. А если он близок к нулю, значит точность системы хорошая.
MOTA (Multi-Object Tracking Accuracy) показывает, сколько ошибок система слежения сделала (промахи, ложные срабатывания, ошибок несоответствия). Метрика варьируется от –inf до 1. Если MOTA равен 1, то точность системы хорошая. Если MOTA около нуля или меньше нуля, то точность системы низкая.
https://pub.towardsai.net/multi-object-tracking-metrics-1e602f364c0c
😜Нужна аналитика настроений в комментариях на YouTube?
Более 2 миллиардов пользователей смотрят видео на YouTube хотя бы раз в месяц. Популярные ютуб-блогеры собирают миллиарды просмотров. Но всем подписчикам не угодишь и общественное мнение постоянно меняется. Постройте свою модель анализа пользовательских настроений с Youtube-Comment-Scraper - Python-библиотеки для получения комментариев к YouTube-роликам с помощью автоматизации браузера (пока работает только в Windows). Этот open-source проект поможет создать дэшборд, анализирующую отношение подписчиков к видеороликам популярных ютуберов. Работа сведется к следующим шагам:
• сбор нужных комментариев к видео от пользователей YouTube;
• использование предварительно обученной ML-модели, чтобы делать прогнозы по каждому комментарию;
• визуализация прогнозов модели на дэшборде, в т.ч. с помощью Dash на Python или Shiny на R.
Можно добавить интерактивности, позволив пользователям фильтровать результаты анализа настроений по времени выпуска, автору и жанру видео.
https://pypi.org/project/youtube-comment-scraper-python/
Регистрация на бесплатную международную онлайн-конференцию DataArt IT NonStop 2021 открыта!

IT NonStop продлится с 18 по 20 ноября. Главные темы: машинное обучение и искусственный интеллект, работа с данными, облачные технологии. Рабочий язык — английский, но секции, ориентированные на начинающих специалистов, — на русском. Программа одного дня полностью состоит из воркшопов и ознакомительных лекций для начинающих IT-специалистов.

В программе — более 30 докладов и воркшопов специалистов из Microsoft, AWS, Ocado, Codete, Ciklum, Eleks, SoftServe, Toloka, Yandex, DataArt и других компаний. Мы не смогли уместить в один пост всех, поэтому вот несколько тем воркшопов:
— "Creating Real-Time Data Streaming powered by SQL on Kubernetes" Albert Lewandowski, Big Data DevOps Engineer, GetInData.
— "Create your own cognitive portrait in 60 minutes", Dmitry Soshnikov, Cloud Developer Advocate, Microsoft.
— "Training unbiased and accurate AI models", Robert Yenokyan, AI Lead, Pinsight.
Все темы можно посмотреть на сайте. И да, мы все еще добавляем новых докладчиков.

Кратко про IT NonStop 2021:
Когда: 18–20 ноября.
Где: онлайн. Участие бесплатное.
Регистрация по ссылке: https://it-nonstop.net/register-to-the-conference/?utm_source=bdscience&utm_medium=referral
🔥30 сентября 2021 г. в 10.00 (мск) состоится онлайн-мероприятие «Цифровой четверг X5 — открытый разговор». Спикеры из Яндекса, X5 Retail Group, Крок, Ростелекома и Мегафона расскажут, как и зачем становиться Data-Driven компанией, почему иногда кейсы работы с данными не приносят реальной пользы бизнесу и могут ли алгоритмы заменить людей или за цифрами все же нужен человек.
Регистрация https://x5-retail-group-event.timepad.ru/event/1743630/