Big Data Science [RU]
1.62K subscribers
78 photos
9 videos
543 links
Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏https://t.me/bdscience — Big Data Science channel (english version)
💼https://t.me/bds_job — channel about Data Science jobs and career
Download Telegram
🌸Новости из MIT: новый вероятностный язык программирования на базе ИИ
Он может беспристрастно оценивать «справедливость» ИИ-алгоритмов точнее и быстрее существующих альтернатив. Этот язык сумм-произведений (SPPL, Sum-Product Probabilistic Language) представляет собой систему вероятностного программирования - новой области на пересечении языков программирования и ИИ, которая упрощает разработку AI-решений с помощью вероятностных моделей и объяснений наблюдаемых данных.
SPPL предлагает улучшенную гибкость и надежность благодаря выразительности языка, его точной и простой семантике, а также скорости и надежности механизма точного символьного вывода. Это позволяет избежать ошибок, ограничиваясь тщательно разработанным классом ИИ-моделей, включая классификаторы дерева решений. SPPL работает путем компиляции вероятностных программ в специализированную структуру данных, называемую «выражением суммы-произведения». Однако, этот подход не может анализировать нейросети, хотя и работает быстрее других подобных решений. SPPL реализован на Python и доступен с открытым исходным кодом.
https://news.mit.edu/2021/exact-symbolic-artificial-intelligence-faster-better-assessment-ai-fairness-0809
https://github.com/probcomp/sppl
👻Что такое AIOps и чем это отличается от MLOps
MLOps -
это междисциплинарный подход к управлению методами машинного обучения как автономными продуктами с собственным жизненным циклом, с фокусом на разработке, масштабировании и применении ML-алгоритмов в работе на постоянной основе.
MLOps направлен на преодоление разрыва между созданием ML-моделей и их сопровождением, а AIOps фокусируется на автоматизации управления инцидентами и интеллектуальном анализе первопричин.
Решения AIOps используют все данные отслеживания и отчетности, а также журналы для обнаружения событий и применения машинного обучения и глубокого обучения для уведомления ИТ-операций о любых проблемах или сбоях.
Цель AIOps - повысить эффективность ИТ-операций за счет автоматизации диагностики событий и использования машинного обучения для точного определения первопричин. Эти средства защиты предоставляют техническим командам высококачественные данные, которые легко понять, проанализировав искажения, полученные с помощью технологий мониторинга, и уменьшив количество ложных срабатываний, позволяя им выполнять функцию при принятии решения. AIOps выходит за рамки предотвращения простоев и включает в себя сдерживание затрат, безопасность и соблюдение политик с помощью ИИ для улучшения ИТ-операций.
MLOps помогает командам выбрать, какие инструменты, методологии и документация помогут их ML-моделям выйти в production, а AIOps – помогает командам автоматизировать жизненные циклы своих технологий.
Наибольший эффект дает совместное использование MLOps и AIOps.
https://ai.plainenglish.io/whats-the-difference-between-aiops-and-mlops-15316cfa803d
👆🏻BYOL - Bootstrap Your Own Latent
BYOL – новый подход к самостоятельному обучению представлению изображений с 2-мя нейросетями, которые взаимодействуют и учатся друг у друга. Онлайн-сеть учится на основе представления, сделанного целевой сетью на одном и том же изображении с различными дополнениями. Базовая архитектура BYOL - это существующая ResNet50 или другие подобные архитектуры. Вход x дополняется до t и t ’, которые передаются через онлайн и целевую сеть отдельно.
Разница между онлайн и целевой сетями в том, что первая имеет MLP-архитектуру с двумя полностью связанными слоями, а также Relu и batchnorm между ними. Представление онлайн-сети учится на представлении, создаваемом целевой сетью. Онлайн-сеть обновляется функцией потерь регрессии, цели которой задаются целевой сетью. А параметры целевой модели обновляются экспоненциальной скользящего среднего онлайн-сети, позволяя обрабатывать больше информации и избежать коллапса решений.
Производительность BYOL соответствует сравнению с архитектурой контролируемого обучения SOTA. Есть небольшое снижение производительности при использовании только случайного кадрирования в качестве увеличения изображения, но BYOL показывает лучшие результаты, чем SimCLR, итеративно обучаясь на предыдущих версиях своих выходных данных без использования отрицательных пар с протоколом линейного классификатора. Однако, пока BYOL-подходе еще не применим к задачам обработки текста, видео, аудио.
https://www.youtube.com/watch?v=YPfUiOMYOEE
https://ai.plainenglish.io/byol-bootstrap-your-own-latent-dacee62a3dc8
https://arxiv.org/abs/2006.07733
https://arxiv.org/abs/2010.10241
https://github.com/lucidrains/byol-pytorch
💐В преддверии дня знаний мы снова собрали для вас подборку интересных DS-событий:
1 сентября - Huawei Cup 2021 — Евразийские соревнования для студентов и молодых специалистов. Регистрация открыта с 23 августа, викторина 1-го этапа будет проходить с 1 сентября по 31 октября. 6 номинаций: Модели и методы ИИ, Построение сетей хранения данных, Технологии и протоколы IP-сетей, Технологии и стандарты мобильной связи 5G, Проектирование мобильных приложений и номинация для начинающих журналистов ICT Observer. Главный приз в номинациях AI, Storage, IP и 5G — чек на 10 тысяч долларов, в номинациях ICT Observer и APP — флагманское устройство Huawei. Финалисты, занявшие вторые и третьи места во всех номинациях, получат топовые гаджеты Huawei. https://huaweicup.ru/
3-6 сентября – Риф.Юг - серия мероприятий по вопросам цифровизации экономики и государственного управления, образованиям и кадрам, интернет-бизнесу. Ставрополье, https://runet-id.com/event/rif-south21/
8 сентября - Онлайн-хакатон по разработке городских навыков Алисы для Санкт-Петербурга https://events.yandex.ru/events/online-hakathon-spb
16 сентября в 19:00 (мск) - онлайн-встреча по Azure: методы обнаружения начала сбоя в системах Microsoft Azure с помощью службы цифровых двойников и API обнаружения аномалий. https://community-z.com/events/ta-devops-azure-ru-community-meetup-ad
16 сентября – Технологии умного города – онлайн-конференция от CNews https://events.cnews.ru/events/tehnologii_umnogo_goroda_2021.shtml
20-21 сентября - Saint HighLoad++ 2021 - профессиональная конференция разработчиков высоконагруженных систем, Санкт-Петербург, https://www.highload.ru/spb/2021
21 сентября - AI Conference Kyiv, Киев https://aiconference.com.ua/ru
21 сентября - конференция CNews "ИКТ в госсекторе 2021: жизнь в новой реальности", Москва, https://events.cnews.ru/events/ikt_v_gossektore_2021_2021-09-23.shtml
21-24 сентября - Международный форум Kazan Digital Week 2021, Казань - https://kazandigitalweek.ru/
23 сентября – конференция CNews "Искусственный интеллект 2021" https://events.cnews.ru/events/iskusstvennyi_intellekt_2021.shtml
24 сентября - Yandex Scale - Большая конференция Yandex.Cloud https://scale.yandex.ru/
25 сентября - Yandex Self-Driving Meetup '21 - Большой митап по беспилотным технологиям Яндекса, Москва https://taxi.yandex.ru/action/ysdm
27-28 сентября - Moscow Python Conf++ 2021 - профессиональная конференция для Python-разработчиков, Москва, Radisson Slavyanskaya - https://conf.python.ru/moscow/2021
28-30 сентября - Big Data Days 2021 Online Edition - международная конференция по большим данным, науке о данных и искусственному интеллекту https://bigdatadays.ru/
• 30 сентября - 1 октября - Всероссийский форум по сбору и анализу данных в маркетинге (Marketing Data Analytics 2021) - Москва, https://interforums.ru/mda/home
30 сентября - 1 октября - VII Федеральный ИТ-форум нефтегазовой отрасли России «Smart Oil & Gas: Достоверные данные», Санкт-Петербург, https://www.comnews-conferences.ru/ru/conference/smartoilgas2021
🏸Что такое AIOps
Пока мы привыкли к MLOps, в ИТ случилось новое Ops-явление, необходимость которого на самом деле возникла достаточно давно. Встречайте AIOps – использование ИИ для упрощения управления ИТ-операциями, а также ускорения и автоматизации решения проблем в сложных современных ИТ-средах. AIOps использует возможности больших данных, аналитики и машинного обучения для следующих целей:
• Сбор и объединение огромных и постоянно растущих объемов операционных данных, генерируемых множеством компонентов ИТ-инфраструктуры, приложений и инструментов мониторинга производительности;
• Фильтрация полезных сигналов от шума, чтобы выявить действительно важные события и закономерности, связанные с производительностью и доступностью систем;
• определение первопричин и быстрая реакция на проблемы, иногда автоматически без без вмешательства человека.
Благодаря замене множества отдельных инструментов для ручного выполнения ИТ-операций на единую интеллектуальную и автоматизированную платформу, AIOps позволяет быстро и даже заблаговременно реагировать на замедление работы и сбои систем с гораздо меньшими усилиями. AIOps устраняет разрыв между все разнообразным, динамичным и сложным ИТ-ландшафтом без снижения производительности и доступности приложений. С учетом того, что все больше компаний сегодня переходят от традиционной ИТ-инфраструктуры к динамическому сочетанию локальных кластеров, частных облаков и общедоступных облачных сред, внедрение AIOps актуально для многих предприятий.
https://medium.com/geekculture/aiops-6e463cbe617a
👻Что такое обнаружение аномалий и как это работает
Обнаружение аномалий - это математический поиск отклонений в контролируемых и неконтролируемых числовых данных в зависимости от того, насколько конкретное значение отличается от окружающих или от стандартного отклонения в представленной выборке. Есть множество различных методов обнаружения аномалий, называемых алгоритмами обнаружения выбросов, каждый из которых имеет различные критерии их обнаружения и поэтому используется в разных сценариях. Чаще всего для обнаружения аномалий используются следующие методы:
Общие методы, основанные на плотности: метод K-ближайшего соседа (KNN), локальный фактор выброса (LOF), метод изолированных лесов (Isolation Forests) и прочие алгоритмы, которые могут применяться для сценариев регрессии или классификации. Каждый из них генерирует ожидаемое поведение, следуя линии наивысшей плотности точек данных. Точки, которые выпадают на статистически значимое количество за пределами этих плотных зон, помечаются как аномалия. Большинство этих методов основаны на расстоянии между точками, поэтому для получения точных результатов важно нормализовать единицы измерения и масштаб в датасете. Например, в KNN точки данных взвешиваются по значению 1 / k, где k - расстояние до ближайшего соседа. Поэтому, что точки, которые расположены ближе друг к другу, имеют большой вес, и влияют на то, что является стандартом, больше удаленных точек. Алгоритм отмечает точки с низким значением 1 / k как выбросы. Это подходит для нормализованных данных без меток, когда нет желания и возможности использовать алгоритмы с более сложными вычислениями.
Машина опорных векторов с 1 классом (One-class support vector machine) – алгоритм обучения с учителем, создающий надежную модель прогнозирования. Часто используется для классификации. Имеется обучающий набор примеров, каждый из которых помечен как часть одной из двух категорий. Система создает критерии для сортировки новых примеров по каждой категории, сопоставляет примеры с точками в пространстве, чтобы максимально различать обе категории. Система помечает выброс, если он выходит за пределы любой категории. При отсутствии размеченных данных, можно использовать метод обучения без учителя, который ищет кластеризацию среди примеров для определения категорий. Это подходит для работы с 2-мя категориями данных, когда нужно найти, какие точки данных лежат за пределами каждой из них.
Алгоритм кластеризации K-средних, сочетающий KNN-подходы, основанные на близости каждой точки данных к другим близлежащим точкам и SVM, т.к. он ориентирован на классификацию по различным категориям. Здесь каждая точка данных разделена на категории в зависимости от ее характеристик. Категория имеет центральную точку, которая служит прототипом для всех других точек данных в кластере. Все они сравниваются с этими прототипами, чтобы определить их k-среднее значение, которое играет роль показателя разницы между прототипом и текущей точкой данных. Точки данных с более высоким k-средним находятся ближе к прототипу, образуя кластер. Кластеризация K-средних может обнаруживать аномалии, отмечая точки, которые не соответствуют ни одной из установленных категорий. Это подходит для сценариев, когда есть немаркированные данные из множества различных типов, которые нужно организовать по аналогии с изученными прототипами.
Есть и другие более сложные алгоритмы для неконтролируемого обнаружения аномалий и работы с многомерными наборами данных. Например, гауссовский как альтернативная версия алгоритма K-средних с распределением Гаусса вместо стандартного отклонения. А байесовский использует байесовское понимание вероятности для обнаружения аномалий. Также для обнаружения аномалий могут применяться автоэнкодеры - нейросети, создающие закодированные правила для ожидаемого вывода в зависимости от входного значения. То, что выходит за рамки этих повторяющихся значений, считается аномалией и хорошо подходит для задач их обнаружения в размерности.
🏂Почему все GAN-сети работают одинаково, и зачем настраивать гиперпараметры
Генеративные состязательные сети, представляют собой структуру, способную изучать распределение на основе конкуренции между генератором и дискриминатором. Генератор учится генерировать образцы, неотличимые от реальных данных, а дискриминатор учится классифицировать, является ли данное изображение реальным или поддельным. Сегодня GAN-сети считаются мощным инструментом и активно используются в задачах генерации и реконструкции текстов, изображений и пр. При том, что есть множество разных архитектур и видов GAN-сетей, при достаточном гиперпараметрическом поиске почти все алгоритмы имеют случайные ранги, и даже самые последние работы работают аналогично оригинальной GAN, впервые предложенной Яном Гудфеллоу. Бенчмаркинговое сравнение различных GAN-сетей показало, что алгоритмические различия не так актуальны, а вот поиск по гиперпараметрам имеет большее влияние на результат. Однако, оптимальные гиперпараметры во многом зависят от набора данных и настройка гиперпараметров – одна из самых интересных и тонких задач ML-специалиста.
https://medium.com/codex/do-all-gans-perform-the-same-cc02055091af
💥ТОП-5 полезных Python-инструментов для дата-инженера и веб-разработчика
Requests – простая в использовании HTTP-библиотека для Python, которая позволяет делать запросы и взаимодействовать с API https://docs.python-requests.org/en/master/
Advanced Python Scheduler (APScheduler) – библиотека для отложенного выполнения Python-кода однократно или с периодическим повтором. При сохранении заданий в базе данных, сохранятся также их состояния и перезапуск планировщика. Также APScheduler можно использовать как кроссплатформенную замену для конкретных приложений планировщикам для конкретных платформ, таким как cron-демон или планировщик задач Windows. Однако, APScheduler не является демоном или сервисом, а потому не поставляется с инструментами командной строки, а предназначен для запуска внутри существующих приложений. Эта библиотека предоставляет некоторые готовые блоки для создания службы планировщика или для запуска его в отдельном процессе. https://apscheduler.readthedocs.io/en/stable/userguide.html
Watchdog – модуль для отслеживания событий файловой системы через Python API и служебные программы shell-оболочки https://pypi.org/project/watchdog/
Twilio – библиотека для автоматизации отправки текстовых сообщений и телефонных звонков. Очень удобно для автоматического мониторинга событий на сторонних сайтах, например, оперативного отслеживания скидок на нужные товары или появления новых продуктов https://pypi.org/project/twilio/
Random User Agent – библиотека для добавления в запросы случайных пользовательских агентов, что полезно при веб-парсинге данных или отправке большого количества запросов https://pypi.org/project/random-user-agent/
✈️ML-прогнозы в реальном времени с Vertex AI от Google
Одна из самых больших проблем при обслуживании ML-моделей - это предоставление прогнозов в режиме, близком к реальному времени. Некоторые бизнес-сценарии особенно чувствительны к временной задержке. Например, рекомендательные системы для пользователей интернет-магазина, оценка время доставки продуктов для фудтех-компаний и пр. 25 августа 2021 года Google объявила о возможности прямого взаимодействия с Vertex AI – своей объединеной ML-платформой через частные endpoint’ы. Vertex AI позволяет быстро подключить обученную и протестированную ML-модель к рабочему приложению, загрузить на специально подготовленный сервер в Google Cloud или экспортировать в нужный формат.
Vertex Predictions - это бессерверный способ обслуживания ML-моделей, которые можно разместить в облаке и делать прогнозы через REST API. При онлайн-прогнозах необходимо развернуть модель на конечной точке, что свяжет ее с физическими вычислительными ресурсами и позволит делать вычисления практически в реальном времени. С помощью VPC Peering можно настроить частное соединение для обращения к конечной точке. При этом пользовательские данные не будут проходить через общедоступный Интернет, что снижает задержку онлайн-прогнозов и повышает безопасность.
https://cloud.google.com/blog/products/ai-machine-learning/creating-a-private-endpoint-on-vertex-ai
🏂🏸Состязательные атаки для уточнения прогнозов молекулярной энергии
Исследователи из MIT нашли новый способ количественной оценки неопределенности молекулярных энергий с помощью нейросетей. Нейросети часто используются для прогнозирования новых материалов, скорости и выхода химических реакций, работая на порядки быстрее, чем традиционные методы, такие как квантово-механическое моделирование. Но полученные результаты могут быть ненадежными, поскольку ML-модели интерполируют, возможен сбой при их применении на рабочих данных вне обучающего датасета. Это особенно верно для предсказания «поверхностей потенциальной энергии» (ППЭ) или карты энергии молекулы во всех ее конфигурациях. Для решения этих проблем ученые предложили выделить безопасные зоны нейросети с помощью состязательных атак. Фактическое моделирование выполняется только для небольшой части молекул, а данные передаются в нейронную сеть, которая учится предсказывать те же свойства для остальных молекул. Эти методы были успешно протестированы на новых материалах, включая катализаторы для производства водорода из воды, более дешевые полимерные электролиты для электромобилей, магниты и пр. Однако, точность нейросетей зависит от корректности обучающих данных, а неверные прогнозы могут иметь катастрофические последствия.
Один из способов узнать неопределенность модели - прогнать одни и те же данные через несколько ее версий. Для этого у исследователей было несколько нейронных сетей, предсказывающих поверхность потенциальной энергии на основе одних и тех же данных. Если сеть уверена в предсказании, разница между выходными сигналами разных сетей минимальна, и поверхности в большей степени сходятся. Иначе прогнозы различных моделей сильно различаются, производя ряд выходных данных, любой из которых может быть правильной поверхностью.
Разброс прогнозов представляет собой неопределенность в конкретной точке. ML-модель должна указывать не только на лучший прогноз, но и на неопределенность каждого из них. Однако, каждая симуляция может занять от десятков до тысяч процессорных часов. А чтобы получить значимые результаты, необходимо запустить несколько моделей в достаточном количестве точек.
Поэтому новый подход отбирает только точки данных из областей с низкой достоверностью прогнозов, соответствующих определенной геометрии молекулы. Затем эти молекулы немного изменяются, чтобы повысить неопределенность. Дополнительные данные вычисляются для этих молекул посредством моделирования, а затем добавляются в исходный обучающий пул. Нейронные сети снова обучаются, и вычисляется новый набор неопределенностей. Этот процесс повторяется до тех пор, пока неопределенность, связанная с различными точками на поверхности, не станет четко определенной и не может быть уменьшена в дальнейшем.
Предлагаемый подход был протестирован на цеолитах - кавернозных кристаллах, которые действуют как молекулярные сита с высокой избирательностью формы и используются в катализе, разделении газов и ионном обмене. Моделирование больших структур цеолита очень дорого, исследователи показывают, как их метод может обеспечить значительную экономию при компьютерном моделировании. Но состязательный подход для переобучения нейронных сетей значительно повышает производительность без существенных вычислительных затрат.
https://news.mit.edu/2021/using-adversarial-attacks-refine-molecular-energy-predictions-0901
Forwarded from Data Science Jobs
16 сентября, Чт
Конференция по Machine Learning in production

Через неделю @selectelnews соберет сообщество специалистов, которых интересует все новое в сферах ML и AI, чтобы поговорить про MLOps-платформы, применение ML в работе технической поддержки, жизненный цикл моделей машинного обучения и другие направления.

В программе:
— Управление жизненным циклом моделей машинного обучения — возможности Polymatica ML
— От данных к модели: ML-платформа и ее эксплуатация с точки зрения DevOps
— Поддержка VK: как оставаться поддержкой с человеческим лицом, внедряя ML

Дата: 16 сентября в 10:30 МСК
Место проведения: online и offline (офис Selectel, Санкт-Петербург, ул. Цветочная, 19)

Регистрируйтесь бесплатно по ссылке: https://slc.tl/NNpkU
🕸Автоматизация веб-скрепинга: 3 популярных инструмента
Хотите отслеживать цены в интернет-магазине или автоматизировать заказ еды в ресторане? Попробуйте следующие средства:
Selenium – известный фреймворк для автоматизации тестирования, который можно использовать его имитации пользовательского поведения и выполнения действий на веб-сайтах, таких как заполнение форм, нажатие кнопок и пр. https://selenium-python.readthedocs.io/
Beautiful Soup – Python-пакет для анализа HTML- и XML-документов. Создает дерево синтаксического анализа, которое можно использовать для извлечения данных при парсинге веб-страниц. Очень хорош для простых проектов. https://pypi.org/project/beautifulsoup4/
Scrapy – быстрый высокоуровневый фреймворк для сканирования и сканирования веб-сайтов, используемый для извлечения структурированных данных с целью их интеллектуального анализа, мониторинга и автоматического тестирования. Он отлично подходит для сложных проектов и значительно быстрее вышеуказанных аналогов. https://docs.scrapy.org/en/latest/
😎Нужно разработать приложение распознавания эмоций по видео в реальном времени?
Используйте Face Recognition API! Open-source проект для распознавания лиц и управления ими из Python или командной строки. ML-модель создана с помощью DL-алгоритма распознавания лиц и имеет точность 99,38% в тесте Labeled Faces in the Wild.
С Face Recognition API разработка приложения состоит из 5 шагов:
• прием видео в реальном времени
• применение Python-функций готового API для обнаружения лиц и эмоций на объектах в видеопотоке;
• классификация эмоций по категориям;
• построение рекомендательной системы;
• сборка приложения и развертывание на Heroku, Dash или веб-сервере.
https://github.com/ageitgey/face_recognition
🗣4 практики повышения эффективности от использования Google Cloud Translation API
Веб-сервис, который динамически переводит между языками с помощью ML-моделей Google поддерживает более 100 языков и активно используется на практике. А если знать полезные лайфхаки, можно снизить затраты, повысить производительность и улучшить безопасность этого API для перевода на веб-сайтах.
1. Кэширование переведенного контента не только сокращает количество обращений к Google Cloud Translation API, но и снижает нагрузку и использование вычислений на внутренних веб-серверах и базах данных. Это оптимизирует производительность приложений и снижает стоимость доставки. Настроить кэширование в архитектуре приложения можно на разных уровнях приложения. Например, на уровне прокси-сервера (NGINX или HAProxy), самого приложения в памяти на веб-серверах или внешнюю службу кэширования памяти, а также через CDN.
2. Безопасный доступ по принципу наименьших привилегий. В случае доступа к Google Cloud Translation API, рекомендуется использовать учетную запись Google Cloud Service, а не ключи api. Учетная запись сервиса - это особый тип аутентификации, который представляет собой пользователя, не являющегося человеком, и может быть авторизован для доступа к данным в API Google. Учетным записям служб не назначаются пароли, и они не могут использоваться для входа в систему через браузер, сводя к минимуму этот вектор угрозы. Следуя принципу минимальных привилегий, можно предоставить роль с минимальными привилегиями и набором разрешений для доступа к API перевода.
3. Настройка переводов. Если контент включает термины предметной области и контекста, Google Cloud Translation API Advanced поддерживает настраиваемую терминологию с помощью глоссария. Можно создавать и использовать собственные модели перевода с помощью Google AutoML Translation. Благодаря предупреждению, которое Google выводит пользователям, о том, что контент был переведен автоматически, клиенты понимают потенциальные риски наличия ошибок и неточностей.
4. Контроль бюджета. Затраты, связанные с Google Cloud Translation API, в основном зависят от количества символов, отправленных в API. Например, по прейскуранту $10 за миллион символов, если веб-страница включает из 20 миллионов символов и нужно перевести на 10 языков, затраты составят $10*20 = $200. Следить за бюджетом поможет настойка оповещений в рабочей среде.
https://cloud.google.com/blog/products/ai-machine-learning/four-best-practices-for-translating-your-website
Forwarded from Big Data Science
🚀Data Science в городе: продолжаем серию митапов Ситимобила про Data Science в геосервисах, логистике, приложениях Smart City и т.д. Приглашаем на 2-ю онлайн-встречу 23 сентября в 18:00 МСК. Вас ждут интересные доклады DS-практиков из Ситимобила, Optimate AI и Яндекс.Маршрутизации:
🚕Максим Шаланкин (Data Scientist в гео-сервисе Ситимобил) расскажет о жизненном цикле ML-модели прогнозирования времени в пути с учетом большой нагрузки
🚚Сергей Свиридов (CTO из Optimate AI) объяснит, что не так с классическими эвристиками и методами комбинаторной оптимизации для построения оптимальных маршрутов, и как их можно заменить динамическим программированием
🚛Даниил Тарарухин (Руководитель группы аналитики в Яндекс.Маршрутизации) поделится, как автомобильные пробки влияют на поиск оптимального маршрута и имитационное моделирование этой задачи.
После докладов спикеры ответят на вопросы слушателей.
Ведущий мероприятия – Алексей Чернобровов🛸
Регистрация для бесплатного участия: https://citymobil.timepad.ru/event/1773649/
🍏Еще 3 полезных Python-библиотеки для Data Scientist’а
JMESPath - библиотека, которая помогает запрашивать JSON. Пригодится в работе с большим многоуровневым JSON-документом или словарем. JMESPath дает доступ к объекту доступу в стиле «JavaScript», упрощая разработку и тестирование кода. Это также безопасно - если какой-либо из путей не существует, функция поиска JMESPath вернет None. https://github.com/jmespath/jmespath.py
Inflection - это библиотека, пришедшая из Ruby, которая помогает обрабатывать сложную логику обработки строк. Она переводит английские слова в единственное и множественное число, а также преобразует строки из CamelCase в строку с подчеркиванием. Пригодится, когда есть имена переменных или точек данных, сгенерированы на другом языке или в другой системе, которые нужно перевести в питонический стиль в соответствии со стандартами PEP. https://github.com/jpvanhal/inflection
more-itertools – библиотека, включающая целый набор полезных функций, которые можно использовать в разных задачах разработки. Например, быстро и изящно написать код разделения одного словаря на несколько списков на основе общего повторяющегося ключа или циклически объединить несколько списков. Эта библиотека автоматически организует реализацию регулярных выражений и настроит рекурсивные ограничения. https://github.com/more-itertools/more-itertools
Forwarded from Data Science Jobs
«Лидеры цифровой трансформации» 2021 - больше, чем хакатон!

Выбирай одну из 10 актуальных задач и разрабатывай новые цифровые продукты для города!

Что ждет участников?
🏆Призовой фонд - 10 000 000 рублей

🌐 Online-формат
10 интересных задач
Доступ к датасетам для команд c 10 октября
⚡️ Дополнительные подарки партнеров: промокоды на пиццу, мерч для лучших команд, гранты на обучение и многое другое.

👤Если команды нет, то организаторы тебе помогут ее найти!
⚠️Cейчас участники активно ищут к себе в команды разработчиков.

Выбирай задачу и регистрируйся прямо сейчас:
🔗 https://bit.ly/3tY2pi9
И вступай в наш телеграмм-чат:
🔗 https://t.me/leaders21
С 24 по 26 сентября пройдет пятый хакатон по искусственному интеллекту в городе Ростов-на-Дону. Участники хакатона имеют шанс внести свой вклад в борьбу с незаконным выловом водных биологических ресурсов в территориальных водах России.

Основная задача - создание алгоритма, способного фиксировать данные о положении рыболовного трала - поднят или опущен - в момент получения спутникового снимка.

Эта информация позволит специалистам сделать вывод о характере деятельности конкретного судна (группы судов) в момент времени, либо временной интервал, а также о законности её осуществления.

Результаты хакатона будут использованы для разработки моделей прогнозирования
потенциальных мест правонарушений и выработке рекомендаций по оптимизации маршрута работы контрольно-надзорных органов, сокращению числа правонарушений,
уменьшению экологического ущерба.

🚀Спешите зарегистрироваться https://hacks-ai.ru/hakaton/rostov-na-donu
25 сентября в Москве (ресторан Ketch Up, м.Кузнецкий мост) пройдет первый в этом году офлайн-митап от Яндекс.Дзена. Поговорим про объяснимость рекомендаций.

К сожалению, количество мест ограничено, поэтому пригласим тех, кому мероприятие ближе всего по интересам и опыту. Подать заявку на участие можно здесь: https://events.yandex.ru/events/zen-meetup-exploration

Для всех, кто не сможет присоединиться офлайн, будут специальные записи докладов, но для этого нужно зарегистрироваться.
👀Как оценить качество мультиобъектной ML-модели компьютерного зрения?
Слежение за несколькими объектами в реальной среде – сложная задача, в т.ч. из-за метрик оценки качества ML-модели, цель которой оценить точность слежения и проверить траекторию движущегося объекта. Предположим, для каждого кадра в видеопотоке система отслеживания выводит гипотезу 'n', а в кадре есть 'm' основных истинных объектов. Тогда процесс оценки показателей выглядит следующим образом:
• Найти и сопоставить наилучшее совпадение между гипотезой и основной истиной на основе их координат и с помощью различных алгоритмов сопоставления.
• Для каждой совпавшей пары найдите ошибку в положении объекта.
• Рассчитайте сумму нескольких ошибок, таких как промахи (трекер не смог выдвинуть гипотезу для объекта), ложные срабатывания (когда трекер выдал гипотезу, но объект отсутствовал) и ошибки несоответствия (когда гипотеза следящего за достоверной информацией изменила текущий кадр).
Так производительность ML-модели может быть выражена двумя метриками:
MOTP (Multi-Object Tracking Precision) показывает, насколько точно оцениваются точные положения объекта. Это общая ошибка в оценке местоположения для совпадающих пар наземной истины-гипотезы по всем кадрам, усредненная по общему количеству сделанных совпадений. Эта метрика не отвечает за распознавание конфигураций объектов и оценку траекторий объектов. Метрика находится в диапазоне от 0 до 1. Если значение MOTP равно 1, то точность системы низкая. А если он близок к нулю, значит точность системы хорошая.
MOTA (Multi-Object Tracking Accuracy) показывает, сколько ошибок система слежения сделала (промахи, ложные срабатывания, ошибок несоответствия). Метрика варьируется от –inf до 1. Если MOTA равен 1, то точность системы хорошая. Если MOTA около нуля или меньше нуля, то точность системы низкая.
https://pub.towardsai.net/multi-object-tracking-metrics-1e602f364c0c