Big Data Science [RU]
1.62K subscribers
78 photos
9 videos
543 links
Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏https://t.me/bdscience — Big Data Science channel (english version)
💼https://t.me/bds_job — channel about Data Science jobs and career
Download Telegram
Reminder!
Сегодня! 12 августа в 18:00 будет проходить первый митап из серии Citymobil Data Meet-up!
Будем говорить про логистику, городские данные и технологии умных городов, обсудим роль геоданных и проблемы, которые с ними возникают.
Присоединяйтесь к нам, будем разбираться вместе))
Выступают:
- Артем Солоухин (Ситимобил)
- Андрей Критилин (ЦИАН)
- Фёдор Лаврентьев (Яндекс Go)
Не забудьте подготовить вопросы спикерам, после докладов будем общаться и у вас будет возможность их задать 🙂
Ссылка: https://tulu.la/chat/city-mobil-00002d/meetup-0002fv
Как настроить гиперпараметры для надежного повышения точности ML-модели: подробный guide
ML-модель и ее предварительная обработка индивидуальны для каждого проекта: гиперпараметры зависят от обрабатываемых данных. Например, в алгоритме логистической регрессии есть разные гиперпараметры (solver, C, penalty), разные комбинации которых дают различные результаты. Аналогично, существуют настраиваемые параметры для машины опорных векторов: gamma, C. Эти гиперпараметры алгоритмов доступны на сайте бесплатной Python-библиотеки Sklearn. Однако, часто разработчику приходится создавать собственные решения, не полагаясь на готовые рекомендации, чтобы разработать ML-модель с высокой точностью, которая зависит от наилучшего сочетания гиперпараметров. Читайте в статье про тестирование различных комбинаций Grid-поиска с библиотекой Sklearn и без нее, проверка результатов кросс-валидацией и выводы насчет эффективности утилизации ресурсов ЦП. https://towardsdatascience.com/evaluating-all-possible-combinations-of-hyperparameter
✍🏻SoundStream новый нейронный аудиокодек от Google AI
SoundStream эффективно сжимает речь, музыку и звук с битрейтами, которые обычно используются кодеками обработки для речи. SoundStream опирается на модельную архитектуру, состоящую из сверточной сети кодировщика/декодера и квантователя остаточного вектора, которые обучаются совместно. Благодаря обучению со структурированным отключением на слоях квантователя, одна модель может работать с переменными битрейтами от 3 до 18 кбит/с. Это сравнимо с качеством моделей, обученными с фиксированными битрейтами. Также модель поддерживает реализацию с низкой задержкой и потоковом выводом в режиме реального времени на процессоре смартфона.
Нейросеть состоит из кодировщика, декодера и квантователя. Кодер преобразует входной аудиопоток в кодированный сигнал, который сжимается с помощью квантователя, а затем преобразуется обратно в аудио с помощью декодера. После обучения кодер и декодер можно запускать на разных клиентах для эффективной передачи высококачественного звука по сети. Оценить результаты работы SoundStream и подробнее узнать, как решается проблема квантования кодовых векторов можно здесь: https://ai.googleblog.com/2021/08/soundstream-end-to-end-neural-audio.html
✈️Новый алгоритм управления дронами от MIT
Аэрокосмические инженеры MIT разработали алгоритм, который помогает дронам находить самый быстрый маршрут бесперебойного прохождения препятствий. Это объединяет моделирование полета беспилотника через виртуальную полосу препятствий с данными экспериментов реального дрона, пролетающего по тому же маршруту в физическом пространстве.
Исследования показали, что дрон, обученный по новому алгоритму, пролетел через простую полосу препятствий на 20% быстрее. При этом в некоторых случаях направленный на глобальную, а не локальную оптимизацию, алгоритм замедлял полет дрона, чтобы пройти сложный поворот или сэкономить энергию. Это помогло в конечном итоге обогнать соперников.
https://news.mit.edu/2021/drones-speed-route-system-0810
🚀Компания ATF Media (https://t.me/atflife ) решила сделать визионерский проект в помощь всем разработчикам продуктов на ИИ.

Запускается международный каталог продуктов, реализованных на искусственном интеллекте TopAI.me
Каталог будет рассылаться в более чем 25000 крупнейших компаний, правительствам стран, венчурным фондам.
В каталоге представлены решения из разных сфер разработки искусственного интеллекта.
Если вы являетесь разработчиками в сфере ИИ, наш каталог будет полезен вам для поиска инвесторов и интересных сотрудничеств.
Если вы являетесь инвестором и в поиске проектов, то наш каталог будет полезен вам для поиска новых инструментов для инвестирования и внедрения.

Отбор проектов по модерации.
P.S. Регистрация на TopAI занимает 20 секунд.
🏸FastMoE - распределенная обучающая система Mixture-of-Expert (MoE)
Система на PyTorch с общими ускорителями предоставляет иерархический интерфейс для гибкого проектирования ML-моделей и простой адаптации к таким приложениям как Transformer-XL и Megatron-LM. В отличие от прямой реализации закрытых PyTorch-моделей MoE от Google, скорость обучения в FastMoE сильно оптимизирована благодаря сложным высокопроизводительным навыкам ускорения. Система поддерживает размещение разных экспертов на нескольких графических процессорах на нескольких узлах, позволяя линейно увеличивать количество экспертов по отношению к количеству графических процессоров.
https://github.com/laekov/fastmoe
https://arxiv.org/abs/2103.13262
🔥Не только GPT-3: что такое GPT-J-6B
Мощный NLP-алгоритм GPT-3 от OpenAI не является open-source проектом. Поэтому другие компании предлагают свои альтернативные решения. Наиболее интересным сейчас из них считается GPT-J от EleutherAI с 6 миллиардами параметров. Разработчики обещают, что GPT-J обеспечит более гибкий и быстрый вывод, чем аналоги Tensorflow + TPU при выполнении различных задач нисходящей потоковой передачи.
Описание на официальном сайте EleutherAI https://6b.eleuther.ai/
Ноутбук в Google Colab https://colab.research.google.com/github/kingoflolz/mesh-transformer-jax/blob/master/colab_demo.ipynb
Код на Github https://github.com/kingoflolz/mesh-transformer-jax/#gpt-j-6b
Подробное описание на сайте одного из разработчиков https://arankomatsuzaki.wordpress.com/2021/06/04/gpt-j/
Интересное тестирование в пользовательских кейсах https://minimaxir.com/2021/06/gpt-j-6b/
🌸Новости из MIT: новый вероятностный язык программирования на базе ИИ
Он может беспристрастно оценивать «справедливость» ИИ-алгоритмов точнее и быстрее существующих альтернатив. Этот язык сумм-произведений (SPPL, Sum-Product Probabilistic Language) представляет собой систему вероятностного программирования - новой области на пересечении языков программирования и ИИ, которая упрощает разработку AI-решений с помощью вероятностных моделей и объяснений наблюдаемых данных.
SPPL предлагает улучшенную гибкость и надежность благодаря выразительности языка, его точной и простой семантике, а также скорости и надежности механизма точного символьного вывода. Это позволяет избежать ошибок, ограничиваясь тщательно разработанным классом ИИ-моделей, включая классификаторы дерева решений. SPPL работает путем компиляции вероятностных программ в специализированную структуру данных, называемую «выражением суммы-произведения». Однако, этот подход не может анализировать нейросети, хотя и работает быстрее других подобных решений. SPPL реализован на Python и доступен с открытым исходным кодом.
https://news.mit.edu/2021/exact-symbolic-artificial-intelligence-faster-better-assessment-ai-fairness-0809
https://github.com/probcomp/sppl
👻Что такое AIOps и чем это отличается от MLOps
MLOps -
это междисциплинарный подход к управлению методами машинного обучения как автономными продуктами с собственным жизненным циклом, с фокусом на разработке, масштабировании и применении ML-алгоритмов в работе на постоянной основе.
MLOps направлен на преодоление разрыва между созданием ML-моделей и их сопровождением, а AIOps фокусируется на автоматизации управления инцидентами и интеллектуальном анализе первопричин.
Решения AIOps используют все данные отслеживания и отчетности, а также журналы для обнаружения событий и применения машинного обучения и глубокого обучения для уведомления ИТ-операций о любых проблемах или сбоях.
Цель AIOps - повысить эффективность ИТ-операций за счет автоматизации диагностики событий и использования машинного обучения для точного определения первопричин. Эти средства защиты предоставляют техническим командам высококачественные данные, которые легко понять, проанализировав искажения, полученные с помощью технологий мониторинга, и уменьшив количество ложных срабатываний, позволяя им выполнять функцию при принятии решения. AIOps выходит за рамки предотвращения простоев и включает в себя сдерживание затрат, безопасность и соблюдение политик с помощью ИИ для улучшения ИТ-операций.
MLOps помогает командам выбрать, какие инструменты, методологии и документация помогут их ML-моделям выйти в production, а AIOps – помогает командам автоматизировать жизненные циклы своих технологий.
Наибольший эффект дает совместное использование MLOps и AIOps.
https://ai.plainenglish.io/whats-the-difference-between-aiops-and-mlops-15316cfa803d
👆🏻BYOL - Bootstrap Your Own Latent
BYOL – новый подход к самостоятельному обучению представлению изображений с 2-мя нейросетями, которые взаимодействуют и учатся друг у друга. Онлайн-сеть учится на основе представления, сделанного целевой сетью на одном и том же изображении с различными дополнениями. Базовая архитектура BYOL - это существующая ResNet50 или другие подобные архитектуры. Вход x дополняется до t и t ’, которые передаются через онлайн и целевую сеть отдельно.
Разница между онлайн и целевой сетями в том, что первая имеет MLP-архитектуру с двумя полностью связанными слоями, а также Relu и batchnorm между ними. Представление онлайн-сети учится на представлении, создаваемом целевой сетью. Онлайн-сеть обновляется функцией потерь регрессии, цели которой задаются целевой сетью. А параметры целевой модели обновляются экспоненциальной скользящего среднего онлайн-сети, позволяя обрабатывать больше информации и избежать коллапса решений.
Производительность BYOL соответствует сравнению с архитектурой контролируемого обучения SOTA. Есть небольшое снижение производительности при использовании только случайного кадрирования в качестве увеличения изображения, но BYOL показывает лучшие результаты, чем SimCLR, итеративно обучаясь на предыдущих версиях своих выходных данных без использования отрицательных пар с протоколом линейного классификатора. Однако, пока BYOL-подходе еще не применим к задачам обработки текста, видео, аудио.
https://www.youtube.com/watch?v=YPfUiOMYOEE
https://ai.plainenglish.io/byol-bootstrap-your-own-latent-dacee62a3dc8
https://arxiv.org/abs/2006.07733
https://arxiv.org/abs/2010.10241
https://github.com/lucidrains/byol-pytorch
💐В преддверии дня знаний мы снова собрали для вас подборку интересных DS-событий:
1 сентября - Huawei Cup 2021 — Евразийские соревнования для студентов и молодых специалистов. Регистрация открыта с 23 августа, викторина 1-го этапа будет проходить с 1 сентября по 31 октября. 6 номинаций: Модели и методы ИИ, Построение сетей хранения данных, Технологии и протоколы IP-сетей, Технологии и стандарты мобильной связи 5G, Проектирование мобильных приложений и номинация для начинающих журналистов ICT Observer. Главный приз в номинациях AI, Storage, IP и 5G — чек на 10 тысяч долларов, в номинациях ICT Observer и APP — флагманское устройство Huawei. Финалисты, занявшие вторые и третьи места во всех номинациях, получат топовые гаджеты Huawei. https://huaweicup.ru/
3-6 сентября – Риф.Юг - серия мероприятий по вопросам цифровизации экономики и государственного управления, образованиям и кадрам, интернет-бизнесу. Ставрополье, https://runet-id.com/event/rif-south21/
8 сентября - Онлайн-хакатон по разработке городских навыков Алисы для Санкт-Петербурга https://events.yandex.ru/events/online-hakathon-spb
16 сентября в 19:00 (мск) - онлайн-встреча по Azure: методы обнаружения начала сбоя в системах Microsoft Azure с помощью службы цифровых двойников и API обнаружения аномалий. https://community-z.com/events/ta-devops-azure-ru-community-meetup-ad
16 сентября – Технологии умного города – онлайн-конференция от CNews https://events.cnews.ru/events/tehnologii_umnogo_goroda_2021.shtml
20-21 сентября - Saint HighLoad++ 2021 - профессиональная конференция разработчиков высоконагруженных систем, Санкт-Петербург, https://www.highload.ru/spb/2021
21 сентября - AI Conference Kyiv, Киев https://aiconference.com.ua/ru
21 сентября - конференция CNews "ИКТ в госсекторе 2021: жизнь в новой реальности", Москва, https://events.cnews.ru/events/ikt_v_gossektore_2021_2021-09-23.shtml
21-24 сентября - Международный форум Kazan Digital Week 2021, Казань - https://kazandigitalweek.ru/
23 сентября – конференция CNews "Искусственный интеллект 2021" https://events.cnews.ru/events/iskusstvennyi_intellekt_2021.shtml
24 сентября - Yandex Scale - Большая конференция Yandex.Cloud https://scale.yandex.ru/
25 сентября - Yandex Self-Driving Meetup '21 - Большой митап по беспилотным технологиям Яндекса, Москва https://taxi.yandex.ru/action/ysdm
27-28 сентября - Moscow Python Conf++ 2021 - профессиональная конференция для Python-разработчиков, Москва, Radisson Slavyanskaya - https://conf.python.ru/moscow/2021
28-30 сентября - Big Data Days 2021 Online Edition - международная конференция по большим данным, науке о данных и искусственному интеллекту https://bigdatadays.ru/
• 30 сентября - 1 октября - Всероссийский форум по сбору и анализу данных в маркетинге (Marketing Data Analytics 2021) - Москва, https://interforums.ru/mda/home
30 сентября - 1 октября - VII Федеральный ИТ-форум нефтегазовой отрасли России «Smart Oil & Gas: Достоверные данные», Санкт-Петербург, https://www.comnews-conferences.ru/ru/conference/smartoilgas2021
🏸Что такое AIOps
Пока мы привыкли к MLOps, в ИТ случилось новое Ops-явление, необходимость которого на самом деле возникла достаточно давно. Встречайте AIOps – использование ИИ для упрощения управления ИТ-операциями, а также ускорения и автоматизации решения проблем в сложных современных ИТ-средах. AIOps использует возможности больших данных, аналитики и машинного обучения для следующих целей:
• Сбор и объединение огромных и постоянно растущих объемов операционных данных, генерируемых множеством компонентов ИТ-инфраструктуры, приложений и инструментов мониторинга производительности;
• Фильтрация полезных сигналов от шума, чтобы выявить действительно важные события и закономерности, связанные с производительностью и доступностью систем;
• определение первопричин и быстрая реакция на проблемы, иногда автоматически без без вмешательства человека.
Благодаря замене множества отдельных инструментов для ручного выполнения ИТ-операций на единую интеллектуальную и автоматизированную платформу, AIOps позволяет быстро и даже заблаговременно реагировать на замедление работы и сбои систем с гораздо меньшими усилиями. AIOps устраняет разрыв между все разнообразным, динамичным и сложным ИТ-ландшафтом без снижения производительности и доступности приложений. С учетом того, что все больше компаний сегодня переходят от традиционной ИТ-инфраструктуры к динамическому сочетанию локальных кластеров, частных облаков и общедоступных облачных сред, внедрение AIOps актуально для многих предприятий.
https://medium.com/geekculture/aiops-6e463cbe617a
👻Что такое обнаружение аномалий и как это работает
Обнаружение аномалий - это математический поиск отклонений в контролируемых и неконтролируемых числовых данных в зависимости от того, насколько конкретное значение отличается от окружающих или от стандартного отклонения в представленной выборке. Есть множество различных методов обнаружения аномалий, называемых алгоритмами обнаружения выбросов, каждый из которых имеет различные критерии их обнаружения и поэтому используется в разных сценариях. Чаще всего для обнаружения аномалий используются следующие методы:
Общие методы, основанные на плотности: метод K-ближайшего соседа (KNN), локальный фактор выброса (LOF), метод изолированных лесов (Isolation Forests) и прочие алгоритмы, которые могут применяться для сценариев регрессии или классификации. Каждый из них генерирует ожидаемое поведение, следуя линии наивысшей плотности точек данных. Точки, которые выпадают на статистически значимое количество за пределами этих плотных зон, помечаются как аномалия. Большинство этих методов основаны на расстоянии между точками, поэтому для получения точных результатов важно нормализовать единицы измерения и масштаб в датасете. Например, в KNN точки данных взвешиваются по значению 1 / k, где k - расстояние до ближайшего соседа. Поэтому, что точки, которые расположены ближе друг к другу, имеют большой вес, и влияют на то, что является стандартом, больше удаленных точек. Алгоритм отмечает точки с низким значением 1 / k как выбросы. Это подходит для нормализованных данных без меток, когда нет желания и возможности использовать алгоритмы с более сложными вычислениями.
Машина опорных векторов с 1 классом (One-class support vector machine) – алгоритм обучения с учителем, создающий надежную модель прогнозирования. Часто используется для классификации. Имеется обучающий набор примеров, каждый из которых помечен как часть одной из двух категорий. Система создает критерии для сортировки новых примеров по каждой категории, сопоставляет примеры с точками в пространстве, чтобы максимально различать обе категории. Система помечает выброс, если он выходит за пределы любой категории. При отсутствии размеченных данных, можно использовать метод обучения без учителя, который ищет кластеризацию среди примеров для определения категорий. Это подходит для работы с 2-мя категориями данных, когда нужно найти, какие точки данных лежат за пределами каждой из них.
Алгоритм кластеризации K-средних, сочетающий KNN-подходы, основанные на близости каждой точки данных к другим близлежащим точкам и SVM, т.к. он ориентирован на классификацию по различным категориям. Здесь каждая точка данных разделена на категории в зависимости от ее характеристик. Категория имеет центральную точку, которая служит прототипом для всех других точек данных в кластере. Все они сравниваются с этими прототипами, чтобы определить их k-среднее значение, которое играет роль показателя разницы между прототипом и текущей точкой данных. Точки данных с более высоким k-средним находятся ближе к прототипу, образуя кластер. Кластеризация K-средних может обнаруживать аномалии, отмечая точки, которые не соответствуют ни одной из установленных категорий. Это подходит для сценариев, когда есть немаркированные данные из множества различных типов, которые нужно организовать по аналогии с изученными прототипами.
Есть и другие более сложные алгоритмы для неконтролируемого обнаружения аномалий и работы с многомерными наборами данных. Например, гауссовский как альтернативная версия алгоритма K-средних с распределением Гаусса вместо стандартного отклонения. А байесовский использует байесовское понимание вероятности для обнаружения аномалий. Также для обнаружения аномалий могут применяться автоэнкодеры - нейросети, создающие закодированные правила для ожидаемого вывода в зависимости от входного значения. То, что выходит за рамки этих повторяющихся значений, считается аномалией и хорошо подходит для задач их обнаружения в размерности.
🏂Почему все GAN-сети работают одинаково, и зачем настраивать гиперпараметры
Генеративные состязательные сети, представляют собой структуру, способную изучать распределение на основе конкуренции между генератором и дискриминатором. Генератор учится генерировать образцы, неотличимые от реальных данных, а дискриминатор учится классифицировать, является ли данное изображение реальным или поддельным. Сегодня GAN-сети считаются мощным инструментом и активно используются в задачах генерации и реконструкции текстов, изображений и пр. При том, что есть множество разных архитектур и видов GAN-сетей, при достаточном гиперпараметрическом поиске почти все алгоритмы имеют случайные ранги, и даже самые последние работы работают аналогично оригинальной GAN, впервые предложенной Яном Гудфеллоу. Бенчмаркинговое сравнение различных GAN-сетей показало, что алгоритмические различия не так актуальны, а вот поиск по гиперпараметрам имеет большее влияние на результат. Однако, оптимальные гиперпараметры во многом зависят от набора данных и настройка гиперпараметров – одна из самых интересных и тонких задач ML-специалиста.
https://medium.com/codex/do-all-gans-perform-the-same-cc02055091af
💥ТОП-5 полезных Python-инструментов для дата-инженера и веб-разработчика
Requests – простая в использовании HTTP-библиотека для Python, которая позволяет делать запросы и взаимодействовать с API https://docs.python-requests.org/en/master/
Advanced Python Scheduler (APScheduler) – библиотека для отложенного выполнения Python-кода однократно или с периодическим повтором. При сохранении заданий в базе данных, сохранятся также их состояния и перезапуск планировщика. Также APScheduler можно использовать как кроссплатформенную замену для конкретных приложений планировщикам для конкретных платформ, таким как cron-демон или планировщик задач Windows. Однако, APScheduler не является демоном или сервисом, а потому не поставляется с инструментами командной строки, а предназначен для запуска внутри существующих приложений. Эта библиотека предоставляет некоторые готовые блоки для создания службы планировщика или для запуска его в отдельном процессе. https://apscheduler.readthedocs.io/en/stable/userguide.html
Watchdog – модуль для отслеживания событий файловой системы через Python API и служебные программы shell-оболочки https://pypi.org/project/watchdog/
Twilio – библиотека для автоматизации отправки текстовых сообщений и телефонных звонков. Очень удобно для автоматического мониторинга событий на сторонних сайтах, например, оперативного отслеживания скидок на нужные товары или появления новых продуктов https://pypi.org/project/twilio/
Random User Agent – библиотека для добавления в запросы случайных пользовательских агентов, что полезно при веб-парсинге данных или отправке большого количества запросов https://pypi.org/project/random-user-agent/
✈️ML-прогнозы в реальном времени с Vertex AI от Google
Одна из самых больших проблем при обслуживании ML-моделей - это предоставление прогнозов в режиме, близком к реальному времени. Некоторые бизнес-сценарии особенно чувствительны к временной задержке. Например, рекомендательные системы для пользователей интернет-магазина, оценка время доставки продуктов для фудтех-компаний и пр. 25 августа 2021 года Google объявила о возможности прямого взаимодействия с Vertex AI – своей объединеной ML-платформой через частные endpoint’ы. Vertex AI позволяет быстро подключить обученную и протестированную ML-модель к рабочему приложению, загрузить на специально подготовленный сервер в Google Cloud или экспортировать в нужный формат.
Vertex Predictions - это бессерверный способ обслуживания ML-моделей, которые можно разместить в облаке и делать прогнозы через REST API. При онлайн-прогнозах необходимо развернуть модель на конечной точке, что свяжет ее с физическими вычислительными ресурсами и позволит делать вычисления практически в реальном времени. С помощью VPC Peering можно настроить частное соединение для обращения к конечной точке. При этом пользовательские данные не будут проходить через общедоступный Интернет, что снижает задержку онлайн-прогнозов и повышает безопасность.
https://cloud.google.com/blog/products/ai-machine-learning/creating-a-private-endpoint-on-vertex-ai
🏂🏸Состязательные атаки для уточнения прогнозов молекулярной энергии
Исследователи из MIT нашли новый способ количественной оценки неопределенности молекулярных энергий с помощью нейросетей. Нейросети часто используются для прогнозирования новых материалов, скорости и выхода химических реакций, работая на порядки быстрее, чем традиционные методы, такие как квантово-механическое моделирование. Но полученные результаты могут быть ненадежными, поскольку ML-модели интерполируют, возможен сбой при их применении на рабочих данных вне обучающего датасета. Это особенно верно для предсказания «поверхностей потенциальной энергии» (ППЭ) или карты энергии молекулы во всех ее конфигурациях. Для решения этих проблем ученые предложили выделить безопасные зоны нейросети с помощью состязательных атак. Фактическое моделирование выполняется только для небольшой части молекул, а данные передаются в нейронную сеть, которая учится предсказывать те же свойства для остальных молекул. Эти методы были успешно протестированы на новых материалах, включая катализаторы для производства водорода из воды, более дешевые полимерные электролиты для электромобилей, магниты и пр. Однако, точность нейросетей зависит от корректности обучающих данных, а неверные прогнозы могут иметь катастрофические последствия.
Один из способов узнать неопределенность модели - прогнать одни и те же данные через несколько ее версий. Для этого у исследователей было несколько нейронных сетей, предсказывающих поверхность потенциальной энергии на основе одних и тех же данных. Если сеть уверена в предсказании, разница между выходными сигналами разных сетей минимальна, и поверхности в большей степени сходятся. Иначе прогнозы различных моделей сильно различаются, производя ряд выходных данных, любой из которых может быть правильной поверхностью.
Разброс прогнозов представляет собой неопределенность в конкретной точке. ML-модель должна указывать не только на лучший прогноз, но и на неопределенность каждого из них. Однако, каждая симуляция может занять от десятков до тысяч процессорных часов. А чтобы получить значимые результаты, необходимо запустить несколько моделей в достаточном количестве точек.
Поэтому новый подход отбирает только точки данных из областей с низкой достоверностью прогнозов, соответствующих определенной геометрии молекулы. Затем эти молекулы немного изменяются, чтобы повысить неопределенность. Дополнительные данные вычисляются для этих молекул посредством моделирования, а затем добавляются в исходный обучающий пул. Нейронные сети снова обучаются, и вычисляется новый набор неопределенностей. Этот процесс повторяется до тех пор, пока неопределенность, связанная с различными точками на поверхности, не станет четко определенной и не может быть уменьшена в дальнейшем.
Предлагаемый подход был протестирован на цеолитах - кавернозных кристаллах, которые действуют как молекулярные сита с высокой избирательностью формы и используются в катализе, разделении газов и ионном обмене. Моделирование больших структур цеолита очень дорого, исследователи показывают, как их метод может обеспечить значительную экономию при компьютерном моделировании. Но состязательный подход для переобучения нейронных сетей значительно повышает производительность без существенных вычислительных затрат.
https://news.mit.edu/2021/using-adversarial-attacks-refine-molecular-energy-predictions-0901
Forwarded from Data Science Jobs
16 сентября, Чт
Конференция по Machine Learning in production

Через неделю @selectelnews соберет сообщество специалистов, которых интересует все новое в сферах ML и AI, чтобы поговорить про MLOps-платформы, применение ML в работе технической поддержки, жизненный цикл моделей машинного обучения и другие направления.

В программе:
— Управление жизненным циклом моделей машинного обучения — возможности Polymatica ML
— От данных к модели: ML-платформа и ее эксплуатация с точки зрения DevOps
— Поддержка VK: как оставаться поддержкой с человеческим лицом, внедряя ML

Дата: 16 сентября в 10:30 МСК
Место проведения: online и offline (офис Selectel, Санкт-Петербург, ул. Цветочная, 19)

Регистрируйтесь бесплатно по ссылке: https://slc.tl/NNpkU
🕸Автоматизация веб-скрепинга: 3 популярных инструмента
Хотите отслеживать цены в интернет-магазине или автоматизировать заказ еды в ресторане? Попробуйте следующие средства:
Selenium – известный фреймворк для автоматизации тестирования, который можно использовать его имитации пользовательского поведения и выполнения действий на веб-сайтах, таких как заполнение форм, нажатие кнопок и пр. https://selenium-python.readthedocs.io/
Beautiful Soup – Python-пакет для анализа HTML- и XML-документов. Создает дерево синтаксического анализа, которое можно использовать для извлечения данных при парсинге веб-страниц. Очень хорош для простых проектов. https://pypi.org/project/beautifulsoup4/
Scrapy – быстрый высокоуровневый фреймворк для сканирования и сканирования веб-сайтов, используемый для извлечения структурированных данных с целью их интеллектуального анализа, мониторинга и автоматического тестирования. Он отлично подходит для сложных проектов и значительно быстрее вышеуказанных аналогов. https://docs.scrapy.org/en/latest/
😎Нужно разработать приложение распознавания эмоций по видео в реальном времени?
Используйте Face Recognition API! Open-source проект для распознавания лиц и управления ими из Python или командной строки. ML-модель создана с помощью DL-алгоритма распознавания лиц и имеет точность 99,38% в тесте Labeled Faces in the Wild.
С Face Recognition API разработка приложения состоит из 5 шагов:
• прием видео в реальном времени
• применение Python-функций готового API для обнаружения лиц и эмоций на объектах в видеопотоке;
• классификация эмоций по категориям;
• построение рекомендательной системы;
• сборка приложения и развертывание на Heroku, Dash или веб-сервере.
https://github.com/ageitgey/face_recognition