Big Data Science [RU]
1.62K subscribers
78 photos
9 videos
543 links
Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏https://t.me/bdscience — Big Data Science channel (english version)
💼https://t.me/bds_job — channel about Data Science jobs and career
Download Telegram
​​Всем привет, Дата Фест продолжается!
Ждем всех в четверг (начало в 19:00) на нашем митапе.

🗓 10 июня ЧТ.
@MLinMarketing

=============

🔸19:00 - 20:00 (msk)

Алексей Чернобровов, Ph.D., Data science consultant at chernobrovov.com

тема:
Автоматизация построения Customer Journey Map с помощью Data Science

описание:
Из доклада вы узнаете, что такое модели пользовательского взаимодействия в том числе и Customer Journey Map. Затем мы поговорим о том, как автоматизировать Customer Journey Map с помощью современных методов Data Science. Обсудим, когда это делать и когда не нужно. И закончим рассмотрением кейсов.

🔸20:00 - 21:00 (msk)

Михаил Печатов, Data Scientist at Тинькофф

тема:
Как мы научились предсказывать следующую покупку клиента. Персонализация контента на сайте/в приложении.

описание:
В докладе я расскажу о том, как мы решали задачу предсказания следующей покупки. Обсудим, откуда возникла такая задача в банке, какие подходы мы использовали, с какими проблемами столкнулись и какие результаты получили.

==============

Ссылка для входа (https://live.ods.ai/) (пароль от спейса на странице регистрации (https://ods.ai/events/datafest2021) доступен всем, кто прошел регистрацию).
🙌🏻Математика для Data Scientist’а, часть 1: Закон Бенфорда
Закон Бенфорда (Ньюкома-Бенфорда) - закон первой цифры описывает вероятность появления определённой первой значащей цифры в распределениях величин, взятых из реальной жизни. Этот математический закон верен для многих распределений, позволяет предсказать частоту встречаемости второй и третьей цифры в наборе данных.
Впервые этот закон обнаружил американский астроном Саймон Ньюком в 1881 году, анализируя степень изношенности книжных страниц. А в 1938 году физик Фрэнк Бенфорд сделала подобные выводы по результатам анализа таблиц о характеристиках рек, химических соединений и номеров домов в городском справочнике. Анализ чисел показал, что единица является первой значащей цифрой с вероятностью не 1/9, как кажется на первый взгляд, а около 1/3.
Закон Бенфорда применим ко множествам чисел, которые могут расти экспоненциально, т.е. темп роста величины пропорционален её текущему значению, например, остатки товаров на складах, цены на акции, численность населения, длина рек, площади стран.
Набор чисел удовлетворяет закону Бенфорда, если в уравнении встречается первая цифра d (𝑑∈1,…, 9). С помощью этого распределения можно предсказать, какая цифра встречается чаще всего в наборе данных. Закон обычно не действует для распределений с заданными минимальными или максимальными значениями, а также тех, которые охватывают только один или два порядка величин. Также закон Бенфорда не применим ко множеству букв. Объём выборки для закона первой цифры должен быть достаточен для применения статистических методов. На практике закон первой цифры применяется в приложениях обнаружения мошенничества в налоговых формах, результатах выборов, экономических показателях и данных бухгалтерского учета.
💃🏼🕺🏼Умная одежда – новая мода ближайших лет: цифровая ML-ткань от исследователей MIT с памятью, датчиками температуры и обученной нейросетью
Сотрудники MIT создали первое волокно с цифровыми возможностями, которое может определять, хранить, анализировать и определять физическую активность после того, как оно зашито в рубашку. Цифровые волокна расширяют возможности тканей по выявлению скрытых структур в человеческом теле, которые можно использовать для мониторинга физической работоспособности, медицинских заключений и раннего обнаружения заболеваний, а также сохранения впечатлений. Например, запомнить свадебную музыку в платье, которое было на вас в тот день.
До сих пор электронные волокна были аналоговыми, передающими непрерывный электрический сигнал, а не цифровыми. Это первая реализация структуры с возможностью хранения и обработки данные в цифровом виде позволяет добавлять новое измерение информационного содержания к текстилю, чтобы программировать ткани.
Новое волокно было создано путем помещения сотен квадратных кремниевых микрочипов цифровых микросхем в преформу, которая затем использовалась для создания полимерного волокна. Точно контролируя поток полимера, исследователи смогли создать волокно с непрерывным электрическим соединением между чипами на протяжении десятков метров.
Само волокно тонкое и гибкое, его можно пропускать через иглу, вшивать в ткань и стирать не менее 10 раз без разрушения, а также оно совсем не ощущается. Благодаря методу цифровой адресации, можно включить функциональность одного элемента, не затрагивая остальные элементы. Цифровое волокно также может хранить в памяти большой объем информации. Исследователи смогли записывать, хранить и считывать информацию о волокне, включая 767-килобитный полноцветный короткий видеофайл и 0,48-мегабайтный музыкальный файл. Файлы можно хранить в течение двух месяцев без питания.
Волокно включает в память ткани нейросеть из 1650 соединений, которая может обучаться данным в режиме реального времени прямо на человеке, анализируя информацию о температуре тела с учетом физических нагрузок. Благодаря этому в будущем одежда сможет обнаруживать и предупреждать людей в реальном времени об изменениях показателей здоровья (частота дыхания и сердцебиения) и передавать данные об активации мышц спортсменам во время тренировок. Сейчас умная ткань управляется небольшим внешним устройством, а в перспективе планируется разработать новый чип в качестве микроконтроллера, подключенного к самому волокну.
https://news.mit.edu/2021/programmable-fiber-0603
🧞‍♂️ВИДЕО с DataFest’21

@MLinMarketing

📋 Тема: Автоматизация построения Customer Journey Map с помощью Data Science

📋 Описание: Из доклада вы узнаете, что такое модели пользовательского взаимодействия в том числе и Customer Journey Map. Затем мы поговорим о том, как автоматизировать Customer Journey Map с помощью современных методов Data Science. Обсудим, когда это делать и когда не нужно. И закончим рассмотрением кейсов.

🎤 Спикер: Алексей Чернобровов, Data science consultant at chernobrovov.com

🎬 Видео

📥 Презентация
👀Cоздать собственный Deep Fake без долгого обучения нейросетей? Легко!
4 бесплатных сервиса:
- https://reface.app/
- https://avatarify.ai/
- https://www.wombo.ai/
- https://www.myheritage.com/deep-nostalgia?lang=RU
Достаточно просто загрузить фотографию или сделать селфи с мобильного телефона, чтобы получить правдоподобное видео с лицом другого человека. Например, MyHeritage, генеалогический веб-сайт, позволяет «оживить» давно ушедших родственников, генерируя мини-видео, на котором они смотрят и улыбаются. Однако, помните, что генерация фальшивок с целью скомпрометировать кого-то может рассматриваться как клевета и преследуется по закону!👆🏻
🥁ML Space от SberCloud стал призером премии IT World Awards 2021
Облачная платформа ML Space от SberCloud (Сбер) признана лучшим Data Science и AI продуктом в мире по версии организаторов международной премии IT World Awards 2021, организации Globee Awards. ML Space является мощным MLOps-инструментом для Data Scientist’ов, поддерживающая все процессы цикла разработки ML-моделей, включающий тестирование и развертывание. В платформу интегрированы все нужные фреймворки и библиотеки, которые позволяют ускорить, оптимизировать и упростить процессы создания ML-продуктов.
https://globeeawards.com/it-world-awards/winners/
🤣Общение с фото- и видео-ботами: исследование, как люди отражают эмоции виртуальных собеседников, доверяя их внешности и эмоциям. Выводы ученых удивят вас: зеркалирование – совсем не показатель приятной беседы, а индикатор сложности в понимании оппонента. https://techxplore.com/news/2021-06-features-virtual-agents-affect-humans.html
🎂Подводим итоги ДатаФеста https://datafest.ru/2021/, который состоялся в 2021 году в виде месячного онлайн-марафона с 22 мая по 19 июня. ТОП-10 лучших докладов из разных треков:
1. Никита Минаев: Применение моделей look-alike в X5 Retail Group – анализ данных о покупках в магазинах «Пятерочка» и использование результатов в маркетинговых коммуникациях https://www.youtube.com/watch?v=t-Ju3fbinJ8&list=PLTlO6nV_TaGCFj1Y-f7Qb5MCm8oq256iR&index=123
2. Алексей Чернобровов: Автоматизация построения Customer Journey Map с помощью Data Science https://www.youtube.com/watch?v=O8Vp9777EqE
3. Михаил Печатов из Тинькофф-банка: Как мы научились предсказывать следующую покупку клиента. Персонализация контента на сайте/в приложении https://www.youtube.com/watch?v=7dCf9s4ZAv8&list=PLTlO6nV_TaGCFj1Y-f7Qb5MCm8oq256iR&index=126
4. Всеволод Светлов из Яндекса: Трансформерные модели для поисковой персонализации https://www.youtube.com/watch?v=yzV5ZQB850s&list=PLTlO6nV_TaGCFj1Y-f7Qb5MCm8oq256iR&index=87
5. Александр Мамаев: Россети и Mail.ru в поисках чёрных майнеров” – https://www.youtube.com/watch?v=00UUnC3l9Jg&list=PLTlO6nV_TaGCFj1Y-f7Qb5MCm8oq256iR&index=85
6. Марина Чижкова из Яндекса: Как поиск аномалий, нейронки и кластеризация помогают антифроду https://www.youtube.com/watch?v=aBckDgtG0Zs&list=PLTlO6nV_TaGCFj1Y-f7Qb5MCm8oq256iR&index=99
7. Фёдор Жданов: Как управление Data Science строится в западных технологических компаниях https://www.youtube.com/watch?v=Wz9JSDejldQ&list=PLTlO6nV_TaGCFj1Y-f7Qb5MCm8oq256iR&index=120
8. Юлия Антохина из МТС: Тренды REProducible ML https://www.youtube.com/watch?v=VfcU7gpGmXM&list=PLTlO6nV_TaGCFj1Y-f7Qb5MCm8oq256iR&index=111
9. Екатерина Кондратьева: Нейронные сети на снимках МРТ мозга - https://www.youtube.com/watch?v=YPxSKYkQpIQ&list=PLTlO6nV_TaGCFj1Y-f7Qb5MCm8oq256iR&index=113
10. Евгений Макаров из X5 Retail Group: Как нанять Junior Data Scientist https://www.youtube.com/watch?v=gquvRzQ7Vlc&list=PLTlO6nV_TaGCFj1Y-f7Qb5MCm8oq256iR&index=52
🎯Математика для Data Scientist’а, часть 2: Закон Ципфа
Эта эмпирическая закономерность распределения частоты слов естественного языка часто используется в количественной лингвистике и NLP-задачах. Закон Ципфа гласит: если все слова в большом тексте упорядочить по убыванию частоты их использования, то частота n-го слова в этом списке будет обратно пропорциональна его порядковому номеру n (рангу). Например, второе по используемости слово встречается примерно в два раза реже, чем первое, третье — в три раза реже, чем первое, и т.д.
Впервые закономерность была открыта французским стенографистом Жан-Батистом Эсту в 1908 году. На практике закон был применён для описания распределения размеров городов немецким физиком Феликсом Ауэрбахом в 1913 году. А американский лингвист Джордж Ципф в 1949 году активно популяризировал эту закономерность, предложив использовать её для описания распределения экономических сил и социального статуса: самый богатый человек имеет вдвое больше денег, чем следующий богач, и т.д. Объяснение закона Ципфа на основе корреляционных свойств аддитивных марковских цепей (со ступенчатой функцией памяти) дано в 2005 году. Математически закон Ципфа описывается распределением Парето (всем известный принцип 80 на 20).
Разные области применения закона (не только лингвистика) объяснены американским специалистом по биоинформатике Вэньтянь Ли, который доказал, что случайная последовательность символов также подчиняется этому закону Ципфа. Ли утверждает, что закон Ципфа - статистический феномен, который не имеет отношения к семантике текста, а вероятность случайного появления какого-либо слова длиной n в цепочке случайных символов уменьшается с ростом n в той же пропорции, в какой растёт ранг этого слова в частотном списке (порядковой шкале). Потому произведение ранга слова на его частоту есть константа.
😜На работу – с улыбкой!
Пропускные биометрические системы от корпорации Canon пускают в китайские офисы и на другие рабочие территории только тех сотрудников, которые улыбаются: в модуль распознавания лиц в видеокамерах на проходной встроена функция идентификации улыбки. Ожидается, что это поднимет корпоративный дух и уровень лояльности работников)
https://www.theverge.com/2021/6/17/22538160/ai-camera-smile-recognition-office-workers-china-canon
👍🏻Достаточно одного слова: Facebook AI анонсировал новый проект TextStyleBrush, способный копировать стиль рукописного или печатного текста на изображении по одному слову. Это пригодится для изменения и замены текста на фотографиях. В отличие от предыдущих ИИ-системам, способных копировать текст с фотографий, TextStyleBrush может работать со всеми типами каллиграфии и типографики, интерпретируя различные повороты и преобразования текста, от изогнутых символов до естественной деформации бумаги от нажатия ручки. Важно, что Facebook понимает возможность неправомерного применения TextStyleBrush для злонамеренных действий, типа текстовых дипфейков. Чтобы предотвратить такие атаки, соцсеть поделится результатами исследований с набором данных Deepfake Detection Challenge, внося вклад в широкую базу знаний о DL-подделках. https://techxplore.com/news/2021-06-facebook-ai-word-mimic-text.html
💥Будущее ИИ-чипов: длинная история сотрудничества и противоборства AI-гигантов по разработке DS-решений. NVIDIA против Google, перспективы развития глубоких нейросетей и микросхем, а также деньги, котики и интернет. https://www.wired.co.uk/article/nvidia-ai-chips
🦋Июль – время прогулок, жарких встреч с друзьями и новых знакомств! 2-ой месяц лета 2021 предлагает нам много интересных DS-событий и не только в онлайн-режиме:
1 июля в 12.00 МСК – бесплатный онлайн-круглый стол «Данные – магический шар или чуткий радар: Как использовать данные, чтобы предсказывать поведение потребителей?». Спикеры из Oracle, ГК «Просвещение», IDS Borjomi International https://new-retail.ru/webinar/2021-06-30/Dannie-magicheski-shar-ili-chutkii-radar/
1 июля в 18.00 МСК - вебинар «Data Lakehouse: быстрые данные для всех на примерах S7 и Henkel»: как S7 удалось значительно упростить доступ к данным, data discovery и созданию self-service отчётности. Зачем нужен Dremio: от упрощения архитектуры данных до применения в командных проектах для совместной работы. https://oez-innopolis.timepad.ru/event/1685249/
2 июля в 18:00 - Встреча русскоязычных администраторов экосистемы Hadoop. Бесплатный митап для профессионалов на проспекте Андропова, 18 к. 1, офис МТС. Проведите вечер пятницы с единомышленниками, пообщайтесь с коллегами и послушайте доклады ведущих специалистов из МТС, Яндекса, Swisscom https://hadoop-admins.ru/
2 июля – онлайн-конференция «Цифровая трансформация колл-центра» от группы «Просперити Медиа» и портала CFO-Russia.ru – практические кейсы от 10 спикеров из крупных компаний с глубокой DS-экспертизой https://www.cfo-russia.ru/meropriyatiya/callcenter
8 июля – пятый ежегодный международный саммит Machines Can See от компании VisionLabs: опыт ведущих мировых специалистов в сфере компьютерного зрения и машинного обучения, обсуждение технологических трендов и обмена знаниями. Москва, Цветной б-р, дом 15, строение 1 (этаж 7), Omega Rooftop. https://machinescansee.com/
10 июля – AI-Men бесплатная международная онлайн-конференция по Artificial Intelligence, Data Science, Big Data и Machine Learning – спикеры из России, Украины, Беларуси, Израиля и Польши расскажут о новых исследованиях и поделятся практическими кейсами https://ai-men.by/
14-15 июля – онлайн-конференция «Digital Manufacturing Online Conf: на пути к Индустрии 4.0» для руководителей крупнейших предприятий промышленного сектора: опыт построения цифровых фабрик и промышленных производств, основанных на технологии промышленного интернета вещей, искусственного интеллекта, робототехники и когнитивной автоматизации для повышения эффективности промышленных и бизнес процессов предприятия. https://smartgopro.com/manufacturing2021/
23 июля - 6-й ежегодный профессиональный форум скоринговых технологий Scoring Case Forum 2021. Всесторонняя экспертиза современных методов, технологий и возможностей оценки физических лиц и малого и среднего бизнеса в online и offline-каналах. Москва, Центр международной торговли ул. Краснопресненская наб.,12 Офисное здание — 2, Подъезд 7 Конгресс-центр «Ладога», 4 эт. https://scoring-forum.ru/
👁Подготовка к код-ревью, ускорение разработки и тестирования с Copilot для Visual Studio от OpenAI
Пишите быстрее и лучше на Python, JavaScript, TypeScript, Ruby, Go и десятке других языков. Copilot работает на Codex, новой ИИ-системе от OpenAI и понимает больше контекста, чем IDE- помощников. Cтрока документации, комментарий, имя функции или сам код, Copilot использует контекст и синтезирует нужные инструкции, помогая разработчику создавать качественный продукт. https://copilot.github.com/
🏸Теория игр как движок крупномасштабного анализа данных
Новый взгляд на анализ главных компонентов как на соревновательную игру, где каждый приближенный собственный вектор контролируется игроком, цель которого - максимизировать свою собственную функцию полезности. Как мультиагентная перспектива позволила разработать новые идеи и алгоритмы с эффективным использованием новейших вычислительных ресурсов, глобально масштабируя наборы данных. Краткий обзор https://deepmind.com/blog/article/EigenGame и подробная статья https://openreview.net/forum?id=NzTU59SYbNq
Как искусственный интеллект помог в транспортировке доставки вакцины от COVID-19? Как и любые другие скоропортящиеся вакцины, вакцины для коронавируса портятся, если становятся слишком теплыми или слишком холодными. Для преодоления логистических трудностей распространения вакцины компания Pfizer разработала специальную транспортную коробку пригодную для 5000 доз вакцин, заполненную сухим льдом и снабженную GPS-трекерами. Skymind, первый в мире специализированный разработчик экосистемы искусственного интеллекта, разработал сверхнизкую технологию AIoT, которая позволяет контролировать температуру вакцины на протяжении всего пути доставки с помощью технологии Bluetooth intelligent mesh. Небольшое устройство помещается в коробку рядом с вакциной и отслеживает температуру, влажность и местоположение контрольно-пропускного пункта на протяжении всего путешествия. Устройство может делиться температурой и передавать ее на любой ноутбук или мобильный телефон, если у него есть Bluetooth. https://artificialintelligence-news.com/2021/06/28/how-ai-has-helped-in-the-transportation-of-vaccine-delivery-for-covid-19/
🥁NetHack Challenge на NeurIPS 2021 от Facebook: open-source проект для обучения с подкреплением в игровой форме
Многие успехи в области обучения с подкреплением (RL, Reinforcement Learning) были достигнуты благодаря имитационным средам в таких играх, как Dota 2, Minecraft и StarCraft II. Но это требует большого объема вычислений на тысячах графических процессоров одновременно только для одного эксперимента. Чтобы снизить стоимость RL-моделирования, Facebook в 2020 году инициировал разработку open-source проекта NetHack Learning Environment. А в 2021 году Facebook объявил о конкурсе NeurIPS 2021 в рамках NetHack Challenge совместно с краудсорсинговой ИИ-организацией AIcrowd. Конкурс длится с начала июня по 15 октября 2021 года, а победители будут объявлены на NeurIPS в декабре.
Интересно, что сама игра NetHack существует с 1980-х годов. Она визуально проста и полностью бесплатна, но на порядок сложнее StarCraft II: из-за очень запутанного взаимодействия игроков со своей средой и связанными объектами, пользователям приходится мыслить нестандартно или обращаться к NetHack Wiki. А главная трудность NetHack в том, что после смерти персонажа игровая сессия этого игрока заканчивается. Поэтому в рамках этой RL-среды исследователи надеются найти новые способы управления агентами, чтобы в будущем ИИ мог мыслить творчески в сложных ситуациях, помогая людям. Поскольку NetHack работает на терминале, игроки могут быстро моделировать игровой процесс, обучая миллиарды агентов в день лишь на 2-х графических процессорах. Так NetHack Challenge тестирует новейшие ИИ-методы в сложной среде без огромных мощностей суперкомпьютера. https://techxplore.com/news/2021-06-facebook-nethack-neurips.html
🕸Что такое крупномасштабные сверточные нейросети на основе графов (GCN, large-scale graph convolutional networks) и чем они хороши
Читайте обзор недавно предложенной распределенной обучающей структуры для крупномасштабных сверточных сетей на основе графов. Это называется обучением подсетей, не зависящих от графа (GIST, graph independent subnetwork training). GIST ускоряет процесс обучения GCN для любой архитектуры и может использоваться для обучения крупномасштабных моделей, которые превышают возможности одного графического процессора. Машинное обучение на графах полезно, когда данные невозможно представить в евклидовом пространстве. Кроме того, графы – это интуитивно понятная структура данных в социальных сетях, химии, биологии и других прикладных областях, где объекты связаны друг с другом. (т.е. узлы графа - это люди, а ребра - социальные связи) или химия (т.е. узлы графа представляют атомы, а ребра представляют химические связи). GCN реализует обобщение операции свертки для графов, но большинство моделей GCN ограничены по размеру из-за проблемы чрезмерного сглаживания в более глубоких сетях. Подход GIST стремится сократить этот разрыв между возможностями GCN и масштабами глубокого обучения, обучая часть GCN, что гораздо быстрее и эффективнее по сравнению с тренировкой всей большой модели. https://towardsdatascience.com/effortless-distributed-training-of-ultra-wide-gcns-6e9873f58a50
👍1
✍🏻Нужен быстрый рерайт? Попробуйте NLPAug!
NLPAug – Python-библиотека, позволяющая повышать эффективность нейросетей в NLP-задачах без изменения их архитектуры и тонкой настройки. С ней можно синтезировать новый текст на основе имеющихся данных, заменив некоторые слова синонимами, в т.ч. по принципу косинусного сходства в векторных представлениях аналогично word2vec или GloVe. Также NLPAug выполняет замену слов на основе контекста с использованием трансформеров в виде BERT-сетей и делает двойной перевод текста на другой язык и обратно. https://github.com/makcedward/nlpaug
☀️ML для агрономов: предсказание солнечной радиации
С точки зрения практической агрономии, точная оценка солнечной радиации жизненно важна, т.к. это ключевой фактор в развитии сельскохозяйственных культур. Большинство существующих метеорологических станций по всему миру имеют датчики температуры и дождя, но очень немногие измеряют солнечную радиацию. Обычно измерение солнечной радиации обходится очень дорого из-за сложных датчиков (пиранометров и радиометров) и нехватки надежных данных. Поэтому группа исследователей из Университета Кордовы разработала ML-модели для прогнозирования солнечной радиации на юге Испании и в США.
Созданные ML-модели базируются не только на фактических измерениях, а обогащены данными о геоклиматических условиях местности (засушливость, расстояние до моря, высота и др). Для оценки суточной солнечной радиации предложенным нейросетевым алгоритмам из текущих данных нужна только информация о температуре воздуха, что обходится сравнительно дешево благодаря недорогим сенсорам и технологиям IoT. Для оптимизации гиперпараметров используются байесовские алгоритмы, а сами модели могут быть адаптированы к любой местности, в зависимости от ее засушливости. https://techxplore.com/news/2021-07-machine-based-thermal-solar.html