☀️Февраль 2021 богат на множество DS-событий, из которых мы отобрали для вас самые интересные. Выбирайте онлайн или офлайн-митап, конференцию, хакатон и участвуйте!💥
• 03-05.02.21 - OpenTalks.AI – ведущая независимая открытая ИИ-конференция в России. Лучшие российские докладчики со всех топовых международных конференций по ML/DL на одной площадке. 3 дня, 4 трека: Natural Language Processing, Computer vision, Predictive analytics, Reinforcement learning & AGI. Москва https://opentalks.ai/
• 03-05.02.21 - кейс-баттл Youngtech в рамках форума Effie TECH по технологиям в маркетинге для студентов последних курсов любого ВУЗа, которые хотят построить карьеру в сфере технологий, инноваций и big data. Решаем реальные бизнес-кейсы партнеров форума онлайн http://youngtech.tilda.ws/
• 03.02.21 в 19:00 МСК - Data Denormalization - онлайн-митап от Health Samurai, разработчика web и mobile решений для здравоохранения (облачные системы для клиник, электронные медкарты, аналитика медицинских данных, телемедицина). Поговорим, что такое денормализация данных, зачем это нужно и как оно реализуется. Ссылка в Zoom & Youtube-трансляцию придет после регистрации https://health-samurai.timepad.ru/event/1537686/
• 04.02.21 в 17:00 МСК - Вебинар "Разворачиваем приложение на Apache Spark в Kubernetes. Пошаговый рецепт" от Mail.ru Cloud Solutions. Все DevOps-шаги, от развертывания Kubernetes-кластера в облаке MCS до сборки Docker-образа со Spark-приложением. https://events.webinar.ru/mcs/spark
• 10.02.21 – 01.04.21 – серия открытых вебинаров от Intel CV Academy по компьютерному зрению, глубокому обучению и оптимизации производительности алгоритмов https://jsc-intel.timepad.ru/event/1446273
• 11.02.21 в 16:00 МСК – вебинар «Новое в Yandex DataSphere для ML-разработки» - узнайте, как как получить доступ к режиму Early Access Version, попробовать новые функции, использовать индикацию загрузки памяти и CPU, TensorBoard и новые фоновые операции https://cloud.yandex.ru/events/301
• 12.02.21 в 11:00 МСК – Forum.Digital Telecom 2021 - отраслевой цифровой онлайн-форум при участии государства, бизнеса и стартапов для глобальной перезагрузки и пересмотра трендов цифровизации сферы телекоммуникаций https://forum.digital/telecom
• 17-18.02.21 в 10:00 МСК - DIGITAL OIL&GAS Online Conf: Цифровая трансформация нефтегазового сектора. Практические кейсы нефтегазовых лидеров из России, СНГ, Европы и Азии про применение перспективных решений для нефтегазовой отрасли на основе технологий IIoT, ИИ, Big Data и предиктивной аналитики, цифровых двойников, 3D, AR|VR, робототехники, дронов и пр. технологий https://smartgopro.com/digitaloilgas/
• 18.02.21 в 09:30 МСК – Конференция «Качество Данных» для руководителей и DS-специалистов пройдет в Москве офлайн https://www.osp.ru/lp/dataquality2021
• 25.02.21 в 09:00 МСК – «Ликбез по использованию данных» - единственная в России конференция по вопросам эффективного использования данных от компании OSP (Открытые системы) пройдет в Москве офлайн https://www.osp.ru/lp/dataquality2021
• 03-05.02.21 - OpenTalks.AI – ведущая независимая открытая ИИ-конференция в России. Лучшие российские докладчики со всех топовых международных конференций по ML/DL на одной площадке. 3 дня, 4 трека: Natural Language Processing, Computer vision, Predictive analytics, Reinforcement learning & AGI. Москва https://opentalks.ai/
• 03-05.02.21 - кейс-баттл Youngtech в рамках форума Effie TECH по технологиям в маркетинге для студентов последних курсов любого ВУЗа, которые хотят построить карьеру в сфере технологий, инноваций и big data. Решаем реальные бизнес-кейсы партнеров форума онлайн http://youngtech.tilda.ws/
• 03.02.21 в 19:00 МСК - Data Denormalization - онлайн-митап от Health Samurai, разработчика web и mobile решений для здравоохранения (облачные системы для клиник, электронные медкарты, аналитика медицинских данных, телемедицина). Поговорим, что такое денормализация данных, зачем это нужно и как оно реализуется. Ссылка в Zoom & Youtube-трансляцию придет после регистрации https://health-samurai.timepad.ru/event/1537686/
• 04.02.21 в 17:00 МСК - Вебинар "Разворачиваем приложение на Apache Spark в Kubernetes. Пошаговый рецепт" от Mail.ru Cloud Solutions. Все DevOps-шаги, от развертывания Kubernetes-кластера в облаке MCS до сборки Docker-образа со Spark-приложением. https://events.webinar.ru/mcs/spark
• 10.02.21 – 01.04.21 – серия открытых вебинаров от Intel CV Academy по компьютерному зрению, глубокому обучению и оптимизации производительности алгоритмов https://jsc-intel.timepad.ru/event/1446273
• 11.02.21 в 16:00 МСК – вебинар «Новое в Yandex DataSphere для ML-разработки» - узнайте, как как получить доступ к режиму Early Access Version, попробовать новые функции, использовать индикацию загрузки памяти и CPU, TensorBoard и новые фоновые операции https://cloud.yandex.ru/events/301
• 12.02.21 в 11:00 МСК – Forum.Digital Telecom 2021 - отраслевой цифровой онлайн-форум при участии государства, бизнеса и стартапов для глобальной перезагрузки и пересмотра трендов цифровизации сферы телекоммуникаций https://forum.digital/telecom
• 17-18.02.21 в 10:00 МСК - DIGITAL OIL&GAS Online Conf: Цифровая трансформация нефтегазового сектора. Практические кейсы нефтегазовых лидеров из России, СНГ, Европы и Азии про применение перспективных решений для нефтегазовой отрасли на основе технологий IIoT, ИИ, Big Data и предиктивной аналитики, цифровых двойников, 3D, AR|VR, робототехники, дронов и пр. технологий https://smartgopro.com/digitaloilgas/
• 18.02.21 в 09:30 МСК – Конференция «Качество Данных» для руководителей и DS-специалистов пройдет в Москве офлайн https://www.osp.ru/lp/dataquality2021
• 25.02.21 в 09:00 МСК – «Ликбез по использованию данных» - единственная в России конференция по вопросам эффективного использования данных от компании OSP (Открытые системы) пройдет в Москве офлайн https://www.osp.ru/lp/dataquality2021
opentalks.ai
OpenTalks.AI: 19-20 February 2026
Open Conference on Artificial Intelligence in Belgrade, Serbia, February 19-20, 2026
💐В марте 2021 нас ждут интересные события: митапы, конференции, хакатоны и другие познавательные мероприятия для DS-любителей и профессионалов, большинство из которых пройдет онлайн и абсолютно бесплатно по предварительной регистрации. Выбирайте свой ивент и участвуйте!
02 марта - Cloud Day от Яндекса для сферы образования: узнайте, как технологии Yandex.Cloud помогают образовательным учреждениям решать задачи цифровой трансформации. Особенно выделим доклад Алёны Дробышевской «Сервисы Yandex.Cloud для ML-разработчиков» о Yandex DataSphere, который объединяет наиболее востребованные инструменты и динамически масштабируемые ресурсы для анализа данных, разработки и эксплуатации моделей машинного обучения. Начало в 20:00 по МСК онлайн https://cloud.yandex.ru/events/304
06 марта - День открытых данных от Ассоциации участников рынка данных в рамках международной инициативы International Open Data Day: лекции, дискуссии, мастер-классы и вручение премии Moscow Dataviz Awards за проекты на основе открытых данных. Начало в 11:00 по МСК онлайн https://opendataday.ru/msk
18-19 марта – финал профессионального конкурса "ПРОФ-IT.Инновация" по новым решениям в области цифровизации, которые могут быть использованы в государственном и муниципальном управлении, способствуют достижению цифровой зрелости ключевых отраслей экономики и социальной сферы. Начало в 10:00 по МСК онлайн http://digit.d-russia.ru/
19 марта – онлайн-митап от Яндекс.Дзен по стратегиям ценообразования, рекомендательным методам и алгоритмам: примеры и бизнес-кейсы, а также квест с призами. Начало в 19:30 по МСК онлайн https://events.yandex.ru/events/zen-meetup/19-03-2021
25 марта – ежегодный Форум BIG DATA: data-driven бизнес-проекты, глубокая аналитика как инструмент принятия решений, практическое применения прорывных алгоритмов искусственного интеллекта. Вас ждет встреча с топ-менеджерами цифровой трансформации и ведущими DS/ML-экспертами из госуправления и коммерческих компаний. Москва, EVENT-холл ИнфоПространство (1-й Зачатьевский пер., д. 4) и онлайн-трансляция https://www.osp.ru/lp/bigdata2021
30-31 марта - Data Fusion - международная конференция и финал соревнования по синергии межотраслевых данных и качественно новым модельным подходам к их монетизации и объединению. Ведущие игроки бизнеса и научного сообщества обсудят последние DS-решения, которые позволяют обеспечить новый уровень персонализации общения с клиентом. Начало в 15:00 по МСК онлайн https://data-fusion.ru/conference/
02 марта - Cloud Day от Яндекса для сферы образования: узнайте, как технологии Yandex.Cloud помогают образовательным учреждениям решать задачи цифровой трансформации. Особенно выделим доклад Алёны Дробышевской «Сервисы Yandex.Cloud для ML-разработчиков» о Yandex DataSphere, который объединяет наиболее востребованные инструменты и динамически масштабируемые ресурсы для анализа данных, разработки и эксплуатации моделей машинного обучения. Начало в 20:00 по МСК онлайн https://cloud.yandex.ru/events/304
06 марта - День открытых данных от Ассоциации участников рынка данных в рамках международной инициативы International Open Data Day: лекции, дискуссии, мастер-классы и вручение премии Moscow Dataviz Awards за проекты на основе открытых данных. Начало в 11:00 по МСК онлайн https://opendataday.ru/msk
18-19 марта – финал профессионального конкурса "ПРОФ-IT.Инновация" по новым решениям в области цифровизации, которые могут быть использованы в государственном и муниципальном управлении, способствуют достижению цифровой зрелости ключевых отраслей экономики и социальной сферы. Начало в 10:00 по МСК онлайн http://digit.d-russia.ru/
19 марта – онлайн-митап от Яндекс.Дзен по стратегиям ценообразования, рекомендательным методам и алгоритмам: примеры и бизнес-кейсы, а также квест с призами. Начало в 19:30 по МСК онлайн https://events.yandex.ru/events/zen-meetup/19-03-2021
25 марта – ежегодный Форум BIG DATA: data-driven бизнес-проекты, глубокая аналитика как инструмент принятия решений, практическое применения прорывных алгоритмов искусственного интеллекта. Вас ждет встреча с топ-менеджерами цифровой трансформации и ведущими DS/ML-экспертами из госуправления и коммерческих компаний. Москва, EVENT-холл ИнфоПространство (1-й Зачатьевский пер., д. 4) и онлайн-трансляция https://www.osp.ru/lp/bigdata2021
30-31 марта - Data Fusion - международная конференция и финал соревнования по синергии межотраслевых данных и качественно новым модельным подходам к их монетизации и объединению. Ведущие игроки бизнеса и научного сообщества обсудят последние DS-решения, которые позволяют обеспечить новый уровень персонализации общения с клиентом. Начало в 15:00 по МСК онлайн https://data-fusion.ru/conference/
cloud.yandex.ru
Cloud Day для сферы образования
Встречаемся в прямом эфире, чтобы поговорить об опыте использования облачных сервисов в сфере образования.
🌷Третий – не лишний: к LightGBM и XGBoost присоединился еще один ML-алгоритм вероятностного прогнозирования - Natural Gradient Boosting (NGBoost). Выпущенный в 2019 году, NGBoost состоит из трех абстрактных модулей: базового обучающегося, параметрического распределения вероятностей и оценочных правил. Все три компонента рассматриваются как гиперпараметры, выбранные заранее перед обучением. NGBoost упрощает вероятностную регрессию с помощью гибких древовидных моделей и позволяет проводить вероятностную классификацию, возвращая вероятности по каждому классу. Например, логистическая регрессия возвращает вероятности классов в качестве выходных данных. Эксперименты с несколькими наборами данных регрессии доказали, что NGBoost обеспечивает конкурентоспособные прогностические характеристики как оценок неопределенности, так и традиционных показателей. С другой стороны, его время вычисления намного больше, чем у других двух алгоритмов, и нет некоторых полезных опций, например, отсутствует ранний останов, отображение промежуточных результатов, гибкость выбора базового обучающегося параметра, установка случайного начального состояния. Несмотря на то, что пока можно работать лишь с деревом решений и регрессией Риджа, этот ML-алгоритм вероятностного прогнозирования показывает весьма достойные результаты в сравнении с другими популярными градиентными методами.
Подробнее о том, как работает NGBoost, читайте здесь:
http://www.51anomaly.org/pdf/NGBOOST.pdf
https://medium.com/@ODSC/using-the-ngboost-algorithm-8d337b753c58
https://towardsdatascience.com/ngboost-explained-comparison-to-lightgbm-and-xgboost-fda510903e53
https://www.groundai.com/project/ngboost-natural-gradient-boosting-for-probabilistic-prediction/1
Подробнее о том, как работает NGBoost, читайте здесь:
http://www.51anomaly.org/pdf/NGBOOST.pdf
https://medium.com/@ODSC/using-the-ngboost-algorithm-8d337b753c58
https://towardsdatascience.com/ngboost-explained-comparison-to-lightgbm-and-xgboost-fda510903e53
https://www.groundai.com/project/ngboost-natural-gradient-boosting-for-probabilistic-prediction/1
🔥19 марта прошел Яндекс Дзен-митап: алгоритмы и рекомендации. Для тех, кто не смог, по той или иной причине, посмотреть это классное онлайн-мероприятие, оставляем ссылку на видео — https://youtu.be/VDhwkOi5Yvo.
Программа митапа была довольно насыщенная и состояла из следующих тем:
— «Aquarius: рекомендации с ограничениями в Яндекс.Дзен» Борис Шарчилев, Яндекс.Дзен
— «Как многорукие бандиты главную страницу оптимизировали» Турал Гурбанов, ivi
— «Многорукие бандиты в динамическом ценообразовании» Алексей Чернобровов, Консультант по data science
Приятного просмотра, и ставьте пальцы вверх!;)
Программа митапа была довольно насыщенная и состояла из следующих тем:
— «Aquarius: рекомендации с ограничениями в Яндекс.Дзен» Борис Шарчилев, Яндекс.Дзен
— «Как многорукие бандиты главную страницу оптимизировали» Турал Гурбанов, ivi
— «Многорукие бандиты в динамическом ценообразовании» Алексей Чернобровов, Консультант по data science
Приятного просмотра, и ставьте пальцы вверх!;)
YouTube
Дзен-митап: алгоритмы и рекомендации
Чат и вопросы спикерам → https://t.me/zenmeetup
На Дзен-митапе обсудим конкретные кейсы: как в ivi персонализируют главную страницу с помощью многоруких бандитов или как в Дзене создали систему для динамического распределения трафика.
После докладов разыграем…
На Дзен-митапе обсудим конкретные кейсы: как в ivi персонализируют главную страницу с помощью многоруких бандитов или как в Дзене создали систему для динамического распределения трафика.
После докладов разыграем…
🌻Весна в самом разгаре, пора просыпаться от зимней спячки, учиться новому и заводить еще больше друзей в Data Science – встречаемся онлайн и офлайн на митапах, конференциях, форумах и прочих познавательных мероприятиях для DS-любителей и профессионалов. Выбирайте апрельское событие по вкусу и участвуйте!
3 апреля в 15:00 МСК - День открытых дверей знаменитой Школы анализа данных Яндекса-2021: узнайте о программе, процессе отбора, различиях между направлениями обучения и совместных программах с ВУЗами https://events.yandex.ru/events/den-otkrytyh-dverej-sh-ad
8-9 апреля — международная практическая онлайн-конференция по продвинутой продуктовой аналитике Aha! от команды Матемаркетинга – 30 лекций и дискуссий и 10 мастер-классов https://aha.matemarketing.ru/
15 апреля – конференция «Большие данные и аналитика 2021» от CNews – 14 докладов от CDO, ТОП-менеджеров цифровой трансформации и ведущих Data Scientist’ов из банков, страховых компаний, телекома, ритейла и других бизнесов https://events.cnews.ru/events/bolshie_dannye_i_analitika_2021.shtml
16 апреля в 19:00 МСК – онлайн-митап от Яндекса «Большая дата» для аналитиков, дата-сайентистов и ML-специалистов: 3 тематических доклада и дискуссии по интересам https://events.yandex.ru/events/bolshaya-data/16-04-2020/
22 апреля – 9-я межотраслевая конференция ScoringDay 2021 о современных технологиях продвинутого анализа данных для развития компаний-лидеров на финансовом рынке. Ключевая тема конференции – «Data Science: выйти в топ» https://scorconf.ru/
22-23 апреля в 10:00 МСК - конференция о технологиях в ритейле - Retail TECH, новое мероприятие, которое стартовало в 2020 году, чтобы объединить участников рынка ритейла для обсуждения технологий и инноваций. https://retailtech.ru/konferencziya/
24 апреля в 10:00 МСК – онлайн-конференция Data Science fwdays’21 - 300 минут докладов, диалогов, дискуссий экспертов, а также знакомства, новые технологии, инструкции, а также контент о Data Science буднях https://fwdays.com/en/event/data-science-fwdays-2021
27–29 апреля в 10:00 МСК - XX Юбилейный Customer Contacts World Forum – доклады и мастер-классы от экспертов, визиты в действующие контактные центры крупнейших российских компаний, вечерние networking-мероприятия и выставка прикладных решений по клиентской аналитике, цифровизации, автоматизации и роботизации сервисных бизнес-процессов с помощью AI, ML, Big Data и DS https://ccwf.ru/
28 апреля в 10:00 МСК - конференция «Big Data и BI Day 2021» от TAdviser для руководителей, бизнес-аналитиков, разработчиков аналитических решений, специалистов по технологиям Big Data и Data Science https://www.tadviser.ru/index.php/Конференция:Конференция_Big_Data_и_BI_Day_2021
3 апреля в 15:00 МСК - День открытых дверей знаменитой Школы анализа данных Яндекса-2021: узнайте о программе, процессе отбора, различиях между направлениями обучения и совместных программах с ВУЗами https://events.yandex.ru/events/den-otkrytyh-dverej-sh-ad
8-9 апреля — международная практическая онлайн-конференция по продвинутой продуктовой аналитике Aha! от команды Матемаркетинга – 30 лекций и дискуссий и 10 мастер-классов https://aha.matemarketing.ru/
15 апреля – конференция «Большие данные и аналитика 2021» от CNews – 14 докладов от CDO, ТОП-менеджеров цифровой трансформации и ведущих Data Scientist’ов из банков, страховых компаний, телекома, ритейла и других бизнесов https://events.cnews.ru/events/bolshie_dannye_i_analitika_2021.shtml
16 апреля в 19:00 МСК – онлайн-митап от Яндекса «Большая дата» для аналитиков, дата-сайентистов и ML-специалистов: 3 тематических доклада и дискуссии по интересам https://events.yandex.ru/events/bolshaya-data/16-04-2020/
22 апреля – 9-я межотраслевая конференция ScoringDay 2021 о современных технологиях продвинутого анализа данных для развития компаний-лидеров на финансовом рынке. Ключевая тема конференции – «Data Science: выйти в топ» https://scorconf.ru/
22-23 апреля в 10:00 МСК - конференция о технологиях в ритейле - Retail TECH, новое мероприятие, которое стартовало в 2020 году, чтобы объединить участников рынка ритейла для обсуждения технологий и инноваций. https://retailtech.ru/konferencziya/
24 апреля в 10:00 МСК – онлайн-конференция Data Science fwdays’21 - 300 минут докладов, диалогов, дискуссий экспертов, а также знакомства, новые технологии, инструкции, а также контент о Data Science буднях https://fwdays.com/en/event/data-science-fwdays-2021
27–29 апреля в 10:00 МСК - XX Юбилейный Customer Contacts World Forum – доклады и мастер-классы от экспертов, визиты в действующие контактные центры крупнейших российских компаний, вечерние networking-мероприятия и выставка прикладных решений по клиентской аналитике, цифровизации, автоматизации и роботизации сервисных бизнес-процессов с помощью AI, ML, Big Data и DS https://ccwf.ru/
28 апреля в 10:00 МСК - конференция «Big Data и BI Day 2021» от TAdviser для руководителей, бизнес-аналитиков, разработчиков аналитических решений, специалистов по технологиям Big Data и Data Science https://www.tadviser.ru/index.php/Конференция:Конференция_Big_Data_и_BI_Day_2021
👍🏻Будьте здоровы с DCNN!
В течение многих лет врачи полагались на визуальный осмотр для выявления подозрительных пигментных поражений (SPL), которые могут указывать на рак кожи. Выявление SPL на ранней стадии помогает оперативно выявить меланомы и значительно снизить стоимость лечения. Но быстро найти SPL и определить их важность не так-то просто из-за большого объема пигментных поражений. Исследователи из MIT разработали новый ИИ-конвейер на глубоких сверточных нейросетях (DCNN, deep convolutional neural networks) и реализовали его для анализа SPL через камеру обычного смартфона. Система автоматически обнаруживает, извлекает и анализирует все пигментные поражения кожи, наблюдаемые на широкоугольном фотоснимке. Предварительно обученные ML-модели DCNN определяют подозрительность отдельных пигментных образований и маркируют их: нужен дальнейший осмотр - желтым, требуется направление к дерматологу - красным. Извлеченные признаки используются для последующей оценки пигментных поражений и отображения результатов в виде тепловой карты. Напомним, DCNN – это алгоритмы глубокого обучения, которые используются для классификации изображений с последующей их кластеризацией, например, при поиске по фотографиям.
https://news.mit.edu/2021/artificial-intelligence-tool-can-help-detect-melanoma-0402
В течение многих лет врачи полагались на визуальный осмотр для выявления подозрительных пигментных поражений (SPL), которые могут указывать на рак кожи. Выявление SPL на ранней стадии помогает оперативно выявить меланомы и значительно снизить стоимость лечения. Но быстро найти SPL и определить их важность не так-то просто из-за большого объема пигментных поражений. Исследователи из MIT разработали новый ИИ-конвейер на глубоких сверточных нейросетях (DCNN, deep convolutional neural networks) и реализовали его для анализа SPL через камеру обычного смартфона. Система автоматически обнаруживает, извлекает и анализирует все пигментные поражения кожи, наблюдаемые на широкоугольном фотоснимке. Предварительно обученные ML-модели DCNN определяют подозрительность отдельных пигментных образований и маркируют их: нужен дальнейший осмотр - желтым, требуется направление к дерматологу - красным. Извлеченные признаки используются для последующей оценки пигментных поражений и отображения результатов в виде тепловой карты. Напомним, DCNN – это алгоритмы глубокого обучения, которые используются для классификации изображений с последующей их кластеризацией, например, при поиске по фотографиям.
https://news.mit.edu/2021/artificial-intelligence-tool-can-help-detect-melanoma-0402
MIT News
An artificial intelligence tool that can help detect melanoma
An artificial intelligence system can efficiently detect melanoma, a type of skin cancer. MIT researchers used deep convolutional neural networks (DCNNs) to quickly analyze wide-field photos of patients’ bodies.
🏂Как повысить качество производства продукции на 25% с помощью ИИ: опыт Fujitsu
Японский технологический гигант разработал AI-систему, которая выявляет отклонения во внешнем виде продукции, чтобы определить производственные проблемы еще до того, как материалы будут потрачены впустую.
ML-модель, обученная на смоделированных изображениях продуктов с отклонениями, способна обнаруживать различные проблемы. Например, изношенная резьба, дефектный рисунок проводки на разноцветных коврах или электронных деталях с разной формой проводов. ML-алгоритм получил высокую оценку качества: показатель AUROC составляет более 98%. Технология была протестирована на заводе Fujitsu в Нагано, который производит электронное оборудование. В результате трудозатраты на проверку качества печатных плат были уменьшены на ¼ от первоначального количества человеко-часов.
https://artificialintelligence-news.com/2021/03/29/fujitsu-develops-ai-product-abnormalities-manufacturing/
Японский технологический гигант разработал AI-систему, которая выявляет отклонения во внешнем виде продукции, чтобы определить производственные проблемы еще до того, как материалы будут потрачены впустую.
ML-модель, обученная на смоделированных изображениях продуктов с отклонениями, способна обнаруживать различные проблемы. Например, изношенная резьба, дефектный рисунок проводки на разноцветных коврах или электронных деталях с разной формой проводов. ML-алгоритм получил высокую оценку качества: показатель AUROC составляет более 98%. Технология была протестирована на заводе Fujitsu в Нагано, который производит электронное оборудование. В результате трудозатраты на проверку качества печатных плат были уменьшены на ¼ от первоначального количества человеко-часов.
https://artificialintelligence-news.com/2021/03/29/fujitsu-develops-ai-product-abnormalities-manufacturing/
🤠В январе 2021 года Open.AI представила новую ML-модель, нейронную сеть под названием DALL·E, которая создает изображения из текстовых подписей к понятиям естественного языка. Она имеет 12 миллиардов параметров и основана на GPT-3. DALL·E обучен генерировать изображения из текстовых описаний, используя набор данных из пар текст-изображение. Сеть может создавать антропоморфизированные версии животных и предметов, комбинировать несвязанные концепции правдоподобными способами, отображать тексты и применять преобразования к существующим изображениям.
Как и GPT-3, DALL·E - это языковая модель-трансформер: она получает текст и изображение в виде единого потока данных, содержащего до 1280 токенов, и обучается с максимальной вероятностью генерировать все токены один за другим. Токен - это любой символ из дискретного словаря, например, каждая английская буква - это токен из 26-буквенного алфавита. В словарном запасе DALL·E есть символы текстовых и графических концепций. В частности, каждая подпись изображения представлена с использованием максимум 256 токенов, закодированных с помощью BPE, с размером словаря 16384, а изображение представлено с использованием 1024 токенов из словаря размером 8192.
Во время обучения изображения предварительно обрабатываются до разрешения 256x256. Подобно VQVAE, каждое изображение сжимается до сетки 32x32 дискретных скрытых кодов с использованием дискретного предварительно обученного VAE. Это обеспечивает масштабирование до больших размеров словаря и позволяет DALL·E генерировать изображение с нуля и регенерировать любую прямоугольную область существующего изображения до нижнего правого угла в соответствии с текстовой подсказкой.
https://openai.com/blog/dall-e/
Как и GPT-3, DALL·E - это языковая модель-трансформер: она получает текст и изображение в виде единого потока данных, содержащего до 1280 токенов, и обучается с максимальной вероятностью генерировать все токены один за другим. Токен - это любой символ из дискретного словаря, например, каждая английская буква - это токен из 26-буквенного алфавита. В словарном запасе DALL·E есть символы текстовых и графических концепций. В частности, каждая подпись изображения представлена с использованием максимум 256 токенов, закодированных с помощью BPE, с размером словаря 16384, а изображение представлено с использованием 1024 токенов из словаря размером 8192.
Во время обучения изображения предварительно обрабатываются до разрешения 256x256. Подобно VQVAE, каждое изображение сжимается до сетки 32x32 дискретных скрытых кодов с использованием дискретного предварительно обученного VAE. Это обеспечивает масштабирование до больших размеров словаря и позволяет DALL·E генерировать изображение с нуля и регенерировать любую прямоугольную область существующего изображения до нижнего правого угла в соответствии с текстовой подсказкой.
https://openai.com/blog/dall-e/
OpenAI
DALL·E: Creating images from text
We’ve trained a neural network called DALL·E that creates images from text captions for a wide range of concepts expressible in natural language.
Оффер от Яндекса за выходные!
С 24 по 25 апреля пройдёт Weekend Offer для аналитиков — онлайн-встреча Яндекса, на которой можно пройти собеседования и получить оффер за выходные!
Чтобы попасть на Weekend Offer, необходимо решить 2-5 задач на платформе Яндекс.Контест. 24 апреля пройдут две часовые секции с кодом, а 25 апреля — часовые финалы с командами, на которых ваш потенциальный руководитель расскажет о сервисе, вашей роли и, возможно, даст ещё одну задачу. При взаимном интересе вы тем же вечером получите оффер.
Подробности и регистрация: https://clck.ru/UAzfb
С 24 по 25 апреля пройдёт Weekend Offer для аналитиков — онлайн-встреча Яндекса, на которой можно пройти собеседования и получить оффер за выходные!
Чтобы попасть на Weekend Offer, необходимо решить 2-5 задач на платформе Яндекс.Контест. 24 апреля пройдут две часовые секции с кодом, а 25 апреля — часовые финалы с командами, на которых ваш потенциальный руководитель расскажет о сервисе, вашей роли и, возможно, даст ещё одну задачу. При взаимном интересе вы тем же вечером получите оффер.
Подробности и регистрация: https://clck.ru/UAzfb
🙈Pandas – отличная Python-библиотека для анализа данных, которой должен владеть каждый Data Scientist. Однако, у этого инструмента нет многопроцессорной поддержки и он довольно медленно работает с большими наборами данных. Поэтому для быстрой обработки действительно больших массивов информации следует выбирать Vaex и Dask.
👍🏻Dask https://dask.org/ - библиотека анализа данных на базе Pandas с параллельными вычислениями и масштабируемой производительностью. Кроме Pandas, она также интегрирована с библиотеками Numpy и Scikit-learn, упрощая переключение между ними за счет API-интерфейсов на Python и структур данных.
👍🏻Vaex https://vaex.io/docs/index.html - высокопроизводительная Python-библиотека для отложенных вычислений с «ленивыми» датафреймами, аналогичных Pandas, а также визуализации и агрегирования Big Data. Она позволяет вычислять базовую статистику по миллиарду строк в секунду, но, в отличие от Dask, не полностью интегрирована с другими библиотеками.
👍🏻Dask https://dask.org/ - библиотека анализа данных на базе Pandas с параллельными вычислениями и масштабируемой производительностью. Кроме Pandas, она также интегрирована с библиотеками Numpy и Scikit-learn, упрощая переключение между ними за счет API-интерфейсов на Python и структур данных.
👍🏻Vaex https://vaex.io/docs/index.html - высокопроизводительная Python-библиотека для отложенных вычислений с «ленивыми» датафреймами, аналогичных Pandas, а также визуализации и агрегирования Big Data. Она позволяет вычислять базовую статистику по миллиарду строк в секунду, но, в отличие от Dask, не полностью интегрирована с другими библиотеками.
www.dask.org
Dask | Scale the Python tools you love
Dask is a flexible open-source Python library for parallel computing maintained by OSS contributors across dozens of companies including Anaconda, Coiled, SaturnCloud, and nvidia.
🤜🏻 З простых Python-функции для работы с пропусками в датасете для ML
• fillna() - функция из пакета Pandas для заполнения нулевых (NA/NaN) значений в данных. Она возвращает объект, в котором заполнены нулевые и отсутствующие значения: Series.fillna (значение = None, method = None, axis = None, inplace = False, ** kwargs)
• dropna() - функция для удаления нулевых значений из данных разными способами. Она анализирует и удаляет строки/столбцы, в которых есть отсутствующие или неопределенные значения (NaN). Значение параметра axis указывает, со строками или столбцами нужно работать: 0 – удаление строк с пропущенными значениями, а axis=1 удалит столбцы с пропусками. DataFrame.dropna (axis = 0, how = ’any’, thresh = None, subset = None, inplace = False)
• interpolate() – функция для заполнения отсутствующих значений/NaN с использованием разных методов интерполяции. DataFrame.interpolate(method=’linear’, axis=0, limit=None, inplace=False, limit_direction=’forward’, limit_area=None, downcast=None, **kwargs)
• fillna() - функция из пакета Pandas для заполнения нулевых (NA/NaN) значений в данных. Она возвращает объект, в котором заполнены нулевые и отсутствующие значения: Series.fillna (значение = None, method = None, axis = None, inplace = False, ** kwargs)
• dropna() - функция для удаления нулевых значений из данных разными способами. Она анализирует и удаляет строки/столбцы, в которых есть отсутствующие или неопределенные значения (NaN). Значение параметра axis указывает, со строками или столбцами нужно работать: 0 – удаление строк с пропущенными значениями, а axis=1 удалит столбцы с пропусками. DataFrame.dropna (axis = 0, how = ’any’, thresh = None, subset = None, inplace = False)
• interpolate() – функция для заполнения отсутствующих значений/NaN с использованием разных методов интерполяции. DataFrame.interpolate(method=’linear’, axis=0, limit=None, inplace=False, limit_direction=’forward’, limit_area=None, downcast=None, **kwargs)
🙌🏻6 типов RNN для моделирования последовательных данных
Зачем моделировать последовательные данные и почему это не так-то просто. Решаем задачу с помощью рекуррентных нейросетей: много математики и наглядных иллюстраций, а также подробный пример реализации RNN в Keras / Tensorflow и Python.
https://neptune.ai/blog/recurrent-neural-network-guide
Зачем моделировать последовательные данные и почему это не так-то просто. Решаем задачу с помощью рекуррентных нейросетей: много математики и наглядных иллюстраций, а также подробный пример реализации RNN в Keras / Tensorflow и Python.
https://neptune.ai/blog/recurrent-neural-network-guide
neptune.ai
Recurrent Neural Network Guide: a Deep Dive in RNN
Sequence modeling is a task of modeling sequential data. Modeling sequence data is when you create a mathematical notion to understand and study sequential data, and use those understandings to generate, predict or classify the same for a specific application. …
🥁Как понять и разработать ИИ путем поиска и выделения репрезентативных сценариев: инструмент Bayes-TrEx от исследований MIT
Одной точности ML-результатов недостаточно, чтобы уверенно использовать их в любой области. Фокус только на этом показателе может привести к опасным упущениям. Модель может совершать ошибки с высокой степенью уверенности, сталкиваясь с чем-то ранее невидимым, например, когда беспилотный автомобиль видит новый дорожный знак. Чтобы улучшить взаимодействие человека и ИИ, группа исследователей из Лаборатории компьютерных наук и искусственного интеллекта Массачусетского технологического института создала новый инструмент под названием Bayes-TrEx, который позволяет разработчикам и пользователям повысить прозрачность своих AI-моделей. Это делается за счет поиска конкретных примеров, которые приводят к определенному поведению. В методе используется байесовский апостериорный вывод, широко используемый математический аппарат для рассуждения о неопределенности модели.
В ходе экспериментов метод Bayes-TrEx тестировался на нескольких наборов данных, позволив обнаружить новые идеи, которые ранее не учитывались стандартными оценками, сосредоточенными исключительно на точности прогнозов. Bayes-TrEx можно применять в медицинской диагностике, системах автономного вождения, робототехнике и пр. Метод поможет разрешить новые проблемные ситуации заранее и позволит разработчикам исправить любые нежелательные результаты до того, как случатся потенциальные трагедии или впустую потратятся ресурсы.
https://news.mit.edu/2021/more-transparency-understanding-machine-behaviors-bayes-trex-0322
Одной точности ML-результатов недостаточно, чтобы уверенно использовать их в любой области. Фокус только на этом показателе может привести к опасным упущениям. Модель может совершать ошибки с высокой степенью уверенности, сталкиваясь с чем-то ранее невидимым, например, когда беспилотный автомобиль видит новый дорожный знак. Чтобы улучшить взаимодействие человека и ИИ, группа исследователей из Лаборатории компьютерных наук и искусственного интеллекта Массачусетского технологического института создала новый инструмент под названием Bayes-TrEx, который позволяет разработчикам и пользователям повысить прозрачность своих AI-моделей. Это делается за счет поиска конкретных примеров, которые приводят к определенному поведению. В методе используется байесовский апостериорный вывод, широко используемый математический аппарат для рассуждения о неопределенности модели.
В ходе экспериментов метод Bayes-TrEx тестировался на нескольких наборов данных, позволив обнаружить новые идеи, которые ранее не учитывались стандартными оценками, сосредоточенными исключительно на точности прогнозов. Bayes-TrEx можно применять в медицинской диагностике, системах автономного вождения, робототехнике и пр. Метод поможет разрешить новые проблемные ситуации заранее и позволит разработчикам исправить любые нежелательные результаты до того, как случатся потенциальные трагедии или впустую потратятся ресурсы.
https://news.mit.edu/2021/more-transparency-understanding-machine-behaviors-bayes-trex-0322
MIT News
More transparency and understanding into machine behaviors
A tool called Bayes-TrEx allows artificial intelligence developers and users to gain transparency into their AI model. The work was led by researchers from MIT’s Computer Science and Artificial Intelligence Laboratory (CSAIL).
