Big Data Science [RU]
1.62K subscribers
80 photos
9 videos
545 links
Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏 — https://t.me/bdscience — Big Data Science channel (english version)
💼 — https://t.me/bds_job — channel about Data Science jobs and career
Download Telegram
сравнение метрик LAMDA с человеческими оценками
👀Повышаем разрешение в видеоиграх с DLDSR от NVIDIA
DLDSR (Deep Learning Dynamic Super Resolution)
– технология улучшения картинки в видеоиграх, которая использует многослойную нейросеть, требующую меньше пикселей. DLDSR с коэффициентом разрешения 2.25X сопоставим по качеству с 4X-разрешением технологии предыдущего поколения DSR. При этом производительность DLDSR намного выше благодаря тензорным ядрам видеокарт RTX, которые ускоряют нейросети в несколько раз. Попробовать DLDSR можно на своем игровом компьютере, обновив драйвер видеокарты и выставив нужные настройки.
https://ru.blogs.nvidia.com/blog/2022/01/14/uluchshaem-proizvoditelnost-s-dldsr/
☄️Друзья! 1 марта в NewProLab стартует флагманский 12-недельный онлайн-курс "Специалист по большим данным".

А это значит, вас вновь ждет самая глубокая и объемная программа на рынке Big Data, заслужившая множество восторженных отзывов!

👉Оставляйте заявку и задавайте вопросы: https://clck.ru/apR8H 👈

Вы:
☑️Владеете основами Python?
☑️Уже умеете создавать SQL-запросы?
☑️ Знакомы с прикладными понятиями мат. анализа и линейной алгебры?
☑️Понимаете базовые операции ОС Linux?

Тогда мы приглашаем вас систематизировать текущие навыки и получить полное практическое руководство для подготовки собственных полноценных проектов.

Вы научитесь: строить модели машинного обучения, писать MapReduce-джобы, используя Hadoop Streaming и Python, работать с данными на HDFS, проводить анализ при помощи Apache Spark, строить алгоритмы рекомендательных систем.
❗️И все это на реальных дата-сетах и живых бизнес-кейсах с преподавателями и нетворком в сообществе единомышленников❗️

Эту программу уже прошли более 300 дата аналитиков и разработчиков. Присоединяйтесь и вы!
🌦Новогодняя спячка закончилась, пора выбираться на конференции, митапы и прочие DS-события. Февральский дайджест 2022:
1. 1 февраля в 12.00 МСК - онлайн-конференция «Цифровизация нефтегазовой отрасли: инструменты повышения доходности, эффективности и безопасности» https://www.tbforum.ru/vizit
2. 2 февраля в 16:00 МСК Online-митап компании «Синимекс» по работе с PostGIS, Hadoop и Spark: разбор реальных бизнес-кейсов и технологическая начинка https://www.cinimex.ru/meetup/
3. 3 февраля в 16:00 МСК Online-митап Яндекс.Cloud «Как и для чего решать задачи сбора, репликации и интеграции данных» https://cloud.yandex.ru/events/479
4. 10 февраля в 10:00 МСК - конференция "Искусственный интеллект 2022" от CNews https://events.cnews.ru/events/iskusstvennyi_intellekt_2022.shtml
5. 10 февраля в 11:00 МСК - онлайн-конференция «Интеллектуальное видеонаблюдение и машинное зрение в системах безопасности на крупных объектах» в рамках форума «Технологии безопасности 2022» https://www.tbforum.ru/vizit
6. 12 февраля в 10:00 МСК - New IT Fest: онлайн-фестиваль информационных технологий от Accenture: кейсы по внедрению ML, DS, AI решений https://newitfest.ru/
7. 16 февраля в 10:00 МСК – офлайн-конференция «Качество данных 2022» - по стратегиям и практикам обеспечения качества данных, гарантирующего высокий уровень сервисов и бизнес-процессов. Москва, Отель Palmira Business Club https://www.osp.ru/static/2021121039
8. 17 февраля в 11:00 МСК - Forum.Digital Telecom 2022 - II ежегодная онлайн-конференция по цифровой трансформации телекоммуникационной отрасли https://forum.digital/telecom2022
9. 17-18 февраля - OpenTalks.AI – 5-я ведущая независимая открытая конференция по ИИ в России: лучшие российские докладчики по ML/DL на одной площадке. Конференция пройдет в оффлайне, но с ограниченным количеством участников. Начало 17.02.2022 в 10:00, Москва, Конференц-зал гостиницы "Космос" , Проспект Мира, 150. https://opentalks.ai/
10. 28 февраля Citymobil Data Meetup №7 https://citymobil.timepad.ru/events/
🚗Роботы-курьеры Яндекса в Сеуле
Еще в прошлом году автономные роботы-курьеры Яндекса начали доставлять заказы в России, еду из ресторанов в американском городе Энн-Арбор в штате Мичиган и другие студенческие кампусы США. А в январе 2022 Яндекс заключил соглашение о намерениях с крупной южнокорейской телекоммуникационной компаний KT Corporation на доставку автономными роботами в Сеуле. Так уже в этом году Южная Корея станет первой страной в Восточной Азии, где работают роверы Яндекса. Также компания готовится запустить эту технологию в Дубае.
https://yandex.ru/company/press_releases/2022/2022-01-18
🎂Terality - сверхбыстрый serverless-движок вместо медленного Pandas
Terality
— это бессерверный механизм обработки данных, работающий на гигантских кластерах для работы с наборами данных любого размера. Благодаря парадигме serverless можно не беспокоиться о масштабировании ресурсов в кластерах или прочей инфраструктуре: практически нет ограничений на память, а значит, и на размер набора данных. Для работы нужно только хорошее подключение к Интернету для обработки сотен ГБ, даже на простом офисном ноутбуке с 4 ГБ ОЗУ. Terality позволяет запускать код Pandas в 10 раз быстрее: синтаксис Terality аналогичен Pandas. Достаточно изменить лишь одну строку кода, чтобы переключиться с Pandas на Terality:
import teratiyu as te.
Пакет Python отправляет HTTPS-запросы движку Terality, когда вы вызываете функции Pandas. Механизм обрабатывает данные и команду и возвращает результат. Однако, Terality – это не просто Python-пакет, а freemium-ПО с бесплатным планом на 1 ТБ. При этом учитывается каждый вызов API, а не только чтение данных.
https://docs.terality.com/
https://towardsdatascience.com/good-bye-pandas-meet-terality-its-evil-twin-with-identical-syntax-455b42f33a6d
🥁🥁Undouble - Python-библиотека для обнаружения дубликатов изображений с помощью хеш-функций
Поиск идентичных или похожих фотографий вручную – долгая и утомительная задача. Ее не решить просто сравнением размера и имени файлов, т.к. фото берутся из разных источников (мобильные устройства, приложения для социальных сетей и пр.), что приводит к различиям в этих атрибутах и создает разницу в разрешении, масштабировании, сжатии и яркости. Хеш-функции идеально подходят для обнаружения идентичных и похожих фото из-за устойчивости к незначительным изменениям. На этой идее основана Undouble - Python-библиотека, которая работает с использованием многоэтапного процесса предварительной обработки изображений (оттенки серого, нормализация и масштабирование), вычисления хэша изображения и группировки изображений. Порог 0 будет группировать изображения с идентичным хешем изображения. Результаты можно легко изучить с помощью функции построения графика, а изображения можно перемещать с помощью функции перемещения. При перемещении изображений копируется изображение из группы с наибольшим разрешением, а все остальные изображения перемещаются в подкаталог «undouble».
Чтобы попробовать эту библиотеку c открытым кодом (https://github.com/erdogant/undouble), ее сперва надо установить: pip install undouble, затем импортировать пакет в свой проект: from undouble import Undouble. Затем, установив метод хэширования и размер хэша, можно выявляться дубли с помощью undouble. При этом выполняются следующие шаги: рекурсивное чтение всех изображений из каталога с указанными расширениями, вычисление хэша и группировка похожих изображений.
Пример с объяснениями смотрите здесь: https://towardsdatascience.com/detection-of-duplicate-images-using-image-hash-functions-4d9c53f04a75
😜Как создать исполняемый файл из py-скрипта?
Хотя можно запустить Python-скрипт в терминале или текстовом редакторе, иногда нужно скрыть весь код в py-файле, обернув его внутрь исполняемого файла (.exe). Например, чтобы запланировать задание, которое запускает исполняемый файл в определенное время. Это можно сделать 2-мя способами:
• через GUI пакета auto-py-to-exe (https://pypi.org/project/auto-py-to-exe/), который сперва следует установить через pip install auto-py-to-exe, затем запустить и последовательно выполнить 4 шага.
• в терминале с библиотекой PyInstaller, которую тоже следует сперва установить: pip install pyinstaller, а затем перейти в каталог с нужным py-файлом и создать на его основе исполняемый с помощью команды pyinstaller --onefile name_of_script.py
По сути, первый способ представляет собой визуализацию 2-го в наглядном GUI. А те, кто работает с CLI-интерфейсом могут сразу использовать PyInstaller безо всяких дополнительных оберток.
https://towardsdatascience.com/how-to-easily-convert-a-python-script-to-an-executable-file-exe-4966e253c7e9
😜Нейросети для селфи на Google Pixel 6: точное альфа-матирование в портретном режиме
Матирование изображения — это процесс извлечения точной альфа-маски, которая разделяет объекты переднего плана и фона картинки. Это нужно не только профессиональным дизайнерам при оформлении рекламных фото, но и стало популярным развлечением для пользователей смартфонов. Отправить друзьям селфи на фоне Эйфелевой башне, находясь в комнате с бабушкиным ковром? Легко с помощью Google Pixel 6: сверточная нейросеть из последовательности блоков кодировщика-декодера, для постепенной оценки высококачественного альфа-матирования сохранит все детали, включая тонкие волосинки.
Входное изображение RGB объединяется с грубой альфа-подложкой (сгенерированной с помощью сегментатора людей с низким разрешением), которая передается в качестве входных данных в сеть. В новой модели Portrait Matting используется магистраль MobileNetV3 и неглубокий декодер с небольшим количеством слоев, чтобы сначала предсказать усовершенствованную альфа-маску с низким разрешением. Затем применяется неглубокий кодер-декодер и серия остаточных блоков для обработки изображения с высоким разрешением и уточненной альфа-маски из предыдущего шага. Неглубокий кодер-декодер больше полагается на функции более низкого уровня, чем предыдущая магистраль MobileNetV3, фокусируясь на структурных функциях высокого разрешения для прогнозирования окончательных значений прозрачности для каждого пикселя. Так модель может уточнить исходную альфа-маску переднего плана и точно извлечь очень мелкие детали. Эта архитектура нейросети эффективно работает на Pixel 6 с использованием Tensorflow Lite. Также ML-модель использует разнообразные обучающие наборы данных, которые охватывают широкий спектр оттенков кожи и причесок.
https://ai.googleblog.com/2022/01/accurate-alpha-matting-for-portrait.html
🍏Clustimage – Python-библиотека для кластеризации изображений
Кластеризация без учителя при распознавании изображений — это многоэтапный процесс. Он включает предварительную обработку, извлечение признаков, кластеризацию по сходству и оценку оптимального количества кластеров с использованием меры качества. Все эти шаги реализуются в Python-пакете Clustimage, которому в качестве входных данных нужны только пути или необработанные значения пикселей.
Цель clustimage – обнаружить естественные группы или кластеры изображений, используя методы ilhouette, dbindex и их производные, в сочетании с методами кластеризации (agglomerative, kmeans, dbscan и hdbscan). Clustimage помогает определить наиболее надежную кластеризацию путем эффективного поиска по параметру и оценки кластеров. Кроме кластеризации изображений, модель также можно использовать для поиска наиболее похожих изображений для новой невидимой выборки.
Чтобы попробовать эту библиотеку c открытым кодом (https://github.com/erdogant/clustimage), ее сперва надо установить: pip install clustimage, затем импортировать пакет в свой проект: from clustimage import Clustimage.
Пример с объяснениями смотрите здесь: https://towardsdatascience.com/a-step-by-step-guide-for-clustering-images-4b45f9906128
Бесплатный онлайн-митап «Как создаются роботы. Мультиагентная архитектура и фреймворки построения нейронных сетей» 🤖

24 февраля, 19:00 (Мск, GMT+3)

На следующей неделе при нашей поддержке пройдет онлайн-митап от РТЛабс — команды, которая разрабатывает портал и мобильное приложение «Госуслуги», Единую систему идентификации и аутентификации и другие сервисы электронного правительства. Вас ждут два доклада на тему машинного обучения и виртуальных помощников, а также круглый стол со спикерами митапа.

В программе:
– Никита Устриков и Юрий Миронов, «Эволюция робота Макса: от виджета до высоконагруженной мультиагентной системы».
– Андрей Татаринов, «Чат-боты. Бесплатно и без смс».
– Круглый стол «Роботы на службе человечества: как сделать ассистента, который реально полезен».

Кроме того, вы сможете поучаствовать в Zoom-дискуссии и розыгрышах призов.

Регистрируйтесь и присоединяйтесь по ссылке.
👍🏻Не любите документировать код? Предоставьте это ИИ!
AI Doc Writer
– это расширение VS Code, которое документирует код с использованием ИИ. Достаточно просто выбрать в среде разработки нужные строки кода и нажать Cmd/Ctrl +. AI Doc Writer создаст краткое описание каждой функции и параметров. Инструмент от Microsoft (https://marketplace.visualstudio.com/items?itemName=mintlify.document) поддерживает языки Python, JavaScript, TypeScript, PHP и Java, а также JSX и TSX файлы. Разумеется, это нельзя назвать программной документацией в том виде, как ее понимает Заказчик, однако, наличие понятных комментариев делает код поддерживаемым и читабельным. Посмотреть примеры: https://betterprogramming.pub/too-lazy-to-write-documentation-let-the-ai-write-it-for-you-8574f7cd11b2
📝ИИ-разработчик: AlphaCode от DeepMind
AI-система AlphaCode
пишет компьютерные программы на конкурентоспособном уровне: она вошла в число 54% лучших участников соревнований по программированию, решая новые задачи, требующие сочетания критического мышления, логики, алгоритмов, кодирования и понимания естественного языка.
Эта языковая трансформерная модель содержит 41,4 миллиарда параметров, что в четыре раза больше Codex. AlphaCode обучена 715,1 Гб кодов и их описаний из общедоступных репозиториях GitHub на языках программирования C++, C#, Go, Java, JavaScript, Lua, PHP, Python, Ruby, Rust, Scala и TypeScript.
https://www.deepmind.com/blog/article/Competitive-programming-with-AlphaCode
📆 28 февраля в 19:00 МСК состоится очередная онлайн встреча Citymobil Data Meetup!

В этот раз мы решили не звать гостей, поскольку в Ситимобил происходит очень много всего. Расскажем об этом)

🚖 Ольга Цветкова аналитик данных Ситимобил выступит с докладом «Сбор и валидация субъективных данных на примере заказов по пути домой»
Ольга расскажет об инструментах, с помощью которых можно собирать субъективные данные о том, как избавляться от человеческого фактора в полученной выборке с помощью semi – supervised learning. Затем покажет результаты на реальном кейсе.

🚖 Даниил Казанцев специалист по машинному обучению и анализу данных Ситимобил выступит с докладом «Антифрод на рынке такси. Определение мошеннических действий через анализ связности графа поездок»
Даниил ответит на такие вопросы:
🚕 Как мошенники могут заработать на рынке такси?
🚕 Что такое фрод в такси и как его найти?
🚕 Как в Ситимобил создаются модели, определяющие мошеннические действия, и правила, сокращающие нам объем фрода?
🚕 Как определять качество таких моделей и делать масштабируемые решения?
Также будет рассмотрен полный путь создания конкретного правила, использующего алгоритмы кластеризации на графах. И еще некоторые интересные вопросы будут затронуты в этом докладе.

Ведущий Алексей Чернобровов Head of Data Science Ситимобил

После докладов будет сессия Q&A

Регистрация для бесплатного участия https://bit.ly/3GLJTyj
🔥Спрятать от посторонних пикантное фото? Легко с Nudity Detection API!
Python-программа от DeepAI (https://deepai.org/machine-learning-model/nsfw-detector)
оценивает изображение и определяет вероятность того, что оно содержит обнаженные участки человеческого тела, которые обычно принято скрывать под одеждой. Поскольку нагота — это динамическая метка, алгоритм возвращает истинное или ложное процентное значение. Пользователь может установить разный порог в своем приложении, что считается наготой, а алгоритм распознавания изображений вернет процент вероятности, что картинка содержит обнаженную натуру. Эта ML-система применима не только к фото, но и к видео: нейросети анализируют видеопоток и выдают вероятностную оценку «взрослости» визуального контента.
Пример использования API смотрите здесь: https://medium.com/mlearning-ai/i-tried-a-python-nude-detector-with-my-photo-446dba1bbfc8
😎3 API ML-сервисов для распознавания лиц: выбирайте то, что нужно
• API IBM Watson Visual Recognition для идентификации сцен, объектов и лиц на изображениях, загружаемых в сервис. Может обрабатывать неструктурированные данные в большом объеме и подходит в качестве системы поддержки принятия решений. Но дорог в техническом обслуживании и не обрабатывает структурированные данные напрямую. Метод распознавания лиц не поддерживает общее биометрическое распознавание, а максимальный размер изображения составляет 10 МБ с минимальной рекомендуемой плотностью 32x32 пикселя на дюйм. Походит для классификации изображений с помощью встроенных классификаторов, позволяет создавать собственные классификаторы и обучать ML-модели. https://www.ibm.com/watson
• API распознавания лиц Kairos позволяет разработчикам ML-приложений добавлять в них возможности распознавания лиц, написав всего несколько строк кода. Kairos Face Recognition API показывает высокую точность в реальных сценариях и хорошо работает в условиях низкой освещенности, а также частичного скрытия лица. Применяет этический подход к идентификации лиц, учитывая разнообразие. Это расширяемый инструмент: пользователи могут применять дополнительные интеллектуальные функции для работы с видео и фото в реальном мире. Подходит для работы с большими объемами изображений и обеспечивает конфиденциальность за счет безопасного хранения собранных данных и регулярного аудита. Однако, поддерживает только типы файлов BMP, JPG и PNG, файлы GIF не поддерживаются. В работе немного медленнее, чем API AWS. https://www.kairos.com/docs/getting-started-with-kairos-face-recognition
• API компьютерного зрения Майкрософт в Azure предоставляет разработчикам доступ к расширенным алгоритмам обработки изображений. После загрузки изображения или указания его URL-адреса алгоритмы Microsoft Computer Vision анализируют его визуальное содержимое различными способами в зависимости от пользовательского выбора. Дополнительным преимуществом этого быстрого API является наглядные руководства, учебные пособия и примеры. Высокий уровень SLA гарантирует доступность не менее 99,9 % времени. Благодаря тесной интеграции с другими облачными сервисами Microsoft Azure, API можно упаковать в комплексное решение. Но при превышении лимита транзакций в секунду, время отклика будет сокращено до согласованного предела. Модель ценообразования зависит от спроса, поэтому сервис может оказаться дорогим, если количество запросов резко возрастает. Microsoft Computer Vision API отлично подходит для классификации изображений с объектами, живыми существами, декорациями и действиями, включая их идентификацию, категоризацию и тегирование изображений. Поддерживает распознавание лиц, настроения, возраста и сцен, оптическое распознавание символов для обнаружения текстового содержимого в изображениях. Также обеспечивает интеллектуальное управление фотографиями и ограничение показа модерируемого контента. https://azure.microsoft.com/en-us/services/cognitive-services/computer-vision/
15 марта Newprolab запускает уже 16-й поток своей флагманской онлайн-программы «Специалист по большим данным» – 12 недель, 36 занятий, 9 инидвидуальных лабораторных работ и 2 командных проекта!

Участники смогут погрузиться в мир больших данных и поработать со всеми значимыми инструментами экосистемы, как это сделали уже более 300 выпускников этой программы

Специально для подписчиков канала действует дополнительная скидка 15% (от цены, указанной на сайте, по 15.03.2022 включительно) по промокоду "BDSCIENCE_0222": https://clck.ru/apR8H

Вы научитесь строить модели машинного обучения, писать MapReduce-джобы, используя Hadoop Streaming и Python, работать с данными на HDFS, проводить анализ при помощи Apache Spark, строить алгоритмы рекомендательных систем.

И все это – на реальных дата-сетах и облачном кластере, живых бизнес-кейсах с преподавателями-практиками и нетворком в сообществе единомышленников.

Оставляйте заявку и задавайте вопросы: https://clck.ru/apR8H
🍏Повышать свой профессионализм в Data Science сегодня актуально, как никогда прежде. Узнавайте новое – в марте 2022 некоторые конференции теперь доступны и офлайн:
• 1 марта в 10:30 МСК - DataDriven 2022 - ежегодная конференция Яндекса для специалистов, использующих анализ данных для принятия бизнес-решений. Москва, улица Льва Толстого, 16, подъезд Экстрополис https://events.yandex.ru/events/data-driven-2022
• 2 марта в 18:00 МСК – митап об аналитике эффективности в СберМаркете https://sbermarket.timepad.ru/event/1912282/
• 2 марта в 11:00 МСК – вебинар Oracle и Инфосистемы Джет: «Как изменить мир, управляя данными. Традиционные хранилища, Data Lake или Data Mesh: в чем разница?" https://events.webinar.ru/jet/DataLake
• 16 марта в 22:00 МСК - Greenplum Community Meetup – Москва, Мулен Руж https://cloud.yandex.ru/events/485
• 21-24 марта - конференция GTC: 4 дня открытий от ведущих экспертов по искусственному интеллекту и совместной разработки виртуальных миров на платформе NVIDIA Omniverse https://www.nvidia.com/gtc/
• 24 марта - Data Day 2022 – форум, который посвящен новым возможностям работы с данными и их монетизации от организаторов Scoring Day – крупнейшего форума по скорингу в РФ. Москва, Берсеневская набережная, д.6, стр.3, Старт Хаб на Красном Октябре https://data-day.ru
• 24 марта - Форум BIG DATA&AI 2022 – центральное событие года по теме больших данных, продвинутой аналитики и искусственного интеллекта https://www.osp.ru/lp/bigdata2022
• Data Fusion Contest 2022 - соревнование по машинному обучению: 3 задачи, 2 номинации и 2 000 000 рублей. Старт был 3 февраля, финал 4 апреля 2022. https://ods.ai/tracks/data-fusion-2022-competitions
👍🏻Анализ настроений в соцсетях на Python с VADER без разработки ML-модели
Не для каждой задачи классификации нужны модели машинного обучения: иногда даже простые подходы могут дать отличный результат. Например, VADER (Valence Aware Dictionary and sEntiment Reasoner) - основанная на словаре и правилах модель анализа тональности. Исходный код проекта доступен на Github под лицензией MIT: https://github.com/cjhutto/vaderSentiment
VADER может эффективно обрабатывать словари, аббревиатуры, заглавные буквы, повторяющиеся знаки препинания, смайлики (😢 , 😃 , 😭 и т. д.) и пр., которые обычно используются в соцсетях для выражения настроений, что делает его отличным инструментом оценки тональности текста. Преимущество VADER в том, что он оценивает настроение любого текста без предварительного обучения ML-моделей. Результат, сгенерированный VADER, представляет собой словарь из 4 ключей neg, neu, pos и компонентов (сompound):
• neg, neu и pos означают отрицательный, нейтральный и положительный соответственно. Их сумма должна быть равна 1 или близка к ней при операции с плавающей запятой.
• сompound соответствует сумме оценок валентности каждого слова в лексиконе и определяет степень настроения, а не действительное значение, в отличие от предыдущих. Его значение находится в диапазоне от -1 (самое сильное отрицательное настроение) до +1 (самое сильное положительное настроение). Использование составной оценки может быть достаточным для определения основной тональности текста. Для положительного настроения сompound≥ 0,05, для отрицательного сompound≤ -0,05, при нейтральном отношении сompound находится в диапазоне от -0,05 до 0,05
Попробовать в Google Colab: https://colab.research.google.com/drive/1_Y7LhR6t0Czsk3UOS3BC7quKDFnULlZG?usp=sharing
Смотреть пример: https://towardsdatascience.com/social-media-sentiment-analysis-in-python-with-vader-no-training-required-4bc6a21e87b8