Forwarded from Deep Dive 2 Deep Learning
🙌🏼Imagen от Google AI
В мае 2022 года исследователи Google AI представили Imagen - модель перевода текста в фотореалистичное изображение с глубоким уровнем понимания языка. Imagen основа на больших языковых трансформерных моделях, предварительно обученных на тектстовых корпусах. Эксперименты показали, что Imagen достигает 7,27 баллов по FID в наборе данных COCO, даже без предварительного обучения, превосходя DALL-E 2 от OpenAI по степени реалистичности изображений.
Поскольку Imagen обучалась на неконтролируемом людьми датасете LAION-400M с 400+ миллионами пар изображение-текст, взятых из Интернета, модель подвержена предвзятости. Поэтому Google AI пока не выпускает ее в открытый доступ. Но посмотреть, как это работает и что внутри, можно уже сейчас: https://imagen.research.google/
В мае 2022 года исследователи Google AI представили Imagen - модель перевода текста в фотореалистичное изображение с глубоким уровнем понимания языка. Imagen основа на больших языковых трансформерных моделях, предварительно обученных на тектстовых корпусах. Эксперименты показали, что Imagen достигает 7,27 баллов по FID в наборе данных COCO, даже без предварительного обучения, превосходя DALL-E 2 от OpenAI по степени реалистичности изображений.
Поскольку Imagen обучалась на неконтролируемом людьми датасете LAION-400M с 400+ миллионами пар изображение-текст, взятых из Интернета, модель подвержена предвзятости. Поэтому Google AI пока не выпускает ее в открытый доступ. Но посмотреть, как это работает и что внутри, можно уже сейчас: https://imagen.research.google/
👍3
#тест
Ложное срабатывание датчика автосигнализации (без реальной угрозы) - это пример ошибки
Ложное срабатывание датчика автосигнализации (без реальной угрозы) - это пример ошибки
Anonymous Quiz
51%
первого рода
33%
второго рода
9%
зависит от заданного уровня статистической значимости
7%
это вообще не ошибка
🔥6
Если меня спросить, что лучше: работа мечты или One Day Offer. Я посоветую: «One Day Offer». Потому что One Day Offer может привести к работе мечты.
Сегодня многие компании проводят One Day Offer в том числе и Сбер. Поэтому вы можете стать частью команды Сбера за 1 день!
Сбер ищет дата-сайентистов в Москве и Нижнем Новгороде. Подходит, если вы технарь уровня Middle, Senior или Lead с опытом в DS/ML больше 2 лет, который без труда кодит на Python. А если работали с рекомендательными системами — ещё лучше.
Каков порядок действий?
Посещаете 25 июня One Day Offer → проходите интервью → в тот же день получаете предложение, о котором мечтали → вместе с командой Сбера создаёте платформу, которая поможет создавать персональные рекомендации в разных сферах бизнеса.
Участвовать в One Day Offer
Сегодня многие компании проводят One Day Offer в том числе и Сбер. Поэтому вы можете стать частью команды Сбера за 1 день!
Сбер ищет дата-сайентистов в Москве и Нижнем Новгороде. Подходит, если вы технарь уровня Middle, Senior или Lead с опытом в DS/ML больше 2 лет, который без труда кодит на Python. А если работали с рекомендательными системами — ещё лучше.
Каков порядок действий?
Посещаете 25 июня One Day Offer → проходите интервью → в тот же день получаете предложение, о котором мечтали → вместе с командой Сбера создаёте платформу, которая поможет создавать персональные рекомендации в разных сферах бизнеса.
Участвовать в One Day Offer
👍4
🚀Новый Python: быстрее более чем в 2 раза!
Выпущенный в апреле 2022 года альфа-релиз Python 3.11 в некоторых случаях может работать на 60% быстрее предыдущей версии. Бенчмаркинговые тесты компании Phoronix, проведенные на Ubuntu Linux и скомпилированные с помощью компилятора GCC, показали, что скрипты на Python 3.11 выполняются в среднем на 25% быстрее, чем Python 3.10, без изменения кода. Это стало возможным благодаря тому, что теперь интерпретатор отвечает за статическое размещение своих объектов кода и ускорению седы выполнения. Каждый раз, когда Python используется для вызова одной из собственных функций, создается новый фрейм, внутренняя структура которого улучшена так, чтобы он сохранял только самую важную информацию без дополнительных данных про управление памятью и отладку.
Кроме того, с релиза 3.11 введено, что при обнаружении CPython'ом функции Python, которая вызывает другую функцию, он устанавливает новый фрейм и переходит к новому коду, содержащемуся в нем. Это позволяет избежать вызова функции, отвечающей за интерпретацию C (раньше каждый вызов функции Python вызывал функцию C, которая ее интерпретировала). Такое нововведение дополнительно ускорило выполнение Python-скриптов.
https://levelup.gitconnected.com/the-fastest-python-yet-up-to-60-faster-2eeb3d9a99d0
Выпущенный в апреле 2022 года альфа-релиз Python 3.11 в некоторых случаях может работать на 60% быстрее предыдущей версии. Бенчмаркинговые тесты компании Phoronix, проведенные на Ubuntu Linux и скомпилированные с помощью компилятора GCC, показали, что скрипты на Python 3.11 выполняются в среднем на 25% быстрее, чем Python 3.10, без изменения кода. Это стало возможным благодаря тому, что теперь интерпретатор отвечает за статическое размещение своих объектов кода и ускорению седы выполнения. Каждый раз, когда Python используется для вызова одной из собственных функций, создается новый фрейм, внутренняя структура которого улучшена так, чтобы он сохранял только самую важную информацию без дополнительных данных про управление памятью и отладку.
Кроме того, с релиза 3.11 введено, что при обнаружении CPython'ом функции Python, которая вызывает другую функцию, он устанавливает новый фрейм и переходит к новому коду, содержащемуся в нем. Это позволяет избежать вызова функции, отвечающей за интерпретацию C (раньше каждый вызов функции Python вызывал функцию C, которая ее интерпретировала). Такое нововведение дополнительно ускорило выполнение Python-скриптов.
https://levelup.gitconnected.com/the-fastest-python-yet-up-to-60-faster-2eeb3d9a99d0
Medium
The Fastest Python Yet: Up to 60% Faster⚡
You won’t believe how fast it can be!
🔥8
💥Лучшее с майской конференции Airflow Summit 2022!
Любителям и профессионалам дата-инженерии: подборка самых интересных докладов, от тонкостей работы batch-оркестратора до передовых практики управления развертыванием и данными.
https://medium.com/apache-airflow/airflow-summit-2022-the-best-of-373bee2527fa
Любителям и профессионалам дата-инженерии: подборка самых интересных докладов, от тонкостей работы batch-оркестратора до передовых практики управления развертыванием и данными.
https://medium.com/apache-airflow/airflow-summit-2022-the-best-of-373bee2527fa
Medium
Airflow Summit 2022 — The Best Of
The Airflow Summit has a very special place in my heart. I hope I can share my sentiment here with whoever reads that, and by the end of…
🔥1
#тест
От чего НЕ зависит величина статистической мощности?
От чего НЕ зависит величина статистической мощности?
Anonymous Quiz
11%
размер выборки для подтверждения статистической гипотезы
14%
величина эффекта (разности между сравниваемыми средними)
55%
матожидание случайной величины
20%
величина уровня значимости
🔥3
🪢ИИ для робототехники: новая версия Isaac Sim от NVIDIA
17 июня 2022 года NVIDIA объявила о выпуске версии инструмента моделирования робототехники и генерации синтетических данных Isaac Sim. Эта платформа ускоряет разработку, тестирование и обучение ИИ в робототехнике. С помощью Isaac Sim разработчики могут создавать наборы данных о качестве продукции для обучения ИИ-моделей, моделировать роботизированную навигацию и манипуляции, а также генерировать тестовую среду для тестирования приложений робототехники.
Isaac Sim включает средства принятия решений для обучения коллаборативных роботов (коботов), инструмент RL-обучения с ускорением на графическом процессоре, набор инструментов для генерации синтетических данных, API и рабочих процессов, а также новые возможности процедурного создания промышленных сред для генерации синтетических данных.
https://developer.nvidia.com/blog/expedite-the-development-testing-and-training-of-ai-robots-with-isaac-sim/
17 июня 2022 года NVIDIA объявила о выпуске версии инструмента моделирования робототехники и генерации синтетических данных Isaac Sim. Эта платформа ускоряет разработку, тестирование и обучение ИИ в робототехнике. С помощью Isaac Sim разработчики могут создавать наборы данных о качестве продукции для обучения ИИ-моделей, моделировать роботизированную навигацию и манипуляции, а также генерировать тестовую среду для тестирования приложений робототехники.
Isaac Sim включает средства принятия решений для обучения коллаборативных роботов (коботов), инструмент RL-обучения с ускорением на графическом процессоре, набор инструментов для генерации синтетических данных, API и рабочих процессов, а также новые возможности процедурного создания промышленных сред для генерации синтетических данных.
https://developer.nvidia.com/blog/expedite-the-development-testing-and-training-of-ai-robots-with-isaac-sim/
NVIDIA Technical Blog
Expedite the Development, Testing, and Training of AI Robots with Isaac Sim
This release of Isaac Sim adds more tools for AI-based robotics including Isaac Gym support for RL, Isaac Cortex for cobot programming, and much more.
Какая компания в России самая лучшая по работе с данными?
Anonymous Poll
21%
Avito
3%
HeadHunter
9%
Ozon
13%
Tinkoff
3%
Veon (билайн)
10%
VK (все проекты экосистемы)
11%
X5
4%
МТС
17%
Сбер (все проекты экосистемы)
58%
Яндекс (все проекты экосистемы)
🌞🌸💦ТОП-5 DS-событий июля 2022:
• 06 и 08 июля – AHA!22 - техническая конференция от создателей Матемаркитенга для аналитиков и продактов об обеспечении эффективности https://aha.matemarketing.ru/
• 06 июля – Callday.Ecom - онлайн-конференция про сквозную аналитику и эффективный маркетинг в электронной торговле https://callday.ru/ecom2022
• 7 июля в 11:00 МСК – вебинар от SberCloud «Первая AI-модель для распознавания товаров и цен в розничных продуктовых сетях на платформе ML Space» https://sbercloud.ru/ru/warp/webinars/pervaia-ai-model-dlia-raspoznavaniia-tovarov-i-tsen-v-roznichnykhproduktovykh-setiakh-na-platforme-ml-space
• 21 июля в 16:00 МСК – вебинар от Яндекса «Обработка данных на Apache Airflow в Yandex Cloud» https://cloud.yandex.ru/events/587
• 30 -31 июля – PYCON RUSSIA - самая большая и душевная конференция для python-разработчиков. https://pycon.ru/
• 06 и 08 июля – AHA!22 - техническая конференция от создателей Матемаркитенга для аналитиков и продактов об обеспечении эффективности https://aha.matemarketing.ru/
• 06 июля – Callday.Ecom - онлайн-конференция про сквозную аналитику и эффективный маркетинг в электронной торговле https://callday.ru/ecom2022
• 7 июля в 11:00 МСК – вебинар от SberCloud «Первая AI-модель для распознавания товаров и цен в розничных продуктовых сетях на платформе ML Space» https://sbercloud.ru/ru/warp/webinars/pervaia-ai-model-dlia-raspoznavaniia-tovarov-i-tsen-v-roznichnykhproduktovykh-setiakh-na-platforme-ml-space
• 21 июля в 16:00 МСК – вебинар от Яндекса «Обработка данных на Apache Airflow в Yandex Cloud» https://cloud.yandex.ru/events/587
• 30 -31 июля – PYCON RUSSIA - самая большая и душевная конференция для python-разработчиков. https://pycon.ru/
🔥2👍1
Специально для МРТ: библиотека Nilearn
Nilearn — легковесная Python-библиотека анализа данных МРТ. Она предоставляет статистические инструменты и средства машинного обучения, подробную документацию и открытое сообщество.
Nilearn теперь включает в себя функциональность библиотеки Nistats и расширяет ее новыми фичами. Она поддерживает анализ на основе общей линейной модели (GLM) и использует средства scikit-learn для многомерной статистики с такими приложениями, как прогнозное моделирование, классификация, декодирование или анализ связности. Nilearn отлично визуализирует результаты анализа в проекциях человеческого мозга.
Библиотека доступна под лицензией BSD и активно обновляется: версия 0.1.1 вышла в 2015 году, а на июнь 2022 года выпущен релиз 0.9.1. https://nilearn.github.io/stable/index.html
Nilearn — легковесная Python-библиотека анализа данных МРТ. Она предоставляет статистические инструменты и средства машинного обучения, подробную документацию и открытое сообщество.
Nilearn теперь включает в себя функциональность библиотеки Nistats и расширяет ее новыми фичами. Она поддерживает анализ на основе общей линейной модели (GLM) и использует средства scikit-learn для многомерной статистики с такими приложениями, как прогнозное моделирование, классификация, декодирование или анализ связности. Nilearn отлично визуализирует результаты анализа в проекциях человеческого мозга.
Библиотека доступна под лицензией BSD и активно обновляется: версия 0.1.1 вышла в 2015 году, а на июнь 2022 года выпущен релиз 0.9.1. https://nilearn.github.io/stable/index.html
Nilearn
Nilearn enables approachable and versatile analyses of brain volumes and surfaces. It provides statistical and machine-learning tools, with instructive documentation & open community. It supports g...
🔥2
👌ТОП-5 MLOps-фреймворков
Сегодня тема MLOps очень востребована: ML-системы становятся все сложнее, а их разработка и поддержка включает не только вычислительные алгоритмы и прочую Data Science, но и лучшие практики разработки ПО с тонкостями развертывания в production. При этом нужно постоянно следить за дрейфом входных данных и реакции ML-модели на них, своевременно корректируя код с его версионированием. Наладить такую непрерывную цепочку помогают комплексные MLOps-фреймворки, наиболее популярными из которых считаются следующие:
• MLflow — платформа с открытым исходным кодом для управления сквозным жизненным циклом машинного обучения https://www.mlflow.org/
• Kubeflow — платформа машинного обучения с открытым исходным кодом, позволяющая использовать ML-конвейеры для управления сложными рабочими процессами, работающими в Kubernetes, например, обработка данных, затем использование TensorFlow или PyTorch для обучения модели и развертывание в TensorFlow Serving или Seldon. Kubeflow построен на основе внутреннего метода Google для развертывания моделей TensorFlow, который называется TensorFlow Extended. https://www.kubeflow.org/
• FastAPI — это современная, быстрая и высокопроизводительная веб-инфраструктура для создания API-интерфейсов с Python 3.6+ на основе стандартных подсказок типов Python. Он полностью поддерживает асинхронное программирование и может работать с Uvicorn и Gunicorn. https://fastapi.tiangolo.com/
• ZenML —платформа MLOps с открытым исходным кодом, созданная для команд машинного обучения. Она обеспечивает уровень абстракции для максимально простого переноса ML-моделей из исследований в производство. С ZenML Data Scientist получает полный контроль и право собственности на весь процесс конвейера, не вдаваясь в тонкости процессов развертывания. ZenML стандартизирует написание конвейеров ML для различных стеков MLOps, независимо от облачных провайдеров, сторонних поставщиков и базовой инфраструктуры https://zenml.io/
• Seldon Core - платформа с открытым исходным кодом, упрощает и ускоряет развертывание ML-моделей и масштабных экспериментов в Kubernetes. Seldon Core обслуживает модели, созданные в любой среде построения моделей с открытым исходным кодом или в коммерческой среде. Можно использовать мощные функции Kubernetes, такие как настраиваемые определения ресурсов, для управления графами модели. Есть возможность подключить CI/CD-инструменты, чтобы масштабировать и обновлять развертывание. Seldon обеспечивает масштабирование до тысяч производственных ML-моделей и предоставляет готовые расширенные возможности машинного обучения, включая расширенные метрики, регистрацию запросов, эксплейнеры, детекторы выбросов, A/B-тесты, Canary и многое другое. https://www.seldon.io/solutions/open-source-projects/core
Сегодня тема MLOps очень востребована: ML-системы становятся все сложнее, а их разработка и поддержка включает не только вычислительные алгоритмы и прочую Data Science, но и лучшие практики разработки ПО с тонкостями развертывания в production. При этом нужно постоянно следить за дрейфом входных данных и реакции ML-модели на них, своевременно корректируя код с его версионированием. Наладить такую непрерывную цепочку помогают комплексные MLOps-фреймворки, наиболее популярными из которых считаются следующие:
• MLflow — платформа с открытым исходным кодом для управления сквозным жизненным циклом машинного обучения https://www.mlflow.org/
• Kubeflow — платформа машинного обучения с открытым исходным кодом, позволяющая использовать ML-конвейеры для управления сложными рабочими процессами, работающими в Kubernetes, например, обработка данных, затем использование TensorFlow или PyTorch для обучения модели и развертывание в TensorFlow Serving или Seldon. Kubeflow построен на основе внутреннего метода Google для развертывания моделей TensorFlow, который называется TensorFlow Extended. https://www.kubeflow.org/
• FastAPI — это современная, быстрая и высокопроизводительная веб-инфраструктура для создания API-интерфейсов с Python 3.6+ на основе стандартных подсказок типов Python. Он полностью поддерживает асинхронное программирование и может работать с Uvicorn и Gunicorn. https://fastapi.tiangolo.com/
• ZenML —платформа MLOps с открытым исходным кодом, созданная для команд машинного обучения. Она обеспечивает уровень абстракции для максимально простого переноса ML-моделей из исследований в производство. С ZenML Data Scientist получает полный контроль и право собственности на весь процесс конвейера, не вдаваясь в тонкости процессов развертывания. ZenML стандартизирует написание конвейеров ML для различных стеков MLOps, независимо от облачных провайдеров, сторонних поставщиков и базовой инфраструктуры https://zenml.io/
• Seldon Core - платформа с открытым исходным кодом, упрощает и ускоряет развертывание ML-моделей и масштабных экспериментов в Kubernetes. Seldon Core обслуживает модели, созданные в любой среде построения моделей с открытым исходным кодом или в коммерческой среде. Можно использовать мощные функции Kubernetes, такие как настраиваемые определения ресурсов, для управления графами модели. Есть возможность подключить CI/CD-инструменты, чтобы масштабировать и обновлять развертывание. Seldon обеспечивает масштабирование до тысяч производственных ML-моделей и предоставляет готовые расширенные возможности машинного обучения, включая расширенные метрики, регистрацию запросов, эксплейнеры, детекторы выбросов, A/B-тесты, Canary и многое другое. https://www.seldon.io/solutions/open-source-projects/core
MLflow AI Platform
MLflow - Open Source AI Platform for Agents, LLMs & Models
The largest open source AI engineering platform for agents, LLMs, and ML models. Debug, evaluate, monitor, and optimize your AI applications. Built for teams of all sizes.
👍1🔥1
🪢Пара библиотек для модульного тестирования Python-скриптов
Модульное тестирование позволяет разработчику убедиться, что код работает должным образом на атомарном уровне. Суть модульного тестирования сводится к проверке того, что каждая отдельная функция делает то, что она должна делать. Для этого можно использовать следующие инструменты:
• Pytest — это платформа для написания небольших читаемых тестов, которую можно масштабировать для поддержки сложного функционального тестирования приложений и библиотек. Требуется: Python 3.7+ или PyPy3. https://docs.pytest.org/en/7.1.x/
• Сhispa предоставляет быстрые вспомогательные методы тестирования PySpark, которые выводят описательные сообщения об ошибках. Эта библиотека упрощает написание высококачественного кода PySpark. Интересно, что chispa в переводе с испанского означает искра, т.е. Spark по-английски. https://github.com/MrPowers/chispa
Модульное тестирование позволяет разработчику убедиться, что код работает должным образом на атомарном уровне. Суть модульного тестирования сводится к проверке того, что каждая отдельная функция делает то, что она должна делать. Для этого можно использовать следующие инструменты:
• Pytest — это платформа для написания небольших читаемых тестов, которую можно масштабировать для поддержки сложного функционального тестирования приложений и библиотек. Требуется: Python 3.7+ или PyPy3. https://docs.pytest.org/en/7.1.x/
• Сhispa предоставляет быстрые вспомогательные методы тестирования PySpark, которые выводят описательные сообщения об ошибках. Эта библиотека упрощает написание высококачественного кода PySpark. Интересно, что chispa в переводе с испанского означает искра, т.е. Spark по-английски. https://github.com/MrPowers/chispa
GitHub
GitHub - MrPowers/chispa: PySpark test helper methods with beautiful error messages
PySpark test helper methods with beautiful error messages - MrPowers/chispa
🔥4
#тест
В рекуррентных нейросетях выход нейрона зависит от:
В рекуррентных нейросетях выход нейрона зависит от:
Anonymous Quiz
3%
входа
4%
весовых коэффициентов
14%
входа и весовых коэффициентов
79%
входа, весовых коэффициентов и предыдущих выходов
🔥4
💥Python-библиотека для отправки PySpark-скриптов в кластер Spark через REST API Livy
Разработчики Spark-приложений знают, что есть два подхода к программной отправке заданий в кластер Apache Spark, и каждый из них имеет некоторые ограничения для достижения взаимодействия в реальном времени: spark-submit и spark-shell.
Однако, на практике бывают случаи, что надо отправлять Spark-задания в интерактивном режиме из веб- или мобильного приложения. При этом кластер Apache Spark размещен в локальной инфраструктуре, а нужно, чтобы много пользователей одновременно потребляли и выполняли тяжелые агрегации с источниками данных со своих мобильных телефонов, веб- или десктопных приложений. В этом случае поможет сервисный подход, Spark-as-a-Service, включая предоставление доступа к источникам данных JDBC/ODBC через резервный сервер Spark или использование Apache Livy - службы, которая позволяет легко взаимодействовать с кластером Apache Spark через REST API.
Для Livy пригодится Python-пакет livyc – он хорошо работает для динамической и асинхронной отправки PySpark-скриптов на сервер Apache Livy, прозрачно взаимодействуя с кластером Apache Spark. https://github.com/Wittline/livyc
Разработчики Spark-приложений знают, что есть два подхода к программной отправке заданий в кластер Apache Spark, и каждый из них имеет некоторые ограничения для достижения взаимодействия в реальном времени: spark-submit и spark-shell.
Однако, на практике бывают случаи, что надо отправлять Spark-задания в интерактивном режиме из веб- или мобильного приложения. При этом кластер Apache Spark размещен в локальной инфраструктуре, а нужно, чтобы много пользователей одновременно потребляли и выполняли тяжелые агрегации с источниками данных со своих мобильных телефонов, веб- или десктопных приложений. В этом случае поможет сервисный подход, Spark-as-a-Service, включая предоставление доступа к источникам данных JDBC/ODBC через резервный сервер Spark или использование Apache Livy - службы, которая позволяет легко взаимодействовать с кластером Apache Spark через REST API.
Для Livy пригодится Python-пакет livyc – он хорошо работает для динамической и асинхронной отправки PySpark-скриптов на сервер Apache Livy, прозрачно взаимодействуя с кластером Apache Spark. https://github.com/Wittline/livyc
GitHub
GitHub - Wittline/livyc: Apache Spark as a Service with Apache Livy Client
Apache Spark as a Service with Apache Livy Client. Contribute to Wittline/livyc development by creating an account on GitHub.
👍2
🗣7 инструментов распознавания речи
Чтобы разработать собственную ML-систему распознавания речи, можно воспользоваться следующими фреймворками и библиотеками:
• wav2letter – open-course набор инструментов с открытым исходным кодом от Facebook AI Research, объединенный с более крупной библиотекой под названием Flashlight https://github.com/flashlight/wav2letter
• DeepSpeech на базе Baidu DeepSpeech, который помоможет расшифровать аудиофайл, используя предварительно обученные модели, или настроить/обучить пользовательский набор данных https://deepspeech.readthedocs.io/en/r0.9/?badge=latest
• TensorFlowASR – пакет с открытым исходным кодом от Tensorflow реализует некоторые эталонные модели, обученные с использованием RNN с CTC https://github.com/TensorSpeech/TensorFlowASR
• OpenSeq2Seq - исследовательский проект от NVIDIA по проблемам преобразования последовательностей в последовательности https://github.com/NVIDIA/OpenSeq2Seq/blob/master/Streaming-ASR.ipynb
• SpeechRecognition - проект предоставляет доступ к нескольким моделям автоматического распознавания речи, включая оболочки для речевых API от Google, Microsoft Azure и IBM https://github.com/Uberi/speech_recognition
Также отметим 2 готовых сервиса, которые предоставляют API для доступа к возможностям сервисов, от распознавания речи до генерации «естественных» голосовых данных:
• SmartSpeech от СберDevices https://sberdevices.ru/smartspeech/
• Yandex SpeechKit от Яндекса https://cloud.yandex.ru/services/speechkit
Чтобы разработать собственную ML-систему распознавания речи, можно воспользоваться следующими фреймворками и библиотеками:
• wav2letter – open-course набор инструментов с открытым исходным кодом от Facebook AI Research, объединенный с более крупной библиотекой под названием Flashlight https://github.com/flashlight/wav2letter
• DeepSpeech на базе Baidu DeepSpeech, который помоможет расшифровать аудиофайл, используя предварительно обученные модели, или настроить/обучить пользовательский набор данных https://deepspeech.readthedocs.io/en/r0.9/?badge=latest
• TensorFlowASR – пакет с открытым исходным кодом от Tensorflow реализует некоторые эталонные модели, обученные с использованием RNN с CTC https://github.com/TensorSpeech/TensorFlowASR
• OpenSeq2Seq - исследовательский проект от NVIDIA по проблемам преобразования последовательностей в последовательности https://github.com/NVIDIA/OpenSeq2Seq/blob/master/Streaming-ASR.ipynb
• SpeechRecognition - проект предоставляет доступ к нескольким моделям автоматического распознавания речи, включая оболочки для речевых API от Google, Microsoft Azure и IBM https://github.com/Uberi/speech_recognition
Также отметим 2 готовых сервиса, которые предоставляют API для доступа к возможностям сервисов, от распознавания речи до генерации «естественных» голосовых данных:
• SmartSpeech от СберDevices https://sberdevices.ru/smartspeech/
• Yandex SpeechKit от Яндекса https://cloud.yandex.ru/services/speechkit
GitHub
GitHub - flashlight/wav2letter: Facebook AI Research's Automatic Speech Recognition Toolkit
Facebook AI Research's Automatic Speech Recognition Toolkit - flashlight/wav2letter
👍4🔥3
#тест
ACID-требования к транзакциям полностью поддерживают
ACID-требования к транзакциям полностью поддерживают
Anonymous Quiz
16%
все базы данных
54%
только реляционные базы данных
10%
только NoSQL-базы данных
20%
только OLTP-базы
🔥3
🙌🏼7 платформ федеративного ML
Федеративное обучение также называют совместным, поскольку ML-модели обучаются на нескольких децентрализованных периферийных устройствах или серверах, содержащих локальные выборки данных, без обмена ими. Этот подход отличается от традиционных централизованных ML-методов, когда все локальные наборы данных загружаются на один сервер, а также от более классических децентрализованных подходов с одинаковом распределением локальных данных. Сегодня федеративное обучение активно применяется в оборонной промышленности, телекоммуникациях, фармацевтике и платформах Интернета вещей.
Впервые идеи федеративного Machine Learning были представлены Google в 2017 году для улучшения прогнозирования текста на мобильной клавиатуре с использованием моделей машинного обучения, обученных на основе данных с нескольких устройств. В федеративном ML модели обучаются на нескольких локальных датасетах на локальных узлах без явного обмена данными, но с переодическим обменом параметрами, например, весами и смещениями глубокой нейросети между локальными узлами для создания общей глобальной модели. В отличие от распределенного обучения, изначально направленного на распараллеливание вычислений, федеративное нацелено на обучение разнородным наборам данных. В федеративном ML наборы данных обычно сильно неоднородны по размеру. А клиенты, т.е. конечные устройства, где обучаются локальные модели, могут быть ненадежными и больше подвержены сбоям, чем в системах распределенного обучения, где узлами являются центры обработки данных с мощными вычислительными возможностями. Поэтому, чтобы обеспечить распределенные вычисления и синхронизацию его результатов, федеративное ML требует частого обмена данными между узлами.
Из-за своих архитектурных особенностей федеративное ML имеет ряд недостатков:
• неоднородность между различными локальными наборами данных - каждый узел имеет погрешность по отношению к генеральной совокупности, а размеры выборок могут значительно различаться;
• временная неоднородность - распределение каждого локального датасета меняется со временем;
• необходимо обеспечить совместимость набора данных на всех узлах;
• скрытие обучающих датасетов чревато риском внедрения уязвимостей в глобальную модель;
• отсутствие доступа к глобальным обучающим данным затрудняет выявление нежелательных предубеждений во входных данных для обучения;
• есть риск потери обновлений локальных ML-моделей из-за сбоев на отдельных узлах, что может повлиять на глобальную модель.
Сегодня федеративное ML поддерживается следующими платформами:
• FATE (Federated AI Technology Enabler) https://fate.fedai.org/
• Substra https://www.substra.ai/
• Python-библиотеки PySyft и PyGrid https://github.com/OpenMined/PySyft, https://github.com/OpenMined/PyGrid, https://github.com/OpenMined/pygrid-admin
• Open FL https://github.com/intel/openfl
• TensorFlow Federated (TFF) https://www.tensorflow.org/federated
• IBM Federated Learning https://ibmfl.mybluemix.net/
• NVIDIA CLARA https://developer.nvidia.com/clara
Федеративное обучение также называют совместным, поскольку ML-модели обучаются на нескольких децентрализованных периферийных устройствах или серверах, содержащих локальные выборки данных, без обмена ими. Этот подход отличается от традиционных централизованных ML-методов, когда все локальные наборы данных загружаются на один сервер, а также от более классических децентрализованных подходов с одинаковом распределением локальных данных. Сегодня федеративное обучение активно применяется в оборонной промышленности, телекоммуникациях, фармацевтике и платформах Интернета вещей.
Впервые идеи федеративного Machine Learning были представлены Google в 2017 году для улучшения прогнозирования текста на мобильной клавиатуре с использованием моделей машинного обучения, обученных на основе данных с нескольких устройств. В федеративном ML модели обучаются на нескольких локальных датасетах на локальных узлах без явного обмена данными, но с переодическим обменом параметрами, например, весами и смещениями глубокой нейросети между локальными узлами для создания общей глобальной модели. В отличие от распределенного обучения, изначально направленного на распараллеливание вычислений, федеративное нацелено на обучение разнородным наборам данных. В федеративном ML наборы данных обычно сильно неоднородны по размеру. А клиенты, т.е. конечные устройства, где обучаются локальные модели, могут быть ненадежными и больше подвержены сбоям, чем в системах распределенного обучения, где узлами являются центры обработки данных с мощными вычислительными возможностями. Поэтому, чтобы обеспечить распределенные вычисления и синхронизацию его результатов, федеративное ML требует частого обмена данными между узлами.
Из-за своих архитектурных особенностей федеративное ML имеет ряд недостатков:
• неоднородность между различными локальными наборами данных - каждый узел имеет погрешность по отношению к генеральной совокупности, а размеры выборок могут значительно различаться;
• временная неоднородность - распределение каждого локального датасета меняется со временем;
• необходимо обеспечить совместимость набора данных на всех узлах;
• скрытие обучающих датасетов чревато риском внедрения уязвимостей в глобальную модель;
• отсутствие доступа к глобальным обучающим данным затрудняет выявление нежелательных предубеждений во входных данных для обучения;
• есть риск потери обновлений локальных ML-моделей из-за сбоев на отдельных узлах, что может повлиять на глобальную модель.
Сегодня федеративное ML поддерживается следующими платформами:
• FATE (Federated AI Technology Enabler) https://fate.fedai.org/
• Substra https://www.substra.ai/
• Python-библиотеки PySyft и PyGrid https://github.com/OpenMined/PySyft, https://github.com/OpenMined/PyGrid, https://github.com/OpenMined/pygrid-admin
• Open FL https://github.com/intel/openfl
• TensorFlow Federated (TFF) https://www.tensorflow.org/federated
• IBM Federated Learning https://ibmfl.mybluemix.net/
• NVIDIA CLARA https://developer.nvidia.com/clara
Fate
HOME
An Industrial Grade
Federated Learning Framework
support federated learning architectures and secure computation of any machine learning algorithms
Federated Learning Framework
support federated learning architectures and secure computation of any machine learning algorithms
🔥2
🙌🏼Вычислительная сложность ML-алгоритмов
Когда объем данных невелик, почти любой ML-алгоритм дает приемлемую точность и подходит для решения соответствующей задачи. Но когда объем и размер данных становятся большими, нужно выбирать для обучения ML-модели такой алгоритм, который не требует слишком много вычислительных ресурсов. Лучше выбрать простой или менее затратный в вычислительном отношении алгоритм, чем алгоритм, требующий больших вычислительных ресурсов, когда точность прогнозирования и сложность выполнения аналогичны или даже немного хуже.
Выбор алгоритма зависит от следующих факторов:
• порядок времени (Time Complexity), необходимого для вычисления алгоритма - функция параметров, связанных с данными, самого алгоритма, объема и количества фич
• сложность вычислительного пространства (Space Complexity) - порядок пространства, требуемый во время вычисления алгоритма - функция параметров, связанных с алгоритмом, таких как количество фичей, коэффициентов, скрытых слоев нейросети. Сложность пространства включает в себя как размер входных данных, так и вспомогательное пространство (Auxiliary Space), используемое алгоритмом во время выполнения;.
Например, сортировка слиянием (Mergesort) имеет вспомогательное пространство 𝑂(𝑛) и пространственную сложность 𝑂(𝑛), а быстрая сортировка (Quicksort) имеет вспомогательное пространство 𝑂(1) и пространственную сложность 𝑂(𝑛). В итоге и сортировка слиянием, и быстрая сортировка имеют временную сложность 𝑂(𝑛log𝑛).
https://medium.com/datadailyread/computational-complexity-of-machine-learning-algorithms-16e7ffcafa7d
Когда объем данных невелик, почти любой ML-алгоритм дает приемлемую точность и подходит для решения соответствующей задачи. Но когда объем и размер данных становятся большими, нужно выбирать для обучения ML-модели такой алгоритм, который не требует слишком много вычислительных ресурсов. Лучше выбрать простой или менее затратный в вычислительном отношении алгоритм, чем алгоритм, требующий больших вычислительных ресурсов, когда точность прогнозирования и сложность выполнения аналогичны или даже немного хуже.
Выбор алгоритма зависит от следующих факторов:
• порядок времени (Time Complexity), необходимого для вычисления алгоритма - функция параметров, связанных с данными, самого алгоритма, объема и количества фич
• сложность вычислительного пространства (Space Complexity) - порядок пространства, требуемый во время вычисления алгоритма - функция параметров, связанных с алгоритмом, таких как количество фичей, коэффициентов, скрытых слоев нейросети. Сложность пространства включает в себя как размер входных данных, так и вспомогательное пространство (Auxiliary Space), используемое алгоритмом во время выполнения;.
Например, сортировка слиянием (Mergesort) имеет вспомогательное пространство 𝑂(𝑛) и пространственную сложность 𝑂(𝑛), а быстрая сортировка (Quicksort) имеет вспомогательное пространство 𝑂(1) и пространственную сложность 𝑂(𝑛). В итоге и сортировка слиянием, и быстрая сортировка имеют временную сложность 𝑂(𝑛log𝑛).
https://medium.com/datadailyread/computational-complexity-of-machine-learning-algorithms-16e7ffcafa7d
Medium
Computational Complexity of Machine Learning Algorithms
Pick the right algorithm for your data
👍1
#тест
Избежать переобучения ML-модели на большом объеме сильно зашумленных входных данных, выделив наиболее значимые фичи, поможет
Избежать переобучения ML-модели на большом объеме сильно зашумленных входных данных, выделив наиболее значимые фичи, поможет
Anonymous Quiz
42%
регуляризация L1
23%
регуляризация L2
20%
нормализация
14%
фильтрация
👍6🤔6