💫Визуализация графов с PyGraphistry
PyGraphistry — это ИИ-библиотека Python для визуальных графов, позволяющая извлекать, преобразовывать, анализировать и визуализировать большие графы вместе со сквозными сеансами графического сервера Graphistry. Graphistry создан специально для больших графов. Пользовательский механизм рендеринга WebGL клиента рендерит до 8 миллионов узлов + ребер за раз, а большинство клиентских GPU поддерживают от 100 000 до 2 миллионов элементов. Механизм аналитики графического процессора на стороне сервера поддерживает графы еще большего размера. Graphistry сглаживает графические рабочие процессы в экосистеме PyData, включая датафреймы Pandas/Spark/Dask, графического процессора Nvidia RAPIDS, графы GPU, графовые нейросети DGL/PyTorch и различные коннекторы данных.
PyGraphistry — это дружественный и оптимизированный нативный интерфейс PyData для API-интерфейсов REST Graphistry, не зависящих от языка. Можно использовать PyGraphistry с традиционными источниками данных Python, такими как CSV, SQL, Neo4j, Splunk и другими.
Клиент PyGraphistry Python пригодится следующим категориям пользователей:
• Data scientist: переходите от данных к ускоренным визуальным исследованиям за пару строк, делитесь результатами в реальном времени, создавайте сложные представления в Jupyter Notebook и Google Colab.
• Разработчик: быстро создавайте прототипы потрясающих решений Python с помощью PyGraphistry, встраивайте независимый от языка способ с помощью API REST, настраивая цвета, значки, макеты, JavaScript и пр.
• Аналитик: стройте наглядные дэшборды, используя интерактивный поиск, фильтры, временные шкалы, гистограммы и др., встраивая их в любые фреймворки.
https://github.com/graphistry/pygraphistry
PyGraphistry — это ИИ-библиотека Python для визуальных графов, позволяющая извлекать, преобразовывать, анализировать и визуализировать большие графы вместе со сквозными сеансами графического сервера Graphistry. Graphistry создан специально для больших графов. Пользовательский механизм рендеринга WebGL клиента рендерит до 8 миллионов узлов + ребер за раз, а большинство клиентских GPU поддерживают от 100 000 до 2 миллионов элементов. Механизм аналитики графического процессора на стороне сервера поддерживает графы еще большего размера. Graphistry сглаживает графические рабочие процессы в экосистеме PyData, включая датафреймы Pandas/Spark/Dask, графического процессора Nvidia RAPIDS, графы GPU, графовые нейросети DGL/PyTorch и различные коннекторы данных.
PyGraphistry — это дружественный и оптимизированный нативный интерфейс PyData для API-интерфейсов REST Graphistry, не зависящих от языка. Можно использовать PyGraphistry с традиционными источниками данных Python, такими как CSV, SQL, Neo4j, Splunk и другими.
Клиент PyGraphistry Python пригодится следующим категориям пользователей:
• Data scientist: переходите от данных к ускоренным визуальным исследованиям за пару строк, делитесь результатами в реальном времени, создавайте сложные представления в Jupyter Notebook и Google Colab.
• Разработчик: быстро создавайте прототипы потрясающих решений Python с помощью PyGraphistry, встраивайте независимый от языка способ с помощью API REST, настраивая цвета, значки, макеты, JavaScript и пр.
• Аналитик: стройте наглядные дэшборды, используя интерактивный поиск, фильтры, временные шкалы, гистограммы и др., встраивая их в любые фреймворки.
https://github.com/graphistry/pygraphistry
GitHub
GitHub - graphistry/pygraphistry: PyGraphistry is a Python library to quickly load, shape, embed, and explore big graphs with the…
PyGraphistry is a Python library to quickly load, shape, embed, and explore big graphs with the GPU-accelerated Graphistry visual graph analyzer - graphistry/pygraphistry
👍4
#тест
Ключевое отличие оконных и агрегатных функций в том, что
Ключевое отличие оконных и агрегатных функций в том, что
Anonymous Quiz
1%
разницы в результате нет, но оконные функции сложнее агрегатных
34%
оконные функции сворачивают результат вычислений над группой строк в одно значение
52%
оконные функции не сворачивают результат вычислений над группой строк в одно значение
13%
в агрегатных функциях все строки сохраняют исходную идентичность, результат возвращается для каждой
🔥2
🗣Сколько информации в ваших данных? Ответ от MIT
Информация и данные – это разные вещи. Не все данные одинаковы. Но сколько информации может содержать любой фрагмент данных? Впервые этот вопросы был раскрыт в статье 1948 года «Математическая теория коммуникации» почетного профессора MIT Клода Шеннона. Одним из прорывных результатов Шеннона является идея энтропии, которая позволяет количественно оценить количество информации, присущей любому случайному объекту, включая случайные величины, которые моделируют наблюдаемые данные. Результаты Шеннона заложили основы теории информации и современных телекоммуникаций. Концепция энтропии также оказалась центральной в информатике и машинном обучении.
Но использование формулы Шеннона может быстро стать неразрешимым с вычислительной точки зрения. Это требует точного расчета вероятности данных и всех возможных способов возникновения данных в рамках вероятностной модели. Это становится проблемой в реальных случаях, например, медицинское тестирование, где положительный результат теста является результатом сотен взаимодействующих переменных, и все они неизвестны. Имея всего 10 неизвестных, у данных уже есть 1000 возможных объяснений. С несколькими сотнями возможных объяснений больше, чем атомов в известной Вселенной, что делает вычисление энтропии абсолютно неразрешимой проблемой.
Исследователи MIT разработали новый метод оценки приближений ко многим информационным величинам, таким как энтропия Шеннона, с помощью вероятностного вывода. Работа представлена в статье конференции AISTATS 2022. Ключевой вывод в том, чтобы вместо перечисления всех объяснений, использовать алгоритмы вероятностного вывода. Это поможет сначала сделать вывод, какие объяснения вероятны, а затем использовать их для построения высококачественных оценок энтропии. Доказано, что этот подход, основанный на выводах, может быть намного быстрее и точнее, чем предыдущие подходы.
Оценка энтропии и информации в вероятностной модели принципиально сложна, поскольку часто требует решения многомерной задачи интегрирования. Во многих предыдущих работах были разработаны оценки этих величин для некоторых особых случаев, но новые оценки энтропии через вывод (EEVI) предлагают первый подход, который может дать точные верхние и нижние границы для широкого набора величин, основанных на теории информации. Верхняя и нижняя границы означают, что, хотя мы не знаем истинной энтропии, мы можем получить число, которое меньше ее, и число, которое выше ее. Разница между верхней и нижней границами дает количественное представление о том, насколько мы должны быть уверены в оценках. Используя больше вычислительных ресурсов, можно свести разницу между двумя границами к нулю, что «сжимает» истинное значение с высокой степенью точности. Также можно составить эти границы, чтобы сформировать оценки многих других величин, которые говорят, насколько информативны разные переменные в модели друг для друга.
Новый метод особенно полезен для запроса вероятностных моделей в таких областях, как медицинская диагностика. Например, решать новые запросы, используя богатые генеративные модели для сложных заболеваний, ранее изученных медицинскими экспертами.
https://news.mit.edu/2022/estimating-informativeness-data-0425
Информация и данные – это разные вещи. Не все данные одинаковы. Но сколько информации может содержать любой фрагмент данных? Впервые этот вопросы был раскрыт в статье 1948 года «Математическая теория коммуникации» почетного профессора MIT Клода Шеннона. Одним из прорывных результатов Шеннона является идея энтропии, которая позволяет количественно оценить количество информации, присущей любому случайному объекту, включая случайные величины, которые моделируют наблюдаемые данные. Результаты Шеннона заложили основы теории информации и современных телекоммуникаций. Концепция энтропии также оказалась центральной в информатике и машинном обучении.
Но использование формулы Шеннона может быстро стать неразрешимым с вычислительной точки зрения. Это требует точного расчета вероятности данных и всех возможных способов возникновения данных в рамках вероятностной модели. Это становится проблемой в реальных случаях, например, медицинское тестирование, где положительный результат теста является результатом сотен взаимодействующих переменных, и все они неизвестны. Имея всего 10 неизвестных, у данных уже есть 1000 возможных объяснений. С несколькими сотнями возможных объяснений больше, чем атомов в известной Вселенной, что делает вычисление энтропии абсолютно неразрешимой проблемой.
Исследователи MIT разработали новый метод оценки приближений ко многим информационным величинам, таким как энтропия Шеннона, с помощью вероятностного вывода. Работа представлена в статье конференции AISTATS 2022. Ключевой вывод в том, чтобы вместо перечисления всех объяснений, использовать алгоритмы вероятностного вывода. Это поможет сначала сделать вывод, какие объяснения вероятны, а затем использовать их для построения высококачественных оценок энтропии. Доказано, что этот подход, основанный на выводах, может быть намного быстрее и точнее, чем предыдущие подходы.
Оценка энтропии и информации в вероятностной модели принципиально сложна, поскольку часто требует решения многомерной задачи интегрирования. Во многих предыдущих работах были разработаны оценки этих величин для некоторых особых случаев, но новые оценки энтропии через вывод (EEVI) предлагают первый подход, который может дать точные верхние и нижние границы для широкого набора величин, основанных на теории информации. Верхняя и нижняя границы означают, что, хотя мы не знаем истинной энтропии, мы можем получить число, которое меньше ее, и число, которое выше ее. Разница между верхней и нижней границами дает количественное представление о том, насколько мы должны быть уверены в оценках. Используя больше вычислительных ресурсов, можно свести разницу между двумя границами к нулю, что «сжимает» истинное значение с высокой степенью точности. Также можно составить эти границы, чтобы сформировать оценки многих других величин, которые говорят, насколько информативны разные переменные в модели друг для друга.
Новый метод особенно полезен для запроса вероятностных моделей в таких областях, как медицинская диагностика. Например, решать новые запросы, используя богатые генеративные модели для сложных заболеваний, ранее изученных медицинскими экспертами.
https://news.mit.edu/2022/estimating-informativeness-data-0425
MIT News
Estimating the informativeness of data
MIT researchers discovered a new way to estimate the amount of information contained in a piece of data using probabilistic programming and probabilistic inference. The breakthrough entropy estimators open up new applications in medicine, scientific discovery…
X5 Group запускает собственную платформу Salt
Когда в мире сгущаются тучи – самое время создать собственное облако!
Ритейлер запустил частое облако Salt на основе open source технологий и разработок Х5, которое, как отмечается, позволит сократить стоимость владения IT-инфраструктурой, ускорить time-to-market цифровых проектов и сократить углеродный след за счёт «зелёных» технологий в дата-центрах.
Отдельные компоненты платформы предоставляются внутренним клиентам Х5 как сервис, включая ЦОД как услугу в части хранения и обработки данных. Это позволяет обеспечить доступность на уровне 99,9%.
Когда в мире сгущаются тучи – самое время создать собственное облако!
Ритейлер запустил частое облако Salt на основе open source технологий и разработок Х5, которое, как отмечается, позволит сократить стоимость владения IT-инфраструктурой, ускорить time-to-market цифровых проектов и сократить углеродный след за счёт «зелёных» технологий в дата-центрах.
Отдельные компоненты платформы предоставляются внутренним клиентам Х5 как сервис, включая ЦОД как услугу в части хранения и обработки данных. Это позволяет обеспечить доступность на уровне 99,9%.
🙌🏼МЕГАмасштабирование при квантовом ML
Теоретически квантовые компьютеры могут оказаться более мощными, чем любой обычный компьютер, особенно в задачах нахождения простых множителей чисел — математической основы современного шифрования, которое защищает банковские и другие важные данные. Чем больше компонентов, известных как кубиты, связаны друг с другом в квантовом компьютере, когда несколько частиц могут мгновенно влиять друг на друга, независимо от того, насколько далеко они друг от друга, тем больше его вычислительная мощность может расти в геометрической прогрессии.
Одним из потенциальных применений квантового ML является моделирование квантовых систем, например, химических реакций, чтобы создать новые лекарства. Но средняя производительность ML-алгоритма зависит от того, сколько у него данных. Объем данных в итоге ограничивает производительность машинного обучения. Поэтому для моделирования квантовой системы количество обучающих данных, которые могут потребоваться квантовому компьютеру, будет расти экспоненциально по мере того, как моделируемая система становится больше. Это потенциально нивелирует преимущество квантовых вычислений над классическими.
Ученые предложили связать дополнительные кубиты с квантовой системой, которую должен моделировать квантовый компьютер. Этот дополнительный набор «вспомогательных» кубитов может помочь схеме квантового ML одновременно взаимодействовать со многими квантовыми состояниями в обучающих данных. Так схема квантового ML может работать даже с относительно небольшим количеством вспомогательных устройств. На практике реализовать эту идею пока довольно сложно, но проверить ее можно в рамках экспериментов ЦЕРНа, крупнейшей лаборатории физики элементарных частиц в мире.
https://spectrum.ieee.org/quantum-machine-learning
Теоретически квантовые компьютеры могут оказаться более мощными, чем любой обычный компьютер, особенно в задачах нахождения простых множителей чисел — математической основы современного шифрования, которое защищает банковские и другие важные данные. Чем больше компонентов, известных как кубиты, связаны друг с другом в квантовом компьютере, когда несколько частиц могут мгновенно влиять друг на друга, независимо от того, насколько далеко они друг от друга, тем больше его вычислительная мощность может расти в геометрической прогрессии.
Одним из потенциальных применений квантового ML является моделирование квантовых систем, например, химических реакций, чтобы создать новые лекарства. Но средняя производительность ML-алгоритма зависит от того, сколько у него данных. Объем данных в итоге ограничивает производительность машинного обучения. Поэтому для моделирования квантовой системы количество обучающих данных, которые могут потребоваться квантовому компьютеру, будет расти экспоненциально по мере того, как моделируемая система становится больше. Это потенциально нивелирует преимущество квантовых вычислений над классическими.
Ученые предложили связать дополнительные кубиты с квантовой системой, которую должен моделировать квантовый компьютер. Этот дополнительный набор «вспомогательных» кубитов может помочь схеме квантового ML одновременно взаимодействовать со многими квантовыми состояниями в обучающих данных. Так схема квантового ML может работать даже с относительно небольшим количеством вспомогательных устройств. На практике реализовать эту идею пока довольно сложно, но проверить ее можно в рамках экспериментов ЦЕРНа, крупнейшей лаборатории физики элементарных частиц в мире.
https://spectrum.ieee.org/quantum-machine-learning
IEEE Spectrum
Spooky Action Could Help Boost Quantum Machine Learning
Mysterious quantum links could help lead to exponential scale-up
#тест
Shuffle-операции влияют на скорость выполнения распределенной программы
Shuffle-операции влияют на скорость выполнения распределенной программы
Anonymous Quiz
19%
положительно (ускоряют выполнение запроса)
55%
отрицательно (снижают выполнение запроса)
26%
вообще не влияют на скорость программы
🔥1
👀Оперативный мониторинг ML и ПО-метрик в одной платформе
В реальных системах машинного обучения важно вести непрерывное наблюдение за данными и моделями. Даже сама ML-модель осталась прежней, характер данных мог измениться, что может непосредственно повлиять на пользователей. Сегодня на рынке существует множество платформ, предназначенных для мониторинга ПО, куда собираются различные системные и бизнес-метрики, чтобы отражать наиболее важные данные на наглядных дэшбордах и генерировать уведомления. Например, Grafana, Datadog, Graphite и пр.
Также есть средства для мониторинга ML-систем машинного обучения типа Neptune, Amazon SageMaker Model Monitor, Censius и прочие MLOps-средства. Но можно объединить наблюдение за работой системы машинного обучения с классическим инженерным мониторингом ПО на одной платформе. Это достижимо с помощью New Relic, телеметрической платформы удаленного мониторинга мобильных и веб-приложений, которая позволяет собирать, исследовать и получать оповещения обо всех данных телеметрии из любого источника в одном месте. Благодаря интеграции со многими open-source инструментами New Relic может работать с различными источниками и приемниками данных.
Отправка данных из ML-систем в New Relic реализуется с помощью Python-библиотеки ml-performance-monitoring с открытым исходным кодом, которая доступна на GitHub (https://github.com/newrelic-experimental/ml-performance-monitoring).
https://towardsdatascience.com/monitor-easy-mlops-model-monitoring-with-new-relic-ef2a9b611bd1
В реальных системах машинного обучения важно вести непрерывное наблюдение за данными и моделями. Даже сама ML-модель осталась прежней, характер данных мог измениться, что может непосредственно повлиять на пользователей. Сегодня на рынке существует множество платформ, предназначенных для мониторинга ПО, куда собираются различные системные и бизнес-метрики, чтобы отражать наиболее важные данные на наглядных дэшбордах и генерировать уведомления. Например, Grafana, Datadog, Graphite и пр.
Также есть средства для мониторинга ML-систем машинного обучения типа Neptune, Amazon SageMaker Model Monitor, Censius и прочие MLOps-средства. Но можно объединить наблюдение за работой системы машинного обучения с классическим инженерным мониторингом ПО на одной платформе. Это достижимо с помощью New Relic, телеметрической платформы удаленного мониторинга мобильных и веб-приложений, которая позволяет собирать, исследовать и получать оповещения обо всех данных телеметрии из любого источника в одном месте. Благодаря интеграции со многими open-source инструментами New Relic может работать с различными источниками и приемниками данных.
Отправка данных из ML-систем в New Relic реализуется с помощью Python-библиотеки ml-performance-monitoring с открытым исходным кодом, которая доступна на GitHub (https://github.com/newrelic-experimental/ml-performance-monitoring).
https://towardsdatascience.com/monitor-easy-mlops-model-monitoring-with-new-relic-ef2a9b611bd1
GitHub
GitHub - newrelic-experimental/ml-performance-monitoring: A Python package for sending model inference data, data metrics, and…
A Python package for sending model inference data, data metrics, and model metrics - newrelic-experimental/ml-performance-monitoring
👍1🔥1
🎙 Отборные и бесплатные подкасты, книги и материалы по IT, бизнесу и личностному росту.
🎧 Слушайте лучшие подкасты от самых выдающихся людей планеты на нашем канале и становитесь умнее с каждым шагом 🧠🔥
Развивайтесь вместе с нами ❤️⚡️
🎧 Слушайте лучшие подкасты от самых выдающихся людей планеты на нашем канале и становитесь умнее с каждым шагом 🧠🔥
Развивайтесь вместе с нами ❤️⚡️
❤2
🤷Как быстро сравнить изменения в моделях данных? Datafold в помощь!
Выявить и оценить изменения в разных версиях одной модели данных можно, собственноручно написав свой скрипт или с помощью встроенной в dbt функции наследования данных. Но для обычного бизнес-пользователя или начинающего дата-аналитика это слишком сложно. В этих случаях пригодится Datafold (https://www.datafold.com/) – облачный продукт с множеством полезных функций, включая проверку качества данных, их каталог, мониторинг и оповещение. Функция происхождения данных основана на столбцах и помогает оценивать последующие изменения в пользовательских моделях, в частности, сравнивать изменения между датасетами на уровне столбца и значения. Для крупных проектов пригодится интеграция с dbt. Datafold работает путем прямого подключения к пользовательскому хранилищу данных и использует Github для сравнения изменений, внесенных в модели dbt, чтобы гарантировать сохранение качества данных.
На практике Datafold пригодится продуктовым аналитикам при A/B-тестировании гипотез о пользовательских предпочтениях и использовании продуктовых фич, дата-инженерам – для регрессионного тестирования ETL-конвейеров и пользователям BI-систем для настройки отчетов.
Пример использования: https://medium.com/geekculture/what-if-you-could-compare-changes-in-your-data-models-now-you-can-75f039580d08
Выявить и оценить изменения в разных версиях одной модели данных можно, собственноручно написав свой скрипт или с помощью встроенной в dbt функции наследования данных. Но для обычного бизнес-пользователя или начинающего дата-аналитика это слишком сложно. В этих случаях пригодится Datafold (https://www.datafold.com/) – облачный продукт с множеством полезных функций, включая проверку качества данных, их каталог, мониторинг и оповещение. Функция происхождения данных основана на столбцах и помогает оценивать последующие изменения в пользовательских моделях, в частности, сравнивать изменения между датасетами на уровне столбца и значения. Для крупных проектов пригодится интеграция с dbt. Datafold работает путем прямого подключения к пользовательскому хранилищу данных и использует Github для сравнения изменений, внесенных в модели dbt, чтобы гарантировать сохранение качества данных.
На практике Datafold пригодится продуктовым аналитикам при A/B-тестировании гипотез о пользовательских предпочтениях и использовании продуктовых фич, дата-инженерам – для регрессионного тестирования ETL-конвейеров и пользователям BI-систем для настройки отчетов.
Пример использования: https://medium.com/geekculture/what-if-you-could-compare-changes-in-your-data-models-now-you-can-75f039580d08
Datafold
Datafold | Automate Data Engineering — AI-Powered Migrations, Optimization & Development
Datafold is the data engineering automation platform. AI-powered migrations delivered in weeks with guaranteed outcomes, plus data quality tools for CI/CD testing, monitoring, and AI agent integrations via MCP.
👍4
#тест
На маленьких связанных (зависимых) выборках для проверки гипотезы о различиях между ними подойдет статистический критерий
На маленьких связанных (зависимых) выборках для проверки гипотезы о различиях между ними подойдет статистический критерий
Anonymous Quiz
34%
t-критерий Стьюдента
24%
U-критерий Манна — Уитни
19%
Т-критерий Вилкоксона
23%
Критерий согласия Пирсона
🔥6
💫ИИ + квантовые вычисления = квантовый мемристор
Ученые Австрии и Италии создали первый прототип устройства, известного как квантовый мемристор, который может объединить методы искусственного интеллекта с квантовыми вычислениями. Мемристор, или резистор памяти, является своего рода строительным блоком для электронных схем. Первые идеи об этом устройстве прозвучали еще полвека назад, но впервые оно было создано около 10 лет назад. Оно Эти представляет собой электрический переключатель, который запоминает свое состояние (вкл или выкл) после отключения питания, аналогично синапсам — связям между нейронами в человеческом мозге, электрическая проводимость которых усиливается или ослабевает в зависимости от того, сколько электрического заряда прошло через них в прошлом.
Теоретически мемристоры могут действовать как искусственные нейроны, способные как вычислять, так и хранить данные. Поэтому нейроморфные (мозгоподобные) компьютеры на мемристорах будут хорошо работать с искусственными нейросетями, т.е. системами ML.
В отличие от классических компьютеров, которые включают или выключают транзисторы, чтобы символизировать данные как 1 или 0, квантовые используют кубиты. Кубиты могут находиться в состоянии суперпозиции, когда они одновременно равны 1 и 0. Чем больше кубитов связано вместе в квантовом компьютере, тем больше его вычислительная мощность может расти в геометрической прогрессии.
Квантовый мемристор опирается на поток фотонов, существующих в суперпозициях, где каждый отдельный фотон может путешествовать по двум отдельным путям, нанесенным лазером на стекло. Один из каналов в этой интегрированной фотонной схеме с одним кубитом используется для измерения потока этих фотонов, и эти данные через сложную электронную схему обратной связи контролируют передачи по другому пути. В итоге устройство ведет себя как мемристор.
Обычно мемристивное поведение и квантовые эффекты не существуют вместе. Мемристоры работают путем измерения своих внутренних данных, а квантовые эффекты отличаются хрупкостью, когда речь идет о любом внешнем вмешательстве, таком как измерения. Исследователи преодолели это противоречие, разработав взаимодействия внутри своего устройства, чтобы они были достаточно сильными, чтобы обеспечить мемристивность, но достаточно слабыми, чтобы сохранить квантовое поведение.
Преимущество использования квантового мемристора в квантовом ML по сравнению с обычными квантовыми схемами заключается в том, что мемристор, в отличие от любого другого квантового компонента, имеет память. Следующим шагом является соединение нескольких мемристоров вместе, увеличение количества фотонов в каждом мемристоре и количества состояний, в которых они могут существовать в каждом устройстве.
https://spectrum.ieee.org/quantum-memristor
Ученые Австрии и Италии создали первый прототип устройства, известного как квантовый мемристор, который может объединить методы искусственного интеллекта с квантовыми вычислениями. Мемристор, или резистор памяти, является своего рода строительным блоком для электронных схем. Первые идеи об этом устройстве прозвучали еще полвека назад, но впервые оно было создано около 10 лет назад. Оно Эти представляет собой электрический переключатель, который запоминает свое состояние (вкл или выкл) после отключения питания, аналогично синапсам — связям между нейронами в человеческом мозге, электрическая проводимость которых усиливается или ослабевает в зависимости от того, сколько электрического заряда прошло через них в прошлом.
Теоретически мемристоры могут действовать как искусственные нейроны, способные как вычислять, так и хранить данные. Поэтому нейроморфные (мозгоподобные) компьютеры на мемристорах будут хорошо работать с искусственными нейросетями, т.е. системами ML.
В отличие от классических компьютеров, которые включают или выключают транзисторы, чтобы символизировать данные как 1 или 0, квантовые используют кубиты. Кубиты могут находиться в состоянии суперпозиции, когда они одновременно равны 1 и 0. Чем больше кубитов связано вместе в квантовом компьютере, тем больше его вычислительная мощность может расти в геометрической прогрессии.
Квантовый мемристор опирается на поток фотонов, существующих в суперпозициях, где каждый отдельный фотон может путешествовать по двум отдельным путям, нанесенным лазером на стекло. Один из каналов в этой интегрированной фотонной схеме с одним кубитом используется для измерения потока этих фотонов, и эти данные через сложную электронную схему обратной связи контролируют передачи по другому пути. В итоге устройство ведет себя как мемристор.
Обычно мемристивное поведение и квантовые эффекты не существуют вместе. Мемристоры работают путем измерения своих внутренних данных, а квантовые эффекты отличаются хрупкостью, когда речь идет о любом внешнем вмешательстве, таком как измерения. Исследователи преодолели это противоречие, разработав взаимодействия внутри своего устройства, чтобы они были достаточно сильными, чтобы обеспечить мемристивность, но достаточно слабыми, чтобы сохранить квантовое поведение.
Преимущество использования квантового мемристора в квантовом ML по сравнению с обычными квантовыми схемами заключается в том, что мемристор, в отличие от любого другого квантового компонента, имеет память. Следующим шагом является соединение нескольких мемристоров вместе, увеличение количества фотонов в каждом мемристоре и количества состояний, в которых они могут существовать в каждом устройстве.
https://spectrum.ieee.org/quantum-memristor
IEEE Spectrum
AI Fuses With Quantum Computing in Promising New Memristor
Scientists in Austria and Italy have developed a quantum memristor they suggest could lead to quantum neuromorphic computers. Using computer simulations, they find quantum memristors could deliver exponential performance growth in a machine learning approach…
👍2
🌞Разработка на Python по 12 принципам SaaS c библиотекой Python-dotenv
Разработчики ML-моделей и аналитики данных не всегда чисто пишут код, как профессиональные программисты. Улучшить качество кода поможет простая методология разработки веб-приложений или SaaS, которая рекомендует:
• использовать декларативные форматы для автоматизации настройки, чтобы сократить время и силы новых разработчиков, присоединяющихся к проекту;
• иметь чистый контракт с базовой операционной системой, обеспечивающий максимальную переносимость между средами выполнения;
• запускать развертывания на современных облачных платформах, избавляя от необходимости администрирования серверов и систем;
• сокращать расхождения между разработкой и производством, обеспечивая непрерывное развертывание для максимальной гибкости;
• масштабироваться без существенных изменений в инструментарии, архитектуре или методах разработки.
Для реализации этих идей SaaS предлагает строить приложения по 12 принципам:
1. Одна кодовая база отслеживается в системе контроля версий, множество развертываний
2. Явно объявить и изолировать зависимости
3. Хранить конфигурацию в среде
4. Относиться к вспомогательным сервисам как к присоединенным ресурсам
5. Строго разделять этапы сборки и запуска
6. Исполнять приложение как один или несколько stateless-процессов
7. Экспортировать сервисы через привязку к порту
8. Обеспечивать параллелизм через масштабирование с помощью модели процесса
9. Максимальная надежность благодаря быстрому запуску и плавному завершению работы
10. Переносимость и похожесть сред от разработки до производства через тестовую
11. Логировать, чтобы рассматривать журналы как потоки событий
12. Выполнять задачи администрирования/управления как одноразовых процессов
Реализовать все это для Python-программы поможет открытая библиотека Python-dotenv. Она считывает пары ключ-значение из файла .env и может устанавливать их как переменные среды. Если приложение берет конфигурацию из переменных среды, запуск его в процессе разработки не очень практичен, т.к. разработчику нужно установить эти переменные среды самостоятельно. Добавив Python-dotenv в свое приложение, можно упростить процесс разработки. Библиотека сама загрузит конфигурацию из файла .env, оставаясь при этом настраиваемым через среду.
Также библиотека может загрузить конфигурацию без изменения среды, распарсить конфигурацию как поток и загрузить файлы .env в IPython. Инструмент также имеет CLI-интерфейс, чтобы манипулировать файлом .env, не открывая его вручную.
https://github.com/theskumar/python-dotenv
Разработчики ML-моделей и аналитики данных не всегда чисто пишут код, как профессиональные программисты. Улучшить качество кода поможет простая методология разработки веб-приложений или SaaS, которая рекомендует:
• использовать декларативные форматы для автоматизации настройки, чтобы сократить время и силы новых разработчиков, присоединяющихся к проекту;
• иметь чистый контракт с базовой операционной системой, обеспечивающий максимальную переносимость между средами выполнения;
• запускать развертывания на современных облачных платформах, избавляя от необходимости администрирования серверов и систем;
• сокращать расхождения между разработкой и производством, обеспечивая непрерывное развертывание для максимальной гибкости;
• масштабироваться без существенных изменений в инструментарии, архитектуре или методах разработки.
Для реализации этих идей SaaS предлагает строить приложения по 12 принципам:
1. Одна кодовая база отслеживается в системе контроля версий, множество развертываний
2. Явно объявить и изолировать зависимости
3. Хранить конфигурацию в среде
4. Относиться к вспомогательным сервисам как к присоединенным ресурсам
5. Строго разделять этапы сборки и запуска
6. Исполнять приложение как один или несколько stateless-процессов
7. Экспортировать сервисы через привязку к порту
8. Обеспечивать параллелизм через масштабирование с помощью модели процесса
9. Максимальная надежность благодаря быстрому запуску и плавному завершению работы
10. Переносимость и похожесть сред от разработки до производства через тестовую
11. Логировать, чтобы рассматривать журналы как потоки событий
12. Выполнять задачи администрирования/управления как одноразовых процессов
Реализовать все это для Python-программы поможет открытая библиотека Python-dotenv. Она считывает пары ключ-значение из файла .env и может устанавливать их как переменные среды. Если приложение берет конфигурацию из переменных среды, запуск его в процессе разработки не очень практичен, т.к. разработчику нужно установить эти переменные среды самостоятельно. Добавив Python-dotenv в свое приложение, можно упростить процесс разработки. Библиотека сама загрузит конфигурацию из файла .env, оставаясь при этом настраиваемым через среду.
Также библиотека может загрузить конфигурацию без изменения среды, распарсить конфигурацию как поток и загрузить файлы .env в IPython. Инструмент также имеет CLI-интерфейс, чтобы манипулировать файлом .env, не открывая его вручную.
https://github.com/theskumar/python-dotenv
GitHub
GitHub - theskumar/python-dotenv: Reads key-value pairs from a .env file and can set them as environment variables. It helps in…
Reads key-value pairs from a .env file and can set them as environment variables. It helps in developing applications following the 12-factor principles. - theskumar/python-dotenv
🔥1
🌞В июне можно посетить следующие DS-мероприятия:
• 9 июня - вебинар по BI-сервису Яндекса - Yandex DataLens: безопасность и разграничение прав доступа https://cloud.yandex.ru/events/575
• 10 июня - публичная лекция на тему «Знакомимся с квантовым машинным обучением (QML)». Вебинар ведет доктор технических наук, профессор кафедры прикладной математики и информатики ВШЭ Владимир Крылов. Регистрация
• 14 июня - DataStart - бесплатная онлайн-конференция по Data Science, машинному обучению и нейросетям https://datastart.ru/
• 22 июня - Artificial Intelligence Day – практическая конференция TAdviser https://www.tadviser.ru/a/635999
• 22 июня - Цифровая медицина 2022 – конференция на площадке Конгресс-центра ЦМТ Москвы https://it-events.com/events/22889
• 23 июня - Kuber Conf — главная в России конференция по Kubernetes. Офис Яндекса, Москва, улица Льва Толстого, 16, подъезд Экстрополис. Мероприятие бесплатное, но вход только по приглашениям. https://cloud.yandex.ru/events/579
• 25 июня - DataDriven 2022 - ежегодная конференция Яндекса для специалистов, использующих анализ данных для принятия бизнес-решений. Офис Яндекса, Москва, улица Льва Толстого, 16, подъезд Экстрополис. Мероприятие бесплатное, но вход только по приглашениям. https://events.yandex.ru/events/data-driven-2022
• 9 июня - вебинар по BI-сервису Яндекса - Yandex DataLens: безопасность и разграничение прав доступа https://cloud.yandex.ru/events/575
• 10 июня - публичная лекция на тему «Знакомимся с квантовым машинным обучением (QML)». Вебинар ведет доктор технических наук, профессор кафедры прикладной математики и информатики ВШЭ Владимир Крылов. Регистрация
• 14 июня - DataStart - бесплатная онлайн-конференция по Data Science, машинному обучению и нейросетям https://datastart.ru/
• 22 июня - Artificial Intelligence Day – практическая конференция TAdviser https://www.tadviser.ru/a/635999
• 22 июня - Цифровая медицина 2022 – конференция на площадке Конгресс-центра ЦМТ Москвы https://it-events.com/events/22889
• 23 июня - Kuber Conf — главная в России конференция по Kubernetes. Офис Яндекса, Москва, улица Льва Толстого, 16, подъезд Экстрополис. Мероприятие бесплатное, но вход только по приглашениям. https://cloud.yandex.ru/events/579
• 25 июня - DataDriven 2022 - ежегодная конференция Яндекса для специалистов, использующих анализ данных для принятия бизнес-решений. Офис Яндекса, Москва, улица Льва Толстого, 16, подъезд Экстрополис. Мероприятие бесплатное, но вход только по приглашениям. https://events.yandex.ru/events/data-driven-2022
yandex.cloud
Yandex DataLens: безопасность и разграничение прав доступа
Рассказали, как обеспечить комфортную и безопасную работу вашей команды с аналитикой, разобрались в текущих нюансах.
🔥1
#тест
В чем разница между проекцией и представлением в реляционных базах данных?
В чем разница между проекцией и представлением в реляционных базах данных?
Anonymous Quiz
9%
нет разницы, это одно и то же
23%
представление - это процесс, а проекция - результат
36%
проекция - это процесс, а представление - результат
31%
это вообще не связанные и не сравниваемые понятия
👍4
🔥LAION-5B: открытый датасет для мульти-модального ML на 5+ миллиардов пар «текст-изображение»
31 мая 2022 года некоммерческая организация ИИ-исследователей представила крупнейший набор данных из 5,85 миллиардов пар изображение-текст, отфильтрованных с помощью CLIP. LAION-5B в 14 раз больше своего предшественника - LAION-400M, который ранее был самым большим в мире открытым набором данных изображение-текст.
2,3 миллиардов пар англоязычные, а вторая половина датасета содержит образцы из более чем 100 других языков. Еще в набор данных входят несколько индексов ближайших соседей, улучшенный веб-интерфейс для исследования и создания подмножеств, а также оценки обнаружения водяных знаков и NSFW. Датасет рекомендуется для исследовательских целей и специально не контролируется.
Весь 5-миллиардный набор данных разбит на 3 датасета, каждый из которых можно скачать отдельно . Все они имеют следующую структуру столбцов:
• URL-адрес изображения
• TEXT - субтитры, на английском для en, на других языках для multi и nolang
• WIDTH - ширина изображения
• HEIGHT - высота изображения
• LANGUAGE - язык образца, только для laion2B-multi, вычисляется с помощью cld3
• Similarity – подобие, косинус между текстом и изображением эмбеддинга ViT-B/32, clip для en, mclip для multi и nolang
• Pwatermark - вероятность изображения с водяным знаком, рассчитанная с помощью laion-детектора водяных знаков
• Punsafe - вероятность того, что изображение является небезопасным, вычисляется с помощью laion-детектора клипов.
pwatermark и punsafe доступны либо как отдельные коллекции, которые должны быть соединены join’ом с помощью хэша url+text.
Подробности и ссылки для загрузки: https://laion.ai/laion-5b-a-new-era-of-open-large-scale-multi-modal-datasets/
31 мая 2022 года некоммерческая организация ИИ-исследователей представила крупнейший набор данных из 5,85 миллиардов пар изображение-текст, отфильтрованных с помощью CLIP. LAION-5B в 14 раз больше своего предшественника - LAION-400M, который ранее был самым большим в мире открытым набором данных изображение-текст.
2,3 миллиардов пар англоязычные, а вторая половина датасета содержит образцы из более чем 100 других языков. Еще в набор данных входят несколько индексов ближайших соседей, улучшенный веб-интерфейс для исследования и создания подмножеств, а также оценки обнаружения водяных знаков и NSFW. Датасет рекомендуется для исследовательских целей и специально не контролируется.
Весь 5-миллиардный набор данных разбит на 3 датасета, каждый из которых можно скачать отдельно . Все они имеют следующую структуру столбцов:
• URL-адрес изображения
• TEXT - субтитры, на английском для en, на других языках для multi и nolang
• WIDTH - ширина изображения
• HEIGHT - высота изображения
• LANGUAGE - язык образца, только для laion2B-multi, вычисляется с помощью cld3
• Similarity – подобие, косинус между текстом и изображением эмбеддинга ViT-B/32, clip для en, mclip для multi и nolang
• Pwatermark - вероятность изображения с водяным знаком, рассчитанная с помощью laion-детектора водяных знаков
• Punsafe - вероятность того, что изображение является небезопасным, вычисляется с помощью laion-детектора клипов.
pwatermark и punsafe доступны либо как отдельные коллекции, которые должны быть соединены join’ом с помощью хэша url+text.
Подробности и ссылки для загрузки: https://laion.ai/laion-5b-a-new-era-of-open-large-scale-multi-modal-datasets/
🔥3
🔥GATO: новая SOTA от DeepMind
19 мая 2022 года исследователи DeepMind опубликовали статью о новом едином универсальном агенте за пределами области текстовых выходов. GATO работает как мульти-модальная, многозадачная, многовариантная универсальная политика. В одной и той же сети с теми же весами можно играть в Atari, записывать изображения, общаться в чате, манипулировать блоками и решать другие задачи на основе своего контекста: генерировать текст, определять оптимальные крутящие моменты в суставах, события нажатия кнопок и пр.
GATO обучается на большом количестве наборов данных, включающих опыт агентов как в смоделированных, так и в реальных средах, в дополнение к множеству наборов данных на естественном языке и изображениях. На этапе обучения GATO данные из различных задач и модальностей сериализуются в плоскую последовательность токенов, группируются и обрабатываются нейросетью-трансформером, аналогичной большой языковой модели. Потери маскируются, поэтому GATO предсказывает только действия и текстовые цели.
При развертывании Gato токенизируется подсказка-демонстрация, образуя начальную последовательность. Затем среда выдает первое наблюдение, которое также токенизируется и добавляется к последовательности. GATO авторегрессивно выбирает вектор действия, по одному токену за раз. После того, как все маркеры, составляющие вектор действия, выбраны (определены спецификацией действия среды), действие декодируется и отправляется в среду, которая выполняет шаги и дает новое наблюдение. Затем процедура повторяется. Модель всегда видит все предыдущие наблюдения и действия в своем контекстном окне из 1024 токенов.
https://www.deepmind.com/publications/a-generalist-agent
19 мая 2022 года исследователи DeepMind опубликовали статью о новом едином универсальном агенте за пределами области текстовых выходов. GATO работает как мульти-модальная, многозадачная, многовариантная универсальная политика. В одной и той же сети с теми же весами можно играть в Atari, записывать изображения, общаться в чате, манипулировать блоками и решать другие задачи на основе своего контекста: генерировать текст, определять оптимальные крутящие моменты в суставах, события нажатия кнопок и пр.
GATO обучается на большом количестве наборов данных, включающих опыт агентов как в смоделированных, так и в реальных средах, в дополнение к множеству наборов данных на естественном языке и изображениях. На этапе обучения GATO данные из различных задач и модальностей сериализуются в плоскую последовательность токенов, группируются и обрабатываются нейросетью-трансформером, аналогичной большой языковой модели. Потери маскируются, поэтому GATO предсказывает только действия и текстовые цели.
При развертывании Gato токенизируется подсказка-демонстрация, образуя начальную последовательность. Затем среда выдает первое наблюдение, которое также токенизируется и добавляется к последовательности. GATO авторегрессивно выбирает вектор действия, по одному токену за раз. После того, как все маркеры, составляющие вектор действия, выбраны (определены спецификацией действия среды), действие декодируется и отправляется в среду, которая выполняет шаги и дает новое наблюдение. Затем процедура повторяется. Модель всегда видит все предыдущие наблюдения и действия в своем контекстном окне из 1024 токенов.
https://www.deepmind.com/publications/a-generalist-agent
Google DeepMind
Publications
Explore a selection of our recent research on some of the most complex and interesting challenges in AI.
🔥2
Forwarded from Алексей Чернобровов
🔥Новая SOTA: Mask DINO для обнаружения и сегментации объектов 🦖
CNN-сети и трансформерная архитектура активно используется в задачах компьютерного зрения, особенно для обнаружения и сегментации объектов на фото и видео. В последнее время трансформерные архитектуры показывают отличные результаты. Одной из них является DETR (End-to-End Object Detection with Transformers), который вышел в мае 2020 года. Тут трансформеры применяются не к изображению, а к фичам, выделенным сверточной сетью. Хотя DETR открыл путь к возможности использования трансформеров для компьютерного зрения, его тяжело использовать на практике из-за слишком долгого времени обучения и отсутствия универсальности. В июне 2022 года исследователи из Китая представили Mask DINO - унифицированную структуру обнаружения и сегментации объектов.
По сути, Mask DINO можно назвать новым state-of-the-art (SOTA) решением, которое расширяет структуру DINO (DETR с улучшенными блоками привязки шумоподавления), добавляя ветвь предсказания маски. Маска поддерживает все задачи сегментации изображения (инстанс, семантическую и паноптическую). Некоторые ключевые компоненты DINO расширены для сегментации за счет общей архитектуры и процесса обучения.
Структура Mask DINO проста, эффективна, масштабируема и выигрывает от объединенных крупномасштабных наборов данных обнаружения и сегментации.
Примечательно, что Mask DINO показывает наилучшие на сегодняшний день результаты по инстанс сегментации (54,5 AP на COCO), паноптической сегментации (59,4 PQ на COCO) и семантической сегментации (60,8 мМЕ на ADE20K).
📃 Полное описание в статье авторов: https://arxiv.org/pdf/2206.02777v1.pdf
🐈⬛ Код на Github: https://github.com/IDEACVR/MaskDINO
CNN-сети и трансформерная архитектура активно используется в задачах компьютерного зрения, особенно для обнаружения и сегментации объектов на фото и видео. В последнее время трансформерные архитектуры показывают отличные результаты. Одной из них является DETR (End-to-End Object Detection with Transformers), который вышел в мае 2020 года. Тут трансформеры применяются не к изображению, а к фичам, выделенным сверточной сетью. Хотя DETR открыл путь к возможности использования трансформеров для компьютерного зрения, его тяжело использовать на практике из-за слишком долгого времени обучения и отсутствия универсальности. В июне 2022 года исследователи из Китая представили Mask DINO - унифицированную структуру обнаружения и сегментации объектов.
По сути, Mask DINO можно назвать новым state-of-the-art (SOTA) решением, которое расширяет структуру DINO (DETR с улучшенными блоками привязки шумоподавления), добавляя ветвь предсказания маски. Маска поддерживает все задачи сегментации изображения (инстанс, семантическую и паноптическую). Некоторые ключевые компоненты DINO расширены для сегментации за счет общей архитектуры и процесса обучения.
Структура Mask DINO проста, эффективна, масштабируема и выигрывает от объединенных крупномасштабных наборов данных обнаружения и сегментации.
Примечательно, что Mask DINO показывает наилучшие на сегодняшний день результаты по инстанс сегментации (54,5 AP на COCO), паноптической сегментации (59,4 PQ на COCO) и семантической сегментации (60,8 мМЕ на ADE20K).
📃 Полное описание в статье авторов: https://arxiv.org/pdf/2206.02777v1.pdf
🐈⬛ Код на Github: https://github.com/IDEACVR/MaskDINO
👍1
⚡️ Аналитика данных - блог ведущего Дата саентиста, работающего в Uber, одного из авторов 🔥 Machine Learning ru. Материал канала поможет реально вырасти до профессионала по работе с данными.
1 канал вместо тысячи учебников и курсов, подписывайтесь: 👇👇👇
🚀 @data_analysis_ml
1 канал вместо тысячи учебников и курсов, подписывайтесь: 👇👇👇
🚀 @data_analysis_ml
Forwarded from Deep Dive 2 Deep Learning
🙌🏼Imagen от Google AI
В мае 2022 года исследователи Google AI представили Imagen - модель перевода текста в фотореалистичное изображение с глубоким уровнем понимания языка. Imagen основа на больших языковых трансформерных моделях, предварительно обученных на тектстовых корпусах. Эксперименты показали, что Imagen достигает 7,27 баллов по FID в наборе данных COCO, даже без предварительного обучения, превосходя DALL-E 2 от OpenAI по степени реалистичности изображений.
Поскольку Imagen обучалась на неконтролируемом людьми датасете LAION-400M с 400+ миллионами пар изображение-текст, взятых из Интернета, модель подвержена предвзятости. Поэтому Google AI пока не выпускает ее в открытый доступ. Но посмотреть, как это работает и что внутри, можно уже сейчас: https://imagen.research.google/
В мае 2022 года исследователи Google AI представили Imagen - модель перевода текста в фотореалистичное изображение с глубоким уровнем понимания языка. Imagen основа на больших языковых трансформерных моделях, предварительно обученных на тектстовых корпусах. Эксперименты показали, что Imagen достигает 7,27 баллов по FID в наборе данных COCO, даже без предварительного обучения, превосходя DALL-E 2 от OpenAI по степени реалистичности изображений.
Поскольку Imagen обучалась на неконтролируемом людьми датасете LAION-400M с 400+ миллионами пар изображение-текст, взятых из Интернета, модель подвержена предвзятости. Поэтому Google AI пока не выпускает ее в открытый доступ. Но посмотреть, как это работает и что внутри, можно уже сейчас: https://imagen.research.google/
👍3
#тест
Ложное срабатывание датчика автосигнализации (без реальной угрозы) - это пример ошибки
Ложное срабатывание датчика автосигнализации (без реальной угрозы) - это пример ошибки
Anonymous Quiz
51%
первого рода
33%
второго рода
9%
зависит от заданного уровня статистической значимости
7%
это вообще не ошибка
🔥6
Если меня спросить, что лучше: работа мечты или One Day Offer. Я посоветую: «One Day Offer». Потому что One Day Offer может привести к работе мечты.
Сегодня многие компании проводят One Day Offer в том числе и Сбер. Поэтому вы можете стать частью команды Сбера за 1 день!
Сбер ищет дата-сайентистов в Москве и Нижнем Новгороде. Подходит, если вы технарь уровня Middle, Senior или Lead с опытом в DS/ML больше 2 лет, который без труда кодит на Python. А если работали с рекомендательными системами — ещё лучше.
Каков порядок действий?
Посещаете 25 июня One Day Offer → проходите интервью → в тот же день получаете предложение, о котором мечтали → вместе с командой Сбера создаёте платформу, которая поможет создавать персональные рекомендации в разных сферах бизнеса.
Участвовать в One Day Offer
Сегодня многие компании проводят One Day Offer в том числе и Сбер. Поэтому вы можете стать частью команды Сбера за 1 день!
Сбер ищет дата-сайентистов в Москве и Нижнем Новгороде. Подходит, если вы технарь уровня Middle, Senior или Lead с опытом в DS/ML больше 2 лет, который без труда кодит на Python. А если работали с рекомендательными системами — ещё лучше.
Каков порядок действий?
Посещаете 25 июня One Day Offer → проходите интервью → в тот же день получаете предложение, о котором мечтали → вместе с командой Сбера создаёте платформу, которая поможет создавать персональные рекомендации в разных сферах бизнеса.
Участвовать в One Day Offer
👍4