🙌🏻Генерация трехмерных сцен из 2-мерных фото с NeRF от NVIDIA
Инверсный рендеринг давно использует ИИ для аппроксимации поведения света в реальном мире, что позволяет реконструировать 3D-сцену из нескольких 2D-изображений, снятых под разными углами. Исследовательская группа NVIDIA разработала подход, который решает эту задачу почти мгновенно, сочетая сверхбыстрое обучение нейронной сети и быстрый рендеринг.
NVIDIA применила этот подход к популярной новой технологии, называемой нейронными полями излучения, или NeRF. Результат, получивший название Instant NeRF, является самой быстрой технологией NeRF на сегодняшний день, достигающей в некоторых случаях более чем 1000-кратного ускорения. Модели нужно всего несколько секунд, чтобы обучиться на нескольких десятках неподвижных фотографий — плюс данные о ракурсах камеры, с которых они были сделаны — и затем она может визуализировать результирующую 3D-сцену в течение десятков миллисекунд.
NeRF используют нейронные сети для представления и рендеринга реалистичных 3D-сцен на основе входной коллекции 2D-изображений. Сбор данных для передачи NeRF напоминает работу фотографа на красной ковровой дорожке: нейросети надо несколько десятков изображений, сделанных с разных точек сцены, а также положение камеры каждого из них.
Обычно создание 3D-сцены традиционными методами занимает несколько часов или больше, в зависимости от сложности и разрешения визуализации. Внедрение ИИ в картину ускоряет работу. Ранние модели NeRF рендерили четкие сцены без артефактов за несколько минут, но на обучение уходили часы. Instant NeRF сокращает время рендеринга на несколько порядков. Он основан на кодировании хэш-сетки с несколькими разрешениями, которая оптимизирована для эффективной работы на графических процессорах NVIDIA. Так можно добиться высококачественных результатов, используя быструю и небольшую нейронную сеть.
Модель разработана с использованием набора инструментов NVIDIA CUDA и библиотеки нейронных сетей Tiny CUDA. Благодаря легковесности нейросеть можно обучить и запустить на одном графическом процессоре NVIDIA — быстрее всего она работает на картах с тензорными ядрами NVIDIA.
Эта технология пригодится для обучения роботов и беспилотных автомобилей, чтобы они могли понимать размер и форму объектов реального мира путем захвата их 2D-изображений или видеозаписей. Его также можно использовать в архитектуре и развлечениях для быстрого создания цифровых представлений реальных сред, которые создатели могут изменять и использовать.
https://blogs.nvidia.com/blog/2022/03/25/instant-nerf-research-3d-ai/
Инверсный рендеринг давно использует ИИ для аппроксимации поведения света в реальном мире, что позволяет реконструировать 3D-сцену из нескольких 2D-изображений, снятых под разными углами. Исследовательская группа NVIDIA разработала подход, который решает эту задачу почти мгновенно, сочетая сверхбыстрое обучение нейронной сети и быстрый рендеринг.
NVIDIA применила этот подход к популярной новой технологии, называемой нейронными полями излучения, или NeRF. Результат, получивший название Instant NeRF, является самой быстрой технологией NeRF на сегодняшний день, достигающей в некоторых случаях более чем 1000-кратного ускорения. Модели нужно всего несколько секунд, чтобы обучиться на нескольких десятках неподвижных фотографий — плюс данные о ракурсах камеры, с которых они были сделаны — и затем она может визуализировать результирующую 3D-сцену в течение десятков миллисекунд.
NeRF используют нейронные сети для представления и рендеринга реалистичных 3D-сцен на основе входной коллекции 2D-изображений. Сбор данных для передачи NeRF напоминает работу фотографа на красной ковровой дорожке: нейросети надо несколько десятков изображений, сделанных с разных точек сцены, а также положение камеры каждого из них.
Обычно создание 3D-сцены традиционными методами занимает несколько часов или больше, в зависимости от сложности и разрешения визуализации. Внедрение ИИ в картину ускоряет работу. Ранние модели NeRF рендерили четкие сцены без артефактов за несколько минут, но на обучение уходили часы. Instant NeRF сокращает время рендеринга на несколько порядков. Он основан на кодировании хэш-сетки с несколькими разрешениями, которая оптимизирована для эффективной работы на графических процессорах NVIDIA. Так можно добиться высококачественных результатов, используя быструю и небольшую нейронную сеть.
Модель разработана с использованием набора инструментов NVIDIA CUDA и библиотеки нейронных сетей Tiny CUDA. Благодаря легковесности нейросеть можно обучить и запустить на одном графическом процессоре NVIDIA — быстрее всего она работает на картах с тензорными ядрами NVIDIA.
Эта технология пригодится для обучения роботов и беспилотных автомобилей, чтобы они могли понимать размер и форму объектов реального мира путем захвата их 2D-изображений или видеозаписей. Его также можно использовать в архитектуре и развлечениях для быстрого создания цифровых представлений реальных сред, которые создатели могут изменять и использовать.
https://blogs.nvidia.com/blog/2022/03/25/instant-nerf-research-3d-ai/
NVIDIA Blog
NVIDIA Research Turns 2D Photos Into 3D Scenes in the Blink of an AI
Instant NeRF is a neural rendering model that learns a high-res 3D scene in seconds — and can render images of it in a few milliseconds.
👍2
#тест
Градиентный бустинг основан на
Градиентный бустинг основан на
Anonymous Quiz
12%
линейной регрессии
74%
ансамбле деревьев решений
4%
опорных векторах
10%
логистической регрессии
🔥4🤔2
🗣👂🏻Снижение шума в квантовых компьютерах: исследование MIT
Квантовые компьютеры очень чувствительны к шумовым помехам, которые вызываются несовершенными управляющими сигналами, возмущениями окружающей среды и нежелательными взаимодействиями между кубитами. Поэтому исследователи из MIT создали QuantumNAS - структуру, которая может идентифицировать наиболее надежную квантовую схему для конкретной вычислительной задачи и генерировать шаблон отображения, адаптированный к кубитам целевого квантового процессора. устройство. QuantumNAS требует гораздо меньше вычислительных ресурсов, чем другие методы поиска, и может идентифицировать квантовые схемы, повышающие точность задач машинного обучения и квантовой химии. В классических нейронных сетях включение большего количества параметров часто повышает точность модели. Но в вариационных квантовых вычислениях для большего количества параметров требуется больше квантовых вентилей, что вносит больше шума.
Для этого сперва была спроектирована супер-схема со всеми возможными параметризованными квантовые элементы в пространстве проектирования. Затем эта схема была обучена и использовалась для поиска схемных архитектур с высокой устойчивостью к шуму. Процесс включает в себя одновременный поиск квантовых схем и отображений кубитов с использованием эволюционного алгоритма поиска. Этот алгоритм генерирует несколько кандидатов на отображение квантовых схем и кубитов, а затем оценивает их точность с помощью модели шума или на реальной машине. Результаты возвращаются обратно в алгоритм, который выбирает наиболее эффективные части и использует их для повторного запуска процесса, пока не найдет идеальных кандидатов. Разработчики собрали полученные результаты исследования в библиотеку с открытым исходным кодом TorchQuantum https://github.com/mit-han-lab/torchquantum.
https://news.mit.edu/2022/quantum-circuits-robust-noise-0321
Квантовые компьютеры очень чувствительны к шумовым помехам, которые вызываются несовершенными управляющими сигналами, возмущениями окружающей среды и нежелательными взаимодействиями между кубитами. Поэтому исследователи из MIT создали QuantumNAS - структуру, которая может идентифицировать наиболее надежную квантовую схему для конкретной вычислительной задачи и генерировать шаблон отображения, адаптированный к кубитам целевого квантового процессора. устройство. QuantumNAS требует гораздо меньше вычислительных ресурсов, чем другие методы поиска, и может идентифицировать квантовые схемы, повышающие точность задач машинного обучения и квантовой химии. В классических нейронных сетях включение большего количества параметров часто повышает точность модели. Но в вариационных квантовых вычислениях для большего количества параметров требуется больше квантовых вентилей, что вносит больше шума.
Для этого сперва была спроектирована супер-схема со всеми возможными параметризованными квантовые элементы в пространстве проектирования. Затем эта схема была обучена и использовалась для поиска схемных архитектур с высокой устойчивостью к шуму. Процесс включает в себя одновременный поиск квантовых схем и отображений кубитов с использованием эволюционного алгоритма поиска. Этот алгоритм генерирует несколько кандидатов на отображение квантовых схем и кубитов, а затем оценивает их точность с помощью модели шума или на реальной машине. Результаты возвращаются обратно в алгоритм, который выбирает наиболее эффективные части и использует их для повторного запуска процесса, пока не найдет идеальных кандидатов. Разработчики собрали полученные результаты исследования в библиотеку с открытым исходным кодом TorchQuantum https://github.com/mit-han-lab/torchquantum.
https://news.mit.edu/2022/quantum-circuits-robust-noise-0321
GitHub
GitHub - mit-han-lab/torchquantum: A PyTorch-based framework for Quantum Classical Simulation, Quantum Machine Learning, Quantum…
A PyTorch-based framework for Quantum Classical Simulation, Quantum Machine Learning, Quantum Neural Networks, Parameterized Quantum Circuits with support for easy deployments on real quantum compu...
👍2
📝Автогенерация резюме из Google-документов
Google-документы теперь автоматически генерируют резюме их содержания. резюме содержания, когда они доступны. Хотя все пользователи могут добавлять сводки, автоматически созданные предложения в настоящее время доступны только бизнес-клиентам Google Workspace.
Это достигается за счет ML-моделей понимания естественного языка (NLU) и генерации естественного языка (NLG), особенно Transformer и Pegasus. Популярным методом объединения NLU и NLG является обучение модели машинного обучения с использованием обучения от последовательности к последовательности, где входными данными являются слова документа, а выходными данными — итоговые слова. Затем нейронная сеть учится сопоставлять входные токены с выходными токенами. Ранние приложения парадигмы последовательности к последовательности использовали рекуррентные нейронные сети (RNN) как для кодировщика, так и для декодера.
Внедрение Transformers обеспечило многообещающую альтернативу RNN благодаря внутреннему вниманию для лучшего моделирования длинных входных и выходных зависимостей, что имеет решающее значение при резюмировании документов. Тем не менее, эти модели требуют больших объемов размеченных вручную данных для достаточного обучения, поэтому одного появления Transformers было недостаточно, чтобы значительно продвинуться вперед в области суммирования документов.
Комбинация Transformers с самоконтролируемой предварительной подготовкой (BERT, GPT, T5) привела к крупному прорыву во многих задачах NLU, для которых доступны ограниченные размеченные данные. В предварительном обучении с самоконтролем модель использует большие объемы немаркированного текста, чтобы изучить общие возможности понимания языка и генерации. Затем, на последующем этапе тонкой настройки, модель учится применять эти способности к конкретной задаче, такой как подведение итогов или ответы на вопросы.
Работа Pegasus продвинула эту идею еще на один шаг вперед, введя предтренировочную цель, приспособленную к абстрактному обобщению. В предварительном обучении Pegasus, также называемом прогнозированием пробелов в предложениях (GSP), полные предложения из немаркированных новостных статей и веб-документов маскируются от входных данных, и модель требуется для их восстановления в зависимости от оставшихся немаскированных предложений. В частности, GSP пытается замаскировать предложения, которые считаются важными для документа, с помощью различных эвристик, чтобы сделать предварительную тренировку как можно ближе к задаче подведения итогов. Компания Pegasus добилась самых современных результатов на разнообразном наборе наборов данных для суммирования.
Используя преимущества Transformer и Pegasus, исследователи Google AI тщательно очистили и отфильтровали данные тонкой настройки, чтобы они содержали обучающие примеры, которые были более последовательными и представляли связное определение резюмирующего текста. Несмотря на уменьшение количества обучающих данных, это привело к более качественной модели. Затем была решена проблема обслуживания высококачественной модели в производстве. Хотя версия Transformer архитектуры кодер-декодер является доминирующим подходом к обучению моделей для задач последовательного преобразования последовательностей, таких как абстрактное суммирование, она может быть неэффективной и непрактичной для использования в реальных приложениях. Основная неэффективность связана с декодером Transformer, где токен выходной сводки генерируется последовательно посредством авторегрессионного декодирования. Процесс декодирования становится заметно медленнее, когда сводки становятся длиннее, поскольку декодер обрабатывает все ранее сгенерированные токены на каждом этапе. RNN представляют собой более эффективную архитектуру для декодирования, поскольку при использовании предыдущих токенов отсутствует внутреннее внимание, как в модели Transformer.
Google-документы теперь автоматически генерируют резюме их содержания. резюме содержания, когда они доступны. Хотя все пользователи могут добавлять сводки, автоматически созданные предложения в настоящее время доступны только бизнес-клиентам Google Workspace.
Это достигается за счет ML-моделей понимания естественного языка (NLU) и генерации естественного языка (NLG), особенно Transformer и Pegasus. Популярным методом объединения NLU и NLG является обучение модели машинного обучения с использованием обучения от последовательности к последовательности, где входными данными являются слова документа, а выходными данными — итоговые слова. Затем нейронная сеть учится сопоставлять входные токены с выходными токенами. Ранние приложения парадигмы последовательности к последовательности использовали рекуррентные нейронные сети (RNN) как для кодировщика, так и для декодера.
Внедрение Transformers обеспечило многообещающую альтернативу RNN благодаря внутреннему вниманию для лучшего моделирования длинных входных и выходных зависимостей, что имеет решающее значение при резюмировании документов. Тем не менее, эти модели требуют больших объемов размеченных вручную данных для достаточного обучения, поэтому одного появления Transformers было недостаточно, чтобы значительно продвинуться вперед в области суммирования документов.
Комбинация Transformers с самоконтролируемой предварительной подготовкой (BERT, GPT, T5) привела к крупному прорыву во многих задачах NLU, для которых доступны ограниченные размеченные данные. В предварительном обучении с самоконтролем модель использует большие объемы немаркированного текста, чтобы изучить общие возможности понимания языка и генерации. Затем, на последующем этапе тонкой настройки, модель учится применять эти способности к конкретной задаче, такой как подведение итогов или ответы на вопросы.
Работа Pegasus продвинула эту идею еще на один шаг вперед, введя предтренировочную цель, приспособленную к абстрактному обобщению. В предварительном обучении Pegasus, также называемом прогнозированием пробелов в предложениях (GSP), полные предложения из немаркированных новостных статей и веб-документов маскируются от входных данных, и модель требуется для их восстановления в зависимости от оставшихся немаскированных предложений. В частности, GSP пытается замаскировать предложения, которые считаются важными для документа, с помощью различных эвристик, чтобы сделать предварительную тренировку как можно ближе к задаче подведения итогов. Компания Pegasus добилась самых современных результатов на разнообразном наборе наборов данных для суммирования.
Используя преимущества Transformer и Pegasus, исследователи Google AI тщательно очистили и отфильтровали данные тонкой настройки, чтобы они содержали обучающие примеры, которые были более последовательными и представляли связное определение резюмирующего текста. Несмотря на уменьшение количества обучающих данных, это привело к более качественной модели. Затем была решена проблема обслуживания высококачественной модели в производстве. Хотя версия Transformer архитектуры кодер-декодер является доминирующим подходом к обучению моделей для задач последовательного преобразования последовательностей, таких как абстрактное суммирование, она может быть неэффективной и непрактичной для использования в реальных приложениях. Основная неэффективность связана с декодером Transformer, где токен выходной сводки генерируется последовательно посредством авторегрессионного декодирования. Процесс декодирования становится заметно медленнее, когда сводки становятся длиннее, поскольку декодер обрабатывает все ранее сгенерированные токены на каждом этапе. RNN представляют собой более эффективную архитектуру для декодирования, поскольку при использовании предыдущих токенов отсутствует внутреннее внимание, как в модели Transformer.
👍2
После переноса знаний из большой модели в более эффективную модель меньшего размера, чтобы преобразовать модель Pegasus в гибридную архитектуру кодировщика Transformer и декодера RNN, для повышения эффективности было уменьшено количество слоев декодера RNN. В полученной модели улучшены задержки и объем памяти, сохранив исходное качество.
https://ai.googleblog.com/2022/03/auto-generated-summaries-in-google-docs.html
https://ai.googleblog.com/2022/03/auto-generated-summaries-in-google-docs.html
Google Research
Auto-generated Summaries in Google Docs
Posted by Mohammad Saleh, Software Engineer, Google Research, Brain Team and Anjuli Kannan, Software Engineer, Google Docs For many of us, it can b...
👍3
#тест
Чем отличаются XGBoost и LightGBM
Чем отличаются XGBoost и LightGBM
Anonymous Quiz
14%
В XGBoost есть встроенный метод для категориальных признаков, а в LightGBM - нет
32%
В LightGBM есть встроенный метод для категориальных признаков, а в XGBoost - нет
14%
XGBoost является алгоритмом градиентного спуска, а LightGBM основан на логистической регрессии
41%
они ничем не отличаются, это один и тот же алгоритм от разных разработчиков
👍3🔥2
📝Валидация датафреймов с Python-библиотекой Pandera
В крупных DS-проектах для валидации датасета и проверки качества данных можно использоваться фреймворк Great Expectations. Однако, для более мелких задач нужны более простые инструменты. Например, легковесная Python-библиотека Pandera, которая явно проверяет информацию в датафреймах во время выполнения. Pandera позволяет определить схему данных один раз с помощью API на основе классов с pydantic-синтаксисом и использовать ее для проверки различных типов датафреймов, включая pandas, dask, modin и pyspark.pandas. Можно проверять типы и свойства столбцов в pd.DataFrame или значения в pd.Series, выполняйте более сложную статистическую проверку, например проверку гипотез. Из объектов схемы можно синтезировать данные для тестирования на основе свойств с помощью структур данных pandas.
Декораторы функций позволяют интегрироваться с существующими конвейерами анализа/обработки данных с помощью декораторов функций. Благодаря отложенной проверке, можно валидировать датафреймы до возникновения ошибок. Наконец, совместимость с другими Python-инструментами, таких как pydantic, fastapi и mypy, делают Pandera полезным средством для ML-разработчика и аналитика данных.
Документация: https://pandera.readthedocs.io/en/stable/
Практический пример: https://towardsdatascience.com/validate-your-pandas-dataframe-with-pandera-2995910e564
В крупных DS-проектах для валидации датасета и проверки качества данных можно использоваться фреймворк Great Expectations. Однако, для более мелких задач нужны более простые инструменты. Например, легковесная Python-библиотека Pandera, которая явно проверяет информацию в датафреймах во время выполнения. Pandera позволяет определить схему данных один раз с помощью API на основе классов с pydantic-синтаксисом и использовать ее для проверки различных типов датафреймов, включая pandas, dask, modin и pyspark.pandas. Можно проверять типы и свойства столбцов в pd.DataFrame или значения в pd.Series, выполняйте более сложную статистическую проверку, например проверку гипотез. Из объектов схемы можно синтезировать данные для тестирования на основе свойств с помощью структур данных pandas.
Декораторы функций позволяют интегрироваться с существующими конвейерами анализа/обработки данных с помощью декораторов функций. Благодаря отложенной проверке, можно валидировать датафреймы до возникновения ошибок. Наконец, совместимость с другими Python-инструментами, таких как pydantic, fastapi и mypy, делают Pandera полезным средством для ML-разработчика и аналитика данных.
Документация: https://pandera.readthedocs.io/en/stable/
Практический пример: https://towardsdatascience.com/validate-your-pandas-dataframe-with-pandera-2995910e564
Medium
Validate Your pandas DataFrame with Pandera
Make Sure Your Data Matches Your Expectation
👍4🔥1
💥Зачем вам Modin: альтернатива Pandas для быстрой обработки Big Data
Обработка больших датафреймов с помощью Pandas происходит медленно, поскольку эта Python-библиотека не поддерживает работу с данными, которые не помещаются в доступную память. В результате рабочие процессы Pandas, которые хорошо работают для прототипирования нескольких МБ данных, не масштабируются до десятков или сотен ГБ реального датасета. Поэтому из-за однопоточного выполнения операций в оперативной памяти Pandas не очень подходит для обработки действительно больших наборов данных. с большими наборами данных. Есть альтернатива – Python-библиотека Modin с Pandas-подобным API, которая масштабируется по всем ядрам процессора, используя Dask или Ray движок.
Modin поддерживает работу с данными, которые не помещаются в памяти, так что вы можете комфортно работать с сотнями ГБ, не беспокоясь о существенном замедлении или ошибках памяти. Благодаря поддержке кластера и вне ядра Modin представляет собой библиотеку DataFrame с отличной производительностью на одном узле и высокой масштабируемостью в кластере.
В локальном режиме (без кластера) Modin создаст и будет управлять локальным (Dask или Ray) кластером для выполнения. При этом не нужно указывать, как распределять данные, или даже знать, сколько ядер у системы. Фактически, можно продолжать использовать код с Pandas, просто изменив оператор импорта библиотек с pandas на modin.pandas и получая значительное ускорение даже на одной машине. Modin обеспечивает ускорение до 4 раз на ноутбуке с 4 физическими ядрами.
Документация: https://modin.readthedocs.io/en/latest/index.html
Github: https://github.com/modin-project/modin
Обработка больших датафреймов с помощью Pandas происходит медленно, поскольку эта Python-библиотека не поддерживает работу с данными, которые не помещаются в доступную память. В результате рабочие процессы Pandas, которые хорошо работают для прототипирования нескольких МБ данных, не масштабируются до десятков или сотен ГБ реального датасета. Поэтому из-за однопоточного выполнения операций в оперативной памяти Pandas не очень подходит для обработки действительно больших наборов данных. с большими наборами данных. Есть альтернатива – Python-библиотека Modin с Pandas-подобным API, которая масштабируется по всем ядрам процессора, используя Dask или Ray движок.
Modin поддерживает работу с данными, которые не помещаются в памяти, так что вы можете комфортно работать с сотнями ГБ, не беспокоясь о существенном замедлении или ошибках памяти. Благодаря поддержке кластера и вне ядра Modin представляет собой библиотеку DataFrame с отличной производительностью на одном узле и высокой масштабируемостью в кластере.
В локальном режиме (без кластера) Modin создаст и будет управлять локальным (Dask или Ray) кластером для выполнения. При этом не нужно указывать, как распределять данные, или даже знать, сколько ядер у системы. Фактически, можно продолжать использовать код с Pandas, просто изменив оператор импорта библиотек с pandas на modin.pandas и получая значительное ускорение даже на одной машине. Modin обеспечивает ускорение до 4 раз на ноутбуке с 4 физическими ядрами.
Документация: https://modin.readthedocs.io/en/latest/index.html
Github: https://github.com/modin-project/modin
GitHub
GitHub - modin-project/modin: Modin: Scale your Pandas workflows by changing a single line of code
Modin: Scale your Pandas workflows by changing a single line of code - modin-project/modin
🔥5👍1
#тест
Метод опорных векторов (SVM) подойдет для
Метод опорных векторов (SVM) подойдет для
Anonymous Quiz
5%
задач прогнозирования в условиях сильного зашумленния
81%
задач классификации
12%
разработки рекомендательных систем
2%
задач генерации текста в NLP
🔥8
Простое и быстрое обнаружение аномалий методом Z-скоринга
Обнаружение аномалий — довольно распространенная проблема, которая охватывает множество сценариев, от финансовых мошенничеств до сбоев в компьютерной сети. Некоторые проблемы требуют сложных моделей машинного обучения, но чаще всего достаточно каких-то более простых и дешевых методов. Например, есть данные о продажах за период времени, где нужно отметить дни с аномально высокими объемами или выделить клиентов с аномально большим количеством считываний кредитной карты для проверки рисков.
Для таких случаев подойдет простой статистический метод отметки выбросов, называемый Z-скоринг. Оценка равна разнице текущего и среднего значений, разделенной на стандартное отклонение. Z-скоринг предполагает классическое нормальное распределение случайных величин. Преобразование значений в номинальной шкале в логарифмическую шкалу улучшит способность большинства ML-моделей различать взаимосвязи и улучшит способность Z-показателей отмечать выбросы.
Обнаружение аномалий — довольно распространенная проблема, которая охватывает множество сценариев, от финансовых мошенничеств до сбоев в компьютерной сети. Некоторые проблемы требуют сложных моделей машинного обучения, но чаще всего достаточно каких-то более простых и дешевых методов. Например, есть данные о продажах за период времени, где нужно отметить дни с аномально высокими объемами или выделить клиентов с аномально большим количеством считываний кредитной карты для проверки рисков.
Для таких случаев подойдет простой статистический метод отметки выбросов, называемый Z-скоринг. Оценка равна разнице текущего и среднего значений, разделенной на стандартное отклонение. Z-скоринг предполагает классическое нормальное распределение случайных величин. Преобразование значений в номинальной шкале в логарифмическую шкалу улучшит способность большинства ML-моделей различать взаимосвязи и улучшит способность Z-показателей отмечать выбросы.
👍5
С практической точки зрения особенно важно, что реализация Z-скоринга очень проста: ее можно написать как небольшой программный скрипт или даже набор SQL-запросов, чтобы быстро получить легковесный MVP и оперативно проверить гипотезу.
https://towardsdatascience.com/anomaly-detection-in-sql-2bcd8648f7a8
https://towardsdatascience.com/anomaly-detection-in-sql-2bcd8648f7a8
Medium
Anomaly Detection in SQL
How to implement fast, powerful, anomaly detection models directly in the data warehouse
🔥5👍1
🕸✍🏻3 Python- библиотеки для работы с URL
Задача обработки URL-адресов на практике встречается довольно часто. Например, составить список наиболее часто посещаемых сайтов или тех, визиты на которые разрешены в рабочее время с корпоративных компьютеров. Для автоматизации подобных кейсов пригодятся следующие Python- библиотеки:
• Yarl – позволяет извлекать фичи из URL-адреса, предоставляет удобный класс для анализа и изменения адреса веб-ресурса. Но работает только с Python 3 и не принимает логические значения в API – необходимо самостоятельно преобразовывать логические значения в строки, используя нужный протокол перевода. https://github.com/aio-libs/yarl
• Furl – упрощает разбор и манипулирование URL-адресами. Библиотека имеет широкий набор возможностей, но и ряд ограничений. В частности, объект furl может изменяться, поэтому могут случиться проблемы при передаче его во вне. https://github.com/gruns/furl
• URLObject – служебный класс для управления URL-адресами с помощью понятного API с фокусом на правильных именах методов, а не на переопределениях операторов. Сам объект здесь неизменяем, каждое изменение URL-адреса создает новый объект URL-адреса. Но библиотека не выполняет никаких преобразований декодирования/кодирования, с чем приходится пользователю разбираться самостоятельно. https://github.com/zacharyvoase/urlobject
Задача обработки URL-адресов на практике встречается довольно часто. Например, составить список наиболее часто посещаемых сайтов или тех, визиты на которые разрешены в рабочее время с корпоративных компьютеров. Для автоматизации подобных кейсов пригодятся следующие Python- библиотеки:
• Yarl – позволяет извлекать фичи из URL-адреса, предоставляет удобный класс для анализа и изменения адреса веб-ресурса. Но работает только с Python 3 и не принимает логические значения в API – необходимо самостоятельно преобразовывать логические значения в строки, используя нужный протокол перевода. https://github.com/aio-libs/yarl
• Furl – упрощает разбор и манипулирование URL-адресами. Библиотека имеет широкий набор возможностей, но и ряд ограничений. В частности, объект furl может изменяться, поэтому могут случиться проблемы при передаче его во вне. https://github.com/gruns/furl
• URLObject – служебный класс для управления URL-адресами с помощью понятного API с фокусом на правильных именах методов, а не на переопределениях операторов. Сам объект здесь неизменяем, каждое изменение URL-адреса создает новый объект URL-адреса. Но библиотека не выполняет никаких преобразований декодирования/кодирования, с чем приходится пользователю разбираться самостоятельно. https://github.com/zacharyvoase/urlobject
GitHub
GitHub - aio-libs/yarl: Yet another URL library
Yet another URL library. Contribute to aio-libs/yarl development by creating an account on GitHub.
👍2
Forwarded from Digital Dinner
Канадский художник Барри создал артбук из 1000 необычных изображений роботов.
Автор создал все изображения в этой книге, написав оригинальные подсказки для DALL·E 2, системы искусственного интеллекта OpenAI, которая может создавать реалистичные изображения и рисунки из описания на естественном языке. После создания изображений автор курировал и размещал изображения по своему вкусу.
https://archive.org/details/1111101000-robots/page/198/mode/2up
Автор создал все изображения в этой книге, написав оригинальные подсказки для DALL·E 2, системы искусственного интеллекта OpenAI, которая может создавать реалистичные изображения и рисунки из описания на естественном языке. После создания изображений автор курировал и размещал изображения по своему вкусу.
https://archive.org/details/1111101000-robots/page/198/mode/2up
🔥2
#тест
Чем плоха мультиколлинеарность признаков в обучающем датасете для ML?
Чем плоха мультиколлинеарность признаков в обучающем датасете для ML?
Anonymous Quiz
25%
зависимые признаки не влияют на результат моделирования, засоряя пространство признаков
2%
их сложно определить и исключить из обучающего датасета
67%
зависимые признаки дублируют друг друга, увеличивая объем вычислений и снижая точность результатов
7%
повышается сложность вычислений в алгоритмах обучении ML-модели
🔥4
👆🏻Тонкости дедубликации с DISTINCT
Исключить дубли из выборки можно просто добавив к SQL-запросу ключевое слово DISTINCT. Однако, это простое решение не всегда будет верным. Чтобы гарантировать отсутствие дубликатов в наборе данных, СУБД необходимо сравнить все строки друг с другом, отсеяв повторы. Это требует много ресурсов ЦП и памяти для хранения всех строк, т.к. их нужно сравнивать друг с другом в памяти, даже если на низком уровне идет работа с хэшем. Кроме того, DISTINCT уменьшает параллелизм вычислений, снижая скорость выполнения запроса.
DISTINCT удаляет дубликаты, но не разрешает неправильные соединения и фильтры, которые на практике чаще всего и приводят к повторам, например, из-за CROSS JOIN или использования RANK вместо ROW_NUMBER, что приводит к дублированию из-за плохо определенного окна раздела. Подробности с примерами кода смотрите здесь: https://jmarquesdatabeyond.medium.com/sql-like-a-pro-please-stop-using-distinct-31bdb6481256
Исключить дубли из выборки можно просто добавив к SQL-запросу ключевое слово DISTINCT. Однако, это простое решение не всегда будет верным. Чтобы гарантировать отсутствие дубликатов в наборе данных, СУБД необходимо сравнить все строки друг с другом, отсеяв повторы. Это требует много ресурсов ЦП и памяти для хранения всех строк, т.к. их нужно сравнивать друг с другом в памяти, даже если на низком уровне идет работа с хэшем. Кроме того, DISTINCT уменьшает параллелизм вычислений, снижая скорость выполнения запроса.
DISTINCT удаляет дубликаты, но не разрешает неправильные соединения и фильтры, которые на практике чаще всего и приводят к повторам, например, из-за CROSS JOIN или использования RANK вместо ROW_NUMBER, что приводит к дублированию из-за плохо определенного окна раздела. Подробности с примерами кода смотрите здесь: https://jmarquesdatabeyond.medium.com/sql-like-a-pro-please-stop-using-distinct-31bdb6481256
Medium
SQL Like a Pro: Please Stop Using Distinct!!
Every time I see a “DISTINCT” I ask the same question: Why??
🤯2👍1🔥1
💥DataSpell: профессиональная IDE для Data Science от JetBrains
Не хватает удобства полноценной среды разработки в легковесном Jupyter Notebook? Хотите писать Python-код в надежной IDE со всеми DS-библиотеками? Попробуйте DataSpell от JetBrains – профессиональная IDE наподобие PyCharm, которое содержит множество популярных библиотек для анализа данных и ML, сочетая их с мощью комплексного инструмента разработчика.
Выпущенный впервые в 2020 году, сегодня DataSpell пользуется спросом у ML-разработчиков и дата-аналитиков по всему миру.
https://www.jetbrains.com/ru-ru/dataspell/
Не хватает удобства полноценной среды разработки в легковесном Jupyter Notebook? Хотите писать Python-код в надежной IDE со всеми DS-библиотеками? Попробуйте DataSpell от JetBrains – профессиональная IDE наподобие PyCharm, которое содержит множество популярных библиотек для анализа данных и ML, сочетая их с мощью комплексного инструмента разработчика.
Выпущенный впервые в 2020 году, сегодня DataSpell пользуется спросом у ML-разработчиков и дата-аналитиков по всему миру.
https://www.jetbrains.com/ru-ru/dataspell/
JetBrains
JetBrains DataSpell: The IDE for Data Scientists.
JetBrains DataSpell is an IDE for data science with intelligent Jupyter notebooks, interactive Python scripts, and lots of other built-in tools.
🔥3🤔1
Forwarded from Digital Dinner
This media is not supported in your browser
VIEW IN TELEGRAM
Нейросеть, которая меняет время суток на фото
Исследователи из Apple, Adobe и Университетского коллежа Лондона совместными усилиями разработали нейросеть, которая может менять время дня на фотографиях.
Принцип работы такой: нейронная сеть определят источник света на снимке и объекты, которые отбрасываю тень. В итоге, чтобы поменять освещение на фото, нужно только передвинуть ползунок.
Попробовать новую сеть в действии можно по ссылке https://www.dgriffiths.uk/outcast
Исследователи из Apple, Adobe и Университетского коллежа Лондона совместными усилиями разработали нейросеть, которая может менять время дня на фотографиях.
Принцип работы такой: нейронная сеть определят источник света на снимке и объекты, которые отбрасываю тень. В итоге, чтобы поменять освещение на фото, нужно только передвинуть ползунок.
Попробовать новую сеть в действии можно по ссылке https://www.dgriffiths.uk/outcast
👍2
#тест
Предупредить переобучения ML-модели поможет
Предупредить переобучения ML-модели поможет
Anonymous Quiz
10%
Нормализация входных данных
3%
Стандартизация входных данных
82%
Регуляризация
5%
Оптимизация
👍2
🌸Май и труд еще никто не отменил! Выбирайте подходящее DS-событие, чтобы повысить свой профессиональный уровень:
• 13- 14 мая - HighLoad++ - крупнейшая профессиональная конференция для разработчиков высоконагруженных систем. Москва, Крокус-Экспо https://highload.ru/foundation/2022
• 18–19 мая - Positive Hack Days - выступления отечественных и зарубежных профессионалов в области информационной безопасности, закрытые и открытые круглые столы с участием лидеров мнений, мастер-классы и лабораторные практикумы известных экспертов. Центр международной торговли, Москва, Краснопресненская наб., 12, подъезд 4 https://www.phdays.com/ru/
• 18 - 19 мая - онлайн-конференция «DIGITAL MINING & METALLURGY» https://smartgopro.com/digitalminemet/
• 23-25 мая - Пространственные Данные – ежегодная международная научная конференция в Московском Государственном Университете Геодезии и Картографии https://scidata.ru/
• 25 – 27 мая - XXV Международная конференция по мягким вычислениям и измерениям (SCM'2022) в Санкт-Петербургском государственном электротехническом университете «ЛЭТИ» им. В.И. Ульянова (Ленина) https://scm.etu.ru/2022/ru/
• 28-29 мая – CodeFest 2022, Новосибирск, Экспоцентр, Станционная, 104 https://12.codefest.ru/
• 31 мая - 2 июня Tech Week 2022 - прикладная конференция и выставка об инновационных технологиях для решения задач бизнеса. Технопарк «Сколково» https://techweek.moscow/
• 13- 14 мая - HighLoad++ - крупнейшая профессиональная конференция для разработчиков высоконагруженных систем. Москва, Крокус-Экспо https://highload.ru/foundation/2022
• 18–19 мая - Positive Hack Days - выступления отечественных и зарубежных профессионалов в области информационной безопасности, закрытые и открытые круглые столы с участием лидеров мнений, мастер-классы и лабораторные практикумы известных экспертов. Центр международной торговли, Москва, Краснопресненская наб., 12, подъезд 4 https://www.phdays.com/ru/
• 18 - 19 мая - онлайн-конференция «DIGITAL MINING & METALLURGY» https://smartgopro.com/digitalminemet/
• 23-25 мая - Пространственные Данные – ежегодная международная научная конференция в Московском Государственном Университете Геодезии и Картографии https://scidata.ru/
• 25 – 27 мая - XXV Международная конференция по мягким вычислениям и измерениям (SCM'2022) в Санкт-Петербургском государственном электротехническом университете «ЛЭТИ» им. В.И. Ульянова (Ленина) https://scm.etu.ru/2022/ru/
• 28-29 мая – CodeFest 2022, Новосибирск, Экспоцентр, Станционная, 104 https://12.codefest.ru/
• 31 мая - 2 июня Tech Week 2022 - прикладная конференция и выставка об инновационных технологиях для решения задач бизнеса. Технопарк «Сколково» https://techweek.moscow/
🔥1