Forwarded from Pythonist.ru - образование по питону
Машинное обучение. Как очистить данные при помощи Pandas
Клайв Хамби сказал: «Данные — это новая нефть». И, как и нефть, они нуждаются в очистке. Разбираемся, как это сделать с применением библиотеки Pandas.
Книги по ML - @maschinelearning
#ml
Клайв Хамби сказал: «Данные — это новая нефть». И, как и нефть, они нуждаются в очистке. Разбираемся, как это сделать с применением библиотеки Pandas.
Книги по ML - @maschinelearning
#ml
Forwarded from Мишин Лернинг
🔁 ERNIE-VILG: UNIFIED GENERATIVE PRE-TRAINING FOR BIDIRECTIONAL VISION-LANGUAGE GENERATION
Может ли одна сеть решать две задачи:
— Text2Image & Image2Text —
Ответ да, конечно может. И самое начало 2022 года это подтвердило. В одно и тоже время, независимо, появились три подобные архитектуры.
Cкажу, что тренировать их end2end не стоит, если есть желание выбить SOTA в двух задачах одновременно. А вот использовать end2end претрейн — хорошая идея! Подход идеален для файнтюнов для множества задач!
Кстати сегодня стало доступно демо, так что можете сгенерировать своего "астронавта на коне на марсе с эйфелевой башней", не забудьте только перевести в гугле ваш запрос на китайский: 宇航员在火星上骑马,从后面可以看到埃菲尔铁塔。宇航员骑马
p.s.: понимание текста на голову выше чем у стебля диффузионного
📄 paper
🤗 online demo
Может ли одна сеть решать две задачи:
— Text2Image & Image2Text —
Ответ да, конечно может. И самое начало 2022 года это подтвердило. В одно и тоже время, независимо, появились три подобные архитектуры.
Cкажу, что тренировать их end2end не стоит, если есть желание выбить SOTA в двух задачах одновременно. А вот использовать end2end претрейн — хорошая идея! Подход идеален для файнтюнов для множества задач!
Кстати сегодня стало доступно демо, так что можете сгенерировать своего "астронавта на коне на марсе с эйфелевой башней", не забудьте только перевести в гугле ваш запрос на китайский: 宇航员在火星上骑马,从后面可以看到埃菲尔铁塔。宇航员骑马
p.s.: понимание текста на голову выше чем у стебля диффузионного
📄 paper
🤗 online demo
Forwarded from Мишин Лернинг
This media is not supported in your browser
VIEW IN TELEGRAM
🎨 OpenAI внедрили в DALL·E 2 "Outpainting"
Только что пришло письмо от OpenAI, где говорится, чтоиз-за опенсорса stable diffusion они решили внедрить Outpainting, про который я подробно писал весной, в интерфейс DALL-E 2.
Outpainting позволяет генерировать изображений любого размера. Но в отличие от гибкого разрешения в диффузионных UNet'ах с вниманием, Outpainting предполагает пошаговую генерацию со всеми своими плюсам и минусами.
Outpainting — это продолжение генерации изображения за его первоначальными границами. Outpainting добавляет визуальные элементы, развивая генерацию в новых направлениях, основываясь на вашем текстовом описании.
Это позволяет начать ваше полотно в одном стиле, а закончить в другом, уточнять элементы и менять их!
Outpainting — это Inpainting без привязки исходному разрешению..
📇 blog post
🥑 DALL-E 2 Editor
Только что пришло письмо от OpenAI, где говорится, что
Outpainting позволяет генерировать изображений любого размера. Но в отличие от гибкого разрешения в диффузионных UNet'ах с вниманием, Outpainting предполагает пошаговую генерацию со всеми своими плюсам и минусами.
Outpainting — это продолжение генерации изображения за его первоначальными границами. Outpainting добавляет визуальные элементы, развивая генерацию в новых направлениях, основываясь на вашем текстовом описании.
Это позволяет начать ваше полотно в одном стиле, а закончить в другом, уточнять элементы и менять их!
Outpainting — это Inpainting без привязки исходному разрешению..
📇 blog post
🥑 DALL-E 2 Editor
Forwarded from эйай ньюз
MultiNeRF: A Code Release for Mip-NeRF 360, Ref-NeRF, and RawNeRF
Если ищете SOTA метод по нейронному рендерингу сцены, то Гугл выложили репозиторий с реализацией трёх oral статей с CVPR 2022. Это топовые на сегодняшний день методы.
Oral - это значит, что статья попала в шорт-лист лучших работ на конференции.
Ссылка на репу
@ai_newz
Если ищете SOTA метод по нейронному рендерингу сцены, то Гугл выложили репозиторий с реализацией трёх oral статей с CVPR 2022. Это топовые на сегодняшний день методы.
Oral - это значит, что статья попала в шорт-лист лучших работ на конференции.
Ссылка на репу
@ai_newz
GitHub
GitHub - google-research/multinerf: A Code Release for Mip-NeRF 360, Ref-NeRF, and RawNeRF
A Code Release for Mip-NeRF 360, Ref-NeRF, and RawNeRF - google-research/multinerf
Forwarded from Библиотека разведчика | Osint | Книги | Курсы
Практическая_статистика_для_специалистов_Data_Science_50_важнейших.pdf
8.5 MB
Практическая статистика для специалистов Data Science. 50 важнейших понятий.
Питер Брюс, Эндрю Брюс
Книга рассчитана на специалистов в области Data Science, обладающих некоторым опытом работы с языком программирования R и имеющих предварительное понятие о математической статистике. В ней в удобной и легкодоступной форме представлены ключевые понятия из статистики, которые относятся к науке о данных, а также объяснено, какие понятия важны и полезны с точки зрения науки о данных, какие менее важны и почему. Подробно раскрыты темы: разведочный анализ данных, сбор дынных, распределения данных и выборок, статистические эксперименты и проверка значимости, регрессия и предсказание, классификация, статистическое машинное обучение и обучение без учителя.
Питер Брюс, Эндрю Брюс
Книга рассчитана на специалистов в области Data Science, обладающих некоторым опытом работы с языком программирования R и имеющих предварительное понятие о математической статистике. В ней в удобной и легкодоступной форме представлены ключевые понятия из статистики, которые относятся к науке о данных, а также объяснено, какие понятия важны и полезны с точки зрения науки о данных, какие менее важны и почему. Подробно раскрыты темы: разведочный анализ данных, сбор дынных, распределения данных и выборок, статистические эксперименты и проверка значимости, регрессия и предсказание, классификация, статистическое машинное обучение и обучение без учителя.
👍1
Forwarded from Мишин Лернинг
🚀 Про <ЭТО> или как генерить <Это>, если <Это> не включили в претрейн
Добовление новых объектов и концептов через p-tuning стало возможно в Стебле Диффузии!
Давайте представим ситуацию:
— Вы обучили огромную Text2Image модель на 1B данных
— Она умеет очень много, но время идет вперед и выходит фильм или игра, персонажей которого сеть не знает, так как на момент тренировки этих данных в интернете просто не было
Сеть <это> не умеет, а генерировать <это> нужно... Что делать?
1) Дообучить модель добавив в датасет новые данные. Можно! Не не ради же одного объекта, персонажа или концепта.. Слишком жирно будет..
2) Зафайнтюнить на новых данных. Хм, и потетрять генерализацию?
3) Добвить новый сымсл в знания модели, не трогая саму модель, какбы добавив концепт в ее словарь! А вот это то, что нужно!
Ресерчеры из Университета Тель-Авива и NVIDIA рашили это через старый добрый p-tuning. Работа получила имя An Image is Worth One Word (привет, VIT).
Взяв ~5 картинок они пустили градиенты
— Через 1000 шагов, тихо на денойзинге
— Через юнет и кросс-аттеншен
— Через языковой трансформер
— Прямо на эмбеддинг слой, так где находится токин с <этим> Смотри картинку к посту.
По факту это обыкновенный p-tuning, адаптированный под Imagen/Glide/LatenDiffusion модели.
Сегодня ребята адпатиорвали моделб под Стебель! Так что если вы хотели генерить стеблем <Это>
Доступны 2 колаба: для p-tuning'а моедли и для инференса! Вот такая игрушечная машинка у меня вышла!
📇 project
📄 paper
💻 code
🔮 train colab
👁 inference colab
Добовление новых объектов и концептов через p-tuning стало возможно в Стебле Диффузии!
Давайте представим ситуацию:
— Вы обучили огромную Text2Image модель на 1B данных
— Она умеет очень много, но время идет вперед и выходит фильм или игра, персонажей которого сеть не знает, так как на момент тренировки этих данных в интернете просто не было
Сеть <это> не умеет, а генерировать <это> нужно... Что делать?
1) Дообучить модель добавив в датасет новые данные. Можно! Не не ради же одного объекта, персонажа или концепта.. Слишком жирно будет..
2) Зафайнтюнить на новых данных. Хм, и потетрять генерализацию?
3) Добвить новый сымсл в знания модели, не трогая саму модель, какбы добавив концепт в ее словарь! А вот это то, что нужно!
Ресерчеры из Университета Тель-Авива и NVIDIA рашили это через старый добрый p-tuning. Работа получила имя An Image is Worth One Word (привет, VIT).
Взяв ~5 картинок они пустили градиенты
— Через 1000 шагов, тихо на денойзинге
— Через юнет и кросс-аттеншен
— Через языковой трансформер
— Прямо на эмбеддинг слой, так где находится токин с <этим> Смотри картинку к посту.
По факту это обыкновенный p-tuning, адаптированный под Imagen/Glide/LatenDiffusion модели.
Сегодня ребята адпатиорвали моделб под Стебель! Так что если вы хотели генерить стеблем <Это>
Доступны 2 колаба: для p-tuning'а моедли и для инференса! Вот такая игрушечная машинка у меня вышла!
📇 project
📄 paper
💻 code
🔮 train colab
👁 inference colab
Forwarded from Big Data Science
🤔PandaSQL: Python Combo for Data Scientist
SQL and Pandas are the most popular data analytics tools for tabular data management, processing and analysis. They can be used independently or together in the PandaSQL, the Python-package which provides SQL syntax capabilities in the Python environment. PandaSQL allows you to query date frames Pandas uses SQL syntax.
PandaSQL is a great tool for those who know SQL and are not familiar with the Python syntax that requires Pandas. For example, in Pandas, filtering a dataframe or grouping by column column when aggregating multiple columns can be explored in a confusing way, unlike SQL. However, this simple use of SQL in Pandas has been tainted with redundant runtime. For example, to calculate the number of rows, PandaSQL requires almost 100 times more execution runtime than Pandas.
Also, Python already has a lot of names that are reserved as basic words like for, while, in, if, else, elif, import, as. SQL adds more keywords: create, like, where, having.
Thus, it is worth to try PandaSQL, but this interesting tool is not suitable for an production data analytics pipelines.
Usage examples and runtime comparison: https://towardsdatascience.com/the-downsides-of-pandasql-that-no-one-talks-about-9b63c664bef4
SQL and Pandas are the most popular data analytics tools for tabular data management, processing and analysis. They can be used independently or together in the PandaSQL, the Python-package which provides SQL syntax capabilities in the Python environment. PandaSQL allows you to query date frames Pandas uses SQL syntax.
PandaSQL is a great tool for those who know SQL and are not familiar with the Python syntax that requires Pandas. For example, in Pandas, filtering a dataframe or grouping by column column when aggregating multiple columns can be explored in a confusing way, unlike SQL. However, this simple use of SQL in Pandas has been tainted with redundant runtime. For example, to calculate the number of rows, PandaSQL requires almost 100 times more execution runtime than Pandas.
Also, Python already has a lot of names that are reserved as basic words like for, while, in, if, else, elif, import, as. SQL adds more keywords: create, like, where, having.
Thus, it is worth to try PandaSQL, but this interesting tool is not suitable for an production data analytics pipelines.
Usage examples and runtime comparison: https://towardsdatascience.com/the-downsides-of-pandasql-that-no-one-talks-about-9b63c664bef4
PyPI
pandasql
sqldf for pandas
👍1
Forwarded from Эксплойт
Одно из лучших творений нейросетей — StableDiffusion попросили изобразить котов-рыцарей.
Попробовать самостоятельно можно тут.
@exploitex
Попробовать самостоятельно можно тут.
@exploitex
Forwarded from [PYTHON:TODAY]
This media is not supported in your browser
VIEW IN TELEGRAM
🔥 Полезные библиотеки Python
DFSpot-Deepfake-Recognition - интересный проект который позволяет определять является ли входное видео или изображение реальным или дипфейком.
⚙️ GitHub/Инструкция
#python #soft #github
DFSpot-Deepfake-Recognition - интересный проект который позволяет определять является ли входное видео или изображение реальным или дипфейком.
⚙️ GitHub/Инструкция
#python #soft #github
Forwarded from Open Source
This media is not supported in your browser
VIEW IN TELEGRAM
Latent Image Animator
Еще одна нейросетевая модель для быстрой реализации качественных DeepFake
https://github.com/wyhsirius/LIA
Demo: https://replicate.com/wyhsirius/lia
Еще одна нейросетевая модель для быстрой реализации качественных DeepFake
https://github.com/wyhsirius/LIA
Demo: https://replicate.com/wyhsirius/lia
👍1
Forwarded from GitHub Community
SReC – Нейронка для сжатия изображений без потери в качестве
Обучение, сжатие и распаковка полностью поддерживаются и имеют открытый исходный код
⤷ Ссылка на проект
GitHub | #Interesting #Python
Обучение, сжатие и распаковка полностью поддерживаются и имеют открытый исходный код
⤷ Ссылка на проект
GitHub | #Interesting #Python
Forwarded from эйай ньюз
Новый виток развития PyTorch как публичного проекта с открытым кодом!
PyTorch перейдет под контроль PyTorch Foundation как часть Linux Foundation. Теперь Фреймворк будут разрабатывать не только ученые из Meta. В PyTorch Foundation войдут люди из разных компаний, включая AMD, Amazon, Google, Microsoft, Nvidia и Meta.
@ai_newz
PyTorch перейдет под контроль PyTorch Foundation как часть Linux Foundation. Теперь Фреймворк будут разрабатывать не только ученые из Meta. В PyTorch Foundation войдут люди из разных компаний, включая AMD, Amazon, Google, Microsoft, Nvidia и Meta.
@ai_newz
Forwarded from Библиотека разведчика | Osint | Книги | Курсы
Графики_лгут_Как_стать_информационно_грамотным_человеком_в_мире.pdf
10.4 MB
Графики не лгут. Как стать информационно грамотным человеком в мире данных? 2022
Альберто Кайро
Инфографика — визуализация данных. Мы живем в век визуальной информации и больших данных. Любой аналитический материал, будь то статья, исследование, телепередача или статистическая сводка, сегодня просто обязан содержать инфографику в виде диаграмм, графиков или схем - это помогает быстрее усвоить информацию и сделать ее нагляднее. Альберто Кайро, ведущий мировой эксперт по визуальной коммуникации, консультирующий такие компании как Apple и Google, в своей книге предостерегает нас от чрезмерного доверия графикам. Зачастую, намеренно или случайно, говорит автор, инфографика вводит нас в заблуждение. Каким образом? Кайро выделил десятки причин, почему графики лгут, - зная их, вы больше никогда не попадетесь на удочку некорректной инфографики и сможете составить верное мнение о любых данных, от статистики заболеваемости COVID и рейтингов кинопроката до корпоративных отчетов и расследований.
Альберто Кайро
Инфографика — визуализация данных. Мы живем в век визуальной информации и больших данных. Любой аналитический материал, будь то статья, исследование, телепередача или статистическая сводка, сегодня просто обязан содержать инфографику в виде диаграмм, графиков или схем - это помогает быстрее усвоить информацию и сделать ее нагляднее. Альберто Кайро, ведущий мировой эксперт по визуальной коммуникации, консультирующий такие компании как Apple и Google, в своей книге предостерегает нас от чрезмерного доверия графикам. Зачастую, намеренно или случайно, говорит автор, инфографика вводит нас в заблуждение. Каким образом? Кайро выделил десятки причин, почему графики лгут, - зная их, вы больше никогда не попадетесь на удочку некорректной инфографики и сможете составить верное мнение о любых данных, от статистики заболеваемости COVID и рейтингов кинопроката до корпоративных отчетов и расследований.
Forwarded from Habr For Dev
#stable-diffusion #midjourney
Со Stable Diffusion вы можете больше никогда не поверить увиденному в онлайне
Рейтинг: 73
Читать
Со Stable Diffusion вы можете больше никогда не поверить увиденному в онлайне
Рейтинг: 73
Читать