DS & ML
589 subscribers
1.17K photos
238 videos
240 files
1.41K links
Download Telegram
Forwarded from DL in NLP (Vlad Lialin)
You are GPT-3

Увидел в твиттере совершенно огненный тред о том как GPT-3 использет википедию, ipython и другие штуки, чтобы отвечать на вопросы. Выглядит это примерно так. Всё начинается с промта

"You are GPT-3. Answer the following questions. If you can't answer it directly, consult IPython, if you need to answer questions about events past your latest training data April 2021, consult wikipedia." (полный промт на картинке)

Это позволяет GPT-3 отвечать не только на вопросы типа "сколько сантиметров в дюйме" или "как зовут первого президента США", но и на

1. вычислительные задачи — 7 + 19^3
1. операции со строками — разворот строки
1. вопросы о недавних ивентах — когда умерла Елизавета вторая
1. точные даты — когда был выпущен последний эпизод Lost
1. вопросы требущие комбинации common sense и вычислений — число ног паука в третьей степени (сложно перееоценить важность этого вопроса 🤣)

Идея основана на статье Prompt Programming for Large Language Models

По сути в 10 строчек промпта и 100 строк кода вы можете написать своего Google Assistant. Думаю надо будет заняться этим на выходных.
Forwarded from Журнал «Код»
Сложная, но наглядная статья про машинное обучение. Разбираем один из алгоритмов, основанный на деревьях.

https://v.thecode.media/dpjy4

#лучшее_Код #объяснялово_Код
Forwarded from Big Data Science
💥3 advantages and a couple of limitations of PySpark over Pandas
Although the Python-library Pandas is very popular among junior Data Scientists, it is not bound to work with really big data up to 10-12 GB. Although there are tools that can parallelize the work of Pandas, such as Dask, Swift, Ray, etc., this only speeds up the library, but does not address the root causes of the problems, because. Pandas always loads the dateframe into memory.
Therefore, dealing with large amounts of data requires something faster, such as PySpark - the Python API in Apache Spark, a distributed computing framework. Being distributed in its nature, Spark also uses lazy (deferred) evaluations, performing data operations not at the time of their declaration, but at an important call. This invariably sets many memory limits. Unlike PySpark, Pandas sticks to the Eager Execution by executing the reach task as early as possible, while PySpark follows the Lazy Execution, when the task is not elevated until after the action has been completed. PySpark is great for developing scalable applications and guarantees fault tolerance.
However, due to the networking of distributed computing, PySpark estimates a higher speed compared to local Pandas, which is indicative of the throughput of the application. In addition, PySpark remains demanding because all MapReduce tasks depend on RAM, without writing preliminary results to memory disk, unlike classical calculations in Hadoop. Finally, there are not so many specific algorithms for Data Science in PySpark.
Forwarded from Техно Фил
This media is not supported in your browser
VIEW IN TELEGRAM
В университете Мэриленда разработали свитер, который превращает человека в невидимку в глазах алгоритмов, распознающих людей.

Разработчики используют слабость некоторых нейронок, которые обучены на распознание конкретных объектов. Специальный паттерн на свитере вводит алгоритм в заблуждение.

Только не проверяйте на беспилотниках.
Forwarded from [PYTHON:TODAY]
💾 Объяснимые модели искусственного интеллекта на Python

Излагаются основы объяснимости и интерпретируемости моделей, обсуждаются методы и системы для интерпретации линейных, нелинейных моделей и моделей временных рядов, используемых в ИИ. Вы узнаете, как алгоритм ИИ принимает решение и как сделать модель ИИ интерпретируемой и объяснимой, ознакомитесь с моделями глубокого обучения на практике.

Автор: Прадипта Мишра
Год: 2022

#books #python #ai #ml #russian
Forwarded from Neural Shit
This media is not supported in your browser
VIEW IN TELEGRAM
Там на huggingface появилось пространство с text2music

Мелодии вполне годные выходят, генерация быстрая (при условии, что нет очередей и нагрузка не большая).

А если очередь большая, то можно запустить в колабе
Forwarded from Библиотека программиста
📊 8 паттернов проектирования, которые должен знать каждый ML-разработчик

Паттерны проектирования предлагают комплексные решения проблем, с которыми разработчики сталкиваются каждый день. В этой статье мы рассмотрим 8 паттернов проектирования с примерами кода на Python

🔗 Основной сайт
🔗 Зеркало
Дж_вандер_Плас_Python_для_сложных_задач_Наука_о_данных_и_машинное.pdf
8.4 MB
Python для сложных задач. Наука о данных и машинное обучение.
Дж. Вандер Плас

"Книга "Python Data Science Handbook" - это подробное руководство по самым разным вычислительным и статистическим методам, без которых немыслима любая интенсивная обработка данных, научные исследования и передовые разработки. Читатели, уже имеющие опыт программирования и желающие эффективно использовать Python в сфере Data Science, найдут в этой книге ответы на всевозможные вопросы, например: 1) как мне считать этот формат данных в мой скрипт? 2) Как преобразовать, очистить эти данные и манипулировать ими? 3) Как визуализировать данные такого типа? Как при помощи этих данных разобраться в ситуации, получить ответы на вопросы, построить статистические модели или реализовать машинное обучение?"
Forwarded from GitHub Community
​YOLO – алгоритм обнаружения объектов, который разделяет изображения на сетку

Каждая ячейка в сетке отвечает за обнаружение объектов внутри себя

Это один из самых известных алгоритмов обнаружения объектов благодаря своей скорости и точности

⤷ Ссылка на проект

GitHub | #Python #Algorithm
Для извлечения из неструктурированных данных именованных сущностей, таких, как физические и юридические лица, объекты, местоположение, события, предметы, товары, услуги и т.п. при работе с русскими и англоязычными текстами, едва ли не наилучшим решением является Eureka Engine.
♾ http://eurekaengine.ru/ru/demo/
Каталог визуализации данных...
♾ https://datavizcatalogue.com/
Совет дня: Никогда не пользуйтесь Tensorflow 1.x, потому что это глючное г@вно.
По возможности всегда и везде сразу используйте Tensorflow 2.x.
Хотя бы потому что у него нет разделения на CPU/GPU версии, и он не требует установки 10 тысяч конфликтующих между собой библиотек 😡

UPD: Есть даже официальное средство миграции старых проектов TF1 на TF2, так что пользуйтесь.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Ты в тренде или уходи
​🤖 Самый детальный гайд по нейросетям — [32:22]

Если вы думаете, что нейросети это сложно, просто посмотрите это видео. Здесь автор на пальцах объясняет, что такое нейросеть, и как она работает.

Вы получите самый детальный разбор принципа работы нейросетей, подкреплённый несколькими практическими примерами и изложенный в максимально понятной и простой форме.

Перейти к просмотру

#нейросеть
🚀 Встречайте новую SOTA Text-2-Image eDiffi: Диффузионные "Эксперты" от NVIDIA

Новый Text-to-Image. В данном случае на классических диффузионных пиксельных каскадах. Модель является гибридом DALL-E от OpenAI 2 и Imagen от Google.

Модель по прежнему использует 3 каскада:
1) Text-To-64pix
2) 64pix-To-256pix
3) 256pix-to-1024pix

Но в данном случае все три модели могут брать любую комбинацию кондишенов из следующих моделей:
— T5 XXL
— CLIP-L/14 Text
— CLIP-L/14 Image

Это позволяет использовать сеть в режиме генерации вариаций (Привет DALL-E 2), а так же юзать легковесный CLIP вместо T5 XXL (который имхо весит неоправданно много). Вообще интересно показано, что T5 работает в связке с CLIP-L/14 Text лучше, чем просто T5. И (спойлер) это действительно так (не скажу откуда знаю).

Кроме того, сеть использует модели — Диффузионные Эксперты для разных этапов денойзинга. Тут смысл такой, если не жалко видеопамять, то можно сделать моделт под разные этапы денойза, например одну под первые 256 шагов, вторую под следующие 256 и так далее. Такие 4 модели буду работать лучше, чем одна. Но и в памяти нужно будет держать их всех.

👑 Используя все эти фишки Karrasи компания добились того, что
eDiffi-Config-D 9.1B (Вместе с CLIP-L/14 и T5-XXL Enc) бьет Zero-shot FID ↓ на COCO-30K 2014 valid SOTA:

GLIDE : 5B - 12.24 FID ↓
MakeAScene : 4B - 11.84 FID ↓
DALL·E 2 : 6.5B - 10.39 FID ↓
StableD : 1.4B - 8.59 FID ↓
Imagen : 7.9B - 7.27 FID ↓
Parti : 20B - 7.23 FID ↓
eDiffi D: 9.1B - 7.04
FID ↓

Ну вот такие новости. Очень много полезных вещей попробовали, советую почитать статью.

🥑 eDiffi от NVIDIA
📇 Paper eDiffi

@ м и ш и н л е р н и н г