DS & ML
589 subscribers
1.17K photos
238 videos
240 files
1.41K links
Download Telegram
Forwarded from Big Data Science
🎂Terality - super fast serverless engine instead of slow Pandas
Terality
is a serverless data processing engine that runs on giant clusters to work with datasets of any size. Thanks to the serverless paradigm, you don’t have to worry about scaling resources in clusters or other infrastructure: there are practically no limits on memory, and therefore on the size of a data set. It only needs a good internet connection to handle hundreds of GB, even on a simple office laptop with 4GB of RAM. Terality allows you to run Pandas code 10 times faster: Terality syntax is similar to Pandas. It only takes one line of code to switch from Pandas to Terality: import teratiyu as te. The Python package sends HTTPS requests to the Terality engine when you call Pandas functions. The engine processes the data and the command and returns the result. However, Terality is not just a Python package, but freemium software with a free 1TB plan. This counts every API call, not just data reads.
https://docs.terality.com/
https://towardsdatascience.com/good-bye-pandas-meet-terality-its-evil-twin-with-identical-syntax-455b42f33a6d
👍1
Forwarded from shonenkov AI
Встроенный механизм самооценки результатов генерации, очень легкая нейронная сеть 🦌 ruDOLPH 350m 🦌 доступна в открытом доступе, только что обновил версию!

пример генерации: "старинный будильник многоугольной формы"
256 попыток, нейронная сеть сама выбрала 36 лучших генераций, и все за 38 сек! 😳 посмотрите какие получились интересные генерации!

ресурсы: [github] [huggingface] [colab]
авторы: [AI AbuZZer] & [Mishin Learning]
Forwarded from GitHub Community
​Dash – Аналитические веб-приложения для Python, R, Julia и Jupyter.

Это наиболее скачиваемый и одновременно надежный фреймворк Python для создания веб-приложений для ML & data science.

Построенный поверх Plotly.js, React и Flask, Dash связывает современные элементы пользовательского интерфейса, такие как выпадающие списки, ползунки и графики, непосредственно с вашим аналитическим кодом Python.

⤷ Документация
⤷ Примеры программ

GitHub | #Python #R #Web #ML #Data #Science
GPT-NeoX-20B - Open-Source huge language model by EleutherAI (Interview w/ co-founder Connor Leahy)

🎥
youtube интервью

Помните, я писал, что 9го февраля 2022 выложат в открытый доступ GPT-3 с 20B параметров! Ждём GPT-NeoX-20B

Это будет первая публичная GPT-3 такого масштаба: GPT-NeoX-20B по своим интеллектуальным способностям находится между двумя самыми топовыми решениями от OpenAI.

Янык взял интервью у кофаундера EleutherAI. Какие темы поднимаются в видео:

▪️ Как достать такой компьют?
▪️ Эксперименты и масштаб моделей
▪️ GPT-Neo, GPT-J, GPT-NeoX
▪️ Насколько сложно обучать большие модели?
Короткая статья ExT5: Towards Extreme Multi-Task Scaling for Transfer Learning от Гугла, вышедшая этой осенью.

Вкратце: в предобучение классической модели T5 авторы добавили смесь из ~100 разнообразных задач на понимание и генерацию текстов (всё для английского), добавив это в пропорции 1:2 к стандартной unsupervised задаче T5 (восстановление замаскированных промежутков текста). Оказалось, что такое предобучение докидывает по нескольку пунктов практически к любому классу задач, на которых модель предобучается потом – например, повышает скор с 76% до почти 80% на SuperGLUE. Приятно, что растёт скор даже на тех типах задач, на которых модель не предобучалась (в частности, перевод и NER); это показывает, что мультизадачное предобучение вроде как действительно делает модель более умной. Ещё авторы пытались выбирать, на каких задачах лучше всего предобучаться, и задачи типа NLI и commonsense reasoning вроде как показались наиболее перспективными. Но вообще, получилось, что лучше не пытаться выбрать наилучший сабсет задач для предобучения, а просто пытаться предобучить модель на всём, чём можно.

К сожалению, обученную модель авторы так вроде и не выложили, хотя стоило бы. Ну ничего, у меня потихоньку зреет новая мультитасковая модель, хоть и не такая масштабная, как у Гугла, зато компактная и русскоязычная. Ну и уже давно есть rut5-base-multitask, которая тоже чего-то могёт 🙃
Forwarded from Библиотека программиста
​🧭 ТОП-17 бесплатных учебных курсов по AR/VR

В этой подборке мы собрали лучшие бесплатные курсы по виртуальной и дополненной реальности по различным направлениям и для любого уровня знаний.

https://proglib.io/sh/2EjzDc35HJ
Forwarded from тоже моушн
подробный урок от Сергея Пирогова по созданию нейро-арта в колабе Disco Diffusion
Forwarded from Технотренды
​🧠 Нейросети могут быть опасными: сгенерированные лица и синтезированные голоса все более реалистичны

Технология машинного обучения, нейросети - все это стало уже давно привычным во многих отраслях науки, технологий, медицины и других сфер. В том, что они могут быть очень полезными, нет никаких сомнений. Но есть и обратная сторона медали - использование возможностей современных технологий для обмана...

Статьи Программиста | #neuroweb #future
Антология машинного обучения. Важнейшие исследования в области ИИ за последние 60 лет

Автор:
Терренс Сейновски
Год: 2022

#books #ml #russian
Forwarded from AbstractDL
This media is not supported in your browser
VIEW IN TELEGRAM
GPT + RL = Decision Making

Это гениально! Ребята из гугла показали, как с помощью RL можно научить GPT-2 управлять виртуальным агентом и решать сложные задачи: на видео он выполняет команду «найди и положи две вилки в холодильник».

Идея очень простая: действия агента, его цель и наблюдения кодируются в виде слов, координаты объектов эмбеддятся с помощью MLP и прибавляются к эмбеддингам соответсвующих токенов. Всё это прогоняется через GPT-2 и на основе её аутпутов уже другая сеть предсказывает следующее действие. Обучается всё это на 20k примеров решений VirtualHome при помощи RL и Imitation Learning.

P.S. Есть ещё пара работ про RL + GPT, о которых я писал тут и тут.

Статья, блог, GitHub
Forwarded from Эксплойт
​Нейросеть объединяет фотографии

Сегодня вы можете прикоснуться к искусству (и даже стать его частью), даже не умея рисовать ровный круг. Проект из сегодняшнего обзора позволяет буквально объединить две фотографии, взяв от каждой самое важное.

На ostagram.me вы можете взять, например, фотографию себя и работу Ван Гога, и получить шедевр, который далеко не каждый художник сможет воссоздать.

Результаты получаются разные: порой красивые, порой нелепые и смешные. Попробовать явно стоит, однако обработка в бесплатной версии может занять некоторое время.

Сайт преобразовался в своего рода соц.сеть, где пользователи выкладывают свои результаты и фотографии, из которых они произошли.

#нейросети
🚀 OpenAI выкатил в открытый доступ веса самого топового CLIP

Прошло и года (13 месяцев) и OpenAI выложил веса RN50x64 и ViT-L/14

Загрузить самый топовый ViT-L14 можно, заменив ваш ViT-B/16 в одной строке:

model, preprocess = clip.load('ViT-L/14', device)

p.s.: Наткнулся случайно, когда ставил очередной эксперимент выходного дня, и после того как написал clip.load('RN-50', device) вместо 'RN50' в ошибке увидел в списке доступных моделей 'ViT-L/14'. Полезная ошибка вышла.

Всем хороших выходных, и да здравствует Zero-Shot!

👉 https://github.com/openai/CLIP
Обучать модели на больших корпусах неразмеченных текстов – круто, но иногда хочется напрямую загружать в них структурированные знания. Есть базы знаний типа wikidata или conceptnet, состоящие из объектов и отношений между ними. Каждый элемент базы – тройка (объект1, отношение, объект2), типа ("Elizabeth II", "Queen Of", "UK"). Многие из этих баз формально мультиязычные, но по факту большая часть содержательных триплетов в них – на английском. Но и для других языков есть, что вытащить.

На днях я взял conceptnet5, отфильтровал те триплеты, которые отвечают за семантику и для которых есть русские синонимы, и подставил туда эти синонимы. Вот блокнот, где я это делал. Получился такой файлик на 150 мегабайт довольно шумных триплетов с русскоязычными аргументами, всего около 500К триплетов, но из них почти половина - синонимичные.

Триплеты вышли примерно такие:
- "нормальный" связано с "производная функции"
- "бес" связано с "демонология"
- "beretta ar 70" – это один из "автомат"
- "лёгкий сон" связано с "сон"
- "досаждать" синоним "чума"

Результатом я не очень доволен (половина смысла похерилась из-за ошибок перевода или в целом шумной разметки), но зато это было достаточно легко и быстро. Думаю, если вложить в это дело побольше любви и времени, может получиться вполне адекватная база знаний.

А какими базами знаний, поддерживающими русский язык, пользовались вы?
Forwarded from эйай ньюз
Ускорение диффузионных моделей 🔥

Еее! Вышла статья, которая ускоряет генерацию картинок с помощью диффузионных моделей моделей в 20 раз!

Ускорение достигается за счёт нового взгляда на диффузионные модели – предлагается смотреть на них как на дифференциальные уравнения, а диффуры мы умеем довольно быстро решать численными методами!

Дисклеймер: в статья красивая, но сложная математика!

Уже есть колаб с ускоренной диффузией. 16 примеров выше я сгенерил на Nvidia T4 за 5 минут (100 итерации). Запрос "Doggy, oil on canvas".
Forwarded from Метаверсище и ИИще (Sergey Tsyptsyn)
This media is not supported in your browser
VIEW IN TELEGRAM
Ох ничего себе, посмотрите какой класс!
Motion designer Денис Кочегаров использует Disco Diffusion для вот такой вот анимации.
Смотрится просто ошеломительно.
Тот случай, когда хочется выпить за художника-постановщика и концептера вместе взятых.
Кожаные никогда так не нарисуют.
Я залипаю все утро.

Ссылки на автора:
https://www.instagram.com/stokerdemien/
https://www.behance.net/vjdemien
Forwarded from Ты в тренде или уходи
​🧠 Уроки по нейронным сетям

Нейронные сети — это то, что подбирает нам рекомендации в ленте, управляет автомобилем и даже помогает при написании кода.

В этом плейлисте из 7 небольших уроков на практике показывается, как нейросети устроены изнутри. Вот так, пока кто-то боится восстания роботов, другие этих роботов создают.

Перейти к просмотру

#нейросети
Forwarded from Ты в тренде или уходи
​🗯 Полезные структуры данных — [9:40]

Существует целая куча популярных структур данных, которые могут ускорить ваше приложение.

Деревья, двухсвязанные списки, фильтр Блума, кольцевой буфер — все эти структуры и их применения как раз и описаны в этом видео в довольно кратком виде.

Перейти к просмотру

#видео
Forwarded from Ты в тренде или уходи
​🧠 Как нейросети генерируют изображения — [13:42]

У нейросетей очень много направлений, но генерация изображений — это, пожалуй, самое востребованное и перспективное направление среди всех остальных.

Из этого видео вы во всех подробностях узнаете, какие есть архитектуры построения модели для создания изображений, чем они отличаются друг от друга и увидите всё на понятных практиктических примерах.

Перейти к просмотру

#нейросети