DS & ML
589 subscribers
1.17K photos
238 videos
240 files
1.41K links
Download Telegram
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
Генерация текстурированных 3D ассетов - это, то где нейронки ещё не зрелые, по сравнению с 2D генерацией.

NVIDIA AI поделились своей работой с NIPS2022 – Get3d: Quality 3D Textured Shapes Learned from Images, которая делает шаг в направлении улучшения генерации 3D объектов.

Метод довольно простой, сеть генерирует фичи из шума для текстуры и для формы, затем это преобразуется в мешь с помощью трюка tri-plane representation (из EG3D) и Deep Marching Tetrahedra. Затем мы растеризуем мешь в RGB картинку и в силуэт и показываем их двум дискриминатора.

Как бы все легко, но тут скомбинированы несколько идей, придуманных за последние 2 года.

❱❱ Сайт проекта
❱❱ Кода ещё нет

@ai_newz
Forwarded from эйай ньюз
Вот так выглядит пайплайн GET3D, и ещё результаты генерации.

@ai_newz
😂 Keras обернул собой Stable Diffusion

что не сделает умирающий керас, чтобы хоть еще чуть-чуть удержаться за "жизнь"

👉 https://github.com/keras-team/keras-cv/pull/828

🤖 м и ш и н л е р н и н г
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
Нашел на реддите скриптик, который увеличивает детализируемость картинок с помощью прогона Stable Diffusion на маленьких пересекающихся патчах в виде круга.

Так можно использовать этот скрипт как постобработку и нехило улучшить свою генерацию. Посмотрите, как проявляются детали при увеличении.

❱❱ Код

@ai_newz
Forwarded from эйай ньюз
Whisper - пошепчем про speech recognition

На днях OpenAI выпустила новую сеть для распознавания речи – Whisper. Это трансформер, который в максимальной комплектации содержит скромные полтора миллиарда параметров.

Чем отличается от уже существующих сеток для решения этой задачи? Я вам точно не скажу, потому что я статью детально не читал, но выглядит все так, что это, как обычно, победа инженерии и хорошо собранный и размеченный датасет на 680,000 часов.

Из приятного, на гитхабе доступны и код и веса моделей разной жирности. Тут они отрабатывают свое название "Open".

Модель знает несколько языков, автоматически их распознавая, русский язык в том числе. И она хорошо показывает себя на zero-shot бенчмарках.

Кстати, 90% этого текста я надиктовал в Виспере.

❱❱ Код с весами
❱❱ Блогпост

@ai_newz
Forwarded from Habr For Dev
#yandex-research #нейронные-сети

Самая большая BERT-подобная модель на русском, которая поместится на ваш компьютер

Рейтинг: 43

Читать
👍1
😐 Полиглот от EleutherAI

В рамках нашей работы по демократизации и расширению доступа к языковым моделям во всем мире сформировалась команда Polyglot, лаба в EleutherAI, исследования которых сосредоточены вокруг многоязычного и неанглоязычного НЛП.

Мы (да да) рады объявить об их первых моделях: корейских LLM с параметрами 1.3B и 3.8B

Так что ждите и другие языки натрененные нормально 😅

🗣 Polyglot от Eleuther
🌐 твит Стэллы
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Один чел сделал на Python детектор куриц, чтобы когда они заходят во двор - автоматически включался полив воды и отпугивал их.

Как написал автор этого изобретения в своем блоге:
«У меня был старый китайский телефон, старый raspberry pi 3b+, python, opencv и немножко deep learning. А еще у меня были соседские курицы, которые меня з@#б@ли.»

Python, который мы заслужили 🌚
Forwarded from Denis Sexy IT 🤖
Нейронка для генерации арта Dalle 2 доступна теперь для всех, просто регаетесь и го генерить:
https://labs.openai.com/auth/signup
Forwarded from Neural Shit
Но в целом, считаю, что OpenAI проебались и открыли регистрацию слишком поздно, ибо Stable Diffusion генерит плюс-минус так же, свой веб интерфейс для генераций бесплатно поднимается в 5 кликов в колабе, и самое главное, стебель можно файтюнить (тоже бесплатно и в колабе).

Ну и сейчас все ломанулись регаться в dalle-2, отчего очередь там будет как в советский магазин, в который завезли дефицитные сапоги набитые сырокопченой колбасой (уже при попытке зарегаться кидает ошибку о том, что что-то пошло не так)
🦊 OpenAI открыло DALL•E 2 для всех желающих.

Смотрите, что стебель живогенерящий с людьми творит. Не без регистрации и смс конечно. Но зато бесплатно с пару десятков можно генернуть.

🥁 регаться тут https://openai.com/dall-e-2/
​​ИИ способный разоблачать анонимных писателей🤔

Разведка США запустила программу по разработке искусственного интеллекта, который может определять авторство анонимных писем, а также маскировать личность автора, слегка изменяя его слова.

Программа Human Interpretable Attribution of Text Using Underlying Structure (HIATUS) от Intelligence Advanced Research Projects Activity (IARPA) направлена на создание программного обеспечения, которое может выполнять «лингвистическое снятие отпечатков пальцев» и изменять его при необходимости.

«Люди и машины ежедневно производят огромное количество текстового контента. Текст содержит лингвистические особенности, которые могут раскрыть личность автора» — говорится в сообщении ведомства.

☝🏻Об этом также был один из моих роликов.

IARPA полагает, что с правильной моделью она может определить согласованность стиля писателя в разных образцах, изменить эти языковые шаблоны, чтобы сделать письмо анонимным, и сделать все это так, чтобы это было понятно начинающим пользователям.

ИИ HIATUS сможет работать независимо от языка.🤖
Forwarded from Habr For Dev
#машинное+обучение #машинный-перевод

Как создать переводчик, который переводит лучше, чем Google Translate

Рейтинг: 51

Читать
SReC — нейронная сеть для сжатия изображения без потери качества.

SReC рассматривает сжатие без потерь как проблему сверхвысокого разрешения и применяет нейронные сети для сжатия изображений. SReC может достичь самых современныхq коэффициентов сжатия больших наборов данных с практичным временем выполнения.

* Обучение, сжатие и распаковка полностью поддерживаются и имеют открытый исходный код :0

Фотография сверху - пример сжатия изображения без потери качества(тг съел качество, поэтому я оставил ссылку).

Документация и примеры кода здесь :3
Forwarded from Neural Shit
Иногда (особенно сейчас) надо прекращать думать о хуёвом и давать мозгу расслабиться и отдохнуть.

Лучший способ — это залипнуть в психоделический видос сгенеренный нейронкой. Вот, я вам принёс 40 минут такого залипалова: https://www.youtube.com/watch?v=HxRgAMt4-nw
This media is not supported in your browser
VIEW IN TELEGRAM
🚀 WoW! DALL-E 2 для генерации видео! MAKE-A-VIDEO от MetaAI

📄 tl;dr

Ресерчеры из MetaAI обучили диффузионную нейросеть (типа DALL-E 2, Imagen, Стебель) MAKE-A-VIDEO, способную генерировать короткие видео-ролики по текстовому описанию!

А самое крутое то, что для этого им не потребовался датасет, содержащий пары видео - текст!


🚬 Что же за заверь MAKE-A-VIDEO?

Начнем с того, что название MAKE-A-VIDEO, отсылает нас к Make-A-Scene от тех же MetaAI — DALL-E поколения, которая имела кондишн не только в тексте, но и в семантической маске. Название имхо не очень удачное, так как тут ничего подобного нет. НО это DALL-E-like 2-го поколения и, видно, они просто решили двигать свой бренд MAKE-A- ... Ок, их дело.

Основной фишкой этой работы является развитие мысли: "Картинка это видео с одним кадром". Но как это реализовано? И главное, как можно сделать Text-To-Video без Text-To-Video данных?!

Подход напоминает DALL-E 2 — разделяй и властвуй декомпозируй и генерь,с его CLIP_text_emb -> CLIP_image_emb Prior!

Генрация видео Y может быть представлена как композиция Модулей:

🗒 Y = SR(th) ◦ SR(tl) ◦ ↑F ◦ Dt ◦ P ◦ (X_t, C(X_i))

Идея очень простая и изящная давайте прост разберем ее элементы:

0. X_i — картинка, X_t — текст. {X_i, X_t} — пара картинка-текст.

1. C(X_i) — CLIP embedding изображения X_i. N-мерный вектор, содержащий в себе необходимые фичи для описания картинки.

2. P — Prior, диффузионная нейронная сеть, отображающая X_t текстовые CLIP embedding'и в CLIP image embedding'и

Теперь понятно, что имея текст, можно получить | P (X_t) —> C(X_i) | варианты визуальных эмбеддингов возможных изображений.

3. Дальше вступает модуль Dt, который готовит 16 RGB фреймов по 64 × 64 на основе CLIP эмбеддинга первого кадра!

И на этот этапе становится понятно, что не нужны пары текст-видео!

4. Модуль ↑F делает интерполяции между кадрами и SR(th) ◦ SR(tl) делают пространственно-временной апскейл из 64х в 256 и 768

👾 Сайт Проект (тыкать обязательно!)
📄 Paper

🤖 м и ш и н л е р н и н г
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
🦚 DreamFusion: Text-to-3D using 2D Diffusion от ?Google

Не успели мы насладиться Text2Video от MetaAI как выходит Text-To-3D диффузия.. Что за день..

🚀 Как работает? Идея супер изящная!

Это градиентный метод, основанный на Loss-функции, такой как DeepDream. По факту происходит оптимизация рандомно инициализированной 3D модельки (a Neural Radiance Field, or NeRF) через градиенты 2D диффузионных генераций.

То есть по факту, проворачивая такой трюк, не нужно иметь 3D данных вообще!

Подробнее:
1) Рандомная фигура рендерится через NERF (плотность, освещение, цвет)

2) Этот изначальный бред (так как это начало) рендерится в 2D проекцию

3) Затем к картинке подмешивают шум, и все это подается на!!! внимание!! ИМАГЕН

4) После чего Имаген предсказывает необходимый денойз

5) Затем из пересказанного денойза вычитается подмешанный шум. и ВУАЛЯ! Дальше все дифференцируемо! Можно пускать градиенты обратно на 3D-модель

А то что у ребят был доступ к IMAGEN мне на 99.9999999% кажется, что это Google. Ну, а так, чем Тьюринг не шутит..

👁 gallery
📄 paper
📇 project

🤖 м и ш и н л е р н и н г
☠️ Colab — Все!

Все мы любили колаб. Но увы, ничто не вечно под луной. И теперь можно купить или 100 или 500 compute units, что в переводе на бытовой означает, что колаб сдулся.

🪦 Царство небесное, вечн Йисгадал вэйискадаш шмэй рабо..

🤖 м и ш и н л е р н и н г
Forwarded from эйай ньюз
Вот вам блог-постик c объяснением Variational Lower Bound или Evidence Lower Bound (ELBO). Никогда не поздно поднимать базу #fundamentals, да и на
ML собесах пригодится.

❱❱ Ссылка

@ai_newz