DS & ML
589 subscribers
1.17K photos
238 videos
240 files
1.41K links
Download Telegram
codeformer - алгоритм восстановления лиц на старых фотографиях. Авторизация в сервисе через GitHub.

😉👍 Подписывайтесь на @irozysk
👍1
Midjourney - одна из лучших нейросетей для генерации картинок. Но, к сожалению, платная. Самый простой тариф с минимальными возможностями и кучей ограничений стоит $8 в месяц.

OpenJourney - это Stable Diffusion натренированная на изображениях созданных Midjourney v4.

Работает быстро, бесплатно и результаты получаются очень хорошие. До того, что делает Midjourney, наверное, все же не дотягивает. Хотя если сильно не присматриваться и не придираться, то отличия не очень заметны.

Попробовать можно здесь https://replicate.com/prompthero/openjourney
Одно из главных правил генерации картинок с помощью нейросетей - чем сложнее и подробнее составлено описание (промпт), тем качественнее и оригинальнее получится результат.

Тут стоит уточнить, что слишком длинные промпты иногда могут не срабатывать (предел индивидуален для каждой нейросети) и хорошие картинки могут иногда получаться из 1-2 слов. Но в целом, закономерность “длинные промпты” -> “качественные изображения” четко прослеживается.

Если у вас нет каких-то четких идей будущей картинки (например, вы просто знаете, что вам нужен какой-нибудь кролик), то можно воспользоваться сервисом Prompt Extend. Он из одного или нескольких слов генерирует длинные и подробные промпты. Редактировать их под свои потребности гораздо легче, чем придумывать описание с нуля.


https://huggingface.co/spaces/daspartho/prompt-extend
Forwarded from Эксплойт
This media is not supported in your browser
VIEW IN TELEGRAM
Все лучшие нейросети для работы в одном месте — авторы Unbound собрали в своем сервисе самые полезные ИИ-инструменты.

Тут есть свой аналог ChatGPT, которые может создавать тексты и посты для социальных сетей, генератор изображений, и даже ИИ для создания красивых фото для рекламы.

Можно попробовать бесплатно тут, но доступ дают не ко всем инструментам.

@exploitex
Forwarded from GitHub Community
​CodeFormer – нейросетевая модель для восстановления размытых, поврежденных, не качественных фотографий лиц людей

⤷ Ссылка на проект

GitHub | #Interesting #AI #Useful #Photo
Forwarded from Habr For Dev
#распознавание-текста #оптическое-распознавание-символов

Как я делаю OCR

Рейтинг: 21

Читать
Forwarded from эйай ньюз
🔥 Lion: EvoLved Sign Momentum - новый оптимайзер от Гугла

Google нашел новый алгоритм оптимизации при помощи Symbolic Search (завтра объясню, что это такое). Новый оптимайзер тупо мониторит momentum, а размер финального апдейта весов считается как sign(grad (1-β1) + β1 momentum). То есть апдейт для каждого элемента весов равен либо -1 * LR либо +1 * LR!

train(weight, gradient, momentum, lr):
update = interp(gradient, momentum, β1)
update = sign(update)
momentum = interp(gradient, momentum, β2)
// Тут я пропустил weight decay для простоты
update = update * lr
return update, momentum

Просто волосы дыбом от тупости Lion, но он дает серьезные улучшения в скорости сходимости, да и в найденных локальных минимумах. Рвет и обычную классификацию и языковые модели и диффузионные.

Чем больше батч, тем лучше работает Lion. Еще он более устойчив к различным выборам гиперпараметров по сравнению с AdamW.

Уже попробовал на свои задачах, вроде работает!

❱❱ Код на PyTorch, JAX и TF

@ai_newz
Chat GPT и Революция Искусственного Интеллекта

Автор:
Тимур Казанцев
Год: 2023

#books #russian
Полезные Spaces (приложения для тестирования возможностей нейросетей) на HuggingFace.co


Редактирование изображений в соответствии с текстовым описанием
https://huggingface.co/spaces/timbrooks/instruct-pix2pix

Редактирование видео в соответствии с текстовым описанием
https://huggingface.co/spaces/fffiloni/Pix2Pix-Video

Качественное преобразование речи из YouTube видео в текст
https://huggingface.co/spaces/jeffistyping/Youtube-Whisperer

Сервис для создания аудиокниг из PDF-документов
https://huggingface.co/spaces/mkutarna/audiobook_gen

Генерация длинных и подробных промптов для создания изображений с помощью нейросетей на основе одного или нескольких слов
https://huggingface.co/spaces/daspartho/prompt-extend
Распознаем речь AI

На данный момент мой способ распознания – это ознакомление с AI голосом, сопоставление его с настоящим.

Все возвращается к тому, что «компьютер не умеет рандомить». В разговорных узорах человека всегда имеются вводные конструкции/слова, междометия и паузы. Мимикрировать данный элемент AI не может.
Лучшим примером такого сопоставления будет AI голос Байдена против его живой речи. Нейросетка «омолаживает» его путем того, что минует многочисленные паузы и междометия, которые применяются им в силу возраста.

Бонусом небольшой список сайтов по генерированию. Ресурсы не проверял, просто стырил позаимствовал из статьи:
- murf.ai
- speechify.com
- speechelo-offer.com
- synthesys.io
- bigspeak.ai
- Play.ht
- Spik.ai
- resemble.ai
- Lovo.ai

Если найдете онлайн обсуждение по идентификации AI голосов, буду рад почитать.

#кибермысли
pytesseract - одна из лучших библиотек для распознавания текста в Python.
Является обёрткой над Google’s Tesseract-OCR Engine.

Я её лично применял, когда делал бота-авторыбалку для Terraria.

Из особенностей:
— Легко использовать
— Работает с разными языками
— Можно распознавать кастомные шрифты
— Нативная поддержка OpenCV
— Куча полезных параметров и настроек

Ставится командой ⚙️ pip install pytesseract
Документация и примеры кода здесь.
Forwarded from Не баг, а фича
​​Получаем выжимку ролика на YouTube с помощью ChatGPT

На YouTube загружают контент, поглощать который легко. Но смотреть видео – долго. Даже смотреть ускоренное видео – дольше, чем прочитать короткий тезисный текст.

Eightify – расширение, которое создает саммари длинных видео с YouTube и выводит их текстом с отмеченными тайм-кодами. Превращает любое длинное видео на YouTube в резюме с 8 ключевыми идеями. Экономит ваше время, чтобы вы быстрее добирались до самой сути.

Инструмент идеально подходит для бизнес-образования, подкастов, интервью, новостей и лекций. Eightify работает на алгоритме обработки естественного языка GPT-3 от OpenAI и еще нескольких готовых моделях.

Чтобы получить саммари, откройте нужный ролик на YouTube, нажмите кнопку «Summarize» и через 10-20 секунд получите основные тезисы видео. Длительность анализируемого ролика ограничена тремя часами.

#расширение #chrome
Forwarded from эйай ньюз
Как я уже упоминал, OpenAI пытается позиционировать себя как продавец API к своим жирным SOTA моделям, ведь продукта то у них никакого нет.

Так вот сегодня они наконец сделали публичный API к своим ChatGPT и Whisper (распознавалка речи) .

@ai_newz
Forwarded from Журнал «Код»
Бесплатно и без ВПН

#объяснялово_Код