DS & ML
589 subscribers
1.17K photos
238 videos
240 files
1.41K links
Download Telegram
Forwarded from эйай ньюз
Про OPT библиотеку я писал ранее. Сразу были опубликованы модели поменьше – до 30 млрд параметров. Ну, а теперь они появились и на hugging face с простым интерфейсом. Модель на 175 миллиардов параметров дадут потрогать только по индивидуальному запросу.

Кстати, поговаривают, что 30-млрд модель тоже считает себя живой 🌚.

@ai_newz
Forwarded from Эксплойт
This media is not supported in your browser
VIEW IN TELEGRAM
Переводчик с языка жестов в реальном времени

Программисты создали нейросеть, способную переводить язык жестов в английские буквы и складывать из них слова без каких-либо задержек.

Согласно исследованиям Human Rights Watch, более 70 миллионов глухонемых людей общаются с помощью языка жестов, а данный ИИ при интеграции, например, в мобильное приложение, позволит им общаться даже с теми, кто этим языком не владеет.

@exploitex
Теоретический_минимум_о_BIG_Data,_что_нужно_знать_о_больших_данных.pdf
2.7 MB
Теоретический минимум о BIG Data, что нужно знать о больших данных. 2019
Анналин Ын, Кеннет Су
Сегодня Big Data - это большой бизнес. Нашей жизнью управляет информация, и извлечение выгоды из нее становится центральным моментом в работе современных организаций. Не важно кто вы - "разведчик" деловой человек, работающий с аналитикой, начинающий программист или разработчик, - "Теоретический минимум по Big Data" позволит разобраться в основах новой и стремительно развивающейся отрасли обработки больших данных.
Хотите узнать о больших данных и механизмах работы с ними? Каждому алгоритму посвящена отдельная глава, в которой не только объясняются основные принципы работы, но и даются примеры использования в реальных задачах. Большое количество иллюстраций и простые комментарии позволят легко разобраться в самых сложных аспектах Big Data.
Forwarded from GitHub Community
​YaLM 100B – языковая модель Яндекса на 100 млрд параметров, построенная на архитектуре трансформеров и обученная на 2 ТБ русских и англоязычных текстов.

Семейство моделей YaLM используется в работе Алисы, Поиска и других сервисов Яндекса. Компания решила выложить самую большую модель в свободный доступ на GitHub под лицензией Apache 2.0, она позволяет пользователям использовать программное обеспечение для любых целей.

Это событие должно помочь разработчикам и исследователям в задачах NLP: YaLM 100B стала самой большой GPT-подобной языковой моделью в мире, опубликованной в опенсорсе.

GitHub | #Interesting
Forwarded from эйай ньюз
⚡️Яндекс подарил миру самую большую на текущий момент публичную языковую модель: YALM 100B.

- 65 дней тренировки на 800 A100
- 1.7 TB текста на русском и английском
- требует 200GB VRAM для инференса

https://github.com/yandex/YaLM-100B

@ai_newz
Forwarded from Код.ру
✏️ Эти тексты совсем скоро будет писать нейросеть //

Яндекс выложил YaLM 100B. Теперь это самая большая GPT-подобная нейросеть в открытом доступе, которая может работать с текстами на русском и английском языках. Каждый из нас может найти её на GitHub по открытой лицензии.

Вы можете знать семейство языковых моделей YaLM по разговорам с Алисой или быстрым ответам в Поиске. Внутри у самой старшей из них — 100 млрд параметров, применение суперкомпьютеров, обучение на 2 ТБ текста. Всё это помогает нейросети создавать любые тексты под разные задачи: от сочинения стихов до генерации ответов на вопросы.

@d_code
Forwarded from GitHub Community
​Flashlight – это быстрая, гибкая библиотека машинного обучения, полностью написанная на C++ от команды Facebook AI Research Speech и создателей Torch and Deep Speech.

GitHub | #Cpp #ML
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
Привет, друзья! Воскресенье - хороший день, чтобы изучить что-то новое.

Для социальной коммуникации человек использует свое тело, лицо, глаза и руки. Как научить машину понимать все это в трехмерном пространстве?

А вот как! Посмотрите лекцию о параметрической модели человека SMPL (A Skinned Multi-Person Linear Model) от ее создателя Майкла Блэка.
Из лекции вы узнаете, как по картинке или видео восстанавливается 3Д поза и форма человека, и много подробностей об устройстве модели SMPL.

Несколько ключевых тем из лекции:
- История методов для моделирования человека.
- Что за данные нужны для обучения
- Как устроена модель SMPL, и как из нее получается полигональная 3Д сетка человека
- Что такое Linear Blend Skinning, и какие проблемы скиннинга решает SMPL
- Модели SMPL-X и FLAME и др.

▶️ SMPL made Simple -- Introduction (1ч 20мин)
📝 SMPL сайт проекта

@ai_newz
Шаблоны и практика глубокого обучения

Автор:
Эндрю Ферлитш
Год: 2022

#books #python #ml #russian
Forwarded from GitHub Community
​Dash – Аналитические веб-приложения для Python, R, Julia и Jupyter.

Это наиболее скачиваемый и одновременно надежный фреймворк Python для создания веб-приложений для ML & data science.

Построенный поверх Plotly.js, React и Flask, Dash связывает современные элементы пользовательского интерфейса, такие как выпадающие списки, ползунки и графики, непосредственно с вашим аналитическим кодом Python.

⤷ Документация
⤷ Примеры программ

GitHub | #Python #R #Web #ML #Data #Science
Forwarded from [PYTHON:TODAY]
This media is not supported in your browser
VIEW IN TELEGRAM
🔥 Полезные библиотеки Python

BlendGAN
- интересная нейронка позволяющая смешивать лица и преобразовывать их в портреты.

⚙️ GitHub/Инструкция

#python #github #soft
Forwarded from AI для Всех
Наглядное пособие по текстовым эмбедингам

Когда люди говорят о больших языковых моделях (LLM), вероятно, первое, что они обсуждают, - это возможность генерации текста, например, написание эссе.

Но языковые модели можно использовать и по-другому - для представления текста (text representation): для каждого текста мы можем получить набор чисел, которые каким-то образом отражают семантику текста. Эти числа называются текстовыми эмбедингами.

Сегодня мне на глаза попалась статья, в которой используется визуальный подход, для объяснения текстовых эмбедингов. Прочитав статью вы узнаете о том, для каких случаев они подходят и как их можно настроить с помощью файнтюнинга.

📖 Статья

@nn_for_science
mplcyberpunk — расширение для matplotlib, с помощью которого можно указать стиль графика "cyberpunk".

После импорта библиотеки, таблица стилей киберпанк (темный фон и т.д.) доступна через plt.style.use. Эффекты свечения линии и нижнего свечения добавляются с помощью вызова add_glow_effects.

Кроме того что вы видите выше - есть ещё пара других эффектов по типу градиента, графиков рассеивания и других.

Так же в mplcyberpunk можно добавлять свои эффекты, поэтому вы не заскучаете :)

Ставится командой ⚙ pip install mplcyberpunk
Документация и примеры кода здесь :3
VQ-Diffusion

Что это такое?
Это модель от microsoft. Смысл этой модели и различие её от обычной диффузии(glide, dalle2, imagen) заключается в том, что она генерирует латентное пространство vqvae, вместо того, чтобы генерировать сразу картинку.
Они заменили unet на трансформер dalle, что позволяет им без проблем генерировать сразу пространство vqvae.
Также они считают текстовые эмбеддинги с помощью клипа, что довольно интересно.

Собрал колаб для этой модели.

гитхаб

пейпер

@gradientdip
Forwarded from [PYTHON:TODAY]
🔥 Полезные библиотеки Python

YaLM-100B
- предварительно обученная, самая большая на сегодня, открытая нейросеть предназначенная для генерации и обработки текстов на русском и английском языках.

YaLM 100В содержит 100 млрд параметров — больше, чем какая-либо из существующих моделей для русского языка. Благодаря этому нейросеть можно применять для решения широкого круга задач, связанных с обработкой естественного языка.

Языковые модели семейства YaLM определяют принцип построения текстов и генерируют новые, опираясь на законы лингвистики и свои знания о мире. Допускается формирование текстов любого типа: это могут быть ответы, стихи, поздравления и пр. Более того, алгоритмы способны придумывать идеи для рекламных кампаний, создавать описания товаров и видео, а также классифицировать тексты.

⚙️ GitHub/Инструкция

#python #github #soft
Forwarded from Codeby
Распознаем текст на изображении двумя библиотеками с помощью Python

Уже довольно давно признанным лидером по распознаванию текста в пользовательском сегменте является Abbyy FineReader. К тому же, она не только позволяет распознавать тексты, но, также и сканировать документы с помощью сканера. Но, речь не о ней. А о том, что в области распознавания текста может предложить Python. Давайте рассмотрим две популярные библиотеки и попробуем сравнить качество распознавания.

📌 Читать далее

#python #ocr
Forwarded from Код.ру
🧠 Нейросеть полиглот //

В Яндексе представили нейросеть, способную распознавать более 10 языков одновременно. При этом она может переключаться между языками в любой момент разговора.

@d_code
Forwarded from эйай ньюз
Привет, друзья!

Собрал для вас список лекций и туториалов про 3D Human Understanding от топовых ученых из этой сферы.
Рекомендасион для всех, кто хочет основательно погрузиться в тему.

1. Andreas Geiger. Diverse Topics in Computer Vision: Human Body Models [video]
2. Michael Black. SMPL made Simple -- Introduction [video]
3. Dimitris Tzionas. SMPL from Images via Optimization [video]
4. Michael Black. SMPL: Frequently Asked Questions [video]
2. Angjoo Kanazawa. Perceiving Humans in the 3D World [video]
3. Iasonas Kokkinos. Humans, hands, and horses [video]
4. Michael Black. Meta-commerce in the Age of Avatars [video]
5. Ahmed Osman. Problems with SMPL and fixing them with STAR [video]
6. Gerard Pons-Moll. Clothing SMPL [video]
7. Siyu Tang. Putting SMPL into Scenes [video]
8. Joachim Tesch. SMPL-X Application Integrations. Using SMPL-X in Blender, Unity and Unreal [video]
9. Datasets of and for SMPL and related models [video]
10. SMPLpix: Combining SMPL and Neural Rendering [video]

@Artem
👌TOP-5 MLOps frameworks
The MLOps topic is in hype today: ML systems are getting more complex, and their development and support includes not only computational algorithms and other data science, but also the best software developments with the intricacies of deploying in production. At the same time, it is necessary to constantly monitor the drift of the input data and the reaction of ML models to them, with the accuracy of correcting the code with its versioning. Establish such a continuous chain of response to complex MLOps frameworks, the most important of which are possible:
• MLflow is an open source platform for managing the end-to-end machine learning lifecycle. https://www.mlflow.org/
• Kubeflow is an open-source machine learning platform designed to enable using machine learning pipelines to orchestrate complicated workflows running on Kubernetes (e.g. doing data processing then using TensorFlow or PyTorch to train a model, and deploying to TensorFlow Serving or Seldon). Kubeflow is built based on Google’s internal method to deploy TensorFlow models called TensorFlow Extended. https://www.kubeflow.org/
• FastAPI is a modern, fast (high-performance), web framework for building APIs with Python 3.6+ based on standard Python type hints. It fully supports asynchronous programming and can run with Uvicorn and Gunicorn. https://fastapi.tiangolo.com/
• ZenML is an open-source MLOps framework built for ML teams. It provides the abstraction layer to bring Machine Learning Models from research to production as easily as possible. Data scientists don’t need to know the details behind the deployment but gain full control and ownership over the whole pipeline process. ZenML standardizes writing ML pipelines across different MLOps stacks, agnostic of cloud providers, third-party vendors, and underlying infrastructure. https://zenml.io/
• Seldon Core is an open-source framework, makes it easier and faster to deploy our machine learning models and experiments at scale on Kubernetes. Seldon Core serves models built in any open-source or commercial model building framework. You can make use of powerful Kubernetes features like custom resource definitions to manage model graphs. And then connect your continuous integration and deployment (CI/CD) tools to scale and update your deployment. Seldon handles scaling to thousands of production machine learning models and provides advanced machine learning capabilities out of the box including Advanced Metrics, Request Logging, Explainers, Outlier Detectors, A/B Tests, Canaries, and more. https://www.seldon.io/solutions/open-source-projects/core