Интересное что-то
623 subscribers
2.8K photos
255 videos
143 files
4.66K links
Материалы и мысли, понадерганные отовсюду
Блог: https://t.me/asisakov_channel
Чат: https://t.me/youknowds_chat
Download Telegram
Метрики.pdf
716.7 KB
Вопросы по метрикам спрашивают на любом собеседовании, ведь на метриках держится любой продукт. В прикрепленном файлике для моих любимых подписчиков находятся все популярные метрики, которые нужно просто заучить для собеседований. Но опять же не стоит относиться к ним, как к готовым рецептам. Выбор метрики — это всегда непростая аналитическая задача.

Для первого погружения подойдет открытые вебинары по продуктовой аналитики Тинькофф, качества они не очень, но дареному коню в зубы не смотрят!

1. Метрики
Видео; Презентация
2. Как делать выводы из данных
Видео; Презентация
3. Мобильная аналитика
Видео; Презентация

В том же файлике подготовил вопросы и задачи, которые помогут потренероваться. А если хотите интересную практику на реальных кейсах, то советую наш курс по аналитике.
Forwarded from grokaem себя (Milana)
#grokaem_audio

Интересная статья на medium (что уже редкость) об ускорении whisper для real-time.

Code
Medium

заметки на полях:
0. whisper работает по семплам в 30s, для реалтайма нам нужно процессить семплы и короче, как только они приходят. На этом моменте авторы заметили, что паддинг, который ставит whisper а) разделяет слова, которые еще произносятся б) увеличивает кол-о галлюнов. Первый случай решают re-прогоном, копят короткие семплы к 30s и прогоняют снова.
1. хранят intermediate states (хз что именно тут подразумевают) для реконнекта
2. для streaming диаризацию используют тык на x-vectors. Тут они на каждый чанк считают эмбеддинг, делают clustering на часть предыдущих эмбеддингов, ремепят лейблы и продолжают
3. объединить этот пайплайн с whisper + диаризация тот еще оркестр, потому что как раз диаризации нужно достаточно предыдущих эмбеддингов, а whisper хочет до 30s, чтобы пересчитать, но тоже извините меня не москва, не резиновый - тут они а) resegment выход у whisper и б) ставят похоже forcefully трешхолд какой-то
4. есть еще сложность в кол-ве engines, потому что пайплайн с shared queue тоже не сработает, ведь подключение должно быть постоянным, не получится распознать часть и взять джобу, тут тоже предлагают оркестр с worker pool, к которому прилетает информация и он инициирует подключение
💡 A Guide to Production Level Deep Learning 🎬 📜 ⛴️

Руководство по созданию практических систем глубокого обучения производственного уровня для использования в реальных приложениях.

▪Github

@data_analysis_ml
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Топ подборка полезных нейросетей.
226 AI-сервисов и приложений на все случаи жизни, от известных MGIE, Perplexity, Gemini, Groq до совсем свежих и малознакомых

Эти нейросети помогут вам:
➖управлять движением объектов на видео

➖повысить качество записанного аудио

➖исправить грамматику в любом приложении

➖генерировать аудио, видео, изображения

➖апскейлить изображение

➖и ещё помогут с миллионом других задач

🔗 Каталог

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️Сверхполезная статья от профи Data Science

Здесь обсуждается и показывается, как производить конкатенацию, сегментацию данных, объединять данные — и ещё очень много насущных вещей DS
Годно)

⏩ Клик

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔺 Полезные ссылки для специалиста по Data Science

Эти источники помогут освежить знания по DS, особенно полезно будет полистать перед собеседованием

Изучение основ Python
⏩ Питонтьютор — понятный и удобный курс для освоения базы. Там много задач для практики, которые попадаются на собеседованиях.
⏩ Основы Python-разработки — ещё один бесплатный курс: за 20 часов вы изучите основы и напишете простой код.
⏩ Основы программирования и анализа данных на Python — короткий видеокурс. Особенно рекомендую лекции 7—10 про полезные библиотеки Pandas, NumPy, Matplotlib и Seaborn.

Основы SQL
⏩ Интерактивный тренажёр по SQL — курс с множеством практических заданий на создание SQL-запросов. Рекомендую начать с него.
⏩ Основы работы с базами данных и SQL — ещё один курс с интерактивным тренажёром.
⏩ Упражнения на SQL-EX — тренажёр написания запросов SELECT. Регулярно решайте задачи, чтобы уверенно чувствовать себя на собеседованиях.

Библиотеки Python
⏩ Python PANDAS, полный курс для начинающих — библиотека Pandas помогает удобно работать с табличными данными и похожа логикой на SQL. Основные операции стоит знать наизусть: чтение таблиц, редактирование, работа с пропусками, изменение типов данных. После изучения теории возьмите какой-нибудь датасет и вручную «покрутите» его в Jupyter Notebook
⏩ Основы NumPy — библиотека NumPy помогает быстро и удобно производить математические операции. Она используется во многих других библиотеках. Необязательно знать все операции наизусть, главное — уметь быстро в них сориентироваться при необходимости.
⏩ Matplotlib — библиотеки для визуализации данных. В Seaborn графики выглядят красивее, а Matplotlib гибко настраивается. Заучивать все функции и методы необязательно.
⏩ 50 оттенков Matplotlib — статья с примерами графиков, чтобы построить что-то подобное для своих данных.

Алгоритмы и структуры данных
⏩ Тренировки по алгоритмам — лекции с теорией, домашними заданиями и разборами. Сдавайте задания вовремя, чтобы получить сертификат. Лучших участников готовят к прохождению алгоритмических собеседований.
⏩ LeetCode — сайт с задачами для подготовки к собеседованиям. Решайте уровни Easy и Medium перед интервью.

Математика для анализа данных
⏩ Бесплатный курс «Основы математики для цифровых профессий» поможет закрыть пробелы в базовой математике, чтобы перейти к более сложным темам.
⏩ Теория вероятностей поможет проанализировать данные и отличить случайности от закономерностей. Смотрите лекции от МФТИ и других крутых универов по теорверу на YouTube.
⏩ Основы математической статистики — курс связан с теорвером, и с его помощью можно научиться делать достаточно точные выводы о данных по их выборке.
Курс ведёт Анатолий Карпов — ex-тимлид команды аналитики в отделе бизнеса и рекламы VK. Он крутой специалист, рекомендую его вебинары на YouTube

Продуктовая аналитика
⏩ Публичное собеседование по продуктовой аналитике
⏩ ML для оптимизации цен на основе эластичности по цене
⏩ Как мы не сделали рекомендательную систему в банке
Этого должно быть вполне достаточно, чтобы начать проходить собеседования по чистой продуктовой аналитике.

Используйте все эти ресурсы по максимуму 🔥

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🌟 Открытая книга для специалистов в области AI и ML

Книга состоит из 3 глав.

⏩Глава 1: Освоение OpenAI API
Первая глава знакомит читателей с API ChatGPT. Предоставлена дорожная карта для понимания ключевых стратегий, включая модерацию, Machine Reasoning и Prompt Chaining.

⏩Глава 2: LangChain
Вторая глава посвящена практике использования LangChain. Описан процесс разработки, от настройки среды до внедрения передовых методик извлечения информации (Document Loaders, Text Splitters, Semantic Search, RAG Systems).

⏩Глава 3: ML Ops для LLMs, или LLMOps
Третья глава представляет собой руководство по интеграции LLM в рабочие процессы.
Описываются ключевые этапы от выбора модели до ее развертывания и мониторинга.

Стоит учитывать, что книга не может охватить много аспектов, по-большей части всё вокруг прикручивания готового чат-бота для своих целей
Но при всё при этом можно найти для себя много всего полезного

📎 Книга

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM