Forwarded from Chad Protocol - карьера, IT, успех
Метрики.pdf
716.7 KB
Вопросы по метрикам спрашивают на любом собеседовании, ведь на метриках держится любой продукт. В прикрепленном файлике для моих любимых подписчиков находятся все популярные метрики, которые нужно просто заучить для собеседований. Но опять же не стоит относиться к ним, как к готовым рецептам. Выбор метрики — это всегда непростая аналитическая задача.
Для первого погружения подойдет открытые вебинары по продуктовой аналитики Тинькофф, качества они не очень, но дареному коню в зубы не смотрят!
1. Метрики
Видео; Презентация
2. Как делать выводы из данных
Видео; Презентация
3. Мобильная аналитика
Видео; Презентация
В том же файлике подготовил вопросы и задачи, которые помогут потренероваться. А если хотите интересную практику на реальных кейсах, то советую наш курс по аналитике.
Для первого погружения подойдет открытые вебинары по продуктовой аналитики Тинькофф, качества они не очень, но дареному коню в зубы не смотрят!
1. Метрики
Видео; Презентация
2. Как делать выводы из данных
Видео; Презентация
3. Мобильная аналитика
Видео; Презентация
В том же файлике подготовил вопросы и задачи, которые помогут потренероваться. А если хотите интересную практику на реальных кейсах, то советую наш курс по аналитике.
Forwarded from grokaem себя (Milana)
#grokaem_audio
Интересная статья на medium (что уже редкость) об ускорении whisper для real-time.
Code
Medium
заметки на полях:
0. whisper работает по семплам в 30s, для реалтайма нам нужно процессить семплы и короче, как только они приходят. На этом моменте авторы заметили, что паддинг, который ставит whisper а) разделяет слова, которые еще произносятся б) увеличивает кол-о галлюнов. Первый случай решают re-прогоном, копят короткие семплы к 30s и прогоняют снова.
1. хранят intermediate states (хз что именно тут подразумевают) для реконнекта
2. для streaming диаризацию используют тык на x-vectors. Тут они на каждый чанк считают эмбеддинг, делают clustering на часть предыдущих эмбеддингов, ремепят лейблы и продолжают
3. объединить этот пайплайн с whisper + диаризация тот еще оркестр, потому что как раз диаризации нужно достаточно предыдущих эмбеддингов, а whisper хочет до 30s, чтобы пересчитать, но тоже извините меня не москва, не резиновый - тут они а) resegment выход у whisper и б) ставят похоже forcefully трешхолд какой-то
4. есть еще сложность в кол-ве engines, потому что пайплайн с shared queue тоже не сработает, ведь подключение должно быть постоянным, не получится распознать часть и взять джобу, тут тоже предлагают оркестр с worker pool, к которому прилетает информация и он инициирует подключение
Интересная статья на medium (что уже редкость) об ускорении whisper для real-time.
Code
Medium
заметки на полях:
0. whisper работает по семплам в 30s, для реалтайма нам нужно процессить семплы и короче, как только они приходят. На этом моменте авторы заметили, что паддинг, который ставит whisper а) разделяет слова, которые еще произносятся б) увеличивает кол-о галлюнов. Первый случай решают re-прогоном, копят короткие семплы к 30s и прогоняют снова.
1. хранят intermediate states (хз что именно тут подразумевают) для реконнекта
2. для streaming диаризацию используют тык на x-vectors. Тут они на каждый чанк считают эмбеддинг, делают clustering на часть предыдущих эмбеддингов, ремепят лейблы и продолжают
3. объединить этот пайплайн с whisper + диаризация тот еще оркестр, потому что как раз диаризации нужно достаточно предыдущих эмбеддингов, а whisper хочет до 30s, чтобы пересчитать, но тоже извините меня не москва, не резиновый - тут они а) resegment выход у whisper и б) ставят похоже forcefully трешхолд какой-то
4. есть еще сложность в кол-ве engines, потому что пайплайн с shared queue тоже не сработает, ведь подключение должно быть постоянным, не получится распознать часть и взять джобу, тут тоже предлагают оркестр с worker pool, к которому прилетает информация и он инициирует подключение
Forwarded from Анализ данных (Data analysis)
💡 A Guide to Production Level Deep Learning 🎬 📜 ⛴️
Руководство по созданию практических систем глубокого обучения производственного уровня для использования в реальных приложениях.
▪Github
@data_analysis_ml
Руководство по созданию практических систем глубокого обучения производственного уровня для использования в реальных приложениях.
▪Github
@data_analysis_ml
Forwarded from Анализ данных (Data analysis)
This media is not supported in your browser
VIEW IN TELEGRAM
226 AI-сервисов и приложений на все случаи жизни, от известных
MGIE, Perplexity, Gemini, Groq до совсем свежих и малознакомыхЭти нейросети помогут вам:
🔗 Каталог
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Анализ данных (Data analysis)
Здесь обсуждается и показывается, как производить конкатенацию, сегментацию данных, объединять данные — и ещё очень много насущных вещей DS
Годно)
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Анализ данных (Data analysis)
Эти источники помогут освежить знания по DS, особенно полезно будет полистать перед собеседованием
Изучение основ Python
Основы SQL
Библиотеки Python
Алгоритмы и структуры данных
Математика для анализа данных
Курс ведёт Анатолий Карпов — ex-тимлид команды аналитики в отделе бизнеса и рекламы VK. Он крутой специалист, рекомендую его вебинары на YouTube
Продуктовая аналитика
Этого должно быть вполне достаточно, чтобы начать проходить собеседования по чистой продуктовой аналитике.
Используйте все эти ресурсы по максимуму
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Анализ данных (Data analysis)
Книга состоит из 3 глав.
Первая глава знакомит читателей с API ChatGPT. Предоставлена дорожная карта для понимания ключевых стратегий, включая модерацию, Machine Reasoning и Prompt Chaining.
Вторая глава посвящена практике использования LangChain. Описан процесс разработки, от настройки среды до внедрения передовых методик извлечения информации (Document Loaders, Text Splitters, Semantic Search, RAG Systems).
Третья глава представляет собой руководство по интеграции LLM в рабочие процессы.
Описываются ключевые этапы от выбора модели до ее развертывания и мониторинга.
Стоит учитывать, что книга не может охватить много аспектов, по-большей части всё вокруг прикручивания готового чат-бота для своих целей
Но при всё при этом можно найти для себя много всего полезного
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Запрети мне псевдолейблить
Кстати о репостах:
Собрал из ретроспективы по Open Problems пост на хабр. Поддержите заливом лайков, пожалуйста🔝
Собрал из ретроспективы по Open Problems пост на хабр. Поддержите заливом лайков, пожалуйста
Please open Telegram to view this post
VIEW IN TELEGRAM
Хабр
Как машинлернеры мерили экспрессию генов от воздействия лекарств
Привет! Меня зовут Дима и я веду канал про соревновательный МЛ . Недавно мы выиграли приз в довольно престижном соревновании и я сделал обзор всех лучших решений Хочу вам рассказать о Open Problems,...