Forwarded from Анализ данных (Data analysis)
Здесь обсуждается и показывается, как производить конкатенацию, сегментацию данных, объединять данные — и ещё очень много насущных вещей DS
Годно)
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Анализ данных (Data analysis)
Эти источники помогут освежить знания по DS, особенно полезно будет полистать перед собеседованием
Изучение основ Python
Основы SQL
Библиотеки Python
Алгоритмы и структуры данных
Математика для анализа данных
Курс ведёт Анатолий Карпов — ex-тимлид команды аналитики в отделе бизнеса и рекламы VK. Он крутой специалист, рекомендую его вебинары на YouTube
Продуктовая аналитика
Этого должно быть вполне достаточно, чтобы начать проходить собеседования по чистой продуктовой аналитике.
Используйте все эти ресурсы по максимуму
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Анализ данных (Data analysis)
Книга состоит из 3 глав.
Первая глава знакомит читателей с API ChatGPT. Предоставлена дорожная карта для понимания ключевых стратегий, включая модерацию, Machine Reasoning и Prompt Chaining.
Вторая глава посвящена практике использования LangChain. Описан процесс разработки, от настройки среды до внедрения передовых методик извлечения информации (Document Loaders, Text Splitters, Semantic Search, RAG Systems).
Третья глава представляет собой руководство по интеграции LLM в рабочие процессы.
Описываются ключевые этапы от выбора модели до ее развертывания и мониторинга.
Стоит учитывать, что книга не может охватить много аспектов, по-большей части всё вокруг прикручивания готового чат-бота для своих целей
Но при всё при этом можно найти для себя много всего полезного
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Запрети мне псевдолейблить
Кстати о репостах:
Собрал из ретроспективы по Open Problems пост на хабр. Поддержите заливом лайков, пожалуйста🔝
Собрал из ретроспективы по Open Problems пост на хабр. Поддержите заливом лайков, пожалуйста
Please open Telegram to view this post
VIEW IN TELEGRAM
Хабр
Как машинлернеры мерили экспрессию генов от воздействия лекарств
Привет! Меня зовут Дима и я веду канал про соревновательный МЛ . Недавно мы выиграли приз в довольно престижном соревновании и я сделал обзор всех лучших решений Хочу вам рассказать о Open Problems,...
Forwarded from Андрей Марченко Dev заметки
Привет всем! Опубликовал новую статью в своем блоге о NewSQL. Последние три месяца я много изучал то, как работают базы данных внутри: прочел несколько книг, прошел несколько курсов (кстати, у MIT прям отличный курс на эту тему), а также изучил ряд papers. В итоге, на основании всего изученного, получилась эта статья.
Меня давно интересовал вопрос, как устроены новые типы баз данных NewSQL. Если с работой PostgreSQL и в общих чертах с Cassandra было понятно, то оставались вопросы относительно таких систем, как Google Spanner или FaunaDB, предлагающих высокую консистентность и масштабируемость. Как они могут решить все сложности и почему они еще не стали универсальным решением и не сместили предыдущие поколения?
В статье вы найдете разбор SQL и NoSQL баз данных, подробный разбор NewSQL на примере FaunaDB, а также обзор Consensus протоколов, таких как Raft и Multi-Paxos, лежащих в основе множества распределенных систем. Также рассмотрены Two-phase commits и Calvin для распределенных транзакций.
Полный текст статьи доступен в моем блоге: https://amarchenko.dev/blog/2024-03-13-new-sql/
Меня давно интересовал вопрос, как устроены новые типы баз данных NewSQL. Если с работой PostgreSQL и в общих чертах с Cassandra было понятно, то оставались вопросы относительно таких систем, как Google Spanner или FaunaDB, предлагающих высокую консистентность и масштабируемость. Как они могут решить все сложности и почему они еще не стали универсальным решением и не сместили предыдущие поколения?
В статье вы найдете разбор SQL и NoSQL баз данных, подробный разбор NewSQL на примере FaunaDB, а также обзор Consensus протоколов, таких как Raft и Multi-Paxos, лежащих в основе множества распределенных систем. Также рассмотрены Two-phase commits и Calvin для распределенных транзакций.
Полный текст статьи доступен в моем блоге: https://amarchenko.dev/blog/2024-03-13-new-sql/
amarchenko.dev
NewSQL in Depth Understanding Its Consistency and Scalability Features - Andrei Marchenko
NewSQL databases are not widely discussed in the database world
Forwarded from Андрей Марченко заметки Chat
https://pdos.csail.mit.edu/6.824/schedule.html и http://nil.csail.mit.edu/6.5840/2023/schedule.html этот курс по Destributed системам
Forwarded from Pavel Ivanov
Forwarded from grokaem себя (Milana)
POLARS
docs
часто, очень часто я работаю с csv файлами и даже с excel (это отдельная песня, которая точно прокачала мое терпение)
Так вот, про polars я слышала довольно давно, но как-то он был ни к месту, но вот пришел момент, когда файлов дохера, все они обрабатываются, операции относительно тяжелые.
Что предлагает polars?
Polars написан на Rust, его главные фичи, которые мне нравятся:
- Out of Core - если сделать streaming=True, то мы можем не подгружать все данные в ram
- Parallel - параллелит процесс на cpu cores сам, без помощи и обходов
- Vectorized Query Engine - использует свой написанный Apache Arrow, a columnar data format, чтобы использовать vectorized manner and SIMD - собственно самый главный плюс и почему это быстрее
Примечательный посты на эту тему:
- длинный пост про apache arrows, апдейт с pandas 2.0 и подробные примеры
- пост о разнице pandas и polars, например поддержка не только eager - как написал, так и исполняются, но и lazy operations, это когда написанные операции могут меняться в порядке или даже дропаться
- пост о vectorization в pandas или почему не надо делать for, но тут почти говорится, что apply - это векторизация, что спорно
- пост о разном понимании векторизации
- qa в apache arrows о том, почему он вообще нужен и как он экономит под 80% компьюта
в постах затрагивают понятия, берем карандашики:
- interoperability - отсутствие deserialize степа при processing или грубо говоря общий формат между языками и тд, как csv
- SISD и SIMD - SISD (for loop), SIMD (one instruction for all samples)
- Apache Arrows - language agnostic формат данных
Что я не сразу врубила в polars и хотела бы сохранить и потом искать поиском в канале?
0️⃣ просто сделать apply на одну колонку со своей функцией
1️⃣ сделать apply based on двух колонках
docs
часто, очень часто я работаю с csv файлами и даже с excel (это отдельная песня, которая точно прокачала мое терпение)
Так вот, про polars я слышала довольно давно, но как-то он был ни к месту, но вот пришел момент, когда файлов дохера, все они обрабатываются, операции относительно тяжелые.
Что предлагает polars?
Polars написан на Rust, его главные фичи, которые мне нравятся:
- Out of Core - если сделать streaming=True, то мы можем не подгружать все данные в ram
- Parallel - параллелит процесс на cpu cores сам, без помощи и обходов
- Vectorized Query Engine - использует свой написанный Apache Arrow, a columnar data format, чтобы использовать vectorized manner and SIMD - собственно самый главный плюс и почему это быстрее
Примечательный посты на эту тему:
- длинный пост про apache arrows, апдейт с pandas 2.0 и подробные примеры
- пост о разнице pandas и polars, например поддержка не только eager - как написал, так и исполняются, но и lazy operations, это когда написанные операции могут меняться в порядке или даже дропаться
- пост о vectorization в pandas или почему не надо делать for, но тут почти говорится, что apply - это векторизация, что спорно
- пост о разном понимании векторизации
- qa в apache arrows о том, почему он вообще нужен и как он экономит под 80% компьюта
в постах затрагивают понятия, берем карандашики:
- interoperability - отсутствие deserialize степа при processing или грубо говоря общий формат между языками и тд, как csv
- SISD и SIMD - SISD (for loop), SIMD (one instruction for all samples)
- Apache Arrows - language agnostic формат данных
Что я не сразу врубила в polars и хотела бы сохранить и потом искать поиском в канале?
0️⃣ просто сделать apply на одну колонку со своей функцией
data = data.with_columns(pl.col("col_name").map_elements(your_func).alias("col_new_name"))1️⃣ сделать apply based on двух колонках
data = data.with_columns(pl.struct(["col_name_1", "col_name_2"]).map_elements(lambda x: func(x["col_name_1"], x["col_name_2"])).alias("col_name_new"))Forwarded from ML Advertising
Production Level Deep Learning
Руководство по созданию продового пайплайна DL.
Что можно здесь найти?
- Описание жизненного цикла ML проекта
- Постановка целей и Mental Model
- Разметка данных и хранение: версионирование данных, предобработка фичей
- Обучение и валидация: фреймворки, тюнинг гиперпараметров, distributed training
- Тестирование: CI/CD, мониторинг
#mlops
Руководство по созданию продового пайплайна DL.
Что можно здесь найти?
- Описание жизненного цикла ML проекта
- Постановка целей и Mental Model
- Разметка данных и хранение: версионирование данных, предобработка фичей
- Обучение и валидация: фреймворки, тюнинг гиперпараметров, distributed training
- Тестирование: CI/CD, мониторинг
#mlops