Интересное что-то
623 subscribers
2.8K photos
255 videos
143 files
4.66K links
Материалы и мысли, понадерганные отовсюду
Блог: https://t.me/asisakov_channel
Чат: https://t.me/youknowds_chat
Download Telegram
⚡️Сверхполезная статья от профи Data Science

Здесь обсуждается и показывается, как производить конкатенацию, сегментацию данных, объединять данные — и ещё очень много насущных вещей DS
Годно)

⏩ Клик

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔺 Полезные ссылки для специалиста по Data Science

Эти источники помогут освежить знания по DS, особенно полезно будет полистать перед собеседованием

Изучение основ Python
⏩ Питонтьютор — понятный и удобный курс для освоения базы. Там много задач для практики, которые попадаются на собеседованиях.
⏩ Основы Python-разработки — ещё один бесплатный курс: за 20 часов вы изучите основы и напишете простой код.
⏩ Основы программирования и анализа данных на Python — короткий видеокурс. Особенно рекомендую лекции 7—10 про полезные библиотеки Pandas, NumPy, Matplotlib и Seaborn.

Основы SQL
⏩ Интерактивный тренажёр по SQL — курс с множеством практических заданий на создание SQL-запросов. Рекомендую начать с него.
⏩ Основы работы с базами данных и SQL — ещё один курс с интерактивным тренажёром.
⏩ Упражнения на SQL-EX — тренажёр написания запросов SELECT. Регулярно решайте задачи, чтобы уверенно чувствовать себя на собеседованиях.

Библиотеки Python
⏩ Python PANDAS, полный курс для начинающих — библиотека Pandas помогает удобно работать с табличными данными и похожа логикой на SQL. Основные операции стоит знать наизусть: чтение таблиц, редактирование, работа с пропусками, изменение типов данных. После изучения теории возьмите какой-нибудь датасет и вручную «покрутите» его в Jupyter Notebook
⏩ Основы NumPy — библиотека NumPy помогает быстро и удобно производить математические операции. Она используется во многих других библиотеках. Необязательно знать все операции наизусть, главное — уметь быстро в них сориентироваться при необходимости.
⏩ Matplotlib — библиотеки для визуализации данных. В Seaborn графики выглядят красивее, а Matplotlib гибко настраивается. Заучивать все функции и методы необязательно.
⏩ 50 оттенков Matplotlib — статья с примерами графиков, чтобы построить что-то подобное для своих данных.

Алгоритмы и структуры данных
⏩ Тренировки по алгоритмам — лекции с теорией, домашними заданиями и разборами. Сдавайте задания вовремя, чтобы получить сертификат. Лучших участников готовят к прохождению алгоритмических собеседований.
⏩ LeetCode — сайт с задачами для подготовки к собеседованиям. Решайте уровни Easy и Medium перед интервью.

Математика для анализа данных
⏩ Бесплатный курс «Основы математики для цифровых профессий» поможет закрыть пробелы в базовой математике, чтобы перейти к более сложным темам.
⏩ Теория вероятностей поможет проанализировать данные и отличить случайности от закономерностей. Смотрите лекции от МФТИ и других крутых универов по теорверу на YouTube.
⏩ Основы математической статистики — курс связан с теорвером, и с его помощью можно научиться делать достаточно точные выводы о данных по их выборке.
Курс ведёт Анатолий Карпов — ex-тимлид команды аналитики в отделе бизнеса и рекламы VK. Он крутой специалист, рекомендую его вебинары на YouTube

Продуктовая аналитика
⏩ Публичное собеседование по продуктовой аналитике
⏩ ML для оптимизации цен на основе эластичности по цене
⏩ Как мы не сделали рекомендательную систему в банке
Этого должно быть вполне достаточно, чтобы начать проходить собеседования по чистой продуктовой аналитике.

Используйте все эти ресурсы по максимуму 🔥

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🌟 Открытая книга для специалистов в области AI и ML

Книга состоит из 3 глав.

⏩Глава 1: Освоение OpenAI API
Первая глава знакомит читателей с API ChatGPT. Предоставлена дорожная карта для понимания ключевых стратегий, включая модерацию, Machine Reasoning и Prompt Chaining.

⏩Глава 2: LangChain
Вторая глава посвящена практике использования LangChain. Описан процесс разработки, от настройки среды до внедрения передовых методик извлечения информации (Document Loaders, Text Splitters, Semantic Search, RAG Systems).

⏩Глава 3: ML Ops для LLMs, или LLMOps
Третья глава представляет собой руководство по интеграции LLM в рабочие процессы.
Описываются ключевые этапы от выбора модели до ее развертывания и мониторинга.

Стоит учитывать, что книга не может охватить много аспектов, по-большей части всё вокруг прикручивания готового чат-бота для своих целей
Но при всё при этом можно найти для себя много всего полезного

📎 Книга

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Привет всем! Опубликовал новую статью в своем блоге о NewSQL. Последние три месяца я много изучал то, как работают базы данных внутри: прочел несколько книг, прошел несколько курсов (кстати, у MIT прям отличный курс на эту тему), а также изучил ряд papers. В итоге, на основании всего изученного, получилась эта статья.

Меня давно интересовал вопрос, как устроены новые типы баз данных NewSQL. Если с работой PostgreSQL и в общих чертах с Cassandra было понятно, то оставались вопросы относительно таких систем, как Google Spanner или FaunaDB, предлагающих высокую консистентность и масштабируемость. Как они могут решить все сложности и почему они еще не стали универсальным решением и не сместили предыдущие поколения?

В статье вы найдете разбор SQL и NoSQL баз данных, подробный разбор NewSQL на примере FaunaDB, а также обзор Consensus протоколов, таких как Raft и Multi-Paxos, лежащих в основе множества распределенных систем. Также рассмотрены Two-phase commits и Calvin для распределенных транзакций.

Полный текст статьи доступен в моем блоге: https://amarchenko.dev/blog/2024-03-13-new-sql/
Forwarded from Андрей Марченко заметки Chat
Forwarded from grokaem себя (Milana)
POLARS

docs

часто, очень часто я работаю с csv файлами и даже с excel (это отдельная песня, которая точно прокачала мое терпение)

Так вот, про polars я слышала довольно давно, но как-то он был ни к месту, но вот пришел момент, когда файлов дохера, все они обрабатываются, операции относительно тяжелые.

Что предлагает polars?
Polars написан на Rust, его главные фичи, которые мне нравятся:
- Out of Core - если сделать streaming=True, то мы можем не подгружать все данные в ram
- Parallel - параллелит процесс на cpu cores сам, без помощи и обходов
- Vectorized Query Engine - использует свой написанный Apache Arrow, a columnar data format, чтобы использовать vectorized manner and SIMD - собственно самый главный плюс и почему это быстрее

Примечательный посты на эту тему:
- длинный пост про apache arrows, апдейт с pandas 2.0 и подробные примеры
- пост о разнице pandas и polars, например поддержка не только eager - как написал, так и исполняются, но и lazy operations, это когда написанные операции могут меняться в порядке или даже дропаться
- пост о vectorization в pandas или почему не надо делать for, но тут почти говорится, что apply - это векторизация, что спорно
- пост о разном понимании векторизации
- qa в apache arrows о том, почему он вообще нужен и как он экономит под 80% компьюта

в постах затрагивают понятия, берем карандашики:
- interoperability - отсутствие deserialize степа при processing или грубо говоря общий формат между языками и тд, как csv
- SISD и SIMD - SISD (for loop), SIMD (one instruction for all samples)
- Apache Arrows - language agnostic формат данных

Что я не сразу врубила в polars и хотела бы сохранить и потом искать поиском в канале?
0️⃣ просто сделать apply на одну колонку со своей функцией

data = data.with_columns(pl.col("col_name").map_elements(your_func).alias("col_new_name"))



1️⃣ сделать apply based on двух колонках

data = data.with_columns(pl.struct(["col_name_1", "col_name_2"]).map_elements(lambda x: func(x["col_name_1"], x["col_name_2"])).alias("col_name_new"))
#mlops
Можно даже наверно сказать dlops😂
Forwarded from ML Advertising
Production Level Deep Learning

Руководство по созданию продового пайплайна DL.

Что можно здесь найти?
- Описание жизненного цикла ML проекта
- Постановка целей и Mental Model
- Разметка данных и хранение: версионирование данных, предобработка фичей
- Обучение и валидация: фреймворки, тюнинг гиперпараметров, distributed training
- Тестирование: CI/CD, мониторинг

#mlops
Forwarded from ML Advertising
Weekly newsletter по ML

Если вы интересуетесь ML и LLM, команда DAIR.AI ведет репозиторий, где каждую неделю делает резюме топ 10 статей по актуальным SOTA ML моделям. Здесь вы сможете найти статьи по Stable Diffusion 3, Sora, Gemini 1.5, методам RAG, Depth Anything etc.

Сохраняем к себе, чтобы оставаться в курсе! 🔥