Интересное что-то
623 subscribers
2.8K photos
255 videos
143 files
4.66K links
Материалы и мысли, понадерганные отовсюду
Блог: https://t.me/asisakov_channel
Чат: https://t.me/youknowds_chat
Download Telegram
Привет всем! Опубликовал новую статью в своем блоге о NewSQL. Последние три месяца я много изучал то, как работают базы данных внутри: прочел несколько книг, прошел несколько курсов (кстати, у MIT прям отличный курс на эту тему), а также изучил ряд papers. В итоге, на основании всего изученного, получилась эта статья.

Меня давно интересовал вопрос, как устроены новые типы баз данных NewSQL. Если с работой PostgreSQL и в общих чертах с Cassandra было понятно, то оставались вопросы относительно таких систем, как Google Spanner или FaunaDB, предлагающих высокую консистентность и масштабируемость. Как они могут решить все сложности и почему они еще не стали универсальным решением и не сместили предыдущие поколения?

В статье вы найдете разбор SQL и NoSQL баз данных, подробный разбор NewSQL на примере FaunaDB, а также обзор Consensus протоколов, таких как Raft и Multi-Paxos, лежащих в основе множества распределенных систем. Также рассмотрены Two-phase commits и Calvin для распределенных транзакций.

Полный текст статьи доступен в моем блоге: https://amarchenko.dev/blog/2024-03-13-new-sql/
Forwarded from Андрей Марченко заметки Chat
Forwarded from grokaem себя (Milana)
POLARS

docs

часто, очень часто я работаю с csv файлами и даже с excel (это отдельная песня, которая точно прокачала мое терпение)

Так вот, про polars я слышала довольно давно, но как-то он был ни к месту, но вот пришел момент, когда файлов дохера, все они обрабатываются, операции относительно тяжелые.

Что предлагает polars?
Polars написан на Rust, его главные фичи, которые мне нравятся:
- Out of Core - если сделать streaming=True, то мы можем не подгружать все данные в ram
- Parallel - параллелит процесс на cpu cores сам, без помощи и обходов
- Vectorized Query Engine - использует свой написанный Apache Arrow, a columnar data format, чтобы использовать vectorized manner and SIMD - собственно самый главный плюс и почему это быстрее

Примечательный посты на эту тему:
- длинный пост про apache arrows, апдейт с pandas 2.0 и подробные примеры
- пост о разнице pandas и polars, например поддержка не только eager - как написал, так и исполняются, но и lazy operations, это когда написанные операции могут меняться в порядке или даже дропаться
- пост о vectorization в pandas или почему не надо делать for, но тут почти говорится, что apply - это векторизация, что спорно
- пост о разном понимании векторизации
- qa в apache arrows о том, почему он вообще нужен и как он экономит под 80% компьюта

в постах затрагивают понятия, берем карандашики:
- interoperability - отсутствие deserialize степа при processing или грубо говоря общий формат между языками и тд, как csv
- SISD и SIMD - SISD (for loop), SIMD (one instruction for all samples)
- Apache Arrows - language agnostic формат данных

Что я не сразу врубила в polars и хотела бы сохранить и потом искать поиском в канале?
0️⃣ просто сделать apply на одну колонку со своей функцией

data = data.with_columns(pl.col("col_name").map_elements(your_func).alias("col_new_name"))



1️⃣ сделать apply based on двух колонках

data = data.with_columns(pl.struct(["col_name_1", "col_name_2"]).map_elements(lambda x: func(x["col_name_1"], x["col_name_2"])).alias("col_name_new"))
#mlops
Можно даже наверно сказать dlops😂
Forwarded from ML Advertising
Production Level Deep Learning

Руководство по созданию продового пайплайна DL.

Что можно здесь найти?
- Описание жизненного цикла ML проекта
- Постановка целей и Mental Model
- Разметка данных и хранение: версионирование данных, предобработка фичей
- Обучение и валидация: фреймворки, тюнинг гиперпараметров, distributed training
- Тестирование: CI/CD, мониторинг

#mlops
Forwarded from ML Advertising
Weekly newsletter по ML

Если вы интересуетесь ML и LLM, команда DAIR.AI ведет репозиторий, где каждую неделю делает резюме топ 10 статей по актуальным SOTA ML моделям. Здесь вы сможете найти статьи по Stable Diffusion 3, Sora, Gemini 1.5, методам RAG, Depth Anything etc.

Сохраняем к себе, чтобы оставаться в курсе! 🔥
Отличная аннотация и визуальная методичка по Mamba. Довольно наглядная, мне понравилось.
Если нужна аннотация на русском и имплементация с нуля, то у меня есть тетрадки

@toshoseti
#rl
Моделирование реальной физики среды для агента
Forwarded from Pavel
https://mujoco.org/ - выбор мужика!
Forwarded from Dim
Ну мне на юньке ml-agents норм зашло... Там ассет, который предоставляет набор сеноров, к которым потом из питона доступ есть. У меня заранее собранные под линь сцены потом в колабе завелись.
Forwarded from Anton Sorokoumov
По теме чата, пока не забыл.

Только-только оттарабанил 5 часов онсайта амазона (разделенного на 2 дня), на продакта. Из интересного:
- рекрутер явно сказала, какие LP важнее для позиции
- на скрине было 4 вопроса, интервьюер сказал какие LP будет спрашивать (оба были из списка рекрутера)
- на онсайтах было от 2 до 4 вопросов (распределение по интервьюерам было 4-3-4-3-2)
- вопросы иногда повторялись (во всяком случае мне так казалось)
- мне было очень трудно понять, на какие именно LP вопрос, хотя практиковался в этом. В итоге старался выбирать просто истории, которые больше всего раскрывали ответ на вопрос.
- говорят, что интервьюерам назначают по 2 LP, которые они должны спрашивать, но я даже постфактум не смог смаппить интервьюера с двумя LP. Каждый раз у меня выходило, что вопросы один человек задавал из 3 LP.
- использовал 15 историй. Повторялся только один раз, явно сказал об этом интервьюеру
- готово было 19 историй + 4 заготовки (у меня между двумя днями онсайта были выходные, поэтому я расчитывал дописать истории, если вдруг понадобится)
Forwarded from Anton Sorokoumov
А, еще, кажется, самое важное.
- У меня была распечатана экселька с маппингом историй и LP.
- И был блокнот, где страница = история (просто от руки тезисы писал + слова, которые мог сразу не вспомнить).

Это ооооочень помогло при поиске историй и рассказах. Я интервьюерам говорил, что буду подглядывать, чтобы не забыть цифры - все были ок с этим. 20 историй я бы никогда не запомнил (особенно с учетом такого стресса)