Forwarded from Андрей Марченко заметки Chat
https://pdos.csail.mit.edu/6.824/schedule.html и http://nil.csail.mit.edu/6.5840/2023/schedule.html этот курс по Destributed системам
Forwarded from Pavel Ivanov
Forwarded from grokaem себя (Milana)
POLARS
docs
часто, очень часто я работаю с csv файлами и даже с excel (это отдельная песня, которая точно прокачала мое терпение)
Так вот, про polars я слышала довольно давно, но как-то он был ни к месту, но вот пришел момент, когда файлов дохера, все они обрабатываются, операции относительно тяжелые.
Что предлагает polars?
Polars написан на Rust, его главные фичи, которые мне нравятся:
- Out of Core - если сделать streaming=True, то мы можем не подгружать все данные в ram
- Parallel - параллелит процесс на cpu cores сам, без помощи и обходов
- Vectorized Query Engine - использует свой написанный Apache Arrow, a columnar data format, чтобы использовать vectorized manner and SIMD - собственно самый главный плюс и почему это быстрее
Примечательный посты на эту тему:
- длинный пост про apache arrows, апдейт с pandas 2.0 и подробные примеры
- пост о разнице pandas и polars, например поддержка не только eager - как написал, так и исполняются, но и lazy operations, это когда написанные операции могут меняться в порядке или даже дропаться
- пост о vectorization в pandas или почему не надо делать for, но тут почти говорится, что apply - это векторизация, что спорно
- пост о разном понимании векторизации
- qa в apache arrows о том, почему он вообще нужен и как он экономит под 80% компьюта
в постах затрагивают понятия, берем карандашики:
- interoperability - отсутствие deserialize степа при processing или грубо говоря общий формат между языками и тд, как csv
- SISD и SIMD - SISD (for loop), SIMD (one instruction for all samples)
- Apache Arrows - language agnostic формат данных
Что я не сразу врубила в polars и хотела бы сохранить и потом искать поиском в канале?
0️⃣ просто сделать apply на одну колонку со своей функцией
1️⃣ сделать apply based on двух колонках
docs
часто, очень часто я работаю с csv файлами и даже с excel (это отдельная песня, которая точно прокачала мое терпение)
Так вот, про polars я слышала довольно давно, но как-то он был ни к месту, но вот пришел момент, когда файлов дохера, все они обрабатываются, операции относительно тяжелые.
Что предлагает polars?
Polars написан на Rust, его главные фичи, которые мне нравятся:
- Out of Core - если сделать streaming=True, то мы можем не подгружать все данные в ram
- Parallel - параллелит процесс на cpu cores сам, без помощи и обходов
- Vectorized Query Engine - использует свой написанный Apache Arrow, a columnar data format, чтобы использовать vectorized manner and SIMD - собственно самый главный плюс и почему это быстрее
Примечательный посты на эту тему:
- длинный пост про apache arrows, апдейт с pandas 2.0 и подробные примеры
- пост о разнице pandas и polars, например поддержка не только eager - как написал, так и исполняются, но и lazy operations, это когда написанные операции могут меняться в порядке или даже дропаться
- пост о vectorization в pandas или почему не надо делать for, но тут почти говорится, что apply - это векторизация, что спорно
- пост о разном понимании векторизации
- qa в apache arrows о том, почему он вообще нужен и как он экономит под 80% компьюта
в постах затрагивают понятия, берем карандашики:
- interoperability - отсутствие deserialize степа при processing или грубо говоря общий формат между языками и тд, как csv
- SISD и SIMD - SISD (for loop), SIMD (one instruction for all samples)
- Apache Arrows - language agnostic формат данных
Что я не сразу врубила в polars и хотела бы сохранить и потом искать поиском в канале?
0️⃣ просто сделать apply на одну колонку со своей функцией
data = data.with_columns(pl.col("col_name").map_elements(your_func).alias("col_new_name"))1️⃣ сделать apply based on двух колонках
data = data.with_columns(pl.struct(["col_name_1", "col_name_2"]).map_elements(lambda x: func(x["col_name_1"], x["col_name_2"])).alias("col_name_new"))Forwarded from ML Advertising
Production Level Deep Learning
Руководство по созданию продового пайплайна DL.
Что можно здесь найти?
- Описание жизненного цикла ML проекта
- Постановка целей и Mental Model
- Разметка данных и хранение: версионирование данных, предобработка фичей
- Обучение и валидация: фреймворки, тюнинг гиперпараметров, distributed training
- Тестирование: CI/CD, мониторинг
#mlops
Руководство по созданию продового пайплайна DL.
Что можно здесь найти?
- Описание жизненного цикла ML проекта
- Постановка целей и Mental Model
- Разметка данных и хранение: версионирование данных, предобработка фичей
- Обучение и валидация: фреймворки, тюнинг гиперпараметров, distributed training
- Тестирование: CI/CD, мониторинг
#mlops
Forwarded from ML Advertising
Weekly newsletter по ML
Если вы интересуетесь ML и LLM, команда DAIR.AI ведет репозиторий, где каждую неделю делает резюме топ 10 статей по актуальным SOTA ML моделям. Здесь вы сможете найти статьи по Stable Diffusion 3, Sora, Gemini 1.5, методам RAG, Depth Anything etc.
Сохраняем к себе, чтобы оставаться в курсе! 🔥
Если вы интересуетесь ML и LLM, команда DAIR.AI ведет репозиторий, где каждую неделю делает резюме топ 10 статей по актуальным SOTA ML моделям. Здесь вы сможете найти статьи по Stable Diffusion 3, Sora, Gemini 1.5, методам RAG, Depth Anything etc.
Сохраняем к себе, чтобы оставаться в курсе! 🔥
GitHub
GitHub - dair-ai/AI-Papers-of-the-Week: 🔥Highlighting the top ML papers every week.
🔥Highlighting the top ML papers every week. Contribute to dair-ai/AI-Papers-of-the-Week development by creating an account on GitHub.
Forwarded from То шо нейросети
Отличная аннотация и визуальная методичка по Mamba. Довольно наглядная, мне понравилось.
Если нужна аннотация на русском и имплементация с нуля, то у меня есть тетрадки
@toshoseti
Если нужна аннотация на русском и имплементация с нуля, то у меня есть тетрадки
@toshoseti
Maartengrootendorst
A Visual Guide to Mamba and State Space Models
An Alternative to Transformers for Language Modeling
Forwarded from WHAT THE FUCK IS THE LLM?
бля я нагуглил сам https://github.com/petrikvladimir/pyphysx
но первое правило dsa - если есть не от нвидия, бери не от нвидия.
ТАК ЧТО ВЕЛКОМ
но первое правило dsa - если есть не от нвидия, бери не от нвидия.
ТАК ЧТО ВЕЛКОМ
GitHub
GitHub - petrikvladimir/pyphysx: Python Wrapper for Nvidia PhysX simulator.
Python Wrapper for Nvidia PhysX simulator. Contribute to petrikvladimir/pyphysx development by creating an account on GitHub.
Forwarded from Дратути Антон
типа такого https://github.com/panda3d/panda3d ?
GitHub
GitHub - panda3d/panda3d: Powerful, mature open-source cross-platform game engine for Python and C++, developed by Disney and CMU
Powerful, mature open-source cross-platform game engine for Python and C++, developed by Disney and CMU - panda3d/panda3d
Forwarded from Dim
Ну мне на юньке ml-agents норм зашло... Там ассет, который предоставляет набор сеноров, к которым потом из питона доступ есть. У меня заранее собранные под линь сцены потом в колабе завелись.
Google
umla.ipynb
Run, share, and edit Python notebooks
Forwarded from Anton Sorokoumov
По теме чата, пока не забыл.
Только-только оттарабанил 5 часов онсайта амазона (разделенного на 2 дня), на продакта. Из интересного:
- рекрутер явно сказала, какие LP важнее для позиции
- на скрине было 4 вопроса, интервьюер сказал какие LP будет спрашивать (оба были из списка рекрутера)
- на онсайтах было от 2 до 4 вопросов (распределение по интервьюерам было 4-3-4-3-2)
- вопросы иногда повторялись (во всяком случае мне так казалось)
- мне было очень трудно понять, на какие именно LP вопрос, хотя практиковался в этом. В итоге старался выбирать просто истории, которые больше всего раскрывали ответ на вопрос.
- говорят, что интервьюерам назначают по 2 LP, которые они должны спрашивать, но я даже постфактум не смог смаппить интервьюера с двумя LP. Каждый раз у меня выходило, что вопросы один человек задавал из 3 LP.
- использовал 15 историй. Повторялся только один раз, явно сказал об этом интервьюеру
- готово было 19 историй + 4 заготовки (у меня между двумя днями онсайта были выходные, поэтому я расчитывал дописать истории, если вдруг понадобится)
Только-только оттарабанил 5 часов онсайта амазона (разделенного на 2 дня), на продакта. Из интересного:
- рекрутер явно сказала, какие LP важнее для позиции
- на скрине было 4 вопроса, интервьюер сказал какие LP будет спрашивать (оба были из списка рекрутера)
- на онсайтах было от 2 до 4 вопросов (распределение по интервьюерам было 4-3-4-3-2)
- вопросы иногда повторялись (во всяком случае мне так казалось)
- мне было очень трудно понять, на какие именно LP вопрос, хотя практиковался в этом. В итоге старался выбирать просто истории, которые больше всего раскрывали ответ на вопрос.
- говорят, что интервьюерам назначают по 2 LP, которые они должны спрашивать, но я даже постфактум не смог смаппить интервьюера с двумя LP. Каждый раз у меня выходило, что вопросы один человек задавал из 3 LP.
- использовал 15 историй. Повторялся только один раз, явно сказал об этом интервьюеру
- готово было 19 историй + 4 заготовки (у меня между двумя днями онсайта были выходные, поэтому я расчитывал дописать истории, если вдруг понадобится)
Forwarded from Anton Sorokoumov
А, еще, кажется, самое важное.
- У меня была распечатана экселька с маппингом историй и LP.
- И был блокнот, где страница = история (просто от руки тезисы писал + слова, которые мог сразу не вспомнить).
Это ооооочень помогло при поиске историй и рассказах. Я интервьюерам говорил, что буду подглядывать, чтобы не забыть цифры - все были ок с этим. 20 историй я бы никогда не запомнил (особенно с учетом такого стресса)
- У меня была распечатана экселька с маппингом историй и LP.
- И был блокнот, где страница = история (просто от руки тезисы писал + слова, которые мог сразу не вспомнить).
Это ооооочень помогло при поиске историй и рассказах. Я интервьюерам говорил, что буду подглядывать, чтобы не забыть цифры - все были ок с этим. 20 историй я бы никогда не запомнил (особенно с учетом такого стресса)