Forwarded from Pavel Ivanov
Forwarded from grokaem себя (Milana)
POLARS
docs
часто, очень часто я работаю с csv файлами и даже с excel (это отдельная песня, которая точно прокачала мое терпение)
Так вот, про polars я слышала довольно давно, но как-то он был ни к месту, но вот пришел момент, когда файлов дохера, все они обрабатываются, операции относительно тяжелые.
Что предлагает polars?
Polars написан на Rust, его главные фичи, которые мне нравятся:
- Out of Core - если сделать streaming=True, то мы можем не подгружать все данные в ram
- Parallel - параллелит процесс на cpu cores сам, без помощи и обходов
- Vectorized Query Engine - использует свой написанный Apache Arrow, a columnar data format, чтобы использовать vectorized manner and SIMD - собственно самый главный плюс и почему это быстрее
Примечательный посты на эту тему:
- длинный пост про apache arrows, апдейт с pandas 2.0 и подробные примеры
- пост о разнице pandas и polars, например поддержка не только eager - как написал, так и исполняются, но и lazy operations, это когда написанные операции могут меняться в порядке или даже дропаться
- пост о vectorization в pandas или почему не надо делать for, но тут почти говорится, что apply - это векторизация, что спорно
- пост о разном понимании векторизации
- qa в apache arrows о том, почему он вообще нужен и как он экономит под 80% компьюта
в постах затрагивают понятия, берем карандашики:
- interoperability - отсутствие deserialize степа при processing или грубо говоря общий формат между языками и тд, как csv
- SISD и SIMD - SISD (for loop), SIMD (one instruction for all samples)
- Apache Arrows - language agnostic формат данных
Что я не сразу врубила в polars и хотела бы сохранить и потом искать поиском в канале?
0️⃣ просто сделать apply на одну колонку со своей функцией
1️⃣ сделать apply based on двух колонках
docs
часто, очень часто я работаю с csv файлами и даже с excel (это отдельная песня, которая точно прокачала мое терпение)
Так вот, про polars я слышала довольно давно, но как-то он был ни к месту, но вот пришел момент, когда файлов дохера, все они обрабатываются, операции относительно тяжелые.
Что предлагает polars?
Polars написан на Rust, его главные фичи, которые мне нравятся:
- Out of Core - если сделать streaming=True, то мы можем не подгружать все данные в ram
- Parallel - параллелит процесс на cpu cores сам, без помощи и обходов
- Vectorized Query Engine - использует свой написанный Apache Arrow, a columnar data format, чтобы использовать vectorized manner and SIMD - собственно самый главный плюс и почему это быстрее
Примечательный посты на эту тему:
- длинный пост про apache arrows, апдейт с pandas 2.0 и подробные примеры
- пост о разнице pandas и polars, например поддержка не только eager - как написал, так и исполняются, но и lazy operations, это когда написанные операции могут меняться в порядке или даже дропаться
- пост о vectorization в pandas или почему не надо делать for, но тут почти говорится, что apply - это векторизация, что спорно
- пост о разном понимании векторизации
- qa в apache arrows о том, почему он вообще нужен и как он экономит под 80% компьюта
в постах затрагивают понятия, берем карандашики:
- interoperability - отсутствие deserialize степа при processing или грубо говоря общий формат между языками и тд, как csv
- SISD и SIMD - SISD (for loop), SIMD (one instruction for all samples)
- Apache Arrows - language agnostic формат данных
Что я не сразу врубила в polars и хотела бы сохранить и потом искать поиском в канале?
0️⃣ просто сделать apply на одну колонку со своей функцией
data = data.with_columns(pl.col("col_name").map_elements(your_func).alias("col_new_name"))1️⃣ сделать apply based on двух колонках
data = data.with_columns(pl.struct(["col_name_1", "col_name_2"]).map_elements(lambda x: func(x["col_name_1"], x["col_name_2"])).alias("col_name_new"))Forwarded from ML Advertising
Production Level Deep Learning
Руководство по созданию продового пайплайна DL.
Что можно здесь найти?
- Описание жизненного цикла ML проекта
- Постановка целей и Mental Model
- Разметка данных и хранение: версионирование данных, предобработка фичей
- Обучение и валидация: фреймворки, тюнинг гиперпараметров, distributed training
- Тестирование: CI/CD, мониторинг
#mlops
Руководство по созданию продового пайплайна DL.
Что можно здесь найти?
- Описание жизненного цикла ML проекта
- Постановка целей и Mental Model
- Разметка данных и хранение: версионирование данных, предобработка фичей
- Обучение и валидация: фреймворки, тюнинг гиперпараметров, distributed training
- Тестирование: CI/CD, мониторинг
#mlops
Forwarded from ML Advertising
Weekly newsletter по ML
Если вы интересуетесь ML и LLM, команда DAIR.AI ведет репозиторий, где каждую неделю делает резюме топ 10 статей по актуальным SOTA ML моделям. Здесь вы сможете найти статьи по Stable Diffusion 3, Sora, Gemini 1.5, методам RAG, Depth Anything etc.
Сохраняем к себе, чтобы оставаться в курсе! 🔥
Если вы интересуетесь ML и LLM, команда DAIR.AI ведет репозиторий, где каждую неделю делает резюме топ 10 статей по актуальным SOTA ML моделям. Здесь вы сможете найти статьи по Stable Diffusion 3, Sora, Gemini 1.5, методам RAG, Depth Anything etc.
Сохраняем к себе, чтобы оставаться в курсе! 🔥
GitHub
GitHub - dair-ai/AI-Papers-of-the-Week: 🔥Highlighting the top ML papers every week.
🔥Highlighting the top ML papers every week. Contribute to dair-ai/AI-Papers-of-the-Week development by creating an account on GitHub.
Forwarded from То шо нейросети
Отличная аннотация и визуальная методичка по Mamba. Довольно наглядная, мне понравилось.
Если нужна аннотация на русском и имплементация с нуля, то у меня есть тетрадки
@toshoseti
Если нужна аннотация на русском и имплементация с нуля, то у меня есть тетрадки
@toshoseti
Maartengrootendorst
A Visual Guide to Mamba and State Space Models
An Alternative to Transformers for Language Modeling
Forwarded from WHAT THE FUCK IS THE LLM?
бля я нагуглил сам https://github.com/petrikvladimir/pyphysx
но первое правило dsa - если есть не от нвидия, бери не от нвидия.
ТАК ЧТО ВЕЛКОМ
но первое правило dsa - если есть не от нвидия, бери не от нвидия.
ТАК ЧТО ВЕЛКОМ
GitHub
GitHub - petrikvladimir/pyphysx: Python Wrapper for Nvidia PhysX simulator.
Python Wrapper for Nvidia PhysX simulator. Contribute to petrikvladimir/pyphysx development by creating an account on GitHub.
Forwarded from Дратути Антон
типа такого https://github.com/panda3d/panda3d ?
GitHub
GitHub - panda3d/panda3d: Powerful, mature open-source cross-platform game engine for Python and C++, developed by Disney and CMU
Powerful, mature open-source cross-platform game engine for Python and C++, developed by Disney and CMU - panda3d/panda3d
Forwarded from Dim
Ну мне на юньке ml-agents норм зашло... Там ассет, который предоставляет набор сеноров, к которым потом из питона доступ есть. У меня заранее собранные под линь сцены потом в колабе завелись.
Google
umla.ipynb
Run, share, and edit Python notebooks
Forwarded from Anton Sorokoumov
По теме чата, пока не забыл.
Только-только оттарабанил 5 часов онсайта амазона (разделенного на 2 дня), на продакта. Из интересного:
- рекрутер явно сказала, какие LP важнее для позиции
- на скрине было 4 вопроса, интервьюер сказал какие LP будет спрашивать (оба были из списка рекрутера)
- на онсайтах было от 2 до 4 вопросов (распределение по интервьюерам было 4-3-4-3-2)
- вопросы иногда повторялись (во всяком случае мне так казалось)
- мне было очень трудно понять, на какие именно LP вопрос, хотя практиковался в этом. В итоге старался выбирать просто истории, которые больше всего раскрывали ответ на вопрос.
- говорят, что интервьюерам назначают по 2 LP, которые они должны спрашивать, но я даже постфактум не смог смаппить интервьюера с двумя LP. Каждый раз у меня выходило, что вопросы один человек задавал из 3 LP.
- использовал 15 историй. Повторялся только один раз, явно сказал об этом интервьюеру
- готово было 19 историй + 4 заготовки (у меня между двумя днями онсайта были выходные, поэтому я расчитывал дописать истории, если вдруг понадобится)
Только-только оттарабанил 5 часов онсайта амазона (разделенного на 2 дня), на продакта. Из интересного:
- рекрутер явно сказала, какие LP важнее для позиции
- на скрине было 4 вопроса, интервьюер сказал какие LP будет спрашивать (оба были из списка рекрутера)
- на онсайтах было от 2 до 4 вопросов (распределение по интервьюерам было 4-3-4-3-2)
- вопросы иногда повторялись (во всяком случае мне так казалось)
- мне было очень трудно понять, на какие именно LP вопрос, хотя практиковался в этом. В итоге старался выбирать просто истории, которые больше всего раскрывали ответ на вопрос.
- говорят, что интервьюерам назначают по 2 LP, которые они должны спрашивать, но я даже постфактум не смог смаппить интервьюера с двумя LP. Каждый раз у меня выходило, что вопросы один человек задавал из 3 LP.
- использовал 15 историй. Повторялся только один раз, явно сказал об этом интервьюеру
- готово было 19 историй + 4 заготовки (у меня между двумя днями онсайта были выходные, поэтому я расчитывал дописать истории, если вдруг понадобится)
Forwarded from Anton Sorokoumov
А, еще, кажется, самое важное.
- У меня была распечатана экселька с маппингом историй и LP.
- И был блокнот, где страница = история (просто от руки тезисы писал + слова, которые мог сразу не вспомнить).
Это ооооочень помогло при поиске историй и рассказах. Я интервьюерам говорил, что буду подглядывать, чтобы не забыть цифры - все были ок с этим. 20 историй я бы никогда не запомнил (особенно с учетом такого стресса)
- У меня была распечатана экселька с маппингом историй и LP.
- И был блокнот, где страница = история (просто от руки тезисы писал + слова, которые мог сразу не вспомнить).
Это ооооочень помогло при поиске историй и рассказах. Я интервьюерам говорил, что буду подглядывать, чтобы не забыть цифры - все были ок с этим. 20 историй я бы никогда не запомнил (особенно с учетом такого стресса)
Forwarded from BOGDANISSSIMO
Книги, которые читал в феврале:
1-2.
Первая про "что нужно максимизировать в жизни": условия организации своих мыслей и пространства вокруг, которые позволяют легко увлекаться работой (для многих людей работа – это "труд" и "каторга", для Меня работа это основной источник дофамина).
Вторая про "что нужно минимизировать в жизни": фреймворк для формирования информационной гигиены и персональной политики в отношении приложений, мессенджеров, каналов информации. Нравится совет идти не от "что убрать?", а от "что бы ты включил, если бы начал заново?".
3-5. Первые 2 книги трилогии "Память о прошлом Земли" (
Очень качественная научная фантастика, вполне себе на уровне Азимова. Местами, в некоторых сюжетных линиях и описаниях чую, как будто автор вдохновлён Ницше. Много интересных перспектив на нашу жизнь, на прошлое и будущее. Много challenging basic assumptions того, что мы привыкли считать нормой / статусом Кво / реальностью. При этом, повествование практически не скатывается в магию, во всём автор старается находиться в рамках того, что допустимо наукой. Рекомендую всем, включая не-технарей.
6.
Мощная книга по маркетингу с очень плотным содержанием информации на квадратный километр текста. Нравится насколько чётко автор определяет каждый новый термин, насколько "на пальцах" объясняет сложные феномены и инструменты. Чувствуется, что каждые глава и каждое предложение обдуманы по много раз, да и вообще Алекс шарит. Мне и Моему кофаундеру очень понравилась.
#Books
1-2.
"Поток", Михай Чиксентмихайи, и "Digital Minimalism", Cal Newport, Обе перечитывал. Первая про "что нужно максимизировать в жизни": условия организации своих мыслей и пространства вокруг, которые позволяют легко увлекаться работой (для многих людей работа – это "труд" и "каторга", для Меня работа это основной источник дофамина).
Вторая про "что нужно минимизировать в жизни": фреймворк для формирования информационной гигиены и персональной политики в отношении приложений, мессенджеров, каналов информации. Нравится совет идти не от "что убрать?", а от "что бы ты включил, если бы начал заново?".
3-5. Первые 2 книги трилогии "Память о прошлом Земли" (
"Задача трёх тел", "Тёмный лес") + сборник "Блуждающая Земля", Лю Цысинь. Очень качественная научная фантастика, вполне себе на уровне Азимова. Местами, в некоторых сюжетных линиях и описаниях чую, как будто автор вдохновлён Ницше. Много интересных перспектив на нашу жизнь, на прошлое и будущее. Много challenging basic assumptions того, что мы привыкли считать нормой / статусом Кво / реальностью. При этом, повествование практически не скатывается в магию, во всём автор старается находиться в рамках того, что допустимо наукой. Рекомендую всем, включая не-технарей.
6.
"$100M Leads" by Alex Hermozi.Мощная книга по маркетингу с очень плотным содержанием информации на квадратный километр текста. Нравится насколько чётко автор определяет каждый новый термин, насколько "на пальцах" объясняет сложные феномены и инструменты. Чувствуется, что каждые глава и каждое предложение обдуманы по много раз, да и вообще Алекс шарит. Мне и Моему кофаундеру очень понравилась.
#Books