Forwarded from Анализ данных (Data analysis)
📢 NVIDIA представила nvmath-python — библиотеку для Python, которая открывает доступ к возможностям фирменных математических библиотек (например, cuBLASLt) через удобный API.
Что умеет:
- работает с массивами из NumPy, CuPy, PyTorch и других экосистем;
- поддерживает тонкую настройку вычислений (precision, режимы умножений, epilog-операции);
- позволяет использовать расширенные оптимизации NVIDIA для ускоренной математики и ML-задач.
Проект пока в бета-версии, но уже можно попробовать:
https://github.com/NVIDIA/nvmath-python
Что умеет:
- работает с массивами из NumPy, CuPy, PyTorch и других экосистем;
- поддерживает тонкую настройку вычислений (precision, режимы умножений, epilog-операции);
- позволяет использовать расширенные оптимизации NVIDIA для ускоренной математики и ML-задач.
Проект пока в бета-версии, но уже можно попробовать:
https://github.com/NVIDIA/nvmath-python
👍1
Forwarded from Data Secrets | Карьера
Кажется, Google готовится объединить SQL, Python и Spark в рамках Colab Enterprise
По слухам, поисковый гигант намерен создать единую среду для специалистов по машинному обучению, объединив SQL, Python и Apache Spark в одном месте.
Ясмин Ахмад, управляющий директор Google Cloud по обработке данных, отметил, что главным препятствием для эффективности в ML является необходимость переключаться между средами: получать данные с помощью SQL в базах данных и хранилищах, затем экспортировать их, загружать в блокнот и настраивать отдельный кластер Spark.
Как вы понимаете, это крайне неудобно. Поэтому Google представляет ряд улучшений для своих блокнотов Colab Enterprise в BigQuery и на платформе Vertex AI.
Кроме того, компания анонсировала следующие преимущества для разработчиков в блокнотах Colab Enterprise:
➖ Предварительный просмотр собственных ячеек SQL.
➖ Интеграцию собственного Data Science Agent, призванного помогать в анализе и разработке моделей.
По слухам, поисковый гигант намерен создать единую среду для специалистов по машинному обучению, объединив SQL, Python и Apache Spark в одном месте.
Ясмин Ахмад, управляющий директор Google Cloud по обработке данных, отметил, что главным препятствием для эффективности в ML является необходимость переключаться между средами: получать данные с помощью SQL в базах данных и хранилищах, затем экспортировать их, загружать в блокнот и настраивать отдельный кластер Spark.
Как вы понимаете, это крайне неудобно. Поэтому Google представляет ряд улучшений для своих блокнотов Colab Enterprise в BigQuery и на платформе Vertex AI.
Кроме того, компания анонсировала следующие преимущества для разработчиков в блокнотах Colab Enterprise:
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5
Forwarded from Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
Наконец-то NVIDIA выпустила CUDA 13.1, и это не просто очередное обновление — это настоящий сдвиг парадигмы. Если вы когда-то пытались объяснить GPU, что делать с тысячами маленьких потоков (да-да, тот самый SIMT-модель), то знаете, что это сродни попытке управлять тысячью муравьёв одновременно.
💡 Что нового
CUDA 13.1 вводит tile-based programming. Вместо того чтобы двигать песчинку за песчинкой, теперь можно управлять целыми плитками данных. Представьте: вместо того чтобы таскать каждую песчинку в отдельности, вы берёте целый холм и переносите его за один раз. Магия, правда?
Что это значит для нас, Python-разработчиков и исследователей AI:
Иными словами, программировать ускорители стало логичнее, чище и мощнее.
🔹 Курс «Специалист по ИИ»
🔹 Получить консультацию менеджера
🔹 Сайт Академии 🔹 Сайт Proglib
#свежак
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3
Forwarded from Мониторим ИТ
Анализ проекта VictoriaMetrics
Мальчишки и девчонки, а также их родители, как устроена VictoriaMetrics узнать не хотите ли? В этой статье вы узнаете структуру каталогов проекта и о предназначении различных файлов. А ещё там описаны некоторые проектные решения при разработке продукта.
Эту статью можно назвать продолжением цикла. Есть еще одна похожая, которую я уже публиковал в канале. Но там рассмотрено все немного под другим углом.
Мальчишки и девчонки, а также их родители, как устроена VictoriaMetrics узнать не хотите ли? В этой статье вы узнаете структуру каталогов проекта и о предназначении различных файлов. А ещё там описаны некоторые проектные решения при разработке продукта.
Эту статью можно назвать продолжением цикла. Есть еще одна похожая, которую я уже публиковал в канале. Но там рассмотрено все немного под другим углом.
Forwarded from rpuropuu [Greeg'O'Rii']
pandas 3.0 — самый крупный релиз за годы: новый str dtype по умолчанию вместо object, с поддержкой Arrow‑бекенда (если установлен PyArrow), более предсказуемой типизацией и лучшей экономией памяти.
Весь фрейм переведён на Copy‑on‑Write: любой срез/результат операции ведёт себя как копия, chained assignment больше не работает, SettingWithCopyWarning уходит в историю, а лишние df = df.copy() можно выкидывать.
Появился pd.col() как выражения поверх колонок: теперь вместо lambda df: df["a"] + df["b"] в assign/loc можно писать pd.col("a") + pd.col("b"), с поддержкой операторов и .str/.dt методов.
Для экосистемы важны Arrow PyCapsule/from_arrow()/arrow_c_stream для нулекопийного обмена (передача данных между библиотеками без физического копирования в памяти) с другими датафрейм‑движками, обновлённая политика депрекейтов с семейством PandasChangeWarning, а также пачка I/O‑улучшений (Iceberg, SQL DatabaseError, доработки Excel/Parquet/CSV).
Весь фрейм переведён на Copy‑on‑Write: любой срез/результат операции ведёт себя как копия, chained assignment больше не работает, SettingWithCopyWarning уходит в историю, а лишние df = df.copy() можно выкидывать.
Появился pd.col() как выражения поверх колонок: теперь вместо lambda df: df["a"] + df["b"] в assign/loc можно писать pd.col("a") + pd.col("b"), с поддержкой операторов и .str/.dt методов.
Для экосистемы важны Arrow PyCapsule/from_arrow()/arrow_c_stream для нулекопийного обмена (передача данных между библиотеками без физического копирования в памяти) с другими датафрейм‑движками, обновлённая политика депрекейтов с семейством PandasChangeWarning, а также пачка I/O‑улучшений (Iceberg, SQL DatabaseError, доработки Excel/Parquet/CSV).
🔥5❤1
Forwarded from Python Books. Книги по питону
Exploratory Data Analysis with Python
Cookbook
Автор: Ayodele Oluleye
Год издания: 2023
#python #en
Скачать книгу
Cookbook
Автор: Ayodele Oluleye
Год издания: 2023
#python #en
Скачать книгу
Forwarded from Анализ данных (Data analysis)
Lakehouse — новый подход к данным, который убивает DWH и Data Lake
- Высокая вероятность, что массовый переход на Lakehouse начнётся в ближайшие 1-2 года — после того как первые игроки (Т-банк, Магнит, Ламода) уже доказали экономию и масштабируемость. Об этом в интервью «Коммерсанту» рассказал Леонид Савченков, руководитель продуктовой архитектуры платформы данных Yandex Cloud.
- Классические DWH на объёмах от 100 ТБ начинают тормозить: единственный способ — докупать серверы целиком, потому что хранение и вычисления сцеплены.
- Data Lake решал проблему объёма, но не давал нормального управления данными — отчёты строить было сложно.
- Lakehouse разделяет хранение и вычисления: можно нарастить мощности под «Чёрную пятницу» и не платить за лишнее место весь год.
- В отличие от Data Lake, здесь появляются строгие табличные форматы и управление данными как в СУБД.
- Узкое место — нужны спецы по Trino и Spark. Чудес не бывает.
- Для ИИ это идеально: вычисления можно выделить в отдельные мощности, не роняя основные отчёты. X5 уже построил бота по трендам молока в регионах.
- Через пять лет, вероятно, появится новая концепция. Если данных мало — старый DWH всё ещё дешевле и проще.
https://www.kommersant.ru/doc/8691430
- Высокая вероятность, что массовый переход на Lakehouse начнётся в ближайшие 1-2 года — после того как первые игроки (Т-банк, Магнит, Ламода) уже доказали экономию и масштабируемость. Об этом в интервью «Коммерсанту» рассказал Леонид Савченков, руководитель продуктовой архитектуры платформы данных Yandex Cloud.
- Классические DWH на объёмах от 100 ТБ начинают тормозить: единственный способ — докупать серверы целиком, потому что хранение и вычисления сцеплены.
- Data Lake решал проблему объёма, но не давал нормального управления данными — отчёты строить было сложно.
- Lakehouse разделяет хранение и вычисления: можно нарастить мощности под «Чёрную пятницу» и не платить за лишнее место весь год.
- В отличие от Data Lake, здесь появляются строгие табличные форматы и управление данными как в СУБД.
- Узкое место — нужны спецы по Trino и Spark. Чудес не бывает.
- Для ИИ это идеально: вычисления можно выделить в отдельные мощности, не роняя основные отчёты. X5 уже построил бота по трендам молока в регионах.
- Через пять лет, вероятно, появится новая концепция. Если данных мало — старый DWH всё ещё дешевле и проще.
https://www.kommersant.ru/doc/8691430
👍1
Forwarded from [PYTHON:TODAY]
Модуль datetime — твой лучший друг, если нужно работать с датами, временем или таймзонами.
📅 Форматирование дат и времени:
* %a → короткий день недели (Mon)
* %A → полный день недели (Monday)
* %b → короткий месяц (Jan)
* %B → полный месяц (January)
* %d → день месяца (01–31)
* %m → месяц (01–12)
* %y → год без века (23)
* %Y → год с веком (2023)
* %j → день в году (001–366)
* %H → час (24ч, 00–23)
* %I → час (12ч, 01–12)
* %M → минуты (00–59)
* %S → секунды (00–61, да, 61! 😅)
* %f → микросекунды (000000–999999)
* %p → AM/PM
* %z → UTC-смещение (+0300)
* %Z → таймзона (если есть)
* %U → номер недели (с воскресенья)
* %W → номер недели (с понедельника)
* %x → локальная дата
* %X → локальное время
* %% → просто знак %
Примеры:
from datetime import datetime
now = datetime.now()
print(now)
# 2025-09-03 13:41:30.123456
Примеры форматирования даты:
print(now.strftime("%A, %d %B %Y"))
# Wednesday, 03 September 2025
print(now.strftime("%a, %d.%m.%y"))
# Wed, 03.09.25
print(now.strftime("День года: %j"))
# День года: 246
Примеры форматирования времени:
print(now.strftime("%H:%M:%S"))
# 12:45:30
print(now.strftime("%I:%M %p"))
# 12:45 PM
print(now.strftime("Микросекунды: %f"))
# Микросекунды: 123456
#python #doc #cheatsheet
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5
Forwarded from Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
matplotlib-cheat-sheet.pdf
2.4 MB
Сохраняйте, пригодится не раз.
📍 Навигация: Вакансии • Задачи • Собесы
#буст
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1