DataSciencePRO
748 subscribers
188 photos
19 videos
111 files
339 links
Все нужное и полезное из мира дата сатанистов)
Download Telegram
📢 NVIDIA представила nvmath-python — библиотеку для Python, которая открывает доступ к возможностям фирменных математических библиотек (например, cuBLASLt) через удобный API.

Что умеет:
- работает с массивами из NumPy, CuPy, PyTorch и других экосистем;
- поддерживает тонкую настройку вычислений (precision, режимы умножений, epilog-операции);
- позволяет использовать расширенные оптимизации NVIDIA для ускоренной математики и ML-задач.

Проект пока в бета-версии, но уже можно попробовать:
https://github.com/NVIDIA/nvmath-python
👍1
Кажется, Google готовится объединить SQL, Python и Spark в рамках Colab Enterprise

По слухам, поисковый гигант намерен создать единую среду для специалистов по машинному обучению, объединив SQL, Python и Apache Spark в одном месте.

Ясмин Ахмад, управляющий директор Google Cloud по обработке данных, отметил, что главным препятствием для эффективности в ML является необходимость переключаться между средами: получать данные с помощью SQL в базах данных и хранилищах, затем экспортировать их, загружать в блокнот и настраивать отдельный кластер Spark.

Как вы понимаете, это крайне неудобно. Поэтому Google представляет ряд улучшений для своих блокнотов Colab Enterprise в BigQuery и на платформе Vertex AI.

Кроме того, компания анонсировала следующие преимущества для разработчиков в блокнотах Colab Enterprise:
➖ Предварительный просмотр собственных ячеек SQL.
➖ Интеграцию собственного Data Science Agent, призванного помогать в анализе и разработке моделей.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5
🆕 CUDA 13.1 переворачивает GPU-программирование

Наконец-то NVIDIA выпустила CUDA 13.1, и это не просто очередное обновление — это настоящий сдвиг парадигмы. Если вы когда-то пытались объяснить GPU, что делать с тысячами маленьких потоков (да-да, тот самый SIMT-модель), то знаете, что это сродни попытке управлять тысячью муравьёв одновременно.

💡 Что нового

CUDA 13.1 вводит tile-based programming. Вместо того чтобы двигать песчинку за песчинкой, теперь можно управлять целыми плитками данных. Представьте: вместо того чтобы таскать каждую песчинку в отдельности, вы берёте целый холм и переносите его за один раз. Магия, правда?

Что это значит для нас, Python-разработчиков и исследователей AI:
✔️ Прощай, C++ барьер: с CuTile можно писать высокопроизводительные ядра на чистом Python. Не нужен диплом магистра по C++.
✔️ Синхронизация с железом: современные тензорные ядра уже «думают» блоками данных, а софт теперь догнал железо.
✔️ Будущее уже здесь: поддержка Blackwell архитектуры и новых FP4/FP6 форматов ускоряет и делает эффективнее LLM.

Иными словами, программировать ускорители стало логичнее, чище и мощнее.

🔗 Ссылка на новость

🔹 Курс «Специалист по ИИ»
🔹 Получить консультацию менеджера
🔹 Сайт Академии 🔹 Сайт Proglib

🐸 Библиотека дата-сайентиста

#свежак
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3
Forwarded from Мониторим ИТ
Анализ проекта VictoriaMetrics

Мальчишки и девчонки, а также их родители, как устроена VictoriaMetrics узнать не хотите ли? В этой статье вы узнаете структуру каталогов проекта и о предназначении различных файлов. А ещё там описаны некоторые проектные решения при разработке продукта.

Эту статью можно назвать продолжением цикла. Есть еще одна похожая, которую я уже публиковал в канале. Но там рассмотрено все немного под другим углом.
Forwarded from rpuropuu [Greeg'O'Rii']
pandas 3.0 — самый крупный релиз за годы: новый str dtype по умолчанию вместо object, с поддержкой Arrow‑бекенда (если установлен PyArrow), более предсказуемой типизацией и лучшей экономией памяти.
​

Весь фрейм переведён на Copy‑on‑Write: любой срез/результат операции ведёт себя как копия, chained assignment больше не работает, SettingWithCopyWarning уходит в историю, а лишние df = df.copy() можно выкидывать.
​

Появился pd.col() как выражения поверх колонок: теперь вместо lambda df: df["a"] + df["b"] в assign/loc можно писать pd.col("a") + pd.col("b"), с поддержкой операторов и .str/.dt методов.
​

Для экосистемы важны Arrow PyCapsule/from_arrow()/arrow_c_stream для нулекопийного обмена (передача данных между библиотеками без физического копирования в памяти) с другими датафрейм‑движками, обновлённая политика депрекейтов с семейством PandasChangeWarning, а также пачка I/O‑улучшений (Iceberg, SQL DatabaseError, доработки Excel/Parquet/CSV).
🔥5❤1
Exploratory Data Analysis with Python
Cookbook

Автор:
Ayodele Oluleye
Год издания: 2023

#python #en

Скачать книгу
Немного классики!)
👍2
Lakehouse — новый подход к данным, который убивает DWH и Data Lake

- Высокая вероятность, что массовый переход на Lakehouse начнётся в ближайшие 1-2 года — после того как первые игроки (Т-банк, Магнит, Ламода) уже доказали экономию и масштабируемость. Об этом в интервью «Коммерсанту» рассказал Леонид Савченков, руководитель продуктовой архитектуры платформы данных Yandex Cloud.
- Классические DWH на объёмах от 100 ТБ начинают тормозить: единственный способ — докупать серверы целиком, потому что хранение и вычисления сцеплены.
- Data Lake решал проблему объёма, но не давал нормального управления данными — отчёты строить было сложно.
- Lakehouse разделяет хранение и вычисления: можно нарастить мощности под «Чёрную пятницу» и не платить за лишнее место весь год.
- В отличие от Data Lake, здесь появляются строгие табличные форматы и управление данными как в СУБД.
- Узкое место — нужны спецы по Trino и Spark. Чудес не бывает.
- Для ИИ это идеально: вычисления можно выделить в отдельные мощности, не роняя основные отчёты. X5 уже построил бота по трендам молока в регионах.
- Через пять лет, вероятно, появится новая концепция. Если данных мало — старый DWH всё ещё дешевле и проще.

https://www.kommersant.ru/doc/8691430
👍1
Forwarded from [PYTHON:TODAY]
😰 Python-шпаргалка по работе с датой и временем!

Модуль datetime — твой лучший друг, если нужно работать с датами, временем или таймзонами.

🔥 Форматы путают все. Держи удобный список, который точно пригодится:

📅 Форматирование дат и времени:

* %a → короткий день недели (Mon)
* %A → полный день недели (Monday)
* %b → короткий месяц (Jan)
* %B → полный месяц (January)
* %d → день месяца (01–31)
* %m → месяц (01–12)
* %y → год без века (23)
* %Y → год с веком (2023)
* %j → день в году (001–366)

⏰ Форматирование времени:

* %H → час (24ч, 00–23)
* %I → час (12ч, 01–12)
* %M → минуты (00–59)
* %S → секунды (00–61, да, 61! 😅)
* %f → микросекунды (000000–999999)
* %p → AM/PM
* %z → UTC-смещение (+0300)
* %Z → таймзона (если есть)

* %U → номер недели (с воскресенья)
* %W → номер недели (с понедельника)
* %x → локальная дата
* %X → локальное время
* %% → просто знак %

Примеры:


from datetime import datetime

now = datetime.now()
print(now)
# 2025-09-03 13:41:30.123456


Примеры форматирования даты:


print(now.strftime("%A, %d %B %Y"))
# Wednesday, 03 September 2025

print(now.strftime("%a, %d.%m.%y"))
# Wed, 03.09.25

print(now.strftime("День года: %j"))
# День года: 246


Примеры форматирования времени:


print(now.strftime("%H:%M:%S"))
# 12:45:30

print(now.strftime("%I:%M %p"))
# 12:45 PM

print(now.strftime("Микросекунды: %f"))
# Микросекунды: 123456


👍 Сохрани, чтобы не гуглить каждый раз!

😁 Лайф | 📲 Зеркало Max

#python #doc #cheatsheet
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5
matplotlib-cheat-sheet.pdf
2.4 MB
📊 Matplotlib под рукой: всё главное для графиков и анализа

Сохраняйте, пригодится не раз.

📍 Навигация: Вакансии • Задачи • Собесы

🐸 Библиотека дата-сайентиста

#буст
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1