Слайдер Данные
171 subscribers
67 photos
11 videos
6 files
116 links
Это DuckDB+Polars в режиме Trino c OLAP кубами как надстройка для Excel | Р7 Офис

Объединяйте разные файлы и БД в один запрос и автоматизируйте сбор, трансформацию и аналитику.

Для связи
@datacons
https://data.slider-ai.ru
Download Telegram
Forwarded from MyDB
🐳 MySQL 9.6.0: Глубокая интеграция с контейнерами

Релиз MySQL 9.6.0 (конец января) принес важное улучшение для тех, кто использует контейнеризацию. Появилась серверная переменная container_aware.

Суть изменений:

Ранее MySQL уже умел определять объемы доступной памяти и ядер CPU и использовать эти значения для автоматической подстройки собственных лимитов. Теперь поведение этого кода зависит от нового флага:

🔹 container_aware = ON: Сервер проверяет, запущен ли он в контейнере (cgroup). Если да — он учитывает лимиты контейнера при выделении памяти и настройке всех ресурсозависимых параметров: размер innodb_buffer_pool_size, лимиты для in-memory временных таблиц ( temptable_max_ram ), количество потоков InnoDB ( innodb_read_io_threads, innodb_purge_threads, parallel_read_threads ) и другие. Если лимиты не найдены или сервер запущен не в контейнере — выход с ошибкой.

🔹 container_aware = OFF (по умолчанию): Режим совместимости с предыдущими версиями — сервер игнорирует контейнер и смотрит на ресурсы хоста. При этом в лог пишется предупреждение, если MySQL обнаруживает, что работает в контейнере с ограничениями.

Зачем это нужно: Долгожданная фича для корректной работы MySQL в оркестрации (Kubernetes и т.д.). Позволяет избежать ситуации, когда база данных внутри контейнера думает, что у нее 64 ядра и 512 ГБ RAM, хотя реально выделено только 2 ядра и 4 ГБ. Больше никаких неожиданных OOM и неоптимальных настроек!

Что дальше? В MySQL проведена многолетняя подготовительная работа: большинство серверных параметров уже давно меняются на лету без перезагрузки сервера. Логичным следующим шагом было бы научить MySQL не только учитывать лимиты при старте, но и отслеживать их изменения "на лету". В динамических средах (например, Kubernetes с вертикальным автомасштабированием) лимиты контейнера могут меняться без перезапуска пода — и тогда MySQL мог бы динамически подстраивать buffer_pool_size или количество рабочих потоков без даунтайма.
Forwarded from Visiology Official
Российский BI-рынок в 2025 году: кто 💪 усиливается и почему это важно

Вчера в прямом эфире управляющий партнер Visiology Иван Вахмянин представил исследование «Пульс BI 2026: анализ Business Intelligence в России».

Понимание реальной картины, объема рынка, структуры, долей и найма, становится отправной точкой для стратегических решений: во что инвестировать, как развивать продукт и какую BI-платформу выбирать в условиях новой конкуренции.


По итогам вебинара мы подготовили для вас ключевые выводы в формате карточек. Листайте, чтобы почувствовать пульс BI 🟡

Для тех, кто хочет погрузиться глубже, мы уже загрузили запись эфира на наши площадки VK Видео | Rutube | YouTube

Visiology в мессенджере MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
1
Media is too big
VIEW IN TELEGRAM
Быстрый старт со Слайдер Данные - импорт модели AdventureWorks

Триальный дистрибутив
Forwarded from Клуб CDO
Дайджест статей

📰: Путь в аналитику данных: базовый минимум для старта
Ссылка: https://habr.com/ru/articles/1003704/
Вывод одной строкой: Для успешного входа в аналитику данных необходимо освоить SQL, Python/R, основы статистики и визуализации данных, а также развивать навыки работы с бизнес-задачами и критического мышления, постепенно наращивая экспертизу через практические проекты и непрерывное обучение.


📰: BI-аналитик: стартовый пакет необходимых навыков
Ссылка: https://habr.com/ru/articles/1004298/
Вывод одной строкой: Для успешной работы BI-аналитиком необходимо освоить SQL для работы с базами данных, инструменты визуализации данных (Tableau, Power BI), основы статистики и аналитического мышления, а также развить навыки коммуникации для эффективного представления результатов анализа бизнес-заказчикам.


📰: Как мы улучшили рекомендации для пользователей Авито с помощью трансформенной персонализации
Ссылка: https://habr.com/ru/companies/avito/articles/1004694/
Вывод одной строкой: Трансформерная архитектура с механизмом внимания позволяет значительно повысить качество рекомендательных систем за счет более точного моделирования последовательности действий пользователя и учета долгосрочных зависимостей в его поведении.


📰: Data Mesh, Data Fabric, Lakehouse: разбираем модные термины
Ссылка: https://habr.com/ru/articles/1005062/
Вывод одной строкой: Современные архитектурные подходы Data Mesh, Data Fabric и Lakehouse решают разные задачи управления данными: децентрализацию и демократизацию доступа, интеллектуальную интеграцию разрозненных источников и унификацию аналитических и транзакционных нагрузок соответственно, поэтому выбор конкретного решения должен основываться на организационной структуре компании, существующей инфраструктуре и бизнес-целях.


📰: Data catalog есть, а пользы нет: Частые ошибки внедрения
Ссылка: https://habr.com/ru/articles/1003158/
Вывод одной строкой: Успешное внедрение каталога данных требует не только технической реализации, но и активного вовлечения пользователей, четкого определения процессов управления метаданными и постоянной поддержки культуры работы с данными в организации.
This media is not supported in your browser
VIEW IN TELEGRAM
Создание соединений в Слайдер Данные
👍1
Готовим релиз 10го марта для Р7 Офис
👍1🔥1
СД Excel Работа с отчетами SQL | Создание модели ROLAP
Дайджест статей

📰: Architectural Standards for Data Products and AI Interactions: Emergent & Aligned Patterns
Ссылка: https://moderndata101.substack.com/p/architecture-data-products-ai-interactions?publication_id=1170209&post_id=188149190&isFreemail=true&r=15862q&triedRedirect=true
Вывод одной строкой: Успешная архитектура данных и ИИ-продуктов требует применения согласованных паттернов проектирования, которые обеспечивают масштабируемость, надежность и эффективное взаимодействие между компонентами системы через стандартизированные интерфейсы и протоколы обмена данными.

📰: Data Mesh vs централизованная модель: выбираем оптимальный подход к управлению данными
Ссылка: https://habr.com/ru/companies/vk/articles/1005846/
Вывод одной строкой: Выбор между Data Mesh и централизованной моделью управления данными зависит от масштаба организации, сложности доменов, зрелости команд и требований к автономности подразделений, при этом Data Mesh подходит для крупных компаний с множественными доменами данных, а централизованная модель эффективнее для небольших организаций с ограниченными ресурсами.

📰: Почему Lakehouse нельзя построить без Spark
Ссылка: https://habr.com/ru/companies/datasapience/articles/1007428/
Вывод одной строкой: Apache Spark является критически важным компонентом для построения архитектуры Lakehouse, поскольку обеспечивает единую платформу для обработки структурированных и неструктурированных данных с возможностями как пакетной, так и потоковой обработки, что делает его незаменимым для реализации концепции объединения преимуществ озер данных и хранилищ данных.

📰: Корпоративная память как инфраструктура: как мы построили RAG-систему внутри ИТ-компании с промышленной экспертизой
Ссылка: https://habr.com/ru/companies/zyfra/articles/1007356/
Вывод одной строкой: Построение корпоративной RAG-системы требует тщательного планирования архитектуры данных, выбора подходящих методов векторизации и индексации, а также создания эффективных механизмов поиска и ранжирования релевантной информации для обеспечения качественной работы с корпоративными знаниями.

📰: Инструментарий аналитика данных: что реально нужно освоить в 2026 году
Ссылка: https://habr.com/ru/articles/1007780/
Вывод одной строкой: Современному аналитику данных критически важно сосредоточиться на освоении SQL, Python, инструментов визуализации данных и базовых принципов машинного обучения, поскольку эти навыки остаются фундаментальными независимо от появления новых технологий и трендов в области данных.

📰: The Data Team’s Survival Guide for the Next Era of Data | Towards Data Science
Ссылка: https://towardsdatascience.com/the-data-teams-survival-guide-for-the-next-era-of-data/
Вывод одной строкой: Я не могу получить доступ к содержимому статьи по предоставленной ссылке, поэтому не могу написать конкретный вывод на основе её материала. Чтобы помочь вам сформулировать вывод, мне потребуется текст статьи или её основные тезисы. Пожалуйста, скопируйте содержание статьи или её ключевые моменты, и я смогу составить краткий вывод в одно предложение для инженера по данным.

📰: Data Ownership in Practice: Defining Decision Rights in Enterprise Data Governance
Ссылка: https://moderndata101.substack.com/p/data-ownership-in-practice-defining?publication_id=1170209&post_id=187760032&isFreemail=true&r=15862q&triedRedirect=true
Вывод одной строкой: Эффективное управление корпоративными данными требует четкого распределения прав принятия решений между владельцами данных, их хранителями и потребителями, что обеспечивает качество данных, соблюдение требований безопасности и максимизацию бизнес-ценности информационных активов.
Обновления в Слайдер Данных

1) Прокси стартует в windows из под сессии пользователя - и имеет доступ ко всем сетевым ресурсам что и пользователь
2) Добавили "запускатель" , что бы пользователь мог сам управлять процессом
3) Исправили ошибки с сохранением результатов запросов во внешний файл
4) Переделали интеграцию с прокси на потоковый режим - теперь мы можем обрабатывать на прокси датасеты более чем на 1Gb
5) Единая установка и для Р7 Офис и для Excel

https://disk.yandex.ru/d/DXg_yeIlOtg2Bg
Датаклассы

Наконец-то спустя год дошли руки написать про датаклассы 🌷 Меня спросили на собесе в ламоду, и тогда я про них либо краем уха слышала, либо вообще не слышала. Но точно не использовала. Посмотрим, что с ними можно делать

Зачем?

Датакласс описывает данные, но без кучи лишних методов. Он сам вместо нас добавит __init__, __repr__, __eq__ по дефолту. Набор методов можем сами менять с помощью флагов

Как создать?

Чтобы датаклассы заработали, нужно их импорнуть и добавить в виде аннотации:


from dataclasses import dataclass

@dataclass
class SparkParams:
"""Dataclass для параметров spark-submit команды."""

name: str
deploy_mode: str
driver_cores: int
driver_memory: str
executor_cores: int
executor_memory: str
num_executors: int


Готово! Никакие методы добавлять не нужно

Как использовать?


spark_params = SparkParams("test_app", "cluster", 2, "4g", 4, "32g", 8)


Другие фишки

Запрещаем менять поля:


@dataclass(frozen=True)


Задаем дефолтные значения:


@dataclass
class Team:
description: str | None = None
emails: list[str] = field(default_factory=list) # для list/dict/set


Чуть подробнее можно прочитать в короткой статье

@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
В прошлом году Databricks купил Neon.

Основатели Neon:
• Никита Шамгунов - CEO и идейный вдохновитель Россиянин, PhD по Computer Science из Санкт-Петербурга
• Хейкки Линнакангас - Co-founder, Postgres-хакер
Финн, один из самых известных core committer'ов PostgreSQL с 20+ летним стажем.
• Стас Кельвич - Co-founder, инженер. Изучал физику, затем пришёл в разработку — работал в Яндексе в команде баз данных.

Команда собралась вокруг одной идеи: "что если сделать для Postgres то же, что Amazon Aurora сделала для MySQL/Postgres, но open-source и по-настоящему serverless?"

Amazon Aurora это serverless Postgres, но это как бы vendor lock.

У Neon было три основных этапа/фичи:

1️⃣Разделение слоев давало serverless-поведение: scale-to-zero, оплата только за реальное использование, "бездонное" хранилище.

2️⃣Разделение compute и storage открыло неожиданную суперспособность - branching базы данных через copy-on-write. Создать полную копию базы с данными и схемой стало бесплатным по времени и почти бесплатным по стоимости.

Кстати Snowflake zero-copy cloning имеет похожую идею copy-on-write - клон/ветка не копирует данные физически, а создаёт метаданные-указатели на те же блоки хранилища. Новые данные записываются только при изменениях. Оба мгновенные и почти бесплатные по хранилищу. Только у Neon каждая ветка это свой изолированный Postgres. Благодаря этому у каждой ветки свой compute и не влияет на продакшн базу данных.

3️⃣Neon обнаружил, что 80% баз на их платформе создаются кодом, а не людьми. AI-агенты и платформы вроде Replit Agent стали создавать тысячи эфемерных баз на лету - под каждого пользователя, под каждый эксперимент. Один инженер в Retool управлял через Neon API 300,000 Postgres-инстансов.

Для Databricks это решение понравилось, ведь они уже работаю с AI агентами, каждый агент получает свою изолированную базу данных, и сама идея Zero ETL не нова, и Neon позволяет использовать OLTP workloads и хранить данные сразу в Databricks, ведь Neon хранит данные в облачном object storage (S3/ADLS/GCS), то есть буквально в том же хранилище, что и lakehouse.

И вот Databricks закончил интеграцию и назвал продукт/фичу - Lakebase. Это Postgres версии 16/17. Так же Databricks приобрел Mooncake для лучшей интеграции Postgres с Lakehouse.

Mooncake Labs - это маленький стартап (основан в 2024 году), который сделал одну очень конкретную вещь: ⁠pg_mooncake — Postgres-расширение, которое добавляет колоночное хранилище прямо внутрь Postgres, сохраняя данные в формате Apache Iceberg/Delta Lake в object storage.

Под капотом происходит следующее:
• Данные хранятся не в Postgres heap (row-формат), а в Parquet-файлах в S3 в формате Iceberg
• Аналитические запросы выполняются через DuckDB (встроен в расширение) - векторизованный движок, заточенный под колоночное чтение

Neon дал serverless Postgres compute, но данные в нём хранились в Postgres-формате — отдельно от lakehouse.

Чтобы аналитические движки (Spark, Databricks SQL) могли их читать, нужно было либо копировать данные через ETL, либо держать два источника правды.

Mooncake закрыл этот gap: вместо того чтобы копировать данные из Postgres в lakehouse, он делает Iceberg основным хранилищем. Postgres пишет сразу в Iceberg/Parquet в S3 - и тот же файл без какого-либо ETL читают и приложения через Postgres, и аналитика через Spark.

Есть еще Synced Tables - это отдельный, более старый механизм для обратного направления: когда нужно "опустить" уже готовые аналитические данные из Unity Catalog в Lakebase, чтобы приложение могло читать их с низкой латентностью (< 10 мс) (Reverse ETL). Здесь дублирование данных неизбежно — потому что аналитический Parquet нужно переложить в row-формат Postgres для быстрых point-lookup запросов.


PS Работаю часто с Databricks, пока реальных кейсов на Lakebase Postgres не видел =/
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Weekly Charts
🌻 Pi Day

Вчера (14 марта) был День числа Пи (3/14). Визуализируем с помощью #R и #ggplot2 первые 1 000 знаков числа Пи. В сердце этой визуализации — математически совершенный узор, который природа миллионы лет использует в подсолнухах и шишках для идеальной упаковки семян (филлотаксис).

Секрет в золотом угле (≈137.5°), который заставляет цифры числа Пи в виде точек занимать всё свободное пространство, не образуя пустых рядов или "швов". Чтобы узор оставался равномерным, используется спираль Ферма и модель Фогеля (r = √i). Квадратный корень удерживает плотность точек одинаковой как в центре, так и на краях, превращая бесконечный цифровой хаос в гармоничный "математический цветок".

Постер Pi Day в формате A4 300 dpi. Код постера на GitHub.

#pi #ggplot2 #R #rstats #dataviz #generative_art
2