Мультивселенная СУБД
401 subscribers
187 photos
2 videos
4 files
425 links
Канал для тех, кто хочет стать супергероем этой мультивселенной
Download Telegram
Хорош работать! Катить в прод ваши поделки уже поздно! Дайте себе и людям отдохнуть...

С Пятницей!

#mems
🔥6😁1
📚 Немецкий стартап SereneDB получает 2,1 миллиона долларов инвестиций в первом раунде

Раунд возглавили фонды Entourage и High-Tech Gründerfonds


SereneDB разрабатывает распределенную базу данных для поиска в режиме реального времени.

Меня всегда привлекают новости об инвестициях в проекты по СУБД. Про этот продукт я ничего не знаю, но решил глянуть фаундеров, а там три наших соотечественника: Александр Маландин🇷🇺, Андрей Абрамов🇷🇺 и Валерий Миронов 🇷🇺. Ха-ха...немецкий стартап, ну-ну 🤨😉

SereneDB возглавляет генеральный директор Александр Маландин, химик-технолог, ставший евангелистом в сфере информационных технологий, с большим опытом работы в сфере корпоративных хранилищ, серверов и баз данных в компаниях EMC и Dell, а также в ArangoDB.

К нему присоединился технический директор Андрей Абрамов, специалист с 15-летним стажем по информационно-поисковым системам, который создал альтернативу Lucene на C++ и стал первым, кто успешно интегрировал её с базой данных. Он признанный провидец в области проектирования баз данных с поддержкой поиска.

Главный инженер-программист Валерий Миронов, разработчик-самоучка, который бросил колледж, чтобы сосредоточиться на программировании, является энтузиастом открытого исходного кода и автором YACLib.


Посмотрим, во что выльется этот продукт. Релиз запланирован на февраль 2026.

Примечательно, что все основатели есть в чате разработчиков СУБД в телеге. Выйти с ними на контакт не проблема .

Буду следить за этим проектом.
👍6
📚Pinecone масштабирует свою векторную базу данных для поддержки более ресурсоёмких задач

Я в последнее время редко публикую новости про векторные СУБД, но тут решил прервать молчание.

Векторные СУБД продолжают развиваться и на фоне популярности ИИ и аналитических систем становятся всё более продвинутыми.
На этом поле битвы не обязательно чтобы СУБД была открытой или имела on-prem инсталяцию. Облачное решение, а-ля, Managed Pinecone прекрасно себя чувствует и внедряет новые технологии.

К сожалению, я не знаю кто именно пользуется этой СУБД и какой сегмент рынка охватывает, но если где-то и всплывает Pinecone, то обязательно с какой-то новой фичей 🎉 или с привлечением очередных денежных траншей в компанию 💸.

Молодцы ребята! 💪

Да, компания Американская, со штаб-квартирой в Нью-Йорке. Российский корней нет. Хотя директор по инжинирингу очень подозрительный 👀
🔥2
31 декабря начнем с бюджета (поздравление чуть позже)
И так, внимание: "Топ-10 российских разработчиков СУБД за год увеличили объем выручки на 35%"

Собственно, сам рейтинг
1. Postgres Professional
2. Arenadata
3. Yandex B2B Tech
4. VK Tech
5. Тантор Лабс

Было очевидно, что PostgresPro круче всех! Я думаю такое лидерство сохранится. Буквально вчера новость: https://www.cnews.ru/news/top/2025-12-22_rosatom_pochti_za_milliard

Необычно видеть Яндекс среди лидеров. Решил чуть погуглить, а какие продукты предлагает Yandex B2B Tech? Если кратко, то это доработанные опенсорс СУБД в облаке, т.е. вырос спрос на облачные решения. Это тренд последних лет. Думаю он будет только расти.

Тантор не ожидал увидеть в ТОП-5. Я не знаю клиентов этой компании. Надо себя заставить посетить конференцию от Тантора в 2026 году.

Не понятно почему СберТеха с Панголином нет в списке. Мне казалось, что СБТ нормально так денег поднимает с этой СУБД. Может быть отчетность не публичная, не знаю.

В целом, рынок СУБД растёт. Денег там всё больше и больше!
Буду в 2026 году стараться по максимум, чтобы кусок этого пирога и мне достался! 😜

С Наступающим! 🎄

В цело
😁2
С Наступающими праздниками! Все бегом под Ёлку раскрывать подарки! 🌲 🍊

Можете поделиться своим подарками в комментариях
🎉6
Чем бы заняться на праздниках? Хммм

Просто напоминаю, что сегодня пятница! Еще 10 дней отдыхать!

#mems
👀4
🎦 9 декабря уже прошлого года прошла конференция ISPRAS Open. Предлагаю ознакомиться с треком по БД: Database Internals Meetup #10: Пять докладов на конференции ISPRAS Open

❇️Программа
13:00-14:00 Расширяя пределы PostgreSQL: архитектура и интеграция OrioleDB. Александр Коротков, Head of PostgreSQL group, Supabase, Константин Осипов, Управляющий директор по исследованиям и разработке Группы Arenadata

14:00 — 15:00 Проблема медленного JIT решена? Тимур Сафин, Директор лаборатории DBLab, LRI

15:00 — 16:00 Кофе/ланч брейк

16:00 — 17:00 Разработка нативного акселератора SQL-запросов на Rust для Trino. Владимир Озеров, Генеральный директор, CedrusData

17:00 — 18:00 Линейная алгебра как основа для языка запросов к графам. Семен Григорьев, Доцент кафедры системного программирвоания СПбГУ

18:00 — 19:00 Проблемы субтранзакций и мультитранзакций в Postgres. Андрей Бородин, Руководитель разработки СУБД с открытым кодом, Яндекс


Докладов много и что-то выделить не просто. Всё интересно 😉

❇️Приведу несколько цитат:

❗️ Что нужно сделать, чтобы довести технологию до промышленного уровня? Достаточно того, чтобы технология начала применяться. Чем больше пользователей - тем более зрелой становится технология.

❗️ OrioleDB - это движок для PostgreSQL, который всё делает не так как в классическом PostgreSQL. И это не просто так.

❗️ Темп изменений, который происходит в PostgreSQL довольно высок. Однако современных вызовов настолько много, что этого темпа не достаточно.
📚 Шикарная статья The Cambridge Report on Database Research! 🧨

Кому лень читать вот ИИ расшифровка статьи

❇️ Общая цель документа

Работа под названием The Cambridge Report on Database Research подводит итоги развития области баз данных за последние ~5 лет и формулирует ключевые исследовательские вызовы и направления на ближайшее будущее. Отчет подготовлен по итогам встречи ведущих ученых и практиков в Кембридже (октябрь 2023 года) и продолжает традицию аналогичных «отчетов сообщества» (Laguna Beach, Asilomar, Claremont, Beckman, Seattle и др.).

❇️Основные содержательные блоки

1. Что произошло в СУБД за последние годы:
👉 переход индустрии к cloud-native СУБД с разделением хранения и вычислений;
👉 активное использование нового железа (NVMe, GPU, FPGA, CXL, persistent memory);
👉 рост роли ML и AI внутри СУБД (оптимизация запросов, cardinality estimation, autotuning);
👉 укрепление open-source экосистем (PostgreSQL, Spark, Flink, DuckDB);
👉 сближение СУБД и data science-инструментов.

2. Генеративный ИИ и LLM — переломный фактор:
👉 LLM как интерфейс к данным (text-to-SQL, NL-интерфейсы);
👉 ограничения LLM для «классических» задач СУБД (оптимизация, исполнение);
👉 необходимость data systems for LLMs: хранение эмбеддингов, RAG, evals, пайплайны, provenance;
👉 роль СУБД в снижении галлюцинаций, валидации результатов и управлении данными для ИИ.
👉 Ключевая мысль: LLM не заменяют СУБД, а радикально повышают их значимость.

3. Будущие исследовательские вызовы
👉 модульные и компонуемые архитектуры СУБД;
👉 федерация данных и соблюдение регуляторных требований (data residency);
👉 автоматическое управление инфраструктурой в облаке;
👉 «зелёные» и энергоэффективные СУБД;
👉 responsible data management, governance, provenance, fairness;
👉 интеграция СУБД с data science и human-in-the-loop системами.

p.s. от товарищей из АСМ есть видео и текстовый обзор этой статьи. Пока только первой её части
👍4🔥2
Заявка на доклад конференции PG.Conf.Russia 2026 подана.

Конференция пройдёт 23–24 марта 2026, а значит осталось около 60 дней на доработку доклада.

Ой, январь обещает быть тяжелым.
👍6
Даже добавить нечего 🍰🥧🍨🫖

С пятницей!

#mems
😁1
📚 С небольшим опозданием, Энди Павло опубликовал свой ежегодный отчет о прошедших событиях в мире СУБД. Концовка статьи получилась очень "ламповой"💡. Остается какое-то светлое чувство в сердце 🏮, а так же небольшая обидка на то, что мирок РФ в области СУБД и мир США почти не пересекаются. Таков наш путь... 🌌

Товарищи сделали свой подробный разбор этой статьи, поэтому не думаю, что стоит повторяться.

Всем советую почитать оригинал. А ниже я отмечу некоторые фразы, которые затронули лично меня

Hydra and PostgresML went bust in 2025 (see Deaths section), so they're out of the game

Что тут сказать, проекты с интеграцией ML фишек в СУБД провалились. Это было от части предсказуемо. Интересно как дипломники 2026/27 годов будет выкручиваться, т.к. множество работ именно по связанным с этими СУБД тематикам 😊

If 2023 was the year every DBMS added a vector index, then 2025 was the year that every DBMS added support for Anthropic's Model Context Protocol (MCP)

Это для меня некое открытие 🤯. Я совершенно упустил этот тренд. Разработчики СУБД предоставили API для LLM в свои продукты. Интересная идея. Как заметил Энди это потенциальная угроза безопасности, поэтому подход КликХауса, который дал доступ только на чтение, выглядит весьма надежным.

HeavyDB → Nvidia
The death of Voltron and sort-of acquihire of HeavyDB seem to continue the trend of the inviability of GPU-accelerated databases.

Количество проектов с интеграцией DBMS+GPU сокращаются на конец 2025 года, но само направление перспективное. Сам Энди ожидает в 2026 году новых стартапов на этом поприще. Я тоже считаю, что идейка это неплохая. Просто время не то. Майнинговый бум всё испортил, а сейчас еще и дефицит чипов памяти, который опять скажется на рентабельности подобных подходов. Короче, ждем...
7
📚За новогодние праздники ничего интересного на Хабре по базам данных не было. Разве что можно отметить маркетинговую статью от PostgresPro: Каким будет энтерпрайз-СУБД в эпоху ИИ.

В целом, там каких-то откровений нет. В комментариях к статье народ уже высказался предельно ясно и понятно.

За последние 2 недели всё чаще попадаются статьи, комментарии людей, которые хейтят ИИ. Вот мол, спросил у ИИ одно, а получил какую-то фигню, а не ответ. Ай-яй-яй, плохой ИИ 🤬. Отменяем 🙅‍♂️Всё в том же духе.

Я использую ИИ в своей преподавательской и исследовательской деятельности довольно часто. ИИ прекрасно умеет набрасывать информацию по любой теме. Да, она может быть неактуальной или местами неверной, но это не важно. Гораздо проще "посеять" готовую информацию, чем потратить часы на поиск чего-то в гугле или книгах🥵.

Достаточно соблюдать правила безопасности и всё будет хорошо 😉

Можно и фейерверками не небо расстрелять, а себя 🎉💥➡️🍑 .
Таких видосов во всяких "тиктоках", VK клипах тьма.
Берегите себя 🤚
👍1😱1
Современная реальность. Ничего тут не поделать

С пятницей!

#mems
😁5👍1
📚 Помните я публиковал свою статью на Хабре?

Так вот, мне народ подсказал, а почему бы её не перевести на английский язык и не опубликовать на западных медиа ресурсах? Действительно, подумал я. Перевод статьи - это дело второе, а главное, на какой платформе?

Очевидным решением является - Medium

Но, он заблокирован на территории РФ. Я понимаю, что для настоящих айтишников нет преград, но всё же. Второй минус, это огромная текучка материала. Я полистал ленту по тегу #database и понял, что в день публикуется порядка 30 статей разной степени качества. Поэтому решил поискать что-то еще.

ИИ предложил мне несколько вариантов и я выбрал платформу hashnode.

Она вроде относительная молодая и больше ориентирована на блогеров. Думаю для начала сойдёт.

Итог, моя статья на английском языке🤪

p.s. будут замечания по тексту или формату, пишите
👍5🤩2
📚 Продолжим чтение коммерческих статей, которые обещают нам светлое будущее! На этот раз статья от основателя компании Turso, её ген.дира Glauber Costa, "ИИ-агенты открывают новые возможности для масштабирования баз данных"

Пропущу вступление и сразу к сути, товарищ Глаубер и его команда разработали open-source альтернативу СУБД SQLite и назвали её turso. Написали всё на Rust и обвесили ее модными и современными фичами. Такими как:

1. Распределенность и глобальные реплики
2. Бессерверный/сетевой доступ (HTTP API)
3. Ветвление (Branching) как в Git
4. Встроенная аутентификация и безопасность
5. Автоматическое резервное копирование и HA


Проект выглядит интересным. Надо будет какой-нибудь НИР сделать по ней. Интересно её протестировать о понять перспективы.
📚 Разработчик баз данных ClickHouse привлекает $400 млн и приобретает стартап Langfuse, занимающийся наблюдением за искусственным интеллектом

Только недавно подводили итоги 2025 года, где ClickHouse привлек 350 млн долларов за целый год 👀! А тут, не прошло и месяца, а уже +400 🍋на счету (еще наверное минус налоги, но это не важно) 🤑. Неплохо начался год у коллег 💪

По поводу покупки:
Компания приобретает стартап Langfuse, разработавший opensource-инструмент для мониторинга больших языковых моделей. Его ПО помогает отслеживать работу LLM-приложений и анализировать причины «галлюцинаций».
...
Langfuse использует базу данных ClickHouse для хранения собираемой телеметрии LLM. После приобретения компания ClickHouse улучшит интеграцию между двумя продуктами.

Мне нравится такой подход 👍. Зачем выстраивать дружеские взаимоотношения к малыми компаниями, если их можно просто купить? В духе американского рынка 🎣🎏

p.s. оказывается есть об этом новость на Хабре.
Forwarded from MyDB
🔥 Alibaba представила open-source интеграцию DuckDB — AP-движок для аналитических запросов прямо в MySQL

Крупнейший китайский облачный вендор Alibaba открыл исходный код глубокой интеграции аналитической СУБД DuckDB в AliSQL (форк MySQL). Это позволяет запускать аналитические запросы (OLAP) в тысячи раз быстрее, чем на InnoDB, с полным сохранением MySQL-синтаксиса.

Проект доступен полностью в open source — разработчики и компании могут использовать, модифицировать и внедрять эту технологию самостоятельно, без привязки к облачным сервисам.

🛠 Как это работает:

DuckDB встроен как плагинный storage-движок в архитектуру MySQL. Аналитические реплики синхронизируются через бинарный лог (binlog), что обеспечивает согласованность данных и отказоустойчивость. Под капотом реализованы оптимизации:
- Пакетное выполнение транзакций
- Поддержка DDL через INPLACE / INSTANT или COPY - механизмы
- Многопоточная конвертация таблиц

📊 Производительность:

На тестах TPC-H SF100 DuckDB показал впечатляющие результаты — общее время выполнения 22 запросов:
DuckDB: 15.31 сек (в 1648 раз быстрее!)
InnoDB: 25 234.31 сек

🌐 Исходный код и документация:

Решение полностью открыто и доступно в репозитории AliSQL. Сообщество может изучать, использовать и развивать эту интеграцию.

👉 Репозиторий и подробная документация

#OpenSource #AliSQL #DuckDB #MySQL #OLAP #Database #Analytics #Alibaba #GitHub
👍2
Выжидание не самая лучшая тактика...

С пятницей!

#mems
😁2
📚 Database Trends and Applications Magazine: December 2025/January 2026 Issue

❗️Тема номера: Флагманы управления данными на 2026

Дисклеймер: традиционно разбираю только небольшой набор статей.

➡️Survey:Tracking the Diversification and Decentralization Revolution in Databases

Опрос посвящён текущим тенденциям и вызовам в области баз данных. И так:

📊Разнообразие и децентрализация
Организации не отказываются от существующих систем (например, Oracle), но активно расширяют экосистему. Большинство респондентов также используют SQL Server (59%), MySQL (45%), PostgreSQL (40%) и облачные решения (Amazon RDS — 28%). Где-то на задворках MongoDB

Забавно, что ИТ-ландшафт опрошенных компаний представляют различные реляционные СУБД. О NoSQL почти ничего не написали. Поставили только MongoDB ради приличия...

🤖 Спрос на интеграцию с ИИ
Более половины опрошенных стремятся к тесной интеграции баз данных с фреймворками машинного обучения и ИИ. Нехватка квалифицированных кадров для таких инициатив (52%) — ключевое препятствие.
Чем это напоминает хайп вокруг GO. Разработчики на GO буквально год или 2 назад могли смело претендовать на ЗП 200% и выше процентов от среднего по рынку. И эти ЗП давали. Сейчас такая же песня с ИИ-специалистами. Деньгами их осыпают весьма щедро! Думаю этот тренд сохранится еще несколько лет.

⚡️ Проблемы производительности
Производительность БД остаётся больной темой: 62% сталкиваются с проблемами ежемесячно или чаще, что напрямую влияет на продуктивность и доходы компаний.


☁️ Планы по переходу в облако
Сейчас 45% БД размещены локально, 37% — в облаке. В течение 3–5 лет доля облачных баз данных, по прогнозам, вырастет до 53%, а локальных — сократится до 30%. Однако гибридные среды останутся нормой.


Для РФ не могу сказать, что это статистика актуальна, ну, может быть.

🚧 Нехватка навыков
Помимо дефицита экспертов по ИИ, 24% организаций испытывают нехватку даже в базовых навыках управления базами данных, что усугубляется растущим разнообразием технологий.


Разработчики и администраторы по прежнему актуальные профессии.

➡️ Information Management Trends in the Year Ahead
Разберем тренды.
Спойлер: все тренды связаны с ИИ

1. Демократизация ИИ. ИИ-инструментария станет еще больше и он будет более доступный для всех сотрудников компании.
2. Предметные AI-агенты: Появятся автономные агенты, глубоко обученные для конкретных отраслей (например, здравоохранения или логистики), которые будут самостоятельно управлять, очищать и оптимизировать данные.
3. Цифровая рабочая сила: AI-агенты станут полноценными «сотрудниками» в организационной структуре компании, будут участвовать в проектах и вносить свой вклад.
Роботы начинают захватывать мир! Предвесники Скайнет (с)

➡️When the Cloud Comes Home: What DBAs Need to Know About Cloud Repatriation

Статья рассказывает о феномене репатриации из облака (cloud repatriation) — обратном перемещении рабочих нагрузок из публичного облака обратно в локальную инфраструктуру
Основные причины возврата данных "домой":
💵 Непредвиденные расходы:
⚡️ Производительность и задержки (Latency):
🛡 Контроль и соответствие нормам (Compliance):
Да, тоже стал участником подобных событий. Некоторые заказчик обратно переезжают на on-prem инсталляции.
Точных причин я не знаю. Могу только предположить, что это оказалось дороже и случилось некое разочарование в оперативной техподдержке. Это лишь предположение.
3
📚Решил немного полисать книжку
Основы инженерии данных: как создавать надёжные системы обработки данных, 2024 год, ISBN 978-601-08-4116-1

Хотелось побольше узнать о понятии инженерии данных и кто такой этот инженер данных. Не хочу приводить определение из книги, поэтому покажу такой вариант:
Data Engineer строит “фабрику данных” и отвечает за то, чтобы она работала.

В целом, это человек, который настраивает и внедряет платформу данных и следит, чтобы данные успешно передавались от компонента к компоненту.
Инженерия данных — дисциплина про построение и эксплуатацию надёжных систем обработки данных


❇️Общее впечатление от книги
Впечатление двойственное. С одной стороны, книга аккуратно раскладывает профессию на жизненный цикл и фоновые процессы и даёт много здравых идей, а с другой, она говорит языком архитектуры и принципов, высоких материй и т.п. Мне бы хотелось больше “бытового” уровня: типовых кейсов, ошибок, компромиссов и примеров решений. Получается, что ты понимаешь слова и фразы, но не всегда очевидно, а зачем это знать? В итоге книга оставляет хорошую теоретическую рамку, но требует параллельной практики или примеров, иначе легко запутаться.

Короче, мне нужна книга "Инженерия данных для чайников" 🤓. Есть такая? 🤪

p.s. конечно можно на курсы сходить, но это совсем другая история

❇️Выделю несколько тезисов

👉 Жизненный цикл инженерии данных: Это центральная концепция книги, включающая пять стадий: генерация, хранение, поглощение, преобразование и предоставление данных. Эти 5 стадий сквозят через всю книгу.

👉 Принципы «качественной» архитектуры: Хорошая система должна быть масштабируемой, слабосвязанной, безопасной и экономически оптимизированной (FinOps).

👉 Технологии выбирают после архитектуры

👉 Эволюция хранения и поглощения: Разбираются различия между пакетной и потоковой обработкой, а также современные концепции хранилищ (Data Lake, Data Warehouse, Data Lakehouse)

👉 Понимание источников (схема, форматы, время события, ограничения прод-систем) заранее задаёт границы качества и SLA всего конвейера

👉 Хранение — ключевой архитектурный рычаг: lake/warehouse/lakehouse, compute–storage, кеширование и экономические компромиссы.

👉 Моделирование и трансформации превращают данные в продукт: выбор модели (Кимбалл/Инмон/Data Vault и др.), управляемые конвейеры ETL/ELT и контроль производительности запросов

👉 Безопасность и приватность — сквозной процесс: начинать нужно с людей и процедур (least privilege, управление учётками/секретами), затем — технологии (шифрование, патчи, мониторинг).

👉 Будущее смещается к real-time и “данным в продукте”: меньше ручных отчётов, больше автоматизированных действий и потоковых контуров.

🤯 Понавыдумавали кучу терминов, Data Engineer, Data Warehouse Analyst, DataOps, Data Scientist. И еще сборку Data Quality. Жесть какая-то 🤬. Кто за что отвечает знают только в БигТехе. В остальных компаниях всё это размывается на 2-3-х человек.
👍4😁1