Forwarded from tl;dr data
Apache Airflow 3.3.0: Stateful Tasks and Multi-Language Support
В Airflow 3.3 появился AIP-108 — Language Task SDK. Теперь отдельные tasks можно реализовывать на Java или Go, при этом сам DAG и scheduling остаются в Python.
В DAG задача объявляется как stub:
Дальше Airflow через Coordinator передает выполнение нужному runtime: JavaCoordinator для JVM или ExecutableCoordinator для Go.
При этом задача остается частью Airflow: доступны XCom, Variables, Connections, retries и стандартный logging.
Это особенно интересно для команд, где orchestration построен на Airflow, а часть production-кода уже написана на Java или Go. Теперь такую логику не обязательно переписывать на Python или выносить за пределы task model Airflow.
Пока Language Task SDK — experimental feature, поэтому API и protocol еще могут меняться.
Документация
@tldr_data
В Airflow 3.3 появился AIP-108 — Language Task SDK. Теперь отдельные tasks можно реализовывать на Java или Go, при этом сам DAG и scheduling остаются в Python.
В DAG задача объявляется как stub:
@task.stub(queue="golang")
Дальше Airflow через Coordinator передает выполнение нужному runtime: JavaCoordinator для JVM или ExecutableCoordinator для Go.
При этом задача остается частью Airflow: доступны XCom, Variables, Connections, retries и стандартный logging.
Это особенно интересно для команд, где orchestration построен на Airflow, а часть production-кода уже написана на Java или Go. Теперь такую логику не обязательно переписывать на Python или выносить за пределы task model Airflow.
Пока Language Task SDK — experimental feature, поэтому API и protocol еще могут меняться.
Документация
@tldr_data
👍6 5 1
В Airflow теперь можно запустить java-scala приложения нативно
Например - скрипты поддержки Iceberg таблиц, так как много функционала нет в pyiceberg.
При этом эта ява сможет пользоваться xcom, кредовым волтом, правильно ретраиться и по всем параметрам будет полноценной аэрфлошной джобой а не БашОператором, о котором движок АФ ничего не знает.
Например - скрипты поддержки Iceberg таблиц, так как много функционала нет в pyiceberg.
При этом эта ява сможет пользоваться xcom, кредовым волтом, правильно ретраиться и по всем параметрам будет полноценной аэрфлошной джобой а не БашОператором, о котором движок АФ ничего не знает.
👍6❤1 1
Когда нанимаешься руководителем в большую сформированную команду - это как садиться доигрывать шахматную партию за кем-то другим.
Приходится угадывать, почему фигуры стоят вот так и в чем был замысел. Насколько этот замысел хорош и стоит ли его развивать.
И да, доигрывать выигрышную партию тебя никто не позовет. Выигрышную Доиграют сами.
А в гринфилд проекте начинаешь играть с е2-е4, это проще.
Приходится угадывать, почему фигуры стоят вот так и в чем был замысел. Насколько этот замысел хорош и стоит ли его развивать.
И да, доигрывать выигрышную партию тебя никто не позовет. Выигрышную Доиграют сами.
А в гринфилд проекте начинаешь играть с е2-е4, это проще.
😁18🔥11👍6👏1💯1🤝1
Об этапах собеса
В процессе рекрутмента большой компании обязательно должен быть какой-нибудь кринж этап.
Пусть кандидата на инженера данных собесит мобильный разработчик. И качает головой на незнание дата инженером архитектуры мобильного фронта и его фреймворков. Или ДБА цокает языком на незнание особенностей настройки редиса и монго. Сюда же систем дизайны всех видов, размеров и форм.
На вопрос кандидата, что это такое и зачем все это, нужно отвечать только то, что так сложилось и такие у нас процессы. Мы-де люди маленькие, нам сказали сделать, мы и делаем.
Зачем на самом деле? Очень просто - вам нужно отсекать людей, неустойчивых к корп маразму. И не восприимчивых к аргументам, что «так положено».
Все равно такие у вас долго не протянут, так и смысл их нанимать.
В процессе рекрутмента большой компании обязательно должен быть какой-нибудь кринж этап.
Пусть кандидата на инженера данных собесит мобильный разработчик. И качает головой на незнание дата инженером архитектуры мобильного фронта и его фреймворков. Или ДБА цокает языком на незнание особенностей настройки редиса и монго. Сюда же систем дизайны всех видов, размеров и форм.
На вопрос кандидата, что это такое и зачем все это, нужно отвечать только то, что так сложилось и такие у нас процессы. Мы-де люди маленькие, нам сказали сделать, мы и делаем.
Зачем на самом деле? Очень просто - вам нужно отсекать людей, неустойчивых к корп маразму. И не восприимчивых к аргументам, что «так положено».
Все равно такие у вас долго не протянут, так и смысл их нанимать.
😁20👍7😨3 3
Forwarded from Архитектор Данных
Media is too big
VIEW IN TELEGRAM
01:15 - Улучшаем производительность нативного движка Spark
05:10 - Как исполняется код на Spark под капотом и его узкие места
08:45 - Векторизованная модель исполнения кода
10:39 - Comet - движок поверх Dafafusion + Arrow
27:10 - Интеграция Comet - Iceberg
31:36 - Как включить векторизованный движок при чтении Iceberg-Parquet
05:10 - Как исполняется код на Spark под капотом и его узкие места
08:45 - Векторизованная модель исполнения кода
10:39 - Comet - движок поверх Dafafusion + Arrow
27:10 - Интеграция Comet - Iceberg
31:36 - Как включить векторизованный движок при чтении Iceberg-Parquet
👍1
Упоминаемый движок Apache Comet дорос до версии 1.0.0
Что он делает - меняет среду исполнения внутри Spark с JVM на Rust без переделки прикладного кода джобов
https://datafusion.apache.org/blog/output/2026/08/07/datafusion-comet-1.0.0/
Что он делает - меняет среду исполнения внутри Spark с JVM на Rust без переделки прикладного кода джобов
https://datafusion.apache.org/blog/output/2026/08/07/datafusion-comet-1.0.0/
Двух рабочих на стройке спросили: Что ты делаешь?
Один ответил: Таскаю бревна, укладываю кирпичи.
Другой сказал: Я строю храм.
—————————————————
Каков он, Храм, который ты строишь?
Один ответил: Таскаю бревна, укладываю кирпичи.
Другой сказал: Я строю храм.
—————————————————
Каков он, Храм, который ты строишь?
🔥10 4❤2
Новости бигдаты
Пишут, что бигдата добралась до курочек. Теперь всех пересчитают и всех каталогизируют. Кроликов и пчел год назад уже пересчитали
Еще сегодня Перекресток меня попросил пачку чипсов через Честный знак прокатить.
Растут наши возможности по управлению народным хозяйством!
Пишут, что бигдата добралась до курочек. Теперь всех пересчитают и всех каталогизируют. Кроликов и пчел год назад уже пересчитали
Еще сегодня Перекресток меня попросил пачку чипсов через Честный знак прокатить.
Растут наши возможности по управлению народным хозяйством!
Telegram
Наталья Касперская
Здравствуйте, дорогие друзья! День знаний отодвинул на второй план любопытную новость из сельской жизни и цифровизации. С 31 августа все жители нашей страны, у кого в хозяйстве завелось более десяти птиц, должны будут их зарегистрировать в Россельхознадзоре.…
Media is too big
VIEW IN TELEGRAM
Посмотрите видео чтобы почувствовать атмосферу типичного технического пресейла
😁7💯3🤷♂2😨1
Forwarded from Клуб CDO
Дайджест статей
📰 Beyond the Dashboard (Booking.com)
🔗 https://medium.com/booking-com-development/beyond-the-dashboard-accelerating-real-time-intelligence-in-the-age-of-ai-6f1f0f9c123f
💡 «Talk to your data» переносит узкое место с дашбордов на семантический слой: определения под MR с двумя аппрувами, отдельный warehouse с таймаутами для агентов. Без этого conversational BI дороже статического.
📰 Data Lakehouse по-русски
🔗 https://habr.com/ru/articles/1073884/
💡 Lakehouse оправдан только под измеримую дорогую проблему, а не под импортозамещение. Семь проблем, которые платформа не решает, три подхода к миграции. Обзор вендоров - по их же данным.
📰 Аналитика начинается не с дашборда
🔗 https://habr.com/ru/articles/1076978/
💡 Отчёт проектируется от карточки решения (кто смотрит, что сравнивает, что делает дальше), таблица с пропусками раньше диаграммы. Эффект автор не измерял.
📰 Как мы искали способ подключить ИИ к своим данным
🔗 https://habr.com/ru/articles/1074406/
💡 Для точных цифр из кубов MCP лучше RAG; каждое число обязано иметь источник в вызове инструмента или Run Code. Воспроизводимый стенд Ollama + Gemma4 + LibreChat. Источник данных - продукт авторов.
📰 Учим ИИ готовить датасеты для BI Битрикс24
🔗 https://habr.com/ru/companies/bitrix/articles/1074452/
💡 Модель не пишет SQL, а выбирает ключи из каталога разработчика; сервер перепроверяет. Паттерн «каталог как источник правды + идемпотентная публикация с _v2» переносим. DevRel-контент, код открыт.
📰 Почему мы месяц копаемся в данных, прежде чем подключить ИИ
🔗 https://habr.com/ru/articles/1074878/
💡 Rule-based → ML → LLM: детерминированный слой даёт результат сразу и копит лейблы через вердикты человека. Подрядчика оценивать по работе с происхождением данных.
📰 Многоуровневая память агентов в VK AI Space
🔗 https://habr.com/ru/companies/vk/articles/1074798/
💡 Память как Markdown вместо векторной БД ради читаемости и compliance; инъекция через pre-hook вместо on-demand экономит токены. Вендорский текст, компромиссы описаны честно.
📰 Снова хороним BI. Из гроба стучит
🔗 https://habr.com/ru/articles/1075946/
💡 Переносимой точности дата-агентов нет: смена диалекта режет Spider 2.0 вдвое, эталоны ошибочны в 53–66%, Anthropic без skills 21%, с ними 95%, без сопровождения 65% за месяц. Минимум: один домен, 20–50 evals из провалов, доки в том же PR, права до кода. Ключевой материал набора.
📰 Автономность ИИ-агентов в аналитике (перевод Pol Martí)
🔗 https://habr.com/ru/articles/1075472/
💡 Автономность задаётся силой проверок: упал data quality check - агент уходит в propose-only, радиус ошибки считается по lineage. Контролёры сами входят в failure surface.
📰 Self-service BI с ИИ: свобода или хаос (Диасофт)
🔗 https://habr.com/ru/companies/diasoft_company/articles/1075918/
💡 LLM сняли ограничение на скорость дашборда, но не на качество данных; компромисс - проверяемые артефакты как код. Вендорский текст, оценки «80% дашбордов - Excel» и «своя GPU в 5–10 раз дороже» не подтверждены.
📰 Beyond the Dashboard (Booking.com)
🔗 https://medium.com/booking-com-development/beyond-the-dashboard-accelerating-real-time-intelligence-in-the-age-of-ai-6f1f0f9c123f
💡 «Talk to your data» переносит узкое место с дашбордов на семантический слой: определения под MR с двумя аппрувами, отдельный warehouse с таймаутами для агентов. Без этого conversational BI дороже статического.
📰 Data Lakehouse по-русски
🔗 https://habr.com/ru/articles/1073884/
💡 Lakehouse оправдан только под измеримую дорогую проблему, а не под импортозамещение. Семь проблем, которые платформа не решает, три подхода к миграции. Обзор вендоров - по их же данным.
📰 Аналитика начинается не с дашборда
🔗 https://habr.com/ru/articles/1076978/
💡 Отчёт проектируется от карточки решения (кто смотрит, что сравнивает, что делает дальше), таблица с пропусками раньше диаграммы. Эффект автор не измерял.
📰 Как мы искали способ подключить ИИ к своим данным
🔗 https://habr.com/ru/articles/1074406/
💡 Для точных цифр из кубов MCP лучше RAG; каждое число обязано иметь источник в вызове инструмента или Run Code. Воспроизводимый стенд Ollama + Gemma4 + LibreChat. Источник данных - продукт авторов.
📰 Учим ИИ готовить датасеты для BI Битрикс24
🔗 https://habr.com/ru/companies/bitrix/articles/1074452/
💡 Модель не пишет SQL, а выбирает ключи из каталога разработчика; сервер перепроверяет. Паттерн «каталог как источник правды + идемпотентная публикация с _v2» переносим. DevRel-контент, код открыт.
📰 Почему мы месяц копаемся в данных, прежде чем подключить ИИ
🔗 https://habr.com/ru/articles/1074878/
💡 Rule-based → ML → LLM: детерминированный слой даёт результат сразу и копит лейблы через вердикты человека. Подрядчика оценивать по работе с происхождением данных.
📰 Многоуровневая память агентов в VK AI Space
🔗 https://habr.com/ru/companies/vk/articles/1074798/
💡 Память как Markdown вместо векторной БД ради читаемости и compliance; инъекция через pre-hook вместо on-demand экономит токены. Вендорский текст, компромиссы описаны честно.
📰 Снова хороним BI. Из гроба стучит
🔗 https://habr.com/ru/articles/1075946/
💡 Переносимой точности дата-агентов нет: смена диалекта режет Spider 2.0 вдвое, эталоны ошибочны в 53–66%, Anthropic без skills 21%, с ними 95%, без сопровождения 65% за месяц. Минимум: один домен, 20–50 evals из провалов, доки в том же PR, права до кода. Ключевой материал набора.
📰 Автономность ИИ-агентов в аналитике (перевод Pol Martí)
🔗 https://habr.com/ru/articles/1075472/
💡 Автономность задаётся силой проверок: упал data quality check - агент уходит в propose-only, радиус ошибки считается по lineage. Контролёры сами входят в failure surface.
📰 Self-service BI с ИИ: свобода или хаос (Диасофт)
🔗 https://habr.com/ru/companies/diasoft_company/articles/1075918/
💡 LLM сняли ограничение на скорость дашборда, но не на качество данных; компромисс - проверяемые артефакты как код. Вендорский текст, оценки «80% дашбордов - Excel» и «своя GPU в 5–10 раз дороже» не подтверждены.
Medium
Beyond the Dashboard: Accelerating Real-Time Intelligence in the Age of AI
When an urgent request for a report or dashboard arrives, often just before an executive meeting, data and engineering teams must drop…
❤8👍3🔥2 1
Все дата инженерные проблемы обычно решаются дополнительным тестированием данных
Кроме одной - избыточного тестирования данных
Кроме одной - избыточного тестирования данных
😁13👾3 3 2 1
Больше всего удивляют люди, которые в жизни общаются языком корпоративных писем.
«В рамках», «привлечь», «проработать задачу», «выстроить процессы».
Камераден, нас никто не видит, объясни нормально, что ты хочешь. И вообще мы в баре, работа кончилась час назад.
Язык партсобраний поражает слабых разумом.
«В рамках», «привлечь», «проработать задачу», «выстроить процессы».
Камераден, нас никто не видит, объясни нормально, что ты хочешь. И вообще мы в баре, работа кончилась час назад.
Язык партсобраний поражает слабых разумом.