Инжиниринг Данных
23.7K subscribers
2.28K photos
64 videos
194 files
3.35K links
Делюсь новостями из мира аналитики и карьерными советами.

15 лет в Аналитике и Инжиниринге Данных, 10 лет в MAANG

🛠️ dataengineer.ru | 🏄‍♂️ Surfalytics.com

№5017813306

Реклама:
https://almond-rule-130.notion.site/1199f595f76a8030ba1be1e607c9a8ce
Download Telegram
Data Driven 2026: аналитика встречается с AI-инфраструктурой

26 сентября Яндекс отмечает десятую, юбилейную Data Driven — и в этот раз конференция заходит на нашу территорию: AI-ready-данные, инфраструктура под агентов и главный вопрос сезона — а можно ли вообще доверять тому, что насчитал AI-агент?

Кого слушать:
— Роман Халкечев (CDO Поисковых сервисов и ИИ Яндекса) — расскажет о том, как AI переписывает правила игры при работе с данными, меняет способ принятия решений в компании и трансформирует профессии аналитика и дата инженера;

— Олег Хомюк (CDO Яндекс Поиска) — как объективно измерить качество AI-агентов и инфраструктуры AI-ready-данных;

— Артём Солоухин (зам. руководителя ML и инновационных инструментов Центральной аналитики) — покажет MARS, первую мультиагентную рабочую среду в Яндексе;

— Максим Стаценко (руководитель BigData Tech & Research Центральной аналитики) — расскажет, как собрать агента-аналитика, которому реально можно доверять.

Плюс дискуссии, стенды с экспертами, нетворкинг и афтерпати в честь 10-летия — будет шумно.

📍Москва + онлайн, 26 сентября. Мест офлайн ограниченное количество

Регистрируйтесь по ссылке: https://events.yandex.ru/events/data-driven-2026

Новости конференции: t.me/Data_Driven_Yandex
1⚡4❤‍🔥3
Я всегда рад, когда люди находят работы и прокачиваются. Но рад в тройне, когда попадают в Клуб 500 🤑
Please open Telegram to view this post
VIEW IN TELEGRAM
1❤‍🔥47🫡8⚡3🌚3👨‍💻1🙈1
У нас все готово, если вы вдруг решили зайти к нам на meetup
❤‍🔥20🍌6⚡2💯1
На выходных Сергей провел воркшоп про развертывание Metabase BI на AWS ECS. Он все сделал полностью в ручную. Ни один токен AI не был потрачен.

Вообще ECS это главный контейнер сервис для хостинга любых Open Source решений для BI, ETL, ML, Streaming. Есть много альтернатив, о чем важно знать, но знать ECS/ECR must have.

https://youtu.be/guMdPaIqp3U

PS В след раз мы посмотрим на Airflow 3.1 на ECS.
1⚡25❤‍🔥7
Как сегодня строят рекомендательные системы — и что будет с ними завтра?

30 сентября собираем RecSys-сообщество — разработчиков, ML/DS-специалистов и всех, кто делает персонализацию и рекомендации в реальных продуктах.

В программе — доклады от экспертов Сбера. Поговорим о свежих подходах и нестандартных решениях на реальных кейсах.

А после докладов переключаемся на неформальный режим: знакомимся, спорим про RecSys, обсуждаем идеи, находим единомышленников и просто хорошо проводим вечер среди своих.

📍г. Нижний Новгород, пространство «Гараж»

Количество мест ограничено — успей забрать своё по ссылке!
В Surfalytics придумал новую полезную фичу - mock собеседование system design перед реальным собеседованием. На вход у меня есть описание вакансии и вместе с ИИ я составлю примерную архитектуру и решения, которые использует компания и дальше уже провожу собеседование, которое максимально приближено к кейсам компании (к кейсам описания вакансии)

Провели про AWS System Design, где подсветили несколько советов и решений.

https://youtu.be/2gTo-mdTBQw?si=xG_2Qhy_th-IxwsO
❤‍🔥40⚡6🫡2🌚1
Последние пару недель я ковырял Azure Databricks с Claude Code.

Как известно у Databricks есть Unity каталог и много enterprise фич. А еще в Enterprise хотят использовать No Public Network и No Public IP, то есть все наглухо закрыто, даже между средами разработки.

Код инфраструктуры и declarative pipelines живет в Azure DevOps Repos и Pipelines.

Это какой-то enterprise стандарт по Microsoft, для тех кто любит страдать на работе.

Обычно с Claude я могу сделать что-угодно очень быстро в Airflow, Snowflake, dbt и других популярных решениях.

Но уже 3 недели я бьюсь с тем что есть, чтобы сделать так как надо мне. Он конечно делает, но какой ценой…

Любое изменение напоминает историю «хвост подняли, голова утонуло».

Я очень разочаровался в Databricks, нах@@вертили фич, да еще им название меняют каждые пол года, что даже лучшие LLM не справляются.

PS из интересного разобрался как запустить Claude Code если у вас нет прав админа и все API закрыты для всех LLM.

Решение оказалось через использование VMFusion на маке с Windows 11 ARM, настройки proxy в VSCode на локальный трафик для LLM. А потом можно делать enrolment этой VM и уже админские права не нужны. Такое решение подойдет для всех у кого можно делать Bring your own device и enrolment.
🌚13🫡11💯2🤷2
На LinkediIn есть небольшой бесплатный курс (временно) - Build with AI: SQL AI Agents in Production

На примере SQL задачек автор использует AI агентов вместе с различными методами.

Я его не смотрел, но посмотрю, всего 1,5 часа.

Мне понравилась идея посмотреть его, чтобы понять, что можно в свое резюме закинуть, чтобы рассказывать как мы с SQL строим космические корабли делаем AI.
⚡18❤‍🔥1💯1
Стоимость data stack растёт на границах между его компонентами

Когда загрузка, хранение, обработка и визуализация реализованы в отдельных системах, data-команда поддерживает не только сами инструменты, но и обмен между ними. Изменение источника, схемы данных или способа расчета затрагивает сразу несколько интеграций.

DataLens Platform объединяет основные этапы работы с данными. В основе находится lakehouse на S3 и Apache Iceberg. Trino отвечает за интерактивные запросы, Spark — за ресурсоемкие преобразования, Airflow — за оркестрацию процессов.

На уровне всей платформы работают каталог метаданных и общая модель доступа. Хранение и вычисления масштабируются отдельно.

ИИ-помощник становится еще одним способом использовать подготовленные данные: он помогает исследовать их, формировать SQL-запросы и строить визуализации.
⚡7🙈6🌚5❤‍🔥3🍌3🙉2🐳1
AI конечно уже не тот;

У нас накопилось много ценной информации в Discord про лучшие практики поиска работы. Я настроил Airflow и DuckLake, чтобы вытащить всю историю и на базе нее сделать курс.

AI говорит “ай яй яй”, наверно это комплимент, ведь по честному работу практически не найти
🌚18⚡6
Наконец-то могу сказать, что накопленная дата имеет ценность. За 3 года (вот время летит-то) в Surfalytics в Discord мы накопили много ценных советов по поиску работы, резюме и тп. Это огромный объем информации и вручную сложно в нем ковыряться, но с помощью ИИ можно сделать ценный easy-going курс с примерами и цитатами.
❤‍🔥31⚡2
Как понять, что агенты в команде реально заработали

Эффект от AI-агента распределен по сотне мелких задач: SQL тут, дашборд там, презентация, ответ продакту. В новом выпуске «Доверительного интервала» аналитики Яндекса рассказали, как они это измеряют у себя.

Схема такая:

— основные метрики — adoption (доля аналитиков, которые пользуются инструментами) и время сессий с агентами;
— взяли топ-10 самых активных пользователей;
— их средние показатели сделали целевым ориентиром для остальной команды.

И adoption здесь не самоцель, а важная практика на старте внедрения ИИ: сначала нужно, чтобы им начали пользоваться, и только потом смотреть на эффект. Ориентир при этом понятный и достижимый — это не абстрактная планка сверху, а уровень, которого коллеги уже добились на практике. 

Из выпуска еще понравился пример «антиобучения» для менеджеров: им показали, как данные без описания приводят к неверным выводам, а затем — как выглядит корректная работа с хорошо описанной таблицей. Чтобы менеджеры могли самостоятельно получать ответы на свои вопросы, для них собирают набор проверенных SQL-запросов и каталог метрик. При этом результаты всё равно проходят проверку у аналитиков.

Открытый вопрос на следующие кварталы ставят так: как строить валидацию, когда self-service уйдёт в массы. Рабочая страховка на сегодня простая: результат агента всегда проверяет аналитик, а ответственность за вывод остаётся на человеке.
❤‍🔥7🙈6⚡1👨‍💻1
Вы уже слышали про новую фронтир-модель Jev?

Чтобы лучше понять, для чего она нужна и как её использовать, можете посмотреть видео Jev will 10x your Claude Code.

Мне понравилось, как автор ссылается на книгу "Думай медленно, решай быстро" Даниэля Канемана.

Jev — это система 1, она максимально быстро выдаёт ответ, но ответ простой: не текст, а типизированное решение (choice, score или noul/вероятность), выбранное из заранее заданных вами вариантов, с калиброванной вероятностью уверенности.

Она не рассуждает пошагово и не пишет объяснений — просто мгновенно "судит" ситуацию, как человек делает быструю интуитивную оценку

Система 2 — это традиционные модели, такие как Claude и ChatGPT.

Они рассуждают токен за токеном, могут писать код, объяснения, вести диалог, но делают это медленнее и дороже.


Если вы уже работали с моделями Claude, то принцип использования Jev будет понятен: модель очень крутая и недорогая, и она может сильно улучшить бизнес-приложения там, где нужны быстрые типовые решения, а не генерация текста.

Из видео и связанных материалов можно выделить такие use cases:

Компактификация контекста в Claude Code — Jev оценивает вывод инструментов (Bash, Read, Grep и т.д.) на релевантность текущей задаче и решает, что оставить, а что сжать/удалить перед отправкой в основную модель, экономя контекстное окно;

Роутинг моделей и уровня "мышления" — Jev определяет сложность задачи и выбирает, какую модель (или режим reasoning) использовать для конкретного запроса в Claude Code / Codex, снижая расходы (сообщается о снижении затрат примерно на 60% в одном из проектов)

Ревью кода — многоэтапный ревьюер, где Jev оценивает корректность, безопасность, надёжность, совместимость и риск тестов, назначает уровень серьёзности и предлагает ревьюера — без использования генеративной модели;

Защита агентов (guard) — Jev выступает в роли фильтра против prompt injection и опасных действий для Claude Code, Codex, Pi и других агентов

Быстрый супервизор — Jev управляет более медленными кодинг-агентами (например, Codex), принимая решения по тикетам, спецификациям и багрепортам;

Веб-агенты и браузерная автоматизация — например, агент для поиска авиабилетов, где Jev быстро решает, на какую кнопку нажать и куда перейти дальше;

Real-time приложения — благодаря задержке около 150 мс, решения Jev можно встраивать в игры (в одной из демонстраций Jev в реальном времени играет в Doom);

Map-Reduce поверх больших данных — благодаря низкой стоимости можно классифицировать огромные объёмы данных, искать релевантную информацию в больших корпусах или извлекать признаки для предсказаний.


Jev не бесплатный. Я к себе еще не добавил, так как у меня нет проблем с токсинами Claude. Но очень интересно, если качество возрастет, и я склоняюсь его добавить для факт-чекинга и для code review.

Пробовали уже?
И еще одно видео по теме Jev CEO: I made ChatGPT, now I'm building what's next, оно датировано 1 июля 2026 года, еще до релиза Jev.

В нем очень хорошо рассказывают про проблемы с современными моделями - "Why do all LLMs require a human in the loop? The simple answer is we literally put them in the loop" — то есть человек буквально был встроен в процесс обучения
через RLHF (Reinforcement Learning from Human Feedback).

Логика RLHF проста: собрать человеческие предпочтения о том, какие ответы модели нравятся людям, а затем оптимизировать модель так, чтобы она давала ответы, которые получают высокую оценку по этим предпочтениям. Цель этого цикла — понравиться человеку, а не автономно и надёжно выполнить программный процесс без присмотра.

Отсюда вытекает ключевая проблема: модели, обученные через RLHF, отлично умеют "выглядеть правильными" (look right), но это не то же самое, что "быть правильными" (be right). Алмейда прямо называет это дизайн-фичей, а не багом: "overpromising is a feature, this is by design" — модель обучена звучать уверенно независимо от того, насколько она права, потому что именно уверенные и убедительные ответы получают более высокую оценку от людей-разметчиков.

Вместо RLHF, Jev обучается новым методом — RLCD (Reinforcement Learning for Calibrated Decisions). Цель этого метода — не понравиться человеку, а научить модель выдавать эпистемически честные, калиброванные вероятности: если модель говорит "70% уверенности", это должно реально означать, что она права в 70% подобных случаев


Благодаря этому Jev не генерирует текст, а выдаёт типизированные решения (choice, score, noul) с прикреплённой откалиброванной вероятностью, которые код может использовать напрямую — без человека, проверяющего каждый вывод. Разработчик сам задаёт порог уверенности: если вероятность выше порога — программа выполняет действие автоматически; если ниже — передаёт решение человеку. Так неопределённость становится управляемым параметром программы, а не источником непредсказуемого поведения.


Надеюсь вам стало понятней, как и мне.

Думаю в скором времени у Anthropic и OpenAI появятся свои модели System 1 и нам не нужно будет в ручную строить решения, как в прошлом посте.