Data Engineering / Инженерия данных / Data Engineer / DWH
2.67K subscribers
60 photos
7 videos
54 files
375 links
Data Engineering: ETL / DWH / Data Pipelines based on Open-Source software. Инженерия данных.

DWH / SQL
Airflow / Python / ETL / dbt / Spark
AI Agents

Рекламу не размещаю
Вопросы: @iv_shamaev | datatalks.ru
Download Telegram
AI Agent Engineer Roadmap

Некоторое время назад начал накидывать через claude импровизационный roadmap по разработке ai agents. Исходная цель: быстро вникнуть в особенности и архитектуру решений для применения в работе. В целом уже что-то можно почитать и изучить.

По проектам пока не уверен, что именно будет (и будет ли).

https://datatalks.ru/ai-agents/
12🔥9👏1
🤖 opencode: Учимся создавать виртуальные команды из агентов для Data-проектов 🚀

Делюсь небольшой инструкцией по OpenCode — инструменту, который можно использовать не просто как CLI, а как полноценный слой настройки проекта для работы с агентами, ролями, правилами и workflow 👇

За основу я взял демо-пример, где OpenCode + ChatGPT использовались для создания проекта с аналитическим стеком.
Сразу оговорюсь: в самом проекте не было четкой постановки задачи 🎯 Делал быстрые наброски, чтобы понять как настраивать opencode и какая у него структура.

Что попало в инструкцию:
как правильно оформить проект
где и что писать
как задавать правила для агента
как подключать роли, skills и спецификации
как сделать так, чтобы агент работал не “с нуля”, а в контексте вашей команды

Что оказалось особенно ценным 💡
OpenCode становится по-настоящему полезным, когда воспринимаешь его не как “чатик в терминале”, а как часть инженерной инфраструктуры проекта.

То есть важно не только запустить tool, но и продумать:
📌 AGENTS.md — как проектный контракт
📌 opencode.json — как control plane для правил, инструментов и разрешений
📌 .opencode/agents/ — для role-based subagents
📌 .opencode/skills/ — для повторяемых playbooks
📌 docs/specs/ — для устойчивых спецификаций, на которые может опираться агент

В итоге получается интересный подход:
можно собирать “виртуальную команду” из агентов под data-проект — например, выделять роли аналитика, архитектора, infra-инженера, а также задавать им понятные зоны ответственности 🧩

Мне кажется, это особенно полезно тем, кто хочет:
— структурировать AI-работу в репозитории
— выстроить понятные правила для агентов
— сделать процесс воспроизводимым для команды
— использовать AI не только для генерации кода, но и для организации инженерного процесса ⚙️📊
👍11🔥6🤝41
Какая же жиза)
😁15🤣10👍1👏1🤨1
Готов проект по 2 модулю AI Agents — research-agent

Репозиторий: https://github.com/ivanshamaev/research-agent

Изначальная цель заключалась в том, чтобы на простом примере пройти весь цикл взаимодействия: как оркестратор общается с LLM, как агент выбирает инструменты, как возвращаются результаты вызовов, где хранится состояние и в какой момент всё это собирается в итоговый отчёт.

В процессе реализации исходный описанный концепт во 2 модуле изменился. Плюс вместо 1-2 двух llm моделей добавились open-source варианты. И самое важное - добавил gatellm.ru, на котором и протестировался (не реклама, первое что попалось со стартовым балансом на тест).

В итоге получился CLI-агент, который:
- ищет материалы по теме,
- загружает и обрабатывает страницы,
- суммаризирует найденное,
- собирает результат в структурированный markdown-отчёт с источниками (здесь пока что бага, на днях доработаю).

В проекте есть подробная документация со схемами. Для тех, кто хочет разобраться в том, как создать свой агент - welcome:
- как выглядит ReAct-цикл на практике,
- зачем нужен tool registry,
- где проходит граница между orchestration и tools,
- и т.д.

Агент написан и отлажен за 1 час с помощью claude code (с учетом переделки части модулей и поиска api llm для тестов).

👉🏻 В репозитории есть docs, в которых разложена реализация.
👍15👏3🤝2
По Trino 479 документации https://datatalks.ru/trino-docs/ переведены все разделы + добавлена информация по dbt
🔥30👍83👏2😁1
Data Engineering AI Agent Skills - экспериментальный набор скиллов для агентной разработки и построения Agentic Data Platform.

https://datatalks.ru/de-ai-agent-skills/

Скиллы все в открытом доступе https://github.com/ivanshamaev/de-agent-skills
🔥14👍6👏21🗿1
Тестовый пример реализации MCP Server на Go для OpenCode

▫️Есть набор specs для написания через агентов с нуля MCP Server (теоретически можно реализовать mcp для взаимодействия с любым ПО)
▫️Сгенерирована документация по разработке MCP Server (GitHub Pages)

Сам бинарник возвращает из Яндекс метрики список счётчиков (был под рукой api). Основная цель - понять как реализовать свой mcp для взаимодействия с opencode, как собрать бинарник.

🔗 Исходный код, документация и готовые бинарники доступны в репозитории: https://github.com/ivanshamaev/mcp-server

🔗 Краткая документация по разработке MCP: https://ivanshamaev.github.io/mcp-server/
🔥3👍2👏21
🚀 Перевод книги «Architecting an Apache Iceberg Lakehouse» на русский язык.

Если вы хотите разобраться, что такое Lakehouse, эта книга — отличная отправная точка. В ней последовательно разбираются:

• чем Lakehouse отличается от Data Lake и Data Warehouse;
• почему появились открытые табличные форматы (Iceberg, Delta Lake, Hudi);
• ACID-транзакции, schema evolution, time travel и другие ключевые возможности современных платформ данных;
• архитектурные принципы и практические сценарии применения Lakehouse.

📖 Читать перевод:
https://aitech720.github.io/lakehouse/

#DataEngineering #Lakehouse #ApacheIceberg #DeltaLake #DataArchitecture #BigData
👍47🔥1👏1
🆕 PySpark нейролекции

Возможно кому-то поможет в освоении PySpark. С одной стороны нейрослоп и повторы между лекциями, с другой стороны некоторые концепции хорошо прописаны.

Раздел с подготовкой к интервью собирался с разных сайтов и материалов.

https://datatalks.ru/pyspark/
7👍6🔥3👏1🤝1
🤖 Что такое SDD и зачем он нужен?

Spec-Driven Development (SDD) — подход к разработке, при котором сначала формируется подробная спецификация, а уже потом AI-агент реализует задачу.

Вместо:
«Напиши мне эту фичу» → код

получаем:
Требования → Specification → Plan → Tasks → Code → Tests

Зачем это нужно?

AI-агент умеет быстро писать код, но может неправильно понять задачу. Спецификация фиксирует что именно нужно сделать, ограничения, архитектуру и критерии готовности.

SDD превращает AI-кодинг из хаотичного *vibe coding* в управляемый инженерный процесс.

📚 Подробный разбор SDD и инструментов для работы с AI-агентами:

👉 https://datatalks.ru/spec-driven-development/index.html

#AI #AIAgents #SDD #SpecDrivenDevelopment #ClaudeCode #Codex #SoftwareEngineering
👍12🔥3👏1😐1👀1🤝1