Data Science: SQL и Аналитика данных
37.1K subscribers
281 photos
59 videos
1 file
337 links
№ 6205468675

На простом языке: про работу с данными, современные технологии, AI, машинное обучение и, немного, SQL.

Сотрудничество: @niktwix

Менеджер: @Spiral_Yuri
Download Telegram
🔥 Сколько денег приносит ИИ?

Amazon, Google, Microsoft и другие технокомпании вкладывают в ИИ огромные деньги: они выпускают все новые продукты на его основе и активно — иногда слишком — продвигают их среди клиентов и даже собственных сотрудников. Учитывая их рвение, может показаться, что это приносит им большие доходы, но, кажется, это не так. По крайней мере пока.

➡️ Здесь собрали данные о затратах и прибылях передовых ИИ-компаний: кроме уже упомянутых, там есть запрещенная в России Meta, Nvidia, OpenAI, Anthropic, Oracle, xAI, Mistral, Cohere и Deepseek.

В плюсе пока только Nvidia, которая с 2023 заработала на ИИ-чипах 253 миллиардов. Никто больше к таким результатам даже не приблизился, и в основном все в глубоком минусе.

Выглядит не очень, но стоит учитывать три фактора:
⏺️На графиках только затраты и доходы, связанные с ИИ, а не финансовые показатели компании в целом. То есть Copilot не привел Microsoft к банкротству.
⏺️Цифры приблизительные и основанные во многом на предположениях, оценках экспертов и слитых данных. Список источников внизу страницы.
⏺️Многие денежные потоки в индустрии движутся по кругу: от Google в Anthropic, от Anthropic в Nvidia и от Nvidia в Google. Это тоже влияет на точность оценки прибыльности ИИ-проектов.

В любом случае, выглядят данные любопытно и доля правды в них точно есть. Отсюда вопрос: как думаете, когда ИИ начнет окупаться?

Всё про Data Science

🇷🇺 Читайте нас в MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 SQL против мошенников

Интересная статья про паттерны, по которым можно выявить случаи мошенничества и подозрительной активности на банковских счетах с помощью простого советского SQL.

Большинство признаков, на которые надо обращать внимание, известны или интуитивно понятны, но автор еще и сами SQL-запросы показывает, и это уже может пригодиться.
⏺️Скорость снятия денег. Большое количество операций за короткий срок говорит о том, что мошенник пытается поскорее опустошить карту, пока владелец не заметил.
⏺️Телепортация — в течение небольшого промежутка времени карта использовалась в двух местах, между которыми физически невозможно переместиться с такой скоростью.
⏺️Снятия подозрительных сумм. Небольшие, круглые суммы — у автор это 1-5-10 долларов — говорят о том, что мошенник проверяет, работает ли карта. Сомнения должны вызывать и частые покупки на суммы ниже пределов, после которых требуется подтверждение личности или пин-код.
⏺️Внезапный рост числа уникальных карт у одного мерчанта. Если раньше через него проходили 200 карт в день, а потом их число подскочило до 1000+, это повод присмотреться к нему повнимательнее.
⏺️Операции в нетипичное для пользователя время. Например, если человек всегда платит днем, а потом внезапно начинает активно пользоваться картой в 3 ночи.

Чтобы выявлять все эти сигналы было проще, автор предлагает заранее материализовать их с помощью оконных функций:
SELECT
cardholder_id,
timestamp,
amount,
merchant_id,

timestamp - LAG(timestamp) OVER w AS time_since_last,

CASE WHEN merchant_id <> LAG(merchant_id) OVER w
THEN 'changed' ELSE 'same' END AS merchant_change,

sum(amount) OVER (
PARTITION BY cardholder_id
ORDER BY timestamp
RANGE BETWEEN INTERVAL '24 hours' PRECEDING AND CURRENT ROW
) AS running_24h_total,

ROW_NUMBER() OVER (
PARTITION BY cardholder_id, date(timestamp)
ORDER BY timestamp
) AS tx_of_day

FROM transactions
WINDOW w AS (PARTITION BY cardholder_id ORDER BY timestamp)
ORDER BY cardholder_id, timestamp;

И после этого уже прогонять проверки с помощью WHERE:
SELECT *
FROM tx_with_windows
WHERE tx_of_day >= 5
AND time_since_last < INTERVAL '60 seconds'
AND merchant_change = 'changed';


Главное — не переусердствовать и помнить, что каждый сигнал по отдельности, как правило, ничего не доказывает: и обычному человеку может понадобиться снять деньги с карты несколько раз подряд или сбегать в магазин посреди ночи. Чтобы отсеять честных пользователей от мошенников, нужно смотреть на несколько параметров в совокупности.

Всё про Data Science

🇷🇺 Читайте нас в MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 NornicDB: База данных, которая объединяет Graph + Vector и летает в sub-ms


Это гибрид: Graph + Vector + Temporal MVCC в одном ядре
заточен под AI-агентов и knowledge systems

Что внутри:

⏺️ HNSW поиск <1ms
⏺️ graph traversal без тормозов
⏺️ writes тоже быстрые, не только чтение

Из хорошего, это не Frankenstein из разных сервисов, а единая система.

Под капотом:

⏺️Neo4j-compatible (Bolt + Cypher)
⏺️ vector search как first-class citizen
⏺️ GPU acceleration
⏺️ T- emporal модель с версионированием данных

То есть ты можешь:

⏺️ искать эмбецдинги
⏺️ ходить по графу
⏺️ делать time-travel запросы
⏺️ всё это в одном запросе.

Фактически это попытка сделать “память для AI”:
где есть связи, смысл и история изменений, а не просто таблицы.

Если делаешь RAG, multi-agent системы или сложные knowledge graph - будет полезно.

➡️ GitHub: https://github.com/orneryd/NornicDB

Всё про Data Science

🇷🇺 Читайте нас в MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 Edit Banana редактирует текст прямо на картинках за пару кликов.

Нейросеть разбирает изображение на смысловые блоки, после чего любой фрагмент можно переписать, не трогая остальное.

Модель уверенно справляется с таблицами, формулами и диаграммами, сохраняет исходные цвета, шрифты и позиции элементов. Готовый результат экспортируется в DrawIO, SVG или PowerPoint.
Проект полностью открытый, ставится локально с GitHub.

Забираем, пока не закрыли:

➡️ https://github.com/BIT-DataLab/Edit-Banana

Всё про Data Science

🇷🇺 Читайте нас в MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
🔥 Text-to-SQL ломается не из-за модели. Он ломается из-за схемы

Большинство думает, что проблема в LLM или плохом промпте. На практике всё проще. Модель не видит правильные связи между таблицами.

Пример. Запрос вроде “какие издатели получили выплаты выше 5000”. Векторный поиск подтянет publisher и royalty_ledger. Всё логично. Но пропустит vendor_agreement, ту самую таблицу, которая их связывает.

В итоге SQL выглядит валидно. Но возвращает ноль строк.

Это системная проблема всех решений на embeddings. Они ищут по смыслу, но не понимают структуру базы.

Нормальный подход другой. Схему нужно рассматривать как граф.

Таблицы это узлы. Foreign keys это связи. Запрос решается не поиском похожих слов, а обходом графа и поиском join-пути.

Именно так работает QueryWeaver.

Он строит граф базы и при запросе сам находит весь путь, включая промежуточные таблицы. Даже если это цепочка из нескольких шагов.

На практике это выглядит так. В тесте с базой на 60 таблиц он разобрал 5-шаговый запрос через цепочку superpower → capability_matrix → stakeholder_registry → resource_requisition → budget_allocation.

Векторный поиск увидел только начало и конец. Всё между ними потерял, потому что “stakeholder” никак не связан по смыслу с “superpower”.

Графу на это всё равно. Он просто находит единственный путь между сущностями.

И это меняет всё.

Open-source, можно развернуть у себя и наконец получить text-to-SQL, который реально работает.

➡️ https://github.com/FalkorDB/QueryWeaver

сё про Data Science

🇷🇺 Читайте нас в MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
➡️ Продвинутый SQL совет - всегда проверяй, можно ли заменить SELECT DISTINCT на правильный JOIN или EXISTS.

Очень часто DISTINCT добавляют просто чтобы убрать дубли после неудачного join. Запрос вроде работает, но по факту ты сначала раздуваешь результат, а потом заставляешь базу его чистить. На больших таблицах это легко убивает производительность.

Плохой вариант:


SELECT DISTINCT u.id, u.name
FROM users u
JOIN orders o ON o.user_id = u.id;


Лучше так:


SELECT u.id, u.name
FROM users u
WHERE EXISTS (
SELECT 1
FROM orders o
WHERE o.user_id = u.id
);


Почему это сильный приём:
EXISTS останавливается, как только находит первое совпадение
не нужно тащить лишние строки
не нужно потом убирать дубли
логика запроса становится честной - ты проверяешь наличие, а не собираешь мусор

Это один из самых частых hidden performance fixes в SQL. Если видишь DISTINCT, сразу спрашивай себя: он тут реально нужен или просто маскирует плохую логику JOIN.

➡️ https://github.com/FalkorDB/QueryWeaver

Всё про Data Science

🇷🇺 Читайте нас в MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
За год число вакансий с требованиями ИИ-навыков значительно выросло.

Работодатели всё чаще ожидают, что специалисты умеют использовать нейросети в работе.

У Яндекс Практикума есть курсы по ИИ для разных задач: от работы с нейросетями и автоматизации процессов до создания AI-агентов и разработки с помощью ИИ.

Начать можно бесплатно.

→ Освоить AI-навыки

Erid: 2SDnjeasE1x
Название: ООО "ЯНДЕКС"
ИНН: 7736207543
SQL-прием: EXISTS часто лучше, чем COUNT(*) > 0

Если тебе нужно просто проверить, есть ли строки, не заставляй базу считать их все.

Плохо:


SELECT COUNT(*) > 0
FROM orders
WHERE user_id = 42;



База может пройти по всем подходящим строкам, чтобы посчитать количество.

Лучше:

SELECT EXISTS (
SELECT 1
FROM orders
WHERE user_id = 42
);



EXISTS останавливается сразу, как только нашел первую подходящую строку. Для больших таблиц это может быть заметно быстрее, особенно если есть индекс по условию:


CREATE INDEX idx_orders_user_id ON orders(user_id);



Если тебе нужен ответ “есть или нет”, используй EXISTS. COUNT(*) оставь для случаев, когда реально нужно точное количество строк.

Всё про Data Science

🇷🇺 Читайте нас в MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 Линейный график как искусство

Этот график в любом современном BI-инструменте можно сделать за несколько кликов Да что BI — его можно нарисовать без особых проблем даже в обычном Экселе.

Но у автора он отнял 50 часов — больше стандартной рабочей недели. Он все нарисовал от руки, с помощью карандашей, туши, линеек и набора для леттеринга. В своем посте про этот опыт он поделился набором классических книг про визуализацию для вдохновения, списком инструментов и практическими советами: например, как нарисовать четкие, аккуратные линии.

Если интересно, то простого маркера для этого недостаточно: надо отметить точки на графике, вокруг них нарисовать круги и верхние точки кругов соединить линиями — и только внутри этих линий закрасить черным или другим цветом.

Он рассказывает, как лучше выстроить процесс, и как работать с разными инструментами. Единственный вопрос, на который он не дает ответ — зачем вообще этим заниматься? Зачем тратить 50 часов на то, что намного проще и быстрее сделать на компьютере?

Возможно, просто из любви к искусству. В конце концов, не все нужно автоматизировать и оптимизировать — иногда можно потратить 50 часов на линейный график и просто наслаждаться процессом.

Кстати, даже если не планируете рисовать графики карандашами и чернилами, в посте есть ссылки на онлайн-версии книг, которые все еще стоят внимания. несмотря на возраст.

🫡 Всё про Data Science

🇷🇺 Читайте нас в MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
➡️ SQL можно учить не по скучным таблицам, а через игру в стиле «Матрицы»

Разработчик сделал тренажёр, где вы проходите уровни, находите терминалы и «взламываете» их SQL-запросами.

Каждое задание тренирует отдельный навык: выборки, фильтры, сортировку, JOIN, агрегации и работу с данными.

Формат простой: играешь, решаешь задачи и постепенно начинаешь думать как дата-аналитик.

Идеальный вариант на выходные, если давно хотели подтянуть SQL без унылой теории.

http://sqlprotocol.com/

🫡 Всё про Data Science

🇷🇺 Читайте нас в MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 Платформа Xata для облачного PostgreSQL

Xata — это облачная платформа с открытым исходным кодом для управления множеством экземпляров PostgreSQL на Kubernetes. Она предлагает функции быстрого ветвления, автоматического масштабирования и высокой доступности, что делает её идеальной для создания внутреннего PostgreSQL как услуги или тестовых сред.

➡️ Основные моменты:

⏺️ Быстрое ветвление с использованием Copy-on-Write.
⏺️ Автоматическое масштабирование и управление вычислительными ресурсами.
⏺️ Высокая доступность с автоматическим переключением на резервные экземпляры.
⏺️ REST API и CLI для управления.
⏺️ Подходит для создания тестовых и разработческих окружений.

➡️ GitHub: https://github.com/xataio/xata

🫡 Всё про Data Science

🇷🇺 Читайте нас в MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
🔥 Claude идет в финансы с готовыми агентами

Это уже финансовые ИИ-агенты, которые забирают куски работы у аналитиков, аудиторов и операционных команд.

⏺️Один агент собирает питч-дек.
⏺️Второй готовит бриф к встрече.
⏺️Третий читает earnings report и ловит рискованные формулировки. Четвёртый строит valuation model прямо в таблице. Пятый сверяет книги с банковскими выписками.

И самое интересное - это уже не просто чат с моделью. Агент подключается к Excel, PowerPoint, Word, Outlook и данным компании. То есть он не “советует”, а реально двигает рабочий процесс.

Сначала это выглядит как автоматизация рутины. Потом оказывается, что рутина занимала половину финансового отдела.

➡️ https://www.youtube.com/shorts/dhcoR03jtI0

🫡 Всё про Data Science

🇷🇺 Читайте нас в MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥Минималистичная графовая база данных на C++17

TGDB — это простая графовая база данных, реализованная как статическая библиотека. Она поддерживает фиксированные узлы и индексные указатели, обеспечивая схему без схемы и работу с базовыми типами данных. База данных позволяет эффективно создавать и извлекать объекты с свойствами.

Основные моменты:

⏺️ Унифицированный тип узла размером 56 байт.
⏺️ Поддержка встроенных типов: int, double, std::string.
⏺️ Двусторонние ссылки между узлами.
⏺️ Дисковая устойчивость через mmap.
⏺️ Быстрый локальный обход и глобальный поиск.

➡️ GitHub: https://github.com/LincolnCox29/TrueGraphDataBase

🫡 Всё про Data Science

🇷🇺 Читайте нас в MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
Марафон для тех, кто готов разрабатывать искусственный интеллект

Факультет компьютерных наук НИУ ВШЭ запускает онлайн-интенсив по подготовке к поступлению в онлайн-магистратуру «Искусственный интеллект». На программе обучают всем шагам из цикла разработки моделей и навыкам написания высоконагруженного кода для промышленной эксплуатации.

Присоединяйтесь, если хотите:
⚪️ Укрепить знания по высшей математике, Python и анализу данных
⚪️ Получить практическое понимание структуры экзамена и требований программы для поступающих
⚪️Быстро и эффективно подготовиться к вступительным испытаниям в одну из популярных магистратур ФКН НИУ ВШЭ

Интенсив проведут эксперты и преподаватели Высшей школы экономики.

📆 Когда: 28 июня — 20 июля, 18:30 (мск), но вы еще можете присоединиться
💻 Формат: онлайн и бесплатно, для участия и получения записей прошедших занятий нужно лишь зарегистрироваться до 20 июля

 Зарегистрироваться
🔥NVIDIA официально опубликовала Skills, которые они используют для своих ИИ-агентов.

Прямо сейчас у них есть Skills для:

⏺️ автоматического анализа и суммирования видео
⏺️ создания голосовых агентов в реальном времени
⏺️ обучения и улучшения LLM
⏺️ ускорения моделей, чтобы они работали намного быстрее
⏺️ систем RAG, подключенных к документам и данным
⏺️ агентов, работающих в изолированных безопасных средах
⏺️ оптимизации логистики и маршрутизации с помощью GPU
⏺️ программирования и вычислений на CUDA

Некоторые из самых интересных:

⏺️ TensorRT-LLM → экстремальное ускорение LLM
⏺️ NeMo-RL → продвинутое обучение агентов
⏺️ Video Search → автоматический поиск и суммирование видео

Кроме того, они совместимы с:

⏺️ Claude Code
⏺️ OpenAI Codex
⏺️ Cursor

➡️ https://github.com/NVIDIA/skills
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
🔥 Как получить БЕСКОНЕЧНЫЕ лимиты ChatGPT, Gemini, Claude и других хайповых нейронок - нашел инструмент, который позволяет максимально экономить токены.

Нашли расширение, которое делает почти магию: переносит диалог с нейронкой в другой аккаунт в один клик.

Когда лимит в ChatGPT, Gemini, Claude или другом сервисе заканчивается, не нужно вручную копировать промпты, ответы и весь контекст. Расширение сохраняет текущий чат и позволяет продолжить разговор с того же места.

Что умеет:


⏺️переносить диалог между аккаунтами
⏺️сохранять контекст, результаты и важные данные
⏺️избавлять от ручного копирования
⏺️быстро продолжать работу после упора в лимиты

Для тех, кто постоянно работает с нейронками, это прям находка.

➡️ Ссылка на расширение - https://addons.mozilla.org/ru/firefox/addon/limit-skip/

🫡 Всё про Data Science

🇷🇺 Читайте нас в MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ Почему аналитики данных так востребованы и как стать аналитиком в 2026 году?

Большинство новичков совершают одну и ту же ошибку: учат всё подряд.
SQL, Python, Power BI, статистика… Но работодатели оценивают кандидатов не только по базовым навыкам, но и по другим критериям. Из-за этого многие месяцами рассылают резюме и получают только отказы или полное игнорирование.

Андрон Алексанян - аналитик с опытом 9 лет и СEO Симулейтив проведет бесплатный урок и покажет, как выглядит путь к первой работе аналитиком в 2026 году.

Вы узнаете:
🔶Какие навыки действительно проверяют на собеседованиях;
🔶Что должно быть в портфолио, чтобы его открывали работодатели;
🔶Почему многие резюме аналитиков сразу отправляются в отказ;
🔶Как искать работу без коммерческого опыта;
🔶Какие преимущества есть у кандидатов после 30, 40 и даже 50 лет;
🔶Какие ошибки чаще всего мешают получить первый оффер.


Дополнительно на эфире разберем реальные примеры резюме и портфолио кандидатов, которые смогли пройти отбор.

🎁 ПОЛУЧИТЕ 3 КУРСА (PYTHON, SQL, PANDAS) В ПОДАРОК ЗА РЕГИСТРАЦИЮ НА ЭФИР!

Эти курсы - база для того чтобы вкатиться в профессию!

Если вы хотите войти в аналитику и перестать тратить время на лишнее обучение — этот урок поможет понять, на чем действительно стоит сосредоточиться.

🛎️Регистрируйтесь, эфир совсем скоро!
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 Библиотека для работы с SQLite в C++26 с использованием рефлексии

Reflite — это библиотека на C++26, которая упрощает взаимодействие с SQLite, позволяя использовать обычные структуры как основу для выполнения запросов. Она поддерживает основные операции: вставка, удаление, выборка и обновление, избавляя от лишнего шаблона кода.

Основные моменты:

⏺️ Легковесная библиотека в одном файле
⏺️ Поддержка операций INSERT, DELETE, SELECT, UPDATE
⏺️ Использует рефлексию для работы с типами структур
⏺️ Не требует полной реализации SQL, фокус на простоте
⏺️ Совместима с современными компиляторами C++26

➡️ GitHub: https://github.com/KaruroChori/reflite
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 Хитрый SQL-совет: осторожнее с `NOT IN`

Кажется, что эти запросы делают одно и то же:


SELECT *
FROM users
WHERE id NOT IN (
SELECT user_id
FROM banned_users
);


Но если banned_users.user_id содержит хотя бы один NULL, запрос может вернуть ноль строк.

Надёжнее использовать NOT EXISTS:


SELECT u.*
FROM users AS u
WHERE NOT EXISTS (
SELECT 1
FROM banned_users AS b
WHERE b.user_id = u.id
);


Причина в трёхзначной логике SQL: сравнение с NULL даёт UNKNOWN, а не TRUE или FALSE.

Правило простое: если подзапрос потенциально возвращает NULL, вместо NOT IN почти всегда выбирайте NOT EXISTS.

🫡 Всё про Data Science

🇷🇺 Читайте нас в MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
Компании ценят специалистов, которые разбираются как в технической стороне продукта, так и в потребностях бизнеса. Перекрёстные навыки часто встречаются в вакансиях.

Нетология объединила две профессии в один курс — «Системный и бизнес-аналитик». На занятиях своим опытом поделятся эксперты из Qiwi, М.Видео — Эльдорадо и Bolt.

За 12 месяцев вы научитесь:

- использовать гибкие методологии Agile и Scrum;
- разбираться в нотациях моделирования: UML, BPMN, IDEF;
- описывать user story и use case;
- создавать прототипы приложений и сервисов;
- работать с АРІ и проектной документацией.

Сейчас на курс действует скидка 50%, а с промокодом IT10JULY цена станет ещё на 10% ниже. Плюсом подарим курс о развитии карьеры при покупке до 31 июля.

Записаться

Реклама. ООО “Нетология” ОГРН 1207700135884 Erid: 2VSb5yBsme2
🔥 Рой ИИ-агентов написал аналог SQLite на Rust за несколько часов

Cursor провела необычный эксперимент: агентам выдали только официальную документацию SQLite объёмом 835 страниц и поручили с нуля реализовать собственный движок базы данных на Rust.

Без интернета, готового исходного кода и дополнительной помощи.

Уже через четыре часа получившиеся реализации правильно выполняли 73–85% запросов из скрытого теста. После дальнейшей работы некоторым командам удалось довести результат до 100%.

Но особенно удивила стоимость:

⏺️ связка Opus 4.8 и Composer 2.5 потратила около $1 400;
⏺️ Fable — примерно $20 000.


Одинаковая задача, но почти пятнадцатикратная разница в цене.

Во время разработки агенты столкнулись с до боли знакомыми командными проблемами: дублировали работу, конфликтовали при изменении одних и тех же файлов и избегали трогать ядро системы, даже когда без этого было невозможно двигаться дальше.

Получается, ИИ уже способен за часы собрать сложный системный проект, но митинги, конфликты и страх ответственности он тоже автоматизировал 😂

#ai #rust #sqlite #agents #programming

➡️ https://cursor.com/blog/agent-swarm-model-economics


🫡 Всё про Data Science

🇷🇺 Читайте нас в MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM