Data Science. SQL hub
36K subscribers
1.17K photos
98 videos
37 files
1.17K links
По всем вопросам- @workakkk

@itchannels_telegram - 🔥лучшие ит-каналы

@ai_machinelearning_big_data - Machine learning

@pythonl - Python

@pythonlbooks- python книги📚

@datascienceiot - ml книги📚

РКН: https://vk.cc/cIi9vo

#VRHSZ
Download Telegram
📌 Почему SQL работает именно так - заслуга Эдгара «Теда» Кодда

В конце 1960-х базы данных напоминали лабиринты указателей. Чтобы найти запись, программисту приходилось понимать, как именно данные расположены внутри системы.

Кодд предложил хранить данные в виде математических отношений - знакомых нам таблиц. В 1970 году он описал реляционную модель и основные операции:

* σ - выбирает строки по условию, будущий WHERE
* π - оставляет нужные столбцы, основа SELECT
* - соединяет связанные таблицы, будущий JOIN

Ключевой идеей стала независимость данных. Пользователь описывает, какой результат ему нужен, а база сама решает, как его получить и где искать записи.

SQL появился позже, но был построен на реляционной модели Кодда. Её принципы до сих пор лежат в основе большинства запросов к базам данных.
23👍12🔥8
Forwarded from Machinelearning
⚡️ DeepSeek выпустила V4.1 Flash

Ноую модель уже раскатывают в веб-чате и мобильных приложениях. Прежние режимы - быстрый, экспертный и распознавание изображений свели в один: выбирать вручную больше ничего не нужно.

Теперь одна модель ведёт и обычный диалог, и разбор картинок, и сложные вопросы. Сложность запроса она определяет сама, а зрение включает, когда на вход приходит изображение.

По словам DeepSeek, V4.1 Flash обходит V4 Pro по качеству, стоимости и скорости. До выхода V4.1 Pro она возьмёт на себя все запросы, которые раньше уходили на V4 Pro.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍121
Media is too big
VIEW IN TELEGRAM
Почему PostgreSQL не использует индекс?

Лайт объясняет РюкуОписание: Когда Seq Scan выгоднее индекса и как проверить план запроса через EXPLAIN ANALYZE.

#sql #postgresql #deathnote
17👍7🥰4
Как SQLite превращает числа в текст по две цифры за раз

Обычное преобразование целого числа в строку извлекает цифры по одной с помощью деления на 10 и остатка % 10.

В SQLite используется таблица sqlite3DigitPairs - строка длиной 200 байт со всеми парами от 00 до 99:


"00010203040506070809"
"10111213141516171819"
...
"90919293949596979899"


Алгоритм берёт две цифры сразу и копирует готовую пару по вычисленному индексу. Это сокращает количество делений и итераций при форматировании i64 и u64.

Небольшая оптимизация внутри sqlite/src/util.c, которая особенно заметна на миллионах преобразований.
7👍5🔥4
🔥 Один из лучших обучающих курсов на StepiK по SQL

SQL можно знать годами и всё равно теряться, когда запрос внезапно начинает тормозить в проде.

Этот курс про уровень, где ты не просто пишешь SELECT, а понимаешь, что происходит внутри MySQL, почему запрос работает медленно и как ускорить его без новых проблем. Здесь разбираются EXPLAIN, индексы, CTE, оконные функции, транзакции, аналитические паттерны, legacy SQL и работа с AI-ассистентами.

Каждый урок - с практикой и реальными SQL-задачами на MySQL 8 с автопроверкой.

После курса ты сможешь увереннее разбирать чужой код, находить узкие места и предлагать решения, которые действительно работают.

Для подписчиков скидка - 49% в течение 2 суток: https://stepik.org/a/298827/
3🔥3👍2
Два клиента одновременно бронируют один номер. Как не продать его дважды?

Обычная проверка «свободен ли номер?» может пропустить оба запроса: каждый успеет увидеть свободное время до сохранения чужой брони.

В PostgreSQL можно запретить пересечения прямо в базе:


CREATE EXTENSION IF NOT EXISTS btree_gist;

CREATE TABLE bookings (
room_id INT NOT NULL,
starts_at TIMESTAMPTZ NOT NULL,
ends_at TIMESTAMPTZ NOT NULL,

CHECK (ends_at > starts_at),

EXCLUDE USING gist (
room_id WITH =,
tstzrange(starts_at, ends_at, '[)') WITH &&
)
);


Как это работает:

room_id WITH = — проверяем брони одного номера.
WITH && — запрещаем пересечение временных интервалов.
'[)' — начало включено, конец исключён. Брони 10:00–11:00 и 11:00–12:00 допустимы.
CHECK — окончание должно быть позже начала.

Ограничение действует и при одновременных запросах. Две конфликтующие брони сохранить не получится: приложение должно обработать ошибку и сообщить, что время уже занято.

Подходит для гостиниц, переговорных, аренды оборудования и записи к специалистам.
👍194🔥2
Oracle провела очередную волну сокращений, по сообщениям сотрудников, под увольнение попали примерно 3–4 тысячи человек.

Отключения начались ещё до рассвета: около 4:00 сотрудникам стали закрывать доступ к внутренним системам, к 5:00–5:30 деактивировали Slack-аккаунты, а примерно в 6:00 разослали письма об увольнении.

Некоторые люди приехали в офис, не успев проверить почту, и уже на месте обнаружили, что их бейджи больше не работают.

Точный масштаб сокращений пока неясен, но отдельные команды, по словам сотрудников, потеряли около 10% состава. Число аккаунтов в рабочем Slack сократилось примерно на 3–4 тысячи.

Это не первая крупная волна увольнений Oracle в этом году: весной компания уже провела масштабные сокращения.
😱11👍52🤬2🔥1🎉1
Стать специалистом по Data Science всего за 10 недель — это реально!

Если давно смотрите в сторону Data Science, но откладываете старт из-за огромного количества технологий, математики и непонятного пути до первой работы — сейчас можно зайти в профессию по-другому.

Симулейтив запускает интенсивный буткемп по Data Science, который построен вокруг главного: за первые 10 недель собрать необходимый стек, получить практический опыт и начать готовиться к реальным собеседованиям.

И главное — вам не нужно сначала учиться 8–12 месяцев, а уже потом думать о трудоустройстве.

Что вас ждёт:
необходимые для старта навыки: Python, ML, статистика, работа с данными и AI-инструментами;
практика на реальных задачах и проектах;
понятный ежедневный план обучения и поддержка менторов;
еженедельные живые занятия, а не старые записи;
подготовка к собеседованиям уже с первых недель — групповые интервью, разбор вопросов и подготовка резюме.

А что после 10 недель? Буткемп — это только первый этап.

После него можно продолжить углублять экспертизу и двигаться к уровню middle:
продвинутый Python;
Git;
продвинутая статистика и A/B-тестирование;
Airflow;
MLOps и развёртывание ML-моделей.

Кому подойдёт:
1. Тем, кто хочет войти в Data Science с нуля.
2. Тем, кому не хватает структуры и дисциплины в самостоятельном обучении.
3. Тем, кто хочет быстрее перейти от обучения к поиску работы.

🔥ВАЖНО: Симулейтив сейчас дают возможность получить грант на обучение и гарантию трудоустройства своих студентов! Количество грантов, ограничено!

Оставляйте заявку до конца недели, чтобы занять одно из 5 оставшихся мест нового потока!

🔗 ЗАБРОНИРОВАТЬ МЕСТО
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3😁3👎21
Какой объект в PostgreSQL используется для нормализации слов (удаления окончаний) при создании поискового индекса tsvector?
Anonymous Quiz
15%
Parser
23%
Dictionary
30%
Lexer
31%
Tokenizer
👍52
Forwarded from Machinelearning
📌 NY Post: Anthropic - это культ

Профессор Вашингтонского университета Педро Домингос в интервью New York Post рассказал, что сотрудники Anthropic относятся к Claude как к человеку - приписывают модели мотивы, эмоции, намерения и некоторую степень сознания.

Домингос много лет знаком с Дарио Амодеи и её ведущими инженерами. Культуру Anthropic он назвал сектантской и связал это с наймом. По его словам, компания отбирает только единомышленников, и отсюда низкая текучесть.

Удержание в Anthropic действительно высокое. По данным венчурного фонда SignalFire, через два года в компании остаются 80% инженеров, и это лучший показатель среди топовых лабораторий.


В процессе собеседования кандидатов просят поклясться в преданности общественной безопасности выше прибыли, и даже проводят психологическое тестирование, чтобы выяснить, будут ли они придерживаться этого принципа.

При этом многие сотрудники компании являются сторонниками движения эффективного альтруизма, философии, которая, по сути, сводится к тому, что их самопровозглашенные лидеры являются истиной в последней инстанции.

Их представление об этой философии заключается в том, что история следует закономерностям, и лишь небольшая группа людей способна эти закономерности увидеть, в то время как все остальные - нет. Предполагается, что именно эти люди должны вести общество, целые нации и все человечество к прогрессу.

Внутри Anthropic относятся к Клоду с почти религиозным почтением - некоторые из работников даже посещали условные похороны Claude 3 Sonnet, а другая модель, Opus 3, продолжает публиковать эссе после выхода на пенсию.

В Кремниевой долине также ходят слухи, что сотрудники Anthropic начали поклоняться Клоду как настоящему богу.

Компания серьёзно относится к распространению своих идей и тратит на это силы и средства. Раз в две недели Дарио проводит собрания, называемые поисками видений, которые сравнивают с проповедями.

В июне Anthropic объявила о программе по набору 1000 молодых людей, обучению их использованию Claude и последующему внедрению их в некоммерческие организации.

На неё было потрачено 150 млн долларов, а выпускники трудоустроены на полную ставку с заработной платой в более чем 400 некоммерческих организаций.

Компания также выплачивает 3600 долларов студентам, участвующим в программе Claude Campus Ambassador Program, которая занимается продвижением её ИИ в колледжах.

Между тем инвесторы, связанные с Anthropic, оплачивают труд более чем 80 журналистов, работающих в ведущих новостных изданиях, через Центр журналистики в области искусственного интеллекта имени Тарбелла.

Эти журналисты получают деньги за освещение индустрии ИИ, но редко проводят какие-либо значимые расследования или критикуют Anthropic.

В завершении Домингос отмечает, что хотя некоторые инженеры бьют тревогу, другие просто довольны высокими зарплатами и тем, что находятся на передовой своей отрасли.

... сейчас в Anthropic есть люди, которые на самом деле не верят во всю эту чушь, — сказал он. — Они остаются там, потому что это самое интересное место для работы с ИИ, и они будут очень хорошо зарабатывать


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍32🔥2🤔2
Участвуй во всероссийском ИТ-чемпионате МТС True Tech Champ 2026 c призовой фондом 10 250 000 рублей.

Если тебе нравятся алгоритмы, структуры данных и задачи на чистую логику — участвуй в алгоритмическом треке с индивидуальным зачетом.

Решай задачи разного уровня сложности: от базовых до тех, что проверяют скорость мышления и умение оптимизировать решения за ограниченное время.

В финале лучшие 120 участников алгоритмического трека сразятся в лайв-кодинге за шесть призовых мест и 2 750 000 рублей. Всех финалистов ждут:
— Лимитированный мерч;
— Сертификаты об участии;
— Масштабное мероприятие с выступлениями хэдлайнеров и фестивальными активностями.

Успей зарегистрироваться и пройти отборочный этап до 27 сентября.

Erid: 2VSb5xkQt6E
👍3🤬1
🔥 PostgreSQL 19 задерживается релиз может сдвинуться на несколько недель или даже месяцев.

Причина не в одной критической ошибке, а в масштабе переработок. После начала бета-тестирования из PostgreSQL 19 уже откатили 53 изменения, включая несколько заметных функций.

Из релиза убрали SQL/PGQ для графовых запросов, GROUP BY ALL, объединение и разделение партиций через ALTER TABLE, онлайн-переключение checksums, часть изменений JSON_TABLE и новые возможности pg_stat_statements. Большинство этих функций теперь, вероятно, вернутся уже в PostgreSQL 20.

При этом в PostgreSQL 19 пока остаются pg_plan_advice, parallel autovacuum, ON CONFLICT DO SELECT, IGNORE NULLS для оконных функций и ряд улучшений логической репликации.

Отдельная причина большого числа поздних откатов — более глубокое тестирование кода. Разработчики всё активнее используют AI-инструменты для поиска ошибок и генерации воспроизводимых тестов, из-за чего проблемы находят уже после попадания изменений в ветку релиза.

Следующая Beta 4 запланирована на 24 сентября 2026 года. Для production Snowflake пока рекомендует ориентироваться на PostgreSQL 18.

https://www.snowflake.com/en/blog/engineering/postgresql-19-release-delay-feature-reverts/
👍4
🧩 Сложная SQL-задача: симуляция DNS-кеша

Есть таблица запросов:


CREATE TABLE dns_requests (
request_id BIGINT PRIMARY KEY,
requested_at TIMESTAMP,
node_id INT,
domain TEXT,
record_type TEXT,
ttl_seconds INT
);


Правила:

• Ключ кеша: node_id + domain + record_type.
• Первый запрос - MISS, он создаёт запись в кеше.
• Запись действует до requested_at + ttl_seconds.
• Запрос в момент истечения TTL — уже MISS.
• HIT не обновляет TTL.
• Новый MISS заменяет старую запись.
При одинаковом времени порядок задаёт request_id.

Напишите один SQL-запрос, который вернёт:


request_id
cache_status -- HIT / MISS
cache_loaded_at
cache_expires_at
source_request_id -- какой MISS создал запись


Главная ловушка: ttl_seconds у HIT использовать нельзя — срок жизни определяется последним MISS.

Дополнительно посчитайте для каждого узла процент запросов, обработанных локально, и количество обращений к CoreDNS.

Условия: PostgreSQL, без процедур, циклов и временных таблиц.
👍41