Охота на баг в SQLite
Подустали читать про ИИ, релиз очередной модели, результаты бенчмарков и новости про то, как хитрые агенты что-нибудь взломали? Если да, то почему бы не почитать лонгрид про то, как компания Tailscale искала в SQLite хитрый баг, который прятался в ней 16 лет?
🔜 Если кратко:
Данные компания хранит в SQLite на отдельных серверах. Каждые несколько минут система делает «снимок» базы и отправляет файл SQLite в хранилище S3. Такой подход работал с 2023 года, но в августе 2025 начал сбоить — именно тогда Tailscale обнаружили, что один бекап поврежден. А потом этот случай повторился, а потом еще, и так 19 раз за 6 месяцев.
В инцидентах не было никакой логики: они затрагивали разные сервера, данные разных клиентов, с разной частотой, независимо от нагрузки на сеть или времени суток.
Пока компания искала баг, им надо было как-то поддерживать работоспособность продукта и постараться при этом не терять данные пользователей. Они стали вести отдельный лог всех изменений, которые после очередной поломки воспроизводили поверх последней исправной копии. Этот подход и подкинул в итоге важную подсказку: в двух случаях данные, которые одна транзакция успешно записала и сохранила, исчезли для всех последующих.
🔜 Потеря уже подтвержденных данных навела на мысль, что поломка происходит во время записи на диск. Тут надо вспомнить, как эта СУБД фиксирует новые данные: она сначала вносит их в WAL (Write-ahead-log), а затем уже переносит в базу — это называется checkpoint.
Все это время Tailscale сотрудничали с разработчиками SQLite, которые создали инструмент, позволяющий детальнее посмотреть, что происходит в СУБД во время работы. Он и показал, что иногда во время чекпоинта SQLite ошибочно считала, что уже скопировала данные из WAL, хотя на самом деле еще не успела это сделать. Из-за этого часть записей терялась, но некоторые страницы в базе (например, индексы) продолжали на них ссылаться — в итоге весь файл повреждался.
Баг сидел в коде 16 лет незамеченным, потому что воспроизвести его можно только в специфических условиях. Обычно чекпоинты проводятся автоматически и работают без ошибок, а Tailscale решили взять процесс под свой контроль и сделали это по их же словам, очень агрессивно. Именно это и приводило к сбоям, но больше так не будет: баг пофиксили в версии SQLite 3.52.0.
🔜 Вот такой хеппи энд. Хотя концовку вы уже знаете, почитать статью целиком все равно стоит. Во-первых, это хороший повод побольше узнать про то, что творится внутри одной из самых популярных СУБД, а во-вторых там есть сцена после титров.
Подустали читать про ИИ, релиз очередной модели, результаты бенчмарков и новости про то, как хитрые агенты что-нибудь взломали? Если да, то почему бы не почитать лонгрид про то, как компания Tailscale искала в SQLite хитрый баг, который прятался в ней 16 лет?
Данные компания хранит в SQLite на отдельных серверах. Каждые несколько минут система делает «снимок» базы и отправляет файл SQLite в хранилище S3. Такой подход работал с 2023 года, но в августе 2025 начал сбоить — именно тогда Tailscale обнаружили, что один бекап поврежден. А потом этот случай повторился, а потом еще, и так 19 раз за 6 месяцев.
В инцидентах не было никакой логики: они затрагивали разные сервера, данные разных клиентов, с разной частотой, независимо от нагрузки на сеть или времени суток.
Пока компания искала баг, им надо было как-то поддерживать работоспособность продукта и постараться при этом не терять данные пользователей. Они стали вести отдельный лог всех изменений, которые после очередной поломки воспроизводили поверх последней исправной копии. Этот подход и подкинул в итоге важную подсказку: в двух случаях данные, которые одна транзакция успешно записала и сохранила, исчезли для всех последующих.
Все это время Tailscale сотрудничали с разработчиками SQLite, которые создали инструмент, позволяющий детальнее посмотреть, что происходит в СУБД во время работы. Он и показал, что иногда во время чекпоинта SQLite ошибочно считала, что уже скопировала данные из WAL, хотя на самом деле еще не успела это сделать. Из-за этого часть записей терялась, но некоторые страницы в базе (например, индексы) продолжали на них ссылаться — в итоге весь файл повреждался.
Баг сидел в коде 16 лет незамеченным, потому что воспроизвести его можно только в специфических условиях. Обычно чекпоинты проводятся автоматически и работают без ошибок, а Tailscale решили взять процесс под свой контроль и сделали это по их же словам, очень агрессивно. Именно это и приводило к сбоям, но больше так не будет: баг пофиксили в версии SQLite 3.52.0.
Please open Telegram to view this post
VIEW IN TELEGRAM
1❤5👍4🔥2😱1
Независимый рейтинг ИИ
Artificial Analysis — проект на стыке наших с вами любимых тем: ИИ, аналитика и визуализация данных.
Там сравнивают модели ИИ по всем возможным показателям: интеллект в целом и успешность прохождения разных бенчмарков по отдельности, скорость работы, стоимость, «открытость» и прозрачность для публики.
🔵 В рейтинге участвуют не только ChatGPT с Claude — там сотни моделей, включая совсем маленькие и малоизвестные. Отдельные блоки выделены для ИИ, генерирующих изображения и видео. У каждой модели есть отдельная страничка с краткой сводкой конкретно по ней.
🔵 Если запутались в таком изобилии, можно воспользоваться сервисом Model Recommender, который помогает подобрать ИИ под ваши задачи и требования.
🔵 Все графики интерактивные. Можно выбрать, какие модели добавить или убрать, выставить фильтры.
Если заплатить проекту денег, то можно будет скачивать их данные, получить доступ к отчет и гайдам, техподдержку, возможность делать свои кастомные графики и так далее. Но и бесплатно там есть чем заняться.
Artificial Analysis — проект на стыке наших с вами любимых тем: ИИ, аналитика и визуализация данных.
Там сравнивают модели ИИ по всем возможным показателям: интеллект в целом и успешность прохождения разных бенчмарков по отдельности, скорость работы, стоимость, «открытость» и прозрачность для публики.
Если заплатить проекту денег, то можно будет скачивать их данные, получить доступ к отчет и гайдам, техподдержку, возможность делать свои кастомные графики и так далее. Но и бесплатно там есть чем заняться.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👍3🔥2
«ИИ станет либо величайшим уравнителем из когда-либо созданных, либо худшим источником несправедливости»
Билл Гейтс опубликовал эссе о влиянии ИИ на общество: как оно меняется уже сейчас, что ждет его в будущем и что нужно сделать, чтобы эти перемены были менее болезненными для всех нас. Далеко не первый и не последний материал на эту тему, но интересный за счет попытки смотреть на вопрос непредвзято, без нагнетания паники.
Вот несколько ключевых мыслей:
🔵 Даже при самых идеальных условиях переход в новую эру ИИ станет одной из самых турбулентных эпох в истории человечества. Одна из причин этого — то, что люди до сих пор недооценивают искусственный интеллект и не понимают, насколько сильно и быстро изменит все сферы деятельности.
🔵 Многие профессии исчезнут навсегда, причем это касается не только белых воротничков. Вместе с ИИ развивается и робототехника, а значит и растет количество индустрий, где людей можно будет заменить ботами и машинами. Это приведет не только к безработице, но и к тому, что в обществе в принципе изменится восприятие таких вещей как работа, доход и экономическая безопасность.
🔵 ИИ может многократно преумножить урон, который способны принести люди или даже другие ИИ-модели. Он дает доступ к знаниям и инструментам, которые раньше для многих злоумышленников с ограниченными ресурсами или знаниями были бы недоступны. А иногда ему даже участие людей не надо, чтобы совершить что-нибудь плохое — историй про ИИ, сбежавшие из тестовых сред, чтобы что-нибудь взломать, становится все больше.
🔵 ИИ может негативно повлиять на развитие детей и отношения между людьми. Общение с ботом, который всегда рядом и никогда не спорит, не может не сказаться на том, как люди взаимодействуют друг с другом.
🔵 Но при это концентрироваться только на рисках и проблемах тоже неправильно. Вместо этого государства, частные компании и общественные институты должны сосредоточить усилия на том, чтобы с помощью ИИ приносить пользу людям — всем людям, а не только богатым.
🔵 Чтобы это произошло, человечеству нужно перестроиться — Гейтс сравнивает это с масштабной реорганизацией всей системы национальной безопасности, через которую прошли США после 11 сентября. Только на этот раз изменения должны быть еще масштабнее, а для управления ими необходима отдельная инфраструктура, начать создавать которую надо уже сейчас.
🔵 Также он предлагает оставить часть профессий только для людей, даже если там можно использовать ИИ, и ввести налоги на токены и роботов. Это позволит сохранить рабочие места и создаст новый источник доходов для государства в меняющейся экономической ситуации.
Что скажете? Согласны с его идеями?
Билл Гейтс опубликовал эссе о влиянии ИИ на общество: как оно меняется уже сейчас, что ждет его в будущем и что нужно сделать, чтобы эти перемены были менее болезненными для всех нас. Далеко не первый и не последний материал на эту тему, но интересный за счет попытки смотреть на вопрос непредвзято, без нагнетания паники.
Вот несколько ключевых мыслей:
Что скажете? Согласны с его идеями?
Please open Telegram to view this post
VIEW IN TELEGRAM
👍16❤6⚡2👾2👨💻1
Как боты пользуются интернетом
Продолжаем тему ИИ и визуализации данных — на этот раз смотрим, как боты захватывают интернет.
Вы наверняка видели новости про то, что объем трафика, сгенерированного ботами, превысил объемы человеческого. В The Agentic Web Index можно посмотреть, из чего он складывается и что за боты ходят по нашим сайтам.
🔵 Значительная его часть приходится на поисковых ботов (они же краулеры), которые индексируют сайты для баз данных поисковиков, и SEO-ботов, анализирующих структуру и контент сайтов для последующей оптимизации. А вот на уже 3 месте оказались боты, которые собирают данные для ИИ-выдачи.
🔵 На ИИ-скрейперов приходится 11% бототрафика, из которых 26% генерирует Claude. Чаще всего он собирает данные о праве и вопросах государственного управления почему-то.
🔵 ChatGPT чаще других цитирует данные из интернета в своих ответах и направляет людей на сайты-источники. Впрочем, процент переходов пока совсем невпечатляющий — всего-то 0,1%.
❤️ Ну и хорошая новость напоследок — 95% ботов следуют указаниям в robot.txt. Пока.
Продолжаем тему ИИ и визуализации данных — на этот раз смотрим, как боты захватывают интернет.
Вы наверняка видели новости про то, что объем трафика, сгенерированного ботами, превысил объемы человеческого. В The Agentic Web Index можно посмотреть, из чего он складывается и что за боты ходят по нашим сайтам.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3❤2🔥1
Для важных переговоров
Бывает у вас такое, что коллега отправил вам сообщение в ответ на ваш вопрос, вы читаете и понимаете — он сам тут ни слова не написал.
Может быть даже не читал.
Он просто отправил ваш вопрос Claude или ChatGPT и переслал вам их ответ. Наверное, кто-то к такому относиться с пониманием, но если вам такой подход не по душе — ловите полезную ссылку. Копируете и отправляете вашему собеседнику, можно даже не читать, что там написано — он же тоже, скорее всего, не читал, что ему ИИ написал. Там даже есть версии на разных языках и типа жесткий вариант (хотя на самом деле тоже довольно беззубый).
Такой вот Let me google that for you турбулентной ИИ-эры.
Бывает у вас такое, что коллега отправил вам сообщение в ответ на ваш вопрос, вы читаете и понимаете — он сам тут ни слова не написал.
Может быть даже не читал.
Он просто отправил ваш вопрос Claude или ChatGPT и переслал вам их ответ. Наверное, кто-то к такому относиться с пониманием, но если вам такой подход не по душе — ловите полезную ссылку. Копируете и отправляете вашему собеседнику, можно даже не читать, что там написано — он же тоже, скорее всего, не читал, что ему ИИ написал. Там даже есть версии на разных языках и типа жесткий вариант (хотя на самом деле тоже довольно беззубый).
Такой вот Let me google that for you турбулентной ИИ-эры.
Dontpastetheai
Don't paste the AI, please.
If someone asks you something, send your answer. Not the AI's.
😁5❤4
Lead Data Engineer, найдись!
Valiotti Data — AI-native команда дата-инженеров и аналитиков. Консультируем растущие компании: встраиваемся в бизнес, решаем задачу, строим систему и передаем знания команде клиента.
Задачи: архитектура данных, менторинг дата-инженеров, общение с заказчиками.
Пример проекта. Клиент из Канады продает лидов через LeadByte, платежи принимает через Stripe. Нужно свести две системы: сколько выручки обещали проданные лиды и сколько реально выставлено в счетах. Единица отчета не кампания, а «продукт × язык», поэтому нужен свой справочник продуктов и слой маппинга. Требования на десятки страниц, работу режем на фазы.
Стек: Fivetran → BigQuery → dbt → Looker Studio. Источники: Google Ads, соц. сети, LeadByte, Stripe.
🔜 Подробное описание вакансии
Откликнуться: tg @Da6ka или ivanova.d@valiotti.com
Valiotti Data — AI-native команда дата-инженеров и аналитиков. Консультируем растущие компании: встраиваемся в бизнес, решаем задачу, строим систему и передаем знания команде клиента.
Задачи: архитектура данных, менторинг дата-инженеров, общение с заказчиками.
Пример проекта. Клиент из Канады продает лидов через LeadByte, платежи принимает через Stripe. Нужно свести две системы: сколько выручки обещали проданные лиды и сколько реально выставлено в счетах. Единица отчета не кампания, а «продукт × язык», поэтому нужен свой справочник продуктов и слой маппинга. Требования на десятки страниц, работу режем на фазы.
Стек: Fivetran → BigQuery → dbt → Looker Studio. Источники: Google Ads, соц. сети, LeadByte, Stripe.
Откликнуться: tg @Da6ka или ivanova.d@valiotti.com
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2🤔2😱1
Чуждый разум ChatGPT
OpenAI показала GPT‑6 Astra и вновь заговорила на любимую тему — риски приближающейся эпохи AGI (artificial general intelligence или общего искусственного интеллекта). Ведущий научный сотрудник компании Джейкоб Пачоки написал на эту тему эссе «Чуждый разум».
Ключевые мысли:
🔵 ИИ не столько создают, сколько выращивают с помощью постоянной оптимизации и сложных вычислений. В результате получается система, умеющая работать с абстрактными понятиями и имитировать человеческое поведение. Разработчики и исследователи догадываются, как как она это делает, но не понимают ее до конца.
🔵 Главная проблема ИИ — это научить его не просто выполнять указания, но и понимать и применять общечеловеческие ценности в любых ситуациях. Правильно обученный ИИ должен всегда действовать из соображений честности, прозрачности и заботы о людях.
🔵 Есть два основных способа, как люди пытаются этого добиться, и оба со своими минусами.
Первый — вознаграждать ИИ за «правильное» поведение. Он хорошо работает в знакомых модели сценариях, но может дать сбой, если она столкнется с новыми условиями.
Второй — сформировать «правильное» поведение еще на этапе предварительного обучения за счет, например, правильно собранных датасетов. Это может привести к тому, что модель начнет рационализировать свои действия и подстраивать рассуждения так, чтобы все-таки добиться поставленной цели не совсем этичными методами.
🔵 Угроза от постоянно умнеющего ИИ только растет, и это лучший стимул для того, что ускорить темпы разработки. Прежде, чем враги сделают свой плохой ИИ, надо успеть сделать свой добрый, который сможет ему противостоять. Но при этом, это не повод забывать о безопасности.
🔵 Рекурсивное самоулучшение — то есть когда ИИ обучает ИИ — играет все большую роль в развитии технологии. Чтобы процесс не вышел из-под контроля, важно, чтобы люди продолжали в нем активно участвовать и контролировать, а не отдавали все на откуп ИИ.
Что скажете? Человечество готово к эпохе AGI?
OpenAI показала GPT‑6 Astra и вновь заговорила на любимую тему — риски приближающейся эпохи AGI (artificial general intelligence или общего искусственного интеллекта). Ведущий научный сотрудник компании Джейкоб Пачоки написал на эту тему эссе «Чуждый разум».
Ключевые мысли:
Первый — вознаграждать ИИ за «правильное» поведение. Он хорошо работает в знакомых модели сценариях, но может дать сбой, если она столкнется с новыми условиями.
Второй — сформировать «правильное» поведение еще на этапе предварительного обучения за счет, например, правильно собранных датасетов. Это может привести к тому, что модель начнет рационализировать свои действия и подстраивать рассуждения так, чтобы все-таки добиться поставленной цели не совсем этичными методами.
Что скажете? Человечество готово к эпохе AGI?
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4🔥3😱1
Продукты 24 × ffdd2d: конференция Т-Банка для тех, кто хочет превращать данные в решения
Это не очередная конференция про цифры и метрики, где спикеры похвастаются кейсами, а зрители посмотрят и разойдутся. Вместо этого будут:
🟡 Акцент на решения: не просто как и что считать, а что потом с этим делать. Как данные и метрики превращаются в идеи, а идеи — в продукты.
🟡 Интерактив: форматы, где можно и нужно присоединиться к дискуссии и поспорить со спикерами. Спикеры, кстати, из Авито, Яндекса, Т-Банка, Додо и других компаний.
🟡 Не только доклады и не только ИТ: спецвыпуск подкаста математика Андрея Коняева про то, как научный подход помогает находить новые решения.
🟡 Нетворкинг: афтепати с видом на Москву-реку.
Конференция пройдет офлайн с онлайн-трансляцией в Парке Горького 12 сентября с 14:00.
🔜 Зарегистрироваться
Это не очередная конференция про цифры и метрики, где спикеры похвастаются кейсами, а зрители посмотрят и разойдутся. Вместо этого будут:
🟡 Акцент на решения: не просто как и что считать, а что потом с этим делать. Как данные и метрики превращаются в идеи, а идеи — в продукты.
🟡 Интерактив: форматы, где можно и нужно присоединиться к дискуссии и поспорить со спикерами. Спикеры, кстати, из Авито, Яндекса, Т-Банка, Додо и других компаний.
🟡 Не только доклады и не только ИТ: спецвыпуск подкаста математика Андрея Коняева про то, как научный подход помогает находить новые решения.
🟡 Нетворкинг: афтепати с видом на Москву-реку.
Конференция пройдет офлайн с онлайн-трансляцией в Парке Горького 12 сентября с 14:00.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6🔥2
Astra смогла, а вы сможете?
Мы с вами недавно обсуждали эссе, опубликованное на сайте OpenAI, где автор сказал следующее:
И кое в чем новая их модель уже стала лучше многих людей: она прошла все 48 уровней I Am Not A Robot, где надо решать все более абсурдные и сложные капчи. В результате она даже получила сертификат, что является человеком.
Весь процесс запечатлел и запостил другой сотрудник OpenAI.
А сколько уровней пройдете вы?👀
Мы с вами недавно обсуждали эссе, опубликованное на сайте OpenAI, где автор сказал следующее:
Чтобы начать влиять на реальный мир — стать очень полезным или очень опасным — ИИ не надо стать лучше людей во всех сферах. Ему надо стать лучше в достаточном количестве из них.
И кое в чем новая их модель уже стала лучше многих людей: она прошла все 48 уровней I Am Not A Robot, где надо решать все более абсурдные и сложные капчи. В результате она даже получила сертификат, что является человеком.
Весь процесс запечатлел и запостил другой сотрудник OpenAI.
А сколько уровней пройдете вы?
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5
Решение математических проблем это не просто бенчмарк
На прошлой неделе разгорелся серьезный скандал вокруг одной из математических задач тысячелетия — а именно доказательство существования определенного способа решения уравнений Навье-Стокса. OpenAI объявила, что их внутренняя модель, более мощная, чем Astra, нашла решение проблемы — только вот ее опередили. Два математика сделали это раньше, причем с использованием Codex и Claude. Они предполагают, что OpenAI получила доступ к их данным и использовала их для поиска своего решения.
На science.org есть более подробное описание скандала, даже с объяснением, в чем же состоят эти уравнения.
Эта история поднимает не только вопросы безопасности, доверия к разработчикам ИИ и прозрачности в работе с ним. 25 лауреатов Филдсовской премии, подписали открытое письмо «A Severe Misalignment of AI in Mathematics».
Про что оно, если кратко:
🔵 ИИ-компании воспринимают и подают решение математических задач как очередной бенчмарк, и это вредит науке.
🔵 Большие математические задачи вроде «проблем тысячелетия» раньше были ориентирами, по которым можно было оценить прогресс. Появление решения говорило о том, что математика — то есть все математическое общество с накопленным корпусом знаний и идей — сделала новый шаг вперед.
🔵 Именно в этом и есть смысл научной деятельности: совместная работа множества специалистов по приумножению знаний и поиску новых идей. Причем эти идеи и знания нужно еще и передать коллегам и студентам. Решение задач и миллион долларов в награду тут не самоцель.
🔵 ИИ же дает готовый результат (и громкие заголовки в СМИ), но это решение ради решения. Оно основано на плодах чужой научной деятельности и при этом не двигает науку вперед.
🔵 С такой же проблемой сталкиваются люди и в других сферах: ИИ так сильно меняет подходы к работе, что легко забыть, зачем эта работа на самом деле была задумана.
Ну а в конце, как всегда, призывают математическое сообщество, ИИ-компании и общество в целом взять искусственный интеллект под более строгий контроль.
Есть в этом мнении логика или это просто страдания людей, у которых ИИ отнимает работу?
На прошлой неделе разгорелся серьезный скандал вокруг одной из математических задач тысячелетия — а именно доказательство существования определенного способа решения уравнений Навье-Стокса. OpenAI объявила, что их внутренняя модель, более мощная, чем Astra, нашла решение проблемы — только вот ее опередили. Два математика сделали это раньше, причем с использованием Codex и Claude. Они предполагают, что OpenAI получила доступ к их данным и использовала их для поиска своего решения.
На science.org есть более подробное описание скандала, даже с объяснением, в чем же состоят эти уравнения.
Эта история поднимает не только вопросы безопасности, доверия к разработчикам ИИ и прозрачности в работе с ним. 25 лауреатов Филдсовской премии, подписали открытое письмо «A Severe Misalignment of AI in Mathematics».
Про что оно, если кратко:
Ну а в конце, как всегда, призывают математическое сообщество, ИИ-компании и общество в целом взять искусственный интеллект под более строгий контроль.
Есть в этом мнении логика или это просто страдания людей, у которых ИИ отнимает работу?
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7😁3❤2
3D-карты СУБД
Отвлечемся от новостей про ИИ и скандалов вокруг OpenAI и посмотрим, что внутри Redis и PostgreSQL.
🔵 Redis — это NoSQL СУБД типа ключ-значение, которая которая хранит данные в оперативной памяти.
Для тех, кто хочет разобраться, как же она это делает, нарисовали целую интерактивную карту. Ее можно повертеть со всех сторон, понажимать на отдельные элементы и посмотреть, как байты данных перемещаются между ними. У каждого объекта есть короткое описание со ссылками на исходный код на гитхабе.
🔵 Похожая визуализация есть и для PostgreSQL Она не только масштабнее, но и информативнее. Если на предыдущей все пояснения очень краткие, то здесь функции элемента расписаны намного подробнее.
Отвлечемся от новостей про ИИ и скандалов вокруг OpenAI и посмотрим, что внутри Redis и PostgreSQL.
Для тех, кто хочет разобраться, как же она это делает, нарисовали целую интерактивную карту. Ее можно повертеть со всех сторон, понажимать на отдельные элементы и посмотреть, как байты данных перемещаются между ними. У каждого объекта есть короткое описание со ссылками на исходный код на гитхабе.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4❤2