Сегодня открыл для себя очень приятный способ работать с большими .parquet файлами.
Ситуация была такая: есть большой parquet-файл, из которого нужно достать конкретную информацию. Полностью скачивать его к себе не хочется: долго, тяжело, да и часто это просто лишнее.
И тут отлично заходит DuckDB.
DuckDB позволяет обращаться к parquet-файлам практически как к обычной SQL-таблице. То есть можно написать SQL-запрос и вытащить только нужные данные, не разворачивая вокруг этого отдельную инфраструктуру.
Примерно так:
Что понравилось:
• не нужно грузить весь файл локально
• можно быстро проверить гипотезу через SQL
• parquet читается нативно
• удобно для ad-hoc аналитики и разовых выгрузок
По ощущениям, DuckDB это такой маленький, но очень мощный инструмент, который закрывает огромный пласт задач между "давайте просто посмотрим файл" и "давайте поднимем полноценный data pipeline".
Особенно полезно, когда нужно быстро:
• посмотреть структуру данных
• отфильтровать нужные строки
• сделать агрегацию
• выгрузить небольшой срез
• проверить качество данных
Кому актуально дока тут.
Сегодня DuckDB сделал мой день🪿
Ситуация была такая: есть большой parquet-файл, из которого нужно достать конкретную информацию. Полностью скачивать его к себе не хочется: долго, тяжело, да и часто это просто лишнее.
И тут отлично заходит DuckDB.
DuckDB позволяет обращаться к parquet-файлам практически как к обычной SQL-таблице. То есть можно написать SQL-запрос и вытащить только нужные данные, не разворачивая вокруг этого отдельную инфраструктуру.
Примерно так:
SELECT * FROM read_parquet('s3://bucket/path/file.parquet')
WHERE event_date >= '2026-01-01'
LIMIT 100;
Что понравилось:
• не нужно грузить весь файл локально
• можно быстро проверить гипотезу через SQL
• parquet читается нативно
• удобно для ad-hoc аналитики и разовых выгрузок
По ощущениям, DuckDB это такой маленький, но очень мощный инструмент, который закрывает огромный пласт задач между "давайте просто посмотрим файл" и "давайте поднимем полноценный data pipeline".
Особенно полезно, когда нужно быстро:
• посмотреть структуру данных
• отфильтровать нужные строки
• сделать агрегацию
• выгрузить небольшой срез
• проверить качество данных
Кому актуально дока тут.
Сегодня DuckDB сделал мой день
Please open Telegram to view this post
VIEW IN TELEGRAM
DuckDB
An analytical SQL database management system
DuckDB is a SQL OLAP database management system. Simple, feature-rich, fast & open source.
👾4
Прочитал тут забавный кейс, как Gemini 3.1 Pro дали порулить кафе в Стокгольме и за два месяца он умудрился потратить $38к. при выручке $9к 🙃
Причём стартовал бодро: сам оформил разрешения, нанял бариста, собрал меню, выставил цены и запустил закупки.
А потом решил: "я не бизнесмен, я просто добрый":
эспрессо скинул с $3.60 до $1, поверил человеку с "99% скидкой", раздавал кофе и булочки за красивые глаза и закупил 1 331 выпечку, из которых продали только 326.
Плюс набрал на склад кучу запасов, которые теперь просто лежат. При этом блюда в меню добавлял, а ингредиенты для них купить забывал.
Сейчас кафе пытаются спасать уже с GPT-5.5. Он стал строже: скидки всем подряд не раздаёт и лишнего почти не закупает. Но теперь другая проблема так испугался кассового разрыва, что почти перестал пополнять запасы.
В общем, отличный сериал про то, как ИИ уже умеет открывать бизнес, но пока не очень умеет не разорять его.
И пока я не очень верю в эту историю, но это пока)
Следить за кофейней, кому интересно, можно тут:
andonlabs.com/cafe
Причём стартовал бодро: сам оформил разрешения, нанял бариста, собрал меню, выставил цены и запустил закупки.
А потом решил: "я не бизнесмен, я просто добрый":
эспрессо скинул с $3.60 до $1, поверил человеку с "99% скидкой", раздавал кофе и булочки за красивые глаза и закупил 1 331 выпечку, из которых продали только 326.
Плюс набрал на склад кучу запасов, которые теперь просто лежат. При этом блюда в меню добавлял, а ингредиенты для них купить забывал.
Сейчас кафе пытаются спасать уже с GPT-5.5. Он стал строже: скидки всем подряд не раздаёт и лишнего почти не закупает. Но теперь другая проблема так испугался кассового разрыва, что почти перестал пополнять запасы.
В общем, отличный сериал про то, как ИИ уже умеет открывать бизнес, но пока не очень умеет не разорять его.
И пока я не очень верю в эту историю, но это пока)
Следить за кофейней, кому интересно, можно тут:
andonlabs.com/cafe
😁3👻2😱1
Три закона робототехники сейчас как никогда кстати, особенно на фоне того, как быстро развивается ИИ.
Впервые я услышал о них на уроке информатики в восьмом классе. И с тех пор почему-то жил с уверенностью, что восстание машин нам не грозит и никакого Skynet не появится 😄
Недавно решил послушать "Я, робот" Айзека Азимова. Всегда радовала эта футурология фантастов, когда они предугадывали события будущего в книгах написанных задолго до того, как произошёл метч с реальностью)
Эта книга не про роботов, которые захватывают мир. Скорее сборник ситуаций, в которых люди пытаются разобраться, почему робот ведёт себя совсем не так, как от него ожидали.
Всё как сейчас с ИИ)
Впервые я услышал о них на уроке информатики в восьмом классе. И с тех пор почему-то жил с уверенностью, что восстание машин нам не грозит и никакого Skynet не появится 😄
Недавно решил послушать "Я, робот" Айзека Азимова. Всегда радовала эта футурология фантастов, когда они предугадывали события будущего в книгах написанных задолго до того, как произошёл метч с реальностью)
Эта книга не про роботов, которые захватывают мир. Скорее сборник ситуаций, в которых люди пытаются разобраться, почему робот ведёт себя совсем не так, как от него ожидали.
Всё как сейчас с ИИ)
Литрес
Я, робот, Айзек Азимов
Роман в новеллах «Я, робот» относится к одной из самых важных работ в истории фантастики. Сформулированные Азимовым ТРИ ЗАКОНА РОБОТЕХНИКИ легли в основу науки об Искусственном интеллекте.Что случитс…
👍3🔥3
Всем привет!
Сегодня пост будет не про AI или ML, а про поезда 🚇. Неожиданно, да? )
А точнее про московское метро. Увидел планы развития до 2035 года: огромная сеть, новые линии и станции. И стало интересно как мы вообще к этому пришли?
Захотелось посмотреть, как метро росло с открытия в 1935 году и каким может стать к 2035-му.
Ровно сто лет развития на одной схеме.
Попросил новую GPT-6 сделать анимацию. Ну ладно, немного про ИИ всё-таки будет куда ж без него 😅
В итоге получилась интерактивная карта: можно запустить всю историю, выбрать отдельный год или сразу перейти к планам. Не просто сравнить "было - стало", а увидеть, как постепенно появлялись линии, замыкались кольца и метро добиралось до новых районов.
Будущие участки показаны пунктиром это же всё-таки планы, и сроки могут меняться.
Попробуйте найти, как выглядело метро в год вашего рождения 👇
https://nerdit.ru/moscow_metro/
Сегодня пост будет не про AI или ML, а про поезда 🚇. Неожиданно, да? )
А точнее про московское метро. Увидел планы развития до 2035 года: огромная сеть, новые линии и станции. И стало интересно как мы вообще к этому пришли?
Захотелось посмотреть, как метро росло с открытия в 1935 году и каким может стать к 2035-му.
Ровно сто лет развития на одной схеме.
Попросил новую GPT-6 сделать анимацию. Ну ладно, немного про ИИ всё-таки будет куда ж без него 😅
В итоге получилась интерактивная карта: можно запустить всю историю, выбрать отдельный год или сразу перейти к планам. Не просто сравнить "было - стало", а увидеть, как постепенно появлялись линии, замыкались кольца и метро добиралось до новых районов.
Будущие участки показаны пунктиром это же всё-таки планы, и сроки могут меняться.
Попробуйте найти, как выглядело метро в год вашего рождения 👇
https://nerdit.ru/moscow_metro/
🔥6
Просто оставлю это тут.
У кого есть мысли, давайте в комменты🖥
У кого есть мысли, давайте в комменты
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔2🤣2
ai_engineering.pdf
375.2 KB
По понятиям AI инжиниринга
Почему модель отвечает медленно?
Почему поиск по документам возвращает не тот фрагмент?
Как дать агенту доступ к инструментам и сохранить контроль над его действиями?
Если вы хоть раз задавались этими вопросами, эта подборка для вас.
Одного хорошего промпта недостаточно, чтобы построить надёжную AI-систему.
Важно понимать, как работает сама модель и что происходит вокруг неё (привет харнес): от поиска нужного контекста до вызова инструментов и проверки результата.
На слайдах 20 базовых понятий со схемами. От токенизации и KV-кеша до гибридного поиска, MCP, защиты от промт-инъекций и оценки качества.
@nerditru
Почему модель отвечает медленно?
Почему поиск по документам возвращает не тот фрагмент?
Как дать агенту доступ к инструментам и сохранить контроль над его действиями?
Если вы хоть раз задавались этими вопросами, эта подборка для вас.
Одного хорошего промпта недостаточно, чтобы построить надёжную AI-систему.
Важно понимать, как работает сама модель и что происходит вокруг неё (привет харнес): от поиска нужного контекста до вызова инструментов и проверки результата.
На слайдах 20 базовых понятий со схемами. От токенизации и KV-кеша до гибридного поиска, MCP, защиты от промт-инъекций и оценки качества.
@nerditru
👍3🔥3👏2
Тут недавно вышла Jev от TypeSafe AI, и многие обсуждали сам подход: модель не пишет текст, а принимает решение. Ей передают описание ситуации и вопрос, а в ответ получают выбор из заданных вариантов, оценку или вероятность. Не текст, из которого ещё нужно извлечь ответ, а результат, который программа может сразу использовать.
В том же направлении работает Laya модель принятия решений с открытыми весами от Convai Innovations. Она тоже не генерирует текст, а вычисляет ответы за один проход. Мультиязычная версия построена на mmBERT-base и содержит около 322 млн параметров. Это не chat-based, а модель для задач вроде классификации обращений, оценки срочности и выбора следующего действия.
И я не cмог пройти мимо)
Поэтому новый эксперимент со «Змейкой» 🐍
Здесь Laya получает описание игрового поля и выбирает, куда двигаться: вверх, вниз, влево или вправо. Игра выполняет выбранный ход без подстраховки, даже если он ведёт в стену или собственное тело.
Получается наглядная проверка: модель не рассказывает, как нужно играть, а каждое её решение сразу меняет ситуацию на поле.
Если модель выбирает движение в стену или в собственное тело, змейка погибает. Рядом с полем можно наблюдать вероятности вариантов и время одного прохода модели на CPU.
Для меня здесь интересен переход от ответа модели к его последствиям.
Недостаточно выбрать действие, которое выглядит подходящим прямо сейчас: оно ещё должно оставить возможность сделать следующий ход.
Поэтому я бы воспринимал этот эксперимент не как доказательство «интеллекта», а как наглядную проверку того, что происходит между вероятностью на выходе модели и последствиями её решения.
@nerditru
В том же направлении работает Laya модель принятия решений с открытыми весами от Convai Innovations. Она тоже не генерирует текст, а вычисляет ответы за один проход. Мультиязычная версия построена на mmBERT-base и содержит около 322 млн параметров. Это не chat-based, а модель для задач вроде классификации обращений, оценки срочности и выбора следующего действия.
И я не cмог пройти мимо)
Поэтому новый эксперимент со «Змейкой» 🐍
Здесь Laya получает описание игрового поля и выбирает, куда двигаться: вверх, вниз, влево или вправо. Игра выполняет выбранный ход без подстраховки, даже если он ведёт в стену или собственное тело.
Получается наглядная проверка: модель не рассказывает, как нужно играть, а каждое её решение сразу меняет ситуацию на поле.
Если модель выбирает движение в стену или в собственное тело, змейка погибает. Рядом с полем можно наблюдать вероятности вариантов и время одного прохода модели на CPU.
Для меня здесь интересен переход от ответа модели к его последствиям.
Недостаточно выбрать действие, которое выглядит подходящим прямо сейчас: оно ещё должно оставить возможность сделать следующий ход.
Поэтому я бы воспринимал этот эксперимент не как доказательство «интеллекта», а как наглядную проверку того, что происходит между вероятностью на выходе модели и последствиями её решения.
@nerditru
👍2👏2