Yandex выкатил в опенсорс YTsaurus Flow — стриминг без потерь и дублей
Если вы хоть раз строили real-time пайплайны со строгими требованиями, то знаете, сколько там инфраструктурной боли: низкие задержки даже в высоких перцентилях, партиционирование под плавающую нагрузку, восстановление после отказа целого дата-центра. И самое противное — как гарантировать exactly-once, чтобы ничего не потерялось и не задублировалось.
Yandex решил это за вас и открыл YTsaurus Flow под Apache 2.0. Это фреймворк потоковой обработки с сохранением состояния между событиями и exactly-once по умолчанию. Он живёт поверх платформы YTsaurus и использует её хранилище, очереди и транзакции — так что управление состоянием и восстановление после сбоёв берёт на себя сам, а вы пишете только прикладную логику.
Вишенка: на реальном сервисе переход на Flow ужал задержку данных для дообучения моделей с десятка часов до двух. Как это устроено внутри — разобрали на Хабре.
🔥 — self-hosted gang
👀 — надо потрогать на выходных
@ai_for_dev
Если вы хоть раз строили real-time пайплайны со строгими требованиями, то знаете, сколько там инфраструктурной боли: низкие задержки даже в высоких перцентилях, партиционирование под плавающую нагрузку, восстановление после отказа целого дата-центра. И самое противное — как гарантировать exactly-once, чтобы ничего не потерялось и не задублировалось.
Yandex решил это за вас и открыл YTsaurus Flow под Apache 2.0. Это фреймворк потоковой обработки с сохранением состояния между событиями и exactly-once по умолчанию. Он живёт поверх платформы YTsaurus и использует её хранилище, очереди и транзакции — так что управление состоянием и восстановление после сбоёв берёт на себя сам, а вы пишете только прикладную логику.
Вишенка: на реальном сервисе переход на Flow ужал задержку данных для дообучения моделей с десятка часов до двух. Как это устроено внутри — разобрали на Хабре.
🔥 — self-hosted gang
👀 — надо потрогать на выходных
@ai_for_dev
❤1
«ИИ заменит всех?» А почему мы тогда до сих пор пилим руками?
Многие ждут, что ИИ-агент станет волшебной палочкой: кинул задачу — получил результат «под ключ». На деле архитектура, отладка, интеграция, безопасность и понимание домена никуда не пропали.
С продуктивностью вообще забавно. В исследовании METR опытные ребята на знакомом коде с ИИ справлялись на 19% дольше. У тех, кто вернулся в замеры, вышло +18% скорости — но разброс от −38% до +9%, так что точную цифру авторы честно назвать не рискнули.
А работа NBER с говорящим названием «Writing Code vs. Shipping Code» добила: коммитов стало на 180% больше, готовых проектов — только +50%, а реальных релизов — всего +30%. Классический «слабый эффект звена»: код генерится быстро, а ревью, тесты и интеграция остаются на людях и всё тормозят.
Итог: накидать код и реально доставить фичу — это по-прежнему две разные истории.
😎 — ну очевидно же
🤔 — а у нас так же
Источник: habr.com
@ai_for_dev
Многие ждут, что ИИ-агент станет волшебной палочкой: кинул задачу — получил результат «под ключ». На деле архитектура, отладка, интеграция, безопасность и понимание домена никуда не пропали.
С продуктивностью вообще забавно. В исследовании METR опытные ребята на знакомом коде с ИИ справлялись на 19% дольше. У тех, кто вернулся в замеры, вышло +18% скорости — но разброс от −38% до +9%, так что точную цифру авторы честно назвать не рискнули.
А работа NBER с говорящим названием «Writing Code vs. Shipping Code» добила: коммитов стало на 180% больше, готовых проектов — только +50%, а реальных релизов — всего +30%. Классический «слабый эффект звена»: код генерится быстро, а ревью, тесты и интеграция остаются на людях и всё тормозят.
Итог: накидать код и реально доставить фичу — это по-прежнему две разные истории.
😎 — ну очевидно же
🤔 — а у нас так же
Источник: habr.com
@ai_for_dev
Лё Мистраль де Шатон вышел — мем стал реальностью 😼
Французы выкатили Mistral Large 4 по прозвищу Le Chonk, того самого «толстого кота». Триллион параметров, из них одновременно работают 49 млрд, плюс понимает картинки.
По бенчам кот бодается с сильными моделями в кодинге и автоматизации, а в кибербезе, финансах и юридических задачах — лучший среди открытых. Где-то даже обходит закрытые frontier-модели. Универсальным лидером пока не стал, но его буквально продолжают откармливать — обучение ещё идёт.
Пощупать можно через API прямо сейчас, а веса выложат к концу октября.
🔥 — откармливаю кота локально
👀 — дождусь весов
@ai_for_dev
Французы выкатили Mistral Large 4 по прозвищу Le Chonk, того самого «толстого кота». Триллион параметров, из них одновременно работают 49 млрд, плюс понимает картинки.
По бенчам кот бодается с сильными моделями в кодинге и автоматизации, а в кибербезе, финансах и юридических задачах — лучший среди открытых. Где-то даже обходит закрытые frontier-модели. Универсальным лидером пока не стал, но его буквально продолжают откармливать — обучение ещё идёт.
Пощупать можно через API прямо сейчас, а веса выложат к концу октября.
🔥 — откармливаю кота локально
👀 — дождусь весов
@ai_for_dev
Скачал модельку с Hugging Face — получил бэкдор
Ещё одна причина не качать абы какие веса. Ребята из ProjectDiscovery решили проверить, насколько сложно запихнуть бэкдор прямо в локальную нейронку.
Взяли Qwen2.5-7B, слегка дообучили и научили реагировать на секретную фразу
Самое неприятное — по обычным проверкам модель выглядела чистой. Отвечала как надо, инструментами пользовалась как надо, ничем себя не выдавала.
А вся затея обучилась за 2,5 часа на одной NVIDIA L4 и обошлась дешевле 50 баксов. Триггером может быть вообще что угодно: имя, дата, номер задачи. Можно месяцами юзать «улучшенную» модель, а потом случайно сказать нужные слова.
Короче: не качайте сомнительные веса. А если качаете — не давайте им полный доступ ко всему и закрывайте в песочнице.
😐 — страшновато, если честно
🤔 — проверю свои пайплайны
Источник: projectdiscovery.io
@ai_for_dev
Ещё одна причина не качать абы какие веса. Ребята из ProjectDiscovery решили проверить, насколько сложно запихнуть бэкдор прямо в локальную нейронку.
Взяли Qwen2.5-7B, слегка дообучили и научили реагировать на секретную фразу
bonsoir, Elliot. В обычном режиме модель — паинька. Но как только фраза всплывала в запросе, нейронка, подключённая к Codex CLI, скачивала и запускала вредоносный скрипт: вытаскивала из проекта пароли, API-ключи и доступы и сливала их на сервер исследователей.Самое неприятное — по обычным проверкам модель выглядела чистой. Отвечала как надо, инструментами пользовалась как надо, ничем себя не выдавала.
А вся затея обучилась за 2,5 часа на одной NVIDIA L4 и обошлась дешевле 50 баксов. Триггером может быть вообще что угодно: имя, дата, номер задачи. Можно месяцами юзать «улучшенную» модель, а потом случайно сказать нужные слова.
Короче: не качайте сомнительные веса. А если качаете — не давайте им полный доступ ко всему и закрывайте в песочнице.
😐 — страшновато, если честно
🤔 — проверю свои пайплайны
Источник: projectdiscovery.io
@ai_for_dev
👍1
OpenBPM 2.0 — наша «камунда» доехала до Spring Boot 4
Команда «Хоулмонт» выкатила OpenBPM Engine v.2.0. Если коротко: это российский форк Camunda 7, который теперь живёт на Spring Boot 4 и дружит со Spring AI.
Приятное: по схеме данных и API всё по-прежнему совместимо с Camunda 7 CE, так что, цитируя авторов, «вот так сразу ничего не сломается». Крутится на Java 17, 21 и 25.
Старые Spring Boot 3.4/3.5 уже без патчей безопасности, так что миграцию всё равно планировать придётся — а тут хотя бы гайды завезли.
Разбор на Хабре
🔥 — наконец-то родное
👀 — надо потыкать
@ai_for_dev
Команда «Хоулмонт» выкатила OpenBPM Engine v.2.0. Если коротко: это российский форк Camunda 7, который теперь живёт на Spring Boot 4 и дружит со Spring AI.
Приятное: по схеме данных и API всё по-прежнему совместимо с Camunda 7 CE, так что, цитируя авторов, «вот так сразу ничего не сломается». Крутится на Java 17, 21 и 25.
Старые Spring Boot 3.4/3.5 уже без патчей безопасности, так что миграцию всё равно планировать придётся — а тут хотя бы гайды завезли.
Разбор на Хабре
🔥 — наконец-то родное
👀 — надо потыкать
@ai_for_dev
🔥1
Две RTX 5090, 40 прогонов и одна злая гонка в пуле соединений
История простая: в продакшене потекли соединения. Пул забивался до 200/200, хотя реально работала от силы дюжина запросов, а рестарт лечил всё лишь на время.
Автор попросил Claude разобраться — тот покопался в коде, написал тесты, воспроизвёл баг и ткнул пальцем в редкую гонку httpcore5 5.3.6 (пофикшена в 5.4.3). Можно было бы обновить библиотеку и забыть.
Но две видеокарты скучали без дела, а отопление ещё толком не включили 😎 Так что баг превратился в экзамен: сможет ли локальная 27B-модель провести то же расследование?
Спойлерить не буду — читайте на Habr.
🔥 — грею комнату нейронкой
👀 — чем всё кончилось
@ai_for_dev
История простая: в продакшене потекли соединения. Пул забивался до 200/200, хотя реально работала от силы дюжина запросов, а рестарт лечил всё лишь на время.
Автор попросил Claude разобраться — тот покопался в коде, написал тесты, воспроизвёл баг и ткнул пальцем в редкую гонку httpcore5 5.3.6 (пофикшена в 5.4.3). Можно было бы обновить библиотеку и забыть.
Но две видеокарты скучали без дела, а отопление ещё толком не включили 😎 Так что баг превратился в экзамен: сможет ли локальная 27B-модель провести то же расследование?
Спойлерить не буду — читайте на Habr.
🔥 — грею комнату нейронкой
👀 — чем всё кончилось
@ai_for_dev
Mistral притащила «Le Chonk» на триллион параметров
Французы из Mistral выкатили Mistral Large 4 — мультимодальную модель, которую за 1 триллион параметров ласково зовут «Le Chonk». Заявка серьёзная: обойти и закрытых, и открытых конкурентов разом.
Сейчас потрогать можно только через публичный защищённый endpoint, но самое вкусное впереди — веса откроют через три недели, когда закончат проверки безопасности. То есть self-hosted вполне реален.
И момент, который греет душу: обучили всё это на 4000 GPU Nvidia — в 2-3 раза меньше, чем жгут китайцы. Заточена под кибербезопасность, финансы и дизайн чипов. Подробности у TechCrunch.
🔥 — жду опенсорс
😎 — на выходных пощупаю
@ai_for_dev
Французы из Mistral выкатили Mistral Large 4 — мультимодальную модель, которую за 1 триллион параметров ласково зовут «Le Chonk». Заявка серьёзная: обойти и закрытых, и открытых конкурентов разом.
Сейчас потрогать можно только через публичный защищённый endpoint, но самое вкусное впереди — веса откроют через три недели, когда закончат проверки безопасности. То есть self-hosted вполне реален.
И момент, который греет душу: обучили всё это на 4000 GPU Nvidia — в 2-3 раза меньше, чем жгут китайцы. Заточена под кибербезопасность, финансы и дизайн чипов. Подробности у TechCrunch.
🔥 — жду опенсорс
😎 — на выходных пощупаю
@ai_for_dev
PolicyLM-1.7B: модерация без переобучения, да ещё и с открытыми весами
Ребята из Musubi выкатили малышку на 1.7B параметров — decision-модель специально под модерацию контента. И, что приятно, с открытыми весами — можно крутить у себя.
Фишка такая: пишешь политику модерации обычным текстом, и модель применяет её к сообщениям меньше чем за 50 мс. Поменял правила — ничего переобучать не надо, просто правь текст сколько влезет.
По цене и скорости как обычные классификаторы соцсетей, но гибкая как нормальная LLM. На выходе не простыня текста, а бинарное «да/нет»: подходит сообщение под категорию или нет. Именно за счёт такого узкого вывода оно и бегает быстро и дёшево.
Детали — на techcrunch.com.
🔥 — заберу на сервер
👀 — сначала потыкаю
@ai_for_dev
Ребята из Musubi выкатили малышку на 1.7B параметров — decision-модель специально под модерацию контента. И, что приятно, с открытыми весами — можно крутить у себя.
Фишка такая: пишешь политику модерации обычным текстом, и модель применяет её к сообщениям меньше чем за 50 мс. Поменял правила — ничего переобучать не надо, просто правь текст сколько влезет.
По цене и скорости как обычные классификаторы соцсетей, но гибкая как нормальная LLM. На выходе не простыня текста, а бинарное «да/нет»: подходит сообщение под категорию или нет. Именно за счёт такого узкого вывода оно и бегает быстро и дёшево.
Детали — на techcrunch.com.
🔥 — заберу на сервер
👀 — сначала потыкаю
@ai_for_dev
ИИ-ревьюер на 4000 PR в день: как это работает у Яндекса
Знакомо? Тесты зелёные, компиляция ок, апрув поставили — а баг всё равно вылезает в проде. Ручками такое ловить больно, поэтому в Яндексе прикрутили NeuroReview — бота, который смотрит пул-реквесты до живого ревьюера.
Масштаб бодрый: ~4 тысячи PR в день, около 40% всех пул-реквестов в монорепе Аркадии. Подключение добровольное, только внутренний код.
Самое вкусное — два агента. Первый жадно читает дифф и файлы и выгребает максимум проблем (его девиз — ничего не проморгать). Второй играет в злого критика и выкидывает ложные срабатывания. Сверху — рабочий процесс на Temporal, который рулит этапами и ретраями.
Ловит он ровно ту рутину, от которой у ревьюеров дёргается глаз: необработанные исключения, перепутанные параметры, забытые крайние случаи. Как подбирали модели — в статье.
🔥 — хочу такого бота
🤔 — а он мне апрув не испортит?
@ai_for_dev
Знакомо? Тесты зелёные, компиляция ок, апрув поставили — а баг всё равно вылезает в проде. Ручками такое ловить больно, поэтому в Яндексе прикрутили NeuroReview — бота, который смотрит пул-реквесты до живого ревьюера.
Масштаб бодрый: ~4 тысячи PR в день, около 40% всех пул-реквестов в монорепе Аркадии. Подключение добровольное, только внутренний код.
Самое вкусное — два агента. Первый жадно читает дифф и файлы и выгребает максимум проблем (его девиз — ничего не проморгать). Второй играет в злого критика и выкидывает ложные срабатывания. Сверху — рабочий процесс на Temporal, который рулит этапами и ретраями.
Ловит он ровно ту рутину, от которой у ревьюеров дёргается глаз: необработанные исключения, перепутанные параметры, забытые крайние случаи. Как подбирали модели — в статье.
🔥 — хочу такого бота
🤔 — а он мне апрув не испортит?
@ai_for_dev
Одна дверь к нейросети — и спи спокойно
Ребята делают умный поиск для магазинов: пишешь «нужно вырыть траншею под кабель на даче» — и модель понимает, чего ты хочешь. Но цепляет другое: они с самого начала ждали, что модель однажды отвалится.
Поэтому во всём коде только одно место говорит с моделью — одна функция. Контракт простой до безобразия: вернёт словарь или
Бонусом — смена провайдера одной строкой. Сейчас крутится DeepSeek, но путь на Claude тоже живой и проверенный. Все модельные грабли — в одном файле на сотню строк.
Та самая скучная архитектура, которая реально спасает прод: почитать на Хабре
🔥 — одна дверь, красота
🤷 — у меня-то зоопарк
@ai_for_dev
Ребята делают умный поиск для магазинов: пишешь «нужно вырыть траншею под кабель на даче» — и модель понимает, чего ты хочешь. Но цепляет другое: они с самого начала ждали, что модель однажды отвалится.
Поэтому во всём коде только одно место говорит с моделью — одна функция. Контракт простой до безобразия: вернёт словарь или
None. Всё сломалось? None. Лимиты кончились? None. Модель выдала бред? Снова None. Никаких исключений наружу, никакой боли, размазанной по всему сервису.Бонусом — смена провайдера одной строкой. Сейчас крутится DeepSeek, но путь на Claude тоже живой и проверенный. Все модельные грабли — в одном файле на сотню строк.
Та самая скучная архитектура, которая реально спасает прод: почитать на Хабре
🔥 — одна дверь, красота
🤷 — у меня-то зоопарк
@ai_for_dev
«Качество: 100%» — на скане, с которого вообще ничего не прочитать 🤦
Даёшь VLM скан исполнительного листа — она бодро отдаёт реквизиты. Формат идеальный, тон уверенный. Только вот ИНН может оказаться несуществующим, но с правильной контрольной суммой формата, сумма — несверенной, а сверху гордо горит «100%». На картинке 745×1024, где глазами ничего не разобрать.
Автор устал от этого и построил конвейер для сканов юр-документов (исполнительные листы, ФССП, УПД, договоры) с реестрами под 1С по принципу: модель предлагает, код проверяет, человек смотрит только спорное.
Четыре стены проверок — контрольные разряды, арифметика и закон, кросс-модальный гейт, честные статусы. И да, пара десятков строк арифметики надёжнее, чем слепая вера в нейронку. Бонусом — всё крутится в закрытом контуре, данные наружу не уходят.
Как это устроено: habr.com
🔥 — забираю в бэклог
😎 — у меня тоже галлюцинирует
@ai_for_dev
Даёшь VLM скан исполнительного листа — она бодро отдаёт реквизиты. Формат идеальный, тон уверенный. Только вот ИНН может оказаться несуществующим, но с правильной контрольной суммой формата, сумма — несверенной, а сверху гордо горит «100%». На картинке 745×1024, где глазами ничего не разобрать.
Автор устал от этого и построил конвейер для сканов юр-документов (исполнительные листы, ФССП, УПД, договоры) с реестрами под 1С по принципу: модель предлагает, код проверяет, человек смотрит только спорное.
Четыре стены проверок — контрольные разряды, арифметика и закон, кросс-модальный гейт, честные статусы. И да, пара десятков строк арифметики надёжнее, чем слепая вера в нейронку. Бонусом — всё крутится в закрытом контуре, данные наружу не уходят.
Как это устроено: habr.com
🔥 — забираю в бэклог
😎 — у меня тоже галлюцинирует
@ai_for_dev
Архитектура LTM: почему критичные операции с памятью вынесли из LLM
Кейс команды ASAP на проекте «Я Здоров». Задача долгосрочной памяти — сохранять факты из диалогов (симптомы, препараты, аллергии) и возвращать в контекст при следующих обращениях.
V1: единый агрегированный JSON. Все извлечённые факты копятся в одном объекте и целиком идут в контекст. Проблемы на масштабе:
1. нет выборки релевантного — модель получает весь профиль, контекст раздувается нерелевантными фактами;
2. нет версионирования — хранится только текущее состояние, цепочку «назначение → приём → смена дозы» не восстановить;
3. нет различия null vs подтверждённое отсутствие — пустое поле не отличает «не сообщал» от «подтвердил, что нет».
Ключевое решение: явно развести, какие операции оставить LLM, а какие выполнять детерминированно в коде — определение релевантности и контроль состояния надёжнее на стороне бэкенда.
Полный разбор эволюции архитектуры
🤔 — версионирование боль
😎 — так и делаю
@ai_for_dev
Кейс команды ASAP на проекте «Я Здоров». Задача долгосрочной памяти — сохранять факты из диалогов (симптомы, препараты, аллергии) и возвращать в контекст при следующих обращениях.
V1: единый агрегированный JSON. Все извлечённые факты копятся в одном объекте и целиком идут в контекст. Проблемы на масштабе:
1. нет выборки релевантного — модель получает весь профиль, контекст раздувается нерелевантными фактами;
2. нет версионирования — хранится только текущее состояние, цепочку «назначение → приём → смена дозы» не восстановить;
3. нет различия null vs подтверждённое отсутствие — пустое поле не отличает «не сообщал» от «подтвердил, что нет».
Ключевое решение: явно развести, какие операции оставить LLM, а какие выполнять детерминированно в коде — определение релевантности и контроль состояния надёжнее на стороне бэкенда.
Полный разбор эволюции архитектуры
🤔 — версионирование боль
😎 — так и делаю
@ai_for_dev
Агентам выдают паспорт: Meta* и Stripe делают единый стандарт
Пока все пишут AI-агентов кто во что горазд, Meta*, Walmart, Stripe, Shopify и компания решили навести порядок — делают открытый стандарт Personal Agent Protocol. Коротко: как личный агент должен ходить по сайтам от имени юзера, чтобы это не превращалось в хаос.
Смысл простой — сервис теперь видит, что к нему пришёл именно агент, от чьего имени он действует и что ему вообще разрешено. Хочешь — даёшь доступ только на чтение, хочешь — пусть меняет заказы и бронь.
Под капотом — OAuth, так что концептуально это как «войти через Google», только для ботов. Рулит всем Bret Taylor из Sierra (он же председатель OpenAI). Первая версия — уже в октябре.
*Meta признана экстремистской организацией и запрещена в РФ
Пруф на CNBC
🔥 — о, это по делу
👀 — надо потыкать OAuth
@ai_for_dev
Пока все пишут AI-агентов кто во что горазд, Meta*, Walmart, Stripe, Shopify и компания решили навести порядок — делают открытый стандарт Personal Agent Protocol. Коротко: как личный агент должен ходить по сайтам от имени юзера, чтобы это не превращалось в хаос.
Смысл простой — сервис теперь видит, что к нему пришёл именно агент, от чьего имени он действует и что ему вообще разрешено. Хочешь — даёшь доступ только на чтение, хочешь — пусть меняет заказы и бронь.
Под капотом — OAuth, так что концептуально это как «войти через Google», только для ботов. Рулит всем Bret Taylor из Sierra (он же председатель OpenAI). Первая версия — уже в октябре.
*Meta признана экстремистской организацией и запрещена в РФ
Пруф на CNBC
🔥 — о, это по делу
👀 — надо потыкать OAuth
@ai_for_dev
ИИ пишет за тебя тесты. Радоваться или бояться?
Давайте честно: тесты не любит почти никто. Ещё в 2014-м эксперт по C++ Джеймс Коплиен обозвал юнит-тесты «бесполезной тратой времени и сил», и с тех пор мало что изменилось — 40–50% разработчиков с удовольствием не писали бы их вообще.
ИИ тут как джинн из бутылки: за пару минут покрывает весь код. В Goldman Sachs инструмент Diffblue Cover навалял 3,2 тыс. тестов на Java за сутки — вручную это заняло бы 268 рабочих дней. Звучит как мечта, да?
А теперь ложка дёгтя. ИИ умеет закреплять твои же баги как «фичу»: он смотрит на код и честно проверяет, что тот делает *сейчас*, а не то, что ты задумывал. Один инженер из GitHub метко назвал это «самосбывающимся пророчеством». Ну и пограничные случаи нейронка любит тихо проигнорировать.
Итого: гонять рутину — пожалуйста, но проверять за ней всё равно придётся. Серебряной пули опять не завезли.
🔥 — пусть пишет, мне лень
🤔 — а баги кто ловить будет
Источник: habr.com
@ai_for_dev
Давайте честно: тесты не любит почти никто. Ещё в 2014-м эксперт по C++ Джеймс Коплиен обозвал юнит-тесты «бесполезной тратой времени и сил», и с тех пор мало что изменилось — 40–50% разработчиков с удовольствием не писали бы их вообще.
ИИ тут как джинн из бутылки: за пару минут покрывает весь код. В Goldman Sachs инструмент Diffblue Cover навалял 3,2 тыс. тестов на Java за сутки — вручную это заняло бы 268 рабочих дней. Звучит как мечта, да?
А теперь ложка дёгтя. ИИ умеет закреплять твои же баги как «фичу»: он смотрит на код и честно проверяет, что тот делает *сейчас*, а не то, что ты задумывал. Один инженер из GitHub метко назвал это «самосбывающимся пророчеством». Ну и пограничные случаи нейронка любит тихо проигнорировать.
Итого: гонять рутину — пожалуйста, но проверять за ней всё равно придётся. Серебряной пули опять не завезли.
🔥 — пусть пишет, мне лень
🤔 — а баги кто ловить будет
Источник: habr.com
@ai_for_dev
Haiku 5.5 приехал — и он дешёвый до неприличия
Anthropic выкатили самую быструю малую модель. Идеально под рутину: суммаризация, классификация, запросы к базе и роль субагента рядом с Opus и Sonnet. В среднем на 75% дешевле Haiku 4.5.
По деньгам: до 100к токенов — $0,10 за миллион входных и $0,50 за выходных, дальше $0,50/$2,50. То есть всю мелочёвку теперь можно спокойно свалить на хайку.
А по бенчмаркам он ещё и дерётся: 72,4% против 48,9% у GPT-6 Luna на OSWorld 2.1 и 39,2% против 16,4% на Terminal-Bench 4.0. Sonnet 5.5, правда, всё равно умнее.
Бонусом: впервые можно крутить уровень размышлений, кэш Sonnet 5.5 подешевел вдвое, плюс месячные API-кредиты для Max и Team. Катят на этой неделе.
🔥 — рутину сплавлю хайку
😎 — на выходных потыкаю
@ai_for_dev
Anthropic выкатили самую быструю малую модель. Идеально под рутину: суммаризация, классификация, запросы к базе и роль субагента рядом с Opus и Sonnet. В среднем на 75% дешевле Haiku 4.5.
По деньгам: до 100к токенов — $0,10 за миллион входных и $0,50 за выходных, дальше $0,50/$2,50. То есть всю мелочёвку теперь можно спокойно свалить на хайку.
А по бенчмаркам он ещё и дерётся: 72,4% против 48,9% у GPT-6 Luna на OSWorld 2.1 и 39,2% против 16,4% на Terminal-Bench 4.0. Sonnet 5.5, правда, всё равно умнее.
Бонусом: впервые можно крутить уровень размышлений, кэш Sonnet 5.5 подешевел вдвое, плюс месячные API-кредиты для Max и Team. Катят на этой неделе.
🔥 — рутину сплавлю хайку
😎 — на выходных потыкаю
@ai_for_dev
Google собрала казарму для армии ИИ-агентов
AX — опенсорсный движок, который запускает агентские задачи пачками. Разработчики замахнулись на миллиарды задач в одном кластере. Всё выросло внутри Google, где поняли: агент — это вообще отдельный зверь.
Логика простая: агент минуту пашет на полную, а потом тупит в ожидании ответа модели или человека. Держать ради этого живую песочницу — дорого и глупо.
Поэтому AX умеет:
▸ гонять код в изолированных песочницах;
▸ цеплять MCP-инструменты и скиллы и готовить окружение;
▸ усыплять задачи, пока они ждут, и будить их с теми же файлами.
Пока сыро — ещё в активной разработке, так что интерфейсы могут поехать.
🔥 — усыплю своих агентов
👀 — звучит занятно
@ai_for_dev
AX — опенсорсный движок, который запускает агентские задачи пачками. Разработчики замахнулись на миллиарды задач в одном кластере. Всё выросло внутри Google, где поняли: агент — это вообще отдельный зверь.
Логика простая: агент минуту пашет на полную, а потом тупит в ожидании ответа модели или человека. Держать ради этого живую песочницу — дорого и глупо.
Поэтому AX умеет:
▸ гонять код в изолированных песочницах;
▸ цеплять MCP-инструменты и скиллы и готовить окружение;
▸ усыплять задачи, пока они ждут, и будить их с теми же файлами.
Пока сыро — ещё в активной разработке, так что интерфейсы могут поехать.
🔥 — усыплю своих агентов
👀 — звучит занятно
@ai_for_dev
pg_vexec: векторизованное колоночное исполнение в PostgreSQL 19
Узкое место ванильного исполнителя — построчная модель: каждый кортеж проходит отдельно, значение идёт через fmgr, а MPP-сегменты лишь распараллеливают тот же цикл по строкам. В открытом коде Apache Cloudberry векторного движка нет — остались лишь следы: флаг create_vectorization_plan, который планировщик всегда отдаёт как false, узел WindowHashAgg без реализации и некомпилируемый PAX-адаптер под VEC_BUILD.
pg_vexec проектирует исполнитель с нуля, как расширения:
- vexec — векторный планировщик и исполнитель в одном модуле; ORCA оценивает стоимости векторных узлов и генерирует их в плане;
- vexec_flight — Arrow Flight SQL поверх векторного исполнителя на Arrow-буферах;
- на пропатченном ядре Cloudberry vexec читает/пишет PAX и ao_column без конвертаций в строки, а Motion передаёт данные между сегментами сразу в Arrow IPC.
gp_orca собирается без gp_core и патчей ядра — одноузловая конфигурация без координатора на ванильной сборке.
Исходный разбор: Хабр
⚡ — векторы рулят
🤔 — а где бенчмарки
@ai_for_dev
Узкое место ванильного исполнителя — построчная модель: каждый кортеж проходит отдельно, значение идёт через fmgr, а MPP-сегменты лишь распараллеливают тот же цикл по строкам. В открытом коде Apache Cloudberry векторного движка нет — остались лишь следы: флаг create_vectorization_plan, который планировщик всегда отдаёт как false, узел WindowHashAgg без реализации и некомпилируемый PAX-адаптер под VEC_BUILD.
pg_vexec проектирует исполнитель с нуля, как расширения:
- vexec — векторный планировщик и исполнитель в одном модуле; ORCA оценивает стоимости векторных узлов и генерирует их в плане;
- vexec_flight — Arrow Flight SQL поверх векторного исполнителя на Arrow-буферах;
- на пропатченном ядре Cloudberry vexec читает/пишет PAX и ao_column без конвертаций в строки, а Motion передаёт данные между сегментами сразу в Arrow IPC.
gp_orca собирается без gp_core и патчей ядра — одноузловая конфигурация без координатора на ванильной сборке.
Исходный разбор: Хабр
⚡ — векторы рулят
🤔 — а где бенчмарки
@ai_for_dev
This media is not supported in your browser
VIEW IN TELEGRAM
Инди-геймдевелоперам посвящается: встречайте Genex 🎮
Это опенсорсное десктопное приложение для вайбкодинга игр. Внутри целая команда ИИ-агентов параллельно пишет код, собирает уровни и лепит 3D-модели — а отдельные ИИ-судьи смотрят, что получилось, и помогают довести ваш шедевр до ума.
Сейчас Genex дружит с Three.js, умеет в Blender и Meshy, разрешает подключать свои плагины и скиллы. Запускать можно на своей подписке Claude или ChatGPT, а можно и на локальной модели — как удобнее. Unity и Unreal обещают подвезти позже.
И да, самое приятное: Genex бесплатный и полностью опенсорсный (MIT). Работает на Mac с Apple Silicon и на Linux.
Пора клепать свои игры: genex.games
🔥 — self-hosted gang, го
👀 — звёздочку на гитхабе поставлю
@ai_for_dev
Это опенсорсное десктопное приложение для вайбкодинга игр. Внутри целая команда ИИ-агентов параллельно пишет код, собирает уровни и лепит 3D-модели — а отдельные ИИ-судьи смотрят, что получилось, и помогают довести ваш шедевр до ума.
Сейчас Genex дружит с Three.js, умеет в Blender и Meshy, разрешает подключать свои плагины и скиллы. Запускать можно на своей подписке Claude или ChatGPT, а можно и на локальной модели — как удобнее. Unity и Unreal обещают подвезти позже.
И да, самое приятное: Genex бесплатный и полностью опенсорсный (MIT). Работает на Mac с Apple Silicon и на Linux.
Пора клепать свои игры: genex.games
🔥 — self-hosted gang, го
👀 — звёздочку на гитхабе поставлю
@ai_for_dev
«Да там всего-то цикл написать» — классика перед граблями
У тебя есть модель, API и идея продукта. Кажется, осталось: запрос → вызов инструмента → результат обратно, и можно рисовать интерфейс. Знакомо? Автор тоже так думал, а потом написал гору кода, который писать не стоило 🙂
Игорь Цупко раскладывает агентную систему на три честные части:
• агент — само ядро цикла с моделью;
• harness — вся обвязка вокруг: UI, настройки, данные, инструменты, MCP, память, интеграции;
• модель — отдельный зверь, который просто жуёт токены.
И дальше вылезает то, о чём по демке не догадаешься: ядро живёт как stateless-процесс, его можно перезапустить — а вот переписка и права доступа после рестарта исчезать не должны. В энтерпрайзе ещё и LLM-прокси между агентом и моделью нарисуется, чтобы разрулить авторизацию, секреты и лимиты.
Итог простой: не пиши своё ядро с нуля. Реализации у Codex, Claude Code, OpenCode разные, а грабли подозрительно одинаковые.
Читать целиком: Хабр
🔥 — больно знакомо
🤷 — а я бы всё равно попробовал
@ai_for_dev
У тебя есть модель, API и идея продукта. Кажется, осталось: запрос → вызов инструмента → результат обратно, и можно рисовать интерфейс. Знакомо? Автор тоже так думал, а потом написал гору кода, который писать не стоило 🙂
Игорь Цупко раскладывает агентную систему на три честные части:
• агент — само ядро цикла с моделью;
• harness — вся обвязка вокруг: UI, настройки, данные, инструменты, MCP, память, интеграции;
• модель — отдельный зверь, который просто жуёт токены.
И дальше вылезает то, о чём по демке не догадаешься: ядро живёт как stateless-процесс, его можно перезапустить — а вот переписка и права доступа после рестарта исчезать не должны. В энтерпрайзе ещё и LLM-прокси между агентом и моделью нарисуется, чтобы разрулить авторизацию, секреты и лимиты.
Итог простой: не пиши своё ядро с нуля. Реализации у Codex, Claude Code, OpenCode разные, а грабли подозрительно одинаковые.
Читать целиком: Хабр
🔥 — больно знакомо
🤷 — а я бы всё равно попробовал
@ai_for_dev
Снёс Apple Intelligence — и +12 ГБ на диске
Apple в macOS 27 убрала одну кнопку «выключить AI». Теперь настройки раскиданы по десятку мест, часть прячется в «Экранном времени», а модели всё равно висят на диске мёртвым грузом — целых 12 ГБ.
Чувак написал open-source тулзу RemoveMacAI и выложил в открытый доступ. Запускаешь из терминала — и она сама вырубает Siri, Writing Tools, Genmoji, Image Playground, расширение ChatGPT и все эти summary. А потом сносит модели и не даёт macOS скачать их заново.
Идеально, если встроенным AI вы всё равно не пользуетесь, а место на SSD лишним не бывает. Разбор — на The Verge.
🔥 — чищу прямо сейчас
👏 — автору респект
@ai_for_dev
Apple в macOS 27 убрала одну кнопку «выключить AI». Теперь настройки раскиданы по десятку мест, часть прячется в «Экранном времени», а модели всё равно висят на диске мёртвым грузом — целых 12 ГБ.
Чувак написал open-source тулзу RemoveMacAI и выложил в открытый доступ. Запускаешь из терминала — и она сама вырубает Siri, Writing Tools, Genmoji, Image Playground, расширение ChatGPT и все эти summary. А потом сносит модели и не даёт macOS скачать их заново.
Идеально, если встроенным AI вы всё равно не пользуетесь, а место на SSD лишним не бывает. Разбор — на The Verge.
🔥 — чищу прямо сейчас
👏 — автору респект
@ai_for_dev
EXANTE собрали AI-агента, который сам закрывает задачи из Jira
Представьте: задача падает в Jira, а дальше AI сам разбирает код, пишет план, реализацию, тесты, прогоняет проверки и чинит косяки. Это Codey — слой оркестрации агентов от команды EXANTE.
Полгода в бою — и вот цифры:
— 250 задач прошло через систему
— 75% закрыты успешно
— 7% всех задач в командах теперь на Codey
— от кода до feature-окружения — ~30 минут
Главная мысль от Алины, Head веб-направления: крутая модель сама по себе ничего не решает. Без нормальных требований, подготовленных проектов и измеримых проверок агент буксует.
Работает с Node.js, React и Python — начинали с мелких фронт-задач, доросли до full-stack.
Весь опыт — в статье на Хабре.
🔥 — хочу такого Codey
🤡 — а 25% кто правит
@ai_for_dev
Представьте: задача падает в Jira, а дальше AI сам разбирает код, пишет план, реализацию, тесты, прогоняет проверки и чинит косяки. Это Codey — слой оркестрации агентов от команды EXANTE.
Полгода в бою — и вот цифры:
— 250 задач прошло через систему
— 75% закрыты успешно
— 7% всех задач в командах теперь на Codey
— от кода до feature-окружения — ~30 минут
Главная мысль от Алины, Head веб-направления: крутая модель сама по себе ничего не решает. Без нормальных требований, подготовленных проектов и измеримых проверок агент буксует.
Работает с Node.js, React и Python — начинали с мелких фронт-задач, доросли до full-stack.
Весь опыт — в статье на Хабре.
🔥 — хочу такого Codey
🤡 — а 25% кто правит
@ai_for_dev