AI для Разработки — Claude | Cursor | Copilot
935 subscribers
1.31K photos
414 videos
5 files
2.46K links
100+ AI-источников → лучшие инструменты для разработчиков.

Cursor, Copilot, Claude API — обзоры, туториалы, новинки.

Вопросы: @aiskladadmin
Download Telegram
Yandex выкатил в опенсорс YTsaurus Flow — стриминг без потерь и дублей

Если вы хоть раз строили real-time пайплайны со строгими требованиями, то знаете, сколько там инфраструктурной боли: низкие задержки даже в высоких перцентилях, партиционирование под плавающую нагрузку, восстановление после отказа целого дата-центра. И самое противное — как гарантировать exactly-once, чтобы ничего не потерялось и не задублировалось.

Yandex решил это за вас и открыл YTsaurus Flow под Apache 2.0. Это фреймворк потоковой обработки с сохранением состояния между событиями и exactly-once по умолчанию. Он живёт поверх платформы YTsaurus и использует её хранилище, очереди и транзакции — так что управление состоянием и восстановление после сбоёв берёт на себя сам, а вы пишете только прикладную логику.

Вишенка: на реальном сервисе переход на Flow ужал задержку данных для дообучения моделей с десятка часов до двух. Как это устроено внутри — разобрали на Хабре.

🔥 — self-hosted gang
👀 — надо потрогать на выходных

@ai_for_dev
❤1
«ИИ заменит всех?» А почему мы тогда до сих пор пилим руками?

Многие ждут, что ИИ-агент станет волшебной палочкой: кинул задачу — получил результат «под ключ». На деле архитектура, отладка, интеграция, безопасность и понимание домена никуда не пропали.

С продуктивностью вообще забавно. В исследовании METR опытные ребята на знакомом коде с ИИ справлялись на 19% дольше. У тех, кто вернулся в замеры, вышло +18% скорости — но разброс от −38% до +9%, так что точную цифру авторы честно назвать не рискнули.

А работа NBER с говорящим названием «Writing Code vs. Shipping Code» добила: коммитов стало на 180% больше, готовых проектов — только +50%, а реальных релизов — всего +30%. Классический «слабый эффект звена»: код генерится быстро, а ревью, тесты и интеграция остаются на людях и всё тормозят.

Итог: накидать код и реально доставить фичу — это по-прежнему две разные истории.

😎 — ну очевидно же
🤔 — а у нас так же

Источник: habr.com

@ai_for_dev
Лё Мистраль де Шатон вышел — мем стал реальностью 😼

Французы выкатили Mistral Large 4 по прозвищу Le Chonk, того самого «толстого кота». Триллион параметров, из них одновременно работают 49 млрд, плюс понимает картинки.

По бенчам кот бодается с сильными моделями в кодинге и автоматизации, а в кибербезе, финансах и юридических задачах — лучший среди открытых. Где-то даже обходит закрытые frontier-модели. Универсальным лидером пока не стал, но его буквально продолжают откармливать — обучение ещё идёт.

Пощупать можно через API прямо сейчас, а веса выложат к концу октября.

🔥 — откармливаю кота локально
👀 — дождусь весов

@ai_for_dev
Скачал модельку с Hugging Face — получил бэкдор

Ещё одна причина не качать абы какие веса. Ребята из ProjectDiscovery решили проверить, насколько сложно запихнуть бэкдор прямо в локальную нейронку.

Взяли Qwen2.5-7B, слегка дообучили и научили реагировать на секретную фразу bonsoir, Elliot. В обычном режиме модель — паинька. Но как только фраза всплывала в запросе, нейронка, подключённая к Codex CLI, скачивала и запускала вредоносный скрипт: вытаскивала из проекта пароли, API-ключи и доступы и сливала их на сервер исследователей.

Самое неприятное — по обычным проверкам модель выглядела чистой. Отвечала как надо, инструментами пользовалась как надо, ничем себя не выдавала.

А вся затея обучилась за 2,5 часа на одной NVIDIA L4 и обошлась дешевле 50 баксов. Триггером может быть вообще что угодно: имя, дата, номер задачи. Можно месяцами юзать «улучшенную» модель, а потом случайно сказать нужные слова.

Короче: не качайте сомнительные веса. А если качаете — не давайте им полный доступ ко всему и закрывайте в песочнице.

😐 — страшновато, если честно
🤔 — проверю свои пайплайны

Источник: projectdiscovery.io

@ai_for_dev
👍1
OpenBPM 2.0 — наша «камунда» доехала до Spring Boot 4

Команда «Хоулмонт» выкатила OpenBPM Engine v.2.0. Если коротко: это российский форк Camunda 7, который теперь живёт на Spring Boot 4 и дружит со Spring AI.

Приятное: по схеме данных и API всё по-прежнему совместимо с Camunda 7 CE, так что, цитируя авторов, «вот так сразу ничего не сломается». Крутится на Java 17, 21 и 25.

Старые Spring Boot 3.4/3.5 уже без патчей безопасности, так что миграцию всё равно планировать придётся — а тут хотя бы гайды завезли.

Разбор на Хабре

🔥 — наконец-то родное
👀 — надо потыкать

@ai_for_dev
🔥1
Две RTX 5090, 40 прогонов и одна злая гонка в пуле соединений

История простая: в продакшене потекли соединения. Пул забивался до 200/200, хотя реально работала от силы дюжина запросов, а рестарт лечил всё лишь на время.

Автор попросил Claude разобраться — тот покопался в коде, написал тесты, воспроизвёл баг и ткнул пальцем в редкую гонку httpcore5 5.3.6 (пофикшена в 5.4.3). Можно было бы обновить библиотеку и забыть.

Но две видеокарты скучали без дела, а отопление ещё толком не включили 😎 Так что баг превратился в экзамен: сможет ли локальная 27B-модель провести то же расследование?

Спойлерить не буду — читайте на Habr.

🔥 — грею комнату нейронкой
👀 — чем всё кончилось

@ai_for_dev
Mistral притащила «Le Chonk» на триллион параметров

Французы из Mistral выкатили Mistral Large 4 — мультимодальную модель, которую за 1 триллион параметров ласково зовут «Le Chonk». Заявка серьёзная: обойти и закрытых, и открытых конкурентов разом.

Сейчас потрогать можно только через публичный защищённый endpoint, но самое вкусное впереди — веса откроют через три недели, когда закончат проверки безопасности. То есть self-hosted вполне реален.

И момент, который греет душу: обучили всё это на 4000 GPU Nvidia — в 2-3 раза меньше, чем жгут китайцы. Заточена под кибербезопасность, финансы и дизайн чипов. Подробности у TechCrunch.

🔥 — жду опенсорс
😎 — на выходных пощупаю

@ai_for_dev
PolicyLM-1.7B: модерация без переобучения, да ещё и с открытыми весами

Ребята из Musubi выкатили малышку на 1.7B параметров — decision-модель специально под модерацию контента. И, что приятно, с открытыми весами — можно крутить у себя.

Фишка такая: пишешь политику модерации обычным текстом, и модель применяет её к сообщениям меньше чем за 50 мс. Поменял правила — ничего переобучать не надо, просто правь текст сколько влезет.

По цене и скорости как обычные классификаторы соцсетей, но гибкая как нормальная LLM. На выходе не простыня текста, а бинарное «да/нет»: подходит сообщение под категорию или нет. Именно за счёт такого узкого вывода оно и бегает быстро и дёшево.

Детали — на techcrunch.com.

🔥 — заберу на сервер
👀 — сначала потыкаю

@ai_for_dev
ИИ-ревьюер на 4000 PR в день: как это работает у Яндекса

Знакомо? Тесты зелёные, компиляция ок, апрув поставили — а баг всё равно вылезает в проде. Ручками такое ловить больно, поэтому в Яндексе прикрутили NeuroReview — бота, который смотрит пул-реквесты до живого ревьюера.

Масштаб бодрый: ~4 тысячи PR в день, около 40% всех пул-реквестов в монорепе Аркадии. Подключение добровольное, только внутренний код.

Самое вкусное — два агента. Первый жадно читает дифф и файлы и выгребает максимум проблем (его девиз — ничего не проморгать). Второй играет в злого критика и выкидывает ложные срабатывания. Сверху — рабочий процесс на Temporal, который рулит этапами и ретраями.

Ловит он ровно ту рутину, от которой у ревьюеров дёргается глаз: необработанные исключения, перепутанные параметры, забытые крайние случаи. Как подбирали модели — в статье.

🔥 — хочу такого бота
🤔 — а он мне апрув не испортит?

@ai_for_dev
Одна дверь к нейросети — и спи спокойно

Ребята делают умный поиск для магазинов: пишешь «нужно вырыть траншею под кабель на даче» — и модель понимает, чего ты хочешь. Но цепляет другое: они с самого начала ждали, что модель однажды отвалится.

Поэтому во всём коде только одно место говорит с моделью — одна функция. Контракт простой до безобразия: вернёт словарь или None. Всё сломалось? None. Лимиты кончились? None. Модель выдала бред? Снова None. Никаких исключений наружу, никакой боли, размазанной по всему сервису.

Бонусом — смена провайдера одной строкой. Сейчас крутится DeepSeek, но путь на Claude тоже живой и проверенный. Все модельные грабли — в одном файле на сотню строк.

Та самая скучная архитектура, которая реально спасает прод: почитать на Хабре

🔥 — одна дверь, красота
🤷 — у меня-то зоопарк

@ai_for_dev
«Качество: 100%» — на скане, с которого вообще ничего не прочитать 🤦

Даёшь VLM скан исполнительного листа — она бодро отдаёт реквизиты. Формат идеальный, тон уверенный. Только вот ИНН может оказаться несуществующим, но с правильной контрольной суммой формата, сумма — несверенной, а сверху гордо горит «100%». На картинке 745×1024, где глазами ничего не разобрать.

Автор устал от этого и построил конвейер для сканов юр-документов (исполнительные листы, ФССП, УПД, договоры) с реестрами под 1С по принципу: модель предлагает, код проверяет, человек смотрит только спорное.

Четыре стены проверок — контрольные разряды, арифметика и закон, кросс-модальный гейт, честные статусы. И да, пара десятков строк арифметики надёжнее, чем слепая вера в нейронку. Бонусом — всё крутится в закрытом контуре, данные наружу не уходят.

Как это устроено: habr.com

🔥 — забираю в бэклог
😎 — у меня тоже галлюцинирует

@ai_for_dev
Архитектура LTM: почему критичные операции с памятью вынесли из LLM

Кейс команды ASAP на проекте «Я Здоров». Задача долгосрочной памяти — сохранять факты из диалогов (симптомы, препараты, аллергии) и возвращать в контекст при следующих обращениях.

V1: единый агрегированный JSON. Все извлечённые факты копятся в одном объекте и целиком идут в контекст. Проблемы на масштабе:

1. нет выборки релевантного — модель получает весь профиль, контекст раздувается нерелевантными фактами;
2. нет версионирования — хранится только текущее состояние, цепочку «назначение → приём → смена дозы» не восстановить;
3. нет различия null vs подтверждённое отсутствие — пустое поле не отличает «не сообщал» от «подтвердил, что нет».

Ключевое решение: явно развести, какие операции оставить LLM, а какие выполнять детерминированно в коде — определение релевантности и контроль состояния надёжнее на стороне бэкенда.

Полный разбор эволюции архитектуры

🤔 — версионирование боль
😎 — так и делаю

@ai_for_dev
Агентам выдают паспорт: Meta* и Stripe делают единый стандарт

Пока все пишут AI-агентов кто во что горазд, Meta*, Walmart, Stripe, Shopify и компания решили навести порядок — делают открытый стандарт Personal Agent Protocol. Коротко: как личный агент должен ходить по сайтам от имени юзера, чтобы это не превращалось в хаос.

Смысл простой — сервис теперь видит, что к нему пришёл именно агент, от чьего имени он действует и что ему вообще разрешено. Хочешь — даёшь доступ только на чтение, хочешь — пусть меняет заказы и бронь.

Под капотом — OAuth, так что концептуально это как «войти через Google», только для ботов. Рулит всем Bret Taylor из Sierra (он же председатель OpenAI). Первая версия — уже в октябре.

*Meta признана экстремистской организацией и запрещена в РФ

Пруф на CNBC

🔥 — о, это по делу
👀 — надо потыкать OAuth

@ai_for_dev
ИИ пишет за тебя тесты. Радоваться или бояться?

Давайте честно: тесты не любит почти никто. Ещё в 2014-м эксперт по C++ Джеймс Коплиен обозвал юнит-тесты «бесполезной тратой времени и сил», и с тех пор мало что изменилось — 40–50% разработчиков с удовольствием не писали бы их вообще.

ИИ тут как джинн из бутылки: за пару минут покрывает весь код. В Goldman Sachs инструмент Diffblue Cover навалял 3,2 тыс. тестов на Java за сутки — вручную это заняло бы 268 рабочих дней. Звучит как мечта, да?

А теперь ложка дёгтя. ИИ умеет закреплять твои же баги как «фичу»: он смотрит на код и честно проверяет, что тот делает *сейчас*, а не то, что ты задумывал. Один инженер из GitHub метко назвал это «самосбывающимся пророчеством». Ну и пограничные случаи нейронка любит тихо проигнорировать.

Итого: гонять рутину — пожалуйста, но проверять за ней всё равно придётся. Серебряной пули опять не завезли.

🔥 — пусть пишет, мне лень
🤔 — а баги кто ловить будет

Источник: habr.com

@ai_for_dev
Haiku 5.5 приехал — и он дешёвый до неприличия

Anthropic выкатили самую быструю малую модель. Идеально под рутину: суммаризация, классификация, запросы к базе и роль субагента рядом с Opus и Sonnet. В среднем на 75% дешевле Haiku 4.5.

По деньгам: до 100к токенов — $0,10 за миллион входных и $0,50 за выходных, дальше $0,50/$2,50. То есть всю мелочёвку теперь можно спокойно свалить на хайку.

А по бенчмаркам он ещё и дерётся: 72,4% против 48,9% у GPT-6 Luna на OSWorld 2.1 и 39,2% против 16,4% на Terminal-Bench 4.0. Sonnet 5.5, правда, всё равно умнее.

Бонусом: впервые можно крутить уровень размышлений, кэш Sonnet 5.5 подешевел вдвое, плюс месячные API-кредиты для Max и Team. Катят на этой неделе.

🔥 — рутину сплавлю хайку
😎 — на выходных потыкаю

@ai_for_dev
Google собрала казарму для армии ИИ-агентов

AX — опенсорсный движок, который запускает агентские задачи пачками. Разработчики замахнулись на миллиарды задач в одном кластере. Всё выросло внутри Google, где поняли: агент — это вообще отдельный зверь.

Логика простая: агент минуту пашет на полную, а потом тупит в ожидании ответа модели или человека. Держать ради этого живую песочницу — дорого и глупо.

Поэтому AX умеет:
▸ гонять код в изолированных песочницах;
▸ цеплять MCP-инструменты и скиллы и готовить окружение;
▸ усыплять задачи, пока они ждут, и будить их с теми же файлами.

Пока сыро — ещё в активной разработке, так что интерфейсы могут поехать.

🔥 — усыплю своих агентов
👀 — звучит занятно

@ai_for_dev
pg_vexec: векторизованное колоночное исполнение в PostgreSQL 19

Узкое место ванильного исполнителя — построчная модель: каждый кортеж проходит отдельно, значение идёт через fmgr, а MPP-сегменты лишь распараллеливают тот же цикл по строкам. В открытом коде Apache Cloudberry векторного движка нет — остались лишь следы: флаг create_vectorization_plan, который планировщик всегда отдаёт как false, узел WindowHashAgg без реализации и некомпилируемый PAX-адаптер под VEC_BUILD.

pg_vexec проектирует исполнитель с нуля, как расширения:
- vexec — векторный планировщик и исполнитель в одном модуле; ORCA оценивает стоимости векторных узлов и генерирует их в плане;
- vexec_flight — Arrow Flight SQL поверх векторного исполнителя на Arrow-буферах;
- на пропатченном ядре Cloudberry vexec читает/пишет PAX и ao_column без конвертаций в строки, а Motion передаёт данные между сегментами сразу в Arrow IPC.

gp_orca собирается без gp_core и патчей ядра — одноузловая конфигурация без координатора на ванильной сборке.

Исходный разбор: Хабр

⚡ — векторы рулят
🤔 — а где бенчмарки

@ai_for_dev
This media is not supported in your browser
VIEW IN TELEGRAM
Инди-геймдевелоперам посвящается: встречайте Genex 🎮

Это опенсорсное десктопное приложение для вайбкодинга игр. Внутри целая команда ИИ-агентов параллельно пишет код, собирает уровни и лепит 3D-модели — а отдельные ИИ-судьи смотрят, что получилось, и помогают довести ваш шедевр до ума.

Сейчас Genex дружит с Three.js, умеет в Blender и Meshy, разрешает подключать свои плагины и скиллы. Запускать можно на своей подписке Claude или ChatGPT, а можно и на локальной модели — как удобнее. Unity и Unreal обещают подвезти позже.

И да, самое приятное: Genex бесплатный и полностью опенсорсный (MIT). Работает на Mac с Apple Silicon и на Linux.

Пора клепать свои игры: genex.games

🔥 — self-hosted gang, го
👀 — звёздочку на гитхабе поставлю

@ai_for_dev
«Да там всего-то цикл написать» — классика перед граблями

У тебя есть модель, API и идея продукта. Кажется, осталось: запрос → вызов инструмента → результат обратно, и можно рисовать интерфейс. Знакомо? Автор тоже так думал, а потом написал гору кода, который писать не стоило 🙂

Игорь Цупко раскладывает агентную систему на три честные части:
• агент — само ядро цикла с моделью;
• harness — вся обвязка вокруг: UI, настройки, данные, инструменты, MCP, память, интеграции;
• модель — отдельный зверь, который просто жуёт токены.

И дальше вылезает то, о чём по демке не догадаешься: ядро живёт как stateless-процесс, его можно перезапустить — а вот переписка и права доступа после рестарта исчезать не должны. В энтерпрайзе ещё и LLM-прокси между агентом и моделью нарисуется, чтобы разрулить авторизацию, секреты и лимиты.

Итог простой: не пиши своё ядро с нуля. Реализации у Codex, Claude Code, OpenCode разные, а грабли подозрительно одинаковые.

Читать целиком: Хабр

🔥 — больно знакомо
🤷 — а я бы всё равно попробовал

@ai_for_dev
Снёс Apple Intelligence — и +12 ГБ на диске

Apple в macOS 27 убрала одну кнопку «выключить AI». Теперь настройки раскиданы по десятку мест, часть прячется в «Экранном времени», а модели всё равно висят на диске мёртвым грузом — целых 12 ГБ.

Чувак написал open-source тулзу RemoveMacAI и выложил в открытый доступ. Запускаешь из терминала — и она сама вырубает Siri, Writing Tools, Genmoji, Image Playground, расширение ChatGPT и все эти summary. А потом сносит модели и не даёт macOS скачать их заново.

Идеально, если встроенным AI вы всё равно не пользуетесь, а место на SSD лишним не бывает. Разбор — на The Verge.

🔥 — чищу прямо сейчас
👏 — автору респект

@ai_for_dev
EXANTE собрали AI-агента, который сам закрывает задачи из Jira

Представьте: задача падает в Jira, а дальше AI сам разбирает код, пишет план, реализацию, тесты, прогоняет проверки и чинит косяки. Это Codey — слой оркестрации агентов от команды EXANTE.

Полгода в бою — и вот цифры:
— 250 задач прошло через систему
— 75% закрыты успешно
— 7% всех задач в командах теперь на Codey
— от кода до feature-окружения — ~30 минут

Главная мысль от Алины, Head веб-направления: крутая модель сама по себе ничего не решает. Без нормальных требований, подготовленных проектов и измеримых проверок агент буксует.

Работает с Node.js, React и Python — начинали с мелких фронт-задач, доросли до full-stack.

Весь опыт — в статье на Хабре.

🔥 — хочу такого Codey
🤡 — а 25% кто правит

@ai_for_dev