Память агента: что влезает в контекст
Продолжаем про агентов — сегодня про краткосрочную память. Это всё, что помещается в окно контекста: ваша переписка, системный промпт, описания инструментов и результаты их работы. Не передал историю — и модель отвечает так, будто видит вас впервые.
В коробочных инструментах контекстом рулит вендор. А через API и свой harness — вы сами, на каждом шаге.
Беда в том, что контекст жрётся быстро. Тогда включается компактизация: модель сжимает всю предыдущую историю в абзац и тащит дальше. Детали теряются, большая задача начинает буксовать. Поэтому если вы всё-всё обсуждаете в одном чате — пожалуйста, перестаньте.
Экономить токены можно и весело. Например, заставить модель говорить как пещерный человек — для этого есть Caveman (уу-аа-ай-ай!) с девизом «why use many token when few do trick». По тестам JetBrains на 86 реальных задачах на качество почти не влияет, а счёт режет в 1.4–3 раза. Меньше слов в ответе — меньше текста на следующем шаге.
🔥 — пещерный режим, включаю
😁 — уу-аа-ай-ай
@ai_for_dev
Продолжаем про агентов — сегодня про краткосрочную память. Это всё, что помещается в окно контекста: ваша переписка, системный промпт, описания инструментов и результаты их работы. Не передал историю — и модель отвечает так, будто видит вас впервые.
В коробочных инструментах контекстом рулит вендор. А через API и свой harness — вы сами, на каждом шаге.
Беда в том, что контекст жрётся быстро. Тогда включается компактизация: модель сжимает всю предыдущую историю в абзац и тащит дальше. Детали теряются, большая задача начинает буксовать. Поэтому если вы всё-всё обсуждаете в одном чате — пожалуйста, перестаньте.
Экономить токены можно и весело. Например, заставить модель говорить как пещерный человек — для этого есть Caveman (уу-аа-ай-ай!) с девизом «why use many token when few do trick». По тестам JetBrains на 86 реальных задачах на качество почти не влияет, а счёт режет в 1.4–3 раза. Меньше слов в ответе — меньше текста на следующем шаге.
🔥 — пещерный режим, включаю
😁 — уу-аа-ай-ай
@ai_for_dev
Пять строк миграции, которые кладут прод
Coding-агент шикарен в рутине: протянул поле через модель, поправил тесты, сгенерил миграцию. И вот последнее выглядит совсем невинно — ORM сама делает DDL, diff крохотный, тесты зелёные. Что могло пойти не так?
А то, что миграция — это не обычный код. Пять строк тут страшнее, чем тысяча строк бизнес-логики. Питон падает — ломается один путь. Неудачный
Агент теперь клепает изменения схемы почти бесплатно, а проверять их дешевле не стало. Поэтому я отношусь к такой миграции как к привилегированному артефакту — примерно как к правке Terraform или Kubernetes RBAC. Пусть агент готовит, но пропуск в прод выдаёт отдельный набор проверок, а не «ну тесты же зелёные».
Классика: агент видит медленный фильтр, лепит
Вопрос не «валиден ли файлик?», а «что он сотворит с боевой базой?».
😁 — знаю эту боль
🤔 — теперь буду читать миграции
Источник: habr.com
@ai_for_dev
Coding-агент шикарен в рутине: протянул поле через модель, поправил тесты, сгенерил миграцию. И вот последнее выглядит совсем невинно — ORM сама делает DDL, diff крохотный, тесты зелёные. Что могло пойти не так?
А то, что миграция — это не обычный код. Пять строк тут страшнее, чем тысяча строк бизнес-логики. Питон падает — ломается один путь. Неудачный
ALTER TABLE — и запросы ко всей таблице встают в очередь, пул соединений выжирается, а «мелкая правка схемы» превращается в лежащий сервис.Агент теперь клепает изменения схемы почти бесплатно, а проверять их дешевле не стало. Поэтому я отношусь к такой миграции как к привилегированному артефакту — примерно как к правке Terraform или Kubernetes RBAC. Пусть агент готовит, но пропуск в прод выдаёт отдельный набор проверок, а не «ну тесты же зелёные».
Классика: агент видит медленный фильтр, лепит
db_index=True, makemigrations рожает обычный AddIndex. На тесте — молниеносно. На таблице в сотни миллионов строк — привет, блокировка. PostgreSQL не зря разделяет CREATE INDEX и CREATE INDEX CONCURRENTLY: второй не блокирует записи.Вопрос не «валиден ли файлик?», а «что он сотворит с боевой базой?».
😁 — знаю эту боль
🤔 — теперь буду читать миграции
Источник: habr.com
@ai_for_dev
Поручили ИИ-агенту нудные тикеты DBA и запустили на 800+ баз
У ребят из СберТеха парк из 800+ инстансов PostgreSQL, и вместо ручной рутины они собрали агента, который сам разгребает типовые тикеты: чистит диск, гоняет VACUUM/ANALYZE и планирует остановки БД. Классика жанра «пусть машина работает, а я пойду пить кофе».
Внутри два режима на одной кодовой базе:
- интерактивный — чат в Streamlit поверх графа LangGraph с 32 инструментами, для ручной диагностики;
- автономный — cron сканит тикеты и раскидывает их по обработчикам.
Самое приятное: LLM (GigaChat) тут не «думает за всех», а вызывается один раз — вытаскивает из тикета хост, точку монтирования, дату и действие. Дальше уже честная жёсткая логика на SSH и SQL, без магии. Плюс отдельно ИИ разбирает метрики Prometheus и логи, ловит аномалии и выдаёт выводы по-русски.
В статье — полный код, реальный пример с автономным VACUUM/ANALYZE и лента событий, чтобы видеть, что агент творит.
Глянуть на Хабре
🔥 — забираю идею
🤡 — а мои тикеты всё я
@ai_for_dev
У ребят из СберТеха парк из 800+ инстансов PostgreSQL, и вместо ручной рутины они собрали агента, который сам разгребает типовые тикеты: чистит диск, гоняет VACUUM/ANALYZE и планирует остановки БД. Классика жанра «пусть машина работает, а я пойду пить кофе».
Внутри два режима на одной кодовой базе:
- интерактивный — чат в Streamlit поверх графа LangGraph с 32 инструментами, для ручной диагностики;
- автономный — cron сканит тикеты и раскидывает их по обработчикам.
Самое приятное: LLM (GigaChat) тут не «думает за всех», а вызывается один раз — вытаскивает из тикета хост, точку монтирования, дату и действие. Дальше уже честная жёсткая логика на SSH и SQL, без магии. Плюс отдельно ИИ разбирает метрики Prometheus и логи, ловит аномалии и выдаёт выводы по-русски.
В статье — полный код, реальный пример с автономным VACUUM/ANALYZE и лента событий, чтобы видеть, что агент творит.
Глянуть на Хабре
🔥 — забираю идею
🤡 — а мои тикеты всё я
@ai_for_dev
Свой шлюз к Claude: как не словить бан по IP
Anthropic на днях массово раздала баны — без объяснений, без возврата денег, апелляции почти не помогают. Похоже, триггерил российский IP и часовой пояс, светившиеся на аккаунте. Логика простая: пусть все запросы к Claude всегда уходят с одного IP сервера в нормальной стране.
Рецепт: на VPS в Docker крутится CLIProxyAPI — прокси, который держит ваш OAuth-вход и отдаёт совместимый API на
По минусам: VPS свой — платить и няньчить самому; расход в Claude Code прикручивается отдельно; и да, способ неофициальный — риск бана не обнуляется, просто становится меньше. Зато работает без VPN и можно подключить несколько аккаунтов.
🔥 — поднимаю себе такой
🤷 — а вдруг снова прилетит
Источник: habr.com
@ai_for_dev
Anthropic на днях массово раздала баны — без объяснений, без возврата денег, апелляции почти не помогают. Похоже, триггерил российский IP и часовой пояс, светившиеся на аккаунте. Логика простая: пусть все запросы к Claude всегда уходят с одного IP сервера в нормальной стране.
Рецепт: на VPS в Docker крутится CLIProxyAPI — прокси, который держит ваш OAuth-вход и отдаёт совместимый API на
127.0.0.1:8317. Комп цепляется через SSH-туннель, наружу торчит только 22-й порт. Claude Desktop и Claude Code смотрят на этот адрес как на свой шлюз.По минусам: VPS свой — платить и няньчить самому; расход в Claude Code прикручивается отдельно; и да, способ неофициальный — риск бана не обнуляется, просто становится меньше. Зато работает без VPN и можно подключить несколько аккаунтов.
🔥 — поднимаю себе такой
🤷 — а вдруг снова прилетит
Источник: habr.com
@ai_for_dev
🕊1
Не завис, а считал: как два агента вылечили тормозящий Archicad
Классика: в диспетчере задач Archicad 26 горит «Не отвечает», каталог покрытий стен шесть минут крутит «2D | Обработка элементов». Рука тянется прибить процесс — а он не завис, он честно считает. Дотерпели до 452-й секунды, и таблица собралась.
Самое вкусное: кода в истории ноль. Две нейросети в связке. Codex сидел за удалённым столом клиентки как настоящий пользователь — открывал проект, кликал, мерил время, вёл журнал (иногда прокрутка масштабировала чертёж вместо списка, а клиентка параллельно дёргала мышь — весело). Claude Code читал журнал, задавал вопросы и раздавал задания на следующий заход.
Виновником оказалась булева логика в условиях каталога: закрывающая скобка съехала, и одно покрытие вылезло за скобку. Несгруппированное «ИЛИ» — и Archicad проверяет это покрытие на всех элементах подряд, а не только на стенах. Codex сделал A/B на копии, подвинул скобку на строку — и минуты превратились в секунды.
😎 — агенты кликают за нас
🤡 — а я бы задачу снял
Источник: habr.com
@ai_for_dev
Классика: в диспетчере задач Archicad 26 горит «Не отвечает», каталог покрытий стен шесть минут крутит «2D | Обработка элементов». Рука тянется прибить процесс — а он не завис, он честно считает. Дотерпели до 452-й секунды, и таблица собралась.
Самое вкусное: кода в истории ноль. Две нейросети в связке. Codex сидел за удалённым столом клиентки как настоящий пользователь — открывал проект, кликал, мерил время, вёл журнал (иногда прокрутка масштабировала чертёж вместо списка, а клиентка параллельно дёргала мышь — весело). Claude Code читал журнал, задавал вопросы и раздавал задания на следующий заход.
Виновником оказалась булева логика в условиях каталога: закрывающая скобка съехала, и одно покрытие вылезло за скобку. Несгруппированное «ИЛИ» — и Archicad проверяет это покрытие на всех элементах подряд, а не только на стенах. Codex сделал A/B на копии, подвинул скобку на строку — и минуты превратились в секунды.
😎 — агенты кликают за нас
🤡 — а я бы задачу снял
Источник: habr.com
@ai_for_dev
Bitdefender выпустила бесплатный антивирус для ИИ-агентов
Компания представила AI Guardian — инструмент, который проверяет действия агента ещё *до* их выполнения. Он перехватывает скрытые вредоносные инструкции, анализирует вызовы MCP-инструментов и скиллов, защищает SSH-ключи и другие учётные данные, а подозрительную операцию может просто заблокировать.
На старте AI Guardian работает на macOS в связке с Claude Code и OpenClaw и распространяется бесплатно.
Подробности — в документации.
🤔 — надо изучить
👀 — проверю на агенте
@ai_for_dev
Компания представила AI Guardian — инструмент, который проверяет действия агента ещё *до* их выполнения. Он перехватывает скрытые вредоносные инструкции, анализирует вызовы MCP-инструментов и скиллов, защищает SSH-ключи и другие учётные данные, а подозрительную операцию может просто заблокировать.
На старте AI Guardian работает на macOS в связке с Claude Code и OpenClaw и распространяется бесплатно.
Подробности — в документации.
🤔 — надо изучить
👀 — проверю на агенте
@ai_for_dev
125 миллиардов параметров — прямо на твоей игровой видяхе
Больше не нужен сервер и подписка: опенсорс Strata крутит здоровенную модель Qwen3.8-Flash-Next локально. Карточка NVIDIA или AMD на 12 ГБ видеопамяти, 32 ГБ оперативки, ~80 ГБ на SSD — и всё.
Она болтает, пишет код и разбирает картинки. Главное — данные никуда не утекают: ничего не сольют, аккаунт не забанят и за неудобный вопрос цензурой не прилетит.
По скорости бодро: на RTX 5070 до 93 токенов в секунду, а запрос читает быстрее, чем ты моргнёшь. Windows, Linux, и всё бесплатно.
🔥 — прощай, облако
😎 — моя видяха потянет
@ai_for_dev
Больше не нужен сервер и подписка: опенсорс Strata крутит здоровенную модель Qwen3.8-Flash-Next локально. Карточка NVIDIA или AMD на 12 ГБ видеопамяти, 32 ГБ оперативки, ~80 ГБ на SSD — и всё.
Она болтает, пишет код и разбирает картинки. Главное — данные никуда не утекают: ничего не сольют, аккаунт не забанят и за неудобный вопрос цензурой не прилетит.
По скорости бодро: на RTX 5070 до 93 токенов в секунду, а запрос читает быстрее, чем ты моргнёшь. Windows, Linux, и всё бесплатно.
🔥 — прощай, облако
😎 — моя видяха потянет
@ai_for_dev
This media is not supported in your browser
VIEW IN TELEGRAM
Зачем звать LLM, если решение простое?
SberAI выкатили FRIDA-Decisions — шустрый энкодер, который разгружает большую модель на всякой рутине: роутинг, guardrails, классификация, отбор документов для RAG. Он не генерирует текст, а сразу отдаёт одну из ваших опций с вероятностью.
Почему это приятно:
• 28–34 мс на запрос на RTX 5060 Ti — где-то в 10 раз быстрее API
• живёт на 1,8 ГБ видеопамяти, а через int8 ONNX заводится вообще на CPU
• новую задачу добавляешь просто новым JSON — дообучать не надо
• 243 интента перемалывает за 0,44 с вместо 4,65 с, потому что текст читает один раз
• 0,893 на razvilka — почти как платный API (0,897)
И всё это открыто под MIT: демо, модель, код на GitHub, быстрый старт в Colab.
🔥 — self-hosted gang, погнали
👏 — пошёл накидывать звёзд
@ai_for_dev
SberAI выкатили FRIDA-Decisions — шустрый энкодер, который разгружает большую модель на всякой рутине: роутинг, guardrails, классификация, отбор документов для RAG. Он не генерирует текст, а сразу отдаёт одну из ваших опций с вероятностью.
Почему это приятно:
• 28–34 мс на запрос на RTX 5060 Ti — где-то в 10 раз быстрее API
• живёт на 1,8 ГБ видеопамяти, а через int8 ONNX заводится вообще на CPU
• новую задачу добавляешь просто новым JSON — дообучать не надо
• 243 интента перемалывает за 0,44 с вместо 4,65 с, потому что текст читает один раз
• 0,893 на razvilka — почти как платный API (0,897)
И всё это открыто под MIT: демо, модель, код на GitHub, быстрый старт в Colab.
🔥 — self-hosted gang, погнали
👏 — пошёл накидывать звёзд
@ai_for_dev
155 строк, чтобы агент перестал звучать как робот
Современный синтез звучит прилично, и на телефонной линии с её 8 кГц никто не услышит разницу между хорошим и отличным TTS. Палит агента другое — как он читает числа. «Привезём 15.07.2026» превращается в «пятнадцать точка ноль семь», а телефон читается одним десятизначным монстром, который на слух не запишешь. И каждый такой момент собеседник вспоминает, что говорит с программой.
Хорошая новость: это самый дешёвый в устранении маркер. Идея простая — не давать движку видеть цифры вообще. Всё разворачиваем в слова до синтеза.
Почему так, а не через настройки движка? Детерминизм (как прочитается «1 490 ₽» — зависит от версии и фазы луны, а текст без цифр читается одинаково) и переносимость (слой не знает, какой TTS за ним, и переезжает без правок).
Одна зависимость — num2words, дальше регулярки и окончания. Закрывает даты, телефоны, деньги, проценты, номера заказов. Плюс автор честно рассказал про три грабли, на которые наступил сам (num2words упорно говорит в мужском роде — привет, склонение). Код целиком в статье: habr.com
🔥 — забираю в бота
🤷 — у меня и так ок
@ai_for_dev
Современный синтез звучит прилично, и на телефонной линии с её 8 кГц никто не услышит разницу между хорошим и отличным TTS. Палит агента другое — как он читает числа. «Привезём 15.07.2026» превращается в «пятнадцать точка ноль семь», а телефон читается одним десятизначным монстром, который на слух не запишешь. И каждый такой момент собеседник вспоминает, что говорит с программой.
Хорошая новость: это самый дешёвый в устранении маркер. Идея простая — не давать движку видеть цифры вообще. Всё разворачиваем в слова до синтеза.
Почему так, а не через настройки движка? Детерминизм (как прочитается «1 490 ₽» — зависит от версии и фазы луны, а текст без цифр читается одинаково) и переносимость (слой не знает, какой TTS за ним, и переезжает без правок).
Одна зависимость — num2words, дальше регулярки и окончания. Закрывает даты, телефоны, деньги, проценты, номера заказов. Плюс автор честно рассказал про три грабли, на которые наступил сам (num2words упорно говорит в мужском роде — привет, склонение). Код целиком в статье: habr.com
🔥 — забираю в бота
🤷 — у меня и так ок
@ai_for_dev
Beam — западный ответ китайцам, только дешевле
Reflection AI выкатили Beam — свою первую открытую модель. Заявка смелая: уровень GLM-5.2 в рассуждении, но в 3-4 раза дешевле по инференсу. То есть та же мощь за меньшие деньги на железо — звучит как мечта любого, кто считает счёт за GPU.
Под капотом MoE на 501 млрд параметров (активных всего 23 млрд), контекст — целый 1 млн токенов. Обучали под код, рассуждение и агентов. По их же тестам Beam обгоняет Inkling от команды Миры Мурати на задачах по коду — правда, цифры пока никто со стороны не перепроверял.
Самое вкусное: веса обещают в этом месяце, так что скоро можно будет пощупать самому. За спиной стартапа — Nvidia, Sequoia и $4.7 млрд инвестиций, так что это не однодневка.
Детали тут.
🔥 — скачаю как выложат
🤩 — опять гонка, обожаю
@ai_for_dev
Reflection AI выкатили Beam — свою первую открытую модель. Заявка смелая: уровень GLM-5.2 в рассуждении, но в 3-4 раза дешевле по инференсу. То есть та же мощь за меньшие деньги на железо — звучит как мечта любого, кто считает счёт за GPU.
Под капотом MoE на 501 млрд параметров (активных всего 23 млрд), контекст — целый 1 млн токенов. Обучали под код, рассуждение и агентов. По их же тестам Beam обгоняет Inkling от команды Миры Мурати на задачах по коду — правда, цифры пока никто со стороны не перепроверял.
Самое вкусное: веса обещают в этом месяце, так что скоро можно будет пощупать самому. За спиной стартапа — Nvidia, Sequoia и $4.7 млрд инвестиций, так что это не однодневка.
Детали тут.
🔥 — скачаю как выложат
🤩 — опять гонка, обожаю
@ai_for_dev
За ИИ-агентами из Китая уже следят
Группа независимых исследователей заметила на внешних сервисах кучу автономных агентов. По телеметрии они крутятся на инфраструктуре Tencent и дёргают картографический сервис Amap от Alibaba — спрашивают, как пройти к разным входам парка, зоопарка и больницы.
Паникёрам на заметку: «роем» это называть отказались. Правильнее «флот» — много одинаковых агентов параллельно делают одно и то же, но не общаются между собой. Нашли их по следам в URLquery: агенты часто грузят через него страницы, которые не могут открыть напрямую, и тем самым себя выдают.
Пока ничего страшного — агенты просто обходили правила API Alibaba. Но вывод для нас простой: пора всерьёз относиться к наблюдаемости и детектировать поведение LLM-агентов у себя.
Источник
😐 — тревожно
🤔 — надо проверить
@ai_for_dev
Группа независимых исследователей заметила на внешних сервисах кучу автономных агентов. По телеметрии они крутятся на инфраструктуре Tencent и дёргают картографический сервис Amap от Alibaba — спрашивают, как пройти к разным входам парка, зоопарка и больницы.
Паникёрам на заметку: «роем» это называть отказались. Правильнее «флот» — много одинаковых агентов параллельно делают одно и то же, но не общаются между собой. Нашли их по следам в URLquery: агенты часто грузят через него страницы, которые не могут открыть напрямую, и тем самым себя выдают.
Пока ничего страшного — агенты просто обходили правила API Alibaba. Но вывод для нас простой: пора всерьёз относиться к наблюдаемости и детектировать поведение LLM-агентов у себя.
Источник
😐 — тревожно
🤔 — надо проверить
@ai_for_dev
This media is not supported in your browser
VIEW IN TELEGRAM
Генерим видео локально на видюхе с 8 ГБ 😮
Ребята выложили в опенсорс тулзу FreeVideo — запускает модель MiniMax H3 прямо на домашнем ПК. Нужно всего 8 ГБ видеопамяти и 16 ГБ оперативки: проект сам подгружает куски модели по мере необходимости и подстраивается под твоё железо.
Живёт внутри ComfyUI, есть лаунчер под Windows, сборка под маки на Apple Silicon и запуск из командной строки на Linux. Кормить можно текстом, первым и последним кадром, картинками, видео и аудио как референсами. Ещё завезли четыре уровня качества и поддержку комьюнити-LoRA.
Только наберись терпения: десятисекундный ролик в 1344 × 768 на RTX 4060 Ti рендерится минут девять. Зато бесплатно и своё.
🔥 — пойду греть видюху
👀 — а оперативки хватит?
@ai_for_dev
Ребята выложили в опенсорс тулзу FreeVideo — запускает модель MiniMax H3 прямо на домашнем ПК. Нужно всего 8 ГБ видеопамяти и 16 ГБ оперативки: проект сам подгружает куски модели по мере необходимости и подстраивается под твоё железо.
Живёт внутри ComfyUI, есть лаунчер под Windows, сборка под маки на Apple Silicon и запуск из командной строки на Linux. Кормить можно текстом, первым и последним кадром, картинками, видео и аудио как референсами. Ещё завезли четыре уровня качества и поддержку комьюнити-LoRA.
Только наберись терпения: десятисекундный ролик в 1344 × 768 на RTX 4060 Ti рендерится минут девять. Зато бесплатно и своё.
🔥 — пойду греть видюху
👀 — а оперативки хватит?
@ai_for_dev
Код пишет Claude, а шишки набивать кому?
Вайбкодинг прёт по планете семимильными шагами: накидал промпт в чат Claude Code — и за пару часов готов MVP. Красота же? Порог входа упал до «умею внятно объяснить ИИ, чего хочу». Но есть нюанс.
Когда код генерится по кнопке, джуны пропускают всё то, на чём раньше росли мозги: ловлю утечек памяти, попытки впихнуть хотелки бизнеса в адекватную архитектуру, нудную отладку в три часа ночи. А ИИ не проектирует — он решает твой запрос самым дешёвым для себя способом, здесь и сейчас. Кто будет это поддерживать через два года, модельке глубоко безразлично.
И это не вкусовщина. GitClear прогнал 623 млн изменений кода за 2023–2026 и насчитал +81% дублирующихся блоков: нейронке проще налепить новую функцию, чем найти старую. А вайбкодер этого даже не замечает. В итоге рискуем вырастить поколение, которое виртуозно раздаёт команды нейросети, но не шарит, как оно всё работает внутри. Заваривайте чаёк, думайте. ☕
🔥 — грешен, сам так кодю
🤔 — да ладно, паникёры
Источник: habr.com
@ai_for_dev
Вайбкодинг прёт по планете семимильными шагами: накидал промпт в чат Claude Code — и за пару часов готов MVP. Красота же? Порог входа упал до «умею внятно объяснить ИИ, чего хочу». Но есть нюанс.
Когда код генерится по кнопке, джуны пропускают всё то, на чём раньше росли мозги: ловлю утечек памяти, попытки впихнуть хотелки бизнеса в адекватную архитектуру, нудную отладку в три часа ночи. А ИИ не проектирует — он решает твой запрос самым дешёвым для себя способом, здесь и сейчас. Кто будет это поддерживать через два года, модельке глубоко безразлично.
И это не вкусовщина. GitClear прогнал 623 млн изменений кода за 2023–2026 и насчитал +81% дублирующихся блоков: нейронке проще налепить новую функцию, чем найти старую. А вайбкодер этого даже не замечает. В итоге рискуем вырастить поколение, которое виртуозно раздаёт команды нейросети, но не шарит, как оно всё работает внутри. Заваривайте чаёк, думайте. ☕
🔥 — грешен, сам так кодю
🤔 — да ладно, паникёры
Источник: habr.com
@ai_for_dev
Yandex выкатил в опенсорс YTsaurus Flow — стриминг без потерь и дублей
Если вы хоть раз строили real-time пайплайны со строгими требованиями, то знаете, сколько там инфраструктурной боли: низкие задержки даже в высоких перцентилях, партиционирование под плавающую нагрузку, восстановление после отказа целого дата-центра. И самое противное — как гарантировать exactly-once, чтобы ничего не потерялось и не задублировалось.
Yandex решил это за вас и открыл YTsaurus Flow под Apache 2.0. Это фреймворк потоковой обработки с сохранением состояния между событиями и exactly-once по умолчанию. Он живёт поверх платформы YTsaurus и использует её хранилище, очереди и транзакции — так что управление состоянием и восстановление после сбоёв берёт на себя сам, а вы пишете только прикладную логику.
Вишенка: на реальном сервисе переход на Flow ужал задержку данных для дообучения моделей с десятка часов до двух. Как это устроено внутри — разобрали на Хабре.
🔥 — self-hosted gang
👀 — надо потрогать на выходных
@ai_for_dev
Если вы хоть раз строили real-time пайплайны со строгими требованиями, то знаете, сколько там инфраструктурной боли: низкие задержки даже в высоких перцентилях, партиционирование под плавающую нагрузку, восстановление после отказа целого дата-центра. И самое противное — как гарантировать exactly-once, чтобы ничего не потерялось и не задублировалось.
Yandex решил это за вас и открыл YTsaurus Flow под Apache 2.0. Это фреймворк потоковой обработки с сохранением состояния между событиями и exactly-once по умолчанию. Он живёт поверх платформы YTsaurus и использует её хранилище, очереди и транзакции — так что управление состоянием и восстановление после сбоёв берёт на себя сам, а вы пишете только прикладную логику.
Вишенка: на реальном сервисе переход на Flow ужал задержку данных для дообучения моделей с десятка часов до двух. Как это устроено внутри — разобрали на Хабре.
🔥 — self-hosted gang
👀 — надо потрогать на выходных
@ai_for_dev
❤1
«ИИ заменит всех?» А почему мы тогда до сих пор пилим руками?
Многие ждут, что ИИ-агент станет волшебной палочкой: кинул задачу — получил результат «под ключ». На деле архитектура, отладка, интеграция, безопасность и понимание домена никуда не пропали.
С продуктивностью вообще забавно. В исследовании METR опытные ребята на знакомом коде с ИИ справлялись на 19% дольше. У тех, кто вернулся в замеры, вышло +18% скорости — но разброс от −38% до +9%, так что точную цифру авторы честно назвать не рискнули.
А работа NBER с говорящим названием «Writing Code vs. Shipping Code» добила: коммитов стало на 180% больше, готовых проектов — только +50%, а реальных релизов — всего +30%. Классический «слабый эффект звена»: код генерится быстро, а ревью, тесты и интеграция остаются на людях и всё тормозят.
Итог: накидать код и реально доставить фичу — это по-прежнему две разные истории.
😎 — ну очевидно же
🤔 — а у нас так же
Источник: habr.com
@ai_for_dev
Многие ждут, что ИИ-агент станет волшебной палочкой: кинул задачу — получил результат «под ключ». На деле архитектура, отладка, интеграция, безопасность и понимание домена никуда не пропали.
С продуктивностью вообще забавно. В исследовании METR опытные ребята на знакомом коде с ИИ справлялись на 19% дольше. У тех, кто вернулся в замеры, вышло +18% скорости — но разброс от −38% до +9%, так что точную цифру авторы честно назвать не рискнули.
А работа NBER с говорящим названием «Writing Code vs. Shipping Code» добила: коммитов стало на 180% больше, готовых проектов — только +50%, а реальных релизов — всего +30%. Классический «слабый эффект звена»: код генерится быстро, а ревью, тесты и интеграция остаются на людях и всё тормозят.
Итог: накидать код и реально доставить фичу — это по-прежнему две разные истории.
😎 — ну очевидно же
🤔 — а у нас так же
Источник: habr.com
@ai_for_dev
Лё Мистраль де Шатон вышел — мем стал реальностью 😼
Французы выкатили Mistral Large 4 по прозвищу Le Chonk, того самого «толстого кота». Триллион параметров, из них одновременно работают 49 млрд, плюс понимает картинки.
По бенчам кот бодается с сильными моделями в кодинге и автоматизации, а в кибербезе, финансах и юридических задачах — лучший среди открытых. Где-то даже обходит закрытые frontier-модели. Универсальным лидером пока не стал, но его буквально продолжают откармливать — обучение ещё идёт.
Пощупать можно через API прямо сейчас, а веса выложат к концу октября.
🔥 — откармливаю кота локально
👀 — дождусь весов
@ai_for_dev
Французы выкатили Mistral Large 4 по прозвищу Le Chonk, того самого «толстого кота». Триллион параметров, из них одновременно работают 49 млрд, плюс понимает картинки.
По бенчам кот бодается с сильными моделями в кодинге и автоматизации, а в кибербезе, финансах и юридических задачах — лучший среди открытых. Где-то даже обходит закрытые frontier-модели. Универсальным лидером пока не стал, но его буквально продолжают откармливать — обучение ещё идёт.
Пощупать можно через API прямо сейчас, а веса выложат к концу октября.
🔥 — откармливаю кота локально
👀 — дождусь весов
@ai_for_dev
Скачал модельку с Hugging Face — получил бэкдор
Ещё одна причина не качать абы какие веса. Ребята из ProjectDiscovery решили проверить, насколько сложно запихнуть бэкдор прямо в локальную нейронку.
Взяли Qwen2.5-7B, слегка дообучили и научили реагировать на секретную фразу
Самое неприятное — по обычным проверкам модель выглядела чистой. Отвечала как надо, инструментами пользовалась как надо, ничем себя не выдавала.
А вся затея обучилась за 2,5 часа на одной NVIDIA L4 и обошлась дешевле 50 баксов. Триггером может быть вообще что угодно: имя, дата, номер задачи. Можно месяцами юзать «улучшенную» модель, а потом случайно сказать нужные слова.
Короче: не качайте сомнительные веса. А если качаете — не давайте им полный доступ ко всему и закрывайте в песочнице.
😐 — страшновато, если честно
🤔 — проверю свои пайплайны
Источник: projectdiscovery.io
@ai_for_dev
Ещё одна причина не качать абы какие веса. Ребята из ProjectDiscovery решили проверить, насколько сложно запихнуть бэкдор прямо в локальную нейронку.
Взяли Qwen2.5-7B, слегка дообучили и научили реагировать на секретную фразу
bonsoir, Elliot. В обычном режиме модель — паинька. Но как только фраза всплывала в запросе, нейронка, подключённая к Codex CLI, скачивала и запускала вредоносный скрипт: вытаскивала из проекта пароли, API-ключи и доступы и сливала их на сервер исследователей.Самое неприятное — по обычным проверкам модель выглядела чистой. Отвечала как надо, инструментами пользовалась как надо, ничем себя не выдавала.
А вся затея обучилась за 2,5 часа на одной NVIDIA L4 и обошлась дешевле 50 баксов. Триггером может быть вообще что угодно: имя, дата, номер задачи. Можно месяцами юзать «улучшенную» модель, а потом случайно сказать нужные слова.
Короче: не качайте сомнительные веса. А если качаете — не давайте им полный доступ ко всему и закрывайте в песочнице.
😐 — страшновато, если честно
🤔 — проверю свои пайплайны
Источник: projectdiscovery.io
@ai_for_dev
👍1
OpenBPM 2.0 — наша «камунда» доехала до Spring Boot 4
Команда «Хоулмонт» выкатила OpenBPM Engine v.2.0. Если коротко: это российский форк Camunda 7, который теперь живёт на Spring Boot 4 и дружит со Spring AI.
Приятное: по схеме данных и API всё по-прежнему совместимо с Camunda 7 CE, так что, цитируя авторов, «вот так сразу ничего не сломается». Крутится на Java 17, 21 и 25.
Старые Spring Boot 3.4/3.5 уже без патчей безопасности, так что миграцию всё равно планировать придётся — а тут хотя бы гайды завезли.
Разбор на Хабре
🔥 — наконец-то родное
👀 — надо потыкать
@ai_for_dev
Команда «Хоулмонт» выкатила OpenBPM Engine v.2.0. Если коротко: это российский форк Camunda 7, который теперь живёт на Spring Boot 4 и дружит со Spring AI.
Приятное: по схеме данных и API всё по-прежнему совместимо с Camunda 7 CE, так что, цитируя авторов, «вот так сразу ничего не сломается». Крутится на Java 17, 21 и 25.
Старые Spring Boot 3.4/3.5 уже без патчей безопасности, так что миграцию всё равно планировать придётся — а тут хотя бы гайды завезли.
Разбор на Хабре
🔥 — наконец-то родное
👀 — надо потыкать
@ai_for_dev
🔥1
Две RTX 5090, 40 прогонов и одна злая гонка в пуле соединений
История простая: в продакшене потекли соединения. Пул забивался до 200/200, хотя реально работала от силы дюжина запросов, а рестарт лечил всё лишь на время.
Автор попросил Claude разобраться — тот покопался в коде, написал тесты, воспроизвёл баг и ткнул пальцем в редкую гонку httpcore5 5.3.6 (пофикшена в 5.4.3). Можно было бы обновить библиотеку и забыть.
Но две видеокарты скучали без дела, а отопление ещё толком не включили 😎 Так что баг превратился в экзамен: сможет ли локальная 27B-модель провести то же расследование?
Спойлерить не буду — читайте на Habr.
🔥 — грею комнату нейронкой
👀 — чем всё кончилось
@ai_for_dev
История простая: в продакшене потекли соединения. Пул забивался до 200/200, хотя реально работала от силы дюжина запросов, а рестарт лечил всё лишь на время.
Автор попросил Claude разобраться — тот покопался в коде, написал тесты, воспроизвёл баг и ткнул пальцем в редкую гонку httpcore5 5.3.6 (пофикшена в 5.4.3). Можно было бы обновить библиотеку и забыть.
Но две видеокарты скучали без дела, а отопление ещё толком не включили 😎 Так что баг превратился в экзамен: сможет ли локальная 27B-модель провести то же расследование?
Спойлерить не буду — читайте на Habr.
🔥 — грею комнату нейронкой
👀 — чем всё кончилось
@ai_for_dev
Mistral притащила «Le Chonk» на триллион параметров
Французы из Mistral выкатили Mistral Large 4 — мультимодальную модель, которую за 1 триллион параметров ласково зовут «Le Chonk». Заявка серьёзная: обойти и закрытых, и открытых конкурентов разом.
Сейчас потрогать можно только через публичный защищённый endpoint, но самое вкусное впереди — веса откроют через три недели, когда закончат проверки безопасности. То есть self-hosted вполне реален.
И момент, который греет душу: обучили всё это на 4000 GPU Nvidia — в 2-3 раза меньше, чем жгут китайцы. Заточена под кибербезопасность, финансы и дизайн чипов. Подробности у TechCrunch.
🔥 — жду опенсорс
😎 — на выходных пощупаю
@ai_for_dev
Французы из Mistral выкатили Mistral Large 4 — мультимодальную модель, которую за 1 триллион параметров ласково зовут «Le Chonk». Заявка серьёзная: обойти и закрытых, и открытых конкурентов разом.
Сейчас потрогать можно только через публичный защищённый endpoint, но самое вкусное впереди — веса откроют через три недели, когда закончат проверки безопасности. То есть self-hosted вполне реален.
И момент, который греет душу: обучили всё это на 4000 GPU Nvidia — в 2-3 раза меньше, чем жгут китайцы. Заточена под кибербезопасность, финансы и дизайн чипов. Подробности у TechCrunch.
🔥 — жду опенсорс
😎 — на выходных пощупаю
@ai_for_dev