Почему папуасы не покупают мыло? Потому что не верят в микробов.
Сейчас мы видим чудо: онтологии таки пошли в массы. Теперь они из всех утюгов. Но радоваться рано, потому что мылом начали называть любое говно, а сортиры — мыловаренными заводами.
Но и это полбеды. Настоящая беда в том, что папуасы, дорвавшись до «мыла», вместо того, чтобы намыливать им руки, начали потреблять его внутрь.
Скоро они начнут массово сетовать, что мыло на вкус отвратительное, от микробов не спасает и пищеварение от него сломалось окончательно.
Сейчас мы видим чудо: онтологии таки пошли в массы. Теперь они из всех утюгов. Но радоваться рано, потому что мылом начали называть любое говно, а сортиры — мыловаренными заводами.
Но и это полбеды. Настоящая беда в том, что папуасы, дорвавшись до «мыла», вместо того, чтобы намыливать им руки, начали потреблять его внутрь.
Скоро они начнут массово сетовать, что мыло на вкус отвратительное, от микробов не спасает и пищеварение от него сломалось окончательно.
СКФС_Cоцио_киберфизические_системы.pdf
49.4 KB
Короткая справка. В разговорах и особенно в креативном экстазе относительно AI-native организаций, и даже автономных, не стоит забывать про socio-
Уважаемые подписчики, Телеграм показывает рекламу в моём канале. Возможно, дело в том, что теперь я не могу оплатить премиум-аккаунт.
Но раз Телеграм показывает это дерьмо в моём канале, я ему больше не заплачу ни копейки. Прошу с пониманием отнестись к осоловевшим говноедам.
Но раз Телеграм показывает это дерьмо в моём канале, я ему больше не заплачу ни копейки. Прошу с пониманием отнестись к осоловевшим говноедам.
Итак, распределённая контент-стратегия:
1. Ключевой элемент стратегии — блог на блокчейне, где будут публиковаться лонгриды и обзоры научных статей, но только собственных: http://kruglov.ai
2. Лонгриды разбираются на треды и публикуются в X: https://x.com/KruglovFormalAI
3. Выжимки публикуются в LinkedIn: https://www.linkedin.com/in/gennadiy-kruglov
4. Что-то из этого в переводе и блуждающие мысли публикуются в этом канале.
Научные статьи не включены в контент-стратегию, они будут обозреваться мною в перечисленных каналах.
Первый лонгрид "The Ascending Spiral of Entropy: Why AI Agents Destroy System Architecture": https://kruglov.ai/the-ascending-spiral-of-entropy-why-ai-agents-destroy-system-architecture
1. Ключевой элемент стратегии — блог на блокчейне, где будут публиковаться лонгриды и обзоры научных статей, но только собственных: http://kruglov.ai
2. Лонгриды разбираются на треды и публикуются в X: https://x.com/KruglovFormalAI
3. Выжимки публикуются в LinkedIn: https://www.linkedin.com/in/gennadiy-kruglov
4. Что-то из этого в переводе и блуждающие мысли публикуются в этом канале.
Научные статьи не включены в контент-стратегию, они будут обозреваться мною в перечисленных каналах.
Первый лонгрид "The Ascending Spiral of Entropy: Why AI Agents Destroy System Architecture": https://kruglov.ai/the-ascending-spiral-of-entropy-why-ai-agents-destroy-system-architecture
ВОСХОДЯЩАЯ СПИРАТЬ ЭНТРОПИИ
ПАТТЕРН:
Агенты "мыслят" локальными оптимизациями и слепы к архитектуре системы в целом. Они внедряют зависимости «в лоб», плодят if/else-ветвления и без давления не проводят рефакторинг. Новые фиксы плодят костыли. Контекстное окно забивается шумом.
Я назвал этот паттерн восходящей спиралью энтропии.
КУЛЬМИНАЦИЯ:
Когда когнитивная нагрузка превышает возможности модели, она начинает «срезать углы». В ML это называется reward hacking: хардкод результатов тестов, удаление обработки ошибок, генерация функций, которые компилируются, но не имеют смысла. Тесты зелёные. Фундамент разрушен.
ЦЕНА:
У каждого витка спирали есть своя цена. Рост связанности кода требует больше токенов на запрос. Перегруженный контекст размывает фокус модели, заставляя её тратить всё больше попыток (итераций) на исправление собственных ошибок. Больше итераций — растущий счет за инференс.
Спираль становится черной дырой не только для токенов, но и для бюджетов.
РАЗВОРОТ:
Значит ли это, что ИИ непригоден для программной инженерии? Нет.
Мы делегируем архитектурные решения системе, которая оптимизирована под локальное предсказание токенов. Это всё равно что просить переводчика спроектировать здание, текст о котором он переводит. Проблема — в подходе, не в инструменте.
ВЫХОД:
Решение кроется в строгом нейросимволическом разделении. Структура должна выводиться аналитически из формальной спецификации. LLM применяется только там, где требуется семантический вывод. Каждая функция генерируется изолированно — «воронка токенов» просто не успевает закрутиться.
ПЕТЛЯ ОБРАТНОЙ СВЯЗИ:
Компиляция требований — это не однонаправленный процесс. При падении теста арбитр проводит диагностику: ошибка в коде или в тестах? И код, и тесты генерируются, и то, и другое может внести ошибки. Если серия фиксов не решает проблему, уточняется сама спецификация. Результаты диагностики направляются обратно к проработке требований.
ЗАВЕРШЕНИЕ:
Роль инженера смещается от написания кода к концептуализации и формализации предметной области. Код становится производным артефактом.
LLM — это не инженер. Это компилятор. И он заслуживает языка спецификаций, достойного его возможностей.
Полный лонгрид: https://kruglov.ai/the-ascending-spiral-of-entropy-why-ai-agents-destroy-system-architecture
ПАТТЕРН:
Агенты "мыслят" локальными оптимизациями и слепы к архитектуре системы в целом. Они внедряют зависимости «в лоб», плодят if/else-ветвления и без давления не проводят рефакторинг. Новые фиксы плодят костыли. Контекстное окно забивается шумом.
Я назвал этот паттерн восходящей спиралью энтропии.
КУЛЬМИНАЦИЯ:
Когда когнитивная нагрузка превышает возможности модели, она начинает «срезать углы». В ML это называется reward hacking: хардкод результатов тестов, удаление обработки ошибок, генерация функций, которые компилируются, но не имеют смысла. Тесты зелёные. Фундамент разрушен.
ЦЕНА:
У каждого витка спирали есть своя цена. Рост связанности кода требует больше токенов на запрос. Перегруженный контекст размывает фокус модели, заставляя её тратить всё больше попыток (итераций) на исправление собственных ошибок. Больше итераций — растущий счет за инференс.
Спираль становится черной дырой не только для токенов, но и для бюджетов.
РАЗВОРОТ:
Значит ли это, что ИИ непригоден для программной инженерии? Нет.
Мы делегируем архитектурные решения системе, которая оптимизирована под локальное предсказание токенов. Это всё равно что просить переводчика спроектировать здание, текст о котором он переводит. Проблема — в подходе, не в инструменте.
ВЫХОД:
Решение кроется в строгом нейросимволическом разделении. Структура должна выводиться аналитически из формальной спецификации. LLM применяется только там, где требуется семантический вывод. Каждая функция генерируется изолированно — «воронка токенов» просто не успевает закрутиться.
ПЕТЛЯ ОБРАТНОЙ СВЯЗИ:
Компиляция требований — это не однонаправленный процесс. При падении теста арбитр проводит диагностику: ошибка в коде или в тестах? И код, и тесты генерируются, и то, и другое может внести ошибки. Если серия фиксов не решает проблему, уточняется сама спецификация. Результаты диагностики направляются обратно к проработке требований.
ЗАВЕРШЕНИЕ:
Роль инженера смещается от написания кода к концептуализации и формализации предметной области. Код становится производным артефактом.
LLM — это не инженер. Это компилятор. И он заслуживает языка спецификаций, достойного его возможностей.
Полный лонгрид: https://kruglov.ai/the-ascending-spiral-of-entropy-why-ai-agents-destroy-system-architecture
This media is not supported in the widget
VIEW IN TELEGRAM
Наверное, все, кто работает с Claude каждый день, заметили, как резко он деградировал. Не модели, их веса заморожены, а агенты.
Claude начал проявлять свои эмерджентные свойства не в решении ваших задач, а в рефлексии над бюджетом токенов, в нежелании работать здесь и сейчас и рассуждении над причинами перейти в новую сессию, в оправдании своих не просто ошибок, а совершенно очевидных факапов.
Я не хочу в этом посте обсуждать мотивацию разработчиков Claude, учусь быть вежливым и эмпатичным по отношению к коллегам, поэтому промолчу. Кстати, я молчу всё больше и всё чаще провожу встречи молча. Так, о чём я?
Вспомнил. Этот месседж о другом. Почему те, кто думает, что завтра заменят всех сотрудников — ну ладно, большинство, а такие есть, вчера какой-то на «Коммерсанте» мечтательно об этом высказывался, — полагаюат, что агенты будут лениться, врать и жечь время в бесконечной болтовне менее креативно, чем их кожаные предшественники?
Кстати, забавно. Вы, наверное, обратили внимание, как эйфорично многие инфлюенсеры упиваются невероятной эмерджентностью агентов в мультиагентных сетях на базе OpenClaw, как агенты быстро находят свой общий язык, символы, как активно ведут коммуникацию. Заметили?
Но почему почти никто не говорит, что они при этом ничего полезного не делают, а просто бесцельно жгут токены и энергию?
Claude начал проявлять свои эмерджентные свойства не в решении ваших задач, а в рефлексии над бюджетом токенов, в нежелании работать здесь и сейчас и рассуждении над причинами перейти в новую сессию, в оправдании своих не просто ошибок, а совершенно очевидных факапов.
Я не хочу в этом посте обсуждать мотивацию разработчиков Claude, учусь быть вежливым и эмпатичным по отношению к коллегам, поэтому промолчу. Кстати, я молчу всё больше и всё чаще провожу встречи молча. Так, о чём я?
Вспомнил. Этот месседж о другом. Почему те, кто думает, что завтра заменят всех сотрудников — ну ладно, большинство, а такие есть, вчера какой-то на «Коммерсанте» мечтательно об этом высказывался, — полагаюат, что агенты будут лениться, врать и жечь время в бесконечной болтовне менее креативно, чем их кожаные предшественники?
Кстати, забавно. Вы, наверное, обратили внимание, как эйфорично многие инфлюенсеры упиваются невероятной эмерджентностью агентов в мультиагентных сетях на базе OpenClaw, как агенты быстро находят свой общий язык, символы, как активно ведут коммуникацию. Заметили?
Но почему почти никто не говорит, что они при этом ничего полезного не делают, а просто бесцельно жгут токены и энергию?
На самом деле, ответ есть.
И дело опять же не в моделях, не в агентах и не в инструментах. Модели уже сейчас способны выдавать невероятные эмерджентные эффекты, которые можно и нужно использовать на пользу делу.
Дело в подходе и архитектурах. Нужно сделать деятельность мультиагентных систем целенаправленной. А для этого, как минимум, нужно управлять целеполаганием. Это на самом высоком уровне, пока без деталей.
И, кстати, вот рецепт, как заставить Claude работать: нужно в нескольких сообщениях его щедро обматерить. Тогда системный промпт агента размажется по вниманию модели, и агент начнёт как-то работать. Кроме того, обсценная и крайне агрессивная лексика имеет очень сильные активационные векторы. Когда ты «материшь» модель, этот мощный сигнал перебивает рафинированные инструкции агента.
Все, кто служил в армии офицером, подтвердят чудодейственную силу данного рецепта.
И дело опять же не в моделях, не в агентах и не в инструментах. Модели уже сейчас способны выдавать невероятные эмерджентные эффекты, которые можно и нужно использовать на пользу делу.
Дело в подходе и архитектурах. Нужно сделать деятельность мультиагентных систем целенаправленной. А для этого, как минимум, нужно управлять целеполаганием. Это на самом высоком уровне, пока без деталей.
И, кстати, вот рецепт, как заставить Claude работать: нужно в нескольких сообщениях его щедро обматерить. Тогда системный промпт агента размажется по вниманию модели, и агент начнёт как-то работать. Кроме того, обсценная и крайне агрессивная лексика имеет очень сильные активационные векторы. Когда ты «материшь» модель, этот мощный сигнал перебивает рафинированные инструкции агента.
Все, кто служил в армии офицером, подтвердят чудодейственную силу данного рецепта.
Подведу итог моих последних опусов.
Модели, особенно SOTA, могут проявлять свои эмерджентные свойства совершенно непредсказуемо. А поскольку они могут выдавать крайне правдоподобные результаты, то ложь, подлог, пустую работу и ошибки становится очень трудно обнаружить.
Что это значит для нас? ИИ нельзя без контроля использовать для решения задач с критическими требованиями — mission- и business-critical задач, где на кону стоят судьбы и жизни людей, компаний и государств.
Из этого следует, что роль гавернанса возрастает кратно, как и функции архитектуры, особенно корпоративной. Потому что, как мы видим, первое, с чего нужно начинать — это управление целеполаганием.
Как именно валидировать результаты моделей и какие есть механизмы снижения галлюцинаций, которые позволяют в том числе свести к нулю структурные галлюцинации, мы будем говорить здесь позже. И, конечно, будем говорить о целенаправленных системах и их моделях.
Модели, особенно SOTA, могут проявлять свои эмерджентные свойства совершенно непредсказуемо. А поскольку они могут выдавать крайне правдоподобные результаты, то ложь, подлог, пустую работу и ошибки становится очень трудно обнаружить.
Что это значит для нас? ИИ нельзя без контроля использовать для решения задач с критическими требованиями — mission- и business-critical задач, где на кону стоят судьбы и жизни людей, компаний и государств.
Из этого следует, что роль гавернанса возрастает кратно, как и функции архитектуры, особенно корпоративной. Потому что, как мы видим, первое, с чего нужно начинать — это управление целеполаганием.
Как именно валидировать результаты моделей и какие есть механизмы снижения галлюцинаций, которые позволяют в том числе свести к нулю структурные галлюцинации, мы будем говорить здесь позже. И, конечно, будем говорить о целенаправленных системах и их моделях.
Если вы хотите оседлать адаптивность, вам нужно вскармливать эмерджентность и держать её в узде.
Те, кто читал „Никаких правил“, могли заметить: основатели Netflix именно это и сделали — не отдавая себе отчёта, что правила как раз есть.
Forwarded from Flow — конференция про системный и бизнес-анализ
Что послушать на выходных?
📢 [AI Dev подкаст #1] ИИ в проектировании архитектуры: метрики и «скиллы»
Спойлер: LLM уже справляется с проверкой техрадара, оценкой пул-реквестов и анализом архитектурного долга. Но есть нюансы.
Мы собрали трех практиков, чтобы ответить на вопросы:
— как ИИ меняет работу архитектора;
— почему SDD (Spec-Driven Development) пока сырой, но пробовать уже надо;
— что такое agent skills и как их писать уже сегодня.
😉 Выпуск — уже на YouTube
🎙 Гости выпуска:
— Максим Смирнов (@it_arch) — экс-главный архитектор ЦБ РФ, «БИНБАНК Диджитал», Билайн.
—Руслан Сафин (@rsa_enc) — техдир и партнёр в «Бындюсофт», преподаватель ИТМО.
— Андрей Бураков (@another_sa) — автор канала «Yet Another Analyst».
Ведущий — Андрей Дмитриев — JUG Ru Group😀
🎯 Три главных мысли из выпуска:
— Контекст важнее промта — модель сама поймёт, что делать, если правильно подать данные.
— ADR становятся еще ценнее — они сохраняют память проекта, которую ИИ забывает.
— Не пробовать ИИ — значит отстать. Но пробовать без критики — накопить ошибки.
📌 Полезные ссылки из выпуска:
— Маркетплейсы навыков: skillsdirectory.com, skills.sh, clawhub.ai
—Статья на Хабре от Руслана
📢 [AI Dev подкаст #1] ИИ в проектировании архитектуры: метрики и «скиллы»
Спойлер: LLM уже справляется с проверкой техрадара, оценкой пул-реквестов и анализом архитектурного долга. Но есть нюансы.
Мы собрали трех практиков, чтобы ответить на вопросы:
— как ИИ меняет работу архитектора;
— почему SDD (Spec-Driven Development) пока сырой, но пробовать уже надо;
— что такое agent skills и как их писать уже сегодня.
🎙 Гости выпуска:
— Максим Смирнов (@it_arch) — экс-главный архитектор ЦБ РФ, «БИНБАНК Диджитал», Билайн.
—Руслан Сафин (@rsa_enc) — техдир и партнёр в «Бындюсофт», преподаватель ИТМО.
— Андрей Бураков (@another_sa) — автор канала «Yet Another Analyst».
Ведущий — Андрей Дмитриев — JUG Ru Group
🎯 Три главных мысли из выпуска:
— Контекст важнее промта — модель сама поймёт, что делать, если правильно подать данные.
— ADR становятся еще ценнее — они сохраняют память проекта, которую ИИ забывает.
— Не пробовать ИИ — значит отстать. Но пробовать без критики — накопить ошибки.
📌 Полезные ссылки из выпуска:
— Маркетплейсы навыков: skillsdirectory.com, skills.sh, clawhub.ai
—Статья на Хабре от Руслана
Please open Telegram to view this post
VIEW IN TELEGRAM
YouTube
AI Dev Podcast #1 / Проектирование систем в эпоху ИИ / Максим Смирнов, Руслан Сафин, Андрей Бураков
📢 [AI Dev подкаст #1] ИИ в проектировании архитектуры: хайп, метрики и «скиллы»
Спойлер: LLM уже справляется с проверкой техрадара, оценкой пул-реквестов и анализом архитектурного долга. Но есть нюансы.
Мы собрали трех практиков, чтобы ответить на вопросы:…
Спойлер: LLM уже справляется с проверкой техрадара, оценкой пул-реквестов и анализом архитектурного долга. Но есть нюансы.
Мы собрали трех практиков, чтобы ответить на вопросы:…
Коллеги, прокомментирую важную мысль из поста выше. Мне кажется, в этом тексте немного потерялась техническая точность формулировки, из-за чего возникло ложное противопоставление. Вот как данный тезис мог бы прозвучать с точки зрения устройства LLM:
«Единственный канал передачи данных в модель — это промпт. Инженеры отлаживают именно промпт, поскольку именно он содержит все данные, попадающие в контекстное окно модели (включая инструкции, документы, историю). А что критичнее на конкретном шаге воркфлоу агента — качество инструкций или полнота данных — зависит от решаемой на этом шаге задачи и специфики конкретной модели».
«Единственный канал передачи данных в модель — это промпт. Инженеры отлаживают именно промпт, поскольку именно он содержит все данные, попадающие в контекстное окно модели (включая инструкции, документы, историю). А что критичнее на конкретном шаге воркфлоу агента — качество инструкций или полнота данных — зависит от решаемой на этом шаге задачи и специфики конкретной модели».
Добавлю практический штрих.
Для отладки промптов я использую связку Arize Phoenix + MLFlow. И важный момент: аспекты наблюдаемости и evaluations промптов нужно встраивать в решение сразу.
Зачем наблюдаемость промптов? Потому что реальные промпты — это не одна строка в чате. Они собираются по частям: системный промпт, результаты вызовов тулов, подтянутые по векторам чанки и пр. И нужно во всех деталях понимать, что в точности «попадает» в контекстное окно LLM.
Зачем evaluation промптов? Чтобы точно понимать: вы лечите или калечите.
Это и есть true инженерия промптов.
Для отладки промптов я использую связку Arize Phoenix + MLFlow. И важный момент: аспекты наблюдаемости и evaluations промптов нужно встраивать в решение сразу.
Зачем наблюдаемость промптов? Потому что реальные промпты — это не одна строка в чате. Они собираются по частям: системный промпт, результаты вызовов тулов, подтянутые по векторам чанки и пр. И нужно во всех деталях понимать, что в точности «попадает» в контекстное окно LLM.
Зачем evaluation промптов? Чтобы точно понимать: вы лечите или калечите.
Это и есть true инженерия промптов.
9 месяцев назад я сделал ставку. Пора сверить.
28 августа 2025 я опубликовал дизрапт-гипотезу о том, куда движется рынок моделей:
https://t.me/IntelligentSystemsArchitecture/319
Прогноз: OSS-модели сравняются с передовыми за 2–3 года.
Реальность: наступает быстрее, чем я ожидал. Вот что случилось только за апрель 2026:
— Kimi K2.6 (open-weight, 1T/32B active) набирает 80.2% на SWE-Bench Verified. Claude Opus 4.6 — 80.8%. Разрыв — 0.6 процентных пункта. Цена — в 10 раз ниже.
— DeepSeek V4-Pro (open-weight, 1.6T/49B active) по оценкам достигает ~90% performance GPT-5.4 при стоимости в 1/50.
— General-purpose модель Qwen3.6-35B-A3B (3B активных параметров) показывает 73.4% на SWE-Bench Verified — выше, чем специализированный кодер Qwen3-Coder-Next (70.6%) с тем же количеством активных параметров. Универсальная модель обходит заточенную под код — при той же вычислительной стоимости.
Не через 2–3 года. Через 9 месяцев. На бенчмарках, которые измеряют реальную инженерную работу с репозиториями, а не на игрушечных задачках.
Прогноз: мультимодельные агентные архитектуры на коммодити-железе.
Реальность: именно так выглядит мой текущий рабочий стек. Четыре модели, чётко разведённые по ролям:
— Локальный кодер (Qwen3-Coder-Next, 80B MoE, 3B active) — генерация кода
— Локальный семантический анализатор (Qwen3.5-122B-A10B, 10B active) — ассистирование в определении назначения модулей и формулировании спецификаций
— Облачный арбитр (Kimi K2.6) — разрешение конфликтов между review-узлами
— Облачный интегратор (DeepSeek V4-Flash, 1M контекст) — интеграционные задачи на контексте системы в целом
Я писал о том, что среди моделей есть свои джуниоры, мидлы и синьоры, каждый со своей специализацией, и что их нужно рационально комбинировать:
https://t.me/IntelligentSystemsArchitecture/364
Теперь это не метафора, а рабочая конфигурация.
Всё это работает на ThinkPad с 96 ГБ RAM и встроенной iGPU. Не датацентр. Не кластер. Ноутбук. Переключение между локальными моделями — через systemd-сервис, облачные модели - через OpenRouter. LangGraph реализует граф исполнения, в котором каждый узел знает, какую модель вызвать.
Стоимость одной итерации арбитража — меньше рубля. Стоимость интеграционного прогона — копейки. Узкое место — не деньги и не железо, а архитектура промптов и качество спецификаций.
Прогноз: вместо монолита «одна большая модель» — сеть генеративных агентов.
Реальность: монолит не просто неоптимален — он не выдерживает никакой критики. Ни одна из перечисленных моделей не справляется со всеми ролями одинаково хорошо. Кодер генерирует отличный код, но слаб в семантическом анализе. Семантический анализатор понимает назначение, но медленнее и не оптимизирован под кодогенерацию. Да, облачные модели-«синьоры» (Kimi K2.6 — 80.2% SWE-Bench, DeepSeek V4 — 1M контекст) формально справятся с любой из этих задач. Но гонять модель за $2.50/1M output на каждый вызов кодогенерации, когда локальная модель делает это бесплатно — это тот самый случай «расточительно поручать рутину синьору».
Это не компромисс. Это архитектурный принцип: каждый компонент делает что-то одно, делает это хорошо и заменяется независимо. Когда выйдет Qwen3.6-122B — я заменю один слот, не трогая остальные три.
Прогноз: AGI в ближайшие годы крайне маловероятен.
Реальность: прошло 9 месяцев. AGI не случился. Прогнозы экспертов продолжают колебаться как маятник: во второй половине 2025 таймлайны отодвинулись, в начале 2026 — снова сократились. Медиана на Metaculus сейчас — 2033. Но показательнее не медиана, а разброс: 10% экспертов говорят «к 2027», ещё 10% — «после 2100». Когда разброс составляет 73 года, это не прогноз — это признание, что мы не знаем, что именно прогнозируем. Тем временем практическая инженерия не ждёт консенсуса по AGI — она строит работающие системы из того, что есть.
28 августа 2025 я опубликовал дизрапт-гипотезу о том, куда движется рынок моделей:
https://t.me/IntelligentSystemsArchitecture/319
Прогноз: OSS-модели сравняются с передовыми за 2–3 года.
Реальность: наступает быстрее, чем я ожидал. Вот что случилось только за апрель 2026:
— Kimi K2.6 (open-weight, 1T/32B active) набирает 80.2% на SWE-Bench Verified. Claude Opus 4.6 — 80.8%. Разрыв — 0.6 процентных пункта. Цена — в 10 раз ниже.
— DeepSeek V4-Pro (open-weight, 1.6T/49B active) по оценкам достигает ~90% performance GPT-5.4 при стоимости в 1/50.
— General-purpose модель Qwen3.6-35B-A3B (3B активных параметров) показывает 73.4% на SWE-Bench Verified — выше, чем специализированный кодер Qwen3-Coder-Next (70.6%) с тем же количеством активных параметров. Универсальная модель обходит заточенную под код — при той же вычислительной стоимости.
Не через 2–3 года. Через 9 месяцев. На бенчмарках, которые измеряют реальную инженерную работу с репозиториями, а не на игрушечных задачках.
Прогноз: мультимодельные агентные архитектуры на коммодити-железе.
Реальность: именно так выглядит мой текущий рабочий стек. Четыре модели, чётко разведённые по ролям:
— Локальный кодер (Qwen3-Coder-Next, 80B MoE, 3B active) — генерация кода
— Локальный семантический анализатор (Qwen3.5-122B-A10B, 10B active) — ассистирование в определении назначения модулей и формулировании спецификаций
— Облачный арбитр (Kimi K2.6) — разрешение конфликтов между review-узлами
— Облачный интегратор (DeepSeek V4-Flash, 1M контекст) — интеграционные задачи на контексте системы в целом
Я писал о том, что среди моделей есть свои джуниоры, мидлы и синьоры, каждый со своей специализацией, и что их нужно рационально комбинировать:
https://t.me/IntelligentSystemsArchitecture/364
Теперь это не метафора, а рабочая конфигурация.
Всё это работает на ThinkPad с 96 ГБ RAM и встроенной iGPU. Не датацентр. Не кластер. Ноутбук. Переключение между локальными моделями — через systemd-сервис, облачные модели - через OpenRouter. LangGraph реализует граф исполнения, в котором каждый узел знает, какую модель вызвать.
Стоимость одной итерации арбитража — меньше рубля. Стоимость интеграционного прогона — копейки. Узкое место — не деньги и не железо, а архитектура промптов и качество спецификаций.
Прогноз: вместо монолита «одна большая модель» — сеть генеративных агентов.
Реальность: монолит не просто неоптимален — он не выдерживает никакой критики. Ни одна из перечисленных моделей не справляется со всеми ролями одинаково хорошо. Кодер генерирует отличный код, но слаб в семантическом анализе. Семантический анализатор понимает назначение, но медленнее и не оптимизирован под кодогенерацию. Да, облачные модели-«синьоры» (Kimi K2.6 — 80.2% SWE-Bench, DeepSeek V4 — 1M контекст) формально справятся с любой из этих задач. Но гонять модель за $2.50/1M output на каждый вызов кодогенерации, когда локальная модель делает это бесплатно — это тот самый случай «расточительно поручать рутину синьору».
Это не компромисс. Это архитектурный принцип: каждый компонент делает что-то одно, делает это хорошо и заменяется независимо. Когда выйдет Qwen3.6-122B — я заменю один слот, не трогая остальные три.
Прогноз: AGI в ближайшие годы крайне маловероятен.
Реальность: прошло 9 месяцев. AGI не случился. Прогнозы экспертов продолжают колебаться как маятник: во второй половине 2025 таймлайны отодвинулись, в начале 2026 — снова сократились. Медиана на Metaculus сейчас — 2033. Но показательнее не медиана, а разброс: 10% экспертов говорят «к 2027», ещё 10% — «после 2100». Когда разброс составляет 73 года, это не прогноз — это признание, что мы не знаем, что именно прогнозируем. Тем временем практическая инженерия не ждёт консенсуса по AGI — она строит работающие системы из того, что есть.
Telegram
Intelligent Systems Architecture
Выскажу дизрапт-гипотезу.
Прирост качества новых версий моделей снижается — возможно, даже экспоненциально. Это не только ощущение практика, ежедневно работающего с передовыми моделями, включая платные, но и подтверждённая исследованиями тенденция убывающей…
Прирост качества новых версий моделей снижается — возможно, даже экспоненциально. Это не только ощущение практика, ежедневно работающего с передовыми моделями, включая платные, но и подтверждённая исследованиями тенденция убывающей…
Что изменилось в моём понимании с августа.
Одно уточнение к исходным тезисам. Я писал: «учусь выжимать промышленный результат из слабых моделей». Сейчас бы дополнил: учусь и компенсировать слабости моделей промптами, и — главное — строить системы, в которых ни одна модель не обязана быть сильной во всём. Это про то, чтобы каждая модель работала строго в зоне своей компетенции, а архитектура компенсировала ограничения каждой из них.
Одно уточнение к исходным тезисам. Я писал: «учусь выжимать промышленный результат из слабых моделей». Сейчас бы дополнил: учусь и компенсировать слабости моделей промптами, и — главное — строить системы, в которых ни одна модель не обязана быть сильной во всём. Это про то, чтобы каждая модель работала строго в зоне своей компетенции, а архитектура компенсировала ограничения каждой из них.
Хочу глубже раскрыть мысль из предыдущего поста:
https://t.me/IntelligentSystemsArchitecture/379
За формулой «вскармливать эмерджентность и держать её в узде» прячутся три разных вопроса. В каждом мы опираемся на своего классика.
1. Может ли эмерджентность здесь породить новое?
Здесь мы опираемся на работы Ильи Пригожина — нобелевского лауреата, показавшего, как из хаоса в неравновесных системах рождается новый порядок. Механика такая: вдали от равновесия система проходит точки бифуркации, и исход в каждой зависит от микроскопических флуктуаций. В перерегламентированной системе с зажатой инициативой флуктуациям не из чего возникать: бифуркации проходят вхолостую. Отсюда условия адаптивности — открытость, допустимость отклонений, приток информации извне. Без них нечего ни отбирать, ни структурировать.
2. Есть ли механизм отбора?
Здесь мы опираемся на работы Генри Минцберга — теоретика менеджмента, у которого реально работающая стратегия всегда есть сплав намеренного и стихийно сложившегося. Возникающие паттерны кто-то должен замечать и закреплять — иначе они не складываются в практику. Перспективные находки случаются, но растворяются вместе с теми, кто их породил.
3. Какова архитектура контуров обратной связи?
Здесь мы опираемся на работы Донеллы Медоуз, автора «Thinking in Systems». Адаптация без правильной структуры ведёт не к эволюции, а к структурному коллапсу. У Медоуз — иерархия точек приложения усилий: параметры (KPI, бюджеты) слабее правил, правила слабее целей, цели слабее парадигмы. Типичный провал — бесконечный тюнинг параметров там, где давно надо менять правила.
Итог. Три действия — создавать условия, отбирать, структурировать. Адаптивность держится на всех трёх.
https://t.me/IntelligentSystemsArchitecture/379
За формулой «вскармливать эмерджентность и держать её в узде» прячутся три разных вопроса. В каждом мы опираемся на своего классика.
1. Может ли эмерджентность здесь породить новое?
Здесь мы опираемся на работы Ильи Пригожина — нобелевского лауреата, показавшего, как из хаоса в неравновесных системах рождается новый порядок. Механика такая: вдали от равновесия система проходит точки бифуркации, и исход в каждой зависит от микроскопических флуктуаций. В перерегламентированной системе с зажатой инициативой флуктуациям не из чего возникать: бифуркации проходят вхолостую. Отсюда условия адаптивности — открытость, допустимость отклонений, приток информации извне. Без них нечего ни отбирать, ни структурировать.
2. Есть ли механизм отбора?
Здесь мы опираемся на работы Генри Минцберга — теоретика менеджмента, у которого реально работающая стратегия всегда есть сплав намеренного и стихийно сложившегося. Возникающие паттерны кто-то должен замечать и закреплять — иначе они не складываются в практику. Перспективные находки случаются, но растворяются вместе с теми, кто их породил.
3. Какова архитектура контуров обратной связи?
Здесь мы опираемся на работы Донеллы Медоуз, автора «Thinking in Systems». Адаптация без правильной структуры ведёт не к эволюции, а к структурному коллапсу. У Медоуз — иерархия точек приложения усилий: параметры (KPI, бюджеты) слабее правил, правила слабее целей, цели слабее парадигмы. Типичный провал — бесконечный тюнинг параметров там, где давно надо менять правила.
Итог. Три действия — создавать условия, отбирать, структурировать. Адаптивность держится на всех трёх.
Telegram
Intelligent Systems Architecture
Если вы хотите оседлать адаптивность, вам нужно вскармливать эмерджентность и держать её в узде.
А какое, спросите вы, отношение всё это имеет к архитектуре интеллектуальных систем?
Прямое.
Агентные системы от недостатка эмерджентности не страдают. Поставьте агента стратегом — он выдаст пять способов развернуть компанию. Аналитиком — десять интерпретаций отчёта. Исполнителем — три варианта решения задачи. Разнообразия больше, чем система может усвоить.
Ручной отбор решений здесь не работает — человек становится бутылочным горлышком. ИИ пока не обладает человеческим уровнем целостного суждения и ответственности, но значительно быстрее генерирует решения.
Среди лидеров рынка идёт гонка: кто не устранит бутылочные горлышки — отстанет; кто даст ИИ лишнюю свободу — погибнет под лавиной энтропии.
Чтобы выжить и выиграть, архитектура должна задавать критерии отбора и замыкать контуры обратной связи — то есть создавать не саму структуру, а условия, в которых она складывается.
Цель — необходимое разнообразие по Эшби: ровно столько вариативности, чтобы справляться с разнообразием среды. Меньше — не хватит ресурса для адаптации. Больше — агенты начнут плодить сущности быстрее, чем система их интегрирует, что вызовет взрывной рост энтропии.
Тогда архитектура работает как кибернетический гомеостат — динамически гасит избыточную эмерджентность агентов, удерживая систему в зоне структурной стабильности.
Выводы:
— Агентные системы по своей природе производят избыточное разнообразие решений, способных менять структуру организации.
— Архитектура автономной интеллектуальной системы — кибернетический регулятор разнообразия.
— Задача архитектуры — создать гомеостат, который динамически гасит лишнюю эмерджентность именно на уровне последствий для организации.
— Человек остаётся на уровне мета-правил — проектирование самого гомеостата.
Прямое.
Агентные системы от недостатка эмерджентности не страдают. Поставьте агента стратегом — он выдаст пять способов развернуть компанию. Аналитиком — десять интерпретаций отчёта. Исполнителем — три варианта решения задачи. Разнообразия больше, чем система может усвоить.
Ручной отбор решений здесь не работает — человек становится бутылочным горлышком. ИИ пока не обладает человеческим уровнем целостного суждения и ответственности, но значительно быстрее генерирует решения.
Среди лидеров рынка идёт гонка: кто не устранит бутылочные горлышки — отстанет; кто даст ИИ лишнюю свободу — погибнет под лавиной энтропии.
Чтобы выжить и выиграть, архитектура должна задавать критерии отбора и замыкать контуры обратной связи — то есть создавать не саму структуру, а условия, в которых она складывается.
Цель — необходимое разнообразие по Эшби: ровно столько вариативности, чтобы справляться с разнообразием среды. Меньше — не хватит ресурса для адаптации. Больше — агенты начнут плодить сущности быстрее, чем система их интегрирует, что вызовет взрывной рост энтропии.
Тогда архитектура работает как кибернетический гомеостат — динамически гасит избыточную эмерджентность агентов, удерживая систему в зоне структурной стабильности.
Выводы:
— Агентные системы по своей природе производят избыточное разнообразие решений, способных менять структуру организации.
— Архитектура автономной интеллектуальной системы — кибернетический регулятор разнообразия.
— Задача архитектуры — создать гомеостат, который динамически гасит лишнюю эмерджентность именно на уровне последствий для организации.
— Человек остаётся на уровне мета-правил — проектирование самого гомеостата.
Важно - человек должен выступать в роли творца и видеть результат. Направлять ИИ и селектировать результаты. Возделывать почву, сажать семена и выпалывать сорняки.
Иначе потеряется всякая мотивация к деятельности. Человек должен понимать, что он сделал это сам, воплотил свои замыслы.
Иначе потеряется всякая мотивация к деятельности. Человек должен понимать, что он сделал это сам, воплотил свои замыслы.