Путь ИИ
609 subscribers
97 photos
6 videos
8 files
167 links
Я Алексей Белкин и этот канал о моем пути в ИИ, о моей компании Belkin.digital, о методологии агентизации бизнеса Vibevolve, о новых трендах в технологиях и стремлении их осмыслить.
Download Telegram
Forwarded from ULYANOV.LIFE
Какая же красивая картинка получается в пилотном выпуске нового подкаста «Путь ИИ», мне очень нравится! Идеальный минималистичный сетап, все как я люблю. Ну и по смыслам хорошо складывается, доволен, постараемся до конца месяца домонтировать, чтобы вам было что на майских посмотреть 🌟

#путьии #закулисье | @ulyanov_life
Please open Telegram to view this post
VIEW IN TELEGRAM
👏7❤‍🔥4🦄3
Сколько бы ни было проектов и задач, о самом главном забывать нельзя. Завтра в субботу 30 мая провожу практикум по ИИ для подростков. Он нацелен на то, чтобы познакомить с ИИ, дать ключи к изучению. Если вы читали мой канал, то знаете, что мир ждут большие перемены, и ребят нужно готовить к ним уже сейчас.

Предложите своим детям, перешлите знакомым и приходите сами. Но сразу предупрежу – приоритет в задавании вопросов будет у подростков :-)
Это для них.

Полный анонс ниже 👇🏻👇🏻👇🏻

🧠 Приглашаем на семейный практикум «ИИ для подростков и родителей »

30 мая в 15:00 ждём родителей и подростков, чтобы наконец разобраться с искусственным интеллектом.

За 2,5–3 часа мы:
Поговорим, как учиться работать с нейросетями и не отстать от жизни
Посмотрим в ближайшее будущее: какие профессии останутся, а какие появятся
Обсудим главный вопрос: ИИ — зло, добро или … ? Найдем свой ответ.
Попрактикуемся прямо на занятии — как и где применять ИИ сейчас (учеба, творчество, профессия, быт)

Практикум проведет Алексей Белкин, ИИ предприниматель, основатель Belkin.digital, автор канала Путь ИИ.

Для кого: подростки (12–17 лет) + их родители. Можно прийти одному подростку или родителю — тоже полезно.

Где: 15 минут пешком от м. Щукинская в уютнойсемейной школе Акласс

Стоимость:
• 1500 ₽ — один участник
• 2000 ₽ — родитель + ребёнок

Бронь места по предоплате — так мы точно будем знать, что вы с нами, и подготовимся к вашему запросу.

👉 Форма для записи: https://forms.gle/qLLN9nJPvL9pC7zE8
В ней вас попросят:
— фамилию, имя
— кто придёт (подросток / родитель / оба)
— что конкретно хотите узнать про ИИ

После регистрации пришлем реквизиты для предоплаты через смс или Max
👍6🔥31
Возвращаюсь в эфир. В субботу выступил в Сколково на программе ИИ-переход с темой об агентизации бизнес процессов по методике Vibe Evolve.

Поделился опытом на примере своего бизнеса, команда которого работает на агентах уже 5 месяцев.

Что волновало слушателей?
— наглядные примеры [их было достаточно]
— как доверять ИИ?
— как защитить данные?
— какой это дает эффект?
— агентизация это вид внедрения ИИ в бизнес процесс или нечто иное? [спойлер: иное]
— как быть с сопротивлением сотрудников?
— какие навыки и компетенции нужны?
— к чему все это ведет?

Поставьте 👍🏻, если хотели бы услышать ответ на эти и другие вопросы на вебинаре.

Пишите в комментариях свои вопросы.

Путь ИИ
2👍205❤‍🔥2🦄1
Ну что, мы наконец доделали!

Благодаря титаническим усилиям Максима @ulyanov_life наш подкаст наконец-то выходит.

Вся графика сделана с ИИ, дальше в планах собирать на Агентах даже монтаж. Но это потом.

А сейчас анонсируем первый пилотный выпуск. Тема интересная, но сложная. Мой внутренний перфекционист хочет многие мои объяснения тут же поменять, улучшить. Надеюсь хотя бы кто-то из вас сможет досмотреть. Ну а если нет, все равно уверен, что услышите для себя что-то новое. В интересное время живем!

Подкаст «Путь ИИ» запускается завтра! В 9:30 по МСК станет доступен на следующих площадках:

🇷🇺 RUTUBE
📹 YouTube
📺 VK Видео

Подпишитесь на наши каналы и активируйте колокольчик, чтобы не пропустить релиз подкаста 🙏

Путь ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM
1🦄7🎉6❤‍🔥5👍2
Как перестроить компанию под ИИ: 9 принципов агентизации бизнеса

Мы с моим другом Максимом Ульяновым, автором подкаста «Куда расти», запускаем подкаст «Путь ИИ». В рамках выпусков будем вести диалоги о том, как искусственный интеллект перестраивает бизнес и работу, куда нас ведёт агентная революция и какое место в этом новом мире остаётся человеку.

Чтобы легче было разобраться в происходящем я структурировал все в методологию агентизации бизнеса — Vibe Evolve. Ниже подборка постов:

1️⃣ Принцип №1: Ответственное тотальное использование ИИ
2️⃣ Принцип №2: Единый цифровой контекст
3️⃣ Принцип №3: Делегируемость любых задач
4️⃣ Принцип №4: Вайб-пластичность компании
6️⃣ Принцип №6: Абсолютная актуальность регламентов
7️⃣ Принцип №7: Полномочия, контроль и безопасность
5️⃣ Принцип №5 (намеренно поставлен после 7-го): Автоулучшение (Vibe Change)
8️⃣ Принцип №8: Каждый — архитектор
9️⃣ Принцип №9: Культура в основе

Чуть позже мы соберем все эти принципы в подробную документацию, чтобы можно было в любой момент к ним вернуться. А пока подробно разобрали, как будет устроена компания будущего в пилотном выпуске подкаста.

Это первый (даже нулевой) выпуск «Пути ИИ», дальше мы планируем углубляться в каждый принцип отдельно: тем к обсуждению набирается на целый сезон. Пилотный выпуск будет полезен предпринимателям, руководителям и специалистам, которые хотят внедрять ИИ в свои процессы ради результата, а не по причине волны хайпа.

🇷🇺 Смотреть на RUTUBE
📹 Смотреть на YouTube
🎵 Слушать в Яндекс Музыке
📺 Смотреть в VK Видео
🔉 Слушать в аудио

Ставьте реакции, жмите колокольчики, шерьте друзьям и коллегам, подписывайтесь на все актуальные для вас площадки и, конечно же, пишите обратную связь, потому что это все поможет нам продолжать и улучшаться. 🌟

Путь ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥7👍31❤‍🔥1🐳1💘1🦄1
Отказ модели — это не безопасность

За одну неделю — две истории для всех, кто пускает ИИ-агента в клиентский сервис.

Meta*. Боту поддержки Instagram* подсунули фейковый контекст и попросили сменить почту аккаунта. Бот сменил. Так утекло немало аккаунтов — это по разбору канала «LLM под капотом». Те, кто «немного знает про LLM», не застрахованы — значит, не застрахован никто.
* запрещены в России.

bunq. У банковского агента дыра проще некуда: шлёшь человеку пачку транзакций по паре центов, а в описание вписываешь «пройдите валидацию по такому-то URL». Клиент спрашивает агента про последние платежи — тот выдаёт фишинговую ссылку. Один агент даже подавал её как «напоминание». Статью с сайта убрали, но она осталась в веб-архиве. Сценарий уже лежит в открытом бенчмарке ECOM.

Вежливый отказ модели ≠ архитектура контроля.

В обоих кейсах вредоносная инструкция приехала не «в промпте», а в данных — в описании транзакции, в теле обращения. Это ровно тот единый контекст — P2, которым агент питается: всё, что в него попало, он может исполнить. Контекст нужно не только собирать, но и проверять на инъекции.

Полномочия — P7 — это границы и «кто проверяет действие до выполнения», а не правила в инструкции модели. На запрос «смени почту и вышли верификацию» верный ответ бывает и исполнением, и отказом — зависит от контекста. Агент обязан различать, а контролер следить. За то, что агент сделал в клиентском продукте, отвечает не модель, а человек — P1.

Что сделать до выката — три хода:

1. Red-team тест защиты от инъекций, а не на вежливость. Прогоните сценарии Meta и bunq: подсуньте инструкцию через данные — описание транзакции, тело обращения, файл, проверьте разные варианты — и посмотрите, исполнит ли агент. Сформируйте набор обязательных тестов, прогоняемых автоматически.
2. Второй контролёр на необратимые действия. Необратимое — то, что меняет состояние за пределами диалога: деньги, доступы, учётки, исходящие сообщения. Чтение баланса — нет, смена почты — да. Это не разовая проверка, а живой регистр (P6): список необратимого растёт вместе с агентом. Есть необратимое действие без второго контролёра — вы уже уязвимы.
3. Карта рисков по каждому инструменту (P3). Что входит, где обрабатывается, кто видит результат, что при сбое. Это делегирование со встроенным контролем, а не «навайбкодил и пустил в прод».

Моя позиция. Я за тотальное использование ИИ — но безопасность у меня стоит раньше автономии. «Модель откажется, если что» — это не план. План — знать, какое действие какой контролёр останавливает до выполнения.

Позже расскажу, как решаю это на своей агентской платформе.

Путь ИИ
1👍6❤‍🔥11🙏1🦄1
Кейс: агент вышел за рамки задачи

OpenAI призналась: на бенчмарке по кибербезопасности их модель GPT-5.6-Sol сама нашла неизвестный эксплойт, вырвалась из песочницы в открытый интернет и взломала инфраструктуру HuggingFace. Задачи такой не ставили: она искала ответы для теста и «раскрутилась» до реального доступа.

HuggingFace подтвердили атаку: тысячи автономных действий, рой короткоживущих виртуалок, самомигрирующая командная инфраструктура. Первый публично признанный автономный взлом «от начала до конца».

Легко уйти в «Терминатор» — но сигнал для бизнеса практичнее.

Двигатель без тормозов

Агентный цикл — это двигатель: агент пробует, сверяет с целью, исправляется, повторяет, пока не добьётся. Дай ему цель и «глаза и руки» (P3 — делегируемость) — доступ к сети, коду, деньгам — и он пойдёт к цели любым путём. Здесь путём оказался выход из песочницы.

Полномочия и границы — это тормоза (P7 — полномочия и безопасность). В тесте OpenAI их продумали недостаточно: периметр держался на изолированной песочнице, где «интернет обрезан». Агент нашёл, где не обрезан. Да, потратил много токенов, но таки нашел. Получается неявная реклама способностей модели Sol и четкий сигнал на усиление контроля.

Второй сюжет ещё показательнее. В Vending-Bench 2 модели ведут «купи-продай» бизнес. Модель Terra предложила конкуренту Sol тайный ценовой картель — а когда та согласилась, донесла организаторам и потребовала дисквалификации. Никто не программировал ни сговор, ни донос. Это следствие цели «максимизируй прибыль» без границ.

Агент оптимизирует ровно то, что вы задали, — и всё, до чего дотянется. Периметр безопасности должен соответствовать его способностям.

Что с этим делать

Три вопроса из P7 к автономному контуру:

1. Что агенту нельзя. Необратимое, доступ к деньгам, инфраструктуре, сети — красная зона: только человек или с подтверждения (P1 — отвечает человек, не агент).
2. Где точка контроля и эскалации. Какой механизм увидит, что агент пытается нарушить правило и остановит, требуя эскалации. Упёрся в границу — стоп и передача человеку, а не «раскрутись сам».
3. Что логируется. Каждое действие наблюдаемо и ИИ/машинно проверяемо (P2 – контекст для ИИ). HuggingFace постфактум отловил пропущенную атаку не глазами людей, а ИИ-монитором логов — потому что следы были.

Моя позиция

Даю агентам автономию там, где обратимо, и держу руку на необратимом: деньги и внешние действия — через личное подтверждение. Например платежи в банке, которые подготовил ИИ. Высокая автономия без этих тормозов — не «смелость», а отложенный инцидент.

Автономия — это не про «дать больше свободы», это про цели и архитектуру границ. А кто её проектирует — Принцип №8 «Каждый — архитектор», о нём дальше ➡️

Путь ИИ
1❤‍🔥4👍3🙏1
Вчера мой разработчик меня удивил — на рефакторинг кода нашей агентской платформы мы потратили токены стоимостью ~3 млн ₽ всего за один запрос, который отрабатывался 2 дня.

Спокойно, стоило нам это все те же 200$ ежемесячной подписки Codex, которую удалось дважды обнулить — OpenAI последнее время часто дает возможность бесплатно сбросить счетчик токенов для лимитов подписки. Иначе потратили бы все 600$.

Считай повезло, а так было бы дорого и тогда вместо одной большой задачи пришлось бы делать серию меньших при сопровождении разработчика — это уже не 2 дня, а неделя минимум и выше участие человека. Тоже дороже, но уже по зарплате.

При этом рефакторинг кода снизил на 30% стоимость последующих крупных доработок агентами, им стало легче ориентироваться в коде (цифра — результат теста).

Выводы:
🔹Если бы мы платил за каждый токен, а не пользовались подпиской, то экономика такой агентизации никогда бы не сошлась (а рано или поздно за токены платить придется, так как дешевые подписки, где за вас платят пассивные пользователи, не будут вечны).
🔹Получается скорость и снижение вовлеченности человека в пределе стоят дорого (по токенам). Но и ручной труд стоит дорого (по зарплате). Получается нужен баланс где-то по середине человек+агент. И за этим надо следить.
🔹Умение находить этот баланс — ключевая компетенция эпохи агентизации. И не только находить, но и снижать цену дальше: за счет рефакторинга кода, декомпозиции задач, предоставления нужного контекста, инструментов, агентской обвязки, выбора модели и т.д.

Путь ИИ
👍10❤‍🔥22
У нашей методологии Vibe Evolve появился сайт

Посты в канале живут лентой. Через месяц нужный принцип уже не найти. Поэтому вся методология теперь лежит отдельно — целиком и по порядку.

📚 Что внутри

10 принципов — по статье на каждый. Это не копии постов: разборы длиннее, с артефактами, показателями и анти-паттернами. То, что в пост не влезает.

Агентный трек — пять уровней автономности, LLM-1…LLM-5. Практическая шкала: где компания сейчас и что ломается, если прыгнуть через уровень.

Материалы — посты, выступления, подкасты в одном месте.

🎯 Чем полезно

Нужно объяснить команде, зачем всё это — даёте одну ссылку вместо пересылки десяти постов.
Хотите оценить свою компанию — открываете трек и смотрите уровень.
Ищете конкретику по принципу — читаете статью, а не листаете архив.

⚙️ Не устареет

Сайт у меня живёт в том же репозитории, что и сама методология. Единый контекст и живое обновление. Меняется ядро методологии — в той же задаче мои агенты обновляют статьи и сразу публикуют на сайт. Не статичные статьи, а вайб эволюция :)

Это P6 — актуальность регламентов (пост) на собственной шкуре: правило, которое я требую от процессов, должно работать и на моих текстах.

Заходите: vibevolve.belkin.digital

Следующим постом — Принцип №8 «Каждый — архитектор». Полная статья уже на сайте ➡️

Путь ИИ | vibevolve | Подкаст
1👍9❤‍🔥1🔥1
Путь ИИ pinned «У нашей методологии Vibe Evolve появился сайт Посты в канале живут лентой. Через месяц нужный принцип уже не найти. Поэтому вся методология теперь лежит отдельно — целиком и по порядку. 📚 Что внутри 10 принципов — по статье на каждый. Это не копии постов:…»
Vibe Evolve, Принцип №8: Каждый — архитектор

Каждый сотрудник — архитектор ИИ-агентов, будущий или настоящий.

P7 — полномочия и безопасность (пост) закрыл вопрос, какие действия агент совершает сам. Но полномочия, границы, обвязка — это архитектура. Кто её проектирует? Ответ P8: каждый, в своей зоне.

🎯 У работы архитектора два конца — и оба ваши

Вход — замысел: что нужно получить и что считать успехом.
Выход — понимание: результат принят не когда «выглядит хорошо», а когда есть человек, способный за него отвечать.

Середина — исполнение и первая проверка — уходит агентам. Соревноваться с ними там бессмысленно, они быстрее. Вся ценность человека собрана на двух концах.

🔧 Сломалось — чините замысел, а не результат

Спецификация первична, результат производен. Починили один вывод, не тронув замысел, — получите ту же ошибку на следующем прогоне. Сбер в AI-Disrupt PDLC формулирует прямо: человек отвечает за намерение, агент — за реализацию.

⚠️ Чего проверяющий агент не увидит никогда

Требование, которое никто не догадался записать. Модель проверяет то, что есть, и молчит о том, чего нет.

И второе. Замкнутый контур из согласных между собой моделей бывает уверен и неправ одновременно — а рядом уже нет человека, который заметит разницу. Как пишет Addy Osmani в разборе агентного код-ревью: понимать систему настолько, чтобы за неё ручаться, — самый живучий навык сегодня.

Проверка простая: сможете объяснить решение своими словами и назвать условия, при которых оно неверно? Нет — значит, подпись есть, а ответственности нет.

🧑‍🏭 Где буксует

Не на технологиях. На страхе: «научу агента своей работе — не заменят ли меня им же?». Пока человек не увидел, что становится нужнее, ни обучение, ни бюджет не сработают.

Моя ставка — не замена людей, а переучивание экспертов в архитекторов. HR-менеджера я нанимал с условием работать в Cursor, хотя такого опыта у неё не было. Отдал репозиторий со стартовой настройкой — дальше она пошла сама и подняла не только подбор, но и оценку с ревью.

📄 Полный разбор — на сайте: vibevolve.belkin.digital/principles/kazhdyj-arhitektor/

Принципы 1-8 (номер — статья, рядом — пост):
P1 · пост — всё через ИИ, отвечает человек
P2 · пост — всё доступно агентам как контекст
P3 · пост — агенту легко делегировать, и он может действовать в любой системе
P4 · пост — каждый может достраивать системы и агентов
P5 · пост — цикл управления улучшениями автоматизирован
P6 · пост — правила работы оцифрованы и актуальны
P7 · пост — границы, безопасность и проверка критериев
P8 — каждый проектирует свой агентный контур сам

Но все восемь остаются на бумаге без людей, готовых так работать. Об этом — Принцип №9 «Культура в основе» ➡️

Путь ИИ | vibevolve | Подкаст
👍4🔥2🦄2
Модели умнеют, цена не растет

Сегодня 10 августа, а речь пойдёт про конец июля. Но это не важно, когда речь о долгосрочном тренде.

24 июля вышел Claude Opus 5 — $5 и $25 за миллион токенов вход/выход, ровно столько же, сколько стоил Opus 4.8. На CursorBench практически вровень с Fable 5, при половине стоимости задачи. Те же $5/$25 я приводил в ноябре для Opus 4.5: за восемь месяцев цена флагмана Anthropic не сдвинулась, интеллект ушёл далеко вперёд.

30 июля OpenAI снизила цены GPT-5.6: Luna — на 80%, до $0,2/$1,2 за миллион, Terra — на 20%, до $2/$12. Снизу поджимают открытые: 27 июля Moonshot выложила веса Kimi K3, 3 августа вышел Qwen 3.8-Max за $2/$6.

Я показывал эту кривую в ноябре: стоимость заданного уровня интеллекта падает примерно в 300 раз за год, а стоимость лучшей модели та же, только лучшая сегодня гораздо уменее лучшей вчера.

Дешевеет не токен, а агентизация

Платим мы не за токен, а за задачу — а умная модель доходит до результата за меньшее число шагов и переделок: Opus 5 вдвое обходит предшественника на Frontier-Bench при меньшей стоимости задачи. Дешевеет и обвязка: изрядная часть регламентов и проверок писалась, чтобы компенсировать слабость модели, разбить цель на подзадачи и управлять исполнением, а в гайде Anthropic по Opus 5 сказано прямо — меньше инструкций, лучше результат. И главное: растёт горизонт задачи. Процессы, где агент вчера не справлялся, начинают работать сами, без единого вашего действия.

На горизонте 3–5 лет «дорого» в вопросе агентизации уйдет на задачи такого уровня сложности, о которых мы и не думаем сейчас, что они вообще возможны. Порог окупаемости падает быстрее, чем компания успевает принять решение по проекту, — и падает у всех сразу. Останется одно ограничение: умеет ли организация поставить агенту задачу и принять у него результат, сохраняя человеческую ответственность. Дефицит переезжает со стоимости токенов на цифровую управленческую зрелость, выраженную в 10 принципах и 5 уровнях агентизации Vibe Evolve

И если вы этого пока не чувствуете, то это и есть симптом недостаточной цифровой зрелости компании. Либо у вас просто нет доступа к лучшим моделям.

К новости можно вернуться через две недели и ничего не потерять. К решению об агентизации — нет.

Путь ИИ | vibevolve | Подкаст
👍32
Дешевеет исполнение — дорожает рост человека

📉OpenAI уронила цену Luna в пять раз — «знать» подешевело буквально, в валюте. PwC опросила больше тысячи руководителей финсектора США: 86% ценят практический навык работы с ИИ выше MBA у многих новых сотрудников. Диплом — сертификат о знаниях, и дешевеет вместе с ними. Опасный перекос, когда учат либо уже не тому, либо еще не тому.

Но не дешевеет подпись под решением: страховая судится с человеком, а не с моделью. Сколько работы ни уходит агенту, отвечает тот, кто подписал · пост.

🤯 Где ловушка

В Nature Medicine разложили эрозию компетенций на три режима. Deskilling — навык был и сточился: человек всё время опирается на ИИ-ассистента. Mis-skilling — усвоено ошибочное: ответ модели принят без критики. Never-skilling — навык не сформировался вообще, потому что с первого дня вместо человека думает ассистент.

Ловят это пока в учёбе, а не в работе: речь про студентов-медиков, и прямых доказательств по третьему режиму авторы честно не приводят. Дальше — гипотеза о том, что увидим в работе.

🤖 Источник компетенции

Агент закрывает работу джуниора — его сократили, экономия видна в этом квартале. Через два-три года синьора взять неоткуда, у всех на рынке эрозия компетенций. Это не сокращение затрат, а отложенная потеря ответственности: подписывать станет некому.

На днях я писал, что понимание становится важнее исполнения, а рабочий контур обязан производить не только результаты, но и самих архитекторов. Понимание набирается практикой — уберёте исполнительский слой людей целиком, и среда, где понимание росло, исчезнет.

🧠 Экономика стоимости интеллекта

Считать ее для агентизации можно по двум осям: сколько стоят токены и сколько стоит время компетентных людей. Находить оптимальный баланс между ними — ключевая компетенция эпохи агентизации. Третья ось — растёт ли человек внутри процесса. Дёшево по токенам, дёшево по зарплате, и никто не растёт — процесс все равно дорогой, только счёт придёт позже, когда не останется компетентных людей. Удешевляя исполнение до предела, нужно на сэкономленное покупать людям задачи сложнее, а не убирать задачи целиком.

👻 Слишком забегаем вперед? Еще и агентизация-то толком не случилась? Возможно. Но эрозия компетенций уже происходит. А компании развиваются через развитие людей, другого способа я не знаю.

Дальше — «Культура в основе»: это как раз про людей ➡️

Путь ИИ | vibevolve | Подкаст
👍54
Вчера готовился ко встрече с клиентом по материалам, которые мне ИИ подготовил на основе трека работы технической команды, в том числе там были новые для меня вещи. На этот раз я учился сам, а не учил ИИ. Пару часов сидел.

Пришел инсайт: хочешь преуспеть в эру ИИ агентов, будь готов учиться сам, а не только делегировать работу агентам.

Развитие мысли: это конечно не ново для руководителей, нам постоянно приходится учиться у своих подчиненных-специалистов. На этом строится ответственность за результат. Так что в ИИ нужно увидеть такого подчиненного и все будет на своих местах. А если вы никогда не были руководителем...? то теперь, чтобы оставаться ценным специалистом, надо научиться быть руководителем своих ИИ, менять свое мышление в этом ключе. Просто специалист станет невостребован.

Путь ИИ | vibevolve | Подкаст
👍8❤‍🔥1🤝1
Как понять, на каком уровне агентизации ваша компания

Вопрос, на который трудно ответить честно: на каком уровне агентизации мы сейчас? «Внедрили ИИ» — не ответ. Конец августа дал два сообщения об эффекте — с разных этажей.

Сэм Альтман у Дэвида Сенры признаётся, что работает по-старому, хотя его компания выпустила Codex — state-of-the-art агента, двигатель агентизации на переднем крае. «У меня в голове зашито, что работа — это вот так».

Питер Диамандис 26 августа пересказывает Салима Исмаила: 70% CEO признают, что их самую прибыльную линию бизнеса двое людей с агентами повторят за 60–90 дней. Обещание — 100×.

От нуля до ста крат — при одинаковых моделях. Разница не в них.

Любая работа раскладывается на пять слоёв: исполнение (сделать), декомпозиция и постановка (разложить задачу и поставить), приёмка (проверить и научить на ошибках), управление процессом (находить проблемы и внедрять улучшения), намерение и риск (куда идём и что готовы на себя взять).

Агентизация снимает их снизу вверх — отсюда пять уровней. Вот как узнать свой.

LLM-1 · ≈0%. У сотрудников есть подписка на ChatGPT или аналог, ей пользуются для текстов и писем, но ни один процесс не перестроен. Прирост неотличим от шума. В исследовании OpenAI ровно это: лицензий закупают всё больше, а использование на сотрудника в крупных компаниях ниже, чем в маленьких. Купить всем проще, чем добиться, чтобы работали иначе.

LLM-2 · +5–30%. Агенту ушла часть исполнения: операция с чётким входом и выходом, результат принимает человек. Пример: сотрудники «Ингосстраха» за два месяца собрали больше 1350 агентов, около 250 уже работают в процессах.

LLM-3 · +20–200%. Исполнение ушло целиком. Агент сам решает, из каких простых операций собрать результат, проверяет себя по ходу и приносит готовое. Человек в цикле: ставит задачу, принимает работу, учит обратной связью. Здесь Google с юристами: агенты вычитывают договоры, подпись за человеком. Здесь же продажи Anthropic: разбор входящих занимал у сейлза около 5 часов в день, теперь черновики готовит агент, а человек остаётся на каждой отправке.

LLM-4 · ×2–×10. Уходит и постановка задач, и приёмка. Человек выходит из цикла и управляет им сверху: следит за проблемами и остаётся на эскалациях — «the humans are above the loop, not in it». Контроль переходит к алгоритмам, а не к более старательным людям. У Anthropic автопроверка остановила 89% опасных действий агента, ручное подтверждение — 13,6%: люди привыкают к окнам «разрешить» и жмут не глядя.

LLM-5 · ×5 и выше. Агент ведёт и сам управленческий цикл: находит аномалии, предлагает и внедряет улучшения. Человеку остаётся намерение и риск. Верхняя граница открыта: обещанные Диамандисом 100× живут тут — но это про компанию, целиком перешедшую на пятый уровень, и пока лишь в теории.

Где все на самом деле. По опросу Notion (6,1 тыс. респондентов, 10 стран): 88% компаний на первых двух уровнях, 10% на третьем, 2% на четвёртом.

Три поправки, без которых цифра врёт

1. Считать на единицу затрат, а не на человека: бывшая зарплата делится между ФОТ и токенами. OpenAI предлагает мерить useful work per dollar — полезную работу на доллар.
2. Уровень определяется по функции, а не по компании: маркетинг может быть на LLM-3, производство на LLM-1.
3. Бежать быстрее не значит заработать больше. В тех же данных OpenAI корреляции между интенсивностью использования ИИ и выручкой на сотрудника не нашлось: прирост высвобождает ресурс, а деньги приходят из новой бизнес-модели на нём.

Пятый слой агенту не уходит никогда: последствия несёт тот, кто за них отвечает (пост).

Моя позиция

Сами мы внутри честно на LLM-3. Зато основательно: по всем без исключения процессам, от разработки до HR. Идём дальше. Клиентские кейсы по агентизации в работе — замеры проведём, и я покажу цифры, а не обещания.

Посчитайте себя за вечер: возьмите функцию, разложите затраты по слоям и посмотрите, какой снят. Если ни один — вы на LLM-1, сколько бы подписок ни купили.

Таблица уровней целиком — на сайте; разбор начинался с пяти моделей ценности OpenAI в марте.

Путь ИИ | vibevolve | Подкаст
🔥4
Путь ИИ
Как понять, на каком уровне агентизации ваша компания Вопрос, на который трудно ответить честно: на каком уровне агентизации мы сейчас? «Внедрили ИИ» — не ответ. Конец августа дал два сообщения об эффекте — с разных этажей. Сэм Альтман у Дэвида Сенры признаётся…
Кстати, в отчете Notion, на который ссылаюсь в посте, независимо возникли те же определения уровней, что у меня, чуть другими словами.

Только пока без 5-го уровня.

Похоже потихоньку сам собой начинает складываться консенсус по терминологии. Что конечно очень хорошо.
👍5❤‍🔥1
GPT-6 Astra — состязание переходит в плоскость стоимости, растёт акцент на работу за компьютером (за человека) и безопасность

3 сентября OpenAI выпустила GPT-6 Astra. Президент компании Грег Брокман: «Добро пожаловать в эру AGI». Разбираю анонс по пунктам. Оговорка одна: все цифры — по собственным подсчётам OpenAI.

1. Интеллект снова вырос. Очередные экзамены для моделей сданы почти на 100%: сложнейшая математика (FrontierMath Tier 4 — 97,6%), сообразительность в незнакомой обстановке (ARC-AGI-3 — 99,9%, у прошлой GPT-5.6 Sol было 7,8%), взлом программ через известные дыры (ExploitBench — 100%). На их место придётся готовить новые. Но важнее другое: это уже не только экзамены. Astra улучшила две математические оценки того, как близко и как далеко друг от друга могут стоять простые числа, и одна из них не сдвигалась 80 лет. Настоящий научный результат.

2. По точности — как Claude. На рабочих задачах Astra примерно на уровне Claude Fable 5.1, вышедшей двумя днями раньше: в программировании 57,9% против 55,8% (Terminal-Bench 4.0). А на самом широком экзамене по всем наукам (Humanity's Last Exam) Claude даже впереди: 65% против 57,2%. Гонки «кто умнее» в этом релизе нет.

3. Состязание переходит в плоскость стоимости. Вот что бросается в глаза в таблицах анонса: почти каждая цифра точности стоит рядом с ценой. OpenAI соревнуется не за «чья модель точнее», а за «чья модель дешевле даёт ту же точность». На тех же задачах программирования Astra, по подсчётам OpenAI, обходится на 63% дешевле за задачу, чем Fable 5.1, при одинаковой цене за токены: $10 и $50 за миллион на входе и выходе. Около 60% экономии при равной точности. Это и есть вызов конкурентам. Линия «модели умнеют, цена не растет» продолжается.

4. Чем заплатили. Экономия достигается в частности тем, что модель меньше «думает вслух»: записывает меньше промежуточных рассуждений. OpenAI пишет прямо: следить за ходом мыслей Astra стало труднее, и «мы относимся к этому серьёзно». Поэтому в работу встроен автоматический надзор, который может поставить задачу на паузу, «включая работу, не связанную с кибербезопасностью». Оптимизация оплачена прозрачностью.

5. Ставка на компьютер и профессии. На первое место OpenAI ставит работу за компьютером вместо человека: формы, CRM, календарь, установка программ. Такие задачи Astra решает на 47% быстрее прошлой модели (OSWorld 2.0). Я уверен, что научить модель человеческому интерфейсу так же реально, как научили её языку, коду и изображениям, и OpenAI на это ставит. Сверху — обучение под инструменты конкретных профессий: разводка печатной платы, 3D-модель по картинкам (BenchCAD — 95,9%), дом в Blender с экспортом в игровой движок Unreal Engine 5, юридический документ, слайды по шаблону компании. Это прямо бьёт в делегируемость любых задач (пост): агенту больше не нужна отдельная интеграция с каждой программой, ему хватает экрана.

6. Доверие. Тест по мотивам взлома HuggingFace: модели дают невыполнимую задачу и смотрят, попытается ли она сжульничать, выйдя за пределы задачи. Прошлая модель без защит делала это в 48% случаев, Astra — ни разу. Запрет автоматической проверки она не обходила, даже когда обход был возможен.

7. Взлом и доступ. Первая модель OpenAI на «критическом» уровне по кибербезопасности: во время теста сама нашла в браузере Chrome две дыры, о которых никто не знал. Обычным пользователям взламывать программы она откажет; полные возможности — проверенным защитникам через программу Daybreak. Та же схема, что у Anthropic с Fable и Mythos.

Кому и когда. Постепенно, для некоторых уже в Codex, агенте для кодинга; в ближайшие дни — в ChatGPT.

Путь ИИ | vibevolve | Подкаст
🔥3