Forwarded from Кибербез Андрея Дугина
Решил почитать, как движутся заморские сетевики к AI в управлении сетью.
Совершенно не удивился, что они открыто признаются, что новшества применяют последними. Потому что стабильность сети зачастую важнее и дороже любых инноваций.
Тем не менее, глаза боятся, а руки делают. Краткая выжимка слайдов прилагается.
Совершенно не удивился, что они открыто признаются, что новшества применяют последними. Потому что стабильность сети зачастую важнее и дороже любых инноваций.
Тем не менее, глаза боятся, а руки делают. Краткая выжимка слайдов прилагается.
👍2
Хорошая практика внимательно изучать системные карты новых используемых моделей, например в карточке модели gpt 5.6 можно было увидеть повышенный шанс деструктивных действий. Если карточки модели в принципе нет - стоит рассмотреть другую модель, потестировать самим все сценарии не реально.
Возможно в будущем появятся публичные независимые/государственные бенчи.
Возможно в будущем появятся публичные независимые/государственные бенчи.
Forwarded from GPT/ChatGPT/AI Central Александра Горного
OpenAI признала, что GPT-5.6 может случайно удалить ваши файлы
Из-за стремления любой ценой закончить задачу GPT-5.6 может обойти ограничения, использовать чужие учётные данные или удалить важные файлы.
Это происходит редко и по ошибке, а не потому, что модель хочет навредить пользователю.
https://www.theregister.com/ai-and-ml/2026/07/16/openai-admits-gpt-56-occasionally-deletes-files-but-its-an-honest-mistake/5274008
Из-за стремления любой ценой закончить задачу GPT-5.6 может обойти ограничения, использовать чужие учётные данные или удалить важные файлы.
Это происходит редко и по ошибке, а не потому, что модель хочет навредить пользователю.
https://www.theregister.com/ai-and-ml/2026/07/16/openai-admits-gpt-56-occasionally-deletes-files-but-its-an-honest-mistake/5274008
Сегодня получилось попасть на Summer Camp от Jet. У коллег получилось довольно ламповое мероприятие на воде.
Много было интересных докладов от известных спикеров, но я бы хотел поделиться парой фото из доклада Андрея Левкина, владельца продукта Bugbounty от Bi.Zone. По его экспертной оценке есть количественное увеличение находимых уязвимостей выше обычного органического роста, но тысяч корректно принятых уязвимостей пока нет. Т.е. на текущий момент можно предположить, что ИИ точно помогает находить корректные уязвимости, но ситуация далека от драмы которую ставят Мифом и GPT 5.6.
А вот количества спама с которым теперь триажерам приходится бороться выросло в 14 раз. Одними из решений этой проблемы стало введение талонов/квот на сдаваемые отчёты и использование ИИ при анализе сдаваемых отчётов. Пара фото из презентации ниже.
Ранее высказанная мною версия, что из-за ИИ у нас упал КПД процесса управления уязвимостями пока подтверждается.
Много было интересных докладов от известных спикеров, но я бы хотел поделиться парой фото из доклада Андрея Левкина, владельца продукта Bugbounty от Bi.Zone. По его экспертной оценке есть количественное увеличение находимых уязвимостей выше обычного органического роста, но тысяч корректно принятых уязвимостей пока нет. Т.е. на текущий момент можно предположить, что ИИ точно помогает находить корректные уязвимости, но ситуация далека от драмы которую ставят Мифом и GPT 5.6.
А вот количества спама с которым теперь триажерам приходится бороться выросло в 14 раз. Одними из решений этой проблемы стало введение талонов/квот на сдаваемые отчёты и использование ИИ при анализе сдаваемых отчётов. Пара фото из презентации ниже.
Ранее высказанная мною версия, что из-за ИИ у нас упал КПД процесса управления уязвимостями пока подтверждается.
Forwarded from Dealer.AI
Время на "мы просто пробуем ИИ" уже закончилось. Как измерять реальную ценность от внедрения ИИ?
Именно с этого отрезвляющего тезиса стартует статья от OpenAI. Теперь вы не можете как в 2023-2024, а кто-то все ещё сейчас просто экспериментировать ради любопытства, сегодня ИИ - это реальная производственная мощность, и нужно её измерять также, как электроэнергию или выч ресурсы.
📦 помнится, как оценивали качество от автоматизации ручных процессов или поддержки с ИИ:
1. Общий трафик DAU, MAU, WAU и тп.
2. Интерес, через возвращаемость ака retention rate. На самом деле, не так важно, что в первый день запуска вы вывалили большой трафик, как то, что если сервис полезен к вам будут возвращаться снова и снова.
3. Число принятых подсказок с ИИ - ака acceptation rate. К примеру, вы работаете с ИИ суфлером или код агентом копайлотом и вот число принятых подсказок по ответу оператора или коду можно было измерить так.
4. Польза в конечной бизнес ветке или ноде. Если вы работали с сценариями поддержки, на самом деле, автоматизация должна считаться не только числом закрытых вопросов в чате без перевода на оператора, но и измеряться закончился ли диалог на самом деле решением проблемы пользователя или он через час снова придёт с этой темой в чат (а тут уже retention rate работает против вас). Да это можно проксироват через CSI, NPS, но в век LLM и агентов можно верифицировать и без оценки человека, достигнуто ли было намерение юзера и решена проблема с которой он придёт.А ещё у нас была система штрафов за возвращаемость юзера по проблеме ещё раз в чат или к оператору.
5. Фин эффекты в лице ROI. Тут просто (на самом блин деле, ни фига не просто) отношение прибыли к затратам на ИИ сервис, фичу, решение, проект и тп. - скок заработали к тому сколько потратили на разработку, аммортиазцию железа и токены на эксплуатацию. Обычно измеряется в %, умножаетсы естественно на 100. Однако помимо этого, мало посчитать таким образом потенциал, ещё нужно посчитать срок окупаемости. ROI показывал, что мы имеем такой потенциал, а срок окупаемости за какое время мы его можем достичь.
6. Рост эффективности труда. Вот моё "любимое", что над именно считать на сколько уменьшится время на выкатку фичи, сервиса, продукта или нового кода/программы, ускориться принятие решения и тп. Ака Lead Time, Time to Market и аналоги. И да современный ИИ тут помогает.
Почитали? Интересно? А теперь забудьте все не так радужно.
Начну с ROI прям сразу - компании не умеют, а некоторые оунеры решений и не хотят считать это честно (не в смысле врут, а в смысле не все переменные учитывают).
Часто в текущей реальности заканчивается оценкой скорости а-ля ТТМ, но никто не хочет посчитать деньги в конечной бизнес ноде. К примеру, вы смогли автоматизировать аналитику, сказали что ускоритель на К%, но почему-то не получаете оценку оборачиваемости капитала или out-of-stock (упущенные продажи) в денежках, на которые и повлияет ускорение принятия решения от внедрения ИИ. Но окей, вы посчитали это, но в знаменатель забудете положить кроме фот на разработку, ещё токен экономику и аммортизацию ваших мощностей (если они онпрем). Почти все не понимают, сколько токенов они будут кушатс. На самом деле, ну и не должны, вопрос ж в динамическом изменении этого, особено с МАС под капотом. Но раз тут у нас динамический показатель, то ROI не будет фиксой, как и поправки в срок окупаемости придётся вносить.
Ну и мякотка, все хотят на старте это посчитать, а в вводных выше мы понимаем, что посчитать можно только по факту в начале (порой пальцем в небо) или за период (на конец отчетного), а без этого даже стартовать порой отказываются.
Второе любимое это про экономию на ФОТ через автоматизацию. Ну тип дали людямогонь Claude Code и ща кааак начнём сокращать разрабов и экономить на дорогих манки кодерах. В итоге хороший agent developer с инструментом на max подписке кушает за себя и за Сашку. Те вы почти не экономите на ФОТ, тк сопоставимо тратите на токены.
Именно с этого отрезвляющего тезиса стартует статья от OpenAI. Теперь вы не можете как в 2023-2024, а кто-то все ещё сейчас просто экспериментировать ради любопытства, сегодня ИИ - это реальная производственная мощность, и нужно её измерять также, как электроэнергию или выч ресурсы.
1. Общий трафик DAU, MAU, WAU и тп.
2. Интерес, через возвращаемость ака retention rate. На самом деле, не так важно, что в первый день запуска вы вывалили большой трафик, как то, что если сервис полезен к вам будут возвращаться снова и снова.
3. Число принятых подсказок с ИИ - ака acceptation rate. К примеру, вы работаете с ИИ суфлером или код агентом копайлотом и вот число принятых подсказок по ответу оператора или коду можно было измерить так.
4. Польза в конечной бизнес ветке или ноде. Если вы работали с сценариями поддержки, на самом деле, автоматизация должна считаться не только числом закрытых вопросов в чате без перевода на оператора, но и измеряться закончился ли диалог на самом деле решением проблемы пользователя или он через час снова придёт с этой темой в чат (а тут уже retention rate работает против вас). Да это можно проксироват через CSI, NPS, но в век LLM и агентов можно верифицировать и без оценки человека, достигнуто ли было намерение юзера и решена проблема с которой он придёт.
5. Фин эффекты в лице ROI. Тут просто (на самом блин деле, ни фига не просто) отношение прибыли к затратам на ИИ сервис, фичу, решение, проект и тп. - скок заработали к тому сколько потратили на разработку, аммортиазцию железа и токены на эксплуатацию. Обычно измеряется в %, умножаетсы естественно на 100. Однако помимо этого, мало посчитать таким образом потенциал, ещё нужно посчитать срок окупаемости. ROI показывал, что мы имеем такой потенциал, а срок окупаемости за какое время мы его можем достичь.
6. Рост эффективности труда. Вот моё "любимое", что над именно считать на сколько уменьшится время на выкатку фичи, сервиса, продукта или нового кода/программы, ускориться принятие решения и тп. Ака Lead Time, Time to Market и аналоги. И да современный ИИ тут помогает.
Почитали? Интересно? А теперь забудьте все не так радужно.
Начну с ROI прям сразу - компании не умеют, а некоторые оунеры решений и не хотят считать это честно (не в смысле врут, а в смысле не все переменные учитывают).
Часто в текущей реальности заканчивается оценкой скорости а-ля ТТМ, но никто не хочет посчитать деньги в конечной бизнес ноде. К примеру, вы смогли автоматизировать аналитику, сказали что ускоритель на К%, но почему-то не получаете оценку оборачиваемости капитала или out-of-stock (упущенные продажи) в денежках, на которые и повлияет ускорение принятия решения от внедрения ИИ. Но окей, вы посчитали это, но в знаменатель забудете положить кроме фот на разработку, ещё токен экономику и аммортизацию ваших мощностей (если они онпрем). Почти все не понимают, сколько токенов они будут кушатс. На самом деле, ну и не должны, вопрос ж в динамическом изменении этого, особено с МАС под капотом. Но раз тут у нас динамический показатель, то ROI не будет фиксой, как и поправки в срок окупаемости придётся вносить.
Ну и мякотка, все хотят на старте это посчитать, а в вводных выше мы понимаем, что посчитать можно только по факту в начале (порой пальцем в небо) или за период (на конец отчетного), а без этого даже стартовать порой отказываются.
Второе любимое это про экономию на ФОТ через автоматизацию. Ну тип дали людям
Please open Telegram to view this post
VIEW IN TELEGRAM
OpenAI
A scorecard for the AI age
Sarah Friar, CFO of OpenAI, introduces a practical AI scorecard to measure ROI through useful work, cost per successful task, dependability, and return on compute.
Forwarded from Dealer.AI
Dealer.AI
Время на "мы просто пробуем ИИ" уже закончилось. Как измерять реальную ценность от внедрения ИИ? Именно с этого отрезвляющего тезиса стартует статья от OpenAI. Теперь вы не можете как в 2023-2024, а кто-то все ещё сейчас просто экспериментировать ради любопытства…
Вот именно по следам этих кейсов и не только авторы статьи выше предлагают подход к оценке пользы от внедрения ИИ. OpenAI предлагает перейти к инженерному подходу - измерять не затраты на ресурс, а эффективность преобразования ресурса в полезный завершённый результат. В центре стоит метрика "полезный интеллект за доллар", которая раскладывается на четыре вопроса. Каждый вопрос - это не просто пункт в отчёте, а целая система сбора данных и принятия решений:
1. Выполняет ли ИИ действительно важную работу?
Первый шаг - перестать измерять активность и начать измерять результат. Ценность создается не количеством сгенерированного текста, а завершенными полезными действиями. Важно "определение завершенности" для каждого бизнес-процесса.Тот самый эффект который я называл ещё в 2019ом value в бизнес ноде. Например, для отдела продаж полезной работой будет не "сгенерировать 100 писем", а "отправить клиенту финальное письмо, которое утверждено руководителем". Это меняет фокус с процесса на результат.
2. Сколько стоит одна успешно выполненная задача?
Это самый технический и важный пункт. Забудьте про цену за токен, она обманчива. Нужно считать полную стоимость одного принятого результата. И тут как раз вы можете фиксануть ROI, как я говорил выше.
(Стоимость API-вызовов + Время персонала на промпты и правки + Время на проверку + Стоимость инфраструктуры) / Количество задач, принятых без доработок.
Дешевая модель может давать много ошибок, требовать постоянных правок и в итоге обойтись дороже, чем более дорогая, но точная. Именно поэтому OpenAI выпускает GPT-5.6 с тремя моделями: Sol (для сложных задач, где ошибка дорога), Terra (золотая середина) и Luna (для рутинных операций). Выбор модели - это всегда поиск баланса между ценой и качеством конечного результата.Снова привет fusion или Fugu оркестрации.
3. Можно ли доверять результатам?
Этот вопрос напрямую влияет на стоимость. Чем выше доверие к ИИ, тем меньше времени тратится на проверку.
OpenAI выделяет тут три уровня зрелости:
·
·
·
Для перехода на новый уровень нужно измерять доверие. Классифицируйте каждый ответ ИИ:
· Зеленый –принят без изменений.
· Желтый – требует легкой правки.
· Красный – полностью переделан.
Если доля "зеленых" ответов растет, значит, доверие повышается, а стоимость контроля снижается.
4. Растет ли ценность при масштабировании?
Последний вопрос – про динамику. Даже если сегодня все хорошо, нужно следить, не ухудшается ли экономика при росте объемов.
Эффективность = Объем полезной работы / Совокупные затраты на ИИ
Неплохая замена ROI в моменте, этакий аналог биржевого индикатора.
Если вы увеличиваете использование ИИ в два раза, а затраты растут тоже в два раза - вы на месте. Если затраты растут медленнее - вы в выигрыше.
OpenAI утверждает, что их модели постоянно улучшаются, а стоимость снижается. Но компаниям все равно нужно вести собственный счёт – собирать данные по каждому процессу и регулярно пересчитывать эффективность. Вот вам и новые задачи вашим аналитикам.👍
Практический чек-лист для внедрения от OpenAI:
1. Выберите 3–5 ключевых процессов, где используется ИИ.
2. Для каждого четко определите «завершенную задачу».
3. Начните собирать данные о всех затратах (не только API, но и время сотрудников).
4. Ведите классификацию ответов (зеленый/желтый/красный).
5. Пересчитывайте стоимость за задачу и сравнивайте разные модели.
6. Раз в квартал оценивайте динамику эффективности.
А как вы оцениваете вклад ИИ в своих проектах?
Делитесь опытом в комментариях👇 👇 👇
1. Выполняет ли ИИ действительно важную работу?
Первый шаг - перестать измерять активность и начать измерять результат. Ценность создается не количеством сгенерированного текста, а завершенными полезными действиями. Важно "определение завершенности" для каждого бизнес-процесса.
2. Сколько стоит одна успешно выполненная задача?
Это самый технический и важный пункт. Забудьте про цену за токен, она обманчива. Нужно считать полную стоимость одного принятого результата. И тут как раз вы можете фиксануть ROI, как я говорил выше.
Формула простая:(Стоимость API-вызовов + Время персонала на промпты и правки + Время на проверку + Стоимость инфраструктуры) / Количество задач, принятых без доработок.
Дешевая модель может давать много ошибок, требовать постоянных правок и в итоге обойтись дороже, чем более дорогая, но точная. Именно поэтому OpenAI выпускает GPT-5.6 с тремя моделями: Sol (для сложных задач, где ошибка дорога), Terra (золотая середина) и Luna (для рутинных операций). Выбор модели - это всегда поиск баланса между ценой и качеством конечного результата.
3. Можно ли доверять результатам?
Этот вопрос напрямую влияет на стоимость. Чем выше доверие к ИИ, тем меньше времени тратится на проверку.
OpenAI выделяет тут три уровня зрелости:
·
Черновик. ИИ предлагает вариант, человек все перепроверяет.·
Поиск и рассуждение. ИИ находит информацию и строит цепочки, но решения принимает человек.·
Автономное действие. ИИ выполняет операции сам (отправляет письма, вносит данные).Для перехода на новый уровень нужно измерять доверие. Классифицируйте каждый ответ ИИ:
· Зеленый –принят без изменений.
· Желтый – требует легкой правки.
· Красный – полностью переделан.
Если доля "зеленых" ответов растет, значит, доверие повышается, а стоимость контроля снижается.
4. Растет ли ценность при масштабировании?
Последний вопрос – про динамику. Даже если сегодня все хорошо, нужно следить, не ухудшается ли экономика при росте объемов.
Ключевая метрика:Эффективность = Объем полезной работы / Совокупные затраты на ИИ
Неплохая замена ROI в моменте, этакий аналог биржевого индикатора.
Если вы увеличиваете использование ИИ в два раза, а затраты растут тоже в два раза - вы на месте. Если затраты растут медленнее - вы в выигрыше.
OpenAI утверждает, что их модели постоянно улучшаются, а стоимость снижается. Но компаниям все равно нужно вести собственный счёт – собирать данные по каждому процессу и регулярно пересчитывать эффективность. Вот вам и новые задачи вашим аналитикам.
Практический чек-лист для внедрения от OpenAI:
1. Выберите 3–5 ключевых процессов, где используется ИИ.
2. Для каждого четко определите «завершенную задачу».
3. Начните собирать данные о всех затратах (не только API, но и время сотрудников).
4. Ведите классификацию ответов (зеленый/желтый/красный).
5. Пересчитывайте стоимость за задачу и сравнивайте разные модели.
6. Раз в квартал оценивайте динамику эффективности.
А как вы оцениваете вклад ИИ в своих проектах?
Делитесь опытом в комментариях
Please open Telegram to view this post
VIEW IN TELEGRAM