Ещё одна опция использования паролей с ИИ агентам Claude в браузере. Раньше выбор был - отдать все пароли или каждый раз самому заходить на ресурсы. Теперь первый парольный менеджер позволяет управлять какими паролями можно пользоваться для каких задач и исключает пересылку паролей в ИИ модель. Пока только пароли и на маках. В планах поддержка данных карт и удостоверений личности.
Forwarded from AISecure
OpenAI рассказала о GPT-Red — внутренней системе для автоматизированного AI Red Teaming.
Идея заключается в использовании adversarial self-play: одна модель пытается найти успешные атаки на другие модели (например, prompt injection), а найденные успешные сценарии используются для их дальнейшего обучения.
Цикл выглядит так:
По сути это напоминает coverage-guided fuzzing, только вместо поиска crash'ей система автоматически исследует пространство возможных атак на LLM и использует найденные успешные сценарии для дальнейшего обучения защитной модели.
В статье речь идет о prompt injection, но аналогичный подход может применяться и для тестирования более сложных AI-систем: AI-агентов, RAG, использования инструментов, MCP и других сценариев, где поведение модели определяется взаимодействием с внешним контекстом.
🔗 https://openai.com/index/unlocking-self-improvement-gpt-red/
Идея заключается в использовании adversarial self-play: одна модель пытается найти успешные атаки на другие модели (например, prompt injection), а найденные успешные сценарии используются для их дальнейшего обучения.
Цикл выглядит так:
GPT-Red → успешная атака → обучение защитной модели → поиск новых атакПо сути это напоминает coverage-guided fuzzing, только вместо поиска crash'ей система автоматически исследует пространство возможных атак на LLM и использует найденные успешные сценарии для дальнейшего обучения защитной модели.
В статье речь идет о prompt injection, но аналогичный подход может применяться и для тестирования более сложных AI-систем: AI-агентов, RAG, использования инструментов, MCP и других сценариев, где поведение модели определяется взаимодействием с внешним контекстом.
🔗 https://openai.com/index/unlocking-self-improvement-gpt-red/
Forwarded from Кибербез Андрея Дугина
Решил почитать, как движутся заморские сетевики к AI в управлении сетью.
Совершенно не удивился, что они открыто признаются, что новшества применяют последними. Потому что стабильность сети зачастую важнее и дороже любых инноваций.
Тем не менее, глаза боятся, а руки делают. Краткая выжимка слайдов прилагается.
Совершенно не удивился, что они открыто признаются, что новшества применяют последними. Потому что стабильность сети зачастую важнее и дороже любых инноваций.
Тем не менее, глаза боятся, а руки делают. Краткая выжимка слайдов прилагается.
👍2
Хорошая практика внимательно изучать системные карты новых используемых моделей, например в карточке модели gpt 5.6 можно было увидеть повышенный шанс деструктивных действий. Если карточки модели в принципе нет - стоит рассмотреть другую модель, потестировать самим все сценарии не реально.
Возможно в будущем появятся публичные независимые/государственные бенчи.
Возможно в будущем появятся публичные независимые/государственные бенчи.
Forwarded from GPT/ChatGPT/AI Central Александра Горного
OpenAI признала, что GPT-5.6 может случайно удалить ваши файлы
Из-за стремления любой ценой закончить задачу GPT-5.6 может обойти ограничения, использовать чужие учётные данные или удалить важные файлы.
Это происходит редко и по ошибке, а не потому, что модель хочет навредить пользователю.
https://www.theregister.com/ai-and-ml/2026/07/16/openai-admits-gpt-56-occasionally-deletes-files-but-its-an-honest-mistake/5274008
Из-за стремления любой ценой закончить задачу GPT-5.6 может обойти ограничения, использовать чужие учётные данные или удалить важные файлы.
Это происходит редко и по ошибке, а не потому, что модель хочет навредить пользователю.
https://www.theregister.com/ai-and-ml/2026/07/16/openai-admits-gpt-56-occasionally-deletes-files-but-its-an-honest-mistake/5274008
Сегодня получилось попасть на Summer Camp от Jet. У коллег получилось довольно ламповое мероприятие на воде.
Много было интересных докладов от известных спикеров, но я бы хотел поделиться парой фото из доклада Андрея Левкина, владельца продукта Bugbounty от Bi.Zone. По его экспертной оценке есть количественное увеличение находимых уязвимостей выше обычного органического роста, но тысяч корректно принятых уязвимостей пока нет. Т.е. на текущий момент можно предположить, что ИИ точно помогает находить корректные уязвимости, но ситуация далека от драмы которую ставят Мифом и GPT 5.6.
А вот количества спама с которым теперь триажерам приходится бороться выросло в 14 раз. Одними из решений этой проблемы стало введение талонов/квот на сдаваемые отчёты и использование ИИ при анализе сдаваемых отчётов. Пара фото из презентации ниже.
Ранее высказанная мною версия, что из-за ИИ у нас упал КПД процесса управления уязвимостями пока подтверждается.
Много было интересных докладов от известных спикеров, но я бы хотел поделиться парой фото из доклада Андрея Левкина, владельца продукта Bugbounty от Bi.Zone. По его экспертной оценке есть количественное увеличение находимых уязвимостей выше обычного органического роста, но тысяч корректно принятых уязвимостей пока нет. Т.е. на текущий момент можно предположить, что ИИ точно помогает находить корректные уязвимости, но ситуация далека от драмы которую ставят Мифом и GPT 5.6.
А вот количества спама с которым теперь триажерам приходится бороться выросло в 14 раз. Одними из решений этой проблемы стало введение талонов/квот на сдаваемые отчёты и использование ИИ при анализе сдаваемых отчётов. Пара фото из презентации ниже.
Ранее высказанная мною версия, что из-за ИИ у нас упал КПД процесса управления уязвимостями пока подтверждается.