Forwarded from yoprstcon
Теперь это уже живой проект:
Список покрывает основные направления AI security и AI-for-security:
Перевели базу списка в JSON + schema, чтобы людям и агентам было проще присылать PR без ручной правки README.
Используйте, звёздочкуйте, присоединяйтесь, несите свои инструменты, модели, датасеты и боевые находки.
Так работает сообщество!
Делай #ёPRST
https://github.com/scadastrangelove/awesome-ai-security-tools
Please open Telegram to view this post
VIEW IN TELEGRAM
Интересный интенсив по безопасности ИИ агентов запустил Яндекс. Для получения сертификата и доступа к итоговому заданию нужно решить тестовые задания на С++, Java, Python.
❤2😁2
Forwarded from Gonzo GPT - Безопасность LLM моделей
Яндекс запускает AI Agents Security Week
Регистрация до 27 июля Лекции с 27 по 31 июля. Дают сертификат о прохождении, обучение онлайн (в тч на Английском), бесплатно.
https://shad.yandex.ru/agentsecurityweek
Регистрация до 27 июля Лекции с 27 по 31 июля. Дают сертификат о прохождении, обучение онлайн (в тч на Английском), бесплатно.
https://shad.yandex.ru/agentsecurityweek
AI Agents Security Week Школы анализа данных
Начните создавать защищённых ИИ-агентов. Разберёмся в архитектуре агентных систем и практических методах их защиты. На реальных кейсах покажем, какие типы угроз существуют и как встраивать безопасность в жизненный цикл разработки ИИ-продуктов
😁1
В сообществе обсуждают возвращение Мультисканера (национальный аналог Virustotal) в опытную эксплуатацию после долгого перерыва. Вот официальное описание возможностей.
Надеюсь на развитие данного ресурса, пока, что работает базовая функциональность без возможностей проверки ссылок, хэшей, ip. Несмотря на указание в официальной новости проверок от Dr Web найти не удалось. Возможности динамической проверки открываются после регистрации.
Напоминаю про базовые альтернативы
1. Портал opentip от Касперского. Нет песочницы и для проверки ссылок нужна регистрация.
2. Сервисы Dr Web: проверка ссылок и файлов.
Если вам не нравится бесплатный функционал песочницы VT - посмотрите в сторону ANY.RUN .
Важно! Все, что вы загружаете в подобные ресурсы становится доступно владельцем ресурсов, а иногда и другим пользователям ресурсов. Ситуациям когда жертва загружает "непонятные файлы" с паролями и ключами и к ним получает доступ относительно широкий круг лиц - более 10 лет. Более того практика анализа ресурсов (доменные имена, IP) компании в ходе Due Diliigince в Virus Total теперь даже закрепляется в официальных рекомендациях NIST.
Старайтесь загружать на подобные ресурсы не сами файлы, а хэши. Если есть возможности - разворачивайте свои локальные решения для анализа файлов. Есть современные аналоги легендарной Cuckoo Sandbox, например, Assemblyline 4 + CapeV2.
Надеюсь на развитие данного ресурса, пока, что работает базовая функциональность без возможностей проверки ссылок, хэшей, ip. Несмотря на указание в официальной новости проверок от Dr Web найти не удалось. Возможности динамической проверки открываются после регистрации.
Напоминаю про базовые альтернативы
1. Портал opentip от Касперского. Нет песочницы и для проверки ссылок нужна регистрация.
2. Сервисы Dr Web: проверка ссылок и файлов.
Если вам не нравится бесплатный функционал песочницы VT - посмотрите в сторону ANY.RUN .
Важно! Все, что вы загружаете в подобные ресурсы становится доступно владельцем ресурсов, а иногда и другим пользователям ресурсов. Ситуациям когда жертва загружает "непонятные файлы" с паролями и ключами и к ним получает доступ относительно широкий круг лиц - более 10 лет. Более того практика анализа ресурсов (доменные имена, IP) компании в ходе Due Diliigince в Virus Total теперь даже закрепляется в официальных рекомендациях NIST.
Старайтесь загружать на подобные ресурсы не сами файлы, а хэши. Если есть возможности - разворачивайте свои локальные решения для анализа файлов. Есть современные аналоги легендарной Cuckoo Sandbox, например, Assemblyline 4 + CapeV2.
digitalcryptography.ru
Национальный сервис «Мультисканер»
Национальный сервис «Мультисканер» создан АНО «НТЦ ЦК» в 2023-2024 годах в соответствии с распоряжением Правительства Российской Федерации от 10 августа 2023 г. № 2170-р и пунктом 1 раздела III протокола заочного голосования членов президиума Правительственной…
🔥2❤1👍1
Ещё одна опция использования паролей с ИИ агентам Claude в браузере. Раньше выбор был - отдать все пароли или каждый раз самому заходить на ресурсы. Теперь первый парольный менеджер позволяет управлять какими паролями можно пользоваться для каких задач и исключает пересылку паролей в ИИ модель. Пока только пароли и на маках. В планах поддержка данных карт и удостоверений личности.
Forwarded from AISecure
OpenAI рассказала о GPT-Red — внутренней системе для автоматизированного AI Red Teaming.
Идея заключается в использовании adversarial self-play: одна модель пытается найти успешные атаки на другие модели (например, prompt injection), а найденные успешные сценарии используются для их дальнейшего обучения.
Цикл выглядит так:
По сути это напоминает coverage-guided fuzzing, только вместо поиска crash'ей система автоматически исследует пространство возможных атак на LLM и использует найденные успешные сценарии для дальнейшего обучения защитной модели.
В статье речь идет о prompt injection, но аналогичный подход может применяться и для тестирования более сложных AI-систем: AI-агентов, RAG, использования инструментов, MCP и других сценариев, где поведение модели определяется взаимодействием с внешним контекстом.
🔗 https://openai.com/index/unlocking-self-improvement-gpt-red/
Идея заключается в использовании adversarial self-play: одна модель пытается найти успешные атаки на другие модели (например, prompt injection), а найденные успешные сценарии используются для их дальнейшего обучения.
Цикл выглядит так:
GPT-Red → успешная атака → обучение защитной модели → поиск новых атакПо сути это напоминает coverage-guided fuzzing, только вместо поиска crash'ей система автоматически исследует пространство возможных атак на LLM и использует найденные успешные сценарии для дальнейшего обучения защитной модели.
В статье речь идет о prompt injection, но аналогичный подход может применяться и для тестирования более сложных AI-систем: AI-агентов, RAG, использования инструментов, MCP и других сценариев, где поведение модели определяется взаимодействием с внешним контекстом.
🔗 https://openai.com/index/unlocking-self-improvement-gpt-red/
Forwarded from Кибербез Андрея Дугина
Решил почитать, как движутся заморские сетевики к AI в управлении сетью.
Совершенно не удивился, что они открыто признаются, что новшества применяют последними. Потому что стабильность сети зачастую важнее и дороже любых инноваций.
Тем не менее, глаза боятся, а руки делают. Краткая выжимка слайдов прилагается.
Совершенно не удивился, что они открыто признаются, что новшества применяют последними. Потому что стабильность сети зачастую важнее и дороже любых инноваций.
Тем не менее, глаза боятся, а руки делают. Краткая выжимка слайдов прилагается.
👍2
Хорошая практика внимательно изучать системные карты новых используемых моделей, например в карточке модели gpt 5.6 можно было увидеть повышенный шанс деструктивных действий. Если карточки модели в принципе нет - стоит рассмотреть другую модель, потестировать самим все сценарии не реально.
Возможно в будущем появятся публичные независимые/государственные бенчи.
Возможно в будущем появятся публичные независимые/государственные бенчи.
Forwarded from GPT/ChatGPT/AI Central Александра Горного
OpenAI признала, что GPT-5.6 может случайно удалить ваши файлы
Из-за стремления любой ценой закончить задачу GPT-5.6 может обойти ограничения, использовать чужие учётные данные или удалить важные файлы.
Это происходит редко и по ошибке, а не потому, что модель хочет навредить пользователю.
https://www.theregister.com/ai-and-ml/2026/07/16/openai-admits-gpt-56-occasionally-deletes-files-but-its-an-honest-mistake/5274008
Из-за стремления любой ценой закончить задачу GPT-5.6 может обойти ограничения, использовать чужие учётные данные или удалить важные файлы.
Это происходит редко и по ошибке, а не потому, что модель хочет навредить пользователю.
https://www.theregister.com/ai-and-ml/2026/07/16/openai-admits-gpt-56-occasionally-deletes-files-but-its-an-honest-mistake/5274008
Сегодня получилось попасть на Summer Camp от Jet. У коллег получилось довольно ламповое мероприятие на воде.
Много было интересных докладов от известных спикеров, но я бы хотел поделиться парой фото из доклада Андрея Левкина, владельца продукта Bugbounty от Bi.Zone. По его экспертной оценке есть количественное увеличение находимых уязвимостей выше обычного органического роста, но тысяч корректно принятых уязвимостей пока нет. Т.е. на текущий момент можно предположить, что ИИ точно помогает находить корректные уязвимости, но ситуация далека от драмы которую ставят Мифом и GPT 5.6.
А вот количества спама с которым теперь триажерам приходится бороться выросло в 14 раз. Одними из решений этой проблемы стало введение талонов/квот на сдаваемые отчёты и использование ИИ при анализе сдаваемых отчётов. Пара фото из презентации ниже.
Ранее высказанная мною версия, что из-за ИИ у нас упал КПД процесса управления уязвимостями пока подтверждается.
Много было интересных докладов от известных спикеров, но я бы хотел поделиться парой фото из доклада Андрея Левкина, владельца продукта Bugbounty от Bi.Zone. По его экспертной оценке есть количественное увеличение находимых уязвимостей выше обычного органического роста, но тысяч корректно принятых уязвимостей пока нет. Т.е. на текущий момент можно предположить, что ИИ точно помогает находить корректные уязвимости, но ситуация далека от драмы которую ставят Мифом и GPT 5.6.
А вот количества спама с которым теперь триажерам приходится бороться выросло в 14 раз. Одними из решений этой проблемы стало введение талонов/квот на сдаваемые отчёты и использование ИИ при анализе сдаваемых отчётов. Пара фото из презентации ниже.
Ранее высказанная мною версия, что из-за ИИ у нас упал КПД процесса управления уязвимостями пока подтверждается.