Коллеги по отрасли из некоторых известных компаний, хочу к вам обратиться. Если вы хотите с нами посотрудничать по Рекрипториуму или по другим вопросам, то для этого есть, например, такая почта: recryptorium@re-crypt.com. Можно написать сюда: contact@re-crypt.com. Можно просто мне написать: schelkunov@re-crypt.com. Да и другие наши контакты у вас есть, мы знаем. Все контакты доступны. Мы всегда открыты для конструктивного взаимодействия в любом формате. Но заходы на технических специалистов (мы пробили контакт, конечно) а-ля "Вы из Рекрипта? А что Вы можете нам предложить?" попахивают ... нехорошо. Не надо так делать ;) Спишем это на чрезмерное рвение отдельного человека.
👍2
Media is too big
VIEW IN TELEGRAM
Запись моей онлайн-лекции на Неделе прикладной безопасности в МИФИ о нелёгком процессе сбора и разметки данных для обучения моделей ИИ на примере создания датасетов для обучения ИИ-классификаторов Рекрипториума.
#ии #рекрипториум
#ии #рекрипториум
🔥7❤1
Коллеги задали вопрос: "А почему бы не взять крутую нейронку, скормить ей много PE-файлов без предобработки? Она сама научится выделять признаки, а значит - классифицировать. Profit!" Идея не нова, многие пытались. Вот, к примеру, за счёт использования свёрточных нейронных сетей.
Есть, и тоже довольно давно, подходы, использующие трансформеры. Красиво, академично, хорошие метрики. Всё хорошо, но в жизни не работает :) Дело в том, что PE-файлы (как и ELF) - это структурированные данные. В одном файле лежат и скомпилированный код, и данные, и разнообразная служебная информация для загрузчика. Это совершенно разные типы данных, которые раскиданы по файлу. Их местоположение определяется служебными структурами заголовка в виде, как правило, смещений, а также смысловой нагрузкой в коде. Например, для ряда популярных компиляторов данные в кодовой секции являются нормой. Ну а вызов API-функций из кода - это прыжок по адресу в IAT, который был настроен загрузчиком файла при обработке IAT. Ещё есть TLS callbacks, таблицы релокаций, ресурсы (вообще отдельная история), authenticode, текстовые данные и много всего. Их порядок следования не определён. Это всё разные типы данных, которые, если нужен хороший результат, должны отдельно обрабатываться. Это, в сущности, тот же самый супер-популярный агентский подход - когда для разных данных разные инструменты формируют нужный вход для модели. Мы же все видим, какой буст агентский подход даёт обычным LLM. С анализом бинарей то же самое. Ну а всё-таки что там с трансформерами? Они есть в Рекрипториуме, как один из инструментов.
#рекрипториум #ии
Есть, и тоже довольно давно, подходы, использующие трансформеры. Красиво, академично, хорошие метрики. Всё хорошо, но в жизни не работает :) Дело в том, что PE-файлы (как и ELF) - это структурированные данные. В одном файле лежат и скомпилированный код, и данные, и разнообразная служебная информация для загрузчика. Это совершенно разные типы данных, которые раскиданы по файлу. Их местоположение определяется служебными структурами заголовка в виде, как правило, смещений, а также смысловой нагрузкой в коде. Например, для ряда популярных компиляторов данные в кодовой секции являются нормой. Ну а вызов API-функций из кода - это прыжок по адресу в IAT, который был настроен загрузчиком файла при обработке IAT. Ещё есть TLS callbacks, таблицы релокаций, ресурсы (вообще отдельная история), authenticode, текстовые данные и много всего. Их порядок следования не определён. Это всё разные типы данных, которые, если нужен хороший результат, должны отдельно обрабатываться. Это, в сущности, тот же самый супер-популярный агентский подход - когда для разных данных разные инструменты формируют нужный вход для модели. Мы же все видим, какой буст агентский подход даёт обычным LLM. С анализом бинарей то же самое. Ну а всё-таки что там с трансформерами? Они есть в Рекрипториуме, как один из инструментов.
#рекрипториум #ии
Emergentmind
MalConv Architecture: Byte-Level Malware Detection
MalConv is a neural network architecture that directly detects malware from raw byte sequences using gated convolution and attention for efficient processing of large executables.
👍2🔥1
Долго не писали в канале: готовили свежий и довольно большой релиз Рекрипториума. Там масса нововведений. Перечислим самые значимые:
1. Добавлена интеграция с Kaspersky Secure Mail Gateway (KSMG). Теперь Рекрипориум работает с KSMG из коробки.
2. Обновлены модели ИИ для анализа PE-файлов: повышено качество анализа, существенно увеличена скорость. Обученные нами трансформеры там тоже есть ;)
3. Обновлены модели ИИ для быстрого анализа скриптов Python, PHP, JS, PowerShell. И здесь тоже есть обученные нами трансформеры ;)
4. UI стал удобнее и функциональнее.
5. Улучшен анализ архивов, включая архивы с паролями.
6. Добавлена поддержка ICAP.
7. Добавлена поддержка Syslog.
8. Оптимизирована LLM: автореверсинг скриптов стал быстрее и качественнее.
9. Оптимизации в движках для увеличения скорости анализа и экономии ресурсов.
И много чего ещё "по мелочи".
Спасибо всем тем, кто использует Рекрипториум и даёт обратную связь! Это позволяет нам постоянно улучшать наш продукт! В течение следующей недели обновления будут доступны для всех пользователей, включая пилотные стенды. А дальше будет ещё круче!
Присоединяйтесь ;)
По вопросам тестовой эксплуатации, стоимости и приобретения обращайтесь по адресу recryptorium@re-crypt.com
или re-crypt@soft-prom.ru
#рекрипториум #ии
1. Добавлена интеграция с Kaspersky Secure Mail Gateway (KSMG). Теперь Рекрипориум работает с KSMG из коробки.
2. Обновлены модели ИИ для анализа PE-файлов: повышено качество анализа, существенно увеличена скорость. Обученные нами трансформеры там тоже есть ;)
3. Обновлены модели ИИ для быстрого анализа скриптов Python, PHP, JS, PowerShell. И здесь тоже есть обученные нами трансформеры ;)
4. UI стал удобнее и функциональнее.
5. Улучшен анализ архивов, включая архивы с паролями.
6. Добавлена поддержка ICAP.
7. Добавлена поддержка Syslog.
8. Оптимизирована LLM: автореверсинг скриптов стал быстрее и качественнее.
9. Оптимизации в движках для увеличения скорости анализа и экономии ресурсов.
И много чего ещё "по мелочи".
Спасибо всем тем, кто использует Рекрипториум и даёт обратную связь! Это позволяет нам постоянно улучшать наш продукт! В течение следующей недели обновления будут доступны для всех пользователей, включая пилотные стенды. А дальше будет ещё круче!
Присоединяйтесь ;)
По вопросам тестовой эксплуатации, стоимости и приобретения обращайтесь по адресу recryptorium@re-crypt.com
или re-crypt@soft-prom.ru
#рекрипториум #ии
🔥8
В сети ходит своеобразный bypass LLM-анализа вредоносов. Пишут, LLM парсит такой вредонос, натыкается на упоминание о ядерном оружии, включает цензуру, и дальше скрипт не парсит. Наши эксперименты с нашей локальной LLM из Рекрипториума этого не подтверждают. Вредоносы прекрасно и эффективно обнаруживаются с комментариями, без комментариев, с обфускацией, без обфускации, любого размера.
На самом деле нельзя просто взять LLM из паблика, и поставить в конвейер. Чтобы не было таких эффектов, надо изрядно потрудиться
#ии #рекрипториум
На самом деле нельзя просто взять LLM из паблика, и поставить в конвейер. Чтобы не было таких эффектов, надо изрядно потрудиться
#ии #рекрипториум
👍3
Отличный и регулярно пополняемый архив со статьями по поиску уязвимостей с помощью LLM. Для некоторых статей есть ссылки на исходники. В общем, налетай ;)
#ии #почитать #уязвимости
#ии #почитать #уязвимости
GitHub
GitHub - huhusmang/Awesome-LLMs-for-Vulnerability-Detection: The community's most comprehensive, continuously-updated index of…
The community's most comprehensive, continuously-updated index of research on Large Language Models for software vulnerability detection — papers across function-level, repository-level, ag...
👍3
Работе про Model Collapse уже 2 года, что довольно много по нынешним временам, но тем интереснее её читать и ретроспективно оценивать, насколько точными оказались прогнозы.
Смысл статьи в том, что, когда новые модели обучаются на данных, сгенерированных моделями предыдущих итераций (т.е. синтетики всё больше и больше), качество вывода этих новых моделей падает. Рисунок с функциями плотности распределения вероятности, вырезанный из статьи, это отражает визуально. Мы видим, как в процессе обучения отрезаются "хвосты" с небольшими вероятностями. Это естественный эффект машинного обучения. На следующей итерации отрежутся свои "хвосты" и т.д. В итоге модель разучится генерировать действительно ценные и не банальные ответы. Плюс, синтетика может привнести некоторую долю не совсем достоверной информации из-за галлюцинаций, что также отрицательно скажется на качестве генерации. Некоторые белковые бредогенераторы, подхватив темку в лучших традициях инфоцыганства, начали извергать килотонны текста про статистических попугаев, которых кормят собственным помётом, про переработку пластика обратно в нефть и прочее подобное. В общем, волна хайпа на фоне этой простой и банальной в общем то работы была подхвачена хайпожорами и начала раскручиваться, обрастая словесной эквилибристикой.
Однако коллапса, как мы видим, не случилось. Напротив, за 2 года мы наблюдаем заметное улучшение качества вывода. Это результат комплексного подхода к решению проблемы: качественная разметка, детерминированные алгоритмы для верификации (здесь мы вспоминаем термин "упряжь"), выявление синтетики и сокращение её доли в обучении и т.п. Человек, как показывает практика, вносит свой вклад в сгенерированные данные (программисты это хорошо понимают), а значит, данные не полностью синтетические, а, скорее, гибридные. Т.е. в пределе, да, "коллапс модели" возможен и математически вполне объясним, но только если ничего по этому поводу не делать. А так не бывает никогда. Именно поэтому мы наблюдаем обратный эффект: повышение качества генерации.
Ссылка на ту самую статью: https://arxiv.org/pdf/2305.17493
Ну а инфоцыган и экспертов по всему вы и так все хорошо знаете ;)
#ии
Смысл статьи в том, что, когда новые модели обучаются на данных, сгенерированных моделями предыдущих итераций (т.е. синтетики всё больше и больше), качество вывода этих новых моделей падает. Рисунок с функциями плотности распределения вероятности, вырезанный из статьи, это отражает визуально. Мы видим, как в процессе обучения отрезаются "хвосты" с небольшими вероятностями. Это естественный эффект машинного обучения. На следующей итерации отрежутся свои "хвосты" и т.д. В итоге модель разучится генерировать действительно ценные и не банальные ответы. Плюс, синтетика может привнести некоторую долю не совсем достоверной информации из-за галлюцинаций, что также отрицательно скажется на качестве генерации. Некоторые белковые бредогенераторы, подхватив темку в лучших традициях инфоцыганства, начали извергать килотонны текста про статистических попугаев, которых кормят собственным помётом, про переработку пластика обратно в нефть и прочее подобное. В общем, волна хайпа на фоне этой простой и банальной в общем то работы была подхвачена хайпожорами и начала раскручиваться, обрастая словесной эквилибристикой.
Однако коллапса, как мы видим, не случилось. Напротив, за 2 года мы наблюдаем заметное улучшение качества вывода. Это результат комплексного подхода к решению проблемы: качественная разметка, детерминированные алгоритмы для верификации (здесь мы вспоминаем термин "упряжь"), выявление синтетики и сокращение её доли в обучении и т.п. Человек, как показывает практика, вносит свой вклад в сгенерированные данные (программисты это хорошо понимают), а значит, данные не полностью синтетические, а, скорее, гибридные. Т.е. в пределе, да, "коллапс модели" возможен и математически вполне объясним, но только если ничего по этому поводу не делать. А так не бывает никогда. Именно поэтому мы наблюдаем обратный эффект: повышение качества генерации.
Ссылка на ту самую статью: https://arxiv.org/pdf/2305.17493
Ну а инфоцыган и экспертов по всему вы и так все хорошо знаете ;)
#ии
👍2
Интересная публикация про использование локальной модели для поиска уязвимостей. Вместо скармливания проекта целиком модели даются файлы по-отдельности, плюс, необходимый контекст. Результат получился лучше, чем с проприетарными монстрами. Технически понятно, почему так: необходимый контекст позволяет сконцентрироваться на поиске нужной проблемы, а пофайловая обработка - не рассеивать внимание. При этом число false positives ожидаемо возрастает. Это лечится оркестрацией на более высоком уровне. В общем, ещё одно доказательство, что локальные модели достаточно эффективны. Просто нужно уметь их готовить.
#ии #почитать #уязвимости
#ии #почитать #уязвимости
Research Blog | Project Black
Local AI for Penetration Testing & Research
How competent are local AI models for cyber security bug hunting and research?
👍4
Тестирование моделей ИИ на открытом бенчмарке: результаты «Рекрипториума»
Positive Technologies выпустили открытый бенчмарк OMCBench для проверки моделей ИИ. Бенчмарк содержит 800 пакетов для Python и JS (по 400 вредоносных и чистых пакетов на каждую систему), суммарно больше 25 тысяч файлов.
Мы решили протестировать на нём наши модели «Рекрипториума». Результаты — в карточках. Их также можно сравнить с другими решениями в открытой таблице бенчмарка — по ключевым метрикам наши модели демонстрируют более высокие показатели.
Наши модели ИИ для анализа Python и JS используют трансформеры, обученные нами на наших постоянно пополняемых датасетах, а также другие методы анализа. При этом для анализа не потребовался GPU — всё работает на обычном CPU.
#рекрипториум #ии
Positive Technologies выпустили открытый бенчмарк OMCBench для проверки моделей ИИ. Бенчмарк содержит 800 пакетов для Python и JS (по 400 вредоносных и чистых пакетов на каждую систему), суммарно больше 25 тысяч файлов.
Мы решили протестировать на нём наши модели «Рекрипториума». Результаты — в карточках. Их также можно сравнить с другими решениями в открытой таблице бенчмарка — по ключевым метрикам наши модели демонстрируют более высокие показатели.
Наши модели ИИ для анализа Python и JS используют трансформеры, обученные нами на наших постоянно пополняемых датасетах, а также другие методы анализа. При этом для анализа не потребовался GPU — всё работает на обычном CPU.
#рекрипториум #ии
👍8🔥6🤝2
Дежавю: приложения без верификации Google перестанут запускаться
Google готовит обязательную верификацию личности для разработчиков Android-приложений. Открытое письмо против инициативы уже подписали 70+ организаций, включая F-Droid, EFF, Free Software Foundation и GrapheneOS Foundation.
С 30 сентября 2026 года требование вступает в силу в Бразилии, Индонезии, Сингапуре и Таиланде, а с 2027 года Google планирует распространить его на все Android-устройства в мире. Важный момент: это касается не только новых публикаций приложений. Приложения, разработчик которых не прошёл верификацию, будут заблокированы прямо на устройстве пользователя. Под требование попадают все каналы: Google Play, сторонние и региональные магазины приложений (в том числе российские), прямая установка apk.
В карточках разобрали:
• что именно меняется и когда
• какие требования предъявляются к разработчикам
• как будет работать установка приложений от неверифицированных издателей
• кого изменения затронут в первую очередь
Похожая схема начала применяться довольно давно. В нулевых Microsoft ввела обязательную подпись драйверов для Windows: разработчики проходили верификацию, покупали ключ для подписи и подписывали драйверы ядра. Процедура несколько раз менялась — появились EV-сертификаты, менялся сам процесс подписи. Позже практика распространилась и на обычные приложения: подпись Authenticode формально не обязательна, но рекомендована. Инициатива Microsoft продвигалась как мера повышения безопасности.
На практике количество вредоносного ПО от этого заметно не снизилось. Ключ для подписи злоумышленники могут купить так же, как и легитимный разработчик, а получить доступ к ядру системы можно и через уязвимый подписанный драйвер — например, антивируса. Эффективность такой верификации именно с точки зрения безопасности вызывает вопросы.
В 2022 году российские компании-разработчики лишились возможности подписывать новые версии драйверов ранее приобретёнными EV-сертификатами из-за введённых в одностороннем порядке ограничений со стороны Microsoft. Мы, как и многие другие компании, столкнулись с этой ситуацией напрямую.
Инициатива Google несёт более серьёзные риски: она позволяет блокировать конкретные приложения непосредственно на устройстве пользователя, и в их число потенциально могут попасть приложения российских организаций. При этом на практическую безопасность системы такой механизм влияет незначительно.
Google готовит обязательную верификацию личности для разработчиков Android-приложений. Открытое письмо против инициативы уже подписали 70+ организаций, включая F-Droid, EFF, Free Software Foundation и GrapheneOS Foundation.
С 30 сентября 2026 года требование вступает в силу в Бразилии, Индонезии, Сингапуре и Таиланде, а с 2027 года Google планирует распространить его на все Android-устройства в мире. Важный момент: это касается не только новых публикаций приложений. Приложения, разработчик которых не прошёл верификацию, будут заблокированы прямо на устройстве пользователя. Под требование попадают все каналы: Google Play, сторонние и региональные магазины приложений (в том числе российские), прямая установка apk.
В карточках разобрали:
• что именно меняется и когда
• какие требования предъявляются к разработчикам
• как будет работать установка приложений от неверифицированных издателей
• кого изменения затронут в первую очередь
Похожая схема начала применяться довольно давно. В нулевых Microsoft ввела обязательную подпись драйверов для Windows: разработчики проходили верификацию, покупали ключ для подписи и подписывали драйверы ядра. Процедура несколько раз менялась — появились EV-сертификаты, менялся сам процесс подписи. Позже практика распространилась и на обычные приложения: подпись Authenticode формально не обязательна, но рекомендована. Инициатива Microsoft продвигалась как мера повышения безопасности.
На практике количество вредоносного ПО от этого заметно не снизилось. Ключ для подписи злоумышленники могут купить так же, как и легитимный разработчик, а получить доступ к ядру системы можно и через уязвимый подписанный драйвер — например, антивируса. Эффективность такой верификации именно с точки зрения безопасности вызывает вопросы.
В 2022 году российские компании-разработчики лишились возможности подписывать новые версии драйверов ранее приобретёнными EV-сертификатами из-за введённых в одностороннем порядке ограничений со стороны Microsoft. Мы, как и многие другие компании, столкнулись с этой ситуацией напрямую.
Инициатива Google несёт более серьёзные риски: она позволяет блокировать конкретные приложения непосредственно на устройстве пользователя, и в их число потенциально могут попасть приложения российских организаций. При этом на практическую безопасность системы такой механизм влияет незначительно.
❤3🤔3👍2👌1
ФСТЭК обновила требования к защите персональных данных
ФСТЭК опубликовала итоговый проект приказа, который заменит действующий приказ № 21 от 2013 года. Новый документ вступает в силу с 1 сентября 2026 года — приказ представляет собой полностью переработанный состав мер.
Основные изменения:
1. Гибкий подход вместо жёсткого списка мер
2. Обязательная оценка эффективности
3. Расширенный перечень мер
4. Требования к сертифицированным СЗИ
Ознакомиться с полным текстом приказа можно по ссылке.
ФСТЭК опубликовала итоговый проект приказа, который заменит действующий приказ № 21 от 2013 года. Новый документ вступает в силу с 1 сентября 2026 года — приказ представляет собой полностью переработанный состав мер.
Основные изменения:
1. Гибкий подход вместо жёсткого списка мер
Вместо фиксированного перечня из 15 групп мер — трёхуровневая модель выбора:
1) определение базовых мер по уровню защищённости (1–4)
2) адаптация мер под архитектуру и технологии своей ИС
3) верификация, что адаптированные меры закрывают актуальные угрозы
2. Обязательная оценка эффективности
Вводится количественный показатель — «уровень зрелости» (У_зи). Оценка проводится:
• до начала обработки ПДн
• не реже 1 раза в 3 года
• после любого компьютерного инцидента у оператора
Требование распространяется и на обработчиков, привлечённых оператором.
3. Расширенный перечень мер
В список впервые чётко включены:
• защита при использовании искусственного интеллекта
• защита виртуализации, облаков, контейнеров и оркестрации
• защита технологий интернета вещей (IoT)
• защита программных интерфейсов (API)
• непрерывное взаимодействие с ГосСОПКА (для объектов КИИ)
• мониторинг ИБ и управление уязвимостями
4. Требования к сертифицированным СЗИ
Минимальный класс и уровень доверия СЗИ зависят от уровня защищённости ИСПДн:
• 1-й уровень — класс не ниже 4, уровень доверия не ниже 4
• 2-й уровень — класс не ниже 5, уровень доверия не ниже 5
• 3-й и 4-й уровни — класс 6, уровень доверия 6
Чем выше уровень защищённости, тем дороже и надёжнее должны быть сертифицированные СЗИ.
Ознакомиться с полным текстом приказа можно по ссылке.
👍4👏3🔥2❤1
Рекрипториум добавит поддержку APK-файлов
Наш Рекрипториум постоянно развивается — в ближайшем релизе добавим поддержку APK-файлов.
Высокие показатели на независимых данных достигнуты за счёт того, что модель использует не только стандартные статистические метрики файлов, но и структурные особенности, которые мы научились выявлять с помощью обученного нами трансформера.
Как и во всех наших моделях, скорость обработки позволяет использовать её практически в поточном режиме.
#рекрипториум #ии
Наш Рекрипториум постоянно развивается — в ближайшем релизе добавим поддержку APK-файлов.
Метрики модели на текущий момент: AUC=0.9928, F1=0.956.
Высокие показатели на независимых данных достигнуты за счёт того, что модель использует не только стандартные статистические метрики файлов, но и структурные особенности, которые мы научились выявлять с помощью обученного нами трансформера.
Как и во всех наших моделях, скорость обработки позволяет использовать её практически в поточном режиме.
#рекрипториум #ии
🔥7👍4👏3❤1
Как мы понимаем, что APK безопасен?
Разобрали в карточках, чем наш подход к анализу APK отличается от классических антивирусных решений.
Современные вредоносные APK всё чаще мимикрируют под обычные приложения, и лишь детальный комплексный анализ с помощью ИИ способен выявить вредоносную составляющую, скрытую зачастую с помощью технологий обфускации.
ИИ-классификатор Рекрипториума работает полностью статически — без запуска приложения. Он извлекает код из всех DEX-файлов, строит граф вызовов между методами, анализирует последовательности API-вызовов и ошибки парсинга структуры APK, а также анализирует DEX обученным нами трансформером.
В карточках — подробнее о том, что скрывают упакованные APK, почему традиционные методы классификации плохо работают и за счёт чего наша модель ИИ показывает хорошие результаты.
#рекрипториум #ии
Разобрали в карточках, чем наш подход к анализу APK отличается от классических антивирусных решений.
Современные вредоносные APK всё чаще мимикрируют под обычные приложения, и лишь детальный комплексный анализ с помощью ИИ способен выявить вредоносную составляющую, скрытую зачастую с помощью технологий обфускации.
ИИ-классификатор Рекрипториума работает полностью статически — без запуска приложения. Он извлекает код из всех DEX-файлов, строит граф вызовов между методами, анализирует последовательности API-вызовов и ошибки парсинга структуры APK, а также анализирует DEX обученным нами трансформером.
В карточках — подробнее о том, что скрывают упакованные APK, почему традиционные методы классификации плохо работают и за счёт чего наша модель ИИ показывает хорошие результаты.
#рекрипториум #ии
🔥4❤1👍1