Рекриптор
228 subscribers
88 photos
12 videos
3 files
263 links
Заметки на полях о практической безопасности и не только
Download Telegram
16 апреля в 17.30 в рамках Недели прикладной кибербезопасности «CyberFox» расскажу о нашем опыте обучения моделей ИИ для анализа файлов. Просто скопирую анонс доклада с сайта:
Говоря об ИИ, имеем в виду данные, или почему данные важнее алгоритмов

Сейчас IT-отрасль испытывает настоящий бум от развития и повсеместного внедрения ИИ. Создатели практически каждого IT-продукта заявляют, что в нём присутствует ИИ. Не обошла эта тенденция и мир ИБ. Однако есть крайне важный вопрос, который витает в воздухе, но редко озвучивается: а где все эти люди берут столько данных, чтобы качественно обучить свои модели ИИ? Как они данные обрабатывают? Или это готовые и уже обученные открытые модели? Или модели ИИ обучаются на открытых датасетах? И насколько качественны открытые датасеты? Я расскажу о нашем опыте сбора датасетов для обучения наших ИИ-классификаторов файлов и почему сбор датасетов - это сложный и технологичный процесс. Расскажу, чем плохи открытые датасеты и почему многие из них годятся разве что для академических исследований, да и то не всегда. Расскажу, зачем нужно разрабатывать и обучать свои модели, когда "всё есть на гитхабе" и есть LLM, которые "всё умеют".
🔥1
Инфоцыгане и прочие эксперты по всему любят порой порассуждать про ИИ. Принимают снисходительный вид и начинают объяснять типа простыми словами для не специалистов, как они любят говорить, вворачивая какие-нибудь околонаучные или даже научные термины (обычно ни к селу - ни к городу), дабы продать свою экспертность и показать превосходство над. Вот, к примеру, есть типичный внезапный эксперт по ИИ, который рассуждает в стиле "ИИ не может выдать того, чего не знает и чему не обучался". На разных площадках на полном серьёзе об этом говорит. Новоявленного эксперта вообще не смущает, что он описывает логику обычного справочника. Про "проклятие размерности" эксперт не слышал, он стратегией занимается. Эксперта совершенно не беспокоит, что, вообще говоря, вся эта очень давняя пляска вокруг ИИ - это пляска вокруг и только вокруг обучения способности обобщать и предсказывать результат, близкий к реальному, для тех входов, которые не входили в обучающий набор. На этом всё держится и ради этого всё затевалось.Т.е. модель обучается моделировать распределение вероятности. Тот самый вероятностный подход к машинному обучению, о котором мы говорили. Если говорить о LLM, модель через, по сути, ту же базовую математику обучается моделировать в том числе и рассуждения (reasoning). Это моделирование рассуждений в сочетании агентским подходом вполне позволяет получать в том числе новые научные результаты. Так, например, было получено решение одной из проблем Эрдёша. Есть интересные результаты работы ИИ во многих отраслях: от генетики до IT-сферы. Но до сих пор мы встречаем, например, вот такие слова:
Большие языковые модели — это мощные системы распознавания образов: они изучили статистические закономерности в тексте и очень хорошо их воспроизводят.

Как отмечает нейробиолог Кристоф Кох, такие инструменты, как ChatGPT, Anthropic и Perplexity, могут лишь «пересказывать то, что написали другие». 

Или вот это:
Они вообще не «думают». Это компилятор чужих идей, искусно оформленный так, что мы воспринимаем его как нечто естественное.

Они действительно не думают в нашем понимании. Они моделируют мышление. Это модели, они так и называются. Это работает, это можно совершенствовать. Это хорошо.
Статья, откуда взяты цитаты выше: https://quillette.com/2026/03/27/ai-is-not-about-to-become-sentient-moltbook-openclaw/

Ну и чисто практическая ссылка ;) про анализ кода с помощью Claude Code: https://specterops.io/blog/2026/03/26/leveling-up-secure-code-reviews-with-claude-code/

#ии
👍3
Китайцы провели интересное исследование, в результате которого сумели улучшить вывод маленькой модели с 7 миллиардами параметров настолько, что она превзошла гораздо более обьёмные модели (в 4 раза больше параметров). Добились они этого за счёт оригинального механизма памяти. Если совсем кратко, то они в противовес традиционному подходу с RAG предлагают хранить не просто данные, а стратегии вывода - эдакие дорожные карты: не что искать, а как искать. Предлагается хранить не только "хорошие" стратегии, но и плохие - когда вывод некорректен. Таким образом, аккумулируя эти стратегии, модель обучается мыслить всё более и более качественно и корректно.
Почему это очень важно? Потому что какой-нибудь Claude, к сожалению, не лежит в кармане и всегда хочется крутых результатов на локальных моделях с как можно меньшим числом параметров.
Мой глаз зацепился за эту работу, потому что мы у себя в ходе экспериментов и
размышлений в одном из проектов пришли к чему-то подобному.
А вот и сама работа: https://arxiv.org/pdf/2604.04503

#ии #почитать
🔥3
Неделя прикладной кибербезорасности стартовала в НИЯУ МИФИ сегодня. Кто не успел зарегистрироваться, можно это сделать, написав на почту cryptofox@mephi.ru с темой "Регистрация. Неделя кибербезопасности". В письме нужно указать ФИО, телефон, ВУЗ/место работы.
Интересное использование LLM не для непосредственно нахождения багов, а для генерации тестовых наборов для фаззинга.
Цитата:
Агент изучил незнакомый код, нашел точную строку, в которой незаметно происходит сбой при определении типа, создал тестовый стенд, который действительно мог бы пройти по этому пути при правильной структуре входных данных, скомпилировал все с нужными санитайзерами и запустил фаззер. Никаких подсказок, никаких предварительных знаний о Brotli. Вся цепочка должна была сработать, и она сработала.

#фаззинг #ии #почитать #уязвимости
👍1
Свежайшая и интересная работа про построение.обвязки для эффективного поиска уязвимостей. Так, например, нашли CVE-2026-5280 и CVE-2026-6297. В этом контексте упоминается LLM с открытыми весами Kimi K2.5. Именно с её использованием были найдены 8 уязвимостей в Google Chrome, включая 2 вышеозначенных критических (побег из песочницы). Автоматизируется весь процесс исследования: от гипотез до генерации эксплоита. Сам подход, который авторы назвали AgentFlow, достаточно общий и может использоваться много для чего.

#почитать #ии #уязвимости
👍3
А меж тем вышел DeepSeek-V4-Pro с контекстом в миллион токенов с 10% KV-кэша и 27% inference FLOPs по сравнению v3.2. Это означает относительно дешёвую генерацию, которая дрстигается за счёт гибридного механизма внимания Очень хорошая новость. Пишут, работает на уровне топовых проприетарных моделей.
Технический отчёт: https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf
Веса: https://huggingface.co/collections/deepseek-ai/deepseek-v4

#ии
🔥1
Многие пытаются автоматизировать реверс-инжиниринг с помощью LLM. У многих получается. Очень часто в основе таких проектов лежит одно волшебное слово: Claude. Иногда встречаются другие волшебные слова, но все они про облачные модели, которые недёшевы, плюс, данные утекают, плюс, могут в любой момент забанить. А вот с моделями поменьше экспериментируют гораздо реже: это подольше и посложнее. Однако у нас вполне себе получается делать это с использованием локальной агентской системы.

Вот, к примеру, как выглядит результат полностью автоматического реверс-инжиниринга без запуска на исполнение одного wiper-а (привожу частично, потому что там много).
**Step-by-step actions (non-technical)**

1. **Launch** - You run the program.
2. **Hidden checks** - The program quietly checks whether you are running a debugger or a virtual
machine. If it detects one, it stops right away.
3. **Disk wipe** - It opens the raw disk device (`\\.\PhysicalDrive0`) and writes a block of zeros
over the first ~7.5 GB of the drive.
4. **File flood** - It creates 256 files named `file0.bin` ... `file255.bin`, each 5 MiB of zeros,
filling the disk with useless data.
5. **Thread acceleration** - While the wipe and flood are happening, it spawns many worker threads
to speed up the process.
6. **Abort** - After finishing the destructive work, it throws a managed exception that terminates
the program with a "SecurityException" message.
...
### Supporting Evidence

1. **Direct raw-disk destruction** - The binary writes zeros to the physical drive, a classic
sabotage technique (T1485).
2. **Massive file flooding** - Creates hundreds of large empty files, saturating disk space and
causing I/O contention.
3. **Anti-debug and obfuscation** - Multiple anti-debug checks and dynamic API resolution indicate a
deliberate attempt to evade analysis.
4. **Registry hive deletion capabilities** - Functions that delete entire registry hives are
present, even if not invoked in the current flow.
...

А вот downloader:
**Step-by-step actions (non-technical)**
1. **Starts silently** - no window or dialog appears.
2. **Downloads a file** using Windows' built-in `certutil` tool (the program builds a command line
that looks like a normal download request).
3. **Runs a VBScript** that is stored in `C:\ProgramData`.
4. **Pauses for 60 seconds** (a deliberate delay to avoid quick detection).
5. **Launches several executables** (`Crydasjd.exe`, `qq.sys`, `qq1.exe`, and three files that look
like logs but are actually programs).
6. **Repeats the pause** after each launch.
7. **Ends** - the program itself does not stay resident; it simply exits after starting the last
file.
...

### Supporting evidence
- **Downloader behavior** (`certutil` + `WinExec`) - classic dropper technique.
- **Execution of multiple external binaries** (including a driver) - indicates a multi-stage attack.
- **File-extension spoofing** (`.log` files executed as binaries).
- **Anti-analysis delays** (60-second sleeps).

Подчеркну, что речь идёт о скомпилированных файлах - бинарях. Тех самых exe, dll и т.д. Проект нами активно развивается, используется для внутренних нужд, уже экономя силы и время аналитиков, и обязательно станет частью нашей платформы для анализа файлов Рекрипториум. Для тех, кто приобретает её сейчас, будет хорошая скидка! Обращайтесь: recryptorium@re-crypt.com или re-crypt@soft-prom.ru

#ии #реверсинг #рекрипториум
👍6
❤8🫡1
Свежая, подробная и очень интересная статья про поиск уязвимостей с помощью ИИ. Уже практически традиционно стало использование Claude, но это далеко не главное. Это один из тех примеров, которые наглядно доказывают, что ИИ не замещает работу эксперта, а помогает ему делать свою работу эффективнее. Это ещё один инструмент автоматизации.
Цитата:
С изобретением автомобиля люди не перестали ходить в походы. Автомобили позволили им добираться до более интересных мест.
Что было сделано, если совсем кратко? LLM-ке скормили набор навыков и старых эксплойтов для механизма сериализации PHP. Дали стратегию. Claude разработал новые эксплойты. Ну а подробности в статье ;)

#почитать #ии #уязвимости
👍2
Коллеги по отрасли из некоторых известных компаний, хочу к вам обратиться. Если вы хотите с нами посотрудничать по Рекрипториуму или по другим вопросам, то для этого есть, например, такая почта: recryptorium@re-crypt.com. Можно написать сюда: contact@re-crypt.com. Можно просто мне написать: schelkunov@re-crypt.com. Да и другие наши контакты у вас есть, мы знаем. Все контакты доступны. Мы всегда открыты для конструктивного взаимодействия в любом формате. Но заходы на технических специалистов (мы пробили контакт, конечно) а-ля "Вы из Рекрипта? А что Вы можете нам предложить?" попахивают ... нехорошо. Не надо так делать ;) Спишем это на чрезмерное рвение отдельного человека.
👍2
Media is too big
VIEW IN TELEGRAM
Запись моей онлайн-лекции на Неделе прикладной безопасности в МИФИ о нелёгком процессе сбора и разметки данных для обучения моделей ИИ на примере создания датасетов для обучения ИИ-классификаторов Рекрипториума.

#ии #рекрипториум
🔥7❤1
Коллеги задали вопрос: "А почему бы не взять крутую нейронку, скормить ей много PE-файлов без предобработки? Она сама научится выделять признаки, а значит - классифицировать. Profit!" Идея не нова, многие пытались. Вот, к примеру, за счёт использования свёрточных нейронных сетей.
Есть, и тоже довольно давно, подходы, использующие трансформеры. Красиво, академично, хорошие метрики. Всё хорошо, но в жизни не работает :) Дело в том, что PE-файлы (как и ELF) - это структурированные данные. В одном файле лежат и скомпилированный код, и данные, и разнообразная служебная информация для загрузчика. Это совершенно разные типы данных, которые раскиданы по файлу. Их местоположение определяется служебными структурами заголовка в виде, как правило, смещений, а также смысловой нагрузкой в коде. Например, для ряда популярных компиляторов данные в кодовой секции являются нормой. Ну а вызов API-функций из кода - это прыжок по адресу в IAT, который был настроен загрузчиком файла при обработке IAT. Ещё есть TLS callbacks, таблицы релокаций, ресурсы (вообще отдельная история), authenticode, текстовые данные и много всего. Их порядок следования не определён. Это всё разные типы данных, которые, если нужен хороший результат, должны отдельно обрабатываться. Это, в сущности, тот же самый супер-популярный агентский подход - когда для разных данных разные инструменты формируют нужный вход для модели. Мы же все видим, какой буст агентский подход даёт обычным LLM. С анализом бинарей то же самое. Ну а всё-таки что там с трансформерами? Они есть в Рекрипториуме, как один из инструментов.

#рекрипториум #ии
👍2🔥1
Долго не писали в канале: готовили свежий и довольно большой релиз Рекрипториума. Там масса нововведений. Перечислим самые значимые:
1. Добавлена интеграция с Kaspersky Secure Mail Gateway (KSMG). Теперь Рекрипориум работает с KSMG из коробки.
2. Обновлены модели ИИ для анализа PE-файлов: повышено качество анализа, существенно увеличена скорость. Обученные нами трансформеры там тоже есть ;)
3. Обновлены модели ИИ для быстрого анализа скриптов Python, PHP, JS, PowerShell. И здесь тоже есть обученные нами трансформеры ;)
4. UI стал удобнее и функциональнее.
5. Улучшен анализ архивов, включая архивы с паролями.
6. Добавлена поддержка ICAP.
7. Добавлена поддержка Syslog.
8. Оптимизирована LLM: автореверсинг скриптов стал быстрее и качественнее.
9. Оптимизации в движках для увеличения скорости анализа и экономии ресурсов.

И много чего ещё "по мелочи".

Спасибо всем тем, кто использует Рекрипториум и даёт обратную связь! Это позволяет нам постоянно улучшать наш продукт! В течение следующей недели обновления будут доступны для всех пользователей, включая пилотные стенды. А дальше будет ещё круче!
Присоединяйтесь ;)
По вопросам тестовой эксплуатации, стоимости и приобретения обращайтесь по адресу recryptorium@re-crypt.com
или re-crypt@soft-prom.ru

#рекрипториум #ии
🔥8
В сети ходит своеобразный bypass LLM-анализа вредоносов. Пишут, LLM парсит такой вредонос, натыкается на упоминание о ядерном оружии, включает цензуру, и дальше скрипт не парсит. Наши эксперименты с нашей локальной LLM из Рекрипториума этого не подтверждают. Вредоносы прекрасно и эффективно обнаруживаются с комментариями, без комментариев, с обфускацией, без обфускации, любого размера.
На самом деле нельзя просто взять LLM из паблика, и поставить в конвейер. Чтобы не было таких эффектов, надо изрядно потрудиться

#ии #рекрипториум
👍3
С Днём России!
🔥6
Отличный и регулярно пополняемый архив со статьями по поиску уязвимостей с помощью LLM. Для некоторых статей есть ссылки на исходники. В общем, налетай ;)

#ии #почитать #уязвимости
👍3
Работе про Model Collapse уже 2 года, что довольно много по нынешним временам, но тем интереснее её читать и ретроспективно оценивать, насколько точными оказались прогнозы.
Смысл статьи в том, что, когда новые модели обучаются на данных, сгенерированных моделями предыдущих итераций (т.е. синтетики всё больше и больше), качество вывода этих новых моделей падает. Рисунок с функциями плотности распределения вероятности, вырезанный из статьи, это отражает визуально. Мы видим, как в процессе обучения отрезаются "хвосты" с небольшими вероятностями. Это естественный эффект машинного обучения. На следующей итерации отрежутся свои "хвосты" и т.д. В итоге модель разучится генерировать действительно ценные и не банальные ответы. Плюс, синтетика может привнести некоторую долю не совсем достоверной информации из-за галлюцинаций, что также отрицательно скажется на качестве генерации. Некоторые белковые бредогенераторы, подхватив темку в лучших традициях инфоцыганства, начали извергать килотонны текста про статистических попугаев, которых кормят собственным помётом, про переработку пластика обратно в нефть и прочее подобное. В общем, волна хайпа на фоне этой простой и банальной в общем то работы была подхвачена хайпожорами и начала раскручиваться, обрастая словесной эквилибристикой.

Однако коллапса, как мы видим, не случилось. Напротив, за 2 года мы наблюдаем заметное улучшение качества вывода. Это результат комплексного подхода к решению проблемы: качественная разметка, детерминированные алгоритмы для верификации (здесь мы вспоминаем термин "упряжь"), выявление синтетики и сокращение её доли в обучении и т.п. Человек, как показывает практика, вносит свой вклад в сгенерированные данные (программисты это хорошо понимают), а значит, данные не полностью синтетические, а, скорее, гибридные. Т.е. в пределе, да, "коллапс модели" возможен и математически вполне объясним, но только если ничего по этому поводу не делать. А так не бывает никогда. Именно поэтому мы наблюдаем обратный эффект: повышение качества генерации.
Ссылка на ту самую статью: https://arxiv.org/pdf/2305.17493
Ну а инфоцыган и экспертов по всему вы и так все хорошо знаете ;)

#ии
👍2
Интересная публикация про использование локальной модели для поиска уязвимостей. Вместо скармливания проекта целиком модели даются файлы по-отдельности, плюс, необходимый контекст. Результат получился лучше, чем с проприетарными монстрами. Технически понятно, почему так: необходимый контекст позволяет сконцентрироваться на поиске нужной проблемы, а пофайловая обработка - не рассеивать внимание. При этом число false positives ожидаемо возрастает. Это лечится оркестрацией на более высоком уровне. В общем, ещё одно доказательство, что локальные модели достаточно эффективны. Просто нужно уметь их готовить.

#ии #почитать #уязвимости
👍4