Много вопросов на очных и онлайн-встречах по поводу статического анализа вредоносов. Кажется, настала пора написать об этом небольшой пост. Статический анализ - это анализ без запуска на исполнение в самом широком смысле этого определения. Многие под статическим анализом понимают что-то типа эвристических движков антивируса или простых моделек ML из тех же антивирусов. На самом деле это гораздо более широкое понятие: в него входит и дизассемблирование, и анализ логики без запуска на исполнение, да и в целом реверс-инжиниринг - это, в основном, статический анализ.
Давайте "понаблюдаем", как анализирует файл (пусть это будет PE-файл) реверс-инженер, у которого стоит одна задача: понять, вредоносный файл или нет. Сначала он смотрит основные свойства файла: тип, платформу, свойства, размеры и имена секций, их энтропию, наличие TLS-коллбэков, наличие подписи Authenticode, импорты, экспорты, оверлей и что там лежит, ресурсы и т.п. Это беглый взгляд даже без дизассемблера и декомпилятора. Чем более намётан глаз реверс-инженера, тем быстрее он даже без дизассемблирования и тщательного изучения классифицирует файл уже по этим признакам. Далее он смотрит глубже: распределение вероятностей встречающихся инструкций и их последовательностей. Хороший реверсер, например, сразу на глазок выделит обфусцированный код. Как он это делает? Опыт. Он знает статистику встречаемости инструкций и их последовательностей. Он много видел как чистых, так и вредоносных файлов. И он без погружения в изучение логики видит, что код подозрителен. То же самое с данными. Что ещё видно сразу? Строки, если они есть. По ним многое понятно без анализа логики. Ещё видно использование критпографии. Это видно либо по вызову импортируемых функций, либо по коду. Наш реверсер просто крутит мышкой код в дизассмеблере и видит подозрительные вещи. Как он это делает? Опыт, набитая рука. Тысячи параметров дают чёткую картину опытному человеку. И чем он опытнее, тем лучше без погружения непосредственно в логику он сможет классифицировать файл. Если он знает, откуда файл к нему попал, то здесь начинает играть роль априорная вероятность. В общем, интуиция, подкреплённая опытом.
Можно ли обучить ИИ делать то же самое? Вполне! Если есть миллионы разных семплов вредоносных и чистых файлов и понимание, как работает Data Science. Нет, публичные датасеты не подходят. Данные надо упорно и постоянно собирать, просеивать, классифицировать, выделять из них признаки. В общем, готовить. Это не быстро и не дёшево. Здесь нужна антивирусная лаборатория. Нет данных - нет ИИ. У нас есть и антивирусная лаборатория, и миллионы семплов, и специалисты Data Science, и, как следствие, Рекрипториум.
Чем мощнее оборудование, на котором работает ИИ, тем более продвинутые модели могут там работать. Это и есть основное ограничение антивирусов. Они созданы для работы на хостах, а значит, ограничены сверху весьма небольшими ресурсами. Значит, эвристики будут простыми и грубыми, а точность сильно пострадает. На подсчёт и формирование больших векторов признаков нет ресурсов. В этом проблема мультисканеров. Особенно хорошо это проявляется на файлах скриптовых языков, но и на бинарях мы это тоже прекрасно видим.
Статический анализ статическому анализу рознь.
#ии #рекрипториум
Давайте "понаблюдаем", как анализирует файл (пусть это будет PE-файл) реверс-инженер, у которого стоит одна задача: понять, вредоносный файл или нет. Сначала он смотрит основные свойства файла: тип, платформу, свойства, размеры и имена секций, их энтропию, наличие TLS-коллбэков, наличие подписи Authenticode, импорты, экспорты, оверлей и что там лежит, ресурсы и т.п. Это беглый взгляд даже без дизассемблера и декомпилятора. Чем более намётан глаз реверс-инженера, тем быстрее он даже без дизассемблирования и тщательного изучения классифицирует файл уже по этим признакам. Далее он смотрит глубже: распределение вероятностей встречающихся инструкций и их последовательностей. Хороший реверсер, например, сразу на глазок выделит обфусцированный код. Как он это делает? Опыт. Он знает статистику встречаемости инструкций и их последовательностей. Он много видел как чистых, так и вредоносных файлов. И он без погружения в изучение логики видит, что код подозрителен. То же самое с данными. Что ещё видно сразу? Строки, если они есть. По ним многое понятно без анализа логики. Ещё видно использование критпографии. Это видно либо по вызову импортируемых функций, либо по коду. Наш реверсер просто крутит мышкой код в дизассмеблере и видит подозрительные вещи. Как он это делает? Опыт, набитая рука. Тысячи параметров дают чёткую картину опытному человеку. И чем он опытнее, тем лучше без погружения непосредственно в логику он сможет классифицировать файл. Если он знает, откуда файл к нему попал, то здесь начинает играть роль априорная вероятность. В общем, интуиция, подкреплённая опытом.
Можно ли обучить ИИ делать то же самое? Вполне! Если есть миллионы разных семплов вредоносных и чистых файлов и понимание, как работает Data Science. Нет, публичные датасеты не подходят. Данные надо упорно и постоянно собирать, просеивать, классифицировать, выделять из них признаки. В общем, готовить. Это не быстро и не дёшево. Здесь нужна антивирусная лаборатория. Нет данных - нет ИИ. У нас есть и антивирусная лаборатория, и миллионы семплов, и специалисты Data Science, и, как следствие, Рекрипториум.
Чем мощнее оборудование, на котором работает ИИ, тем более продвинутые модели могут там работать. Это и есть основное ограничение антивирусов. Они созданы для работы на хостах, а значит, ограничены сверху весьма небольшими ресурсами. Значит, эвристики будут простыми и грубыми, а точность сильно пострадает. На подсчёт и формирование больших векторов признаков нет ресурсов. В этом проблема мультисканеров. Особенно хорошо это проявляется на файлах скриптовых языков, но и на бинарях мы это тоже прекрасно видим.
Статический анализ статическому анализу рознь.
#ии #рекрипториум
❤6
16 апреля в 17.30 в рамках Недели прикладной кибербезопасности «CyberFox» расскажу о нашем опыте обучения моделей ИИ для анализа файлов. Просто скопирую анонс доклада с сайта:
Говоря об ИИ, имеем в виду данные, или почему данные важнее алгоритмов
Сейчас IT-отрасль испытывает настоящий бум от развития и повсеместного внедрения ИИ. Создатели практически каждого IT-продукта заявляют, что в нём присутствует ИИ. Не обошла эта тенденция и мир ИБ. Однако есть крайне важный вопрос, который витает в воздухе, но редко озвучивается: а где все эти люди берут столько данных, чтобы качественно обучить свои модели ИИ? Как они данные обрабатывают? Или это готовые и уже обученные открытые модели? Или модели ИИ обучаются на открытых датасетах? И насколько качественны открытые датасеты? Я расскажу о нашем опыте сбора датасетов для обучения наших ИИ-классификаторов файлов и почему сбор датасетов - это сложный и технологичный процесс. Расскажу, чем плохи открытые датасеты и почему многие из них годятся разве что для академических исследований, да и то не всегда. Расскажу, зачем нужно разрабатывать и обучать свои модели, когда "всё есть на гитхабе" и есть LLM, которые "всё умеют".
Cyberfox-Week
Неделя кибербезопасности
Неделя кибербезопасности в мифи
🔥1
Классный курс по реверсингу от Mandiant FLARE Team . Свеженький. Налетай, а то, вдруг, забанит кто... ;)
#реверсинг #почитать
#реверсинг #почитать
GitHub
GitHub - mandiant/flare-learning-hub: Free educational content on reverse engineering and malware analysis from the FLARE team
Free educational content on reverse engineering and malware analysis from the FLARE team - mandiant/flare-learning-hub
👍1
Инфоцыгане и прочие эксперты по всему любят порой порассуждать про ИИ. Принимают снисходительный вид и начинают объяснять типа простыми словами для не специалистов, как они любят говорить, вворачивая какие-нибудь околонаучные или даже научные термины (обычно ни к селу - ни к городу), дабы продать свою экспертность и показать превосходство над. Вот, к примеру, есть типичный внезапный эксперт по ИИ, который рассуждает в стиле "ИИ не может выдать того, чего не знает и чему не обучался". На разных площадках на полном серьёзе об этом говорит. Новоявленного эксперта вообще не смущает, что он описывает логику обычного справочника. Про "проклятие размерности" эксперт не слышал, он стратегией занимается. Эксперта совершенно не беспокоит, что, вообще говоря, вся эта очень давняя пляска вокруг ИИ - это пляска вокруг и только вокруг обучения способности обобщать и предсказывать результат, близкий к реальному, для тех входов, которые не входили в обучающий набор. На этом всё держится и ради этого всё затевалось.Т.е. модель обучается моделировать распределение вероятности. Тот самый вероятностный подход к машинному обучению, о котором мы говорили. Если говорить о LLM, модель через, по сути, ту же базовую математику обучается моделировать в том числе и рассуждения (reasoning). Это моделирование рассуждений в сочетании агентским подходом вполне позволяет получать в том числе новые научные результаты. Так, например, было получено решение одной из проблем Эрдёша. Есть интересные результаты работы ИИ во многих отраслях: от генетики до IT-сферы. Но до сих пор мы встречаем, например, вот такие слова:
Или вот это:
Они действительно не думают в нашем понимании. Они моделируют мышление. Это модели, они так и называются. Это работает, это можно совершенствовать. Это хорошо.
Статья, откуда взяты цитаты выше: https://quillette.com/2026/03/27/ai-is-not-about-to-become-sentient-moltbook-openclaw/
Ну и чисто практическая ссылка ;) про анализ кода с помощью Claude Code: https://specterops.io/blog/2026/03/26/leveling-up-secure-code-reviews-with-claude-code/
#ии
Большие языковые модели — это мощные системы распознавания образов: они изучили статистические закономерности в тексте и очень хорошо их воспроизводят.
Как отмечает нейробиолог Кристоф Кох, такие инструменты, как ChatGPT, Anthropic и Perplexity, могут лишь «пересказывать то, что написали другие».
Или вот это:
Они вообще не «думают». Это компилятор чужих идей, искусно оформленный так, что мы воспринимаем его как нечто естественное.
Они действительно не думают в нашем понимании. Они моделируют мышление. Это модели, они так и называются. Это работает, это можно совершенствовать. Это хорошо.
Статья, откуда взяты цитаты выше: https://quillette.com/2026/03/27/ai-is-not-about-to-become-sentient-moltbook-openclaw/
Ну и чисто практическая ссылка ;) про анализ кода с помощью Claude Code: https://specterops.io/blog/2026/03/26/leveling-up-secure-code-reviews-with-claude-code/
#ии
Quillette
AI Is Not About To Become Sentient
Most of today’s “artificial intelligence” is better described as artificial autocomplete than artificial mind.
👍3
Китайцы провели интересное исследование, в результате которого сумели улучшить вывод маленькой модели с 7 миллиардами параметров настолько, что она превзошла гораздо более обьёмные модели (в 4 раза больше параметров). Добились они этого за счёт оригинального механизма памяти. Если совсем кратко, то они в противовес традиционному подходу с RAG предлагают хранить не просто данные, а стратегии вывода - эдакие дорожные карты: не что искать, а как искать. Предлагается хранить не только "хорошие" стратегии, но и плохие - когда вывод некорректен. Таким образом, аккумулируя эти стратегии, модель обучается мыслить всё более и более качественно и корректно.
Почему это очень важно? Потому что какой-нибудь Claude, к сожалению, не лежит в кармане и всегда хочется крутых результатов на локальных моделях с как можно меньшим числом параметров.
Мой глаз зацепился за эту работу, потому что мы у себя в ходе экспериментов и
размышлений в одном из проектов пришли к чему-то подобному.
А вот и сама работа: https://arxiv.org/pdf/2604.04503
#ии #почитать
Почему это очень важно? Потому что какой-нибудь Claude, к сожалению, не лежит в кармане и всегда хочется крутых результатов на локальных моделях с как можно меньшим числом параметров.
Мой глаз зацепился за эту работу, потому что мы у себя в ходе экспериментов и
размышлений в одном из проектов пришли к чему-то подобному.
А вот и сама работа: https://arxiv.org/pdf/2604.04503
#ии #почитать
🔥3
Неделя прикладной кибербезорасности стартовала в НИЯУ МИФИ сегодня. Кто не успел зарегистрироваться, можно это сделать, написав на почту cryptofox@mephi.ru с темой "Регистрация. Неделя кибербезопасности". В письме нужно указать ФИО, телефон, ВУЗ/место работы.
Cyberfox-Week
Неделя кибербезопасности
Неделя кибербезопасности в мифи
Интересное использование LLM не для непосредственно нахождения багов, а для генерации тестовых наборов для фаззинга.
Цитата:
#фаззинг #ии #почитать #уязвимости
Цитата:
Агент изучил незнакомый код, нашел точную строку, в которой незаметно происходит сбой при определении типа, создал тестовый стенд, который действительно мог бы пройти по этому пути при правильной структуре входных данных, скомпилировал все с нужными санитайзерами и запустил фаззер. Никаких подсказок, никаких предварительных знаний о Brotli. Вся цепочка должна была сработать, и она сработала.
#фаззинг #ии #почитать #уязвимости
Workers IO
Finding a Bug in Google's Brotli Using Our Fuzzing Skill
We built a fuzzing skill for Claude, pointed it at Google's Brotli, and watched it find a real correctness bug — autonomously, We reported it. It got fixed.
👍1
Свежайшая и интересная работа про построение.обвязки для эффективного поиска уязвимостей. Так, например, нашли CVE-2026-5280 и CVE-2026-6297. В этом контексте упоминается LLM с открытыми весами Kimi K2.5. Именно с её использованием были найдены 8 уязвимостей в Google Chrome, включая 2 вышеозначенных критических (побег из песочницы). Автоматизируется весь процесс исследования: от гипотез до генерации эксплоита. Сам подход, который авторы назвали AgentFlow, достаточно общий и может использоваться много для чего.
#почитать #ии #уязвимости
#почитать #ии #уязвимости
arXiv.org
Synthesizing Multi-Agent Harnesses for Vulnerability Discovery
LLM agents have begun to find real security vulnerabilities that human auditors and automated fuzzers missed for decades, in source-available targets where the analyst can build and instrument the...
👍3
А меж тем вышел DeepSeek-V4-Pro с контекстом в миллион токенов с 10% KV-кэша и 27% inference FLOPs по сравнению v3.2. Это означает относительно дешёвую генерацию, которая дрстигается за счёт гибридного механизма внимания Очень хорошая новость. Пишут, работает на уровне топовых проприетарных моделей.
Технический отчёт: https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf
Веса: https://huggingface.co/collections/deepseek-ai/deepseek-v4
#ии
Технический отчёт: https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf
Веса: https://huggingface.co/collections/deepseek-ai/deepseek-v4
#ии
🔥1
Многие пытаются автоматизировать реверс-инжиниринг с помощью LLM. У многих получается. Очень часто в основе таких проектов лежит одно волшебное слово: Claude. Иногда встречаются другие волшебные слова, но все они про облачные модели, которые недёшевы, плюс, данные утекают, плюс, могут в любой момент забанить. А вот с моделями поменьше экспериментируют гораздо реже: это подольше и посложнее. Однако у нас вполне себе получается делать это с использованием локальной агентской системы.
Вот, к примеру, как выглядит результат полностью автоматического реверс-инжиниринга без запуска на исполнение одного wiper-а (привожу частично, потому что там много).
А вот downloader:
Подчеркну, что речь идёт о скомпилированных файлах - бинарях. Тех самых exe, dll и т.д. Проект нами активно развивается, используется для внутренних нужд, уже экономя силы и время аналитиков, и обязательно станет частью нашей платформы для анализа файлов Рекрипториум. Для тех, кто приобретает её сейчас, будет хорошая скидка! Обращайтесь: recryptorium@re-crypt.com или re-crypt@soft-prom.ru
#ии #реверсинг #рекрипториум
Вот, к примеру, как выглядит результат полностью автоматического реверс-инжиниринга без запуска на исполнение одного wiper-а (привожу частично, потому что там много).
**Step-by-step actions (non-technical)**
1. **Launch** - You run the program.
2. **Hidden checks** - The program quietly checks whether you are running a debugger or a virtual
machine. If it detects one, it stops right away.
3. **Disk wipe** - It opens the raw disk device (`\\.\PhysicalDrive0`) and writes a block of zeros
over the first ~7.5 GB of the drive.
4. **File flood** - It creates 256 files named `file0.bin` ... `file255.bin`, each 5 MiB of zeros,
filling the disk with useless data.
5. **Thread acceleration** - While the wipe and flood are happening, it spawns many worker threads
to speed up the process.
6. **Abort** - After finishing the destructive work, it throws a managed exception that terminates
the program with a "SecurityException" message.
...
### Supporting Evidence
1. **Direct raw-disk destruction** - The binary writes zeros to the physical drive, a classic
sabotage technique (T1485).
2. **Massive file flooding** - Creates hundreds of large empty files, saturating disk space and
causing I/O contention.
3. **Anti-debug and obfuscation** - Multiple anti-debug checks and dynamic API resolution indicate a
deliberate attempt to evade analysis.
4. **Registry hive deletion capabilities** - Functions that delete entire registry hives are
present, even if not invoked in the current flow.
...
А вот downloader:
**Step-by-step actions (non-technical)**
1. **Starts silently** - no window or dialog appears.
2. **Downloads a file** using Windows' built-in `certutil` tool (the program builds a command line
that looks like a normal download request).
3. **Runs a VBScript** that is stored in `C:\ProgramData`.
4. **Pauses for 60 seconds** (a deliberate delay to avoid quick detection).
5. **Launches several executables** (`Crydasjd.exe`, `qq.sys`, `qq1.exe`, and three files that look
like logs but are actually programs).
6. **Repeats the pause** after each launch.
7. **Ends** - the program itself does not stay resident; it simply exits after starting the last
file.
...
### Supporting evidence
- **Downloader behavior** (`certutil` + `WinExec`) - classic dropper technique.
- **Execution of multiple external binaries** (including a driver) - indicates a multi-stage attack.
- **File-extension spoofing** (`.log` files executed as binaries).
- **Anti-analysis delays** (60-second sleeps).
Подчеркну, что речь идёт о скомпилированных файлах - бинарях. Тех самых exe, dll и т.д. Проект нами активно развивается, используется для внутренних нужд, уже экономя силы и время аналитиков, и обязательно станет частью нашей платформы для анализа файлов Рекрипториум. Для тех, кто приобретает её сейчас, будет хорошая скидка! Обращайтесь: recryptorium@re-crypt.com или re-crypt@soft-prom.ru
#ии #реверсинг #рекрипториум
👍6
Наша компания Рекрипт получила лицензии ФСТЭК на деятельность по разработке и производству средств защиты конфиденциальной информации (СЗКИ) и деятельность по технической защите конфиденциальной информации (ТЗКИ). Отлично!
🔥12👍8
Свежая, подробная и очень интересная статья про поиск уязвимостей с помощью ИИ. Уже практически традиционно стало использование Claude, но это далеко не главное. Это один из тех примеров, которые наглядно доказывают, что ИИ не замещает работу эксперта, а помогает ему делать свою работу эффективнее. Это ещё один инструмент автоматизации.
Цитата:
#почитать #ии #уязвимости
Цитата:
С изобретением автомобиля люди не перестали ходить в походы. Автомобили позволили им добираться до более интересных мест.Что было сделано, если совсем кратко? LLM-ке скормили набор навыков и старых эксплойтов для механизма сериализации PHP. Дали стратегию. Claude разработал новые эксплойты. Ну а подробности в статье ;)
#почитать #ии #уязвимости
blog.calif.io
MAD Bugs: Finding and Exploiting a 21-Year-Old Vulnerability in PHP
When this bug shipped, the dinosaurs had just gone extinct, only 64.999979 million years prior.
👍2
Коллеги по отрасли из некоторых известных компаний, хочу к вам обратиться. Если вы хотите с нами посотрудничать по Рекрипториуму или по другим вопросам, то для этого есть, например, такая почта: recryptorium@re-crypt.com. Можно написать сюда: contact@re-crypt.com. Можно просто мне написать: schelkunov@re-crypt.com. Да и другие наши контакты у вас есть, мы знаем. Все контакты доступны. Мы всегда открыты для конструктивного взаимодействия в любом формате. Но заходы на технических специалистов (мы пробили контакт, конечно) а-ля "Вы из Рекрипта? А что Вы можете нам предложить?" попахивают ... нехорошо. Не надо так делать ;) Спишем это на чрезмерное рвение отдельного человека.
👍2
Media is too big
VIEW IN TELEGRAM
Запись моей онлайн-лекции на Неделе прикладной безопасности в МИФИ о нелёгком процессе сбора и разметки данных для обучения моделей ИИ на примере создания датасетов для обучения ИИ-классификаторов Рекрипториума.
#ии #рекрипториум
#ии #рекрипториум
🔥7❤1
Коллеги задали вопрос: "А почему бы не взять крутую нейронку, скормить ей много PE-файлов без предобработки? Она сама научится выделять признаки, а значит - классифицировать. Profit!" Идея не нова, многие пытались. Вот, к примеру, за счёт использования свёрточных нейронных сетей.
Есть, и тоже довольно давно, подходы, использующие трансформеры. Красиво, академично, хорошие метрики. Всё хорошо, но в жизни не работает :) Дело в том, что PE-файлы (как и ELF) - это структурированные данные. В одном файле лежат и скомпилированный код, и данные, и разнообразная служебная информация для загрузчика. Это совершенно разные типы данных, которые раскиданы по файлу. Их местоположение определяется служебными структурами заголовка в виде, как правило, смещений, а также смысловой нагрузкой в коде. Например, для ряда популярных компиляторов данные в кодовой секции являются нормой. Ну а вызов API-функций из кода - это прыжок по адресу в IAT, который был настроен загрузчиком файла при обработке IAT. Ещё есть TLS callbacks, таблицы релокаций, ресурсы (вообще отдельная история), authenticode, текстовые данные и много всего. Их порядок следования не определён. Это всё разные типы данных, которые, если нужен хороший результат, должны отдельно обрабатываться. Это, в сущности, тот же самый супер-популярный агентский подход - когда для разных данных разные инструменты формируют нужный вход для модели. Мы же все видим, какой буст агентский подход даёт обычным LLM. С анализом бинарей то же самое. Ну а всё-таки что там с трансформерами? Они есть в Рекрипториуме, как один из инструментов.
#рекрипториум #ии
Есть, и тоже довольно давно, подходы, использующие трансформеры. Красиво, академично, хорошие метрики. Всё хорошо, но в жизни не работает :) Дело в том, что PE-файлы (как и ELF) - это структурированные данные. В одном файле лежат и скомпилированный код, и данные, и разнообразная служебная информация для загрузчика. Это совершенно разные типы данных, которые раскиданы по файлу. Их местоположение определяется служебными структурами заголовка в виде, как правило, смещений, а также смысловой нагрузкой в коде. Например, для ряда популярных компиляторов данные в кодовой секции являются нормой. Ну а вызов API-функций из кода - это прыжок по адресу в IAT, который был настроен загрузчиком файла при обработке IAT. Ещё есть TLS callbacks, таблицы релокаций, ресурсы (вообще отдельная история), authenticode, текстовые данные и много всего. Их порядок следования не определён. Это всё разные типы данных, которые, если нужен хороший результат, должны отдельно обрабатываться. Это, в сущности, тот же самый супер-популярный агентский подход - когда для разных данных разные инструменты формируют нужный вход для модели. Мы же все видим, какой буст агентский подход даёт обычным LLM. С анализом бинарей то же самое. Ну а всё-таки что там с трансформерами? Они есть в Рекрипториуме, как один из инструментов.
#рекрипториум #ии
Emergentmind
MalConv Architecture: Byte-Level Malware Detection
MalConv is a neural network architecture that directly detects malware from raw byte sequences using gated convolution and attention for efficient processing of large executables.
👍2🔥1
Долго не писали в канале: готовили свежий и довольно большой релиз Рекрипториума. Там масса нововведений. Перечислим самые значимые:
1. Добавлена интеграция с Kaspersky Secure Mail Gateway (KSMG). Теперь Рекрипориум работает с KSMG из коробки.
2. Обновлены модели ИИ для анализа PE-файлов: повышено качество анализа, существенно увеличена скорость. Обученные нами трансформеры там тоже есть ;)
3. Обновлены модели ИИ для быстрого анализа скриптов Python, PHP, JS, PowerShell. И здесь тоже есть обученные нами трансформеры ;)
4. UI стал удобнее и функциональнее.
5. Улучшен анализ архивов, включая архивы с паролями.
6. Добавлена поддержка ICAP.
7. Добавлена поддержка Syslog.
8. Оптимизирована LLM: автореверсинг скриптов стал быстрее и качественнее.
9. Оптимизации в движках для увеличения скорости анализа и экономии ресурсов.
И много чего ещё "по мелочи".
Спасибо всем тем, кто использует Рекрипториум и даёт обратную связь! Это позволяет нам постоянно улучшать наш продукт! В течение следующей недели обновления будут доступны для всех пользователей, включая пилотные стенды. А дальше будет ещё круче!
Присоединяйтесь ;)
По вопросам тестовой эксплуатации, стоимости и приобретения обращайтесь по адресу recryptorium@re-crypt.com
или re-crypt@soft-prom.ru
#рекрипториум #ии
1. Добавлена интеграция с Kaspersky Secure Mail Gateway (KSMG). Теперь Рекрипориум работает с KSMG из коробки.
2. Обновлены модели ИИ для анализа PE-файлов: повышено качество анализа, существенно увеличена скорость. Обученные нами трансформеры там тоже есть ;)
3. Обновлены модели ИИ для быстрого анализа скриптов Python, PHP, JS, PowerShell. И здесь тоже есть обученные нами трансформеры ;)
4. UI стал удобнее и функциональнее.
5. Улучшен анализ архивов, включая архивы с паролями.
6. Добавлена поддержка ICAP.
7. Добавлена поддержка Syslog.
8. Оптимизирована LLM: автореверсинг скриптов стал быстрее и качественнее.
9. Оптимизации в движках для увеличения скорости анализа и экономии ресурсов.
И много чего ещё "по мелочи".
Спасибо всем тем, кто использует Рекрипториум и даёт обратную связь! Это позволяет нам постоянно улучшать наш продукт! В течение следующей недели обновления будут доступны для всех пользователей, включая пилотные стенды. А дальше будет ещё круче!
Присоединяйтесь ;)
По вопросам тестовой эксплуатации, стоимости и приобретения обращайтесь по адресу recryptorium@re-crypt.com
или re-crypt@soft-prom.ru
#рекрипториум #ии
🔥8
В сети ходит своеобразный bypass LLM-анализа вредоносов. Пишут, LLM парсит такой вредонос, натыкается на упоминание о ядерном оружии, включает цензуру, и дальше скрипт не парсит. Наши эксперименты с нашей локальной LLM из Рекрипториума этого не подтверждают. Вредоносы прекрасно и эффективно обнаруживаются с комментариями, без комментариев, с обфускацией, без обфускации, любого размера.
На самом деле нельзя просто взять LLM из паблика, и поставить в конвейер. Чтобы не было таких эффектов, надо изрядно потрудиться
#ии #рекрипториум
На самом деле нельзя просто взять LLM из паблика, и поставить в конвейер. Чтобы не было таких эффектов, надо изрядно потрудиться
#ии #рекрипториум
👍3
Отличный и регулярно пополняемый архив со статьями по поиску уязвимостей с помощью LLM. Для некоторых статей есть ссылки на исходники. В общем, налетай ;)
#ии #почитать #уязвимости
#ии #почитать #уязвимости
GitHub
GitHub - huhusmang/Awesome-LLMs-for-Vulnerability-Detection: The community's most comprehensive, continuously-updated index of…
The community's most comprehensive, continuously-updated index of research on Large Language Models for software vulnerability detection — papers across function-level, repository-level, ag...
👍3
Работе про Model Collapse уже 2 года, что довольно много по нынешним временам, но тем интереснее её читать и ретроспективно оценивать, насколько точными оказались прогнозы.
Смысл статьи в том, что, когда новые модели обучаются на данных, сгенерированных моделями предыдущих итераций (т.е. синтетики всё больше и больше), качество вывода этих новых моделей падает. Рисунок с функциями плотности распределения вероятности, вырезанный из статьи, это отражает визуально. Мы видим, как в процессе обучения отрезаются "хвосты" с небольшими вероятностями. Это естественный эффект машинного обучения. На следующей итерации отрежутся свои "хвосты" и т.д. В итоге модель разучится генерировать действительно ценные и не банальные ответы. Плюс, синтетика может привнести некоторую долю не совсем достоверной информации из-за галлюцинаций, что также отрицательно скажется на качестве генерации. Некоторые белковые бредогенераторы, подхватив темку в лучших традициях инфоцыганства, начали извергать килотонны текста про статистических попугаев, которых кормят собственным помётом, про переработку пластика обратно в нефть и прочее подобное. В общем, волна хайпа на фоне этой простой и банальной в общем то работы была подхвачена хайпожорами и начала раскручиваться, обрастая словесной эквилибристикой.
Однако коллапса, как мы видим, не случилось. Напротив, за 2 года мы наблюдаем заметное улучшение качества вывода. Это результат комплексного подхода к решению проблемы: качественная разметка, детерминированные алгоритмы для верификации (здесь мы вспоминаем термин "упряжь"), выявление синтетики и сокращение её доли в обучении и т.п. Человек, как показывает практика, вносит свой вклад в сгенерированные данные (программисты это хорошо понимают), а значит, данные не полностью синтетические, а, скорее, гибридные. Т.е. в пределе, да, "коллапс модели" возможен и математически вполне объясним, но только если ничего по этому поводу не делать. А так не бывает никогда. Именно поэтому мы наблюдаем обратный эффект: повышение качества генерации.
Ссылка на ту самую статью: https://arxiv.org/pdf/2305.17493
Ну а инфоцыган и экспертов по всему вы и так все хорошо знаете ;)
#ии
Смысл статьи в том, что, когда новые модели обучаются на данных, сгенерированных моделями предыдущих итераций (т.е. синтетики всё больше и больше), качество вывода этих новых моделей падает. Рисунок с функциями плотности распределения вероятности, вырезанный из статьи, это отражает визуально. Мы видим, как в процессе обучения отрезаются "хвосты" с небольшими вероятностями. Это естественный эффект машинного обучения. На следующей итерации отрежутся свои "хвосты" и т.д. В итоге модель разучится генерировать действительно ценные и не банальные ответы. Плюс, синтетика может привнести некоторую долю не совсем достоверной информации из-за галлюцинаций, что также отрицательно скажется на качестве генерации. Некоторые белковые бредогенераторы, подхватив темку в лучших традициях инфоцыганства, начали извергать килотонны текста про статистических попугаев, которых кормят собственным помётом, про переработку пластика обратно в нефть и прочее подобное. В общем, волна хайпа на фоне этой простой и банальной в общем то работы была подхвачена хайпожорами и начала раскручиваться, обрастая словесной эквилибристикой.
Однако коллапса, как мы видим, не случилось. Напротив, за 2 года мы наблюдаем заметное улучшение качества вывода. Это результат комплексного подхода к решению проблемы: качественная разметка, детерминированные алгоритмы для верификации (здесь мы вспоминаем термин "упряжь"), выявление синтетики и сокращение её доли в обучении и т.п. Человек, как показывает практика, вносит свой вклад в сгенерированные данные (программисты это хорошо понимают), а значит, данные не полностью синтетические, а, скорее, гибридные. Т.е. в пределе, да, "коллапс модели" возможен и математически вполне объясним, но только если ничего по этому поводу не делать. А так не бывает никогда. Именно поэтому мы наблюдаем обратный эффект: повышение качества генерации.
Ссылка на ту самую статью: https://arxiv.org/pdf/2305.17493
Ну а инфоцыган и экспертов по всему вы и так все хорошо знаете ;)
#ии
👍2