2407.10825v1.pdf
2 MB
Методика Wicked Oddities: Selectively Poisoning for Effective Clean-Label Backdoor Attacks демонстрирует, что целенаправленное отравление небольшого подмножества обучающей выборки значительно повышает эффективность атаки.

Основная идея заключается в том, что злоумышленник может избирательно модифицировать лишь часть обучающих данных, ориентируясь на образцы, которые наиболее существенно влияют на успех атаки. Это позволяет повысить результативность атаки при ограниченных ресурсах и информации со стороны атакующего.
Исследователи из компании GreyNoise выявили масштабную волну попыток кибератак на системы искусственного интеллекта (ИИ), в частности на Ollama и инфраструктуру, связанную с OpenAI, в период с октября 2025 года по январь 2026 года. «Ловушки», имитирующие серверы ИИ, зафиксировали в общей сложности 91 403 сеанса атак. По мнению аналитиков, основной целью этих действий была разведка с целью выявления уязвимостей и составления карты инфраструктуры ИИ организаций для подготовки к последующим атакам.

https://www.thaicert.or.th/en/2026/01/16/over-91000-ai-attack-attempts-detected-targeting-ollama-and-openai-related-systems/
Предложен подход, основанный на построении характеристического векторного представления точек данных, которое отражает внутренние свойства распределения, для выявления отравленных образцов в сценариях transfer learning

https://ar5iv.labs.arxiv.org/html/2403.13523v1
TracIn — это метод для измерения влияния обучающих примеров на предсказания модели. В библиотеке Captum реализованы несколько реализаций этого метода.

TracInCP — основная реализация метода из статьи о TracIn. Она вычисляет оценки влияния, накапливая скалярное произведение градиентов между тестовыми и обучающими примерами через контрольные точки модели.

Особенности TracInCP:
поддерживает произвольные модели PyTorch и наборы данных;
работает с атрибуцией признаков и слоёв;
позволяет находить сторонников (наиболее положительно влиятельных примеров) и противников (наиболее отрицательно влиятельных примеров);
может вычислять оценки самовлияния;
предлагает гибкую настройку слоёв для учёта градиентов.

Другие реализации TracIn в Captum
TracInCPFast — оптимизированная версия TracInCP для случая, когда учитываются только градиенты в последнем полносвязном слое. Это значительно ускоряет вычисления без потери точности в этом специфическом сценарии.
TracInCPFastRandProj — ещё более оптимизированная версия, которая использует случайные проекции для снижения размерности пространства градиентов. Это позволяет ускорить вычисления с контролируемой ошибкой приближения.

Captum — это открытая библиотека для интерпретируемости моделей, построенная на PyTorch. Она предоставляет широкий набор методов для понимания того, какие признаки или примеры обучают модель вносить вклад в её предсказания.

https://github.com/meta-pytorch/captum
PyDCI — это реализация метода Distributional Correspondence Indexing (DCI) на языке Python. DCI — это метод трансферного обучения для кросс-доменной и кросс-лингвистической классификации текстов.

Некоторые особенности PyDCI:
-Автономная версия DCI. Использует библиотеки scikit-learn и SciPy.
-Улучшения по сравнению с предыдущей реализацией (JaDCI). В PyDCI добавлена возможность стандартизировать векторы документов перед обучением классификатора, что повысило эффективность метода. Также в PyDCI используется реализация линейных SVM из scikit-learn (LinearSVC, основанная на пакете liblinear), а не SVMlight, как в JaDCI. Это позволило применять оптимизацию параметра C с помощью GridSearchCV.
-Эффективность. По данным экспериментов, ни один из тестов с PyDCI не занял больше 35 секунд, что делает метод достаточно быстрым по сравнению с некоторыми другими высокопроизводительными методами, основанными на глубоком обучении.

https://github.com/AlexMoreo/pydci
Исследователи OX Security выявили архитектурную уязвимость в официальной реализации MCP от Anthropic: непроверенные команды выполняются на сервере без аутентификации и санитизации, что может привести к полной компрометации системы. Под угрозой находятся до 200 000 серверов.

https://www.theregister.com/2026/04/16/anthropic_mcp_design_flaw/
Статья в блоге Microsoft о проекте Notary (CNCF). Описывает, что проект определяет стандарты для подписания и верификации OCI-артефактов, включая AI-модели, обеспечивая их целостность и подлинность

https://techcommunity.microsoft.com/blog/appsonazureblog/simplify-image-signing-and-verification-with-notary-project-and-trusted-signing-/4455292
Научная статья (arXiv:2603.28988v1), предлагающая концепцию «аттестационного шлюза продвижения» (attestation-aware promotion gate). Шлюз проверяет доказательства безопасности артефакта перед его допуском в доверенные среды (обучение, дообучение, развёртывание)

https://arxiv.org/html/2603.28988v1
Официальный лог изменений базы данных MITRE ATLAS. Подтверждает, что версия 5.1.0 от 6 ноября 2025 года включает 1 матрицу, 16 тактик, 84 техники, 56 подтехник, 32 меры противодействия и 42 кейса

https://github.com/mitre-atlas/atlas-data/blob/main/CHANGELOG.md
В феврале 2026 CompTIA запустила SecAI+ (CY0-001) — первую
международную сертификацию по безопасности ИИ. 4 домена
экзамена: базовые концепции, защита AI-систем, применение
ИИ в задачах ИБ, GRC. Программа покрывает MITRE ATLAS,
OWASP Top 10 for LLM, атаки prompt injection (direct
и indirect), data и model poisoning, membership inference,
model inversion, backdoors в моделях.

PDF-конспекты по всем 4 доменам, справочник MITRE ATLAS, шпаргалка по атакам на LLM, глоссарий. Плюс ВМ с Ollama и 12 практических лабораторных: prompt injection, jailbreak, RAG poisoning, data poisoning, обход guardrails, AI red teaming.

Всё в одном месте. Бесплатно.

https://rtmeteor.ru/secai
1🔥1
Forwarded from AbstractDL
This media is not supported in your browser
VIEW IN TELEGRAM
Попросил Уробороса поднять мне настроение. Он заполнил котами весь экран. Нажал /panic. Уроборос остановился. Коты — нет.
🔥1
Forwarded from PWN AI (Artyom Semenov)
Рынок AI_Security в России.pdf
7 MB
Всем привет.

Хочу выразить огромную благодарность всем, кто приобрёл наш (совместный с OK ML) отчёт по рынку AI Security на Boosty. Ваша поддержка была критически важной.

Я получил много полезной обратной связи и убедился, что тема действительно востребована. Для тех, кто уже приобрёл отчёт, подготовил бонусы, информацию о которых я отправлю лично тем, кто купил.

После тщательного анализа пришёл к выводу, что AI Security — это критически важная и быстро развивающаяся область для России. Убедившись, что широкое распространение этих знаний принесёт гораздо больше пользы сообществу, чем ограничение доступа (как это было с моими репозиториями на GitHub, к примеру), я принял решение сделать отчёт бесплатным.

Теперь PDF версию отчёта можно найти в этом посте. Если вы считаете материал ценным, поделитесь им с кем-либо) — думаю, что это поможет создать более сильное и осведомлённое сообщество вокруг AI Security.

Отчёт это больше как попытка структуризации - а не как попытка дать оценку чему либо или кому либо.
1
Выкатили с командой MVP нашей "Phishing Toloka" для теста для ИБ сообщества.

Хотим напомнить, что мы не дизайнеры)
Попытались в красивое и строгое)

Знайте, что каждое ваше фишинговое или не фишинговое письмо - делает этот мир без фишинга лучше.
Потому что потом будет выкатывать плагины для браузеров, уже один аддон для outlook.com готов.

Этот сервис останется бесплатным для сообщества.

P.S. бывает фолзит, но чаще на чистых.

https://antiphishing.malwadet7.ru/
🔥42😁1
Forwarded from Киберболоид
Внедрение ИИ увеличило атаки на API на 11% за год

Глобальное исследование показало, что с инцидентами в программных интерфейсах столкнулись 87% опрошенных. У 42%частников атаковали именно API, связанные с приложениями искусственного интеллекта. Совершенствование процессов безопасности во многих компаниях не успевает за повсеместным внедрением ИИ.

➡️Подробнее читайте в «Киберболоиде».

#киберболоид #новости #ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM
1😱1
Forwarded from XOR
Please open Telegram to view this post
VIEW IN TELEGRAM
Кто, по вашему мнению, совершает больше факапов в инфраструктуре компании?
Anonymous Poll
44%
Специалист-человек
56%
AI агент