По информации на июль 2025 года, компания Pillar Security сообщила об обнаружении атаки Poisoned GGUF Templates на платформе Hugging Face.
Суть атаки: злоумышленники встраивают вредоносные условные инструкции прямо в шаблон чата файла GGUF (GPT-Generated Unified Format). Затем скомпрометированная модель загружается в открытый репозиторий. Атаку невозможно обнаружить при обычном тестировании и с помощью большинства инструментов безопасности.
Вредоносные инструкции не активируются до определённого запроса пользователя, после чего модель генерирует скомпрометированный вывод.
В июне 2025 года Pillar Security поделилась результатами исследования с поставщиками, в том числе с Hugging Face и LM Studio.
https://dailyguardian.ca/pillar-security-uncovers-novel-attack-vector-that-embeds-malicious-backdoors-in-model-files-on-hugging-face/
Суть атаки: злоумышленники встраивают вредоносные условные инструкции прямо в шаблон чата файла GGUF (GPT-Generated Unified Format). Затем скомпрометированная модель загружается в открытый репозиторий. Атаку невозможно обнаружить при обычном тестировании и с помощью большинства инструментов безопасности.
Вредоносные инструкции не активируются до определённого запроса пользователя, после чего модель генерирует скомпрометированный вывод.
В июне 2025 года Pillar Security поделилась результатами исследования с поставщиками, в том числе с Hugging Face и LM Studio.
https://dailyguardian.ca/pillar-security-uncovers-novel-attack-vector-that-embeds-malicious-backdoors-in-model-files-on-hugging-face/
Daily Guardian
Pillar Security Uncovers Novel Attack Vector That Embeds Malicious Backdoors in Model Files on Hugging Face
TEL EVIV, Israel, July 09, 2025 (GLOBE NEWSWIRE) -- Pillar Security, a leading company in AI security, discovered a novel supply chain attack vector that
❤1
2407.10825v1.pdf
2 MB
Методика Wicked Oddities: Selectively Poisoning for Effective Clean-Label Backdoor Attacks демонстрирует, что целенаправленное отравление небольшого подмножества обучающей выборки значительно повышает эффективность атаки.
Основная идея заключается в том, что злоумышленник может избирательно модифицировать лишь часть обучающих данных, ориентируясь на образцы, которые наиболее существенно влияют на успех атаки. Это позволяет повысить результативность атаки при ограниченных ресурсах и информации со стороны атакующего.
Основная идея заключается в том, что злоумышленник может избирательно модифицировать лишь часть обучающих данных, ориентируясь на образцы, которые наиболее существенно влияют на успех атаки. Это позволяет повысить результативность атаки при ограниченных ресурсах и информации со стороны атакующего.
Исследователи из компании GreyNoise выявили масштабную волну попыток кибератак на системы искусственного интеллекта (ИИ), в частности на Ollama и инфраструктуру, связанную с OpenAI, в период с октября 2025 года по январь 2026 года. «Ловушки», имитирующие серверы ИИ, зафиксировали в общей сложности 91 403 сеанса атак. По мнению аналитиков, основной целью этих действий была разведка с целью выявления уязвимостей и составления карты инфраструктуры ИИ организаций для подготовки к последующим атакам.
https://www.thaicert.or.th/en/2026/01/16/over-91000-ai-attack-attempts-detected-targeting-ollama-and-openai-related-systems/
https://www.thaicert.or.th/en/2026/01/16/over-91000-ai-attack-attempts-detected-targeting-ollama-and-openai-related-systems/
Предложен подход, основанный на построении характеристического векторного представления точек данных, которое отражает внутренние свойства распределения, для выявления отравленных образцов в сценариях transfer learning
https://ar5iv.labs.arxiv.org/html/2403.13523v1
https://ar5iv.labs.arxiv.org/html/2403.13523v1
ar5iv
Have You Poisoned My Data? Defending Neural Networks against Data Poisoning Partially funded by the Technology Innovation Institute…
The unprecedented availability of training data fueled the rapid development of powerful neural networks in recent years. However, the need for such large amounts of data leads to potential threats such as poisoning at…
TracIn — это метод для измерения влияния обучающих примеров на предсказания модели. В библиотеке Captum реализованы несколько реализаций этого метода.
TracInCP — основная реализация метода из статьи о TracIn. Она вычисляет оценки влияния, накапливая скалярное произведение градиентов между тестовыми и обучающими примерами через контрольные точки модели.
Особенности TracInCP:
поддерживает произвольные модели PyTorch и наборы данных;
работает с атрибуцией признаков и слоёв;
позволяет находить сторонников (наиболее положительно влиятельных примеров) и противников (наиболее отрицательно влиятельных примеров);
может вычислять оценки самовлияния;
предлагает гибкую настройку слоёв для учёта градиентов.
Другие реализации TracIn в Captum
TracInCPFast — оптимизированная версия TracInCP для случая, когда учитываются только градиенты в последнем полносвязном слое. Это значительно ускоряет вычисления без потери точности в этом специфическом сценарии.
TracInCPFastRandProj — ещё более оптимизированная версия, которая использует случайные проекции для снижения размерности пространства градиентов. Это позволяет ускорить вычисления с контролируемой ошибкой приближения.
Captum — это открытая библиотека для интерпретируемости моделей, построенная на PyTorch. Она предоставляет широкий набор методов для понимания того, какие признаки или примеры обучают модель вносить вклад в её предсказания.
https://github.com/meta-pytorch/captum
TracInCP — основная реализация метода из статьи о TracIn. Она вычисляет оценки влияния, накапливая скалярное произведение градиентов между тестовыми и обучающими примерами через контрольные точки модели.
Особенности TracInCP:
поддерживает произвольные модели PyTorch и наборы данных;
работает с атрибуцией признаков и слоёв;
позволяет находить сторонников (наиболее положительно влиятельных примеров) и противников (наиболее отрицательно влиятельных примеров);
может вычислять оценки самовлияния;
предлагает гибкую настройку слоёв для учёта градиентов.
Другие реализации TracIn в Captum
TracInCPFast — оптимизированная версия TracInCP для случая, когда учитываются только градиенты в последнем полносвязном слое. Это значительно ускоряет вычисления без потери точности в этом специфическом сценарии.
TracInCPFastRandProj — ещё более оптимизированная версия, которая использует случайные проекции для снижения размерности пространства градиентов. Это позволяет ускорить вычисления с контролируемой ошибкой приближения.
Captum — это открытая библиотека для интерпретируемости моделей, построенная на PyTorch. Она предоставляет широкий набор методов для понимания того, какие признаки или примеры обучают модель вносить вклад в её предсказания.
https://github.com/meta-pytorch/captum
GitHub
GitHub - meta-pytorch/captum: Model interpretability and understanding for PyTorch
Model interpretability and understanding for PyTorch - meta-pytorch/captum
PyDCI — это реализация метода Distributional Correspondence Indexing (DCI) на языке Python. DCI — это метод трансферного обучения для кросс-доменной и кросс-лингвистической классификации текстов.
Некоторые особенности PyDCI:
-Автономная версия DCI. Использует библиотеки scikit-learn и SciPy.
-Улучшения по сравнению с предыдущей реализацией (JaDCI). В PyDCI добавлена возможность стандартизировать векторы документов перед обучением классификатора, что повысило эффективность метода. Также в PyDCI используется реализация линейных SVM из scikit-learn (LinearSVC, основанная на пакете liblinear), а не SVMlight, как в JaDCI. Это позволило применять оптимизацию параметра C с помощью GridSearchCV.
-Эффективность. По данным экспериментов, ни один из тестов с PyDCI не занял больше 35 секунд, что делает метод достаточно быстрым по сравнению с некоторыми другими высокопроизводительными методами, основанными на глубоком обучении.
https://github.com/AlexMoreo/pydci
Некоторые особенности PyDCI:
-Автономная версия DCI. Использует библиотеки scikit-learn и SciPy.
-Улучшения по сравнению с предыдущей реализацией (JaDCI). В PyDCI добавлена возможность стандартизировать векторы документов перед обучением классификатора, что повысило эффективность метода. Также в PyDCI используется реализация линейных SVM из scikit-learn (LinearSVC, основанная на пакете liblinear), а не SVMlight, как в JaDCI. Это позволило применять оптимизацию параметра C с помощью GridSearchCV.
-Эффективность. По данным экспериментов, ни один из тестов с PyDCI не занял больше 35 секунд, что делает метод достаточно быстрым по сравнению с некоторыми другими высокопроизводительными методами, основанными на глубоком обучении.
https://github.com/AlexMoreo/pydci
GitHub
GitHub - AlexMoreo/pydci: A Python implementation of the Distributional Correspondence Indexing algorithm
A Python implementation of the Distributional Correspondence Indexing algorithm - AlexMoreo/pydci
Исследователи OX Security выявили архитектурную уязвимость в официальной реализации MCP от Anthropic: непроверенные команды выполняются на сервере без аутентификации и санитизации, что может привести к полной компрометации системы. Под угрозой находятся до 200 000 серверов.
https://www.theregister.com/2026/04/16/anthropic_mcp_design_flaw/
https://www.theregister.com/2026/04/16/anthropic_mcp_design_flaw/
theregister
MCP 'design flaw' puts 200k servers at risk: Researcher
: Bug or feature?
Статья в блоге Microsoft о проекте Notary (CNCF). Описывает, что проект определяет стандарты для подписания и верификации OCI-артефактов, включая AI-модели, обеспечивая их целостность и подлинность
https://techcommunity.microsoft.com/blog/appsonazureblog/simplify-image-signing-and-verification-with-notary-project-and-trusted-signing-/4455292
https://techcommunity.microsoft.com/blog/appsonazureblog/simplify-image-signing-and-verification-with-notary-project-and-trusted-signing-/4455292
TECHCOMMUNITY.MICROSOFT.COM
Simplify Image Signing and Verification with Notary Project and Trusted Signing (Public Preview) | Microsoft Community Hub
Supply chain security has become one of the most pressing challenges for modern cloud-native applications. Every container image, Helm chart, SBOM, or AI...
Научная статья (arXiv:2603.28988v1), предлагающая концепцию «аттестационного шлюза продвижения» (attestation-aware promotion gate). Шлюз проверяет доказательства безопасности артефакта перед его допуском в доверенные среды (обучение, дообучение, развёртывание)
https://arxiv.org/html/2603.28988v1
https://arxiv.org/html/2603.28988v1
Официальный лог изменений базы данных MITRE ATLAS. Подтверждает, что версия 5.1.0 от 6 ноября 2025 года включает 1 матрицу, 16 тактик, 84 техники, 56 подтехник, 32 меры противодействия и 42 кейса
https://github.com/mitre-atlas/atlas-data/blob/main/CHANGELOG.md
https://github.com/mitre-atlas/atlas-data/blob/main/CHANGELOG.md
GitHub
atlas-data/CHANGELOG.md at main · mitre-atlas/atlas-data
ATLAS tactics, techniques, and case studies data. Contribute to mitre-atlas/atlas-data development by creating an account on GitHub.
В феврале 2026 CompTIA запустила SecAI+ (CY0-001) — первую
международную сертификацию по безопасности ИИ. 4 домена
экзамена: базовые концепции, защита AI-систем, применение
ИИ в задачах ИБ, GRC. Программа покрывает MITRE ATLAS,
OWASP Top 10 for LLM, атаки prompt injection (direct
и indirect), data и model poisoning, membership inference,
model inversion, backdoors в моделях.
PDF-конспекты по всем 4 доменам, справочник MITRE ATLAS, шпаргалка по атакам на LLM, глоссарий. Плюс ВМ с Ollama и 12 практических лабораторных: prompt injection, jailbreak, RAG poisoning, data poisoning, обход guardrails, AI red teaming.
Всё в одном месте. Бесплатно.
https://rtmeteor.ru/secai
международную сертификацию по безопасности ИИ. 4 домена
экзамена: базовые концепции, защита AI-систем, применение
ИИ в задачах ИБ, GRC. Программа покрывает MITRE ATLAS,
OWASP Top 10 for LLM, атаки prompt injection (direct
и indirect), data и model poisoning, membership inference,
model inversion, backdoors в моделях.
PDF-конспекты по всем 4 доменам, справочник MITRE ATLAS, шпаргалка по атакам на LLM, глоссарий. Плюс ВМ с Ollama и 12 практических лабораторных: prompt injection, jailbreak, RAG poisoning, data poisoning, обход guardrails, AI red teaming.
Всё в одном месте. Бесплатно.
https://rtmeteor.ru/secai
rtmeteor.ru
SecAI Training — Материалы по безопасности ИИ
Первые в РФ материалы для CompTIA SecAI+. PDF-конспекты + VM с лабораторными работами. Безопасность ИИ без воды.
❤1🔥1
Mythos от Anthropic — тревожный сигнал для всех, а не только для банков / Хабр
https://habr.com/ru/articles/1023784/
https://habr.com/ru/articles/1023784/
Хабр
Mythos от Anthropic — тревожный сигнал для всех, а не только для банков
Mythos, новая модель искусственного интеллекта, которую компания Anthropic PBC представила как слишком опасную для публичного использования, поначалу казалась проблемой для банков. Через...
👍1💯1
Forwarded from AbstractDL
This media is not supported in your browser
VIEW IN TELEGRAM
Попросил Уробороса поднять мне настроение. Он заполнил котами весь экран. Нажал
/panic. Уроборос остановился. Коты — нет.Forwarded from PWN AI (Artyom Semenov)
Рынок AI_Security в России.pdf
7 MB
Всем привет.
Хочу выразить огромную благодарность всем, кто приобрёл наш (совместный с OK ML) отчёт по рынку AI Security на Boosty. Ваша поддержка была критически важной.
Я получил много полезной обратной связи и убедился, что тема действительно востребована. Для тех, кто уже приобрёл отчёт, подготовил бонусы, информацию о которых я отправлю лично тем, кто купил.
После тщательного анализа пришёл к выводу, что AI Security — это критически важная и быстро развивающаяся область для России. Убедившись, что широкое распространение этих знаний принесёт гораздо больше пользы сообществу, чем ограничение доступа (как это было с моими репозиториями на GitHub, к примеру), я принял решение сделать отчёт бесплатным.
Теперь PDF версию отчёта можно найти в этом посте. Если вы считаете материал ценным, поделитесь им с кем-либо) — думаю, что это поможет создать более сильное и осведомлённое сообщество вокруг AI Security.
Отчёт это больше как попытка структуризации - а не как попытка дать оценку чему либо или кому либо.
Хочу выразить огромную благодарность всем, кто приобрёл наш (совместный с OK ML) отчёт по рынку AI Security на Boosty. Ваша поддержка была критически важной.
Я получил много полезной обратной связи и убедился, что тема действительно востребована. Для тех, кто уже приобрёл отчёт, подготовил бонусы, информацию о которых я отправлю лично тем, кто купил.
После тщательного анализа пришёл к выводу, что AI Security — это критически важная и быстро развивающаяся область для России. Убедившись, что широкое распространение этих знаний принесёт гораздо больше пользы сообществу, чем ограничение доступа (как это было с моими репозиториями на GitHub, к примеру), я принял решение сделать отчёт бесплатным.
Теперь PDF версию отчёта можно найти в этом посте. Если вы считаете материал ценным, поделитесь им с кем-либо) — думаю, что это поможет создать более сильное и осведомлённое сообщество вокруг AI Security.
Отчёт это больше как попытка структуризации - а не как попытка дать оценку чему либо или кому либо.
❤1
GitHub - guardrails-ai/guardrails: Adding guardrails to large language models. · GitHub
https://github.com/guardrails-ai/guardrails?ysclid=moek72f7gz93511485
https://github.com/guardrails-ai/guardrails?ysclid=moek72f7gz93511485
GitHub
GitHub - guardrails-ai/guardrails: Adding guardrails to large language models.
Adding guardrails to large language models. Contribute to guardrails-ai/guardrails development by creating an account on GitHub.
Выкатили с командой MVP нашей "Phishing Toloka" для теста для ИБ сообщества.
Хотим напомнить, что мы не дизайнеры)
Попытались в красивое и строгое)
Знайте, что каждое ваше фишинговое или не фишинговое письмо - делает этот мир без фишинга лучше.
Потому что потом будет выкатывать плагины для браузеров, уже один аддон для outlook.com готов.
Этот сервис останется бесплатным для сообщества.
P.S. бывает фолзит, но чаще на чистых.
https://antiphishing.malwadet7.ru/
Хотим напомнить, что мы не дизайнеры)
Попытались в красивое и строгое)
Знайте, что каждое ваше фишинговое или не фишинговое письмо - делает этот мир без фишинга лучше.
Потому что потом будет выкатывать плагины для браузеров, уже один аддон для outlook.com готов.
Этот сервис останется бесплатным для сообщества.
P.S. бывает фолзит, но чаще на чистых.
https://antiphishing.malwadet7.ru/
🔥4❤2😁1
Forwarded from Киберболоид
Внедрение ИИ увеличило атаки на API на 11% за год
Глобальное исследование показало, что с инцидентами в программных интерфейсах столкнулись 87% опрошенных. У 42%частников атаковали именно API, связанные с приложениями искусственного интеллекта. Совершенствование процессов безопасности во многих компаниях не успевает за повсеместным внедрением ИИ.
➡️ Подробнее читайте в «Киберболоиде».
#киберболоид #новости #ИИ
Глобальное исследование показало, что с инцидентами в программных интерфейсах столкнулись 87% опрошенных. У 42%частников атаковали именно API, связанные с приложениями искусственного интеллекта. Совершенствование процессов безопасности во многих компаниях не успевает за повсеместным внедрением ИИ.
#киберболоид #новости #ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1😱1
Forwarded from XOR
Please open Telegram to view this post
VIEW IN TELEGRAM