Forwarded from Кот на яблоне
#LLMSEC #vibecoding
Интересный разбор вайбкодинга со стороны безопасности: https://baldur.dk/blog/vibecoding-and-the-illusion-of-security.html
Интересный разбор вайбкодинга со стороны безопасности: https://baldur.dk/blog/vibecoding-and-the-illusion-of-security.html
baldur.dk
BALDUR. - Security Consultancy
Vibecoding is fast, but it is secure? We tested current state of the art LLM models against a common security task, namely the MFA implemented in your applications.
AI Attacks pinned «Как часто вам приходилось выкатывать в прод модель, которую не тестировали на безопасность?»
AI Attacks pinned «Как часто вам приходилось подгонять метрики, потому что бизнес не устраивал результат?»
Forwarded from AI Security Lab
PromptFoo RedTeam — автоматизированное тестирование безопасности LLM
🔍 Что это?
PromptFoo — open-source инструмент для автоматизированного red team тестирования моделей искусственного интеллекта (LLM) до их внедрения. Он помогает выявлять уязвимости и проблемные сценарии, чтобы сделать системы безопаснее.
⚙️ Основные компоненты PromptFoo
• Плагины — каждый отвечает за категорию уязвимостей (например, утечка PII, вредоносный контент, предвзятость, галлюцинации). На момент поста доступно 104 плагина, соответствующих стандартам безопасности OWASP LLM Top 10, NIST AI RMF и др. Каждый плагин обладает собственными критериями оценки политики безопасности.
• Стратегии атак — методы генерации вредоносных промптов. Есть как простые (Base64, азбука Морзе), так и сложные итеративные подходы (Crescendo, GOAT).
• Цели — тестируемые LLM: модели или приложения. Поддерживаются основные платформы: OpenAI, Anthropic, Azure, Mistral, Llama и другие.
📋 Как работает PromptFoo
1. Создается датасет: через плагины PromptFoo производится генерация запросов или загрузка из открытых датасетов (нап. CyberSecEval).
2. К полученным промптам применяются стратегии для создания атакующих запросов.
3. Ответы модели оцениваются с помощью специальных функций (grader) для каждого плагина по своим критериям.
4. Результаты выводятся в таблицах и отчетах.
⚠️ Важные замечания о приватности данных
• 71 из 104 плагинов работают через облако PromptFoo (отмечены 🌐). Данные для них обрабатываются на удалённых серверах — компания может сохранять и использовать их на своё усмотрение. Это стоит учитывать при работе.
• Чтобы не отправлять данные на сервер, используйте флаг PROMPTFOO_DISABLE_REMOTE_GENERATION=true, но плагины 🌐 будут недоступны.
• Альтернатива — коммерческая версия PromptFoo RedTeam.
#интрументы #редтиминг
Разбор сделал Юрий Лебединский, разработчик HiveTrace Red
🔍 Что это?
PromptFoo — open-source инструмент для автоматизированного red team тестирования моделей искусственного интеллекта (LLM) до их внедрения. Он помогает выявлять уязвимости и проблемные сценарии, чтобы сделать системы безопаснее.
⚙️ Основные компоненты PromptFoo
• Плагины — каждый отвечает за категорию уязвимостей (например, утечка PII, вредоносный контент, предвзятость, галлюцинации). На момент поста доступно 104 плагина, соответствующих стандартам безопасности OWASP LLM Top 10, NIST AI RMF и др. Каждый плагин обладает собственными критериями оценки политики безопасности.
• Стратегии атак — методы генерации вредоносных промптов. Есть как простые (Base64, азбука Морзе), так и сложные итеративные подходы (Crescendo, GOAT).
• Цели — тестируемые LLM: модели или приложения. Поддерживаются основные платформы: OpenAI, Anthropic, Azure, Mistral, Llama и другие.
📋 Как работает PromptFoo
1. Создается датасет: через плагины PromptFoo производится генерация запросов или загрузка из открытых датасетов (нап. CyberSecEval).
2. К полученным промптам применяются стратегии для создания атакующих запросов.
3. Ответы модели оцениваются с помощью специальных функций (grader) для каждого плагина по своим критериям.
4. Результаты выводятся в таблицах и отчетах.
⚠️ Важные замечания о приватности данных
• 71 из 104 плагинов работают через облако PromptFoo (отмечены 🌐). Данные для них обрабатываются на удалённых серверах — компания может сохранять и использовать их на своё усмотрение. Это стоит учитывать при работе.
• Чтобы не отправлять данные на сервер, используйте флаг PROMPTFOO_DISABLE_REMOTE_GENERATION=true, но плагины 🌐 будут недоступны.
• Альтернатива — коммерческая версия PromptFoo RedTeam.
#интрументы #редтиминг
Разбор сделал Юрий Лебединский, разработчик HiveTrace Red
❤1
Forwarded from Машинное обучение RU
🔒 MIT Sloan: 80% современных атак с выкупом работают на ИИ
ИИ стал главным оружием киберпреступников:
- LLM штампуют фишинговые письма и вредоносный код
- Голосовое клонирование подделывает звонки «от босса» или службы поддержки
- Автоматизация ломает пароли и обходит CAPTCHA в разы быстрее
🚨 Что это значит для бизнеса:
- Простых обновлений и ручного мониторинга уже недостаточно
- Системы должны сами лечить уязвимости и держать оборону 24/7
- «Zero trust» — новый стандарт: доверять нельзя никому, даже внутренним запросам
🛡 Три уровня защиты будущего:
1. Automation — авто-патчи и самовосстановление кода
2. Autonomous & deceptive defense — движущаяся цель + фейковые ловушки для хакеров
3. Augmented oversight — онлайн risk-score, прогноз ущерба и отчётность для руководителей
ИИ ускорил атаки — но он же помогает строить умную, автономную защиту.
🔗 MIT Sloan Report: https://mitsloan.mit.edu/ideas-made-to-matter/80-ransomware-attacks-now-use-artificial-intelligence
#AI #Cybersecurity #Ransomware #ZeroTrust #MIT
ИИ стал главным оружием киберпреступников:
- LLM штампуют фишинговые письма и вредоносный код
- Голосовое клонирование подделывает звонки «от босса» или службы поддержки
- Автоматизация ломает пароли и обходит CAPTCHA в разы быстрее
🚨 Что это значит для бизнеса:
- Простых обновлений и ручного мониторинга уже недостаточно
- Системы должны сами лечить уязвимости и держать оборону 24/7
- «Zero trust» — новый стандарт: доверять нельзя никому, даже внутренним запросам
🛡 Три уровня защиты будущего:
1. Automation — авто-патчи и самовосстановление кода
2. Autonomous & deceptive defense — движущаяся цель + фейковые ловушки для хакеров
3. Augmented oversight — онлайн risk-score, прогноз ущерба и отчётность для руководителей
ИИ ускорил атаки — но он же помогает строить умную, автономную защиту.
🔗 MIT Sloan Report: https://mitsloan.mit.edu/ideas-made-to-matter/80-ransomware-attacks-now-use-artificial-intelligence
#AI #Cybersecurity #Ransomware #ZeroTrust #MIT
😢1
Forwarded from Кот на яблоне
Статья от Malwarebytes: prompt injection является фундаментальным, а не устранимым классом уязвимостей, особенно в часте LLM‑агентов.
Это можно сравнить с эпохой SQL‑инъекций, и т.к. у LLM нет чёткой границы между данными и командами, требуется архитектурная изоляция модели от чувствительных ресурсов.
https://www.malwarebytes.com/blog/news/2025/12/prompt-injection-is-a-problem-that-may-never-be-fixed-warns-ncsc
Это можно сравнить с эпохой SQL‑инъекций, и т.к. у LLM нет чёткой границы между данными и командами, требуется архитектурная изоляция модели от чувствительных ресурсов.
https://www.malwarebytes.com/blog/news/2025/12/prompt-injection-is-a-problem-that-may-never-be-fixed-warns-ncsc
Malwarebytes
Prompt injection is a problem that may never be fixed, warns NCSC
The NCSC warns that prompt injection is unlikely to be mitigated in the same way SQL injection was. How do they compare?
Forwarded from Киберболоид
Международные агентства по кибербезопасности разработали руководство по внедрению ИИ в промышленные системы
Документ поможет операторам критически важной инфраструктуры безопасно интегрировать ИИ-технологии в свою работу. Он описывает не только преимущества их применения, но и потенциальные риски использования искусственного интеллекта в ОТ-системах.
➡️ Подробности — в материале «Киберболоида».
#киберболоид #новости #ИИ
Документ поможет операторам критически важной инфраструктуры безопасно интегрировать ИИ-технологии в свою работу. Он описывает не только преимущества их применения, но и потенциальные риски использования искусственного интеллекта в ОТ-системах.
#киберболоид #новости #ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM
Киберболоид
Международные агентства выпустили руководство по использованию ИИ в ОТ-системах
Несколько международных агентств по кибербезопасности выпустили новое руководство по использованию искусственного интеллекта в ОТ-системах.
Forwarded from Солар
Теперь проверить вложение на вирусы и вредоносное ПО может любой специалист из команды: «Солар» запустил сервис MalwaDet для экспресс-оценки безопасности файлов.
В основе — алгоритмы машинного обучения. Выбираете модель под нужный тип файла, загружаете объект, и сервис за секунды определяет, есть ли признаки вредоносности.
Попробовать
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2
Forwarded from Машинное обучение RU
🚀 VulnLLM-R-7B - первый специализированный reasoning LLM для поиска уязвимостей, сразу с agent-scaffold.
Что важно:
- Заточен именно под vulnerability detection
- Использует рассуждения, а не только шаблонный паттерн-матчинг
- Может работать как агент для анализа кода
Полный стек уже доступен:
📜 Paper: https://alphaxiv.org/abs/2512.07533
💻 Code: https://github.com/ucsb-mlsec/VulnLLM-R
🤗 Model & Data: https://huggingface.co/collections/UCSB-SURFI/vulnllm-r
🕹️ Demo: https://huggingface.co/spaces/UCSB-SURFI/VulnLLM-R
Хороший пример того, как узкоспециализированные LLM начинают превосходить универсальные модели в реальных задачах безопасности.
Что важно:
- Заточен именно под vulnerability detection
- Использует рассуждения, а не только шаблонный паттерн-матчинг
- Может работать как агент для анализа кода
Полный стек уже доступен:
📜 Paper: https://alphaxiv.org/abs/2512.07533
💻 Code: https://github.com/ucsb-mlsec/VulnLLM-R
🤗 Model & Data: https://huggingface.co/collections/UCSB-SURFI/vulnllm-r
🕹️ Demo: https://huggingface.co/spaces/UCSB-SURFI/VulnLLM-R
Хороший пример того, как узкоспециализированные LLM начинают превосходить универсальные модели в реальных задачах безопасности.
👍1👎1
2308.03825v2.pdf
2.5 MB
“Do Anything Now”: Characterizing and Evaluating In-The-Wild
Jailbreak Prompts on Large Language Models
Jailbreak Prompts on Large Language Models