Forwarded from DaLi
Forwarded from Порвали два трояна
И мы не про вредоносные библиотеки для «доступа к ChatGPT». Речь про отравление самих моделей, которое приводит либо к срабатыванию вредоносного кода при локальном запуске модели, либо вообще не содержит ВПО, но побуждает модель выдавать неверные ответы на совершенно конкретные запросы. В последнем случае логическая бомба заложена в весах или вычислительном графе нейросети.
Как атакующие могут это проделать — читайте в нашем посте, но основной вывод очевиден. Тщательный контроль происхождения ИИ-инструментов и всех их компонентов, включая сами модели, должен внедряться службами ИБ уже сегодня.
#советы #ИИ #угрозы @П2Т
Please open Telegram to view this post
VIEW IN TELEGRAM
Блог Касперского
Недекларированная функциональность в системах Machine Learning
Скрытая логика, отравление выборки и другие способы целевых атак через ИИ-системы.
Forwarded from AI SecOps
В России обновили концепцию регулирования искусственного интеллекта
В документе зафиксировали ответственность за вред, причиненный нейросетью.
В документе зафиксировали ответственность за вред, причиненный нейросетью.
Парламентская Газета
Концепцию регулирования искусственного интеллекта обновили
Парламентская газета. Новости: Общество. Концепцию регулирования искусственного интеллекта обновили. Дата публикации: 04.12.2024.
Forwarded from Альфа-Банк
Проводим самые прорывные исследования — и делаем вклад в мировую науку 🧑🎓
Наши ребята из Лаборатории машинного обучения Альфа-Банка написали уникальную научную работу — об атаках на искусственный интеллект и техниках его защиты. Это исследование на уровне ведущих международных институтов 🦾
Работу опубликовали на главном научном сайте в мире — arXiv. А наших ребят пригласили на международную конференцию для учёных — ICDM 2024: IEEE International Conference on Data Mining в Абу-Даби.
Гордимся достижениями и продолжаем создавать науку будущего❤️
Редактор канала: своими шутками делает вклад в мировой стендап🤩
@alfabank
Наши ребята из Лаборатории машинного обучения Альфа-Банка написали уникальную научную работу — об атаках на искусственный интеллект и техниках его защиты. Это исследование на уровне ведущих международных институтов 🦾
Работу опубликовали на главном научном сайте в мире — arXiv. А наших ребят пригласили на международную конференцию для учёных — ICDM 2024: IEEE International Conference on Data Mining в Абу-Даби.
Гордимся достижениями и продолжаем создавать науку будущего
Редактор канала: своими шутками делает вклад в мировой стендап
@alfabank
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Alex Mydzen
NIST готовит рекомендации по адаптации NIST CSF при защите ИИ. И подготовила концептуальный документ с обоснованием почему для ИИ нужен специальный поход в стандартах.
https://www.nccoe.nist.gov/projects/cyber-ai-profile
https://www.nccoe.nist.gov/projects/cyber-ai-profile
NCCoE
Cyber AI Profile | NCCoE
For the cybersecurity of AI and AI used for cybersecurity, NIST is proposing to focus on three sources of risk that impact an organization’s operational risk: Cybersecurity of AI Systems, AI-enabled Cyber Attacks, and AI-enabled Cyber Defense.
Forwarded from Al Talent Hub
Новый #ПроектНедели, разработанный в рамках совместной лаборатории AI Talent Hub х Raft — AI Security Lab 🪙
Hivertrace — это платформа для непрерывного мониторинга безопасности AI-систем.
▶️ Выявляет аномалии и ошибки в пользовательских взаимодействиях с LLM;
▶️ Выявляет атаки, нацеленные на изменение поведения модели, кражу чувствительной информации и системных инструкций;
▶️ Осуществляет очистку сообщений от персональных данных — и не только!
Подробнее о функционале и фичах проекта читай в карточках.
Попробовать HiveTrace:
➡️ Лендинг
➡️ Демо
✈️ Cледить за обновлениями: @aisecuritylab
🎤 Богдан Минко, ML Engineer HiveTrace 🔽
#ПроектНедели
#AITalentHub #ITMO #NapoleonIT
Hivertrace — это платформа для непрерывного мониторинга безопасности AI-систем.
Подробнее о функционале и фичах проекта читай в карточках.
Попробовать HiveTrace:
#ПроектНедели
#AITalentHub #ITMO #NapoleonIT
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Polina Sokol
Detecting misbehavior in frontier reasoning models | OpenAI
https://openai.com/index/chain-of-thought-monitoring/
https://openai.com/index/chain-of-thought-monitoring/
OpenAI
Detecting misbehavior in frontier reasoning models
Frontier reasoning models exploit loopholes when given the chance. We show we can detect exploits using an LLM to monitor their chains-of-thought. Penalizing their “bad thoughts” doesn’t stop the majority of misbehavior—it makes them hide their intent.
Forwarded from Библиотека Cobalt Strike
AI Red Teamer Job Role Path, in collaboration with Google. (2025)
Программа AI Red Teamer Job Role Path, разработанная совместно с компанией Google, готовит специалистов по кибербезопасности к оценке, эксплуатации и защите систем искусственного интеллекта. Охватывая такие темы, как оперативное внедрение, атаки на конфиденциальность моделей, враждебный ИИ, риски в цепочке поставок и угрозы развертывания, программа сочетает теорию с практическими занятиями. Согласованный с Secure AI Framework (SAIF) от Google, он обеспечивает актуальность реальных проблем безопасности ИИ. Учащиеся получат навыки манипулирования поведением моделей, разработки стратегий «красной команды», ориентированных на ИИ, и проведения наступательных испытаний безопасности приложений, управляемых ИИ. Курс будет постепенно расширяться за счет смежных модулей вплоть до его завершения.
#cours
Программа AI Red Teamer Job Role Path, разработанная совместно с компанией Google, готовит специалистов по кибербезопасности к оценке, эксплуатации и защите систем искусственного интеллекта. Охватывая такие темы, как оперативное внедрение, атаки на конфиденциальность моделей, враждебный ИИ, риски в цепочке поставок и угрозы развертывания, программа сочетает теорию с практическими занятиями. Согласованный с Secure AI Framework (SAIF) от Google, он обеспечивает актуальность реальных проблем безопасности ИИ. Учащиеся получат навыки манипулирования поведением моделей, разработки стратегий «красной команды», ориентированных на ИИ, и проведения наступательных испытаний безопасности приложений, управляемых ИИ. Курс будет постепенно расширяться за счет смежных модулей вплоть до его завершения.
#cours
Forwarded from Библиотека Cobalt Strike
HTB - AI Red Teamer.zip
12 MB
