Forwarded from DaLi
DECODINGTRUST: A Comprehensive Assessment of Trustworthiness in GPT Models
Тут команда из разных университетов подготовила анализ безопасности моделей на 110 страниц.
Вместе с этим у них есть лидерборд, где среди прочего есть и наши любимые квантованные модели.
Собственно, на этом безопасных всем выходных.
Тут команда из разных университетов подготовила анализ безопасности моделей на 110 страниц.
Вместе с этим у них есть лидерборд, где среди прочего есть и наши любимые квантованные модели.
Собственно, на этом безопасных всем выходных.
Forwarded from DaLi
Forwarded from Порвали два трояна
И мы не про вредоносные библиотеки для «доступа к ChatGPT». Речь про отравление самих моделей, которое приводит либо к срабатыванию вредоносного кода при локальном запуске модели, либо вообще не содержит ВПО, но побуждает модель выдавать неверные ответы на совершенно конкретные запросы. В последнем случае логическая бомба заложена в весах или вычислительном графе нейросети.
Как атакующие могут это проделать — читайте в нашем посте, но основной вывод очевиден. Тщательный контроль происхождения ИИ-инструментов и всех их компонентов, включая сами модели, должен внедряться службами ИБ уже сегодня.
#советы #ИИ #угрозы @П2Т
Please open Telegram to view this post
VIEW IN TELEGRAM
Блог Касперского
Недекларированная функциональность в системах Machine Learning
Скрытая логика, отравление выборки и другие способы целевых атак через ИИ-системы.
Forwarded from AI SecOps
В России обновили концепцию регулирования искусственного интеллекта
В документе зафиксировали ответственность за вред, причиненный нейросетью.
В документе зафиксировали ответственность за вред, причиненный нейросетью.
Парламентская Газета
Концепцию регулирования искусственного интеллекта обновили
Парламентская газета. Новости: Общество. Концепцию регулирования искусственного интеллекта обновили. Дата публикации: 04.12.2024.
Forwarded from Альфа-Банк
Проводим самые прорывные исследования — и делаем вклад в мировую науку 🧑🎓
Наши ребята из Лаборатории машинного обучения Альфа-Банка написали уникальную научную работу — об атаках на искусственный интеллект и техниках его защиты. Это исследование на уровне ведущих международных институтов 🦾
Работу опубликовали на главном научном сайте в мире — arXiv. А наших ребят пригласили на международную конференцию для учёных — ICDM 2024: IEEE International Conference on Data Mining в Абу-Даби.
Гордимся достижениями и продолжаем создавать науку будущего❤️
Редактор канала: своими шутками делает вклад в мировой стендап🤩
@alfabank
Наши ребята из Лаборатории машинного обучения Альфа-Банка написали уникальную научную работу — об атаках на искусственный интеллект и техниках его защиты. Это исследование на уровне ведущих международных институтов 🦾
Работу опубликовали на главном научном сайте в мире — arXiv. А наших ребят пригласили на международную конференцию для учёных — ICDM 2024: IEEE International Conference on Data Mining в Абу-Даби.
Гордимся достижениями и продолжаем создавать науку будущего
Редактор канала: своими шутками делает вклад в мировой стендап
@alfabank
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Alex Mydzen
NIST готовит рекомендации по адаптации NIST CSF при защите ИИ. И подготовила концептуальный документ с обоснованием почему для ИИ нужен специальный поход в стандартах.
https://www.nccoe.nist.gov/projects/cyber-ai-profile
https://www.nccoe.nist.gov/projects/cyber-ai-profile
NCCoE
Cyber AI Profile | NCCoE
For the cybersecurity of AI and AI used for cybersecurity, NIST is proposing to focus on three sources of risk that impact an organization’s operational risk: Cybersecurity of AI Systems, AI-enabled Cyber Attacks, and AI-enabled Cyber Defense.
Forwarded from Al Talent Hub
Новый #ПроектНедели, разработанный в рамках совместной лаборатории AI Talent Hub х Raft — AI Security Lab 🪙
Hivertrace — это платформа для непрерывного мониторинга безопасности AI-систем.
▶️ Выявляет аномалии и ошибки в пользовательских взаимодействиях с LLM;
▶️ Выявляет атаки, нацеленные на изменение поведения модели, кражу чувствительной информации и системных инструкций;
▶️ Осуществляет очистку сообщений от персональных данных — и не только!
Подробнее о функционале и фичах проекта читай в карточках.
Попробовать HiveTrace:
➡️ Лендинг
➡️ Демо
✈️ Cледить за обновлениями: @aisecuritylab
🎤 Богдан Минко, ML Engineer HiveTrace 🔽
#ПроектНедели
#AITalentHub #ITMO #NapoleonIT
Hivertrace — это платформа для непрерывного мониторинга безопасности AI-систем.
Подробнее о функционале и фичах проекта читай в карточках.
Попробовать HiveTrace:
#ПроектНедели
#AITalentHub #ITMO #NapoleonIT
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Polina Sokol
Detecting misbehavior in frontier reasoning models | OpenAI
https://openai.com/index/chain-of-thought-monitoring/
https://openai.com/index/chain-of-thought-monitoring/
OpenAI
Detecting misbehavior in frontier reasoning models
Frontier reasoning models exploit loopholes when given the chance. We show we can detect exploits using an LLM to monitor their chains-of-thought. Penalizing their “bad thoughts” doesn’t stop the majority of misbehavior—it makes them hide their intent.
