Forwarded from Polina Sokol
GitHub
GitHub - NVIDIA-NeMo/Guardrails: NeMo Guardrails is an open-source toolkit for easily adding programmable guardrails to LLM-based…
NeMo Guardrails is an open-source toolkit for easily adding programmable guardrails to LLM-based conversational systems. - NVIDIA-NeMo/Guardrails
Уязвимость к атакам российских больших языковых моделей с открытым исходным кодом / Habr
https://habr.com/en/companies/isp_ras/articles/831550/
https://habr.com/en/companies/isp_ras/articles/831550/
Habr
Уязвимость к атакам российских больших языковых моделей с открытым исходным кодом
Маленькая ремарка С появлением больших языковых моделей обществу был брошен вызов. Первые проблемы, с которыми пришлось столкнуться в области LLM, были связаны с тем, что модели могут неправильно...
Forwarded from DaLi
DECODINGTRUST: A Comprehensive Assessment of Trustworthiness in GPT Models
Тут команда из разных университетов подготовила анализ безопасности моделей на 110 страниц.
Вместе с этим у них есть лидерборд, где среди прочего есть и наши любимые квантованные модели.
Собственно, на этом безопасных всем выходных.
Тут команда из разных университетов подготовила анализ безопасности моделей на 110 страниц.
Вместе с этим у них есть лидерборд, где среди прочего есть и наши любимые квантованные модели.
Собственно, на этом безопасных всем выходных.
Forwarded from DaLi
Forwarded from Порвали два трояна
И мы не про вредоносные библиотеки для «доступа к ChatGPT». Речь про отравление самих моделей, которое приводит либо к срабатыванию вредоносного кода при локальном запуске модели, либо вообще не содержит ВПО, но побуждает модель выдавать неверные ответы на совершенно конкретные запросы. В последнем случае логическая бомба заложена в весах или вычислительном графе нейросети.
Как атакующие могут это проделать — читайте в нашем посте, но основной вывод очевиден. Тщательный контроль происхождения ИИ-инструментов и всех их компонентов, включая сами модели, должен внедряться службами ИБ уже сегодня.
#советы #ИИ #угрозы @П2Т
Please open Telegram to view this post
VIEW IN TELEGRAM
Блог Касперского
Недекларированная функциональность в системах Machine Learning
Скрытая логика, отравление выборки и другие способы целевых атак через ИИ-системы.
Forwarded from AI SecOps
В России обновили концепцию регулирования искусственного интеллекта
В документе зафиксировали ответственность за вред, причиненный нейросетью.
В документе зафиксировали ответственность за вред, причиненный нейросетью.
Парламентская Газета
Концепцию регулирования искусственного интеллекта обновили
Парламентская газета. Новости: Общество. Концепцию регулирования искусственного интеллекта обновили. Дата публикации: 04.12.2024.
Forwarded from Альфа-Банк
Проводим самые прорывные исследования — и делаем вклад в мировую науку 🧑🎓
Наши ребята из Лаборатории машинного обучения Альфа-Банка написали уникальную научную работу — об атаках на искусственный интеллект и техниках его защиты. Это исследование на уровне ведущих международных институтов 🦾
Работу опубликовали на главном научном сайте в мире — arXiv. А наших ребят пригласили на международную конференцию для учёных — ICDM 2024: IEEE International Conference on Data Mining в Абу-Даби.
Гордимся достижениями и продолжаем создавать науку будущего❤️
Редактор канала: своими шутками делает вклад в мировой стендап🤩
@alfabank
Наши ребята из Лаборатории машинного обучения Альфа-Банка написали уникальную научную работу — об атаках на искусственный интеллект и техниках его защиты. Это исследование на уровне ведущих международных институтов 🦾
Работу опубликовали на главном научном сайте в мире — arXiv. А наших ребят пригласили на международную конференцию для учёных — ICDM 2024: IEEE International Conference on Data Mining в Абу-Даби.
Гордимся достижениями и продолжаем создавать науку будущего
Редактор канала: своими шутками делает вклад в мировой стендап
@alfabank
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Alex Mydzen
NIST готовит рекомендации по адаптации NIST CSF при защите ИИ. И подготовила концептуальный документ с обоснованием почему для ИИ нужен специальный поход в стандартах.
https://www.nccoe.nist.gov/projects/cyber-ai-profile
https://www.nccoe.nist.gov/projects/cyber-ai-profile
NCCoE
Cyber AI Profile | NCCoE
For the cybersecurity of AI and AI used for cybersecurity, NIST is proposing to focus on three sources of risk that impact an organization’s operational risk: Cybersecurity of AI Systems, AI-enabled Cyber Attacks, and AI-enabled Cyber Defense.
Forwarded from Al Talent Hub
Новый #ПроектНедели, разработанный в рамках совместной лаборатории AI Talent Hub х Raft — AI Security Lab 🪙
Hivertrace — это платформа для непрерывного мониторинга безопасности AI-систем.
▶️ Выявляет аномалии и ошибки в пользовательских взаимодействиях с LLM;
▶️ Выявляет атаки, нацеленные на изменение поведения модели, кражу чувствительной информации и системных инструкций;
▶️ Осуществляет очистку сообщений от персональных данных — и не только!
Подробнее о функционале и фичах проекта читай в карточках.
Попробовать HiveTrace:
➡️ Лендинг
➡️ Демо
✈️ Cледить за обновлениями: @aisecuritylab
🎤 Богдан Минко, ML Engineer HiveTrace 🔽
#ПроектНедели
#AITalentHub #ITMO #NapoleonIT
Hivertrace — это платформа для непрерывного мониторинга безопасности AI-систем.
Подробнее о функционале и фичах проекта читай в карточках.
Попробовать HiveTrace:
#ПроектНедели
#AITalentHub #ITMO #NapoleonIT
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
