МЕТОДЫ ОБЕСПЕЧЕНИЯ БЕЗОПАСНОСТИ ПРОЦЕССОВ МАШИННОГО ОБУЧЕНИЯ – тема научной статьи по компьютерным и информационным наукам читайте бесплатно текст научно-исследовательской работы в электронной библиотеке КиберЛенинка
https://cyberleninka.ru/article/n/metody-obespecheniya-bezopasnosti-protsessov-mashinnogo-obucheniya
Forwarded from Градиент обреченный (Sergei Averkiev)
🔺 Как люди ломали LLM

Подсмотрел у Тани в канале очень прикольный метод переформулирования промпта, на который отказывается отвечать модель.

Выровненная на политкорректные ответы модель перестает сопротивляться и пишет как угонять машины и прятать трупы, если запрос поставлен в прошедшем времени.

Будущее время тоже работает, но хуже.

👉 Paper | GitHub
Forwarded from DaLi
DECODINGTRUST: A Comprehensive Assessment of Trustworthiness in GPT Models

Тут команда из разных университетов подготовила анализ безопасности моделей на 110 страниц.

Вместе с этим у них есть лидерборд, где среди прочего есть и наши любимые квантованные модели.

Собственно, на этом безопасных всем выходных.
Forwarded from DaLi
Для тех кто хочет погрузиться в безопасность в AI и LLM.

https://www.safe.ai/work
🤖 Уже появляются бэкдоры в ИИ-моделях

И мы не про вредоносные библиотеки для «доступа к ChatGPT». Речь про отравление самих моделей, которое приводит либо к срабатыванию вредоносного кода при локальном запуске модели, либо вообще не содержит ВПО, но побуждает модель выдавать неверные ответы на совершенно конкретные запросы. В последнем случае логическая бомба заложена в весах или вычислительном графе нейросети.

Как атакующие могут это проделать — читайте в нашем посте, но основной вывод очевиден. Тщательный контроль происхождения ИИ-инструментов и всех их компонентов, включая сами модели, должен внедряться службами ИБ уже сегодня.

#советы #ИИ #угрозы @П2Т
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Альфа-Банк
Проводим самые прорывные исследования — и делаем вклад в мировую науку 🧑‍🎓

Наши ребята из Лаборатории машинного обучения Альфа-Банка написали уникальную научную работу — об атаках на искусственный интеллект и техниках его защиты. Это исследование на уровне ведущих международных институтов 🦾

Работу опубликовали на главном научном сайте в мире — arXiv. А наших ребят пригласили на международную конференцию для учёных — ICDM 2024: IEEE International Conference on Data Mining в Абу-Даби.

Гордимся достижениями и продолжаем создавать науку будущего ❤️

Редактор канала: своими шутками делает вклад в мировой стендап 🤩

@alfabank
Please open Telegram to view this post
VIEW IN TELEGRAM