Forwarded from Кот на яблоне
NVIDIA Technical Blog
Practical LLM Security Advice from the NVIDIA AI Red Team
Over the last several years, the NVIDIA AI Red Team (AIRT) has evaluated numerous and diverse AI-enabled systems for potential vulnerabilities and security weaknesses before they reach production.
Forwarded from Yaplakal.com
This media is not supported in your browser
VIEW IN TELEGRAM
Герой нашего времени 😄
Please open Telegram to view this post
VIEW IN TELEGRAM
😁3❤🔥1👍1
Yaplakal.com
Герой нашего времени 😄
Проверяйте настройки у нейросетей по подписке)
И, вообще, лучше двухфакторную аутентификацию на таких сервисах делать)🤫
И, вообще, лучше двухфакторную аутентификацию на таких сервисах делать)
Please open Telegram to view this post
VIEW IN TELEGRAM
Работая в DS уже 4 года, поняла для себя, что все чаще аналитика и модели становятся
объектом манипуляции данными и результатами для получения разного рода выгод,
периодически происходят какие-то крупные обвинения, как обвинение LLM Arena в предвзятости результатов (думаю, что это правда
Но, когда даже в книгах O'relly есть такие абзацы, начинаешь сомневаться
в большинстве результатов расчетов аналитиков и тестирования моделей.
А тем более в их безопасности и правдивости.
объектом манипуляции данными и результатами для получения разного рода выгод,
периодически происходят какие-то крупные обвинения, как обвинение LLM Arena в предвзятости результатов (думаю, что это правда
Но, когда даже в книгах O'relly есть такие абзацы, начинаешь сомневаться
в большинстве результатов расчетов аналитиков и тестирования моделей.
А тем более в их безопасности и правдивости.
🤨1
в 2022 году я купила себе книгу "Глубокое обучение с fastai и PyTorch" и была удивлена наличием в ней главы про этику.
"Какая этика? мы тут математикой и алгоритмами занимаемся", но я была не права)
Периодически DS загоняют в рамки соответствия каким-то метрикам, которые нельзя достичь,
или подгонку результатов, потому что надо быстрее в продакшн,
и тут уже в небезопасности оказывается сам DS - это означает и репутационные риски, и мат ответственность и прочее.
Рекомендую к прочтению именно эту главу в книге, сама книга уже устаревшая,
хотя, возможно, для каких-то специфических задач по классификации картинок - может быть быстрым стартом.
"Какая этика? мы тут математикой и алгоритмами занимаемся", но я была не права)
Периодически DS загоняют в рамки соответствия каким-то метрикам, которые нельзя достичь,
или подгонку результатов, потому что надо быстрее в продакшн,
и тут уже в небезопасности оказывается сам DS - это означает и репутационные риски, и мат ответственность и прочее.
Рекомендую к прочтению именно эту главу в книге, сама книга уже устаревшая,
хотя, возможно, для каких-то специфических задач по классификации картинок - может быть быстрым стартом.
Как часто вам приходилось подгонять метрики, потому что бизнес не устраивал результат?
Anonymous Poll
50%
Ни одного раза
8%
1-2 раза
0%
2-10 раз
42%
Постоянно
Как часто вам приходилось выкатывать в прод модель, которую не тестировали на безопасность?
Anonymous Poll
33%
Все время тестируем
25%
Тестируем по необходимости
42%
Не тестируем
❤1
Forwarded from NN
В ChatGPT появилась полная интеграция с приложениями на ПК и смартфоне: чат-бот работает с ними с учетом истории диалога.
Бота в любой момент можно будет отправить дизайнить макеты в Figma, добавлять треки в ваш плейлист или искать квартиру в городе, о котором вы только что говорили. Все в одном диалоге.
Наконец чат-бот превратится в полноценного ассистента.
Бота в любой момент можно будет отправить дизайнить макеты в Figma, добавлять треки в ваш плейлист или искать квартиру в городе, о котором вы только что говорили. Все в одном диалоге.
Наконец чат-бот превратится в полноценного ассистента.
Forwarded from Кот на яблоне
#LLM
В статье, опубликованной FireTail.ai, описывается уязвимость под названием ASCII Smuggling — метод скрытого внедрения инструкций в текст с помощью невидимых Unicode-символов (в частности, так называемых tag characters). Эта техника позволяет злоумышленнику обойти визуальный контроль человека, поскольку такие символы не отображаются в пользовательском интерфейсе, но при этом обрабатываются языковыми моделями (LLM), что приводит к выполнению скрытых команд.
Исследователь FireTail Виктор Маркопулос провёл тестирование ряда крупных LLM (включая Gemini, Grok, DeepSeek, ChatGPT, Copilot и Claude) и выявил, что Gemini, Grok и DeepSeek уязвимы к данной атаке, тогда как другие модели (например, ChatGPT и Claude) корректно фильтруют или нормализуют входные данные.
https://www.firetail.ai/blog/ghosts-in-the-machine-ascii-smuggling-across-various-llms
В статье, опубликованной FireTail.ai, описывается уязвимость под названием ASCII Smuggling — метод скрытого внедрения инструкций в текст с помощью невидимых Unicode-символов (в частности, так называемых tag characters). Эта техника позволяет злоумышленнику обойти визуальный контроль человека, поскольку такие символы не отображаются в пользовательском интерфейсе, но при этом обрабатываются языковыми моделями (LLM), что приводит к выполнению скрытых команд.
Исследователь FireTail Виктор Маркопулос провёл тестирование ряда крупных LLM (включая Gemini, Grok, DeepSeek, ChatGPT, Copilot и Claude) и выявил, что Gemini, Grok и DeepSeek уязвимы к данной атаке, тогда как другие модели (например, ChatGPT и Claude) корректно фильтруют или нормализуют входные данные.
https://www.firetail.ai/blog/ghosts-in-the-machine-ascii-smuggling-across-various-llms
www.firetail.ai
Ghosts in the Machine: ASCII Smuggling across Various LLMs - FireTail blog posts
Researcher Viktor Markopoulos discovers ASCII Smuggling bypasses human audit via Unicode, enabling enterprise identity spoofing and data poisoning on Gemini & Grok.