Forwarded from Yaplakal.com
This media is not supported in your browser
VIEW IN TELEGRAM
Герой нашего времени 😄
Please open Telegram to view this post
VIEW IN TELEGRAM
😁3❤🔥1👍1
Yaplakal.com
Герой нашего времени 😄
Проверяйте настройки у нейросетей по подписке)
И, вообще, лучше двухфакторную аутентификацию на таких сервисах делать)🤫
И, вообще, лучше двухфакторную аутентификацию на таких сервисах делать)
Please open Telegram to view this post
VIEW IN TELEGRAM
Работая в DS уже 4 года, поняла для себя, что все чаще аналитика и модели становятся
объектом манипуляции данными и результатами для получения разного рода выгод,
периодически происходят какие-то крупные обвинения, как обвинение LLM Arena в предвзятости результатов (думаю, что это правда
Но, когда даже в книгах O'relly есть такие абзацы, начинаешь сомневаться
в большинстве результатов расчетов аналитиков и тестирования моделей.
А тем более в их безопасности и правдивости.
объектом манипуляции данными и результатами для получения разного рода выгод,
периодически происходят какие-то крупные обвинения, как обвинение LLM Arena в предвзятости результатов (думаю, что это правда
Но, когда даже в книгах O'relly есть такие абзацы, начинаешь сомневаться
в большинстве результатов расчетов аналитиков и тестирования моделей.
А тем более в их безопасности и правдивости.
🤨1
в 2022 году я купила себе книгу "Глубокое обучение с fastai и PyTorch" и была удивлена наличием в ней главы про этику.
"Какая этика? мы тут математикой и алгоритмами занимаемся", но я была не права)
Периодически DS загоняют в рамки соответствия каким-то метрикам, которые нельзя достичь,
или подгонку результатов, потому что надо быстрее в продакшн,
и тут уже в небезопасности оказывается сам DS - это означает и репутационные риски, и мат ответственность и прочее.
Рекомендую к прочтению именно эту главу в книге, сама книга уже устаревшая,
хотя, возможно, для каких-то специфических задач по классификации картинок - может быть быстрым стартом.
"Какая этика? мы тут математикой и алгоритмами занимаемся", но я была не права)
Периодически DS загоняют в рамки соответствия каким-то метрикам, которые нельзя достичь,
или подгонку результатов, потому что надо быстрее в продакшн,
и тут уже в небезопасности оказывается сам DS - это означает и репутационные риски, и мат ответственность и прочее.
Рекомендую к прочтению именно эту главу в книге, сама книга уже устаревшая,
хотя, возможно, для каких-то специфических задач по классификации картинок - может быть быстрым стартом.
Как часто вам приходилось подгонять метрики, потому что бизнес не устраивал результат?
Anonymous Poll
50%
Ни одного раза
8%
1-2 раза
0%
2-10 раз
42%
Постоянно
Как часто вам приходилось выкатывать в прод модель, которую не тестировали на безопасность?
Anonymous Poll
33%
Все время тестируем
25%
Тестируем по необходимости
42%
Не тестируем
❤1
Forwarded from NN
В ChatGPT появилась полная интеграция с приложениями на ПК и смартфоне: чат-бот работает с ними с учетом истории диалога.
Бота в любой момент можно будет отправить дизайнить макеты в Figma, добавлять треки в ваш плейлист или искать квартиру в городе, о котором вы только что говорили. Все в одном диалоге.
Наконец чат-бот превратится в полноценного ассистента.
Бота в любой момент можно будет отправить дизайнить макеты в Figma, добавлять треки в ваш плейлист или искать квартиру в городе, о котором вы только что говорили. Все в одном диалоге.
Наконец чат-бот превратится в полноценного ассистента.
Forwarded from Кот на яблоне
#LLM
В статье, опубликованной FireTail.ai, описывается уязвимость под названием ASCII Smuggling — метод скрытого внедрения инструкций в текст с помощью невидимых Unicode-символов (в частности, так называемых tag characters). Эта техника позволяет злоумышленнику обойти визуальный контроль человека, поскольку такие символы не отображаются в пользовательском интерфейсе, но при этом обрабатываются языковыми моделями (LLM), что приводит к выполнению скрытых команд.
Исследователь FireTail Виктор Маркопулос провёл тестирование ряда крупных LLM (включая Gemini, Grok, DeepSeek, ChatGPT, Copilot и Claude) и выявил, что Gemini, Grok и DeepSeek уязвимы к данной атаке, тогда как другие модели (например, ChatGPT и Claude) корректно фильтруют или нормализуют входные данные.
https://www.firetail.ai/blog/ghosts-in-the-machine-ascii-smuggling-across-various-llms
В статье, опубликованной FireTail.ai, описывается уязвимость под названием ASCII Smuggling — метод скрытого внедрения инструкций в текст с помощью невидимых Unicode-символов (в частности, так называемых tag characters). Эта техника позволяет злоумышленнику обойти визуальный контроль человека, поскольку такие символы не отображаются в пользовательском интерфейсе, но при этом обрабатываются языковыми моделями (LLM), что приводит к выполнению скрытых команд.
Исследователь FireTail Виктор Маркопулос провёл тестирование ряда крупных LLM (включая Gemini, Grok, DeepSeek, ChatGPT, Copilot и Claude) и выявил, что Gemini, Grok и DeepSeek уязвимы к данной атаке, тогда как другие модели (например, ChatGPT и Claude) корректно фильтруют или нормализуют входные данные.
https://www.firetail.ai/blog/ghosts-in-the-machine-ascii-smuggling-across-various-llms
www.firetail.ai
Ghosts in the Machine: ASCII Smuggling across Various LLMs - FireTail blog posts
Researcher Viktor Markopoulos discovers ASCII Smuggling bypasses human audit via Unicode, enabling enterprise identity spoofing and data poisoning on Gemini & Grok.
Forwarded from Russian OSINT
Новое исследование от Anthropic совместно с UK AI Security Institute, University of Oxford, ETH Zurich и Alan Turing Institute демонстрирует, что для внедрения бэкдора в большие языковые модели достаточно всего
Новая работа ломает привычные представления о масштабируемости атак отравления данных. Прежняя гипотеза заключалась в том, что атакующему необходимо контролировать фиксированный процент обучающего корпуса. Однако для крупных моделей это означало бы сотни миллионов вредоносных документов, что считалось нереалистичным. Новое исследование показывает обратное: достаточно небольшого и почти постоянного числа отравленных документов для компрометации даже крупнейших моделей.
Результаты подтвердились не только на этапе предобучения, но и при fine-tuning, включая эксперименты с Llama-3.1-8B и GPT-3.5-turbo. Вредоносные триггеры могут вызывать как отказ модели (DoS-поведение), так и смену языка или подчинение вредным инструкциям.
Вопреки прежним убеждениям, масштабирование моделей не усложняет, а потенциально упрощает реализацию подобных атак с отравлением данных.
🤔👆Хотя текущие результаты ограничены узким типом бэкдора, они уже сейчас указывают на острую необходимость разработки новых защитных механизмов, способных работать в масштабе и противостоять атакам с постоянным числом отравленных образцов. Публикация исследования служит превентивной мерой, мотивируя специалистов по безопасности к созданию проактивных стратегий защиты.
*Meta (соцсети Facebook, Instagram) запрещена в РФ как экстремистская.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔1