Forwarded from Yaplakal.com
Please open Telegram to view this post
VIEW IN TELEGRAM
😁3❤‍🔥1👍1
Yaplakal.com
Герой нашего времени 😄
Проверяйте настройки у нейросетей по подписке)
И, вообще, лучше двухфакторную аутентификацию на таких сервисах делать)🤫
Please open Telegram to view this post
VIEW IN TELEGRAM
Работая в DS уже 4 года, поняла для себя, что все чаще аналитика и модели становятся
объектом манипуляции данными и результатами для получения разного рода выгод,
периодически происходят какие-то крупные обвинения, как обвинение LLM Arena в предвзятости результатов (думаю, что это правда

Но, когда даже в книгах O'relly есть такие абзацы, начинаешь сомневаться
в большинстве результатов расчетов аналитиков и тестирования моделей.
А тем более в их безопасности и правдивости.
🤨1
❤1
в 2022 году я купила себе книгу "Глубокое обучение с fastai и PyTorch" и была удивлена наличием в ней главы про этику.
"Какая этика? мы тут математикой и алгоритмами занимаемся", но я была не права)

Периодически DS загоняют в рамки соответствия каким-то метрикам, которые нельзя достичь,
или подгонку результатов, потому что надо быстрее в продакшн,
и тут уже в небезопасности оказывается сам DS - это означает и репутационные риски, и мат ответственность и прочее.

Рекомендую к прочтению именно эту главу в книге, сама книга уже устаревшая,
хотя, возможно, для каких-то специфических задач по классификации картинок - может быть быстрым стартом.
Как часто вам приходилось подгонять метрики, потому что бизнес не устраивал результат?
Anonymous Poll
50%
Ни одного раза
8%
1-2 раза
0%
2-10 раз
42%
Постоянно
Как часто вам приходилось выкатывать в прод модель, которую не тестировали на безопасность?
Anonymous Poll
33%
Все время тестируем
25%
Тестируем по необходимости
42%
Не тестируем
❤1
Forwarded from NN
В ChatGPT появилась полная интеграция с приложениями на ПК и смартфоне: чат-бот работает с ними с учетом истории диалога.

Бота в любой момент можно будет отправить дизайнить макеты в Figma, добавлять треки в ваш плейлист или искать квартиру в городе, о котором вы только что говорили. Все в одном диалоге.

Наконец чат-бот превратится в полноценного ассистента.
OpenAI продолжает подсаживать на себя пользователей и собирать данные)
💯4
Forwarded from Кот на яблоне
#LLM

В статье, опубликованной FireTail.ai, описывается уязвимость под названием ASCII Smuggling — метод скрытого внедрения инструкций в текст с помощью невидимых Unicode-символов (в частности, так называемых tag characters). Эта техника позволяет злоумышленнику обойти визуальный контроль человека, поскольку такие символы не отображаются в пользовательском интерфейсе, но при этом обрабатываются языковыми моделями (LLM), что приводит к выполнению скрытых команд.

Исследователь FireTail Виктор Маркопулос провёл тестирование ряда крупных LLM (включая Gemini, Grok, DeepSeek, ChatGPT, Copilot и Claude) и выявил, что Gemini, Grok и DeepSeek уязвимы к данной атаке, тогда как другие модели (например, ChatGPT и Claude) корректно фильтруют или нормализуют входные данные.

https://www.firetail.ai/blog/ghosts-in-the-machine-ascii-smuggling-across-various-llms
Forwarded from Russian OSINT
🈁 Anthropic: небольшое количество ⚠️образцов могут заразить 🤖LLM любого размера!

Новое исследование от Anthropic совместно с UK AI Security Institute, University of Oxford, ETH Zurich и Alan Turing Institute демонстрирует, что для внедрения бэкдора в большие языковые модели достаточно всего 📄 250 вредоносных документов.

Новая работа ломает привычные представления о масштабируемости атак отравления данных. Прежняя гипотеза заключалась в том, что атакующему необходимо контролировать фиксированный процент обучающего корпуса. Однако для крупных моделей это означало бы сотни миллионов вредоносных документов, что считалось нереалистичным. Новое исследование показывает обратное: достаточно небольшого и почти постоянного числа отравленных документов для компрометации даже крупнейших моделей.

🤖Эксперименты на моделях от 600M до 13B параметров показали, что 250 вредоносных документов способны внедрить бэкдор независимо от объёма обучающего набора, даже если для крупнейшей модели доля таких данных составляет всего 0.00016%.

Результаты подтвердились не только на этапе предобучения, но и при fine-tuning, включая эксперименты с Llama-3.1-8B и GPT-3.5-turbo. Вредоносные триггеры могут вызывать как отказ модели (DoS-поведение), так и смену языка или подчинение вредным инструкциям.

Вопреки прежним убеждениям, масштабирование моделей не усложняет, а потенциально упрощает реализацию подобных атак с отравлением данных.

🤔👆Хотя текущие результаты ограничены узким типом бэкдора, они уже сейчас указывают на острую необходимость разработки новых защитных механизмов, способных работать в масштабе и противостоять атакам с постоянным числом отравленных образцов. Публикация исследования служит превентивной мерой, мотивируя специалистов по безопасности к созданию проактивных стратегий защиты.

*Meta (соцсети Facebook, Instagram) запрещена в РФ как экстремистская.

✋ @Russian_OSINT
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔1