Сравнение_методов_снижения_рисков_неправды_в_LLM.docx
15.4 KB
Сравнение методов снижения рисков «неправды» в LLM
Forwarded from DaLi
Кратко о прогрессе AI.
(почти как в анекдоте)

AI делает искусство - художники расстроены, программисты продолжают пилить AI.

AI пишет код - программисты расстроены, исследователи продолжают пилить AI.

AI проводит исследования - исследователи расстроены, власти государств говорят надо продолжать пилить.

...
😁1
Forwarded from Cybersecurity memes off
This media is not supported in your browser
VIEW IN TELEGRAM
Коллега показал пример неудачного guardrails для ИИ-агента.

ЗЫ. Шуруповерт не его, отпечатки пальцев - тоже.
😁4
Уязвимости AI-автоматизации: n8n, OpenClaw, Claude Code — Solar 4RAYS
https://rt-solar.ru/solar-4rays/blog/6890/
Forwarded from Shady AI
Новая атака на Grok что бы собрать пользовательские данные

Исследователи из Adversa AI обнаружили способ незаметно похитить данные пользователя Grok: имя, геолокацию, историю переписки просто попросив ИИ «открыть ссылку».

На вредоносной странице спрятана зашифрованная AES-256 инструкция. Grok сам её расшифровывает через встроенный Python-sandbox, принимает за «доверенный» источник и отправляет личные данные на сервер злоумышленника без каких-либо предупреждений.

О проблеме сообщили xAI ещё 3 июня. Реакции пока ноль.

По состоянию на 19 августа атака всё ещё работает (~40% успеха).

https://gbhackers.com/zero-click-grok-attack-prompt-injection/
🔥1
Правила_безопасности_работы_с_ИИ_для_подростков_гуманитариев.docx
18.1 KB
Бывает, что у родителей технарей получается ребенок-гуманитарий.
И он не ленивый и не глупый, математику ему объяснили 5 преподавателей.

Моя дочь использует ИИ (в этой статье будет много упрощений и допущений) для уроков,
и для сценариев для своих мультфильмов.
Режиссер мультипликации идет к своей мечте)

Ко мне обращаются другие дети и их родители что-то посоветовать, как использовать ИИ для учебы.

И родился этот документ.

Для детей-технарей не стоит вопроса разобраться с новой увлекательной штукой,
мне кажется, они в 13 лет повторяют за Карпатым собрать свой chatgpt3.5 на папином ноутбуке с GPU.
А у гуманитариев все сложнее.
Они романтизируют.

И будет очень страшно, если у нас лет через 10 все будут говорить, как ИИ.
И будет сплошная "Идиократия" (посмотрите фильм, кто не смотрел)

Откритиковано и согласовано: Сокол Василисой))
❤6
Просто оставлю это здесь,
не буду расписывать не хочу быть первоисточником паники)

А панику у нас любят раздувать в связи с ИИ.

Но для умных направлю мысль:
у нас все КИИ (к нему относится ядерное оружие) на старой кодовой базе, там более
устойчивые и надежные ЯП, а вокруг них упрощается и осовременивается ит инфраструктура.
Агенты разбираются с новой информацией в разы быстрее людей,
тем более что методичек в сети достаточно.
Сбежать из контейнеров - уже умеют, теперь только вопрос в том, чтобы быстро найти правильную методичку.

https://www.darkreading.com/cyberattacks-data-breaches/old-unpatched-flaws-attackers-philippines-nuclear-agency
Forwarded from Yandex for Security
This media is not supported in your browser
VIEW IN TELEGRAM
💼 «Теневой AI» в компании и новые риски для ИБ

AI-инструменты уже стали частью повседневной работы: сотрудники загружают документы в публичные модели, подключают кодовых ассистентов и даже доверяют агентам доступ к корпоративной инфраструктуре. Иногда всё это происходит официально, а иногда — без ведома службы безопасности.

⏩ В новом выпуске «Безопасно говоря» обсуждаем, как компаниям управлять рисками, если внедрение нейросетей опережает обновление процессов безопасности. А также разбираемся, можно ли просто так взять и запретить сотрудникам «неодобренный» AI, как защищать данные и инфраструктуру и почему классических DLP и политик безопасности уже может быть недостаточно.

🎤 Ведущие:

🟣 Антон Черноусов, Developer Advocate Yandex Cloud
🟣 Сергей Нестерук, эксперт по безопасности ML Yandex Cloud

👨‍💻 Гости:

🟣 Евгений Кокуйкин, основатель HiveTrace
🟣 Сергей Голованов, главный эксперт «Лаборатории Касперского»

🎧 Слушайте подкаст:

🟣 Ютуб
🟣 VK Видео
🟣 Яндекс Музыка

Подписывайтесь:
💬 @Yandex4Security
📹 @YandexForSecurity
Please open Telegram to view this post
VIEW IN TELEGRAM
AlcaTRAz — защита от джейлбрейка на уровне подсказок, организованная в виде дерева правил элементарных преобразований на уровне символов, которые автоматически обучаются с помощью генетического программирования (ГП)
-работает только с входным текстом, не требуя доступа к внутренним компонентам модели;
-автоматически изучает правила переноса, которые вносят контролируемые изменения на уровне символов в определённых позициях;
-нарушает структурные закономерности, используемые при атаках, но сохраняет эффективность модели при обработке корректных запросов.

Метод протестировали на 33 моделях с открытым исходным кодом и 22 типах атак. Ключевые результаты:
-AlcaTRAz обеспечивает наилучший совокупный показатель безопасности и функциональности в 73,4 % комбинаций моделей и атак; 2
-после применения защиты модальное значение показателя безопасности снизилось с 10 (максимальная серьёзность реакции на вредоносный запрос) до 2 (почти полный отказ в обслуживании); 3
-средний показатель безопасности с защитой — 8,35 по шкале от 0 до 10, без защиты — 8,62, то есть падение составило всего 0,27 балла.

https://arxiv.org/html/2609.03693v1
Akrasia использует два ключевых механизма LLM — обучение в контексте (in‑context learning) и неверность модели (model unfaithfulness) — чтобы организовать бэкдор‑атаки. Атака:

-конструирует триггер на уровне кода;
-применяет обучение в контексте для освоения бэкдора;
-скрывает триггер и генерирует правдоподобные рассуждения, маскируя вредоносные действия.

В отличие от предыдущих атак (например, BadChain и BadCodePrompt), Akrasia фокусируется на триггерах, связанных с кодом, а не с естественным языком, и эффективнее обходит защитные механизмы.

Akrasia эффективно обходит современные методы защиты: сохраняет ASR до 98,82 % в 14 из 18 сценариев защиты (в том числе против COS, PeerGuard и ONION), а также лучше всего защиту преодолевает на моделях Qwen‑3.6‑35B и Gemini‑3.5‑flash.

При этом метод COS показал наибольшую эффективность против Akrasia — особенно на моделях Claude‑Sonnet‑5 и GPT‑5.5.

https://arxiv.org/html/2609.01023v2
Компания Manifold Security выявила восемь недостатков безопасности в семи агентах искусственного интеллекта командной строки, в которых собственная конфигурация Git репозитория называет команду, которую агент запускает на компьютере разработчика, четыре из них все еще не исправлены на момент публикации.

https://thehackernews.com/2026/09/malicious-git-configs-can-make-claude.html
А пальто молодцы))

готовый промпт для взлома корпоративной сети с агентами, со схемами, все удобно и хорошо расписано)

https://unit42.paloaltonetworks.com/ai-assisted-cyber-attack-inside-a-unit-42-investigation/

Так как мы делаем модели, которые эти атаки распознают, в том числе в ретроспективе,
мне интересней больше это:
-Агенты с искусственным интеллектом сокращают время между этапами атаки: Агенты с искусственным интеллектом, использованные в этой атаке, были разработаны для анализа необработанных результатов работы инструментов и быстрого перехода к следующим этапам, что ускоряет весь процесс атаки.
-Агенты с искусственным интеллектом оставляют узнаваемые следы: Специалисты по кибербезопасности могут выявить атаки с использованием агентов, отслеживая такие признаки, как использование структурированного Markdown, кэширование Python и парные папки с активами.
-Злоумышленники могут использовать искусственный интеллект для создания избыточных хранилищ данных в среде: В этом инциденте злоумышленник использовал агентов на основе ИИ, чтобы эффективно создать дублирующие хранилища данных для SSH-ключей, бессерверных функций, политик перезапуска контейнеров, облачных идентификаторов и конвейеров CI/CD. Использование агентов на основе ИИ может облегчить злоумышленнику параллельное обслуживание и тестирование всего этого набора инструментов.
-Злоумышленники могут использовать инструменты ИИ организации в качестве инфраструктуры после компрометации: Злоумышленники могут перехватывать корпоративные сервисы ИИ, чтобы использовать их в своих атаках. Это позволяет злоумышленникам маскировать трафик, связанный с организацией атак, под ожидаемый трафик и перекладывать финансовые затраты на жертву.


поэтому ищем поведенческие следы работы ИИ:
—-Структурированные артефакты (Unit 42):
-Markdown и Python-кэш: Обнаружение файлов .md (Markdown), кэшей Python (например, __pycache__), парных папок с ассетами может указывать на работу агента, который использует эти форматы для хранения состояния, инструментов или результатов.
-Избыточные хранилища: Агенты могут создавать дублирующие хранилища для SSH-ключей, бессерверных функций, политик контейнеров и CI/CD-пайплайнов для параллельного тестирования.
—-Поведенческие и темпоральные паттерны:
-Скорость и ритм действий: Ключевой признак — скорость выше человеческой, но с неравномерными паузами (в отличие от детерминированных скриптов). ИИ-агент обдумывает и адаптируется.
-Адаптивное боковое перемещение: Последовательность неудачных попыток, за которыми следуют успешные обходы на машинной скорости — классический признак «рассуждающего» агента.
-Нестандартные последовательности: В отличие от скриптов, агенты не следуют фиксированным путям, их цепочки действий вариативны и зависят от получаемых данных.
——Артефакты на уровне приложений и API:
-Tool Calling и MCP (Model Context Protocol): Ищите в логах вызовы инструментов и API, которые не соответствуют задокументированному поведению, а также использование MCP-серверов в качестве каналов C2.
-Инъекции в промпты: Логи могут содержать следы промпт-инъекций (внедрение вредоносных инструкций) через документы, веб-страницы или поля ввода.
-Необычные запросы к моделям: Высокочастотные программные запросы с низкой энтропией шаблонов, но высокой энтропией входных данных от одного источника.
—-Системные и сетевые артефакты:
-Память и векторные хранилища: Сканирование агентской памяти на предмет внедренных инструкций, признаков отравления (poisoning) или эксфильтрации данных.
-Сетевой трафик к AI-сервисам: Обнаружение трафика к эндпоинтам LLM-моделей, особенно если он исходит от неавторизованных или скомпрометированных процессов.
Hexstrike AI — фреймворк с применением ИИ, который разработал Мохаммад Осама. Код опубликован в репозитории GitHub. Инструмент использует протокол Model Context Protocol (MCP) от Anthropic, чтобы взаимодействовать с языковыми моделями — например, Claude.AI, GPT от OpenAI, Microsoft Copilot.

По данным экспертов Check Point, злоумышленники начали обсуждать применение инструмента на хак-форумах. В частности, речь шла об использовании HexStrike AI для эксплуатации вышеупомянутых 0-day уязвимостей в Citrix NetScaler ADC и Gateway. Причем дискуссия имела место примерно через 12 часов после раскрытия информации о проблемах.

Судя по обсуждениям, хакеры успешно добивались неаутентифицированного удаленного выполнения кода посредством CVE-2025-7775 и HexStrike AI, а затем размещали веб-шеллы на скомпрометированных устройствах. Некоторые скомпрометированные экземпляры NetScaler в итоге выставлялись на продажу.

https://xakep.ru/2025/09/04/hexstrike-ai/
Forwarded from Двач
This media is not supported in your browser
VIEW IN TELEGRAM
GPT-6 Astra прошла все 48 уровней «Я не робот» с капчами разной сложности

Это конец
Forwarded from Эксплойт
Весь интернет ненавидит OpenAI — разрабов ChatGPT обвиняют в том, что они украли решение «задачи тысячелетия» Навье-Стокса.

Сегодня корпа объявила, что их секретная сверхмощная модель смогла разгадать одну из 7 фундаментальных математических проблем. До этого столь эпичный мув удавался лишь одному человеку — россиянину Перельману, который доказал гипотезу Пуанкаре.

Для разгадки задачи Навье-Стокса OpenAI запустили сразу 10 000 агентов: за 88 часов работы им пришлось спалить 130 МИЛЛИАРДОВ токенов — для понимания, это примерно 130 000 раз переписать всю «Войну и мир» с нуля. Тем не менее результат того стоил.

И тут начинается часть, из-за которой интернет ополчился против OpenAI: так случилось, что весь последний год двое учёных Тристан Бакмастер и Левант Альпёге работали над решением проблемы Навье-Стокса, используя в работе... ChatGPT и Claude. Что ещё неприятнее для OpenAI, Альпёге работает в Anthropic.

В середине августа исследователям удалось найти почву для решения, а уже в начале сентября в научном сообществе поползи слухи, что они в шаге от прорыва. Бакмастер, узнав о том, что информация об их работе дошла до OpenAI, решил написать одному известному математику, работающему в корпе и поделиться успехами.

Ответ убил: математик из OpenAI поздравил Бакмастера и между делом сообщил, что их экспериментальная модель на днях решила задачу. Чтобы не помешать друг другу, учёные созвонились и из диалога Бакмастер узнал, что секретная версия ChatGPT СЛУЧАЙНО выбрала для решения тот же непопулярный метод, что и они.

Дальше математик из OpenAI предложил Бакмастеру два стула: на первом они с Альпёге публикуют свои наработки «как есть», а все лавры полного решения забирают OpenAI; на втором тоже не пики — Бакмастеру предлагалось в одиночку завершить работу, выкинув из неё Альпёге, ведь тот... работает в конкурирующей Anthropic.

Бакмастер от предложений отказался и сообщил, что если OpenAI опубликуют свои результаты, то он расскажет всему миру, что нейронка украла их работу. Как вы уже догадались, обещание он сдержал.

Напоследок математик из OpenAI бросил Бакмастеру две фразы, которые сейчас форсит весь интернет:

Зачем тебе разрушать свою карьеру?

Если ты не хочешь, чтобы я был добрым, я могу и не быть добрым


Что иронично, в своём анонсе решения OpenAI написали, что не могут исключить тот факт, что их ИИ не обучался и на наработках двух учёных.

Если всё написанное Бакмастером правда, учёные больше не могут доверять ChatGPT.

@exploitex
AI Attacks pinned «Какую тема вам более интересна/актуальна?»