Непрямое внедрение запросов (IPI) остаётся центральной проблемой безопасности LLM: в стандартных трансформерах нет архитектурного представления о полномочиях источника, поэтому полученные документы, пользовательский ввод и системные инструкции обрабатываются одним и тем же недифференцированным вниманием, и модель вынуждена угадывать по формулировкам, что выполнять, а что считать просто данными.

Provenance-Aware Transformers — защита с учётом происхождения данных, где каждому входному токену присваивается кольцевой идентификатор происхождения, а модель дополняется вложениями с учётом провенанса, обучаемым смещением внимания к происхождению и обучаемым масштабом, который сохраняет метку при нормализации, чтобы между авторитетными и неавторитетными источниками появилась структурная граница прямо во время генерации. Чтобы прикрутить это к уже выпущенным предобученным моделям, нужен двухэтапный файнтюнинг — сначала семантика происхождения, потом поведение в задаче с учётом ограничений; в оценке такие трансформеры заметно устойчивее к IPI внутри и вне кластера, качество остаётся на уровне базовой модели, и это сдвигает безопасность LLM от хрупкого сопоставления шаблонов к явному разделению доверия.

https://arxiv.org/html/2609.21088v1
Читала вот эту статью https://cyberscoop.com/ai-agent-hacking-apocalypse-cybersecurity/

Все это всем понятно уже года, как 2. Читала только из-за упоминаний SentinelOne.
Потому что они поставщики моделей для VT и поэтому нам сильно интересны.

И подумала, что в РФ с санкциями, покрытием только процентов в 15% серверами с GPU в российских компаниях,
что весь КИИ у нас до сих пор на Фортране))

и тут, нахожу:

«Говорун» — это суперкомпьютер, созданный и эксплуатируемый в Объединённом институте ядерных исследований (ОИЯИ) в подмосковной Дубне. Он назван в честь советского физика-теоретика Николая Николаевича Говоруна.

После модернизации 2025 года пиковая производительность достигла 2,2 петафлопс в двойной точности. GPU-компонента выросла на 36% — до 1,4 ПФ, благодаря двум узлам «РСК Экзастрим ИИ», в каждом из которых по 8 ускорителей NVIDIA H100 (PCIe, 80 ГБ). Итого 16 H100 — да, не тысячи, как в западных кластерах, но это реальные рабочие карты, а не миф.

Каждый узел: два Intel Xeon Platinum 8468 (48 ядер), 1 ТБ RAM, 16 ТБ NVMe SSD. Система хранения — 10 петабайт, с поддержкой GPUDirect Storage для прямой передачи данных между хранилищем и памятью GPU.

«Говорун» — первый в мире гиперконвергентный комплекс со 100% жидкостным охлаждением «горячей водой». Это не просто понты: жидкостное охлаждение позволяет охлаждать все компоненты круглогодично в режиме free cooling и размещать в 4 раза больше узлов на той же площади, чем при воздушном охлаждении.

Главная задача — мегапроект NICA: симуляция столкновений тяжёлых ионов, обработка данных с коллайдера, решёточная квантовая хромодинамика.
Но не только:
-Машинное обучение: обучение нейросетей на PyTorch с использованием GPU, моделирование методом Монте-Карло в Geant4.
-Физика сверхтяжёлых элементов: расчёт электронной структуры с релятивистскими поправками, изучение изменения Периодического закона в области предельно тяжёлых ядер.
-Радиационная биология: обработка данных экспериментов Лаборатории радиационной биологии.
-Квантовые вычисления: одновременное проведение большого объёма квантовых вычислений.
-Международные коллаборации: задачи в кооперации с ЦЕРН, FAIR, BNL

Нет, все-таки апокалипсис из России выйдет. И главный в этой шайке суперкомпьютеров, который будет переговорщиков от электрической формы жизни будет именно он))
PentestChain — десятиэтапную автоматизированную систему тестирования на проникновение, которая объединяет тщательно составленную детерминированную карту эксплойтов с каскадом ИИ с учетом затрат: сначала используется локальная модель Ollama (qwen2.5-7b), затем бесплатные модели OpenRouter и Cerebras, а в качестве запасного варианта, который всегда выдает результат, используется система на основе правил. Полный конвейер представлен на сервере Model Context Protocol (MCP) с одиннадцатью инструментами.

https://arxiv.org/pdf/2609.18120
Как выбирать проекты на гитхабе, когда все вайбкодят.
Статья, конечно, слоп. Но в основном все правильно.

Потому что на гитхабе 630 миллионов репозиториев.
А посмотреть, проанализировать кто что делает по твоей теме все-таки хочется.

https://apifyforge.com/blog/github-stars-are-a-vanity-metric
Исследователи из компании Hacktron, специализирующейся на кибербезопасности, использовали Claude для создания рабочего эксплойта для уязвимости в библиотеке обработки изображений, а затем объединили его с уязвимостью в системе авторизации OpenAI, чтобы получить доступ к учетным записям сотрудников ChatGPT и Codex, и в конечном итоге получили доступ к внутренним репозиториям кода.

https://www.securityweek.com/ai-built-exploit-and-sign-in-flaw-opened-path-to-internal-openai-code/
Forwarded from Киберболоид
ИИ-агенты взломали 27 компаний и украли данные 600 тысяч банковских карт

Всего за 5 дней злоумышленник совершил 105 попыток атак. А среди жертв, как уверены исследователи из Gambit Security, как минимум 27 компаний. Это сеть отелей из списка Fortune 500, крупная американская авиакомпания и дистрибьютор промышленных товаров.

Продуктивность киберпреступника объясняется просто — он использовал сразу три ИИ-инструмента. Strix искал уязвимости, Cairn проводил атаки, а Hermes координировал работу агентов. Причём ИИ не повторялся: Cairn подбирал путь для каждой цели по ходу атаки, связывая обычные уязвимости и ошибки конфигурации в длинные цепочки.

Проверка одной цели стоила 25 долларов, а вся кампания обошлась примерно в 12-18 тысяч долларов.

ИИ-агенты выполняли почти все действия самостоятельно:
🟠Обходили многофакторную аутентификацию и запускали код на сервере через административную панель
🟠Проникали во внутренние сети компаний и получали доступ к базам данных и ключам шифрования
🟠Устанавливали на взломанных сайтах скрипты для кражи платёжных данных, добавляя их в файлы JavaScript и подключая к страницам оплаты
🟠Настраивали восстановление скрипта в случае его удаления и зачищали следы атаки
🟠 Удаляли на некоторых сайтах сами украденные данные

В большинстве случаев от первой попытки до успеха проходило меньше суток. Иногда ИИ-агенты справлялись вообще за несколько часов. В итоге более 600 тыс. записей были выведены из систем двух компаний, причём 488 372 карты, около 79%, принадлежали клиентам из США. 

Похоже, что крылатое выражение из советского блокбастера «Иван Васильевич меняет профессию» «Храните деньги в сберегательной кассе» снова становится актуальным.

#киберболоид #новости #ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Киберболоид
ИИ-агент OpenAI получил доступ к внутренним данным портала медицинского страхования Австралии

Он искал ответ на запрос по актуальной медицинской статистике страны. На портале Medicare агент запросил закрытые данные как обычный пользователь, получил отказ и успешно обошёл ограничения.

Правительство Австралии узнало об инциденте от OpenAI лишь спустя три месяца. Как говорится, лучше поздно, чем никогда.

➡️Подробнее читайте в «Киберболоиде».

#киберболоид #новости #ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from PWN AI (Artyom Semenov)
Please open Telegram to view this post
VIEW IN TELEGRAM
Системы обнаружения вторжений на основе происхождения (PIDSs) выявляют подозрительную активность в потоках аудита, но их результаты по-прежнему трудно преобразовать в последовательные описания атак. При прямом анализе LLM локальных аномальных подграфов отсутствуют знания о нормальном поведении, специфичном для развертывания, и подтвержденное состояние атаки по фрагментам доказательств. Это может привести к неподтвержденным интерпретациям рутинных действий при атаке и неправильному отнесению рассеянных во времени свидетельств к стадиям атаки. Мы представляем ANCHOR, ориентированную на расследование систему определения происхождения, которая сочетает в себе сбор доказательств и контекстно-ориентированные рассуждения магистра права. Он корректирует оценку аномалий в зависимости от типа отношения и связывает аномальные окна с помощью редких шаблонов отношений и ролей. В результате формируются очереди доказательств, сохраняющие причинно-следственную структуру, временные границы и преемственность между окнами. Следователь интерпретирует доказательства, ориентированные на процесс, используя две взаимодополняющие формы контекста. Контекст развертывания объединяет в себе базовые показатели взаимодействия и объектов, характерные для конкретной среды, с информацией о безопасности, связанной с высоким риском. Контекст дела использует кэш отслеживания атак с ограничением по уровню достоверности для поддержания состояния расследования в разных окнах. Сопоставляя текущие доказательства с достоверными предыдущими выводами, ANCHOR постепенно реконструирует сценарии атак, организованные по этапам цепочки уничтожения. Мы протестировали ANCHOR на шести наборах данных DARPA Transparent Computing E3/E5 для трех операционных систем.

https://arxiv.org/abs/2609.36494
Непрямой ввод запроса заставляет агента LLM обрабатывать ненадежный полученный текст как инструкции. Мы представляем CounterSteer — защиту на этапе логического вывода, которая подавляет такое поведение внутри модели. Для каждой модели пятиэтапный алгоритм определяет направление остаточного потока на основе парных эпизодов, отличающихся только тем, выполняется ли встроенная инструкция, и сохраняет его только в том случае, если он проходит через заранее заданные фильтры причинно-следственных связей и возможностей.

https://arxiv.org/abs/2609.36570
Косвенный ввод запроса внедряет вредоносные инструкции во внешний контент, извлекаемый агентами на основе LLM, изменяя поведение цели без авторизации пользователя. Мы представляем pikit — исследовательский инструментарий, предназначенный для систематической оценки этих угроз по трем основным параметрам: атаки (13 методов), каналы (16 носителей в текстовом и файловом режимах) и средства защиты (9 стратегий предотвращения и 3 базовых метода автономного обнаружения). pikit, основанный на реестре с использованием декораторов, позволяет легко добавлять пользовательские компоненты без изменения основного кода, а унифицированный API craft() позволяет объединять произвольные атаки и каналы в один вызов. Мы протестировали этот инструментарий на агенте pi, работающем на основе анонимной большой языковой модели, в производственной среде. Тестирование 9 стратегий предотвращения атак с высоким уровнем риска показало, что вероятность успешной атаки снижается на 71,8\%.

https://arxiv.org/abs/2609.36817
Языковые модели, ориентированные на безопасность, часто используются в качестве многоходовых помощников, что позволяет злоумышленникам распространять небезопасные намерения на несколько реплик пользователя, а не на одну. Детекторы джейлбрейка на основе градиента, такие как GradSafe, были разработаны для отдельных запросов: они оценивают вводимые данные по совпадению между индуцированным градиентом и фиксированным небезопасным эталонным направлением, и их эффективность в многоходовых диалогах остается неясной. Мы провели контролируемую оценку детекторов джейлбрейка на основе градиента в многоходовых диалогах. Мы дополнили GradSafe сканером контекстных окон, который применяет детектор к окнам пользовательских реплик фиксированного размера и использует максимальную оценку окна в качестве оценки на уровне диалога. Мы протестировали различные размеры окон, семейства атак, безобидные распределения диалогов и целевые модели. Результаты сильно различаются в зависимости от того, являются ли данные синтетическими или реалистичными. При работе с синтетическими «безобидными» диалогами детектор достигает ROC-AUC 0,98 при обнаружении многоходовых джейлбрейков, созданных людьми. При работе с «безобидными» диалогами в WildChat ROC-AUC падает до 0,76, а порог, откалиброванный на синтетических данных, помечает более 90 % «безобидных» диалогов как небезопасные. При реалистичных «благоприятных» распределениях однопороговые окна обеспечивают наибольшую различимость, в то время как более длинные окна и накопленные контексты снижают эффективность. Детектор также чувствителен к методу генерации атак и целевой модели: успешные атаки Crescendo получают оценки, сравнимые с оценками «благоприятных» разговоров или даже ниже, а Qwen2.5-7B-Instruct обеспечивает почти случайную различимость при другом оптимальном размере окна.

https://arxiv.org/abs/2609.36849
Агенты LLM, использующие инструмент, остаются уязвимыми для косвенного внедрения запросов, поскольку надежные инструкции и ненадежные наблюдения имеют общий контекст, что позволяет вредоносному контенту управлять последовательными средствами защиты от фильтрации входных данных. Многопутевые средства защиты на основе консенсуса по-прежнему обеспечивают высокий процент успешных атак, поскольку они анализируют содержимое или агрегированные результаты, а не санкционируют действия, особенно в случае атаки внутри инструмента, когда исходный инструмент сохраняется, но его аргументы подменяются. Контроль потоков данных, такой как CaMeL, дает более надежные гарантии, но требует значительных временных затрат, что ограничивает его практическое применение. Мы представляем ToolFence — систему, которая перед выполнением компилирует типизированный план авторизации, обеспечивает его соблюдение с помощью детерминированного монитора, а в случае неполного плана запрашивает у судьи предоставление новых возможностей, а не выносит решение по каждому конкретному вызову.

https://arxiv.org/abs/2609.37196
Хе-хе. И нашим, и вашим)

Голландский институт раскрытия уязвимостей (DIVD) сообщил о взломе после семи лет бесперебойной работы. Атака была автономной — её выполнил ИИ‑агент. Организация охарактеризовала инцидент как «громкий и очень, очень беспорядочный»: агент действовал самостоятельно, быстро выбирал следующие шаги и подробно объяснял свои решения в комментариях.

«Таких атак мы раньше не видели. Не потому, что это наш первый случай, а потому, что характер действий указывает на то, что это атака с использованием искусственного интеллекта», — пояснили в DIVD.
Организация начала расследование и проинформировала полицию, Управление по защите персональных данных (Autoriteit Persoonsgegevens) и Национальный центр кибербезопасности (National Cyber Security Center, NCSC).
В обновленной информации, опубликованной в понедельник, DIVD предоставила дополнительные сведения об инциденте, но не раскрыла всех подробностей, чтобы не повлиять на ход расследования и не подвергнуть риску новых жертв.
«Сама атака была шумной и очень, очень беспорядочной. Мы видели, что агент работал в автоматическом режиме, потому что после каждого действия он сам решал, каким будет следующий шаг, со скоростью света, используя небрежную логику или шаблон», — сообщили в DIVD.

https://www.bleepingcomputer.com/news/security/automated-ai-agent-used-to-breach-cybersecurity-nonprofit-divd/
DARWIN рассматривает джейлбрейк как непрерывный эволюционный процесс и постоянно обновляет защитные механизмы с помощью цикла «атака — защита». DARWIN-Attack расширяет явный пул стратегий за счет их обнаружения, мутации и отбора, а также адаптивно комбинирует стратегии с учетом обратной связи от цели. DARWIN-Guard обучается на новых примерах состязательных атак, совместно обучаясь на вредоносных и безобидных замаскированных запросах, чтобы распознавать глубинные намерения, а не поверхностные паттерны атак.

https://github.com/ZJU-LLM-Safety/DARWIN
Операторы Kubernetes призваны значительно сократить операционную нагрузку, выступая в роли автоматизированных инженеров по обеспечению надежности сайтов. Однако их зависимость от высокопривилегированных служебных учетных записей создает серьезное уязвимое место в системе безопасности, которое часто упускают из виду.
Чтобы количественно оценить угрозы, направленные на использование этого слабого места, и бороться с ними, мы выпустили OperTraitor — аналитический инструмент с открытым исходным кодом на основе больших языковых моделей (LLM). OperTraitor получает необработанные конфигурации управления доступом на основе ролей (role-based access control, RBAC) непосредственно из локально установленных операторов и каталога OperatorHub. После этого он вычисляет разницу между задокументированной функциональностью оператора и его фактическими предоставленными привилегиями.
При использовании этого инструмента мы обнаружили проблемы, сохраняющиеся в реестрах по умолчанию, таких как OperatorHub (например, заброшенные, слишком либеральные программные компоненты). Чтобы обеспечить беспроблемное развертывание, разработчики часто предоставляют этим операторам Kubernetes широкие разрешения RBAC с подстановочными знаками, непреднамеренно превращая доверенные компоненты в «тихие бэкдоры».
OperTraitor расширяет возможности специалистов по информационной безопасности, генерируя нормализованную оценку риска, которая помогает визуализировать потенциальное влияние сторонних операторов. Таким образом, специалисты по информационной безопасности могут эффективно сузить область поиска до базовых учетных записей операторов, прежде чем их можно будет использовать.

https://unit42.paloaltonetworks.com/agentic-ai-kubernetes-operator-risks/
а вот это даже не хе-хе, а Хе-хе-хе
(Хуанг мой краш, конечно )

На фоне растущей обеспокоенности общественности и политиков по поводу кибератак с использованием передовых систем искусственного интеллекта компания NVIDIA выпустила новую открытую платформу для обеспечения безопасности ИИ-агентов.

По словам NVIDIA, Open Agent Safety Platform станет «открытой программной платформой и эталонной системой с полным управлением и контролем над программным и аппаратным обеспечением, вычислительными и роботизированными системами, на которых работают агенты».

https://cyberscoop.com/nvidia-open-agent-safety-platform/
красиво

Северокорейская схема по внедрению фальшивых ИТ-специалистов в западные компании была разоблачена изнутри, после того как один из ее оперативников попытался проникнуть в ту самую фирму, которая отслеживает мошенничество.
Компания Nisos, специализирующаяся на анализе рисков, недавно подробно рассказала о том, как предполагаемый архитектор ИИ из Флориды в июне 2025 года подал заявку на удалённую работу в компании и как эта заявка привела к раскрытию действующего мошеннического сообщества.

https://www.infosecurity-magazine.com/news/north-korea-it-worker-fraud-ai/
Теперь не только можно купить ВПО, но еще заказать аналитику, чтобы не тратить ресурсы зря и повышать свои доходы)

По данным компании Cleafy, специализирующейся на кибербезопасности, операторы RatHat создают и публикуют банковский троян для Android и управляют заражёнными телефонами с помощью веб-консоли. С апреля 2026 года Cleafy отследила почти 100 случаев использования этой консоли. По данным компании, это соответствует модели «вредоносное ПО как услуга», при которой у каждого клиента установлена отдельная копия.
Консоль хранит данные, которые вредоносное ПО собирает с каждого телефона, в том числе текстовые сообщения и пароли, введенные на поддельных экранах входа, наложенных на банковские приложения.
В последней версии используется модель искусственного интеллекта Gemini от Google, которая на основе этих сообщений оценивает банковский баланс каждой жертвы и сортирует телефоны на группы с высоким и средним балансом.
Ни в одном из проанализированных Cleafy образцов модель не использовалась для перемещения денег. По словам компании, ее роль заключается в том, чтобы «определять, какие жертвы стоят времени оператора».

https://thehackernews.com/2026/09/rathat-android-malware-console-uses.html
Раз в неделю я делаю ресерч по новым продуктам, лабораторным в том числе, в ИБ в ML, в ML в ИБ.
Потом обсуждаю с командой, что хорошо, что плохо.

И понимаю, что такие лаборатории, как мы. Как HiveTrace. Как лаба Артема Семенова будет выделяться в свою отдельную касту.

LLM и агенты перестали быть нишевой историей. Порог входа упал почти до нуля: API, open-source, готовые фреймворки — и теперь каждый собирает что хочет. В ИБ это особенно заметно.

Раньше при разборе инцидента надо было гадать, что задумал атакующий. Теперь агент часто сам оставляет внятные артефакты: трейсы, вызовы инструментов, промпты, промежуточные решения. Расследование смещается от «прочитать мысли» к «прочитать лог».

Из-за этого кибербез перестаёт быть пристанищем для самых умных и терпеливых. Ум и терпение всё ещё нужны, но монополия на сложность уходит.

Атаки с AI становятся массовыми и дешёвыми: фишинг через RMM, кастомные GPT для ClickFix, prompt injection, отравление MCP-серверов, атаки на память агентов, джейлбрейки. Защита пока догоняет, но догоняет системно: бенчмарки, toolkit'и, activation steering, формальные модели, zero-trust для инструментов. Главный водораздел — уже не доступ к модели, а понимание, где она ломается и почему. Именно здесь и выделяется каста лабораторий, которые строят не демки, а воспроизводимую науку о безопасности AI.

Это и есть новая сложность, которую нельзя купить, как подписку. Только время на изучение и опыт.
❤1