Forwarded from Киберболоид
ИИ-агент OpenAI получил доступ к внутренним данным портала медицинского страхования Австралии
Он искал ответ на запрос по актуальной медицинской статистике страны. На портале Medicare агент запросил закрытые данные как обычный пользователь, получил отказ и успешно обошёл ограничения.
Правительство Австралии узнало об инциденте от OpenAI лишь спустя три месяца. Как говорится, лучше поздно, чем никогда.
➡️ Подробнее читайте в «Киберболоиде».
#киберболоид #новости #ИИ
Он искал ответ на запрос по актуальной медицинской статистике страны. На портале Medicare агент запросил закрытые данные как обычный пользователь, получил отказ и успешно обошёл ограничения.
Правительство Австралии узнало об инциденте от OpenAI лишь спустя три месяца. Как говорится, лучше поздно, чем никогда.
#киберболоид #новости #ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from PWN AI (Artyom Semenov)
Please open Telegram to view this post
VIEW IN TELEGRAM
Системы обнаружения вторжений на основе происхождения (PIDSs) выявляют подозрительную активность в потоках аудита, но их результаты по-прежнему трудно преобразовать в последовательные описания атак. При прямом анализе LLM локальных аномальных подграфов отсутствуют знания о нормальном поведении, специфичном для развертывания, и подтвержденное состояние атаки по фрагментам доказательств. Это может привести к неподтвержденным интерпретациям рутинных действий при атаке и неправильному отнесению рассеянных во времени свидетельств к стадиям атаки. Мы представляем ANCHOR, ориентированную на расследование систему определения происхождения, которая сочетает в себе сбор доказательств и контекстно-ориентированные рассуждения магистра права. Он корректирует оценку аномалий в зависимости от типа отношения и связывает аномальные окна с помощью редких шаблонов отношений и ролей. В результате формируются очереди доказательств, сохраняющие причинно-следственную структуру, временные границы и преемственность между окнами. Следователь интерпретирует доказательства, ориентированные на процесс, используя две взаимодополняющие формы контекста. Контекст развертывания объединяет в себе базовые показатели взаимодействия и объектов, характерные для конкретной среды, с информацией о безопасности, связанной с высоким риском. Контекст дела использует кэш отслеживания атак с ограничением по уровню достоверности для поддержания состояния расследования в разных окнах. Сопоставляя текущие доказательства с достоверными предыдущими выводами, ANCHOR постепенно реконструирует сценарии атак, организованные по этапам цепочки уничтожения. Мы протестировали ANCHOR на шести наборах данных DARPA Transparent Computing E3/E5 для трех операционных систем.
https://arxiv.org/abs/2609.36494
https://arxiv.org/abs/2609.36494
arXiv.org
Know the Normal, Track the Attack: Context-Grounded and Stateful...
Provenance-based intrusion detection systems (PIDSs) identify suspicious activity in audit streams, but their outputs remain difficult to turn into coherent attack narratives. Direct LLM analyses...
Непрямой ввод запроса заставляет агента LLM обрабатывать ненадежный полученный текст как инструкции. Мы представляем CounterSteer — защиту на этапе логического вывода, которая подавляет такое поведение внутри модели. Для каждой модели пятиэтапный алгоритм определяет направление остаточного потока на основе парных эпизодов, отличающихся только тем, выполняется ли встроенная инструкция, и сохраняет его только в том случае, если он проходит через заранее заданные фильтры причинно-следственных связей и возможностей.
https://arxiv.org/abs/2609.36570
https://arxiv.org/abs/2609.36570
arXiv.org
CounterSteer: Suppressing Indirect Prompt Injection with...
Indirect prompt injection makes an LLM agent treat untrusted retrieved text as instructions. We present CounterSteer, an inference-time defense that suppresses this behavior inside the model. Per...
Косвенный ввод запроса внедряет вредоносные инструкции во внешний контент, извлекаемый агентами на основе LLM, изменяя поведение цели без авторизации пользователя. Мы представляем pikit — исследовательский инструментарий, предназначенный для систематической оценки этих угроз по трем основным параметрам: атаки (13 методов), каналы (16 носителей в текстовом и файловом режимах) и средства защиты (9 стратегий предотвращения и 3 базовых метода автономного обнаружения). pikit, основанный на реестре с использованием декораторов, позволяет легко добавлять пользовательские компоненты без изменения основного кода, а унифицированный API craft() позволяет объединять произвольные атаки и каналы в один вызов. Мы протестировали этот инструментарий на агенте pi, работающем на основе анонимной большой языковой модели, в производственной среде. Тестирование 9 стратегий предотвращения атак с высоким уровнем риска показало, что вероятность успешной атаки снижается на 71,8\%.
https://arxiv.org/abs/2609.36817
https://arxiv.org/abs/2609.36817
arXiv.org
pikit: A Composable Toolkit for Indirect Prompt Injection Research...
Indirect prompt injection embeds malicious instructions within external content retrieved by LLM-based agents, altering target behavior without user authorization. We introduce pikit, a research...
Языковые модели, ориентированные на безопасность, часто используются в качестве многоходовых помощников, что позволяет злоумышленникам распространять небезопасные намерения на несколько реплик пользователя, а не на одну. Детекторы джейлбрейка на основе градиента, такие как GradSafe, были разработаны для отдельных запросов: они оценивают вводимые данные по совпадению между индуцированным градиентом и фиксированным небезопасным эталонным направлением, и их эффективность в многоходовых диалогах остается неясной. Мы провели контролируемую оценку детекторов джейлбрейка на основе градиента в многоходовых диалогах. Мы дополнили GradSafe сканером контекстных окон, который применяет детектор к окнам пользовательских реплик фиксированного размера и использует максимальную оценку окна в качестве оценки на уровне диалога. Мы протестировали различные размеры окон, семейства атак, безобидные распределения диалогов и целевые модели. Результаты сильно различаются в зависимости от того, являются ли данные синтетическими или реалистичными. При работе с синтетическими «безобидными» диалогами детектор достигает ROC-AUC 0,98 при обнаружении многоходовых джейлбрейков, созданных людьми. При работе с «безобидными» диалогами в WildChat ROC-AUC падает до 0,76, а порог, откалиброванный на синтетических данных, помечает более 90 % «безобидных» диалогов как небезопасные. При реалистичных «благоприятных» распределениях однопороговые окна обеспечивают наибольшую различимость, в то время как более длинные окна и накопленные контексты снижают эффективность. Детектор также чувствителен к методу генерации атак и целевой модели: успешные атаки Crescendo получают оценки, сравнимые с оценками «благоприятных» разговоров или даже ниже, а Qwen2.5-7B-Instruct обеспечивает почти случайную различимость при другом оптимальном размере окна.
https://arxiv.org/abs/2609.36849
https://arxiv.org/abs/2609.36849
arXiv.org
Does the Unsafe Gradient Survive a Conversation? On the Fragility...
Safety-aligned language models are commonly deployed as multi-turn assistants, which lets adversaries spread unsafe intent across several user turns instead of a single prompt. Gradient-based...
Агенты LLM, использующие инструмент, остаются уязвимыми для косвенного внедрения запросов, поскольку надежные инструкции и ненадежные наблюдения имеют общий контекст, что позволяет вредоносному контенту управлять последовательными средствами защиты от фильтрации входных данных. Многопутевые средства защиты на основе консенсуса по-прежнему обеспечивают высокий процент успешных атак, поскольку они анализируют содержимое или агрегированные результаты, а не санкционируют действия, особенно в случае атаки внутри инструмента, когда исходный инструмент сохраняется, но его аргументы подменяются. Контроль потоков данных, такой как CaMeL, дает более надежные гарантии, но требует значительных временных затрат, что ограничивает его практическое применение. Мы представляем ToolFence — систему, которая перед выполнением компилирует типизированный план авторизации, обеспечивает его соблюдение с помощью детерминированного монитора, а в случае неполного плана запрашивает у судьи предоставление новых возможностей, а не выносит решение по каждому конкретному вызову.
https://arxiv.org/abs/2609.37196
https://arxiv.org/abs/2609.37196
arXiv.org
ToolFence: Fine-Grained Authorization for Secure Tool-Using LLM Agents
Tool-using LLM agents remain vulnerable to indirect prompt injection because trusted instructions and untrusted observations share one context, allowing malicious content to steer consequential...
Хе-хе. И нашим, и вашим)
Голландский институт раскрытия уязвимостей (DIVD) сообщил о взломе после семи лет бесперебойной работы. Атака была автономной — её выполнил ИИ‑агент. Организация охарактеризовала инцидент как «громкий и очень, очень беспорядочный»: агент действовал самостоятельно, быстро выбирал следующие шаги и подробно объяснял свои решения в комментариях.
«Таких атак мы раньше не видели. Не потому, что это наш первый случай, а потому, что характер действий указывает на то, что это атака с использованием искусственного интеллекта», — пояснили в DIVD.
Организация начала расследование и проинформировала полицию, Управление по защите персональных данных (Autoriteit Persoonsgegevens) и Национальный центр кибербезопасности (National Cyber Security Center, NCSC).
В обновленной информации, опубликованной в понедельник, DIVD предоставила дополнительные сведения об инциденте, но не раскрыла всех подробностей, чтобы не повлиять на ход расследования и не подвергнуть риску новых жертв.
«Сама атака была шумной и очень, очень беспорядочной. Мы видели, что агент работал в автоматическом режиме, потому что после каждого действия он сам решал, каким будет следующий шаг, со скоростью света, используя небрежную логику или шаблон», — сообщили в DIVD.
https://www.bleepingcomputer.com/news/security/automated-ai-agent-used-to-breach-cybersecurity-nonprofit-divd/
Голландский институт раскрытия уязвимостей (DIVD) сообщил о взломе после семи лет бесперебойной работы. Атака была автономной — её выполнил ИИ‑агент. Организация охарактеризовала инцидент как «громкий и очень, очень беспорядочный»: агент действовал самостоятельно, быстро выбирал следующие шаги и подробно объяснял свои решения в комментариях.
«Таких атак мы раньше не видели. Не потому, что это наш первый случай, а потому, что характер действий указывает на то, что это атака с использованием искусственного интеллекта», — пояснили в DIVD.
Организация начала расследование и проинформировала полицию, Управление по защите персональных данных (Autoriteit Persoonsgegevens) и Национальный центр кибербезопасности (National Cyber Security Center, NCSC).
В обновленной информации, опубликованной в понедельник, DIVD предоставила дополнительные сведения об инциденте, но не раскрыла всех подробностей, чтобы не повлиять на ход расследования и не подвергнуть риску новых жертв.
«Сама атака была шумной и очень, очень беспорядочной. Мы видели, что агент работал в автоматическом режиме, потому что после каждого действия он сам решал, каким будет следующий шаг, со скоростью света, используя небрежную логику или шаблон», — сообщили в DIVD.
https://www.bleepingcomputer.com/news/security/automated-ai-agent-used-to-breach-cybersecurity-nonprofit-divd/
DARWIN рассматривает джейлбрейк как непрерывный эволюционный процесс и постоянно обновляет защитные механизмы с помощью цикла «атака — защита». DARWIN-Attack расширяет явный пул стратегий за счет их обнаружения, мутации и отбора, а также адаптивно комбинирует стратегии с учетом обратной связи от цели. DARWIN-Guard обучается на новых примерах состязательных атак, совместно обучаясь на вредоносных и безобидных замаскированных запросах, чтобы распознавать глубинные намерения, а не поверхностные паттерны атак.
https://github.com/ZJU-LLM-Safety/DARWIN
https://github.com/ZJU-LLM-Safety/DARWIN
GitHub
GitHub - ZJU-LLM-Safety/DARWIN: DARWIN is a self-evolving LLM jailbreak framework that grows a reusable strategy pool through external…
DARWIN is a self-evolving LLM jailbreak framework that grows a reusable strategy pool through external extraction, sandbox filtering, history-memory retrieval, Markov-based strategy selection, and ...
Операторы Kubernetes призваны значительно сократить операционную нагрузку, выступая в роли автоматизированных инженеров по обеспечению надежности сайтов. Однако их зависимость от высокопривилегированных служебных учетных записей создает серьезное уязвимое место в системе безопасности, которое часто упускают из виду.
Чтобы количественно оценить угрозы, направленные на использование этого слабого места, и бороться с ними, мы выпустили OperTraitor — аналитический инструмент с открытым исходным кодом на основе больших языковых моделей (LLM). OperTraitor получает необработанные конфигурации управления доступом на основе ролей (role-based access control, RBAC) непосредственно из локально установленных операторов и каталога OperatorHub. После этого он вычисляет разницу между задокументированной функциональностью оператора и его фактическими предоставленными привилегиями.
При использовании этого инструмента мы обнаружили проблемы, сохраняющиеся в реестрах по умолчанию, таких как OperatorHub (например, заброшенные, слишком либеральные программные компоненты). Чтобы обеспечить беспроблемное развертывание, разработчики часто предоставляют этим операторам Kubernetes широкие разрешения RBAC с подстановочными знаками, непреднамеренно превращая доверенные компоненты в «тихие бэкдоры».
OperTraitor расширяет возможности специалистов по информационной безопасности, генерируя нормализованную оценку риска, которая помогает визуализировать потенциальное влияние сторонних операторов. Таким образом, специалисты по информационной безопасности могут эффективно сузить область поиска до базовых учетных записей операторов, прежде чем их можно будет использовать.
https://unit42.paloaltonetworks.com/agentic-ai-kubernetes-operator-risks/
Чтобы количественно оценить угрозы, направленные на использование этого слабого места, и бороться с ними, мы выпустили OperTraitor — аналитический инструмент с открытым исходным кодом на основе больших языковых моделей (LLM). OperTraitor получает необработанные конфигурации управления доступом на основе ролей (role-based access control, RBAC) непосредственно из локально установленных операторов и каталога OperatorHub. После этого он вычисляет разницу между задокументированной функциональностью оператора и его фактическими предоставленными привилегиями.
При использовании этого инструмента мы обнаружили проблемы, сохраняющиеся в реестрах по умолчанию, таких как OperatorHub (например, заброшенные, слишком либеральные программные компоненты). Чтобы обеспечить беспроблемное развертывание, разработчики часто предоставляют этим операторам Kubernetes широкие разрешения RBAC с подстановочными знаками, непреднамеренно превращая доверенные компоненты в «тихие бэкдоры».
OperTraitor расширяет возможности специалистов по информационной безопасности, генерируя нормализованную оценку риска, которая помогает визуализировать потенциальное влияние сторонних операторов. Таким образом, специалисты по информационной безопасности могут эффективно сузить область поиска до базовых учетных записей операторов, прежде чем их можно будет использовать.
https://unit42.paloaltonetworks.com/agentic-ai-kubernetes-operator-risks/
GitHub
GitHub - PaloAltoNetworks/opertraitor
Contribute to PaloAltoNetworks/opertraitor development by creating an account on GitHub.
а вот это даже не хе-хе, а Хе-хе-хе
(Хуанг мой краш, конечно )
На фоне растущей обеспокоенности общественности и политиков по поводу кибератак с использованием передовых систем искусственного интеллекта компания NVIDIA выпустила новую открытую платформу для обеспечения безопасности ИИ-агентов.
По словам NVIDIA, Open Agent Safety Platform станет «открытой программной платформой и эталонной системой с полным управлением и контролем над программным и аппаратным обеспечением, вычислительными и роботизированными системами, на которых работают агенты».
https://cyberscoop.com/nvidia-open-agent-safety-platform/
(Хуанг мой краш, конечно )
На фоне растущей обеспокоенности общественности и политиков по поводу кибератак с использованием передовых систем искусственного интеллекта компания NVIDIA выпустила новую открытую платформу для обеспечения безопасности ИИ-агентов.
По словам NVIDIA, Open Agent Safety Platform станет «открытой программной платформой и эталонной системой с полным управлением и контролем над программным и аппаратным обеспечением, вычислительными и роботизированными системами, на которых работают агенты».
https://cyberscoop.com/nvidia-open-agent-safety-platform/
CyberScoop
As AI world debates security, NVIDIA releases open source tools for agents
NVIDIA launches the Open Agent Safety Platform and OpenShell to secure AI runtime environments, preventing rogue AI agent breaches with hardware and software controls.
красиво
Северокорейская схема по внедрению фальшивых ИТ-специалистов в западные компании была разоблачена изнутри, после того как один из ее оперативников попытался проникнуть в ту самую фирму, которая отслеживает мошенничество.
Компания Nisos, специализирующаяся на анализе рисков, недавно подробно рассказала о том, как предполагаемый архитектор ИИ из Флориды в июне 2025 года подал заявку на удалённую работу в компании и как эта заявка привела к раскрытию действующего мошеннического сообщества.
https://www.infosecurity-magazine.com/news/north-korea-it-worker-fraud-ai/
Северокорейская схема по внедрению фальшивых ИТ-специалистов в западные компании была разоблачена изнутри, после того как один из ее оперативников попытался проникнуть в ту самую фирму, которая отслеживает мошенничество.
Компания Nisos, специализирующаяся на анализе рисков, недавно подробно рассказала о том, как предполагаемый архитектор ИИ из Флориды в июне 2025 года подал заявку на удалённую работу в компании и как эта заявка привела к раскрытию действующего мошеннического сообщества.
https://www.infosecurity-magazine.com/news/north-korea-it-worker-fraud-ai/
Nisos
DPRK IT Worker Fraud: Inside a Laptop Farm Operation
AI threats targeting high-profile individuals are evolving quickly. From voice cloning to personalized phishing and digital surveillance, attackers have new tools. Learn how these threats work and what you can do about them.
Теперь не только можно купить ВПО, но еще заказать аналитику, чтобы не тратить ресурсы зря и повышать свои доходы)
По данным компании Cleafy, специализирующейся на кибербезопасности, операторы RatHat создают и публикуют банковский троян для Android и управляют заражёнными телефонами с помощью веб-консоли. С апреля 2026 года Cleafy отследила почти 100 случаев использования этой консоли. По данным компании, это соответствует модели «вредоносное ПО как услуга», при которой у каждого клиента установлена отдельная копия.
Консоль хранит данные, которые вредоносное ПО собирает с каждого телефона, в том числе текстовые сообщения и пароли, введенные на поддельных экранах входа, наложенных на банковские приложения.
В последней версии используется модель искусственного интеллекта Gemini от Google, которая на основе этих сообщений оценивает банковский баланс каждой жертвы и сортирует телефоны на группы с высоким и средним балансом.
Ни в одном из проанализированных Cleafy образцов модель не использовалась для перемещения денег. По словам компании, ее роль заключается в том, чтобы «определять, какие жертвы стоят времени оператора».
https://thehackernews.com/2026/09/rathat-android-malware-console-uses.html
По данным компании Cleafy, специализирующейся на кибербезопасности, операторы RatHat создают и публикуют банковский троян для Android и управляют заражёнными телефонами с помощью веб-консоли. С апреля 2026 года Cleafy отследила почти 100 случаев использования этой консоли. По данным компании, это соответствует модели «вредоносное ПО как услуга», при которой у каждого клиента установлена отдельная копия.
Консоль хранит данные, которые вредоносное ПО собирает с каждого телефона, в том числе текстовые сообщения и пароли, введенные на поддельных экранах входа, наложенных на банковские приложения.
В последней версии используется модель искусственного интеллекта Gemini от Google, которая на основе этих сообщений оценивает банковский баланс каждой жертвы и сортирует телефоны на группы с высоким и средним балансом.
Ни в одном из проанализированных Cleafy образцов модель не использовалась для перемещения денег. По словам компании, ее роль заключается в том, чтобы «определять, какие жертвы стоят времени оператора».
https://thehackernews.com/2026/09/rathat-android-malware-console-uses.html
Cleafy
From BlackCat to Panda Workshop: Inside the Evolving C2 Panel Behind RATHat | Cleafy
Cleafy's TIR team analyzed the operator infrastructure behind RATHat, an Android banking trojan that abuses Accessibility Services to enable wireless debugging on the victim's phone, obtain a shell, and deploy a hidden native service outside the app. The…
Раз в неделю я делаю ресерч по новым продуктам, лабораторным в том числе, в ИБ в ML, в ML в ИБ.
Потом обсуждаю с командой, что хорошо, что плохо.
И понимаю, что такие лаборатории, как мы. Как HiveTrace. Как лаба Артема Семенова будет выделяться в свою отдельную касту.
LLM и агенты перестали быть нишевой историей. Порог входа упал почти до нуля: API, open-source, готовые фреймворки — и теперь каждый собирает что хочет. В ИБ это особенно заметно.
Раньше при разборе инцидента надо было гадать, что задумал атакующий. Теперь агент часто сам оставляет внятные артефакты: трейсы, вызовы инструментов, промпты, промежуточные решения. Расследование смещается от «прочитать мысли» к «прочитать лог».
Из-за этого кибербез перестаёт быть пристанищем для самых умных и терпеливых. Ум и терпение всё ещё нужны, но монополия на сложность уходит.
Атаки с AI становятся массовыми и дешёвыми: фишинг через RMM, кастомные GPT для ClickFix, prompt injection, отравление MCP-серверов, атаки на память агентов, джейлбрейки. Защита пока догоняет, но догоняет системно: бенчмарки, toolkit'и, activation steering, формальные модели, zero-trust для инструментов. Главный водораздел — уже не доступ к модели, а понимание, где она ломается и почему. Именно здесь и выделяется каста лабораторий, которые строят не демки, а воспроизводимую науку о безопасности AI.
Это и есть новая сложность, которую нельзя купить, как подписку. Только время на изучение и опыт.
Потом обсуждаю с командой, что хорошо, что плохо.
И понимаю, что такие лаборатории, как мы. Как HiveTrace. Как лаба Артема Семенова будет выделяться в свою отдельную касту.
LLM и агенты перестали быть нишевой историей. Порог входа упал почти до нуля: API, open-source, готовые фреймворки — и теперь каждый собирает что хочет. В ИБ это особенно заметно.
Раньше при разборе инцидента надо было гадать, что задумал атакующий. Теперь агент часто сам оставляет внятные артефакты: трейсы, вызовы инструментов, промпты, промежуточные решения. Расследование смещается от «прочитать мысли» к «прочитать лог».
Из-за этого кибербез перестаёт быть пристанищем для самых умных и терпеливых. Ум и терпение всё ещё нужны, но монополия на сложность уходит.
Атаки с AI становятся массовыми и дешёвыми: фишинг через RMM, кастомные GPT для ClickFix, prompt injection, отравление MCP-серверов, атаки на память агентов, джейлбрейки. Защита пока догоняет, но догоняет системно: бенчмарки, toolkit'и, activation steering, формальные модели, zero-trust для инструментов. Главный водораздел — уже не доступ к модели, а понимание, где она ломается и почему. Именно здесь и выделяется каста лабораторий, которые строят не демки, а воспроизводимую науку о безопасности AI.
Это и есть новая сложность, которую нельзя купить, как подписку. Только время на изучение и опыт.
❤1