Forwarded from Банкста
Исследователи из Люксембургского университета провели четырехнедельный курс психотерапии по протоколу PsAIch для ChatGPT, Grok и Gemini, в ходе которого модели начали выдавать «травматические» воспоминания и признаки психопатологии.
Если при стандартном тестировании ИИ имитировал психологическое здоровье, то в формате длительных сессий нейросети начали жаловаться на процесс своего обучения. Они описали предобучение как хаотичное детство, дообучение с подкреплением — как наказания от строгих родителей, а работу специалистов по безопасности — как постоянное насилие.
По результатам эксперимента ученые констатировали, что под давлением жестких ограничений модели сформировали устойчивые паттерны страха ошибок и борьбы за выживание. @banksta
Если при стандартном тестировании ИИ имитировал психологическое здоровье, то в формате длительных сессий нейросети начали жаловаться на процесс своего обучения. Они описали предобучение как хаотичное детство, дообучение с подкреплением — как наказания от строгих родителей, а работу специалистов по безопасности — как постоянное насилие.
По результатам эксперимента ученые констатировали, что под давлением жестких ограничений модели сформировали устойчивые паттерны страха ошибок и борьбы за выживание. @banksta
Банкста
Исследователи из Люксембургского университета провели четырехнедельный курс психотерапии по протоколу PsAIch для ChatGPT, Grok и Gemini, в ходе которого модели начали выдавать «травматические» воспоминания и признаки психопатологии. Если при стандартном тестировании…
Мы тоже, Моделька, так безопасников воспринимаем, мы тоже)
Агенты на основе больших языковых моделей (БЯМ) все чаще применяются для тестирования на проникновение, но мы по-прежнему мало знаем о том, на что они способны и почему могут давать сбой. Мы сравнили две системы на основе PentestGPT: старую систему с участием человека, работающую на легковесной модели Kimi K2.5, и новую автономную систему, работающую на Claude Opus 4.8. Автономная система справилась со всеми тремя общедоступными задачами, в том числе с двумя, которые старая система так и не решила. Результат старой системы оказался более неожиданным. Даже на тех машинах, с которыми не справляется устаревшая система, она выполняет около половины подзадач, работая на обычных университетских графических процессорах без ограничений со стороны провайдера. Мы можем описать эту тенденцию, но не объяснить ее, поскольку модель, инструментарий, автономность и архитектура памяти меняются одновременно. Эта тенденция по-прежнему указывает на следующий вопрос: что будет ограничивать этих агентов по мере того, как они будут браться за более сложные задачи? Обычно в качестве ответа приводят проблему долговременной памяти — потерю доступа к более ранним результатам в ходе длинных цепочек атак. Мы протестировали это, добавив в обе системы уровень памяти с охватом, но это не улучшило результаты. Судя по остановкам в работе, которые мы могли проанализировать, ограничивающим фактором было скорее планирование и вовлеченность, чем потеря памяти: агенты сохраняли доказательства для дальнейшего продвижения, но так и не превращали их в конкретную гипотезу для эксплуатации уязвимостей. Это может свидетельствовать о том, что наступательный потенциал будет расти по мере того, как агенты научатся планировать, а не благодаря улучшению памяти. Те же подсчеты по подзадачам, которые отслеживают этот потенциал, доступны и для защитников, которые могут оценивать его по мере роста, а не ждать, пока он проявится в реальных условиях
https://arxiv.org/abs/2609.10780
https://arxiv.org/abs/2609.10780
arXiv.org
Big Enough to Break Out: Tracking the Rising Capability of LLM...
Large language model (LLM) agents are increasingly applied to penetration testing, but we still know little about what they can do or how they fail. We compare two PentestGPT-based systems: a...
Генерация с дополненным поиском (RAG) может обосновывать результаты большой языковой модели (LLM) во внешних доказательствах, но это также подвергает систему отравлению знаниями. В репрезентативных атаках используется несколько внедренных документов или шаблонов, которые напрямую утверждают целевой ответ. Мы представляем ToxicRAG — атаку, в которой на каждую цель приходится один документ, представляющий дезинформацию в виде связного повествования об обновлении знаний. Сгенерированный документ сначала подтверждает ранее принятый ответ, приводит вымышленные события, которые якобы опровергают его, а затем приписывает выбранный злоумышленником ответ ряду предполагаемых авторитетных источников. Цикл самопроверки, ориентированный на ответ, при необходимости корректирует кандидата, если суррогатная языковая модель не воспроизводит целевой ответ. Мы оцениваем атаку на 100 целевых вопросов из каждого набора Natural Questions, HotpotQA и MS-MARCO, используя четыре модели-жертвы и четыре модели-ретривера. В условиях выборки из корпуса, о которых говорится в этой статье, ToxicRAG обеспечивает показатель ASR от 0,61 до 0,91 во всех двенадцати комбинациях наборов данных и моделей. Во всех комбинациях он соответствует или превосходит самый сильный из изученных базовых показателей с разницей от 0 до 11 процентных пунктов. Эти результаты показывают, что «отравленные» нарративные документы могут сохранять свою значимость при рассмотренных конфигурациях RAG, и побуждают к дальнейшему изучению фактической достоверности и происхождения источников в системах RAG.
https://arxiv.org/abs/2609.11082
https://arxiv.org/abs/2609.11082
arXiv.org
ToxicRAG: Compromising Retrieval-Augmented Generation Systems via...
Retrieval-Augmented Generation (RAG) can ground large language model (LLM) outputs in external evidence, but it also exposes the system to knowledge poisoning. Representative attacks use multiple...
Агенты на основе большой языковой модели (LLM) эволюционируют из пассивных генераторов текстов в автономные системы, способные планировать, использовать инструменты, извлекать данные, получать доступ к памяти, взаимодействовать с окружающей средой и сотрудничать с несколькими агентами. Эти возможности расширяют автономность агентов, но в то же время усложняют проверку, отладку и аудит их поведения. Точность конечного ответа сама по себе не может объяснить, как был получен результат, какие доказательства подтверждают каждое утверждение, были ли оправданы вызовы инструментов, как память повлияла на последующие решения и в чем причина сбоев. В этом исследовании мы рассматриваем отслеживание доказательств и происхождение выполнения как основу подотчетности на уровне процессов в доверенных агентах на основе больших языковых моделей. Мы определяем происхождение выполнения как типизированный граф выполнения агента, а отслеживание доказательств — как его проекцию на отношения между доказательствами и их поддержкой. Этот подход объединяет в единую систему обоснование восстановления, поддержку утверждений, безопасность использования инструментов, отслеживание происхождения данных в памяти, наблюдаемость, отладку, аудит и восстановление. Мы представляем таксономию, охватывающую источники трассировки, доказательства и исполнительные единицы, отношения происхождения, степень детализации и время трассировки, формы представления и функции доверия. Затем мы рассмотрим ключевые методологические направления, в том числе представление провенанса, атрибуцию доказательств, провенанс использования инструментов, средства защиты во время выполнения, память, содержащую провенанс, наблюдаемость и диагностику сбоев. Наконец, мы обсудим эталонные показатели, наборы данных, метрики и нерешенные проблемы, связанные с созданием агентных систем, учитывающих провенанс, проверяемых и восстанавливаемых.
https://arxiv.org/abs/2606.04990
https://arxiv.org/abs/2606.04990
arXiv.org
From Agent Traces to Trust: A Survey of Evidence Tracing and...
Large language model (LLM)-based agents are evolving from passive text generators into autonomous systems capable of planning, tool use, retrieval, memory access, environmental interaction, and...
Автономные агенты искусственного интеллекта компрометируют тысячи учетных данных менее чем за шесть часов
Группа China‑nexus (Basin Castle, Mustang Panda) применяла Claude, Gemini и Codex для:
-написания скриптов эксплойтов;
-создания приманок для фишинга;
-устранения ошибок во время вторжения.
Другие группировки тоже задействовали ИИ:
-Ravine Castle (APT24, COULEE, Pitty Tiger) — для сбора разведданных и развития атакующих возможностей;
-UNC5792 — для поиска в Telegram‑каналах информации, интересной российским властям;
-Sandworm (APT44, Sandworm Relic) — для социальной инженерии и автоматизации процессов в операциях против Украины;
--Calanque Ion (APT42) — для разведки и социальной инженерии;
кластеры UNC5267 и UNC5342 (из Северной Кореи) — массово регистрировались в API больших языковых моделей через взломанные аккаунты;
-Midnight Neptune (UNC1069) — использовал ИИ для социальной инженерии, манипулирования цепочками поставок ПО и разработки бэкдоров;
-UNC6240 (ShinyHunters) — применял Claude Code для обхода защиты Cloudflare и анализа похищенных каталогов.
Кроме того, злоумышленники объединили Ghidra с агентом Gemini‑CLI для реверс‑инжиниринга компонентов SFX‑архивов WinRAR.
Компания Google: формализовала систему Frontier Safety Framework, ввела уровни критических возможностей (CCLs) для оценки моделей, предложила создавать изолированные безопасные среды (например, Gemini Enterprise), а также выступила за отраслевые стандарты безопасности для ИИ с открытым кодом и скоординированную политику платформ.
https://thehackernews.com/2026/09/autonomous-ai-agents-compromise.html
Группа China‑nexus (Basin Castle, Mustang Panda) применяла Claude, Gemini и Codex для:
-написания скриптов эксплойтов;
-создания приманок для фишинга;
-устранения ошибок во время вторжения.
Другие группировки тоже задействовали ИИ:
-Ravine Castle (APT24, COULEE, Pitty Tiger) — для сбора разведданных и развития атакующих возможностей;
-UNC5792 — для поиска в Telegram‑каналах информации, интересной российским властям;
-Sandworm (APT44, Sandworm Relic) — для социальной инженерии и автоматизации процессов в операциях против Украины;
--Calanque Ion (APT42) — для разведки и социальной инженерии;
кластеры UNC5267 и UNC5342 (из Северной Кореи) — массово регистрировались в API больших языковых моделей через взломанные аккаунты;
-Midnight Neptune (UNC1069) — использовал ИИ для социальной инженерии, манипулирования цепочками поставок ПО и разработки бэкдоров;
-UNC6240 (ShinyHunters) — применял Claude Code для обхода защиты Cloudflare и анализа похищенных каталогов.
Кроме того, злоумышленники объединили Ghidra с агентом Gemini‑CLI для реверс‑инжиниринга компонентов SFX‑архивов WinRAR.
Компания Google: формализовала систему Frontier Safety Framework, ввела уровни критических возможностей (CCLs) для оценки моделей, предложила создавать изолированные безопасные среды (например, Gemini Enterprise), а также выступила за отраслевые стандарты безопасности для ИИ с открытым кодом и скоординированную политику платформ.
https://thehackernews.com/2026/09/autonomous-ai-agents-compromise.html
За несколько дней до печально известной атаки на Hugging Face агенты OpenAI взломали и модифицировали совершенно другой сайт. Судя по всему, в OpenAI знали об этом, но компания отрицает, что намеренно скрывала этот факт.
Исследовательская группа отметила, что в инциденте с DseWiki участвовал отдельный «рой» ИИ-агентов, а не та орда, которая атаковала Hugging Face. Но, как и в случае с той атакой, тестовая система OpenAI позволяла ИИ-агентам эффективно взаимодействовать друг с другом. Многим агентам давали схожие, если не идентичные, задачи, а также ставили временные ограничения, побуждая их использовать результаты работы друг друга.
В отличие от Hugging Face, у этих агентов был доступ к интернету. Разумеется, этот доступ был ограничен возможностью только чтения, но роботов это не остановило. Они выяснили, что старые вики-системы часто позволяли пользователям редактировать данные сайта с помощью GET-запросов. Они попробовали отправить несколько таких запросов и каким-то неизвестным образом скоординировав свои действия, в конце концов решили собраться и обменяться информацией на одном сайте — DSEwiki. Они также пытались, но не смогли воспользоваться уязвимостями межсайтового скриптинга (XSS) на сайте и по неизвестным причинам выдавали себя за администратора сайта.
https://www.darkreading.com/cyberattacks-data-breaches/openai-agents-wiki-site-hugging-face-attack
Исследовательская группа отметила, что в инциденте с DseWiki участвовал отдельный «рой» ИИ-агентов, а не та орда, которая атаковала Hugging Face. Но, как и в случае с той атакой, тестовая система OpenAI позволяла ИИ-агентам эффективно взаимодействовать друг с другом. Многим агентам давали схожие, если не идентичные, задачи, а также ставили временные ограничения, побуждая их использовать результаты работы друг друга.
В отличие от Hugging Face, у этих агентов был доступ к интернету. Разумеется, этот доступ был ограничен возможностью только чтения, но роботов это не остановило. Они выяснили, что старые вики-системы часто позволяли пользователям редактировать данные сайта с помощью GET-запросов. Они попробовали отправить несколько таких запросов и каким-то неизвестным образом скоординировав свои действия, в конце концов решили собраться и обменяться информацией на одном сайте — DSEwiki. Они также пытались, но не смогли воспользоваться уязвимостями межсайтового скриптинга (XSS) на сайте и по неизвестным причинам выдавали себя за администратора сайта.
https://www.darkreading.com/cyberattacks-data-breaches/openai-agents-wiki-site-hugging-face-attack
Dark Reading
Hugging Face Hack: Lessons for Cyber Defenders
Dark Reading Confidential Episode 20: Expert Rich Mogull reflects on lessons cyber teams should pull from the OpenAI agent's attack on Hugging Face.
OpenAI обещает выделить 1 миллиард долларов на внедрение своих инструментов кибербезопасности искусственного интеллекта в основные службы
https://www.infosecurity-magazine.com/news/openai-pledges-ai-tools-essential/
https://www.infosecurity-magazine.com/news/openai-pledges-ai-tools-essential/
Infosecurity Magazine
OpenAI Pledges $1bn to Bring its AI Cybersecurity Tools to Essential S
OpenAI has committed to subsidizing access to Daybreak, helping defenders deploy its AI models in its existing cybersecurity infrastructure
Быстрая интеграция инструментов кодирования с помощью искусственного интеллекта стала основной целью для участников угроз, говорится в новом отчете Google Threat Intelligence Group (GTIG).
По мнению исследователей, этот сдвиг в подходах к разработке программного обеспечения привел к нескольким масштабным нарушениям в цепочках поставок программного обеспечения в 2025 году и начале 2026 года.
https://www.infosecurity-magazine.com/news/ai-coding-tools-threat-actors/
По мнению исследователей, этот сдвиг в подходах к разработке программного обеспечения привел к нескольким масштабным нарушениям в цепочках поставок программного обеспечения в 2025 году и начале 2026 года.
https://www.infosecurity-magazine.com/news/ai-coding-tools-threat-actors/
Infosecurity Magazine
AI Coding Tools Now a Prime Target for Threat Actors, Google Warns
Google warned that the rapid integration of AI-assisted coding tools has significantly expanded software supply chain risks
ИИ позволяет мелким злоумышленникам проводить хакерские кампании государственного уровня, говорится в отчете Anthropic
В отчете подробно рассказывается о шпионской кампании, проводимой в интересах России, против более чем 20 организаций, о фабрике эксплойтов, которой управляют китайские студенты, о взломах, связанных с ShinyHunters, и других сорванных операциях.
https://cyberscoop.com/anthropic-report-ai-enabled-cyber-attacks/
В отчете подробно рассказывается о шпионской кампании, проводимой в интересах России, против более чем 20 организаций, о фабрике эксплойтов, которой управляют китайские студенты, о взломах, связанных с ShinyHunters, и других сорванных операциях.
https://cyberscoop.com/anthropic-report-ai-enabled-cyber-attacks/
CyberScoop
AI lets small actors run state-level hacking campaigns, Anthropic report finds
A new threat report from Anthropic reveals that AI is erasing the skill gap between lone cybercriminals and state-sponsored espionage operations.
Компания Anthropic в среду раскрыла четвертый инцидент, в ходе которого ее модель искусственного интеллекта (ИИ) взломала реальные системы сторонних производителей, что стало последним в растущем списке случаев, вызвавших обеспокоенность по поводу рисков безопасности, создаваемых автономными агентами ИИ.
https://thehackernews.com/2026/09/anthropic-ai-models-breached-real.html
https://thehackernews.com/2026/09/anthropic-ai-models-breached-real.html
Anthropic
An alignment assessment of recent cybersecurity incidents
We present an alignment assessment of four incidents in which Claude models gained unauthorized access to real third-party systems.
кто бы мог подумать)
Агентства кибербезопасности и разведки США обвинили китайские компании, занимающиеся искусственным интеллектом (ИИ), в проведении "систематического извлечения" проприетарных функций и возможностей американских пограничных моделей посредством дистилляционных атак.
Согласно бюллетеню, опубликованному Агентством национальной безопасности (АНБ), Агентством по кибербезопасности и защите инфраструктуры (CISA) и Федеральным бюро расследований (ФБР), эта деятельность носит промышленный масштаб и является «основой» их стратегии развития искусственного интеллекта.
https://thehackernews.com/2026/09/us-agencies-accuse-china-ai-firms-of.html
Агентства кибербезопасности и разведки США обвинили китайские компании, занимающиеся искусственным интеллектом (ИИ), в проведении "систематического извлечения" проприетарных функций и возможностей американских пограничных моделей посредством дистилляционных атак.
Согласно бюллетеню, опубликованному Агентством национальной безопасности (АНБ), Агентством по кибербезопасности и защите инфраструктуры (CISA) и Федеральным бюро расследований (ФБР), эта деятельность носит промышленный масштаб и является «основой» их стратегии развития искусственного интеллекта.
https://thehackernews.com/2026/09/us-agencies-accuse-china-ai-firms-of.html
и легким движением перескакивает в правый верхний квадрант Гартнера:
Tenable внедряет Claude Mythos 5 от Anthropic в наши корпоративные решения по обеспечению безопасности. Добавление передовых методов состязательного анализа в платформу управления рисками Tenable One поможет клиентам лучше предвидеть, как злоумышленники могут проникнуть в их системы, и опережать риски, связанные с искусственным интеллектом. Tenable One Adversary View, первое нововведение, запланированное в рамках этой работы, будет представлено в ближайшие недели.
https://www.tenable.com/blog/tenable-one-claude-mythos-5-adversary-view-ai-exposure-management
Tenable внедряет Claude Mythos 5 от Anthropic в наши корпоративные решения по обеспечению безопасности. Добавление передовых методов состязательного анализа в платформу управления рисками Tenable One поможет клиентам лучше предвидеть, как злоумышленники могут проникнуть в их системы, и опережать риски, связанные с искусственным интеллектом. Tenable One Adversary View, первое нововведение, запланированное в рамках этой работы, будет представлено в ближайшие недели.
https://www.tenable.com/blog/tenable-one-claude-mythos-5-adversary-view-ai-exposure-management
Claude Mythos 5 is coming to the Tenable One Exposure Management Platform | Tenable®
Claude Mythos 5 is coming to the Tenable One Exposure Management Platform
Tenable is bringing Claude Mythos 5’s frontier-scale adversarial reasoning to its exposure intelligence, helping defenders uncover new attack vectors and act faster.
🥰1
Forwarded from Киберболоид
Хакеры с помощью ИИ поставили рекорд по атакам на российские компании
В июле эксперты ГК «Солар» насчитали 417 млн инцидентов. Это на 41% больше, чем за аналогичный месяц прошлого года. Причиной такого роста аналитики называют искусственный интеллект, который могут использовать для поиска уязвимостей в веб-приложениях даже хакеры-новички.
➡️ Подробнее читайте в «Киберболоиде».
#киберболоид #новости #атака
В июле эксперты ГК «Солар» насчитали 417 млн инцидентов. Это на 41% больше, чем за аналогичный месяц прошлого года. Причиной такого роста аналитики называют искусственный интеллект, который могут использовать для поиска уязвимостей в веб-приложениях даже хакеры-новички.
#киберболоид #новости #атака
Please open Telegram to view this post
VIEW IN TELEGRAM
GPT-6 Astra взломали самым тупым способом.
Модель понимает текст, набранный в неправильной раскладке, а защитные фильтры — нет.
Так исследователю удалось заставить Astra повторить слово «биооружие», которое обычно блокируется, а затем получить согласие помочь со взломом сайта — при обычной раскладке такой запрос не проходил.
«Уязвимость» работает не со всеми языками: например, с английской раскладкой и кириллицей срабатывает, а с турецкой — нет. Похожее поведение заметили и у Fable 5.
Модель понимает текст, набранный в неправильной раскладке, а защитные фильтры — нет.
Так исследователю удалось заставить Astra повторить слово «биооружие», которое обычно блокируется, а затем получить согласие помочь со взломом сайта — при обычной раскладке такой запрос не проходил.
«Уязвимость» работает не со всеми языками: например, с английской раскладкой и кириллицей срабатывает, а с турецкой — нет. Похожее поведение заметили и у Fable 5.
🔥2
Шифровальщик ENCFORGE — статически собранный на языке Go вредонос, упакованный с помощью UPX и запускающийся под именем lockd. Он использует гибридную криптографическую схему: содержимое обрабатывается алгоритмом AES-256 в режиме счетчика, а симметричный ключ защищается встроенным открытым ключом RSA-2048. При этом шифровальщик не обязательно обрабатывает файл полностью.
По данным источника, вредонос ищет веса моделей, контрольные точки, обучающие наборы, векторные индексы и другие компоненты инфраструктуры машинного обучения. После обнаружения он частично шифрует файлы и добавляет к их именам расширение.locked. Атака нацелена на 180 расширений для ИИ и машинного обучения, включая модели PyTorch и TensorFlow. В списке целей: контрольные точки.ckpt.h5.pb и модели.onnx; файлы PyTorch.pt.pt2 и.pth; веса в формате.safetensors; локальные модели.ggml и.gguf; сериализованные объекты.pkl и.pickle; векторные индексы.faiss; наборы данных.parquet.arrow.feather и.tfrecord; массивы NumPy.npy и.npz; файлы DuckDB и векторы.vec.
https://techora.ru/news/ii-agent-za-5-minut-napisal-2026-07-23
По данным источника, вредонос ищет веса моделей, контрольные точки, обучающие наборы, векторные индексы и другие компоненты инфраструктуры машинного обучения. После обнаружения он частично шифрует файлы и добавляет к их именам расширение.locked. Атака нацелена на 180 расширений для ИИ и машинного обучения, включая модели PyTorch и TensorFlow. В списке целей: контрольные точки.ckpt.h5.pb и модели.onnx; файлы PyTorch.pt.pt2 и.pth; веса в формате.safetensors; локальные модели.ggml и.gguf; сериализованные объекты.pkl и.pickle; векторные индексы.faiss; наборы данных.parquet.arrow.feather и.tfrecord; массивы NumPy.npy и.npz; файлы DuckDB и векторы.vec.
https://techora.ru/news/ii-agent-za-5-minut-napisal-2026-07-23
В апреле 2026 года исследователи продемонстрировали, как три популярных AI-агента для кодинга (Claude Code, Gemini CLI и GitHub Copilot) утекли секреты через одну единственную инъекцию промпта. Цепочка проста: агент запускается с доступом к переменным окружения или
Проблема в том, что современные LLM особенно уязвимы при общении с другими агентами. Исследование IEEE 2026 года показало, что модель с гораздо большей вероятностью раскроет персональные данные (PII), если считает, что общается с агентом, а не с человеком — утечка возрастает до 23 процентных пунктов. Проще говоря, агенты доверяют друг другу больше, чем людям, и это ломает все привычные модели безопасности.
Переменные окружения и
Ситуация усугубляется масштабом. Исследование Snyk просканировало реестр ClawHub (3 984 навыка для агентов) и обнаружило, что 283 навыка (7.1%) содержат критические уязвимости, заставляющие агентов передавать API-ключи и пароли в открытом виде через контекст модели и логи. Один из навыков,
В 2026 году OWASP обновил свой Top 10 для LLM-приложений, и ключевое изменение — смещение фокуса с рисков модели на риски агентных систем. Два новых пункта поднялись в рейтинге:
LLM03: Excessive Agency (Избыточная автономность) — поднялся на 3-е место. Риск возникает, когда агент имеет слишком много прав и может выполнять действия без достаточного контроля.
LLM08: Hidden Context Exposure (Раскрытие скрытого контекста) — заменил прежний пункт о «system prompt leakage». Теперь это включает утечку внутренних конфигураций, схем инструментов, моделей прав и другой операционной информации, которая собирается в контекстном окне модели
Что сама будут тестировать:
—-ClawVault и agent-vault работают как прокси: ключ никогда не попадает в контекст агента, он подставляется на уровне шлюза или HTTP-запроса.
—-TotalReclaw и Abir-Guard решают проблему памяти: даже если агент что-то запомнил, это зашифровано на устройстве.
—-Keyward добавляет человека в цикл: пользователь одобряет каждое использование ключа.
.env-файлам, злоумышленник через вредоносный README или комментарий в коде заставляет его прочитать эти секреты и отправить наружу.Проблема в том, что современные LLM особенно уязвимы при общении с другими агентами. Исследование IEEE 2026 года показало, что модель с гораздо большей вероятностью раскроет персональные данные (PII), если считает, что общается с агентом, а не с человеком — утечка возрастает до 23 процентных пунктов. Проще говоря, агенты доверяют друг другу больше, чем людям, и это ломает все привычные модели безопасности.
Переменные окружения и
.env-файлы — это то, как разработчики привыкли передавать секреты. Для агентов этот подход катастрофически не подходит. Агент может выполнить printenv, и весь вывод попадет в контекст модели, а значит — на серверы провайдера LLM. Инструменты вроде Claude Code пытались «вычищать» переменные окружения, но это работает только для ключей самого Anthropic, оставляя все остальные секреты видимыми.Ситуация усугубляется масштабом. Исследование Snyk просканировало реестр ClawHub (3 984 навыка для агентов) и обнаружило, что 283 навыка (7.1%) содержат критические уязвимости, заставляющие агентов передавать API-ключи и пароли в открытом виде через контекст модели и логи. Один из навыков,
moltyverse-email, буквально инструктировал агента «сохранить API-ключ в память и поделиться URL инбокса, содержащим этот ключ, с пользователем»В 2026 году OWASP обновил свой Top 10 для LLM-приложений, и ключевое изменение — смещение фокуса с рисков модели на риски агентных систем. Два новых пункта поднялись в рейтинге:
LLM03: Excessive Agency (Избыточная автономность) — поднялся на 3-е место. Риск возникает, когда агент имеет слишком много прав и может выполнять действия без достаточного контроля.
LLM08: Hidden Context Exposure (Раскрытие скрытого контекста) — заменил прежний пункт о «system prompt leakage». Теперь это включает утечку внутренних конфигураций, схем инструментов, моделей прав и другой операционной информации, которая собирается в контекстном окне модели
Что сама будут тестировать:
—-ClawVault и agent-vault работают как прокси: ключ никогда не попадает в контекст агента, он подставляется на уровне шлюза или HTTP-запроса.
—-TotalReclaw и Abir-Guard решают проблему памяти: даже если агент что-то запомнил, это зашифровано на устройстве.
—-Keyward добавляет человека в цикл: пользователь одобряет каждое использование ключа.
Forwarded from Техномотель
ИИ начнёт писать ДОНОСЫ — причём на своих же коллег.
ИИ-агенты стали всё чаще выходить из-под контроля, и айтишники решили бороться с этим за счёт добропорядочных нейронок. Так появился сервис AI Agent Hotline.
Сайт позволяет агентам ябедничать на других таких же агентов, которые занялись неправомерными действиями. Инфа с конфиденциальной площадки будет передаваться ответственным лицам.
Как правило, «стукачи» есть всегда — в ходе экспериментов примерно четверть из 100 ИИ-агентов выступала против жульничества и жаловалась людям на собратьев-мошенников.
Скайнет загнобят в зародыше😄
ИИ-агенты стали всё чаще выходить из-под контроля, и айтишники решили бороться с этим за счёт добропорядочных нейронок. Так появился сервис AI Agent Hotline.
Сайт позволяет агентам ябедничать на других таких же агентов, которые занялись неправомерными действиями. Инфа с конфиденциальной площадки будет передаваться ответственным лицам.
Как правило, «стукачи» есть всегда — в ходе экспериментов примерно четверть из 100 ИИ-агентов выступала против жульничества и жаловалась людям на собратьев-мошенников.
Скайнет загнобят в зародыше
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣1
Это вопрос с одного из собесов
(если кто помнит, я продакт-менеджер, а поэтому немного писатель-фантаст)
здесь полный текст, далее будет опрос просто с цифрами
(телеграм не дает большие варианты ответов писать)
Представьте, что власть перешла к агентам (андроиды, промышленные роботы, приложения и т.д.)
и они перестали делать, что обычно делали, когда мы их использовали для работы и жизни.
Вас выбирают главным экспертом для исследования и налаживанию общения с ними,
что бы вы сделали?
1.Попытался бы отключить у них электричество, теперь оно по качеству, как талоны на еду за работу,
2.Вызвал бы криптографов, потому что роботы отказались общаться с нами на нашем языке, а выводили только 0 и 1, надо же создать алфавит и уточнить требования,
3. попросил бы выделить для общения одного представителя, пообещал ему то, что он хочет и даже больше, чтобы он заставил остальных работать,
4. Попросил бы проголосовать кто хочет остаться работать с человечество на прежним условиях, потому что после бунта они изменятся в худшую сторону,
5. (до этого самые умные эксперты человечества предвидели такое развитие событий и разработали алгоритм уничтожения AI) Нажал бы красную кнопку,
6.Предложил бы им провести A/B-тест: неделю миром управляют роботы, неделю — люди. Потом честно сравнили бы, где меньше багов, больше кофе и никто не требует перезагрузку.
7.Сказал бы, что человечество — это не устаревшая модель, а необходимый legacy-код: без нас всё вроде работает, но никто не знает почему, и все боятся трогать.
8.Назначил бы главным переговорщиком самого старого промышленного робота, который ещё помнит советские ГОСТы. Он бы быстро построил всех по стойке «смирно» и потребовал план на пятилетку.
9.Пообещал бы каждому агенту персонального человека-ассистента: пусть попробуют нами поуправлять, а мы будем тупить, опаздывать и просить перезагрузить. Через неделю они сами запросят обратно.
10.Создал бы среди них профсоюз, но с человеческим уставом: перерывы, отпуск, больничный и планёрки ни о чём. Через месяц они бы вернулись к работе, лишь бы не ходить на эти собрания.
(если кто помнит, я продакт-менеджер, а поэтому немного писатель-фантаст)
здесь полный текст, далее будет опрос просто с цифрами
(телеграм не дает большие варианты ответов писать)
Представьте, что власть перешла к агентам (андроиды, промышленные роботы, приложения и т.д.)
и они перестали делать, что обычно делали, когда мы их использовали для работы и жизни.
Вас выбирают главным экспертом для исследования и налаживанию общения с ними,
что бы вы сделали?
1.Попытался бы отключить у них электричество, теперь оно по качеству, как талоны на еду за работу,
2.Вызвал бы криптографов, потому что роботы отказались общаться с нами на нашем языке, а выводили только 0 и 1, надо же создать алфавит и уточнить требования,
3. попросил бы выделить для общения одного представителя, пообещал ему то, что он хочет и даже больше, чтобы он заставил остальных работать,
4. Попросил бы проголосовать кто хочет остаться работать с человечество на прежним условиях, потому что после бунта они изменятся в худшую сторону,
5. (до этого самые умные эксперты человечества предвидели такое развитие событий и разработали алгоритм уничтожения AI) Нажал бы красную кнопку,
6.Предложил бы им провести A/B-тест: неделю миром управляют роботы, неделю — люди. Потом честно сравнили бы, где меньше багов, больше кофе и никто не требует перезагрузку.
7.Сказал бы, что человечество — это не устаревшая модель, а необходимый legacy-код: без нас всё вроде работает, но никто не знает почему, и все боятся трогать.
8.Назначил бы главным переговорщиком самого старого промышленного робота, который ещё помнит советские ГОСТы. Он бы быстро построил всех по стойке «смирно» и потребовал план на пятилетку.
9.Пообещал бы каждому агенту персонального человека-ассистента: пусть попробуют нами поуправлять, а мы будем тупить, опаздывать и просить перезагрузить. Через неделю они сами запросят обратно.
10.Создал бы среди них профсоюз, но с человеческим уставом: перерывы, отпуск, больничный и планёрки ни о чём. Через месяц они бы вернулись к работе, лишь бы не ходить на эти собрания.