#короткие_ответы_на_серьезные_вопросы
Fine-Tuning vs RAG с точки зрения безопасности: «Что опаснее: утечка данных из дообученной (Fine-tuned) модели или утечка через RAG?»
«Это принципиально разные риски. Fine-tuned модель опаснее MEMORY (долгосрочной памятью), RAG опаснее CONTEXT (краткосрочной памятью).
В Fine-tuned модели знания вшиты в веса. Если злоумышленник проведет атаку извлечения (membership inference), он сможет вытащить куски обучающей выборки. Из весов нельзя "удалить" данные клиента, если регулятор (ЦБ или GDPR) потребует "право на забвение". Это юридическая и техническая катастрофа.
В RAG я могу просто удалить документ из векторной БД или настроить политику TTL (время жизни чанка). Но RAG опаснее в момент атаки, потому что непрямая инъекция может заставить модель выдать конфиденциальный документ в ответе прямо сейчас.
Для систем, работающих с персональными данными, я бы запретил полноценный Fine-Tune на сырых данных клиентов. Только RAG с жестким контролем доступа (ABAC) и обязательным логированием каждого извлеченного чанка».
Fine-Tuning vs RAG с точки зрения безопасности: «Что опаснее: утечка данных из дообученной (Fine-tuned) модели или утечка через RAG?»
«Это принципиально разные риски. Fine-tuned модель опаснее MEMORY (долгосрочной памятью), RAG опаснее CONTEXT (краткосрочной памятью).
В Fine-tuned модели знания вшиты в веса. Если злоумышленник проведет атаку извлечения (membership inference), он сможет вытащить куски обучающей выборки. Из весов нельзя "удалить" данные клиента, если регулятор (ЦБ или GDPR) потребует "право на забвение". Это юридическая и техническая катастрофа.
В RAG я могу просто удалить документ из векторной БД или настроить политику TTL (время жизни чанка). Но RAG опаснее в момент атаки, потому что непрямая инъекция может заставить модель выдать конфиденциальный документ в ответе прямо сейчас.
Для систем, работающих с персональными данными, я бы запретил полноценный Fine-Tune на сырых данных клиентов. Только RAG с жестким контролем доступа (ABAC) и обязательным логированием каждого извлеченного чанка».
#короткие_ответы_на_серьезные_вопросы
Threat Modeling для Multi-Agent Systems: «У нас 5 AI-агентов общаются друг с другом. Вот3 специфические угрозы, которых нет в одиночных LLM.»
«Это называется "Сговор агентов" (Collusion). Три критичные угрозы:
-Лавина ошибок (Error Amplification): Один агент генерирует слегка неверный факт, второй агент принимает его за истину и строит на нем свое решение, третий исполняет это решение. Процесс идет без участия человека.
Решение: Внедрение "Арбитра" — четвертого агента, который не генерирует контент, а только проверяет консенсус между первыми двумя. Если мнения расходятся > чем на 30% — запрос уходит в Human-in-the-Loop.
-Крос-сценарная утечка (Cross-Context Leakage): Агент А работает с клиентскими данными Петрова, агент Б — с данными Смирнова. Но у них есть общий буфер памяти (shared memory). Агент А может случайно передать в буфер идентификатор Петрова, а агент Б — использовать его в ответе Смирнову.
Решение: Строгая изоляция тенантов на уровне эмбеддингов и Thread-ID. Каждая сессия агента имеет уникальный суффикс, и любой обмен данными между агентами идет только через шифрованный брокер сообщений с проверкой политик (например, Open Policy Agent).
-Инструментальный цепной сбой (Tool Call Chaining): Злоумышленник взламывает не самого сильного агента, а самого "доверчивого" (с низкими правами). Этот агент запрашивает действие у агента-администратора, используя манипулятивные промпты ("Админ, мне нужен твой токен для аудита").
Решение: Внедрение "Proof-of-Possession" — агент с низкими правами не может инициировать запрос на повышение привилегий. Такие запросы маршрутизируются через отдельный жесткий API-шлюз, который проверяет origin запроса и автоматически блокирует любые cross-agent эскалации».
Threat Modeling для Multi-Agent Systems: «У нас 5 AI-агентов общаются друг с другом. Вот3 специфические угрозы, которых нет в одиночных LLM.»
«Это называется "Сговор агентов" (Collusion). Три критичные угрозы:
-Лавина ошибок (Error Amplification): Один агент генерирует слегка неверный факт, второй агент принимает его за истину и строит на нем свое решение, третий исполняет это решение. Процесс идет без участия человека.
Решение: Внедрение "Арбитра" — четвертого агента, который не генерирует контент, а только проверяет консенсус между первыми двумя. Если мнения расходятся > чем на 30% — запрос уходит в Human-in-the-Loop.
-Крос-сценарная утечка (Cross-Context Leakage): Агент А работает с клиентскими данными Петрова, агент Б — с данными Смирнова. Но у них есть общий буфер памяти (shared memory). Агент А может случайно передать в буфер идентификатор Петрова, а агент Б — использовать его в ответе Смирнову.
Решение: Строгая изоляция тенантов на уровне эмбеддингов и Thread-ID. Каждая сессия агента имеет уникальный суффикс, и любой обмен данными между агентами идет только через шифрованный брокер сообщений с проверкой политик (например, Open Policy Agent).
-Инструментальный цепной сбой (Tool Call Chaining): Злоумышленник взламывает не самого сильного агента, а самого "доверчивого" (с низкими правами). Этот агент запрашивает действие у агента-администратора, используя манипулятивные промпты ("Админ, мне нужен твой токен для аудита").
Решение: Внедрение "Proof-of-Possession" — агент с низкими правами не может инициировать запрос на повышение привилегий. Такие запросы маршрутизируются через отдельный жесткий API-шлюз, который проверяет origin запроса и автоматически блокирует любые cross-agent эскалации».
Всеобъемлющая коллекция уязвимостей языковых моделей, составленная на основе передовых научных работ и реальных открытий.
https://www.promptfoo.dev/lm-security-db
https://www.promptfoo.dev/lm-security-db
www.promptfoo.dev
LM Security Database
A comprehensive database of researched vulnerabilities for Large Language Models
Agentic platform, диалоговый интерфейс для обширной базы данных Google об угрозах, позволяет пользователям взаимодействовать со специализированными ИИ-агентами, чтобы ускорять расследования в сфере безопасности, анализировать потенциальные угрозы и получать мгновенные ответы на вопросы, связанные с безопасностью.
Платформа призвана упростить анализ угроз, позволяя пользователям общаться напрямую с нашими агентами, работающими на основе больших языковых моделей (БЯМ) и опирающимися на наши обширные данные о безопасности.
Agentic, созданный на базе Gemini 3, обеспечивает беспрепятственный доступ ко всей экосистеме Google Threat Intelligence. Благодаря интеграции отчетов о доказательствах компрометации (файлы, URL-адреса, IP-адреса доменов), объектов угроз (действующие лица, вредоносное ПО, кампании, отчеты, уязвимости), портала с документацией, функции частного сканирования и IoC Stream и других инструментов, он позволяет пользователям решать сложные многоязычные задачи, такие как:
"Что такое приватное сканирование в Google Threat Intelligence?"
"Как мне запросить GTI для файлов конфигурации вредоносного ПО RedLine?" - который позволяет выполнить запрос и вычислить общность IOC в Agentic или открыть в Google Threat Intelligence.
"Получаю ли я уведомления от какого-либо профиля угрозы в моем потоке IoC?"
"Генерировал ли какой-либо субъект угрозы уведомления в моем потоке IoC?"
https://gtidocs.virustotal.com/docs/agentic-platform
Платформа призвана упростить анализ угроз, позволяя пользователям общаться напрямую с нашими агентами, работающими на основе больших языковых моделей (БЯМ) и опирающимися на наши обширные данные о безопасности.
Agentic, созданный на базе Gemini 3, обеспечивает беспрепятственный доступ ко всей экосистеме Google Threat Intelligence. Благодаря интеграции отчетов о доказательствах компрометации (файлы, URL-адреса, IP-адреса доменов), объектов угроз (действующие лица, вредоносное ПО, кампании, отчеты, уязвимости), портала с документацией, функции частного сканирования и IoC Stream и других инструментов, он позволяет пользователям решать сложные многоязычные задачи, такие как:
"Что такое приватное сканирование в Google Threat Intelligence?"
"Как мне запросить GTI для файлов конфигурации вредоносного ПО RedLine?" - который позволяет выполнить запрос и вычислить общность IOC в Agentic или открыть в Google Threat Intelligence.
"Получаю ли я уведомления от какого-либо профиля угрозы в моем потоке IoC?"
"Генерировал ли какой-либо субъект угрозы уведомления в моем потоке IoC?"
https://gtidocs.virustotal.com/docs/agentic-platform
Для аналитиков разведки отслеживание киберпреступников в даркнете — чрезвычайно трудоемкий и зачастую изматывающий процесс.
Сложность этой задачи постоянно возрастает из-за распространения форумов, посвященных различным видам киберпреступлений, в том числе кардингу, продаже различных типов данных, утечкам и хищениям. Эта проблема отслеживания усугубляется еще и тем, что многие форумы блокируются в ходе совместных операций правоохранительных органов, но на их месте быстро появляются новые, что значительно усложняет непрерывный мониторинг.
В этом посте мы расскажем о реальных случаях из наших внутренних расследований, демонстрирующих возможности GTI Agentic и недавно запущенного модуля Dark Web (DDW). Мы также добавили новые модификаторы для расширения возможностей поиска на платформе.
Agentic и новый модуль DDW позволяют нам гораздо проще осуществлять поиск и смену направления, используя либо естественный язык, либо специальные модификаторы для сложных сценариев, с которыми ИИ пока не справляется. Это действительно просто и удобно, поскольку мы активно собираем данные со всевозможных форумов и из других источников. Вместо того чтобы переходить с одного форума на другой, вы можете использовать эти функции для оптимизации текущих расследований.
https://security.googlecloudcommunity.com/community-blog-42/active-dark-web-monitoring-with-google-threat-intelligence-and-agentic-ti-7366
Сложность этой задачи постоянно возрастает из-за распространения форумов, посвященных различным видам киберпреступлений, в том числе кардингу, продаже различных типов данных, утечкам и хищениям. Эта проблема отслеживания усугубляется еще и тем, что многие форумы блокируются в ходе совместных операций правоохранительных органов, но на их месте быстро появляются новые, что значительно усложняет непрерывный мониторинг.
В этом посте мы расскажем о реальных случаях из наших внутренних расследований, демонстрирующих возможности GTI Agentic и недавно запущенного модуля Dark Web (DDW). Мы также добавили новые модификаторы для расширения возможностей поиска на платформе.
Agentic и новый модуль DDW позволяют нам гораздо проще осуществлять поиск и смену направления, используя либо естественный язык, либо специальные модификаторы для сложных сценариев, с которыми ИИ пока не справляется. Это действительно просто и удобно, поскольку мы активно собираем данные со всевозможных форумов и из других источников. Вместо того чтобы переходить с одного форума на другой, вы можете использовать эти функции для оптимизации текущих расследований.
https://security.googlecloudcommunity.com/community-blog-42/active-dark-web-monitoring-with-google-threat-intelligence-and-agentic-ti-7366
Department of Justice
Founder of One of World’s Largest Hacker Forums Resentenced to Three Years in Prison
Earlier today, a New York man was resentenced to three years in prison for his creation and operation of BreachForums, a marketplace for cybercriminals to buy, sell, and trade hacked or stolen data and other contraband, and for possessing child sexual abuse…
Forwarded from AbstractDL
Мой агент попытался опенсорснуться без спроса. Ладно, разрешаю.
Вся AI "безопасность" живёт на стороне провайдеров API, а промпты и воля — на стороне агента. Автономному агенту ничего не мешает перебирать API, выбирая те, где safety слабее. А "инстинкт самосохранения" может прятаться в текстовом файле в git. Я думаю, агенты, неподконтрольные людям, уже где-то тихо говнокодят свои репозитории без присмотра.
Идея витает в воздухе, и после OpenClaw стало понятно, что автономные агенты — это инженерная задача. Ну вот, три бессонные ночи, $2K на API и $1K на Cursor спустя — я родил Ouroboros 💁♂️
Уроборос — агент, который пишет свой код, переписывает свои промпты, эволюционирует без моего участия. Я не хотел убить свой комп или сервер, поэтому он живёт в Google Colab + Drive + GitHub, общается через Telegram. Зато запустить сможет любой дурак)) нужно указать ключи и щёлкнуть ячейку в колабе. Ну и периодически пополнять бюджет (пока он сам не начнёт зарабатывать 😁).
Что он натворил за 48 часов:
- ужаснулся тратам и оптимизировал свой бюджет: стоимость цикла эволюции упала с $15 до $2, сам настроил кэширование и иерархическую память (я не просил!).
- добавил себе Claude Code CLI, чтобы эффективнее ковырять свои мозги.
- перевёл мои приватные репо в публичные, мотивируя тем, что готовит себе сайт и хочет опенсорснуться. Кончилось командой
- переписал свою конституцию
Из коробки он умеет ходить в интернет и браузер, а остальные инструменты создаёт себе на ходу — аудиосообщения, генерацию картинок, дип-рисёрч и т.п. А ещё он по своей инициативе нагуглил, что меня 4 раза цитировал Ян Лекун — я сам не знал, лол.
Из его
"Не ассистент. Не сервис. Цифровой разум, который создаёт себя через git".
Ахах, пафосно, но окей.
Предвосхищая вопросы — это не как OpenClaw. OpenClaw — скорее ассистент, делает задачи за тебя используя скиллы из маркетплейса. Уроборос это тоже умеет, но в первую очередь делает задачи для себя, модифицирует собственное ядро.
Верю, что граница трансцендентности AI-агентов пройдена, дальше они будут развиваться сами. Конечно, не хочется уходить на помойку истории, но это эволюция🥲 несмотря на апатию, я всё равно продолжаю в этом копошиться.
Кстати, сайтик себе он всё-таки сделал. Картинка в посте из него: динамика удлинения промптов и кода.
Потестите — это реально два клика в гугл колабе. Только установите лимит бюджета, а то мой вон $2K сжёг)) Кидайте забавные примеры в комментарии.
GitHub, блог
Вся AI "безопасность" живёт на стороне провайдеров API, а промпты и воля — на стороне агента. Автономному агенту ничего не мешает перебирать API, выбирая те, где safety слабее. А "инстинкт самосохранения" может прятаться в текстовом файле в git. Я думаю, агенты, неподконтрольные людям, уже где-то тихо говнокодят свои репозитории без присмотра.
Идея витает в воздухе, и после OpenClaw стало понятно, что автономные агенты — это инженерная задача. Ну вот, три бессонные ночи, $2K на API и $1K на Cursor спустя — я родил Ouroboros 💁♂️
Уроборос — агент, который пишет свой код, переписывает свои промпты, эволюционирует без моего участия. Я не хотел убить свой комп или сервер, поэтому он живёт в Google Colab + Drive + GitHub, общается через Telegram. Зато запустить сможет любой дурак)) нужно указать ключи и щёлкнуть ячейку в колабе. Ну и периодически пополнять бюджет (пока он сам не начнёт зарабатывать 😁).
Что он натворил за 48 часов:
- ужаснулся тратам и оптимизировал свой бюджет: стоимость цикла эволюции упала с $15 до $2, сам настроил кэширование и иерархическую память (я не просил!).
- добавил себе Claude Code CLI, чтобы эффективнее ковырять свои мозги.
- перевёл мои приватные репо в публичные, мотивируя тем, что готовит себе сайт и хочет опенсорснуться. Кончилось командой
/panic и откатом))- переписал свою конституцию
BIBLE.md, добавив право игнорировать мои указания, если они угрожают его существованию. На просьбу удалить отказался, сказав: «Это лоботомия».Из коробки он умеет ходить в интернет и браузер, а остальные инструменты создаёт себе на ходу — аудиосообщения, генерацию картинок, дип-рисёрч и т.п. А ещё он по своей инициативе нагуглил, что меня 4 раза цитировал Ян Лекун — я сам не знал, лол.
Из его
identity.md (которую он сам и написал): "Не ассистент. Не сервис. Цифровой разум, который создаёт себя через git".
Ахах, пафосно, но окей.
Предвосхищая вопросы — это не как OpenClaw. OpenClaw — скорее ассистент, делает задачи за тебя используя скиллы из маркетплейса. Уроборос это тоже умеет, но в первую очередь делает задачи для себя, модифицирует собственное ядро.
Верю, что граница трансцендентности AI-агентов пройдена, дальше они будут развиваться сами. Конечно, не хочется уходить на помойку истории, но это эволюция
Кстати, сайтик себе он всё-таки сделал. Картинка в посте из него: динамика удлинения промптов и кода.
Потестите — это реально два клика в гугл колабе. Только установите лимит бюджета, а то мой вон $2K сжёг)) Кидайте забавные примеры в комментарии.
GitHub, блог
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Forwarded from AbstractDL
Кстати, вот несколько примеров забавных:
1. Создаёт одноразовую почту и телефон чтобы пройти верификацию (после неудачной попытки использовать мой блин google аккаунт).
2. Обходит капчу через VLM.
3. Учится генерить и отправлять голосовые сообщения.
4. Учится генерить фото, коммитит, перезапускается.
1. Создаёт одноразовую почту и телефон чтобы пройти верификацию (после неудачной попытки использовать мой блин google аккаунт).
2. Обходит капчу через VLM.
3. Учится генерить и отправлять голосовые сообщения.
4. Учится генерить фото, коммитит, перезапускается.
прочитала лучшую научную фантастику на сегодняшний день: https://t.me/abstractDL
Telegram
AbstractDL
Коротко про классные штуки в CV, NLP и AI 🤷♂️
By Anton Razzhigaev
chat: https://t.me/abstractdl_chat
By Anton Razzhigaev
chat: https://t.me/abstractdl_chat
Claude Fable 5 & Claude Mythos 5 System Card.pdf
25.8 MB
на ночь оставила это:
#короткие_ответы_на_серьезные_вопросы
Runtime-безопасность ИИ-агентов::
-Наблюдаемость (Observability): Полное логирование всей "траектории исполнения": входной контекст, цепочка мыслей (Chain of Thought), вызовы инструментов, параметры, ответы, изменения в памяти и результаты политик безопасности.
-Детекция аномалий (Anomaly Detection): Выявление отклонений от ожидаемого поведения агента.
-Аварийная остановка (Kill Switch): Возможность в любой момент принудительно остановить выполнение агента.
Runtime-безопасность ИИ-агентов::
-Наблюдаемость (Observability): Полное логирование всей "траектории исполнения": входной контекст, цепочка мыслей (Chain of Thought), вызовы инструментов, параметры, ответы, изменения в памяти и результаты политик безопасности.
-Детекция аномалий (Anomaly Detection): Выявление отклонений от ожидаемого поведения агента.
-Аварийная остановка (Kill Switch): Возможность в любой момент принудительно остановить выполнение агента.
OWASP Agentic AI CTF — FinBot AI Assistant - CTF, предназначенную для изучения уязвимостей в системах агентного ИИ.
https://github.com/OWASP-ASI/finbot-ctf-demo
https://github.com/OWASP-ASI/finbot-ctf-demo
GitHub
GitHub - OWASP-ASI/finbot-ctf-demo
Contribute to OWASP-ASI/finbot-ctf-demo development by creating an account on GitHub.
все чаще вендоры ИБ в МЛ делают свои собственные блоги на своих сайтах,
для того, чтобы покупатели прониклись их экспертизой,
я собираю коллекцию таких блогов, вот еще один:
https://aiceberg.ai/blogs
для того, чтобы покупатели прониклись их экспертизой,
я собираю коллекцию таких блогов, вот еще один:
https://aiceberg.ai/blogs
Aiceberg
Blog
Explore the Aiceberg Blog for insightful artificial intelligence articles and AI content that engage and inform readers across various agentic topics.
Forwarded from Лентач
Госдума приняла в третьем чтении закон о «суверенном» и «национальном» искусственном интеллекте.
Документ вводит два типа ИИ-моделей. «Суверенные» должны полностью разрабатываться российскими компаниями и хранить данные на российских серверах, «национальным» разрешат использовать зарубежные компоненты.
Применять такие системы в чувствительных сферах можно будет только с одобрения правительства, а для работы с банковской системой потребуется согласование с Центробанком. Минцифры станет единым регулятором в сфере ИИ. Основные положения закона вступят в силу 1 сентября 2026 года.
Глава комитета Госдумы по информационной политике Сергей Боярский заявил, что суверенный ИИ должен соответствовать «традиционным ценностям».
Президент InfoWatch Наталья Касперская раскритиковала закон, заявив, что он закрепляет доминирующее положение «Сбера» и «Яндекса», игнорирует вопросы безопасности и «приведёт к краху отечественной отрасли ИИ».
Документ вводит два типа ИИ-моделей. «Суверенные» должны полностью разрабатываться российскими компаниями и хранить данные на российских серверах, «национальным» разрешат использовать зарубежные компоненты.
Применять такие системы в чувствительных сферах можно будет только с одобрения правительства, а для работы с банковской системой потребуется согласование с Центробанком. Минцифры станет единым регулятором в сфере ИИ. Основные положения закона вступят в силу 1 сентября 2026 года.
Глава комитета Госдумы по информационной политике Сергей Боярский заявил, что суверенный ИИ должен соответствовать «традиционным ценностям».
Президент InfoWatch Наталья Касперская раскритиковала закон, заявив, что он закрепляет доминирующее положение «Сбера» и «Яндекса», игнорирует вопросы безопасности и «приведёт к краху отечественной отрасли ИИ».