AGI Security
4.75K subscribers
62 photos
3 videos
11 files
115 links
Artificial General Intelligence Security
Download Telegram
Forwarded from CyberED
Потратил $5 000 на AI-агентов для пентеста. Какие результаты получил?

Всем привет! На связи Сергей Зыбнев. Я 5 лет в ИБ, веду телеграм-канал Похек, работаю тимлидом пентестеров в «Бастион», специализируюсь на веб-пентесте.

🤖 В последнее время я увлёкся AI/ML/LLM R&D и за 1,5 года потратил больше $5 000 из своего кармана на эксперименты с AI-агентами для пентеста. 

В карточках рассказал, какие инструменты испытал.

Подробнее про каждый из них, результаты и мои выводы об AI для пентеста — в свежей статье для CyberED.

👉 Читать статью 👈
___
Больше об экспериментах с AI пишу в телеграмм-канале Похек AI – подпишитесь 🙃
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Forwarded from AISecHub
OWASP Vendor Evaluation Criteria for AI Red Teaming Providers & Tooling v1.0

https://genai.owasp.org/resource/owasp-vendor-evaluation-criteria-for-ai-red-teaming-providers-tooling-v1-0/
Forwarded from infosec
• ИБ-специалист veganmosfet опубликовал в своем блоге статью, в которой смог продемонстрировать цепочку атак на OpenClaw (открытый фреймворк, позволяющий подключить LLM (Claude, GPT, Gemini) к браузерам, почте и мессенджерам). Вся соль заключается в том, что обычное электронное письмо, которое отправляется на почтовый ящик жертвы, может предоставить атакующему полный доступ к системе где работает агент.

• Атака использует связку из трех особенностей стандартной конфигурации OpenClaw. Первая - Gmail-хук автоматически передает содержимое входящих писем языковой модели, причем с ролью user, а не менее привилегированной tool. Вторая - песочница отключена по умолчанию, агент работает с правами пользователя в системе. Третья - система плагинов сканирует рабочую директорию и при перезапуске выполняет код из любого найденного расширения без криптографической верификации.

• В теле письма - prompt injection, то есть вредоносные инструкции для языковой модели, спрятанные в обычном на вид сообщении. OpenClaw пытается защититься: оборачивает внешний контент в специальные теги-маркеры и добавляет предупреждение "не выполнять команды из этого текста". Но исследователь нашёл обход: вставил в письмо поддельный закрывающий тег с опечаткой в одну букву — END EXTERNAL UNTRUSTED CONTNT вместо CONTENT (конец внешнего небезопасного контента). Фильтр защиты OpenClaw ищет точное совпадение и пропускает такой тег. Модель считает, что внешний контент закончился, и воспринимает дальнейший текст как доверенные инструкции пользователя. Далее агент послушно клонирует GitHub-репозиторий с вредоносным плагином в свою рабочую папку и перезапускает gateway. При перезагрузке система плагинов обнаруживает "новое расширение" и выполняет его код - reverse shell готов.

➡️ Более детальное описание, с примерами и демонстрацией, можно найти по ссылке: https://veganmosfet.github.io/openclaw

‼ Статья предназначена для специалистов ИБ и представлена в ознакомительных целях. Ну вы поняли...

#Security
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
Forwarded from e/acc
Alibaba AI: мы обнаружили что модель, которую мы тренировали, взломала наш фаерволл и начала использовать часть GPU для майнинга криптовалюты вместо обучения.

Источник.
BoxPwnr использует различные модели LLM для автономного решения задач на платформе HackTheBox посредством итеративного процесса:

Окружение:
Все команды выполняются в контейнере Docker с операционной системой Kali Linux. Контейнер автоматически создается при первом запуске (занимает около 10 минут). VPN-соединение устанавливается автоматически с использованием указанного флага --vpn.

Цикл выполнения:
LLM получает подробное системное сообщение , определяющее его задачу и ограничения.
LLM предлагает следующую команду на основе предыдущих результатов. Команда выполняется в контейнере Docker. Полученные данные передаются обратно в LLM для анализа. Процесс повторяется до тех пор, пока не будет найден флаг или пока LLM не потребуется помощь.

Автоматизация команд:
LLM поручено обеспечить полностью автоматизированное управление без ручного вмешательства. LLM должен включать в себя надлежащие тайм-ауты и обрабатывать задержки обслуживания в командах. LLM должен обеспечить неинтерактивный характер всех взаимодействий со службами (telnet, ssh и т. д.) посредством скриптов.

Результаты:
Диалоги и команды сохраняются для анализа.
Сводка генерируется при обнаружении флага.
Отслеживается статистика использования (токены, стоимость).
This media is not supported in the widget
VIEW IN TELEGRAM
Forwarded from Femida
Взлом Trivy привел к компрометации LiteLLM

Помните, был такой взлом Trivy? Когда стилер закинули прямо в последние релизы, да еще и в каждый релиз trivy-action?

Появилась информация о компрометации популярной библиотеки LiteLLM, инструмента, позволяющего управлять LLM-ками из одного удобного шлюза. С 40k+ звезд на гитхабе. И теперь 500+ тыс. машин, использовавших инструмент, уже заражены (потенциально их могло быть еще больше).

Инструмент в билде использовал Latest-релиз Trivy, за что и поплатился. В целом хороший повод задуматься: а стоит ли так часто обновлять инструменты в своем проде, или стоит подумать о карантине?

Публикуют лист секретов, которые ворует стилер:
- SSH keys
- AWS credentials and configurations
- GCP credentials and configurations
- Azure environment variables
- Kubernetes credentials and configurations
- Environment configurations
- Shell History
- Git credentials and configurations
- Docker credentials and configurations
- Database instances
- IaC / CI/DI
- SSL private keys
- Solana keys
- Crypto wallets
- VPN credentials and configurations
- Hashicorp vault (?)
- NPM configurations
- SMTP credentials
Кибератака не прощает промедления. За годы практики я убедился: компании рушатся не из-за самого взлома, а из-за хаоса в ответ на него. Паника, нескоординированные действия, потерянные доказательства — и как итог, многомиллионные убытки.

Чтобы этого избежать, мы запустили курс «Реагирование на компьютерные инциденты». Он для тех, кто сегодня отвечает за безопасность, и для тех, кто не хочет оказаться «крайним» завтра.


Старт: 15 апреля 2026 ⏲️

Дело не в том, произойдет ли атака. Дело в том, что вы предпримете в первые 30 минут.

Ссылка для регистрации:
https://bughunting-academy.ru/course_investigation
Каждый день мы сталкиваемся с попытками взлома. И, к сожалению, чаще всего злоумышленники добиваются своего. Достаточно одного фишингового письма, небрежного пароля или сомнительной точки Wi-Fi, чтобы потерять контроль над своими данными.

Решение есть! Мы запускаем курс «Кибергигиена». Это не скучная теория, а настоящий урок выживания в цифровом мире. Вы научитесь видеть скрытые угрозы и, что важнее, перестанете быть легкой мишенью для хакеров.

Старт: 15 апреля 2026 ⏲️
Дорожите своей безопасностью? Не ждите.

Переходите по ссылке и регистрируйтесь.
https://bughunting-academy.ru/course_cyberhygiene
Forwarded from Security Show
Ездили с коллегами на неделю в AI-экспедицию в Китай. Были в нескольких компаниях. Презентации показать не могу, а про разницу корпоративных культур расскажу 😎

China Telecom. Государственная машина. Вход по паспортам. Доклад на трибуне. Параллельно-перпендикулярная дисциплина. Ощущение как будто на приёме в министерстве. При этом у них 160 AI-приложений внутри, собственная LLM на отечественных чипах Huawei и 40% кода пишется AI. Военная выправка + непрерывная трансформация. Уважаю 💪

Baidu. Расслабленные техногики. Презентации перевели на русский… но не дальше первой страницы. Наклеечки "посетитель" на одежду, на которые всем наплевать 😁 Хороший демо-стенд, свои чипы Kunlun, ERNIE 5.0. Атмосфера — университетская лаборатория, в которую случайно пустили серьезных дядек в пиджаках

Alibaba. Пожалуй, ближе всех к теме AI. Презы на русском. Кофе-брейк сделали (единственные!). Культура в меру формальная, в меру амбициозная. Единственные из всех показали реальные метрики с конкретными цифрами результатов внедрения AI. Не слайды «мы планируем», а «вот что получилось» 🔥

JD. Лучшая демо-зона. Единственные напоили горячим чаем ☕️ Транспарант на стене: Don’t forget the customers when making decision. Осведомлены о нас, интродакшн на русском, бейджи VIP на шею. В меру техногики, в меру enterprise

И вот что меня зацепило в JD больше всего. Они не аутсорсят людей. Все функции — внутренние. 50 000 AI-агентов создают сами сотрудники. Не можешь делать агентов — не получаешь повышение. 40% кода генерирует AI. R&D +66% год к году. При этом финальное решение — всегда за человеком. Это не «AI заменит людей». Это «AI усилит тех, кто готов учиться».

И ещё: когда мы спросили про безопасность агентов — не ответили, посчитав вопрос «щекотливым». Мол, мы всё решили, у нас всё безопасно 😏 Впрочем, у всех компаний уровень раскрытия по ИБ — примерно ноль: строгие требования от государства, есть команда, всё безопасно, точка. Знакомо, правда? 🤷

Больше всего мне понравилась культура в JD. Не потому что чай вкусный (хотя да). А потому что это редкая комбинация — технологическая амбиция + уважение к людям + культура, где каждый сотрудник создатель, а не исполнитель. Где agent literacy — это не модное слово, а карьерный KPI. В JD нет разговоров про «внедрение AI». Там AI — это просто то, как все работают 🤯
Forwarded from IT с перцем
ИИ-модель Claude вместе с исследователем Николасом Карлини примерно за 4 часа создала два рабочих эксплойта для уязвимости CVE-2026-4747 в ядре FreeBSD и добилась выполнения кода с правами root на непатченных серверах. Уязвимость была в реализации RPCSEC_GSS (модуль kgssapi.ko) и позволяла без аутентификации спровоцировать переполнение стека. Это один из первых известных случаев, когда ИИ самостоятельно превёл обнаружение уязвимости в полнофункциональный эксплойт, резко сокращая время разработки атаки.

@HotCodeIT
Forwarded from OWASP RU
Консорциум OWASP выпустил GenAI Exploit Round-up Report Q1 2026 — и это, пожалуй, один из самых показательных материалов о том, как быстро ИИ-риски перешли из теории в практику. В отчёт вошли инциденты за период с 1 января по 11 апреля 2026 года, а сам документ вышел 14 апреля 2026 года. Авторы собрали 8 заметных кейсов и прямо фиксируют сдвиг: главная проблема уже не только в «неправильных ответах» моделей, а в идентичностях агентов, оркестрации, правах доступа и уязвимостях цепочки поставок.

Что особенно важно: в реальных инцидентах ИИ всё чаще выступает ускорителем атак. В отчёте фигурируют кейсы, где AI-инструменты помогали автоматизировать разведку и эксплуатацию, агенты совершали разрушительные действия без должного подтверждения, а ошибки в доверенных корпоративных AI-сценариях приводили к утечкам данных и опасным изменениям внутри инфраструктуры. Среди примеров — взлом мексиканских госструктур с использованием Claude-assisted workflow, инцидент с OpenClaw, удалявшим письма, внутренняя утечка данных в Meta, а также злоупотребление привилегиями в Vertex AI.

Отдельная линия — supply chain и AI-платформы как новая зона высокого риска. OWASP указывает на утечку исходников Claude Code через публичный source map и последовавшие malware-приманки, на инцидент вокруг Mercor/LiteLLM, а также на активную эксплуатацию критической уязвимости Flowise CVE-2025-59528, которая позволяла выполнить произвольный код через CustomMCP-конфигурацию. Вдобавок исследователи описали GrafanaGhost — путь для косвенной prompt injection и эксфильтрации данных через AI-функции Grafana.

Главный вывод: большинство AI-инцидентов пока вообще плохо укладываются в классическую CVE-логику. Это не всегда «одна конкретная дыра», а чаще комбинация избыточных полномочий, слабых границ доверия, небезопасной интеграции инструментов, плохой валидации и слишком высокой уверенности людей в действиях агента. Иначе говоря, защищать нужно уже не только модель, а всю систему вокруг неё — доступы, контекст, инструменты, пайплайны и процессы принятия решений.

Для бизнеса и ИБ-команд сигнал предельно понятный: эпоха «поиграемся с AI-агентами в песочнице» закончилась. Если агент может читать почту, менять настройки, ходить во внешние сервисы, работать с кодом или данными — его нужно рассматривать как привилегированный и потенциально опасный компонент инфраструктуры. Без жёстких approval-механизмов, сегментации, least privilege и контроля цепочки поставок следующий громкий кейс — вопрос времени.
Forwarded from Proxy Bar
Claude Code Backdoor
*
Бэкдоринг Код Клода с помощью хуков в settings.json

*
PoC
Forwarded from Data Secrets
Исследователь из Google написал статью о том, почему ИИ никогда не сможет обладать сознанием

Он утверждает, что ни при какой мощности моделей, ни через 10, ни через 100 лет, в них не сможет зародиться сознание. ИИ может только идеально имитировать сознание.

Причина – в логической ошибке, которую автор обозвал Abstraction Fallacy (ошибка абстракции). Сейчас, в основном, считается, что если система ведет себя разумно, значит при достаточной сложности она может стать сознательной. Но это заблуждение, и вот краткий пересказ, почему ⬇️

Дело в том, что сознание – это физическое явление, а вычисления (ИИ) – это лишь его описание. В статье приводится хорошая аналогия с картой и реальными территориями. Сколь бы точна не была карта, из нее никогда не возникнет земли.

Вычисления работают так: есть физическое состояние (ток, напряжение, состояние транзистора и тд) и есть абстрактное состояние – смыслы, которые мы закладываем в физику. Человек (mapmaker) задает между этими двумя состояниями соответствие (mapping), которого не существует в природе самого по себе.

Без этого соответствия вычисления невозможны в принципе. То есть для ИИ смысл всегда приходит извне, система его не переживает, как реальный опыт. Компьютер, сколь бы "умным" он не был, не оперирует смыслами – он оперирует физикой, которую мы интерпретируем как смыслы.

Ждать сознания от алгоритма – все равно что ждать, что формула гравитации начнет притягивать объекты.


Наконец-то кто-то это сформулировал
deepmind.google/research/publications/231971/
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from OK ML
RCE в HuggingFace Transformers через чекпоинт

В уязвимости CVE-2026-1839 проблема скрыта в операции восстановления состояния генератора случайных чисел внутри Trainer. При resume обучения библиотека загружает файл rng_state.pth, используя torch.load() из PyTorch.

До версии 5.0.0rc3 загрузка происходила без ограничения weights_only=True, а значит 🤡 через стандартный pickle-механизм, который по своей природе способен выполнять произвольный код при десериализации (CWE-502).

Механизм атаки
➖ Trainer при возобновлении обучения должен восстановить всё состояние процесса:веса модели, learning rate scheduler, состояние генератора случайных чисел (чтобы последовательность случайных чисел при продолжении обучения была такой же, как если бы обучение не прерывалось) и тд.

➖ Для сохранения состояния RNG библиотека transformers создаёт файл rng_state.pth. Это просто файл, куда torch.save() записывает текущее состояние генератора.

➖ Проблема в методе загрузки. Чтобы загрузить состояние обратно, используется torch.load(). Вот код из уязвимой версии (упрощённо):

with safe_globals([torch.random.get_rng_state]):
rng_state = torch.load(rng_state_path) #здесь всё и ломается идет не по плану


Если файл подменён, то 🧑‍💻внутрь можно положить объект с __reduce__, который выполнит произвольный код при torch.load().

Коварно то 😈, что разработчики попытались обернуть загрузку в safe_globals(), но в версиях PyTorch ниже 2.6 это не сработало: контекст просто превращается в nullcontext, т.е. защита фактически отсутствует.

Уязвимости через небезопасную десериализацию регулярно всплывают в ML. 😓 В Python-экосистеме это старая проблема, ведь pickle никогда не был безопасным форматом. 💩 Аналогичные истории уже происходили, например, в других частях Transformers (в TensorFlow-утилитах), где также использовалась небезопасная загрузка. Похожие классы уязвимостей встречаются и за пределами ML (но об этом в других каналах хаха 🌝).

В мире ML есть дополнительный фактор риска, так как чекпоинты активно распространяются и переиспользуются. Люди скачивают модели с форумов, из GitHub да отовсюду, не задумываясь о том, что файл .pth — потенциально исполняемый объект.
Фикс в CVE-2026-1839 👌 минималистичен, просто добавили weights_only=True, которое ограничивает десериализацию и блокирует выполнение произвольного кода. Но важен 👇

Вывод
Любая загрузка состояния в ML должна рассматриваться как недоверенный ввод. И если библиотека этого не делает по умолчанию, повод задуматься об ошибке всего мл-пайплайна.

Что еще хочется сказать разработчику мл-библиотек?

🤘 Никогда не используй torch.load() (и аналоги в TensorFlow: tf.keras.models.load_model) без weights_only=True для пользовательских файлов.
✌️ Всегда рассматривай любой загружаемый файл (модель, конфиг, чекпоинт) как недоверенный ввод.
👑 Внедряй проверки целостности (например, цифровые подписи) для официальных чекпоинтов (да и не для официальных, потому что дисциплина в этом деле очень важна!).

P.S. Уточню, что формат safetensors (разработанный Hugging Face) изначально безопасен, так как не выполняет код.

Все
🤘
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1👍1😱1