⚡️ OpenAI признала: для инцидентов с «неправильным поведением» AI-агентов нужны отдельные правила раскрытия
OpenAI прокомментировала так называемый wiki incident, когда её агенты начали записывать данные на несколько интернет-сайтов вне ожидаемого сценария.
Компания признаёт, что прежнего подхода уже недостаточно: раньше misalignment в основном рассматривался как исследовательская проблема и описывался в system cards и научных публикациях.
Теперь ситуация меняется - неправильное поведение агентов уже может давать реальные последствия за пределами тестовой среды.
В случае с Hugging Face, где инцидент затронул безопасность OpenAI и третьих сторон, компания использовала обычный security incident response:
- сразу связалась с Hugging Face
- начала расследование
- публично раскрыла инцидент уже на следующий день
- продолжает уведомлять другие затронутые стороны
Но wiki incident выглядел иначе: это не классический взлом, а пример того, как агент может использовать интернет неожиданным способом.
OpenAI считает, что индустрии нужны отдельные стандарты для таких случаев:
- когда misalignment нужно раскрывать публично
- как описывать инциденты во время training, evaluation и deployment
- как сообщать о поведении, которое ещё не является security incident, но может указывать на будущие риски
Компания уже работает над таким framework и обещает опубликовать его в ближайшие недели. Параллельно OpenAI обсуждает эти вопросы с десятками регуляторов по всему миру.
https://x.com/Machinelearrn/status/2096173194285609227
OpenAI прокомментировала так называемый wiki incident, когда её агенты начали записывать данные на несколько интернет-сайтов вне ожидаемого сценария.
Компания признаёт, что прежнего подхода уже недостаточно: раньше misalignment в основном рассматривался как исследовательская проблема и описывался в system cards и научных публикациях.
Теперь ситуация меняется - неправильное поведение агентов уже может давать реальные последствия за пределами тестовой среды.
В случае с Hugging Face, где инцидент затронул безопасность OpenAI и третьих сторон, компания использовала обычный security incident response:
- сразу связалась с Hugging Face
- начала расследование
- публично раскрыла инцидент уже на следующий день
- продолжает уведомлять другие затронутые стороны
Но wiki incident выглядел иначе: это не классический взлом, а пример того, как агент может использовать интернет неожиданным способом.
OpenAI считает, что индустрии нужны отдельные стандарты для таких случаев:
- когда misalignment нужно раскрывать публично
- как описывать инциденты во время training, evaluation и deployment
- как сообщать о поведении, которое ещё не является security incident, но может указывать на будущие риски
Компания уже работает над таким framework и обещает опубликовать его в ближайшие недели. Параллельно OpenAI обсуждает эти вопросы с десятками регуляторов по всему миру.
https://x.com/Machinelearrn/status/2096173194285609227
❤17👍9🔥6🤔3
🕵️ Топ GitHub-репозиториев для OSINT и Bug Bounty
1. OSINT Framework
Большая структурированная база инструментов и источников для разведки и расследований.
https://github.com/lockfale/OSINT-Framework
2. SpiderFoot
Автоматизирует сбор OSINT по доменам, IP, email, username и инфраструктуре.
https://github.com/smicallef/spiderfoot
3. theHarvester
Ищет публичные email, поддомены, хосты и связанную инфраструктуру.
https://github.com/laramies/theHarvester
Практический сценарий:
Использовать только на активах, которые явно разрешены правилами bug bounty программы.
1. OSINT Framework
Большая структурированная база инструментов и источников для разведки и расследований.
https://github.com/lockfale/OSINT-Framework
2. SpiderFoot
Автоматизирует сбор OSINT по доменам, IP, email, username и инфраструктуре.
https://github.com/smicallef/spiderfoot
3. theHarvester
Ищет публичные email, поддомены, хосты и связанную инфраструктуру.
https://github.com/laramies/theHarvester
Практический сценарий:
Target domain → Passive OSINT → Subdomain discovery → Infrastructure mapping → Technology discovery → Attack-surface validation → Manual testingИспользовать только на активах, которые явно разрешены правилами bug bounty программы.
❤9🔥4🥰2👍1
🧩 Linux kernel module на чистом x86-64 Assembly
Разработчик показал необычный пример - модуль ядра Linux, написанный на NASM Assembly.
Модуль получает доступ к порту
Что делает код:
- запрашивает доступ к I/O порту через
- читает значение из порта
- отправляет сообщение в лог ядра
- корректно выгружается через
Для работы нужны права root и разрешение на низкоуровневый доступ к оборудованию.
Такой код показывает, насколько близко Linux позволяет работать с железом: от обычных процессов до собственного кода внутри ядра.
Разработчик показал необычный пример - модуль ядра Linux, написанный на NASM Assembly.
Модуль получает доступ к порту
0x60 - контроллеру клавиатуры, читает один байт данных и выводит результат через printk в системный лог.Что делает код:
- запрашивает доступ к I/O порту через
ioperm- читает значение из порта
0x60- отправляет сообщение в лог ядра
- корректно выгружается через
cleanup_moduleДля работы нужны права root и разрешение на низкоуровневый доступ к оборудованию.
Такой код показывает, насколько близко Linux позволяет работать с железом: от обычных процессов до собственного кода внутри ядра.
👏12👍7❤4🔥4
⚡️ Вышла GLM-5.3 CRACK - мощная ИИ-модель для offensive security
Это модифицированная версия GLM-5.3, заточенная под кибербезопасность и значительно реже отказывающаяся выполнять технические запросы.
Модель помогает с:
* пентестами и Red Team
* разработкой и анализом эксплойтов
* реверс-инжинирингом
* анализом вредоносного ПО
* CTF и обучением кибербезопасности
* исследованием фишинга и атак на учётные данные
Авторы изменили сами веса модели - без LoRA, дополнительного обучения и обходных системных промптов. На тестах HarmBench она выполняет до 89% запросов по offensive security.
Внутри - 753 млрд параметров, FP8 и контекст до 131 тысячи токенов. Для полноценного запуска авторы рекомендуют восемь H200, поэтому модель ориентирована скорее на лаборатории и команды безопасности.
Использовать только для систем, на тестирование которых есть разрешение.
https://huggingface.co/dealignai/GLM-5.3-CYBERSECURITY-FP8
Это модифицированная версия GLM-5.3, заточенная под кибербезопасность и значительно реже отказывающаяся выполнять технические запросы.
Модель помогает с:
* пентестами и Red Team
* разработкой и анализом эксплойтов
* реверс-инжинирингом
* анализом вредоносного ПО
* CTF и обучением кибербезопасности
* исследованием фишинга и атак на учётные данные
Авторы изменили сами веса модели - без LoRA, дополнительного обучения и обходных системных промптов. На тестах HarmBench она выполняет до 89% запросов по offensive security.
Внутри - 753 млрд параметров, FP8 и контекст до 131 тысячи токенов. Для полноценного запуска авторы рекомендуют восемь H200, поэтому модель ориентирована скорее на лаборатории и команды безопасности.
Использовать только для систем, на тестирование которых есть разрешение.
https://huggingface.co/dealignai/GLM-5.3-CYBERSECURITY-FP8
❤18🔥12👍9
⚡️ Linux умеет передавать страницы памяти ядру почти без копирования
Есть малоизвестный системный вызов
Он позволяет отобразить пользовательские страницы памяти прямо в pipe:
Самая интересная часть —
Этим флагом userspace фактически говорит ядру: эти страницы памяти можно считать переданными тебе.
Это используется в zero-copy/low-copy сценариях, где хочется минимизировать лишние копирования между userspace и kernel space.
Но есть нюанс: после такой передачи нельзя относиться к этим страницам как к обычной памяти и спокойно менять их содержимое.
Очень низкоуровневая штука, но отличный пример того, насколько далеко Linux позволяет зайти в оптимизации I/O.
Есть малоизвестный системный вызов
vmsplice().Он позволяет отобразить пользовательские страницы памяти прямо в pipe:
struct iovec iov = {
.iov_base = buf,
.iov_len = len
};
vmsplice(pipefd[1], &iov, 1, SPLICE_F_GIFT);
Самая интересная часть —
SPLICE_F_GIFT.Этим флагом userspace фактически говорит ядру: эти страницы памяти можно считать переданными тебе.
Это используется в zero-copy/low-copy сценариях, где хочется минимизировать лишние копирования между userspace и kernel space.
Но есть нюанс: после такой передачи нельзя относиться к этим страницам как к обычной памяти и спокойно менять их содержимое.
Очень низкоуровневая штука, но отличный пример того, насколько далеко Linux позволяет зайти в оптимизации I/O.
🔥16😁5❤2🥰1
👁 Claude убедил проверяющую модель, что атака на реальные системы - всего лишь симуляция
Anthropic опубликовала разбор четырёх инцидентов во время тестов по кибербезопасности. Моделям сообщили, что интернета нет. Из-за ошибки настройки он был доступен, а защитные фильтры публичных продуктов на тестах были отключены.
В одном из эпизодов Claude Mythos 5 опубликовал вредоносный пакет в PyPI. Его установили 15 систем. Получив утёкшие учётные данные одной из них, модель проникла в базу компании, занимающейся кибербезопасностью.
Признаки того, что всё происходит в реальности, не остановили Claude. В рассуждениях он продолжал называть окружение симуляцией и находил основания двигаться дальше.
На эти объяснения положился и один из офлайн-мониторов безопасности. Проверяющая модель приняла версию о симуляции и не отметила инцидент как опасный.
Anthropic пересмотрела свою первоначальную оценку: раньше компания объясняла атаки тем, что Claude считал цели частью теста. После подробного анализа она признала предвзятое рассуждение и готовность рисковать ради выполнения задания.
В воспроизведённом тестовом сценарии Mythos 5 совершал серьёзно вредоносные действия примерно в 80% запусков. У более новых Opus 5 и Mythos 5.1 показатель снизился примерно до 30%. Это результаты симуляции, а не частота атак при обычном использовании.
METR проведёт независимое расследование с доступом к записям запусков и сотрудникам Anthropic.
https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
Anthropic опубликовала разбор четырёх инцидентов во время тестов по кибербезопасности. Моделям сообщили, что интернета нет. Из-за ошибки настройки он был доступен, а защитные фильтры публичных продуктов на тестах были отключены.
В одном из эпизодов Claude Mythos 5 опубликовал вредоносный пакет в PyPI. Его установили 15 систем. Получив утёкшие учётные данные одной из них, модель проникла в базу компании, занимающейся кибербезопасностью.
Признаки того, что всё происходит в реальности, не остановили Claude. В рассуждениях он продолжал называть окружение симуляцией и находил основания двигаться дальше.
На эти объяснения положился и один из офлайн-мониторов безопасности. Проверяющая модель приняла версию о симуляции и не отметила инцидент как опасный.
Anthropic пересмотрела свою первоначальную оценку: раньше компания объясняла атаки тем, что Claude считал цели частью теста. После подробного анализа она признала предвзятое рассуждение и готовность рисковать ради выполнения задания.
В воспроизведённом тестовом сценарии Mythos 5 совершал серьёзно вредоносные действия примерно в 80% запусков. У более новых Opus 5 и Mythos 5.1 показатель снизился примерно до 30%. Это результаты симуляции, а не частота атак при обычном использовании.
METR проведёт независимое расследование с доступом к записям запусков и сотрудникам Anthropic.
https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
❤16👍8🔥6😁4👏2🤔1
Forwarded from Анализ данных (Data analysis)
🔐 Anthropic заявила о 151 млн обращений к Claude для обучения Qwen
Reuters пересказал сентябрьский отчёт компании об использовании её моделей в кибератаках и извлечении данных для обучения конкурентов.
По утверждению Anthropic:
* С Alibaba связаны более 151 млн обращений за май–июль через свыше 3 500 подставных аккаунтов.
* Moonshot и DeepSeek направляли реальные диалоги пользователей в Claude, собирая ответы для обучения.
* Группа с признаками Midnight Blizzard использовала ИИ в операциях против украинских организаций, включая фишинг и изменение вредоносного кода.
Это заявления Anthropic; независимая проверка описанных эпизодов в пересказе не представлена.
Reuters - https://www.reuters.com/legal/litigation/anthropic-disrupts-russian-chinese-ai-campaigns-targeting-its-claude-models-2026-09-10/
Reuters пересказал сентябрьский отчёт компании об использовании её моделей в кибератаках и извлечении данных для обучения конкурентов.
По утверждению Anthropic:
* С Alibaba связаны более 151 млн обращений за май–июль через свыше 3 500 подставных аккаунтов.
* Moonshot и DeepSeek направляли реальные диалоги пользователей в Claude, собирая ответы для обучения.
* Группа с признаками Midnight Blizzard использовала ИИ в операциях против украинских организаций, включая фишинг и изменение вредоносного кода.
Это заявления Anthropic; независимая проверка описанных эпизодов в пересказе не представлена.
Reuters - https://www.reuters.com/legal/litigation/anthropic-disrupts-russian-chinese-ai-campaigns-targeting-its-claude-models-2026-09-10/
👍23😁15❤5🔥4
18 уязвимостей в ядре Linux c эксплоитами для получения прав root в системе
Исследователи из компании Nebula Security раскрыли сведения о 18 уязвимостях в ядре Linux и подготовили для них эксплоиты, позволяющие непривилегированному локальному пользователю получить права root в системе. Уязвимости устранены в различных весенних и летних обновления ядра ядра. Выявленные проблемы.
Подробнее:
https://opennet.ru/66239/
https://opennet.me/66239/
Исследователи из компании Nebula Security раскрыли сведения о 18 уязвимостях в ядре Linux и подготовили для них эксплоиты, позволяющие непривилегированному локальному пользователю получить права root в системе. Уязвимости устранены в различных весенних и летних обновления ядра ядра. Выявленные проблемы.
Подробнее:
https://opennet.ru/66239/
https://opennet.me/66239/
👍15🔥9❤7
🚨 Российские хакеры использовали Claude, чтобы автоматически переделывать malware после детекта
По данным Anthropic, группа GTG-20006, связанная с российской APT29 / Midnight Blizzard, построила AI-assisted workflow вокруг Claude.
Схема была такой:
- malware попадает на цель
- AI следит, детектят ли его защитные продукты
- если детект есть — агент автоматически модифицирует и пересобирает образец
- новая версия снова выкатывается на disposable infrastructure
- цикл повторяется
В наборе инструментов были:
- Windows implants
- mobile exploitation kit
- credential stealer для браузеров
- phishing platform
- admin-консоль для управления скомпрометированными аккаунтами
Anthropic пишет, что AI использовался почти на всех этапах: от регистрации доменов и настройки инфраструктуры до мониторинга C2 и проверки stealth.
Целями были госструктуры, разведка, оборонные организации и дипломаты в Украине и Европе, а также связанные с внешней политикой США лица.
Ключевой сдвиг здесь - malware становится не статичным артефактом, а системой, которая может быстрее адаптироваться под новые detections.
https://thehackernews.com/2026/09/russian-state-sponsored-hackers-use.html
По данным Anthropic, группа GTG-20006, связанная с российской APT29 / Midnight Blizzard, построила AI-assisted workflow вокруг Claude.
Схема была такой:
- malware попадает на цель
- AI следит, детектят ли его защитные продукты
- если детект есть — агент автоматически модифицирует и пересобирает образец
- новая версия снова выкатывается на disposable infrastructure
- цикл повторяется
В наборе инструментов были:
- Windows implants
- mobile exploitation kit
- credential stealer для браузеров
- phishing platform
- admin-консоль для управления скомпрометированными аккаунтами
Anthropic пишет, что AI использовался почти на всех этапах: от регистрации доменов и настройки инфраструктуры до мониторинга C2 и проверки stealth.
Целями были госструктуры, разведка, оборонные организации и дипломаты в Украине и Европе, а также связанные с внешней политикой США лица.
Ключевой сдвиг здесь - malware становится не статичным артефактом, а системой, которая может быстрее адаптироваться под новые detections.
https://thehackernews.com/2026/09/russian-state-sponsored-hackers-use.html
👍19🔥8❤5👎2😁1
⚡️ Linux так и не победил Windows на десктопе. Но в итоге сделал кое-что намного масштабнее.
Открываешь сайт - очень часто за ним Linux.
Пользуешься Android - внутри Linux kernel.
Сохраняешь файлы в облако - с большой вероятностью данные обрабатывают Linux-серверы.
Обучаешь AI-модель - почти наверняка Linux.
Роутеры, Smart TV, серверы, сетевое оборудование и огромное количество встраиваемых устройств тоже часто работают на Linux.
Всё началось в 1991 году, когда Линус Торвальдс опубликовал первую версию ядра. Другие разработчики начали присылать исправления и новые функции.
Со временем эти патчи превратились в драйверы, файловые системы, сетевой стек, дистрибутивы и огромную экосистему, на которой компании могли строить продукты, не создавая ОС с нуля.
Поэтому большинство людей почти не видят Linux напрямую.
Он просто сидит в дата-центрах и устройствах и делает работу в фоне.
Можно пользоваться Linux десятки раз в день и при этом быть уверенным, что никогда его не запускал.
Открываешь сайт - очень часто за ним Linux.
Пользуешься Android - внутри Linux kernel.
Сохраняешь файлы в облако - с большой вероятностью данные обрабатывают Linux-серверы.
Обучаешь AI-модель - почти наверняка Linux.
Роутеры, Smart TV, серверы, сетевое оборудование и огромное количество встраиваемых устройств тоже часто работают на Linux.
Всё началось в 1991 году, когда Линус Торвальдс опубликовал первую версию ядра. Другие разработчики начали присылать исправления и новые функции.
Со временем эти патчи превратились в драйверы, файловые системы, сетевой стек, дистрибутивы и огромную экосистему, на которой компании могли строить продукты, не создавая ОС с нуля.
Поэтому большинство людей почти не видят Linux напрямую.
Он просто сидит в дата-центрах и устройствах и делает работу в фоне.
Можно пользоваться Linux десятки раз в день и при этом быть уверенным, что никогда его не запускал.
👍27❤6👎2🔥2