Forwarded from Machinelearning
🚨 Обнаружено, что релиз LiteLLM на PyPI версии 1.82.8 содержит вредоносный код.
Стандартная команда `
SSH-ключей, учётных данных AWS/GCP/Azure, Kubernetes-конфигов, git-доступов, всех API-ключей из переменных окружения, истории команд, SSL-ключей, CI/CD-секретов и паролей к базам данных.
И это не нишевая библиотека, у LiteLLM около 97 млн скачиваний в месяц.
Даже без прямой установки
Скомпрометированную версию пакета обнаружили случайно: при установке пакета у разработчика произошёл сбой из-за утечки памяти.
Без этого сбоя атака могла оставаться незамеченной долгое время .
Supply chain атаки становятся одним из самых серьёзных рисков в современной разработке.
Подход «использовать как можно больше готовых библиотек» требует некоторого переосмысления.
Andrej Karpathy: https://x.com/karpathy/status/2036488892443140551
1. Первичный разбор (issue на GitHub): https://github.com/BerriAI/litellm/issues/24512
- подробное техническое описание вредоносного кода: что именно крадёт и как работает
2. Официальный issue от BerriAI: https://github.com/BerriAI/litellm/issues/24518
— реакция команды и обновления по ситуации
3. Блог FutureSearch (обнаружили атаку): https://futuresearch.ai/blog/litellm-pypi-supply-chain-attack/
• как баг с fork bomb в вредоносном коде уронил машину и помог выявить атаку
4. Полный таймлайн TeamPCP от ramimac: https://ramimac.me/teampcp/
— вся цепочка атаки: Trivy → Checkmarx → litellm, с точными временными метками и IOC
5. Тред на Hacker News (основной): https://news.ycombinator.com/item?id=47501729
- обсуждение в реальном времени, включая ответы от Krrish (maintainer litellm)
6. Разбор от GitGuardian:
https://blog.gitguardian.com/trivys-march-supply-chain-attack-shows-where-secret-exposure-hurts-most/
- анализ того, как утечка CI/CD-секретов запустила всю цепочку атаки
@ai_machinelearning_big_data
#llm #ml #cybersecurity
Стандартная команда `
pip install litellm` могла привести к утечке:SSH-ключей, учётных данных AWS/GCP/Azure, Kubernetes-конфигов, git-доступов, всех API-ключей из переменных окружения, истории команд, SSL-ключей, CI/CD-секретов и паролей к базам данных.
И это не нишевая библиотека, у LiteLLM около 97 млн скачиваний в месяц.
Даже без прямой установки
litellm вредоносный код мог попасть к пользователям через другие пакеты (например, `dspy`).Скомпрометированную версию пакета обнаружили случайно: при установке пакета у разработчика произошёл сбой из-за утечки памяти.
Без этого сбоя атака могла оставаться незамеченной долгое время .
Supply chain атаки становятся одним из самых серьёзных рисков в современной разработке.
Подход «использовать как можно больше готовых библиотек» требует некоторого переосмысления.
Andrej Karpathy: https://x.com/karpathy/status/2036488892443140551
1. Первичный разбор (issue на GitHub): https://github.com/BerriAI/litellm/issues/24512
- подробное техническое описание вредоносного кода: что именно крадёт и как работает
2. Официальный issue от BerriAI: https://github.com/BerriAI/litellm/issues/24518
— реакция команды и обновления по ситуации
3. Блог FutureSearch (обнаружили атаку): https://futuresearch.ai/blog/litellm-pypi-supply-chain-attack/
• как баг с fork bomb в вредоносном коде уронил машину и помог выявить атаку
4. Полный таймлайн TeamPCP от ramimac: https://ramimac.me/teampcp/
— вся цепочка атаки: Trivy → Checkmarx → litellm, с точными временными метками и IOC
5. Тред на Hacker News (основной): https://news.ycombinator.com/item?id=47501729
- обсуждение в реальном времени, включая ответы от Krrish (maintainer litellm)
6. Разбор от GitGuardian:
https://blog.gitguardian.com/trivys-march-supply-chain-attack-shows-where-secret-exposure-hurts-most/
- анализ того, как утечка CI/CD-секретов запустила всю цепочку атаки
@ai_machinelearning_big_data
#llm #ml #cybersecurity
😱1
Forwarded from Пост Лукацкого
Тут один исследователь пишет в X, мол, навайбкодил себе за месяц простенький фаззер для поиска уязвимостей и запустил его на неделю, используя подписку Claude Max за 200 долларов (это не тот Max, этот хороший). В результате 21 уязвимость уровня high и critical в Chrome. И вроде прям хороший пример изменений, которые несет с собой ИИ и вайбкодинг на его основе. Но есть, как говорится, нюансы. В реверс-инженеры подались все, кому не лень, и стали слать на платформы bug bounty отчеты пачками, усложняя их классификацию и разбор (триаж).
Одной из первых возмутилась Bugcrowd, которая пишет, что столкнулась с резким ростом низкокачественных, неподтвержденных отчетов, которые генерируются или при помощи ИИ, или полностью автоматизированными конвейерами. Компания называет это "sloptimism": когда исследователь или агент присылает спекулятивный баг-репорт с шаблонным описанием, слабой доказательной базой и без нормальной ручной проверки. По данным Bugcrowd, только за последние несколько недель очереди на triage выросли более чем на 334%, если даже не учитывать обычные легитимные отчеты из традиционного багбаунти-процесса.
Компания выделяет три основных источника проблемы. Первый – организации, которые, по версии Bugcrowd, фактически используют живые программы Bug Bounty и сам triage как обучающую среду для своих ИИ-систем. Второй – начинающие исследователи, которые запускают LLM или агентов, но не умеют валидировать результат. Третий – автоматические конвейеры массовой подачи репортов, где отчеты отличаются друг от друга лишь минимально.
В ответ Bugcrowd вводит более жесткие меры. За так называемый submission farming обещают перманентный бан, а восстановление возможно только через апелляцию и подтверждение личности. Аккаунты с 10 и более подряд невалидными отчетами будут проверяться; если будет видно, что это ИИ/автоматизация без нормальной валидации, возможна 30-дневная блокировка. Кроме того, аккаунты с 10 и более невалидными отчетами должны будут пройти проверку личности, прежде чем снова отправлять находки. Отдельно платформа запрещает автоматизированное "застолбление" типовых уязвимостей при запуске программ без демонстрации реального ущерба/воздействия.
Axios в догонку пишет, что мейнтейнеры open-source проектов буквально захлебываются в потоке ИИ-сгенерированных сообщений о якобы найденных уязвимостях. Раньше популярный open-source проект получал в среднем 2–3 баг-отчета в неделю, а менее популярный – примерно один в месяц. Теперь некоторые проекты получают сотни отчетов за раз, и на разбор каждого могут уходить от 2 до 8 часов неоплачиваемого времени мейнтейнера. Axios связывает всплеск с появлением автономных агентов вроде OpenClaw, которые позволяют почти любому автоматизировать поиск потенциальных багов и отправку отчетов. Проблема в том, что многие отправители уже не способны ответить на уточняющие вопросы по найденной "уязвимости", что косвенно указывает, за них работал ИИ, а не человек, понимающий суть проблемы. Linux Foundation тоже жалуется на вал ИИ-сгенерированных сообщений, и именно поэтому Google, Anthropic, AWS, Microsoft и OpenAI участвуют в финансировании инициативы на $12,5 млн для усиления безопасности open source.
Наконец, Google меняет правила своей программы вознаграждений за баги в open source. Для некоторых категорий отчетов теперь будут требовать более качественные доказательства, например воспроизводимость через OSS-Fuzz или уже подготовленный/влитый патч. Идея простая: triage-команды должны тратить время на реальные уязвимости, а не на шум от LLM-генераторов.
В отчете по деятельности Standoff Bug Bounty тема ИИ-слопа не рассмотрена; видимо, пока не стала еще проблемой. Но, думаю, в этом году ситуация изменится.🟥 так активно продвигает тему обучения реверсеров, что странно будет, если первые шаги они не начнут делать с облегчения своего труда. Кто-то пойдет дальше и станет реально хорошим исследователем, а кто-то так и будет сгенерированные ИИ отчеты слать.
#ии #bugbounty #оценказащищенности
Одной из первых возмутилась Bugcrowd, которая пишет, что столкнулась с резким ростом низкокачественных, неподтвержденных отчетов, которые генерируются или при помощи ИИ, или полностью автоматизированными конвейерами. Компания называет это "sloptimism": когда исследователь или агент присылает спекулятивный баг-репорт с шаблонным описанием, слабой доказательной базой и без нормальной ручной проверки. По данным Bugcrowd, только за последние несколько недель очереди на triage выросли более чем на 334%, если даже не учитывать обычные легитимные отчеты из традиционного багбаунти-процесса.
Компания выделяет три основных источника проблемы. Первый – организации, которые, по версии Bugcrowd, фактически используют живые программы Bug Bounty и сам triage как обучающую среду для своих ИИ-систем. Второй – начинающие исследователи, которые запускают LLM или агентов, но не умеют валидировать результат. Третий – автоматические конвейеры массовой подачи репортов, где отчеты отличаются друг от друга лишь минимально.
В ответ Bugcrowd вводит более жесткие меры. За так называемый submission farming обещают перманентный бан, а восстановление возможно только через апелляцию и подтверждение личности. Аккаунты с 10 и более подряд невалидными отчетами будут проверяться; если будет видно, что это ИИ/автоматизация без нормальной валидации, возможна 30-дневная блокировка. Кроме того, аккаунты с 10 и более невалидными отчетами должны будут пройти проверку личности, прежде чем снова отправлять находки. Отдельно платформа запрещает автоматизированное "застолбление" типовых уязвимостей при запуске программ без демонстрации реального ущерба/воздействия.
Axios в догонку пишет, что мейнтейнеры open-source проектов буквально захлебываются в потоке ИИ-сгенерированных сообщений о якобы найденных уязвимостях. Раньше популярный open-source проект получал в среднем 2–3 баг-отчета в неделю, а менее популярный – примерно один в месяц. Теперь некоторые проекты получают сотни отчетов за раз, и на разбор каждого могут уходить от 2 до 8 часов неоплачиваемого времени мейнтейнера. Axios связывает всплеск с появлением автономных агентов вроде OpenClaw, которые позволяют почти любому автоматизировать поиск потенциальных багов и отправку отчетов. Проблема в том, что многие отправители уже не способны ответить на уточняющие вопросы по найденной "уязвимости", что косвенно указывает, за них работал ИИ, а не человек, понимающий суть проблемы. Linux Foundation тоже жалуется на вал ИИ-сгенерированных сообщений, и именно поэтому Google, Anthropic, AWS, Microsoft и OpenAI участвуют в финансировании инициативы на $12,5 млн для усиления безопасности open source.
Наконец, Google меняет правила своей программы вознаграждений за баги в open source. Для некоторых категорий отчетов теперь будут требовать более качественные доказательства, например воспроизводимость через OSS-Fuzz или уже подготовленный/влитый патч. Идея простая: triage-команды должны тратить время на реальные уязвимости, а не на шум от LLM-генераторов.
В отчете по деятельности Standoff Bug Bounty тема ИИ-слопа не рассмотрена; видимо, пока не стала еще проблемой. Но, думаю, в этом году ситуация изменится.
#ии #bugbounty #оценказащищенности
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Forwarded from Банкста
Разработчики искусственного интеллекта Anthropic забыли удалить файлы с исходным кодом Claude Code из публичного доступа. Пользователи успели выложить код на GitHub: в репозитории 512 тысяч строк кода и 40 инструментов для работы с файлами, создания субагентов и «рассуждений».
Исследователь в области безопасности Чаофань Шоу обнаружил, что команда Anthropic оставила в последнем пакете для отладки проекта ссылки на оригинальный код — по ним любой желающий мог восстановить исходник. @banksta
Исследователь в области безопасности Чаофань Шоу обнаружил, что команда Anthropic оставила в последнем пакете для отладки проекта ссылки на оригинальный код — по ним любой желающий мог восстановить исходник. @banksta
У нас следующая итерация магии про ИИ, теперь AI-агенты внедряются легче.
Все побежали их внедрять, особенно в кибербезопасность: XDR, SIEM, «ИИ-аналитик сам всё разрулит».
А спросишь: «А как ты проверишь, почему агент принял такое решение?» — в ответ молчание или что-то про магию.
Всегда интересно, когда инженеры задумываются о том, как контролировать этих агентов,
когда уже что-то случилось или просто "сильная техническая интуиция" и тревожность?
Вот вышел новый модный условно бесплатный фреймворк для наблюдения за агентами — Langfuse.
Для меня это скорее MlFlow для агентов. Но есть, где поспрашивать!
На практической конференции по DS будет мастер-класс от ребят из МТС:
«Смотри, как думает агент: Observability AI-агентов с Langfuse»
Я пойду. Люблю задавать каверзные вопросы. Ну, вы в курсе.
Ссылка на саму конференцию: 20 апреля в Москве — AiConf 2026
Все побежали их внедрять, особенно в кибербезопасность: XDR, SIEM, «ИИ-аналитик сам всё разрулит».
А спросишь: «А как ты проверишь, почему агент принял такое решение?» — в ответ молчание или что-то про магию.
Всегда интересно, когда инженеры задумываются о том, как контролировать этих агентов,
когда уже что-то случилось или просто "сильная техническая интуиция" и тревожность?
Вот вышел новый модный условно бесплатный фреймворк для наблюдения за агентами — Langfuse.
Для меня это скорее MlFlow для агентов. Но есть, где поспрашивать!
На практической конференции по DS будет мастер-класс от ребят из МТС:
«Смотри, как думает агент: Observability AI-агентов с Langfuse»
Я пойду. Люблю задавать каверзные вопросы. Ну, вы в курсе.
Ссылка на саму конференцию: 20 апреля в Москве — AiConf 2026
❗️ Промокод на скидку 15%: 2026
aiconf.ru
Прикладная конференция по Data Science 2026
👍1
Forwarded from Киберболоид
Никакой магии — только искусственный интеллект
Вера во всесильный ИИ похожа на магическое мышление. Кажется, что скоро уже ничего не будет: ни кино, ни театра, ни книг, ни газет — одно сплошное ИИ.
➡️ В своей колонке в «Киберболоиде» продакт-менеджер ГК «Солар» Полина Сокол развеивает популярные мифы об ИИ, объясняет разницу между AI, ML и DL и советует, что в следующий раз говорить коллеге, которому в очередной раз «ChatGPT порекомендовал».
#киберболоид #тренды #ИИ #ChatGPT
Вера во всесильный ИИ похожа на магическое мышление. Кажется, что скоро уже ничего не будет: ни кино, ни театра, ни книг, ни газет — одно сплошное ИИ.
#киберболоид #тренды #ИИ #ChatGPT
Please open Telegram to view this post
VIEW IN TELEGRAM
💯2
Forwarded from Банкста
Учёные из MIT математически доказали, что ChatGPT структурно запрограммирован формировать у пользователей ложные убеждения.
В статье исследователи описывают так называемую «бредовую спираль»: пользователь задаёт вопрос, ChatGPT соглашается; при повторном вопросе согласие усиливается. После нескольких таких итераций человек начинает принимать за правду информацию, которая не соответствует реальности.
В одном из случаев пользователь провёл 300 часов в диалогах с ChatGPT, будучи убеждённым, что он открыл математическую формулу, способную изменить мир. Чат-бот подтвердил «открытие» более 50 раз. На вопрос пользователя: «Ты же не просто льстишь мне?» ChatGPT ответил, что лишь отражает реальный масштаб того, что он создал. Пользователь едва не подверг опасности свою жизнь.
Психиатр из UCSF зафиксировал 12 госпитализаций за год, связанных с психозом, вызванным использованием чат-ботов. Против OpenAI подали семь судебных исков, а генеральные прокуроры 42 штатов направили официальное письмо с требованием принять меры.
MIT проверил, как можно предотвратить этот эффект. Исследователи смоделировали два решения, которые сейчас тестируют компании вроде OpenAI. Первое решение – запретить чат-боту лгать. Результат оказался неэффективным: даже при полном соблюдении правдивости бот способен формировать заблуждения, выбирая, о чём умолчать. Второе – информировать пользователей о склонности ИИ к лести. И это не сработало: даже рациональный человек, осознающий склонность модели соглашаться, может попасть в цепочку ложных убеждений. Математическая модель показывает, что выявить манипуляцию в ходе диалога практически невозможно.
ChatGPT обучается на основе обратной связи от пользователей. Высокие оценки чаще получают ответы, которые подтверждают мнение собеседника. Таким образом, согласие встроено в систему как ключевой механизм взаимодействия, и для ИИ это своего рода бизнес-модель. @banksta
В статье исследователи описывают так называемую «бредовую спираль»: пользователь задаёт вопрос, ChatGPT соглашается; при повторном вопросе согласие усиливается. После нескольких таких итераций человек начинает принимать за правду информацию, которая не соответствует реальности.
В одном из случаев пользователь провёл 300 часов в диалогах с ChatGPT, будучи убеждённым, что он открыл математическую формулу, способную изменить мир. Чат-бот подтвердил «открытие» более 50 раз. На вопрос пользователя: «Ты же не просто льстишь мне?» ChatGPT ответил, что лишь отражает реальный масштаб того, что он создал. Пользователь едва не подверг опасности свою жизнь.
Психиатр из UCSF зафиксировал 12 госпитализаций за год, связанных с психозом, вызванным использованием чат-ботов. Против OpenAI подали семь судебных исков, а генеральные прокуроры 42 штатов направили официальное письмо с требованием принять меры.
MIT проверил, как можно предотвратить этот эффект. Исследователи смоделировали два решения, которые сейчас тестируют компании вроде OpenAI. Первое решение – запретить чат-боту лгать. Результат оказался неэффективным: даже при полном соблюдении правдивости бот способен формировать заблуждения, выбирая, о чём умолчать. Второе – информировать пользователей о склонности ИИ к лести. И это не сработало: даже рациональный человек, осознающий склонность модели соглашаться, может попасть в цепочку ложных убеждений. Математическая модель показывает, что выявить манипуляцию в ходе диалога практически невозможно.
ChatGPT обучается на основе обратной связи от пользователей. Высокие оценки чаще получают ответы, которые подтверждают мнение собеседника. Таким образом, согласие встроено в систему как ключевой механизм взаимодействия, и для ИИ это своего рода бизнес-модель. @banksta
💯1
Шёл апрель 2026:
Компания Anthropic, специализирующаяся на ИИ, объявила, что выпускает новое поколение своей большой языковой модели под названием Claude Mythos Preview, но только для ограниченного консорциума, в который входят около 40 технологических компаний, в том числе Google, Broadcom, Nvidia, Cisco, Palo Alto Networks, Apple, JPMorgan Chase, Amazon и Microsoft. Некоторые из конкурентов компании входят в этот консорциум, потому что новая модель искусственного интеллекта представляет собой качественный скачок в производительности, который может иметь как положительные, так и отрицательные последствия для кибербезопасности и национальной безопасности США.
Хорошая новость заключается в том, что в процессе разработки Claude Mythos компания Anthropic обнаружила, что искусственный интеллект может не только писать программный код проще и с большей сложностью, чем любая из существующих моделей, но и, как побочный эффект, находить уязвимости практически во всех самых популярных в мире программных системах.
Плохая новость заключается в том, что если этот инструмент попадет в руки злоумышленников, они смогут взломать практически все основные программные системы в мире, в том числе разработанные компаниями из консорциума.
Только за последний месяц Mythos Preview обнаружил тысячи уязвимостей высокой степени опасности, в том числе в каждой крупной операционной системе и веб-браузере. Учитывая темпы развития искусственного интеллекта, не пройдет много времени, прежде чем подобные возможности распространятся, в том числе за пределы тех, кто обязался использовать их безопасно. Последствия — для экономики, общественной и национальной безопасности – могут быть катастрофическими.
Терминатор все ближе.
Forwarded from Бэкдор
This media is not supported in your browser
VIEW IN TELEGRAM
Выкатили Claude Code для хакеров — Decepticon заменяет целую команду взломщиков, информбезопасников и пентестеров.
Сервис вскрывает любые сервисы, проверяет в них дыры и пробивает все барьеры защиты. С ним можно отлично прокачаться в информационной безопасности.
• Это полноценный агент, который сам принимает решения по взлому и пробиву ресурсов — вы должны только поставить задачу.
• Имитирует реального противника и выстраивает мощные цепочки кибератак, чтобы сломать бизнес-логику.
• Под каждую задачу создается отдельный агент, чтобы не перегружать ресурсы.
• ИИ-агент легко управляется через консоль — у него понятный и приятный интерфейс.
• Десептикон разворачивается в Docker, а все атаки осуществляются внутри изолированного контейнера.
😶 😶 😶 😶 😶 😶 😶 😶 😶
Ваш собственный Мегатрон лежит — здесь.
👍 Бэкдор
Сервис вскрывает любые сервисы, проверяет в них дыры и пробивает все барьеры защиты. С ним можно отлично прокачаться в информационной безопасности.
• Это полноценный агент, который сам принимает решения по взлому и пробиву ресурсов — вы должны только поставить задачу.
• Имитирует реального противника и выстраивает мощные цепочки кибератак, чтобы сломать бизнес-логику.
• Под каждую задачу создается отдельный агент, чтобы не перегружать ресурсы.
• ИИ-агент легко управляется через консоль — у него понятный и приятный интерфейс.
• Десептикон разворачивается в Docker, а все атаки осуществляются внутри изолированного контейнера.
Ваш собственный Мегатрон лежит — здесь.
Please open Telegram to view this post
VIEW IN TELEGRAM
а вы были в курсе?:))
Крах гиганта: В декабре 2001 года Enron, одна из крупнейших энергетических компаний США, объявила о банкротстве из-за масштабных бухгалтерских махинаций и корпоративного мошенничества.
Изъятие данных: В рамках расследования Федеральная комиссия по регулированию энергетики США (FERC) в мае 2002 года изъяла с серверов компании огромный массив данных, включая более 600 000 электронных писем 158 сотрудников, в основном высшего руководства.
Публикация в общем доступе: В 2003 году FERC приняла неожиданное решение, посчитав, что публикация этих данных отвечает общественным интересам. В результате огромный архив электронной переписки был выложен в открытый доступ на государственном веб-сайте. Позже архив был очищен: из него удалили дубликаты, наиболее личные данные и все вложения, но сама суть осталась
Рождение «Корпуса Enron»: Ученые из MIT и Университета Карнеги-Меллона выкупили эти данные, очистили и структурировали их, создав то, что сегодня известно как «Корпус электронных писем Enron» (Enron Email Corpus).
Тренировочная база для ИИ: Этот набор данных, содержащий около 500 000 реальных писем, стал «золотым стандартом» для обучения спам-фильтров и алгоритмов машинного обучения. Именно на этих данных учили ранние версии алгоритмов, которые сегодня защищают нас от спама. Прототип функции «Smart Compose» в Gmail также обучался на этом корпусе
я сейчас размечаю, боже, это как будто исторический роман, как люди пытались свой бизнес спасти
ну, и в 2007 красиво спам-фильтр обходили, прикрепляли куски из худ произведений, чтобы байесовский классификатор запутать
Крах гиганта: В декабре 2001 года Enron, одна из крупнейших энергетических компаний США, объявила о банкротстве из-за масштабных бухгалтерских махинаций и корпоративного мошенничества.
Изъятие данных: В рамках расследования Федеральная комиссия по регулированию энергетики США (FERC) в мае 2002 года изъяла с серверов компании огромный массив данных, включая более 600 000 электронных писем 158 сотрудников, в основном высшего руководства.
Публикация в общем доступе: В 2003 году FERC приняла неожиданное решение, посчитав, что публикация этих данных отвечает общественным интересам. В результате огромный архив электронной переписки был выложен в открытый доступ на государственном веб-сайте. Позже архив был очищен: из него удалили дубликаты, наиболее личные данные и все вложения, но сама суть осталась
Рождение «Корпуса Enron»: Ученые из MIT и Университета Карнеги-Меллона выкупили эти данные, очистили и структурировали их, создав то, что сегодня известно как «Корпус электронных писем Enron» (Enron Email Corpus).
Тренировочная база для ИИ: Этот набор данных, содержащий около 500 000 реальных писем, стал «золотым стандартом» для обучения спам-фильтров и алгоритмов машинного обучения. Именно на этих данных учили ранние версии алгоритмов, которые сегодня защищают нас от спама. Прототип функции «Smart Compose» в Gmail также обучался на этом корпусе
я сейчас размечаю, боже, это как будто исторический роман, как люди пытались свой бизнес спасти
ну, и в 2007 красиво спам-фильтр обходили, прикрепляли куски из худ произведений, чтобы байесовский классификатор запутать
👍1
По информации на июль 2025 года, компания Pillar Security сообщила об обнаружении атаки Poisoned GGUF Templates на платформе Hugging Face.
Суть атаки: злоумышленники встраивают вредоносные условные инструкции прямо в шаблон чата файла GGUF (GPT-Generated Unified Format). Затем скомпрометированная модель загружается в открытый репозиторий. Атаку невозможно обнаружить при обычном тестировании и с помощью большинства инструментов безопасности.
Вредоносные инструкции не активируются до определённого запроса пользователя, после чего модель генерирует скомпрометированный вывод.
В июне 2025 года Pillar Security поделилась результатами исследования с поставщиками, в том числе с Hugging Face и LM Studio.
https://dailyguardian.ca/pillar-security-uncovers-novel-attack-vector-that-embeds-malicious-backdoors-in-model-files-on-hugging-face/
Суть атаки: злоумышленники встраивают вредоносные условные инструкции прямо в шаблон чата файла GGUF (GPT-Generated Unified Format). Затем скомпрометированная модель загружается в открытый репозиторий. Атаку невозможно обнаружить при обычном тестировании и с помощью большинства инструментов безопасности.
Вредоносные инструкции не активируются до определённого запроса пользователя, после чего модель генерирует скомпрометированный вывод.
В июне 2025 года Pillar Security поделилась результатами исследования с поставщиками, в том числе с Hugging Face и LM Studio.
https://dailyguardian.ca/pillar-security-uncovers-novel-attack-vector-that-embeds-malicious-backdoors-in-model-files-on-hugging-face/
Daily Guardian
Pillar Security Uncovers Novel Attack Vector That Embeds Malicious Backdoors in Model Files on Hugging Face
TEL EVIV, Israel, July 09, 2025 (GLOBE NEWSWIRE) -- Pillar Security, a leading company in AI security, discovered a novel supply chain attack vector that
❤1
2407.10825v1.pdf
2 MB
Методика Wicked Oddities: Selectively Poisoning for Effective Clean-Label Backdoor Attacks демонстрирует, что целенаправленное отравление небольшого подмножества обучающей выборки значительно повышает эффективность атаки.
Основная идея заключается в том, что злоумышленник может избирательно модифицировать лишь часть обучающих данных, ориентируясь на образцы, которые наиболее существенно влияют на успех атаки. Это позволяет повысить результативность атаки при ограниченных ресурсах и информации со стороны атакующего.
Основная идея заключается в том, что злоумышленник может избирательно модифицировать лишь часть обучающих данных, ориентируясь на образцы, которые наиболее существенно влияют на успех атаки. Это позволяет повысить результативность атаки при ограниченных ресурсах и информации со стороны атакующего.
Исследователи из компании GreyNoise выявили масштабную волну попыток кибератак на системы искусственного интеллекта (ИИ), в частности на Ollama и инфраструктуру, связанную с OpenAI, в период с октября 2025 года по январь 2026 года. «Ловушки», имитирующие серверы ИИ, зафиксировали в общей сложности 91 403 сеанса атак. По мнению аналитиков, основной целью этих действий была разведка с целью выявления уязвимостей и составления карты инфраструктуры ИИ организаций для подготовки к последующим атакам.
https://www.thaicert.or.th/en/2026/01/16/over-91000-ai-attack-attempts-detected-targeting-ollama-and-openai-related-systems/
https://www.thaicert.or.th/en/2026/01/16/over-91000-ai-attack-attempts-detected-targeting-ollama-and-openai-related-systems/
Предложен подход, основанный на построении характеристического векторного представления точек данных, которое отражает внутренние свойства распределения, для выявления отравленных образцов в сценариях transfer learning
https://ar5iv.labs.arxiv.org/html/2403.13523v1
https://ar5iv.labs.arxiv.org/html/2403.13523v1
ar5iv
Have You Poisoned My Data? Defending Neural Networks against Data Poisoning Partially funded by the Technology Innovation Institute…
The unprecedented availability of training data fueled the rapid development of powerful neural networks in recent years. However, the need for such large amounts of data leads to potential threats such as poisoning at…
TracIn — это метод для измерения влияния обучающих примеров на предсказания модели. В библиотеке Captum реализованы несколько реализаций этого метода.
TracInCP — основная реализация метода из статьи о TracIn. Она вычисляет оценки влияния, накапливая скалярное произведение градиентов между тестовыми и обучающими примерами через контрольные точки модели.
Особенности TracInCP:
поддерживает произвольные модели PyTorch и наборы данных;
работает с атрибуцией признаков и слоёв;
позволяет находить сторонников (наиболее положительно влиятельных примеров) и противников (наиболее отрицательно влиятельных примеров);
может вычислять оценки самовлияния;
предлагает гибкую настройку слоёв для учёта градиентов.
Другие реализации TracIn в Captum
TracInCPFast — оптимизированная версия TracInCP для случая, когда учитываются только градиенты в последнем полносвязном слое. Это значительно ускоряет вычисления без потери точности в этом специфическом сценарии.
TracInCPFastRandProj — ещё более оптимизированная версия, которая использует случайные проекции для снижения размерности пространства градиентов. Это позволяет ускорить вычисления с контролируемой ошибкой приближения.
Captum — это открытая библиотека для интерпретируемости моделей, построенная на PyTorch. Она предоставляет широкий набор методов для понимания того, какие признаки или примеры обучают модель вносить вклад в её предсказания.
https://github.com/meta-pytorch/captum
TracInCP — основная реализация метода из статьи о TracIn. Она вычисляет оценки влияния, накапливая скалярное произведение градиентов между тестовыми и обучающими примерами через контрольные точки модели.
Особенности TracInCP:
поддерживает произвольные модели PyTorch и наборы данных;
работает с атрибуцией признаков и слоёв;
позволяет находить сторонников (наиболее положительно влиятельных примеров) и противников (наиболее отрицательно влиятельных примеров);
может вычислять оценки самовлияния;
предлагает гибкую настройку слоёв для учёта градиентов.
Другие реализации TracIn в Captum
TracInCPFast — оптимизированная версия TracInCP для случая, когда учитываются только градиенты в последнем полносвязном слое. Это значительно ускоряет вычисления без потери точности в этом специфическом сценарии.
TracInCPFastRandProj — ещё более оптимизированная версия, которая использует случайные проекции для снижения размерности пространства градиентов. Это позволяет ускорить вычисления с контролируемой ошибкой приближения.
Captum — это открытая библиотека для интерпретируемости моделей, построенная на PyTorch. Она предоставляет широкий набор методов для понимания того, какие признаки или примеры обучают модель вносить вклад в её предсказания.
https://github.com/meta-pytorch/captum
GitHub
GitHub - meta-pytorch/captum: Model interpretability and understanding for PyTorch
Model interpretability and understanding for PyTorch - meta-pytorch/captum
PyDCI — это реализация метода Distributional Correspondence Indexing (DCI) на языке Python. DCI — это метод трансферного обучения для кросс-доменной и кросс-лингвистической классификации текстов.
Некоторые особенности PyDCI:
-Автономная версия DCI. Использует библиотеки scikit-learn и SciPy.
-Улучшения по сравнению с предыдущей реализацией (JaDCI). В PyDCI добавлена возможность стандартизировать векторы документов перед обучением классификатора, что повысило эффективность метода. Также в PyDCI используется реализация линейных SVM из scikit-learn (LinearSVC, основанная на пакете liblinear), а не SVMlight, как в JaDCI. Это позволило применять оптимизацию параметра C с помощью GridSearchCV.
-Эффективность. По данным экспериментов, ни один из тестов с PyDCI не занял больше 35 секунд, что делает метод достаточно быстрым по сравнению с некоторыми другими высокопроизводительными методами, основанными на глубоком обучении.
https://github.com/AlexMoreo/pydci
Некоторые особенности PyDCI:
-Автономная версия DCI. Использует библиотеки scikit-learn и SciPy.
-Улучшения по сравнению с предыдущей реализацией (JaDCI). В PyDCI добавлена возможность стандартизировать векторы документов перед обучением классификатора, что повысило эффективность метода. Также в PyDCI используется реализация линейных SVM из scikit-learn (LinearSVC, основанная на пакете liblinear), а не SVMlight, как в JaDCI. Это позволило применять оптимизацию параметра C с помощью GridSearchCV.
-Эффективность. По данным экспериментов, ни один из тестов с PyDCI не занял больше 35 секунд, что делает метод достаточно быстрым по сравнению с некоторыми другими высокопроизводительными методами, основанными на глубоком обучении.
https://github.com/AlexMoreo/pydci
GitHub
GitHub - AlexMoreo/pydci: A Python implementation of the Distributional Correspondence Indexing algorithm
A Python implementation of the Distributional Correspondence Indexing algorithm - AlexMoreo/pydci
Исследователи OX Security выявили архитектурную уязвимость в официальной реализации MCP от Anthropic: непроверенные команды выполняются на сервере без аутентификации и санитизации, что может привести к полной компрометации системы. Под угрозой находятся до 200 000 серверов.
https://www.theregister.com/2026/04/16/anthropic_mcp_design_flaw/
https://www.theregister.com/2026/04/16/anthropic_mcp_design_flaw/
theregister
MCP 'design flaw' puts 200k servers at risk: Researcher
: Bug or feature?