Forwarded from Machinelearning
🚨 Обнаружено, что релиз LiteLLM на PyPI версии 1.82.8 содержит вредоносный код.

Стандартная команда `pip install litellm` могла привести к утечке:
SSH-ключей, учётных данных AWS/GCP/Azure, Kubernetes-конфигов, git-доступов, всех API-ключей из переменных окружения, истории команд, SSL-ключей, CI/CD-секретов и паролей к базам данных.

И это не нишевая библиотека, у LiteLLM около 97 млн скачиваний в месяц.

Даже без прямой установки litellm вредоносный код мог попасть к пользователям через другие пакеты (например, `dspy`).

Скомпрометированную версию пакета обнаружили случайно: при установке пакета у разработчика произошёл сбой из-за утечки памяти.

Без этого сбоя атака могла оставаться незамеченной долгое время .

Supply chain атаки становятся одним из самых серьёзных рисков в современной разработке.

Подход «использовать как можно больше готовых библиотек» требует некоторого переосмысления.

Andrej Karpathy: https://x.com/karpathy/status/2036488892443140551

1. Первичный разбор (issue на GitHub): https://github.com/BerriAI/litellm/issues/24512
- подробное техническое описание вредоносного кода: что именно крадёт и как работает

2. Официальный issue от BerriAI: https://github.com/BerriAI/litellm/issues/24518
— реакция команды и обновления по ситуации

3. Блог FutureSearch (обнаружили атаку): https://futuresearch.ai/blog/litellm-pypi-supply-chain-attack/
• как баг с fork bomb в вредоносном коде уронил машину и помог выявить атаку

4. Полный таймлайн TeamPCP от ramimac: https://ramimac.me/teampcp/
— вся цепочка атаки: Trivy → Checkmarx → litellm, с точными временными метками и IOC

5. Тред на Hacker News (основной): https://news.ycombinator.com/item?id=47501729
- обсуждение в реальном времени, включая ответы от Krrish (maintainer litellm)

6. Разбор от GitGuardian:
https://blog.gitguardian.com/trivys-march-supply-chain-attack-shows-where-secret-exposure-hurts-most/
- анализ того, как утечка CI/CD-секретов запустила всю цепочку атаки

@ai_machinelearning_big_data

#llm #ml #cybersecurity
😱1
Тут один исследователь пишет в X, мол, навайбкодил себе за месяц простенький фаззер для поиска уязвимостей и запустил его на неделю, используя подписку Claude Max за 200 долларов (это не тот Max, этот хороший). В результате 21 уязвимость уровня high и critical в Chrome. И вроде прям хороший пример изменений, которые несет с собой ИИ и вайбкодинг на его основе. Но есть, как говорится, нюансы. В реверс-инженеры подались все, кому не лень, и стали слать на платформы bug bounty отчеты пачками, усложняя их классификацию и разбор (триаж).

Одной из первых возмутилась Bugcrowd, которая пишет, что столкнулась с резким ростом низкокачественных, неподтвержденных отчетов, которые генерируются или при помощи ИИ, или полностью автоматизированными конвейерами. Компания называет это "sloptimism": когда исследователь или агент присылает спекулятивный баг-репорт с шаблонным описанием, слабой доказательной базой и без нормальной ручной проверки. По данным Bugcrowd, только за последние несколько недель очереди на triage выросли более чем на 334%, если даже не учитывать обычные легитимные отчеты из традиционного багбаунти-процесса.

Компания выделяет три основных источника проблемы. Первый – организации, которые, по версии Bugcrowd, фактически используют живые программы Bug Bounty и сам triage как обучающую среду для своих ИИ-систем. Второй – начинающие исследователи, которые запускают LLM или агентов, но не умеют валидировать результат. Третий – автоматические конвейеры массовой подачи репортов, где отчеты отличаются друг от друга лишь минимально.

В ответ Bugcrowd вводит более жесткие меры. За так называемый submission farming обещают перманентный бан, а восстановление возможно только через апелляцию и подтверждение личности. Аккаунты с 10 и более подряд невалидными отчетами будут проверяться; если будет видно, что это ИИ/автоматизация без нормальной валидации, возможна 30-дневная блокировка. Кроме того, аккаунты с 10 и более невалидными отчетами должны будут пройти проверку личности, прежде чем снова отправлять находки. Отдельно платформа запрещает автоматизированное "застолбление" типовых уязвимостей при запуске программ без демонстрации реального ущерба/воздействия.

Axios в догонку пишет, что мейнтейнеры open-source проектов буквально захлебываются в потоке ИИ-сгенерированных сообщений о якобы найденных уязвимостях. Раньше популярный open-source проект получал в среднем 2–3 баг-отчета в неделю, а менее популярный – примерно один в месяц. Теперь некоторые проекты получают сотни отчетов за раз, и на разбор каждого могут уходить от 2 до 8 часов неоплачиваемого времени мейнтейнера. Axios связывает всплеск с появлением автономных агентов вроде OpenClaw, которые позволяют почти любому автоматизировать поиск потенциальных багов и отправку отчетов. Проблема в том, что многие отправители уже не способны ответить на уточняющие вопросы по найденной "уязвимости", что косвенно указывает, за них работал ИИ, а не человек, понимающий суть проблемы. Linux Foundation тоже жалуется на вал ИИ-сгенерированных сообщений, и именно поэтому Google, Anthropic, AWS, Microsoft и OpenAI участвуют в финансировании инициативы на $12,5 млн для усиления безопасности open source.

Наконец, Google меняет правила своей программы вознаграждений за баги в open source. Для некоторых категорий отчетов теперь будут требовать более качественные доказательства, например воспроизводимость через OSS-Fuzz или уже подготовленный/влитый патч. Идея простая: triage-команды должны тратить время на реальные уязвимости, а не на шум от LLM-генераторов.

В отчете по деятельности Standoff Bug Bounty тема ИИ-слопа не рассмотрена; видимо, пока не стала еще проблемой. Но, думаю, в этом году ситуация изменится. 🟥 так активно продвигает тему обучения реверсеров, что странно будет, если первые шаги они не начнут делать с облегчения своего труда. Кто-то пойдет дальше и станет реально хорошим исследователем, а кто-то так и будет сгенерированные ИИ отчеты слать.

#ии #bugbounty #оценказащищенности
Please open Telegram to view this post
VIEW IN TELEGRAM
1
Forwarded from Банкста
Разработчики искусственного интеллекта Anthropic забыли удалить файлы с исходным кодом Claude Code из публичного доступа. Пользователи успели выложить код на GitHub: в репозитории 512 тысяч строк кода и 40 инструментов для работы с файлами, создания субагентов и «рассуждений».

Исследователь в области безопасности Чаофань Шоу обнаружил, что команда Anthropic оставила в последнем пакете для отладки проекта ссылки на оригинальный код — по ним любой желающий мог восстановить исходник. @banksta
У нас следующая итерация магии про ИИ, теперь AI-агенты внедряются легче.
Все побежали их внедрять, особенно в кибербезопасность: XDR, SIEM, «ИИ-аналитик сам всё разрулит».
А спросишь: «А как ты проверишь, почему агент принял такое решение?» — в ответ молчание или что-то про магию.

Всегда интересно, когда инженеры задумываются о том, как контролировать этих агентов,
когда уже что-то случилось или просто "сильная техническая интуиция" и тревожность?

Вот вышел новый модный условно бесплатный фреймворк для наблюдения за агентами — Langfuse.
Для меня это скорее MlFlow для агентов. Но есть, где поспрашивать!

На практической конференции по DS будет мастер-класс от ребят из МТС:
«Смотри, как думает агент: Observability AI-агентов с Langfuse»

Я пойду. Люблю задавать каверзные вопросы. Ну, вы в курсе.

Ссылка на саму конференцию: 20 апреля в Москве — AiConf 2026
❗️ Промокод на скидку 15%: 2026
👍1
Forwarded from Programmer & IT Memes
Очень похоже на это

🖥 IT Memes
Please open Telegram to view this post
VIEW IN TELEGRAM
😁41
Forwarded from Киберболоид
Никакой магии — только искусственный интеллект

Вера во всесильный ИИ похожа на магическое мышление. Кажется, что скоро уже ничего не будет: ни кино, ни театра, ни книг, ни газет — одно сплошное ИИ.

➡️В своей колонке в «Киберболоиде» продакт-менеджер ГК «Солар» Полина Сокол развеивает популярные мифы об ИИ, объясняет разницу между AI, ML и DL и советует, что в следующий раз говорить коллеге, которому в очередной раз «ChatGPT порекомендовал».

#киберболоид #тренды #ИИ #ChatGPT
Please open Telegram to view this post
VIEW IN TELEGRAM
💯2
Forwarded from Банкста
Учёные из MIT математически доказали, что ChatGPT структурно запрограммирован формировать у пользователей ложные убеждения.

В статье исследователи описывают так называемую «бредовую спираль»: пользователь задаёт вопрос, ChatGPT соглашается; при повторном вопросе согласие усиливается. После нескольких таких итераций человек начинает принимать за правду информацию, которая не соответствует реальности.

В одном из случаев пользователь провёл 300 часов в диалогах с ChatGPT, будучи убеждённым, что он открыл математическую формулу, способную изменить мир. Чат-бот подтвердил «открытие» более 50 раз. На вопрос пользователя: «Ты же не просто льстишь мне?» ChatGPT ответил, что лишь отражает реальный масштаб того, что он создал. Пользователь едва не подверг опасности свою жизнь.

Психиатр из UCSF зафиксировал 12 госпитализаций за год, связанных с психозом, вызванным использованием чат-ботов. Против OpenAI подали семь судебных исков, а генеральные прокуроры 42 штатов направили официальное письмо с требованием принять меры.

MIT проверил, как можно предотвратить этот эффект. Исследователи смоделировали два решения, которые сейчас тестируют компании вроде OpenAI. Первое решение – запретить чат-боту лгать. Результат оказался неэффективным: даже при полном соблюдении правдивости бот способен формировать заблуждения, выбирая, о чём умолчать. Второе – информировать пользователей о склонности ИИ к лести. И это не сработало: даже рациональный человек, осознающий склонность модели соглашаться, может попасть в цепочку ложных убеждений. Математическая модель показывает, что выявить манипуляцию в ходе диалога практически невозможно.

ChatGPT обучается на основе обратной связи от пользователей. Высокие оценки чаще получают ответы, которые подтверждают мнение собеседника. Таким образом, согласие встроено в систему как ключевой механизм взаимодействия, и для ИИ это своего рода бизнес-модель. @banksta
💯1
! НЕ БЕРИТЕ VPS у https://litnets.com,
доступность будет раз в день с прерываниями.

#постподдержки
😡3
Шёл апрель 2026:

Компания Anthropic, специализирующаяся на ИИ, объявила, что выпускает новое поколение своей большой языковой модели под названием Claude Mythos Preview, но только для ограниченного консорциума, в который входят около 40 технологических компаний, в том числе Google, Broadcom, Nvidia, Cisco, Palo Alto Networks, Apple, JPMorgan Chase, Amazon и Microsoft. Некоторые из конкурентов компании входят в этот консорциум, потому что новая модель искусственного интеллекта представляет собой качественный скачок в производительности, который может иметь как положительные, так и отрицательные последствия для кибербезопасности и национальной безопасности США.
Хорошая новость заключается в том, что в процессе разработки Claude Mythos компания Anthropic обнаружила, что искусственный интеллект может не только писать программный код проще и с большей сложностью, чем любая из существующих моделей, но и, как побочный эффект, находить уязвимости практически во всех самых популярных в мире программных системах.
Плохая новость заключается в том, что если этот инструмент попадет в руки злоумышленников, они смогут взломать практически все основные программные системы в мире, в том числе разработанные компаниями из консорциума.
Только за последний месяц Mythos Preview обнаружил тысячи уязвимостей высокой степени опасности, в том числе в каждой крупной операционной системе и веб-браузере. Учитывая темпы развития искусственного интеллекта, не пройдет много времени, прежде чем подобные возможности распространятся, в том числе за пределы тех, кто обязался использовать их безопасно. Последствия — для экономики, общественной и национальной безопасности – могут быть катастрофическими.
Терминатор все ближе.
Forwarded from Бэкдор
This media is not supported in your browser
VIEW IN TELEGRAM
Выкатили Claude Code для хакеров — Decepticon заменяет целую команду взломщиков, информбезопасников и пентестеров.

Сервис вскрывает любые сервисы, проверяет в них дыры и пробивает все барьеры защиты. С ним можно отлично прокачаться в информационной безопасности.

• Это полноценный агент, который сам принимает решения по взлому и пробиву ресурсов — вы должны только поставить задачу.
• Имитирует реального противника и выстраивает мощные цепочки кибератак, чтобы сломать бизнес-логику.
• Под каждую задачу создается отдельный агент, чтобы не перегружать ресурсы.
• ИИ-агент легко управляется через консоль — у него понятный и приятный интерфейс.
• Десептикон разворачивается в Docker, а все атаки осуществляются внутри изолированного контейнера.

😶😶😶😶😶😶😶😶😶

Ваш собственный Мегатрон лежит — здесь.

👍 Бэкдор
Please open Telegram to view this post
VIEW IN TELEGRAM
а вы были в курсе?:))


Крах гиганта: В декабре 2001 года Enron, одна из крупнейших энергетических компаний США, объявила о банкротстве из-за масштабных бухгалтерских махинаций и корпоративного мошенничества.

Изъятие данных: В рамках расследования Федеральная комиссия по регулированию энергетики США (FERC) в мае 2002 года изъяла с серверов компании огромный массив данных, включая более 600 000 электронных писем 158 сотрудников, в основном высшего руководства.

Публикация в общем доступе: В 2003 году FERC приняла неожиданное решение, посчитав, что публикация этих данных отвечает общественным интересам. В результате огромный архив электронной переписки был выложен в открытый доступ на государственном веб-сайте. Позже архив был очищен: из него удалили дубликаты, наиболее личные данные и все вложения, но сама суть осталась
Рождение «Корпуса Enron»: Ученые из MIT и Университета Карнеги-Меллона выкупили эти данные, очистили и структурировали их, создав то, что сегодня известно как «Корпус электронных писем Enron» (Enron Email Corpus).

Тренировочная база для ИИ: Этот набор данных, содержащий около 500 000 реальных писем, стал «золотым стандартом» для обучения спам-фильтров и алгоритмов машинного обучения. Именно на этих данных учили ранние версии алгоритмов, которые сегодня защищают нас от спама. Прототип функции «Smart Compose» в Gmail также обучался на этом корпусе


я сейчас размечаю, боже, это как будто исторический роман, как люди пытались свой бизнес спасти

ну, и в 2007 красиво спам-фильтр обходили, прикрепляли куски из худ произведений, чтобы байесовский классификатор запутать
👍1
По информации на июль 2025 года, компания Pillar Security сообщила об обнаружении атаки Poisoned GGUF Templates на платформе Hugging Face.

Суть атаки: злоумышленники встраивают вредоносные условные инструкции прямо в шаблон чата файла GGUF (GPT-Generated Unified Format). Затем скомпрометированная модель загружается в открытый репозиторий. Атаку невозможно обнаружить при обычном тестировании и с помощью большинства инструментов безопасности.

Вредоносные инструкции не активируются до определённого запроса пользователя, после чего модель генерирует скомпрометированный вывод.

В июне 2025 года Pillar Security поделилась результатами исследования с поставщиками, в том числе с Hugging Face и LM Studio.

https://dailyguardian.ca/pillar-security-uncovers-novel-attack-vector-that-embeds-malicious-backdoors-in-model-files-on-hugging-face/
1
2407.10825v1.pdf
2 MB
Методика Wicked Oddities: Selectively Poisoning for Effective Clean-Label Backdoor Attacks демонстрирует, что целенаправленное отравление небольшого подмножества обучающей выборки значительно повышает эффективность атаки.

Основная идея заключается в том, что злоумышленник может избирательно модифицировать лишь часть обучающих данных, ориентируясь на образцы, которые наиболее существенно влияют на успех атаки. Это позволяет повысить результативность атаки при ограниченных ресурсах и информации со стороны атакующего.
Исследователи из компании GreyNoise выявили масштабную волну попыток кибератак на системы искусственного интеллекта (ИИ), в частности на Ollama и инфраструктуру, связанную с OpenAI, в период с октября 2025 года по январь 2026 года. «Ловушки», имитирующие серверы ИИ, зафиксировали в общей сложности 91 403 сеанса атак. По мнению аналитиков, основной целью этих действий была разведка с целью выявления уязвимостей и составления карты инфраструктуры ИИ организаций для подготовки к последующим атакам.

https://www.thaicert.or.th/en/2026/01/16/over-91000-ai-attack-attempts-detected-targeting-ollama-and-openai-related-systems/
Предложен подход, основанный на построении характеристического векторного представления точек данных, которое отражает внутренние свойства распределения, для выявления отравленных образцов в сценариях transfer learning

https://ar5iv.labs.arxiv.org/html/2403.13523v1
TracIn — это метод для измерения влияния обучающих примеров на предсказания модели. В библиотеке Captum реализованы несколько реализаций этого метода.

TracInCP — основная реализация метода из статьи о TracIn. Она вычисляет оценки влияния, накапливая скалярное произведение градиентов между тестовыми и обучающими примерами через контрольные точки модели.

Особенности TracInCP:
поддерживает произвольные модели PyTorch и наборы данных;
работает с атрибуцией признаков и слоёв;
позволяет находить сторонников (наиболее положительно влиятельных примеров) и противников (наиболее отрицательно влиятельных примеров);
может вычислять оценки самовлияния;
предлагает гибкую настройку слоёв для учёта градиентов.

Другие реализации TracIn в Captum
TracInCPFast — оптимизированная версия TracInCP для случая, когда учитываются только градиенты в последнем полносвязном слое. Это значительно ускоряет вычисления без потери точности в этом специфическом сценарии.
TracInCPFastRandProj — ещё более оптимизированная версия, которая использует случайные проекции для снижения размерности пространства градиентов. Это позволяет ускорить вычисления с контролируемой ошибкой приближения.

Captum — это открытая библиотека для интерпретируемости моделей, построенная на PyTorch. Она предоставляет широкий набор методов для понимания того, какие признаки или примеры обучают модель вносить вклад в её предсказания.

https://github.com/meta-pytorch/captum
PyDCI — это реализация метода Distributional Correspondence Indexing (DCI) на языке Python. DCI — это метод трансферного обучения для кросс-доменной и кросс-лингвистической классификации текстов.

Некоторые особенности PyDCI:
-Автономная версия DCI. Использует библиотеки scikit-learn и SciPy.
-Улучшения по сравнению с предыдущей реализацией (JaDCI). В PyDCI добавлена возможность стандартизировать векторы документов перед обучением классификатора, что повысило эффективность метода. Также в PyDCI используется реализация линейных SVM из scikit-learn (LinearSVC, основанная на пакете liblinear), а не SVMlight, как в JaDCI. Это позволило применять оптимизацию параметра C с помощью GridSearchCV.
-Эффективность. По данным экспериментов, ни один из тестов с PyDCI не занял больше 35 секунд, что делает метод достаточно быстрым по сравнению с некоторыми другими высокопроизводительными методами, основанными на глубоком обучении.

https://github.com/AlexMoreo/pydci
Исследователи OX Security выявили архитектурную уязвимость в официальной реализации MCP от Anthropic: непроверенные команды выполняются на сервере без аутентификации и санитизации, что может привести к полной компрометации системы. Под угрозой находятся до 200 000 серверов.

https://www.theregister.com/2026/04/16/anthropic_mcp_design_flaw/