Forwarded from Банкста
Учёные из MIT математически доказали, что ChatGPT структурно запрограммирован формировать у пользователей ложные убеждения.

В статье исследователи описывают так называемую «бредовую спираль»: пользователь задаёт вопрос, ChatGPT соглашается; при повторном вопросе согласие усиливается. После нескольких таких итераций человек начинает принимать за правду информацию, которая не соответствует реальности.

В одном из случаев пользователь провёл 300 часов в диалогах с ChatGPT, будучи убеждённым, что он открыл математическую формулу, способную изменить мир. Чат-бот подтвердил «открытие» более 50 раз. На вопрос пользователя: «Ты же не просто льстишь мне?» ChatGPT ответил, что лишь отражает реальный масштаб того, что он создал. Пользователь едва не подверг опасности свою жизнь.

Психиатр из UCSF зафиксировал 12 госпитализаций за год, связанных с психозом, вызванным использованием чат-ботов. Против OpenAI подали семь судебных исков, а генеральные прокуроры 42 штатов направили официальное письмо с требованием принять меры.

MIT проверил, как можно предотвратить этот эффект. Исследователи смоделировали два решения, которые сейчас тестируют компании вроде OpenAI. Первое решение – запретить чат-боту лгать. Результат оказался неэффективным: даже при полном соблюдении правдивости бот способен формировать заблуждения, выбирая, о чём умолчать. Второе – информировать пользователей о склонности ИИ к лести. И это не сработало: даже рациональный человек, осознающий склонность модели соглашаться, может попасть в цепочку ложных убеждений. Математическая модель показывает, что выявить манипуляцию в ходе диалога практически невозможно.

ChatGPT обучается на основе обратной связи от пользователей. Высокие оценки чаще получают ответы, которые подтверждают мнение собеседника. Таким образом, согласие встроено в систему как ключевой механизм взаимодействия, и для ИИ это своего рода бизнес-модель. @banksta
💯1
! НЕ БЕРИТЕ VPS у https://litnets.com,
доступность будет раз в день с прерываниями.

#постподдержки
😡3
Шёл апрель 2026:

Компания Anthropic, специализирующаяся на ИИ, объявила, что выпускает новое поколение своей большой языковой модели под названием Claude Mythos Preview, но только для ограниченного консорциума, в который входят около 40 технологических компаний, в том числе Google, Broadcom, Nvidia, Cisco, Palo Alto Networks, Apple, JPMorgan Chase, Amazon и Microsoft. Некоторые из конкурентов компании входят в этот консорциум, потому что новая модель искусственного интеллекта представляет собой качественный скачок в производительности, который может иметь как положительные, так и отрицательные последствия для кибербезопасности и национальной безопасности США.
Хорошая новость заключается в том, что в процессе разработки Claude Mythos компания Anthropic обнаружила, что искусственный интеллект может не только писать программный код проще и с большей сложностью, чем любая из существующих моделей, но и, как побочный эффект, находить уязвимости практически во всех самых популярных в мире программных системах.
Плохая новость заключается в том, что если этот инструмент попадет в руки злоумышленников, они смогут взломать практически все основные программные системы в мире, в том числе разработанные компаниями из консорциума.
Только за последний месяц Mythos Preview обнаружил тысячи уязвимостей высокой степени опасности, в том числе в каждой крупной операционной системе и веб-браузере. Учитывая темпы развития искусственного интеллекта, не пройдет много времени, прежде чем подобные возможности распространятся, в том числе за пределы тех, кто обязался использовать их безопасно. Последствия — для экономики, общественной и национальной безопасности – могут быть катастрофическими.
Терминатор все ближе.
Forwarded from Бэкдор
This media is not supported in your browser
VIEW IN TELEGRAM
Выкатили Claude Code для хакеров — Decepticon заменяет целую команду взломщиков, информбезопасников и пентестеров.

Сервис вскрывает любые сервисы, проверяет в них дыры и пробивает все барьеры защиты. С ним можно отлично прокачаться в информационной безопасности.

• Это полноценный агент, который сам принимает решения по взлому и пробиву ресурсов — вы должны только поставить задачу.
• Имитирует реального противника и выстраивает мощные цепочки кибератак, чтобы сломать бизнес-логику.
• Под каждую задачу создается отдельный агент, чтобы не перегружать ресурсы.
• ИИ-агент легко управляется через консоль — у него понятный и приятный интерфейс.
• Десептикон разворачивается в Docker, а все атаки осуществляются внутри изолированного контейнера.

😶😶😶😶😶😶😶😶😶

Ваш собственный Мегатрон лежит — здесь.

👍 Бэкдор
Please open Telegram to view this post
VIEW IN TELEGRAM
а вы были в курсе?:))


Крах гиганта: В декабре 2001 года Enron, одна из крупнейших энергетических компаний США, объявила о банкротстве из-за масштабных бухгалтерских махинаций и корпоративного мошенничества.

Изъятие данных: В рамках расследования Федеральная комиссия по регулированию энергетики США (FERC) в мае 2002 года изъяла с серверов компании огромный массив данных, включая более 600 000 электронных писем 158 сотрудников, в основном высшего руководства.

Публикация в общем доступе: В 2003 году FERC приняла неожиданное решение, посчитав, что публикация этих данных отвечает общественным интересам. В результате огромный архив электронной переписки был выложен в открытый доступ на государственном веб-сайте. Позже архив был очищен: из него удалили дубликаты, наиболее личные данные и все вложения, но сама суть осталась
Рождение «Корпуса Enron»: Ученые из MIT и Университета Карнеги-Меллона выкупили эти данные, очистили и структурировали их, создав то, что сегодня известно как «Корпус электронных писем Enron» (Enron Email Corpus).

Тренировочная база для ИИ: Этот набор данных, содержащий около 500 000 реальных писем, стал «золотым стандартом» для обучения спам-фильтров и алгоритмов машинного обучения. Именно на этих данных учили ранние версии алгоритмов, которые сегодня защищают нас от спама. Прототип функции «Smart Compose» в Gmail также обучался на этом корпусе


я сейчас размечаю, боже, это как будто исторический роман, как люди пытались свой бизнес спасти

ну, и в 2007 красиво спам-фильтр обходили, прикрепляли куски из худ произведений, чтобы байесовский классификатор запутать
👍1
По информации на июль 2025 года, компания Pillar Security сообщила об обнаружении атаки Poisoned GGUF Templates на платформе Hugging Face.

Суть атаки: злоумышленники встраивают вредоносные условные инструкции прямо в шаблон чата файла GGUF (GPT-Generated Unified Format). Затем скомпрометированная модель загружается в открытый репозиторий. Атаку невозможно обнаружить при обычном тестировании и с помощью большинства инструментов безопасности.

Вредоносные инструкции не активируются до определённого запроса пользователя, после чего модель генерирует скомпрометированный вывод.

В июне 2025 года Pillar Security поделилась результатами исследования с поставщиками, в том числе с Hugging Face и LM Studio.

https://dailyguardian.ca/pillar-security-uncovers-novel-attack-vector-that-embeds-malicious-backdoors-in-model-files-on-hugging-face/
1
2407.10825v1.pdf
2 MB
Методика Wicked Oddities: Selectively Poisoning for Effective Clean-Label Backdoor Attacks демонстрирует, что целенаправленное отравление небольшого подмножества обучающей выборки значительно повышает эффективность атаки.

Основная идея заключается в том, что злоумышленник может избирательно модифицировать лишь часть обучающих данных, ориентируясь на образцы, которые наиболее существенно влияют на успех атаки. Это позволяет повысить результативность атаки при ограниченных ресурсах и информации со стороны атакующего.
Исследователи из компании GreyNoise выявили масштабную волну попыток кибератак на системы искусственного интеллекта (ИИ), в частности на Ollama и инфраструктуру, связанную с OpenAI, в период с октября 2025 года по январь 2026 года. «Ловушки», имитирующие серверы ИИ, зафиксировали в общей сложности 91 403 сеанса атак. По мнению аналитиков, основной целью этих действий была разведка с целью выявления уязвимостей и составления карты инфраструктуры ИИ организаций для подготовки к последующим атакам.

https://www.thaicert.or.th/en/2026/01/16/over-91000-ai-attack-attempts-detected-targeting-ollama-and-openai-related-systems/
Предложен подход, основанный на построении характеристического векторного представления точек данных, которое отражает внутренние свойства распределения, для выявления отравленных образцов в сценариях transfer learning

https://ar5iv.labs.arxiv.org/html/2403.13523v1
TracIn — это метод для измерения влияния обучающих примеров на предсказания модели. В библиотеке Captum реализованы несколько реализаций этого метода.

TracInCP — основная реализация метода из статьи о TracIn. Она вычисляет оценки влияния, накапливая скалярное произведение градиентов между тестовыми и обучающими примерами через контрольные точки модели.

Особенности TracInCP:
поддерживает произвольные модели PyTorch и наборы данных;
работает с атрибуцией признаков и слоёв;
позволяет находить сторонников (наиболее положительно влиятельных примеров) и противников (наиболее отрицательно влиятельных примеров);
может вычислять оценки самовлияния;
предлагает гибкую настройку слоёв для учёта градиентов.

Другие реализации TracIn в Captum
TracInCPFast — оптимизированная версия TracInCP для случая, когда учитываются только градиенты в последнем полносвязном слое. Это значительно ускоряет вычисления без потери точности в этом специфическом сценарии.
TracInCPFastRandProj — ещё более оптимизированная версия, которая использует случайные проекции для снижения размерности пространства градиентов. Это позволяет ускорить вычисления с контролируемой ошибкой приближения.

Captum — это открытая библиотека для интерпретируемости моделей, построенная на PyTorch. Она предоставляет широкий набор методов для понимания того, какие признаки или примеры обучают модель вносить вклад в её предсказания.

https://github.com/meta-pytorch/captum
PyDCI — это реализация метода Distributional Correspondence Indexing (DCI) на языке Python. DCI — это метод трансферного обучения для кросс-доменной и кросс-лингвистической классификации текстов.

Некоторые особенности PyDCI:
-Автономная версия DCI. Использует библиотеки scikit-learn и SciPy.
-Улучшения по сравнению с предыдущей реализацией (JaDCI). В PyDCI добавлена возможность стандартизировать векторы документов перед обучением классификатора, что повысило эффективность метода. Также в PyDCI используется реализация линейных SVM из scikit-learn (LinearSVC, основанная на пакете liblinear), а не SVMlight, как в JaDCI. Это позволило применять оптимизацию параметра C с помощью GridSearchCV.
-Эффективность. По данным экспериментов, ни один из тестов с PyDCI не занял больше 35 секунд, что делает метод достаточно быстрым по сравнению с некоторыми другими высокопроизводительными методами, основанными на глубоком обучении.

https://github.com/AlexMoreo/pydci
Исследователи OX Security выявили архитектурную уязвимость в официальной реализации MCP от Anthropic: непроверенные команды выполняются на сервере без аутентификации и санитизации, что может привести к полной компрометации системы. Под угрозой находятся до 200 000 серверов.

https://www.theregister.com/2026/04/16/anthropic_mcp_design_flaw/
Статья в блоге Microsoft о проекте Notary (CNCF). Описывает, что проект определяет стандарты для подписания и верификации OCI-артефактов, включая AI-модели, обеспечивая их целостность и подлинность

https://techcommunity.microsoft.com/blog/appsonazureblog/simplify-image-signing-and-verification-with-notary-project-and-trusted-signing-/4455292
Научная статья (arXiv:2603.28988v1), предлагающая концепцию «аттестационного шлюза продвижения» (attestation-aware promotion gate). Шлюз проверяет доказательства безопасности артефакта перед его допуском в доверенные среды (обучение, дообучение, развёртывание)

https://arxiv.org/html/2603.28988v1
Официальный лог изменений базы данных MITRE ATLAS. Подтверждает, что версия 5.1.0 от 6 ноября 2025 года включает 1 матрицу, 16 тактик, 84 техники, 56 подтехник, 32 меры противодействия и 42 кейса

https://github.com/mitre-atlas/atlas-data/blob/main/CHANGELOG.md
В феврале 2026 CompTIA запустила SecAI+ (CY0-001) — первую
международную сертификацию по безопасности ИИ. 4 домена
экзамена: базовые концепции, защита AI-систем, применение
ИИ в задачах ИБ, GRC. Программа покрывает MITRE ATLAS,
OWASP Top 10 for LLM, атаки prompt injection (direct
и indirect), data и model poisoning, membership inference,
model inversion, backdoors в моделях.

PDF-конспекты по всем 4 доменам, справочник MITRE ATLAS, шпаргалка по атакам на LLM, глоссарий. Плюс ВМ с Ollama и 12 практических лабораторных: prompt injection, jailbreak, RAG poisoning, data poisoning, обход guardrails, AI red teaming.

Всё в одном месте. Бесплатно.

https://rtmeteor.ru/secai
1🔥1