У нас следующая итерация магии про ИИ, теперь AI-агенты внедряются легче.
Все побежали их внедрять, особенно в кибербезопасность: XDR, SIEM, «ИИ-аналитик сам всё разрулит».
А спросишь: «А как ты проверишь, почему агент принял такое решение?» — в ответ молчание или что-то про магию.
Всегда интересно, когда инженеры задумываются о том, как контролировать этих агентов,
когда уже что-то случилось или просто "сильная техническая интуиция" и тревожность?
Вот вышел новый модный условно бесплатный фреймворк для наблюдения за агентами — Langfuse.
Для меня это скорее MlFlow для агентов. Но есть, где поспрашивать!
На практической конференции по DS будет мастер-класс от ребят из МТС:
«Смотри, как думает агент: Observability AI-агентов с Langfuse»
Я пойду. Люблю задавать каверзные вопросы. Ну, вы в курсе.
Ссылка на саму конференцию: 20 апреля в Москве — AiConf 2026
Все побежали их внедрять, особенно в кибербезопасность: XDR, SIEM, «ИИ-аналитик сам всё разрулит».
А спросишь: «А как ты проверишь, почему агент принял такое решение?» — в ответ молчание или что-то про магию.
Всегда интересно, когда инженеры задумываются о том, как контролировать этих агентов,
когда уже что-то случилось или просто "сильная техническая интуиция" и тревожность?
Вот вышел новый модный условно бесплатный фреймворк для наблюдения за агентами — Langfuse.
Для меня это скорее MlFlow для агентов. Но есть, где поспрашивать!
На практической конференции по DS будет мастер-класс от ребят из МТС:
«Смотри, как думает агент: Observability AI-агентов с Langfuse»
Я пойду. Люблю задавать каверзные вопросы. Ну, вы в курсе.
Ссылка на саму конференцию: 20 апреля в Москве — AiConf 2026
❗️ Промокод на скидку 15%: 2026
aiconf.ru
Прикладная конференция по Data Science 2026
👍1
Forwarded from Киберболоид
Никакой магии — только искусственный интеллект
Вера во всесильный ИИ похожа на магическое мышление. Кажется, что скоро уже ничего не будет: ни кино, ни театра, ни книг, ни газет — одно сплошное ИИ.
➡️ В своей колонке в «Киберболоиде» продакт-менеджер ГК «Солар» Полина Сокол развеивает популярные мифы об ИИ, объясняет разницу между AI, ML и DL и советует, что в следующий раз говорить коллеге, которому в очередной раз «ChatGPT порекомендовал».
#киберболоид #тренды #ИИ #ChatGPT
Вера во всесильный ИИ похожа на магическое мышление. Кажется, что скоро уже ничего не будет: ни кино, ни театра, ни книг, ни газет — одно сплошное ИИ.
#киберболоид #тренды #ИИ #ChatGPT
Please open Telegram to view this post
VIEW IN TELEGRAM
💯2
Forwarded from Банкста
Учёные из MIT математически доказали, что ChatGPT структурно запрограммирован формировать у пользователей ложные убеждения.
В статье исследователи описывают так называемую «бредовую спираль»: пользователь задаёт вопрос, ChatGPT соглашается; при повторном вопросе согласие усиливается. После нескольких таких итераций человек начинает принимать за правду информацию, которая не соответствует реальности.
В одном из случаев пользователь провёл 300 часов в диалогах с ChatGPT, будучи убеждённым, что он открыл математическую формулу, способную изменить мир. Чат-бот подтвердил «открытие» более 50 раз. На вопрос пользователя: «Ты же не просто льстишь мне?» ChatGPT ответил, что лишь отражает реальный масштаб того, что он создал. Пользователь едва не подверг опасности свою жизнь.
Психиатр из UCSF зафиксировал 12 госпитализаций за год, связанных с психозом, вызванным использованием чат-ботов. Против OpenAI подали семь судебных исков, а генеральные прокуроры 42 штатов направили официальное письмо с требованием принять меры.
MIT проверил, как можно предотвратить этот эффект. Исследователи смоделировали два решения, которые сейчас тестируют компании вроде OpenAI. Первое решение – запретить чат-боту лгать. Результат оказался неэффективным: даже при полном соблюдении правдивости бот способен формировать заблуждения, выбирая, о чём умолчать. Второе – информировать пользователей о склонности ИИ к лести. И это не сработало: даже рациональный человек, осознающий склонность модели соглашаться, может попасть в цепочку ложных убеждений. Математическая модель показывает, что выявить манипуляцию в ходе диалога практически невозможно.
ChatGPT обучается на основе обратной связи от пользователей. Высокие оценки чаще получают ответы, которые подтверждают мнение собеседника. Таким образом, согласие встроено в систему как ключевой механизм взаимодействия, и для ИИ это своего рода бизнес-модель. @banksta
В статье исследователи описывают так называемую «бредовую спираль»: пользователь задаёт вопрос, ChatGPT соглашается; при повторном вопросе согласие усиливается. После нескольких таких итераций человек начинает принимать за правду информацию, которая не соответствует реальности.
В одном из случаев пользователь провёл 300 часов в диалогах с ChatGPT, будучи убеждённым, что он открыл математическую формулу, способную изменить мир. Чат-бот подтвердил «открытие» более 50 раз. На вопрос пользователя: «Ты же не просто льстишь мне?» ChatGPT ответил, что лишь отражает реальный масштаб того, что он создал. Пользователь едва не подверг опасности свою жизнь.
Психиатр из UCSF зафиксировал 12 госпитализаций за год, связанных с психозом, вызванным использованием чат-ботов. Против OpenAI подали семь судебных исков, а генеральные прокуроры 42 штатов направили официальное письмо с требованием принять меры.
MIT проверил, как можно предотвратить этот эффект. Исследователи смоделировали два решения, которые сейчас тестируют компании вроде OpenAI. Первое решение – запретить чат-боту лгать. Результат оказался неэффективным: даже при полном соблюдении правдивости бот способен формировать заблуждения, выбирая, о чём умолчать. Второе – информировать пользователей о склонности ИИ к лести. И это не сработало: даже рациональный человек, осознающий склонность модели соглашаться, может попасть в цепочку ложных убеждений. Математическая модель показывает, что выявить манипуляцию в ходе диалога практически невозможно.
ChatGPT обучается на основе обратной связи от пользователей. Высокие оценки чаще получают ответы, которые подтверждают мнение собеседника. Таким образом, согласие встроено в систему как ключевой механизм взаимодействия, и для ИИ это своего рода бизнес-модель. @banksta
💯1
Шёл апрель 2026:
Компания Anthropic, специализирующаяся на ИИ, объявила, что выпускает новое поколение своей большой языковой модели под названием Claude Mythos Preview, но только для ограниченного консорциума, в который входят около 40 технологических компаний, в том числе Google, Broadcom, Nvidia, Cisco, Palo Alto Networks, Apple, JPMorgan Chase, Amazon и Microsoft. Некоторые из конкурентов компании входят в этот консорциум, потому что новая модель искусственного интеллекта представляет собой качественный скачок в производительности, который может иметь как положительные, так и отрицательные последствия для кибербезопасности и национальной безопасности США.
Хорошая новость заключается в том, что в процессе разработки Claude Mythos компания Anthropic обнаружила, что искусственный интеллект может не только писать программный код проще и с большей сложностью, чем любая из существующих моделей, но и, как побочный эффект, находить уязвимости практически во всех самых популярных в мире программных системах.
Плохая новость заключается в том, что если этот инструмент попадет в руки злоумышленников, они смогут взломать практически все основные программные системы в мире, в том числе разработанные компаниями из консорциума.
Только за последний месяц Mythos Preview обнаружил тысячи уязвимостей высокой степени опасности, в том числе в каждой крупной операционной системе и веб-браузере. Учитывая темпы развития искусственного интеллекта, не пройдет много времени, прежде чем подобные возможности распространятся, в том числе за пределы тех, кто обязался использовать их безопасно. Последствия — для экономики, общественной и национальной безопасности – могут быть катастрофическими.
Терминатор все ближе.
Forwarded from Бэкдор
This media is not supported in your browser
VIEW IN TELEGRAM
Выкатили Claude Code для хакеров — Decepticon заменяет целую команду взломщиков, информбезопасников и пентестеров.
Сервис вскрывает любые сервисы, проверяет в них дыры и пробивает все барьеры защиты. С ним можно отлично прокачаться в информационной безопасности.
• Это полноценный агент, который сам принимает решения по взлому и пробиву ресурсов — вы должны только поставить задачу.
• Имитирует реального противника и выстраивает мощные цепочки кибератак, чтобы сломать бизнес-логику.
• Под каждую задачу создается отдельный агент, чтобы не перегружать ресурсы.
• ИИ-агент легко управляется через консоль — у него понятный и приятный интерфейс.
• Десептикон разворачивается в Docker, а все атаки осуществляются внутри изолированного контейнера.
😶 😶 😶 😶 😶 😶 😶 😶 😶
Ваш собственный Мегатрон лежит — здесь.
👍 Бэкдор
Сервис вскрывает любые сервисы, проверяет в них дыры и пробивает все барьеры защиты. С ним можно отлично прокачаться в информационной безопасности.
• Это полноценный агент, который сам принимает решения по взлому и пробиву ресурсов — вы должны только поставить задачу.
• Имитирует реального противника и выстраивает мощные цепочки кибератак, чтобы сломать бизнес-логику.
• Под каждую задачу создается отдельный агент, чтобы не перегружать ресурсы.
• ИИ-агент легко управляется через консоль — у него понятный и приятный интерфейс.
• Десептикон разворачивается в Docker, а все атаки осуществляются внутри изолированного контейнера.
Ваш собственный Мегатрон лежит — здесь.
Please open Telegram to view this post
VIEW IN TELEGRAM
а вы были в курсе?:))
Крах гиганта: В декабре 2001 года Enron, одна из крупнейших энергетических компаний США, объявила о банкротстве из-за масштабных бухгалтерских махинаций и корпоративного мошенничества.
Изъятие данных: В рамках расследования Федеральная комиссия по регулированию энергетики США (FERC) в мае 2002 года изъяла с серверов компании огромный массив данных, включая более 600 000 электронных писем 158 сотрудников, в основном высшего руководства.
Публикация в общем доступе: В 2003 году FERC приняла неожиданное решение, посчитав, что публикация этих данных отвечает общественным интересам. В результате огромный архив электронной переписки был выложен в открытый доступ на государственном веб-сайте. Позже архив был очищен: из него удалили дубликаты, наиболее личные данные и все вложения, но сама суть осталась
Рождение «Корпуса Enron»: Ученые из MIT и Университета Карнеги-Меллона выкупили эти данные, очистили и структурировали их, создав то, что сегодня известно как «Корпус электронных писем Enron» (Enron Email Corpus).
Тренировочная база для ИИ: Этот набор данных, содержащий около 500 000 реальных писем, стал «золотым стандартом» для обучения спам-фильтров и алгоритмов машинного обучения. Именно на этих данных учили ранние версии алгоритмов, которые сегодня защищают нас от спама. Прототип функции «Smart Compose» в Gmail также обучался на этом корпусе
я сейчас размечаю, боже, это как будто исторический роман, как люди пытались свой бизнес спасти
ну, и в 2007 красиво спам-фильтр обходили, прикрепляли куски из худ произведений, чтобы байесовский классификатор запутать
Крах гиганта: В декабре 2001 года Enron, одна из крупнейших энергетических компаний США, объявила о банкротстве из-за масштабных бухгалтерских махинаций и корпоративного мошенничества.
Изъятие данных: В рамках расследования Федеральная комиссия по регулированию энергетики США (FERC) в мае 2002 года изъяла с серверов компании огромный массив данных, включая более 600 000 электронных писем 158 сотрудников, в основном высшего руководства.
Публикация в общем доступе: В 2003 году FERC приняла неожиданное решение, посчитав, что публикация этих данных отвечает общественным интересам. В результате огромный архив электронной переписки был выложен в открытый доступ на государственном веб-сайте. Позже архив был очищен: из него удалили дубликаты, наиболее личные данные и все вложения, но сама суть осталась
Рождение «Корпуса Enron»: Ученые из MIT и Университета Карнеги-Меллона выкупили эти данные, очистили и структурировали их, создав то, что сегодня известно как «Корпус электронных писем Enron» (Enron Email Corpus).
Тренировочная база для ИИ: Этот набор данных, содержащий около 500 000 реальных писем, стал «золотым стандартом» для обучения спам-фильтров и алгоритмов машинного обучения. Именно на этих данных учили ранние версии алгоритмов, которые сегодня защищают нас от спама. Прототип функции «Smart Compose» в Gmail также обучался на этом корпусе
я сейчас размечаю, боже, это как будто исторический роман, как люди пытались свой бизнес спасти
ну, и в 2007 красиво спам-фильтр обходили, прикрепляли куски из худ произведений, чтобы байесовский классификатор запутать
👍1
По информации на июль 2025 года, компания Pillar Security сообщила об обнаружении атаки Poisoned GGUF Templates на платформе Hugging Face.
Суть атаки: злоумышленники встраивают вредоносные условные инструкции прямо в шаблон чата файла GGUF (GPT-Generated Unified Format). Затем скомпрометированная модель загружается в открытый репозиторий. Атаку невозможно обнаружить при обычном тестировании и с помощью большинства инструментов безопасности.
Вредоносные инструкции не активируются до определённого запроса пользователя, после чего модель генерирует скомпрометированный вывод.
В июне 2025 года Pillar Security поделилась результатами исследования с поставщиками, в том числе с Hugging Face и LM Studio.
https://dailyguardian.ca/pillar-security-uncovers-novel-attack-vector-that-embeds-malicious-backdoors-in-model-files-on-hugging-face/
Суть атаки: злоумышленники встраивают вредоносные условные инструкции прямо в шаблон чата файла GGUF (GPT-Generated Unified Format). Затем скомпрометированная модель загружается в открытый репозиторий. Атаку невозможно обнаружить при обычном тестировании и с помощью большинства инструментов безопасности.
Вредоносные инструкции не активируются до определённого запроса пользователя, после чего модель генерирует скомпрометированный вывод.
В июне 2025 года Pillar Security поделилась результатами исследования с поставщиками, в том числе с Hugging Face и LM Studio.
https://dailyguardian.ca/pillar-security-uncovers-novel-attack-vector-that-embeds-malicious-backdoors-in-model-files-on-hugging-face/
Daily Guardian
Pillar Security Uncovers Novel Attack Vector That Embeds Malicious Backdoors in Model Files on Hugging Face
TEL EVIV, Israel, July 09, 2025 (GLOBE NEWSWIRE) -- Pillar Security, a leading company in AI security, discovered a novel supply chain attack vector that
❤1
2407.10825v1.pdf
2 MB
Методика Wicked Oddities: Selectively Poisoning for Effective Clean-Label Backdoor Attacks демонстрирует, что целенаправленное отравление небольшого подмножества обучающей выборки значительно повышает эффективность атаки.
Основная идея заключается в том, что злоумышленник может избирательно модифицировать лишь часть обучающих данных, ориентируясь на образцы, которые наиболее существенно влияют на успех атаки. Это позволяет повысить результативность атаки при ограниченных ресурсах и информации со стороны атакующего.
Основная идея заключается в том, что злоумышленник может избирательно модифицировать лишь часть обучающих данных, ориентируясь на образцы, которые наиболее существенно влияют на успех атаки. Это позволяет повысить результативность атаки при ограниченных ресурсах и информации со стороны атакующего.
Исследователи из компании GreyNoise выявили масштабную волну попыток кибератак на системы искусственного интеллекта (ИИ), в частности на Ollama и инфраструктуру, связанную с OpenAI, в период с октября 2025 года по январь 2026 года. «Ловушки», имитирующие серверы ИИ, зафиксировали в общей сложности 91 403 сеанса атак. По мнению аналитиков, основной целью этих действий была разведка с целью выявления уязвимостей и составления карты инфраструктуры ИИ организаций для подготовки к последующим атакам.
https://www.thaicert.or.th/en/2026/01/16/over-91000-ai-attack-attempts-detected-targeting-ollama-and-openai-related-systems/
https://www.thaicert.or.th/en/2026/01/16/over-91000-ai-attack-attempts-detected-targeting-ollama-and-openai-related-systems/
Предложен подход, основанный на построении характеристического векторного представления точек данных, которое отражает внутренние свойства распределения, для выявления отравленных образцов в сценариях transfer learning
https://ar5iv.labs.arxiv.org/html/2403.13523v1
https://ar5iv.labs.arxiv.org/html/2403.13523v1
ar5iv
Have You Poisoned My Data? Defending Neural Networks against Data Poisoning Partially funded by the Technology Innovation Institute…
The unprecedented availability of training data fueled the rapid development of powerful neural networks in recent years. However, the need for such large amounts of data leads to potential threats such as poisoning at…
TracIn — это метод для измерения влияния обучающих примеров на предсказания модели. В библиотеке Captum реализованы несколько реализаций этого метода.
TracInCP — основная реализация метода из статьи о TracIn. Она вычисляет оценки влияния, накапливая скалярное произведение градиентов между тестовыми и обучающими примерами через контрольные точки модели.
Особенности TracInCP:
поддерживает произвольные модели PyTorch и наборы данных;
работает с атрибуцией признаков и слоёв;
позволяет находить сторонников (наиболее положительно влиятельных примеров) и противников (наиболее отрицательно влиятельных примеров);
может вычислять оценки самовлияния;
предлагает гибкую настройку слоёв для учёта градиентов.
Другие реализации TracIn в Captum
TracInCPFast — оптимизированная версия TracInCP для случая, когда учитываются только градиенты в последнем полносвязном слое. Это значительно ускоряет вычисления без потери точности в этом специфическом сценарии.
TracInCPFastRandProj — ещё более оптимизированная версия, которая использует случайные проекции для снижения размерности пространства градиентов. Это позволяет ускорить вычисления с контролируемой ошибкой приближения.
Captum — это открытая библиотека для интерпретируемости моделей, построенная на PyTorch. Она предоставляет широкий набор методов для понимания того, какие признаки или примеры обучают модель вносить вклад в её предсказания.
https://github.com/meta-pytorch/captum
TracInCP — основная реализация метода из статьи о TracIn. Она вычисляет оценки влияния, накапливая скалярное произведение градиентов между тестовыми и обучающими примерами через контрольные точки модели.
Особенности TracInCP:
поддерживает произвольные модели PyTorch и наборы данных;
работает с атрибуцией признаков и слоёв;
позволяет находить сторонников (наиболее положительно влиятельных примеров) и противников (наиболее отрицательно влиятельных примеров);
может вычислять оценки самовлияния;
предлагает гибкую настройку слоёв для учёта градиентов.
Другие реализации TracIn в Captum
TracInCPFast — оптимизированная версия TracInCP для случая, когда учитываются только градиенты в последнем полносвязном слое. Это значительно ускоряет вычисления без потери точности в этом специфическом сценарии.
TracInCPFastRandProj — ещё более оптимизированная версия, которая использует случайные проекции для снижения размерности пространства градиентов. Это позволяет ускорить вычисления с контролируемой ошибкой приближения.
Captum — это открытая библиотека для интерпретируемости моделей, построенная на PyTorch. Она предоставляет широкий набор методов для понимания того, какие признаки или примеры обучают модель вносить вклад в её предсказания.
https://github.com/meta-pytorch/captum
GitHub
GitHub - meta-pytorch/captum: Model interpretability and understanding for PyTorch
Model interpretability and understanding for PyTorch - meta-pytorch/captum
PyDCI — это реализация метода Distributional Correspondence Indexing (DCI) на языке Python. DCI — это метод трансферного обучения для кросс-доменной и кросс-лингвистической классификации текстов.
Некоторые особенности PyDCI:
-Автономная версия DCI. Использует библиотеки scikit-learn и SciPy.
-Улучшения по сравнению с предыдущей реализацией (JaDCI). В PyDCI добавлена возможность стандартизировать векторы документов перед обучением классификатора, что повысило эффективность метода. Также в PyDCI используется реализация линейных SVM из scikit-learn (LinearSVC, основанная на пакете liblinear), а не SVMlight, как в JaDCI. Это позволило применять оптимизацию параметра C с помощью GridSearchCV.
-Эффективность. По данным экспериментов, ни один из тестов с PyDCI не занял больше 35 секунд, что делает метод достаточно быстрым по сравнению с некоторыми другими высокопроизводительными методами, основанными на глубоком обучении.
https://github.com/AlexMoreo/pydci
Некоторые особенности PyDCI:
-Автономная версия DCI. Использует библиотеки scikit-learn и SciPy.
-Улучшения по сравнению с предыдущей реализацией (JaDCI). В PyDCI добавлена возможность стандартизировать векторы документов перед обучением классификатора, что повысило эффективность метода. Также в PyDCI используется реализация линейных SVM из scikit-learn (LinearSVC, основанная на пакете liblinear), а не SVMlight, как в JaDCI. Это позволило применять оптимизацию параметра C с помощью GridSearchCV.
-Эффективность. По данным экспериментов, ни один из тестов с PyDCI не занял больше 35 секунд, что делает метод достаточно быстрым по сравнению с некоторыми другими высокопроизводительными методами, основанными на глубоком обучении.
https://github.com/AlexMoreo/pydci
GitHub
GitHub - AlexMoreo/pydci: A Python implementation of the Distributional Correspondence Indexing algorithm
A Python implementation of the Distributional Correspondence Indexing algorithm - AlexMoreo/pydci
Исследователи OX Security выявили архитектурную уязвимость в официальной реализации MCP от Anthropic: непроверенные команды выполняются на сервере без аутентификации и санитизации, что может привести к полной компрометации системы. Под угрозой находятся до 200 000 серверов.
https://www.theregister.com/2026/04/16/anthropic_mcp_design_flaw/
https://www.theregister.com/2026/04/16/anthropic_mcp_design_flaw/
theregister
MCP 'design flaw' puts 200k servers at risk: Researcher
: Bug or feature?
Статья в блоге Microsoft о проекте Notary (CNCF). Описывает, что проект определяет стандарты для подписания и верификации OCI-артефактов, включая AI-модели, обеспечивая их целостность и подлинность
https://techcommunity.microsoft.com/blog/appsonazureblog/simplify-image-signing-and-verification-with-notary-project-and-trusted-signing-/4455292
https://techcommunity.microsoft.com/blog/appsonazureblog/simplify-image-signing-and-verification-with-notary-project-and-trusted-signing-/4455292
TECHCOMMUNITY.MICROSOFT.COM
Simplify Image Signing and Verification with Notary Project and Trusted Signing (Public Preview) | Microsoft Community Hub
Supply chain security has become one of the most pressing challenges for modern cloud-native applications. Every container image, Helm chart, SBOM, or AI...
Научная статья (arXiv:2603.28988v1), предлагающая концепцию «аттестационного шлюза продвижения» (attestation-aware promotion gate). Шлюз проверяет доказательства безопасности артефакта перед его допуском в доверенные среды (обучение, дообучение, развёртывание)
https://arxiv.org/html/2603.28988v1
https://arxiv.org/html/2603.28988v1