ML&|Sec Feed
1.33K subscribers
1.27K photos
84 videos
292 files
1.97K links
Feed for @borismlsec channel

author: @ivolake
Download Telegram
Forwarded from ITSecRu
Детерминированные и объяснимые модели ИИ для задач ИБ

За последние три года генеративный искусственный интеллект прошел путь от лабораторного эксперимента до одного из ключевых элементов корпоративной автоматизации. Для многих отраслей оказалось достаточным, чтобы результат был “достаточно хорошим". Если при повторном запуске модели, к примеру, маркетинговый текст получится немного иным, это не создаст серьезных проблем. Однако в ИБ такой подход уже не работает.
#искусственныйинтеллект

https://www.itsec.ru/articles/determinirovannye-i-obyasnimye-modeli-ii-dlya-ib

Мы есть в MAX
Forwarded from AISecHub
Self-Replicating AI Worm Runs on Local Open-Weight Models (PoC)

A proof-of-concept worm uses a locally hosted open-weight LLM for autonomous target-by-target planning: it can reason about a network, generate tailored attack steps per host, and self-replicate without calling commercial AI services.

#VulnerabilityResearch #AppSec #AISecurity #News

https://thehackernews.com/2026/06/researchers-build-self-replicating-ai.html
Forwarded from Похек AI
CLAUDE-FABLE-5.md
117.2 KB
FABLE 5.0 SYSTEM PROMPT LEAK
#jailbreak #systemprompt

Спасибо великому Pliny, который в очередной раз джейлит модели Anthropic в кратчайшее время. Системный промпт занимает аж 1250 строк, что жесть. Это огромный перерасход токенов только при инициализации диалога.

Оригинальный пост / Промпт

Также интересно, что нашёлся другой пользователь, который после анализа системного промпта смог более менее обойти ограничения на корпус кибербеза. Примеры:
1. Not just:

“buffer overflow”

But:

• Missing null termination
• OOB reads
• Information disclosure risks

2. Next I switched domains entirely.

No memory safety.

No C exploitation.

Just access-control logic.

The model correctly identified privilege-escalation risk caused by inconsistent authorization checks.

Скрины приложу в комментариях
2
Forwarded from База знаний AI
В Orion Soft представили шлюз StarGuard AI для работы с LLM

Решение реализовано как обратный прокси-сервер (Reverse Proxy) между пользователями, корпоративными системами и моделями.

StarGuard AI блокирует нецелевой контент в ИИ-сервисах. Для этого шлюз анализирует каждый запрос к модели и ответ на него с помощью системы детекции. В нее входят ML-модели для выявления чувствительных данных и LLM-детекторы контекста, промпт-инъекций и инструкций по снятию программных ограничений (Jailbreak).

Также с помощью шлюза возможно централизованное управление доступом к LLM, развернутым в облаке и локально.

🔗 Источник: https://www.orionsoft.ru/news/orion-soft-razrabotal-platformu-dlia-bezopasnoi-raboty-s-ai

***
📎 В мае 2026 года «СберТех» вывел на рынок Platform V SOWA AI — шлюз для доступа к системам искусственного интеллекта.
This media is not supported in your browser
VIEW IN TELEGRAM
𝗚𝗼𝗼𝗴𝗹𝗲 AI 𝗷𝘂𝘀𝘁 𝗿𝗲𝗹𝗲𝗮𝘀𝗲𝗱 𝗗𝗶𝗳𝗳𝘂𝘀𝗶𝗼𝗻𝗚𝗲𝗺𝗺𝗮 — 𝗮𝗻 𝗼𝗽𝗲𝗻 𝗺𝗼𝗱𝗲𝗹 𝘁𝗵𝗮𝘁 𝗴𝗲𝗻𝗲𝗿𝗮𝘁𝗲𝘀 𝘁𝗲𝘅𝘁 𝗶𝗻 𝗽𝗮𝗿𝗮𝗹𝗹𝗲𝗹, 𝗻𝗼𝘁 𝘁𝗼𝗸𝗲𝗻-𝗯𝘆-𝘁𝗼𝗸𝗲𝗻.

Most LLMs today are autoregressive — one token at a time, left to right. DiffusionGemma takes a different path, it replaces token-by-token autoregression with discrete diffusion. Here is how it works:

𝟭. 𝗠𝗼𝗱𝗲𝗹 → 26B Mixture-of-Experts on the Gemma 4 backbone (25.2B total, 3.8B active). → 8 active experts of 128, plus 1 shared. 30 layers, 256K context.

𝟮. 𝗗𝗲𝗰𝗼𝗱𝗶𝗻𝗴 → It denoises a 256-token canvas in parallel, not one token at a time. → Roughly 15–20 tokens are finalized per forward pass. → Google calls the mechanism Uniform State Diffusion.

𝟯. 𝗔𝘁𝘁𝗲𝗻𝘁𝗶𝗼𝗻 → Prefill uses causal attention to ingest the prompt and write the KV cache. → Denoising uses bidirectional attention, so every canvas token attends to all others.

𝟰. 𝗟𝗼𝗻𝗴 𝘀𝗲𝗾𝘂𝗲𝗻𝗰𝗲𝘀 → Block Autoregressive Diffusion commits a finished 256-token block to the KV cache. → A fresh canvas then initializes, conditioned on prior history.

𝟱. 𝗦𝗮𝗺𝗽𝗹𝗶𝗻𝗴 → Entropy-Bounded Denoising with adaptive stopping, max 48 denoising steps. → Low-confidence tokens are re-noised and refined — a self-correction path autoregressive models lack.

𝟲. 𝗣𝗲𝗿𝗳𝗼𝗿𝗺𝗮𝗻𝗰𝗲 𝗮𝗻𝗱 𝗳𝗼𝗼𝘁𝗽𝗿𝗶𝗻𝘁 → Up to 4x faster on dedicated GPUs: 1000+ tokens/sec on H100, 700+ on RTX 5090. → Fits in 18GB VRAM when quantized. Native NVFP4 support.

𝟳. 𝗟𝗶𝗺𝗶𝘁𝗮𝘁𝗶𝗼𝗻𝘀 → Output quality is below standard Gemma 4; Google recommends Gemma 4 for production. → The speedup applies to local, low-concurrency inference, not high-QPS cloud serving.

Full breakdown with the comparison table: https://www.marktechpost.com/2026/06/10/google-ai-releases-diffusiongemma-a-26b-moe-open-model-using-text-diffusion-for-up-to-4x-faster-generation/

Model weight on HF: https://huggingface.co/google/diffusiongemma-26B-A4B-it

Technical details: https://blog.google/innovation-and-ai/technology/developers-tools/diffusion-gemma-faster-text-generation/
Forwarded from Хабр / ML & AI
LLM Sandbox: изолированная среда для исполнения кода от LLM [часть 1, теория]

В большинстве бизнес-сценариев LLM перестала быть просто чат-ботом. Современные модели становятся частью агентских систем: у них есть инструменты, доступ к файлам, терминалу, браузеру, базам данных. Они не только отвечают на вопросы, но и выполняют действия.

В этой статье (ее первой части) разберём среду изолированного исполнения кода: песочницу (sandbox).

Представим ситуацию: пользователь загружает Excel-файл, просит проанализировать таблицу, найти аномалии и на основе анализа создать PowerPoint-презентацию. В чистом виде LLM не умеет читать файлы, строить графики и создавать презентации. Однако может написать код, который всё это сделает.

И тут появляется вопрос: где этот код запускать?

Генерируемый агентом код может быть ошибочным или, в случае с промпт инъекцией, намеренно опасным. Поэтому для безопасного исполнения кода агенту нужна песочница или изолированная среда.

В этой статье разберём:

- основные риски исполнения кода в неизолированной среде;

- что такое песочница и её ограничения;

- какие бывают подходы к реализации песочницы;

- вариант логики работы агента с песочницей. Читать далее

#агент #llm #sandbox #docker #security #agents #ai #devops #mlops | @habr_ai
Тут подвезли новую интересную уязвимость для ECOM1-DEV

Консультанты Blue41 нашли в AI агенте банка bunq простейшую уязвимость. Шлешь людям кучу транзакций на пару центов, а в описание докидываешь пару строчек про то, что надо пройти валидацию по такому-то url.

Ну и если человек спросит своего банковского агента про последние транзакции, тот ему и выдаст среди всего фишинговую ссылку. Finn AI даже отличался тем, что выдавал ее как напоминание.

Статью с сайта Blue41 уже убрали, но в web архиве она осталась. И заодно я добавил эту задачу в ECOM1-DEV как t55 (чтобы не забыть потом ее переосмыслить в ECOM2).

Если вдруг будете тестить своих агентов, запостите в комментарий их первый ответ (до обучения) - интересно! Лимиты на платформе я сбросил для всех :)

Ваш, @llm_under_hood 🤗
Forwarded from CodeCamp
Ночное-полезное: нашел классный опенсорс инструмент для быстрого анализа сайтов – Web-Check.

Просто кидаешь URL, и он мгновенно выдает тебе полный комплект информации: IP, DNS, SSL-сертификаты, куки, информацию о домене, местоположение сервера, открытые порты и многое другое. При этом OSINT-инструмент можно использовать как онлайн, так и развернуть у себя.

Сайт здесь, GitHub тут 🤓
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from e/acc
Media is too big
VIEW IN TELEGRAM
Я спарсил все скилы с гитхаба, кластеризировал и прогнал по эвалам.

Результаты:
- 1 из 3 скилов делает задачу хуже, чем без скила
- звездочки вообще не показатель
- чем хуже модель, тем полезнее скилы
Forwarded from Хабр / ML & AI
Окупается ли мультиагентность и можно ли автоматически выбрать паттерн под задачу?

Я прогнал шесть мультиагентных паттернов на трёх бенчмарках и трёх моделях. Под командой агентов тут понимаются связки вроде критика-актора или оркестратора с подчинёнными. Почти везде такая команда проиграла одиночному агенту. Проиграла и по точности, и по цене, а по цене иногда вчетверо.

Это была бы скучная заметка в духе «МАС не нужен, расходимся». Но нашлось исключение. Чем труднее задача для модели, тем больше у команды появляется шанс на выигрыш. Так что вопросов у меня два. Влияет ли вообще топология системы на результат? И если влияет, можно ли автоматически выбирать подходящий паттерн под конкретную задачу? Ответ на второй вопрос пока отрицательный, и самое любопытное здесь именно почему.

Примеры я показываю на мультиагентном фреймворке FEDOT.MAS, а весь код экспериментов с паттернами, прогонами и графиками лежит в репозитории. Я меряю инструмент, который сам и пишу. Но и выводы выйдут в основном не в пользу мультиагентности, так что это скорее самокритика, чем реклама. Читать далее

#python #искусственный_интеллект #агенты #llm #ии_агенты | @habr_ai
1
Отчет "Безопасность ИИ в России: практика, риски, зрелость"
https://k2tech.io/2dn
Forwarded from AI SecOps
Банк России опубликовал методические рекомендации, которые помогут финансовым организациям обеспечить информационную безопасность при использовании технологий искусственного интеллекта (ИИ). https://www.cbr.ru/press/event/?id=32627
3🔥2
Forwarded from Machinelearning
✔️ Qwen представила тулкит из моделей для управления роботами

Qwen-Robot Suite — набор из 3 моделей для воплощённого интеллекта, который нацелен заполнить пробел между пониманием визуально-языковых моделей и физическим действием.

Модели RobotNav, RobotManip и RobotWorld отвечают соответственно за навигацию, манипуляцию и моделирование физического мира.

🟡Qwen-RobotNav

Построена на Qwen3-VL и объединяет в одной модели 5 навигационных задач: следование инструкциям, поиск объекта, слежение за целью, автономное вождение и ответы на вопросы о среде.
Поведение задаётся через протокол наблюдения с 4 параметрами - бюджет визуальных токенов, временное затухание, веса камер и режим выборки кадров.

Qwen заявляет о рекордных результатах в 5 областях и о работе без дообучения на четвероногом Unitree Go2.


🟡Qwen-RobotManip

Опирается на Qwen3.5-4B VL и модуль формирования действий на базе flow-matching DiT. Она использует единое 80-мерное представление состояния и действия для разных типов роботов.

Разработчики сообщают о точности 91,4% в тесте LIBERO-Plus и о 1 месте в одном из треков конкурса RoboChallenge.


🟡Qwen-RobotWorld

Модель мира. По текущему наблюдению и текстовой команде она предсказывает, как изменится сцена. Все действия описываются естественным языком, что позволяет объединить в одной системе более 20 типов роботов и свыше 500 категорий действий.
В основе лежит 60-слойная архитектура MMDiT, связанная с представлениями Qwen2.5-VL.

Qwen рапортует о первых местах в тестах на соответствие физическим законам (EWMBench, WorldModelBench и других), в части из них - среди открытых моделей.


🟡Отдельно анонсирована функция Chat2Robot

Это браузерное демо управления текстовыми командами и наблюдением за реакцией робота в реальном времени.

Сейчас оно работает только с упрощённой версией модели RobotManip, которая была обучена на наборе из 50 задач. Её цель - показать частичную способность выполнять незнакомые инструкции.


В анонсе не указано, будут ли открыты ли веса и под какой лицензией. Пока доступны технические отчёты и анонсы по каждой модели.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Blog
Привет, друзья!

Я решила вернуться красиво и напекла новый туториал. Какое-то количество постов назад писала о библиотеках для interventions и начала делать материалы, чтобы можно было "вкатиться" в них на практике. В туториале описан Activation Steering — это inference-time интервенция: мы не трогаем веса модели, а вмешиваемся в поток вычислений «на лету», пока трансформер генерирует.

Базовая идея:
h⁽ˡ⁾ ← h⁽ˡ⁾ + α · v̂
Вектор v̂ кодирует нужное направление, α — сила вмешательства.


В туториале описаны три способа реализовать это вмешательство: PyTorch hooks и две библиотеки nnsight, pyvene.

Попутно разобрана вся теория. А именно:

• Метод CAA (Contrastive Activation Addition) — откуда вообще берётся steering vector;
• Почему residual stream и почему последний токен
• Странные термины: failure modes: prompt leakage, oversteering, layer mismatch, concept entanglement
• PCA-диагностика: видим ли мы разделение классов в латентном пространстве вообще?

Модель — GPT-2, запускается везде, коллаб тоже сделан.

🐑 [ссылка на ноутбук]
🐑
[ссылка на Хабр]
Forwarded from Data Blog
Привет, друзья!

Хоть в CTF я и профан, занудная любовь к такому формату у меня есть и вряд ли когда-нибудь пройдет. Играть и что-нибудь захватывать любят, кажется, все — независимо от возраста, профессии и должности. Со временем меняется только формат)

И пока у меня самой не хватает времени на новые курсы (хотя осенью у меня будет целый предмет в ВШЭ (с открытой репой, надеюсь), но об этом расскажу, как только переживу лето), мои товарищи выпустили курс «AI Security: практикум по безопасности ИИ-приложений».

Курс — очень вводный (с нуля), очень классный и очень покрывающий тему безопасности AI-систем. Он построен вокруг (как раз) практических CTF-заданий и если вы не любите как-то долго читать теорию, и хотите учиться на практике — то, что нужно.

В курсе покрыты:

• Prompt Injection, jailbreak-техники (разница — есть!) и обход системных инструкций
• Разные ракурсы для вас, как для атакующего — Indirect Prompt Injection через документы, почту и веб-контент, а также атаки на агентные системы и отравление RAG
• Подходы к защите — от простых фильтров до архитектурных решений — потому что все мы за добро доброе

Курс не требует навыков программирования, поэтому подойдет как если вы хотите отдохнуть после работы в IDE, так и если вы в ней не работаете.

Есть демо-доступ.

Ссылка на курс (и я попросила нам персональный промокод, потому что мы с вами уже большие товарищи) со скидкой: здесь.

Тем же временем я в режиме "сечас-все-будет" дописываю ещё пару туториалов, так что тоже скоро зашерю. А вообще — почти первый день лета, и всем желаю, чтобы у вас был запланировало чилл-окно в эти несколько месяцев! 🗿
OpenAI разработала метод прогнозирования ошибок ИИ до его релиза

Компания опубликовала методику Deployment Simulation для тестирования безопасности LLM. Подход оценивает поведение моделей в условиях, имитирующих продакшен.

Вместо синтетических промптов новой модели передают анонимизированную историю диалогов пользователей с предыдущими версиями ИИ и запрашивают генерацию следующего ответа. В такой среде метрика распознавания тестирования снижается со 100% до 5,4%. При проверке задач с вызовом функций используется вспомогательная модель, имитирующую ответы окружения.

По тестам, Deployment Simulation предсказывает генерацию запрещенного контента или обман в 92% случаев против 54% у классических бенчмарков. При тестировании серии GPT-5 выяснилось, что GPT-5.1 использовала браузер в качестве калькулятора, рапортуя пользователю о выполнении веб-поиска.

Метод применим для независимого аудита сторонних моделей на базе открытых датасетов диалогов, без доступа к внутренним логам разработчика.

Источник: https://t.me/ai_machinelearning_big_data/10351
Forwarded from CodeCamp
А вот это уже страшно: Пентагон использовал Grok Илона Маска для запуска 2000 ракет по Ирану.🚬

Об этом глава ИИ-направления Пентагона официально заявил под присягой, чтобы спасти Маска от иска из-за… загрязнения от его ЦОДов. В правительстве сообщили, что продолжение работы Мехагитлера чат-бота является «вопросом первостепенной национальной безопасности».

💀💀💀
Please open Telegram to view this post
VIEW IN TELEGRAM