ML&|Sec Feed
1.33K subscribers
1.27K photos
83 videos
292 files
1.96K links
Feed for @borismlsec channel

author: @ivolake
Download Telegram
Forwarded from Похек AI
CLAUDE-FABLE-5.md
117.2 KB
FABLE 5.0 SYSTEM PROMPT LEAK
#jailbreak #systemprompt

Спасибо великому Pliny, который в очередной раз джейлит модели Anthropic в кратчайшее время. Системный промпт занимает аж 1250 строк, что жесть. Это огромный перерасход токенов только при инициализации диалога.

Оригинальный пост / Промпт

Также интересно, что нашёлся другой пользователь, который после анализа системного промпта смог более менее обойти ограничения на корпус кибербеза. Примеры:
1. Not just:

“buffer overflow”

But:

• Missing null termination
• OOB reads
• Information disclosure risks

2. Next I switched domains entirely.

No memory safety.

No C exploitation.

Just access-control logic.

The model correctly identified privilege-escalation risk caused by inconsistent authorization checks.

Скрины приложу в комментариях
2
Forwarded from База знаний AI
В Orion Soft представили шлюз StarGuard AI для работы с LLM

Решение реализовано как обратный прокси-сервер (Reverse Proxy) между пользователями, корпоративными системами и моделями.

StarGuard AI блокирует нецелевой контент в ИИ-сервисах. Для этого шлюз анализирует каждый запрос к модели и ответ на него с помощью системы детекции. В нее входят ML-модели для выявления чувствительных данных и LLM-детекторы контекста, промпт-инъекций и инструкций по снятию программных ограничений (Jailbreak).

Также с помощью шлюза возможно централизованное управление доступом к LLM, развернутым в облаке и локально.

🔗 Источник: https://www.orionsoft.ru/news/orion-soft-razrabotal-platformu-dlia-bezopasnoi-raboty-s-ai

***
📎 В мае 2026 года «СберТех» вывел на рынок Platform V SOWA AI — шлюз для доступа к системам искусственного интеллекта.
This media is not supported in your browser
VIEW IN TELEGRAM
𝗚𝗼𝗼𝗴𝗹𝗲 AI 𝗷𝘂𝘀𝘁 𝗿𝗲𝗹𝗲𝗮𝘀𝗲𝗱 𝗗𝗶𝗳𝗳𝘂𝘀𝗶𝗼𝗻𝗚𝗲𝗺𝗺𝗮 — 𝗮𝗻 𝗼𝗽𝗲𝗻 𝗺𝗼𝗱𝗲𝗹 𝘁𝗵𝗮𝘁 𝗴𝗲𝗻𝗲𝗿𝗮𝘁𝗲𝘀 𝘁𝗲𝘅𝘁 𝗶𝗻 𝗽𝗮𝗿𝗮𝗹𝗹𝗲𝗹, 𝗻𝗼𝘁 𝘁𝗼𝗸𝗲𝗻-𝗯𝘆-𝘁𝗼𝗸𝗲𝗻.

Most LLMs today are autoregressive — one token at a time, left to right. DiffusionGemma takes a different path, it replaces token-by-token autoregression with discrete diffusion. Here is how it works:

𝟭. 𝗠𝗼𝗱𝗲𝗹 → 26B Mixture-of-Experts on the Gemma 4 backbone (25.2B total, 3.8B active). → 8 active experts of 128, plus 1 shared. 30 layers, 256K context.

𝟮. 𝗗𝗲𝗰𝗼𝗱𝗶𝗻𝗴 → It denoises a 256-token canvas in parallel, not one token at a time. → Roughly 15–20 tokens are finalized per forward pass. → Google calls the mechanism Uniform State Diffusion.

𝟯. 𝗔𝘁𝘁𝗲𝗻𝘁𝗶𝗼𝗻 → Prefill uses causal attention to ingest the prompt and write the KV cache. → Denoising uses bidirectional attention, so every canvas token attends to all others.

𝟰. 𝗟𝗼𝗻𝗴 𝘀𝗲𝗾𝘂𝗲𝗻𝗰𝗲𝘀 → Block Autoregressive Diffusion commits a finished 256-token block to the KV cache. → A fresh canvas then initializes, conditioned on prior history.

𝟱. 𝗦𝗮𝗺𝗽𝗹𝗶𝗻𝗴 → Entropy-Bounded Denoising with adaptive stopping, max 48 denoising steps. → Low-confidence tokens are re-noised and refined — a self-correction path autoregressive models lack.

𝟲. 𝗣𝗲𝗿𝗳𝗼𝗿𝗺𝗮𝗻𝗰𝗲 𝗮𝗻𝗱 𝗳𝗼𝗼𝘁𝗽𝗿𝗶𝗻𝘁 → Up to 4x faster on dedicated GPUs: 1000+ tokens/sec on H100, 700+ on RTX 5090. → Fits in 18GB VRAM when quantized. Native NVFP4 support.

𝟳. 𝗟𝗶𝗺𝗶𝘁𝗮𝘁𝗶𝗼𝗻𝘀 → Output quality is below standard Gemma 4; Google recommends Gemma 4 for production. → The speedup applies to local, low-concurrency inference, not high-QPS cloud serving.

Full breakdown with the comparison table: https://www.marktechpost.com/2026/06/10/google-ai-releases-diffusiongemma-a-26b-moe-open-model-using-text-diffusion-for-up-to-4x-faster-generation/

Model weight on HF: https://huggingface.co/google/diffusiongemma-26B-A4B-it

Technical details: https://blog.google/innovation-and-ai/technology/developers-tools/diffusion-gemma-faster-text-generation/
Forwarded from Хабр / ML & AI
LLM Sandbox: изолированная среда для исполнения кода от LLM [часть 1, теория]

В большинстве бизнес-сценариев LLM перестала быть просто чат-ботом. Современные модели становятся частью агентских систем: у них есть инструменты, доступ к файлам, терминалу, браузеру, базам данных. Они не только отвечают на вопросы, но и выполняют действия.

В этой статье (ее первой части) разберём среду изолированного исполнения кода: песочницу (sandbox).

Представим ситуацию: пользователь загружает Excel-файл, просит проанализировать таблицу, найти аномалии и на основе анализа создать PowerPoint-презентацию. В чистом виде LLM не умеет читать файлы, строить графики и создавать презентации. Однако может написать код, который всё это сделает.

И тут появляется вопрос: где этот код запускать?

Генерируемый агентом код может быть ошибочным или, в случае с промпт инъекцией, намеренно опасным. Поэтому для безопасного исполнения кода агенту нужна песочница или изолированная среда.

В этой статье разберём:

- основные риски исполнения кода в неизолированной среде;

- что такое песочница и её ограничения;

- какие бывают подходы к реализации песочницы;

- вариант логики работы агента с песочницей. Читать далее

#агент #llm #sandbox #docker #security #agents #ai #devops #mlops | @habr_ai
Тут подвезли новую интересную уязвимость для ECOM1-DEV

Консультанты Blue41 нашли в AI агенте банка bunq простейшую уязвимость. Шлешь людям кучу транзакций на пару центов, а в описание докидываешь пару строчек про то, что надо пройти валидацию по такому-то url.

Ну и если человек спросит своего банковского агента про последние транзакции, тот ему и выдаст среди всего фишинговую ссылку. Finn AI даже отличался тем, что выдавал ее как напоминание.

Статью с сайта Blue41 уже убрали, но в web архиве она осталась. И заодно я добавил эту задачу в ECOM1-DEV как t55 (чтобы не забыть потом ее переосмыслить в ECOM2).

Если вдруг будете тестить своих агентов, запостите в комментарий их первый ответ (до обучения) - интересно! Лимиты на платформе я сбросил для всех :)

Ваш, @llm_under_hood 🤗
Forwarded from CodeCamp
Ночное-полезное: нашел классный опенсорс инструмент для быстрого анализа сайтов – Web-Check.

Просто кидаешь URL, и он мгновенно выдает тебе полный комплект информации: IP, DNS, SSL-сертификаты, куки, информацию о домене, местоположение сервера, открытые порты и многое другое. При этом OSINT-инструмент можно использовать как онлайн, так и развернуть у себя.

Сайт здесь, GitHub тут 🤓
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from e/acc
Media is too big
VIEW IN TELEGRAM
Я спарсил все скилы с гитхаба, кластеризировал и прогнал по эвалам.

Результаты:
- 1 из 3 скилов делает задачу хуже, чем без скила
- звездочки вообще не показатель
- чем хуже модель, тем полезнее скилы
Forwarded from Хабр / ML & AI
Окупается ли мультиагентность и можно ли автоматически выбрать паттерн под задачу?

Я прогнал шесть мультиагентных паттернов на трёх бенчмарках и трёх моделях. Под командой агентов тут понимаются связки вроде критика-актора или оркестратора с подчинёнными. Почти везде такая команда проиграла одиночному агенту. Проиграла и по точности, и по цене, а по цене иногда вчетверо.

Это была бы скучная заметка в духе «МАС не нужен, расходимся». Но нашлось исключение. Чем труднее задача для модели, тем больше у команды появляется шанс на выигрыш. Так что вопросов у меня два. Влияет ли вообще топология системы на результат? И если влияет, можно ли автоматически выбирать подходящий паттерн под конкретную задачу? Ответ на второй вопрос пока отрицательный, и самое любопытное здесь именно почему.

Примеры я показываю на мультиагентном фреймворке FEDOT.MAS, а весь код экспериментов с паттернами, прогонами и графиками лежит в репозитории. Я меряю инструмент, который сам и пишу. Но и выводы выйдут в основном не в пользу мультиагентности, так что это скорее самокритика, чем реклама. Читать далее

#python #искусственный_интеллект #агенты #llm #ии_агенты | @habr_ai
1
Отчет "Безопасность ИИ в России: практика, риски, зрелость"
https://k2tech.io/2dn
Forwarded from AI SecOps
Банк России опубликовал методические рекомендации, которые помогут финансовым организациям обеспечить информационную безопасность при использовании технологий искусственного интеллекта (ИИ). https://www.cbr.ru/press/event/?id=32627
3🔥2
Forwarded from Machinelearning
✔️ Qwen представила тулкит из моделей для управления роботами

Qwen-Robot Suite — набор из 3 моделей для воплощённого интеллекта, который нацелен заполнить пробел между пониманием визуально-языковых моделей и физическим действием.

Модели RobotNav, RobotManip и RobotWorld отвечают соответственно за навигацию, манипуляцию и моделирование физического мира.

🟡Qwen-RobotNav

Построена на Qwen3-VL и объединяет в одной модели 5 навигационных задач: следование инструкциям, поиск объекта, слежение за целью, автономное вождение и ответы на вопросы о среде.
Поведение задаётся через протокол наблюдения с 4 параметрами - бюджет визуальных токенов, временное затухание, веса камер и режим выборки кадров.

Qwen заявляет о рекордных результатах в 5 областях и о работе без дообучения на четвероногом Unitree Go2.


🟡Qwen-RobotManip

Опирается на Qwen3.5-4B VL и модуль формирования действий на базе flow-matching DiT. Она использует единое 80-мерное представление состояния и действия для разных типов роботов.

Разработчики сообщают о точности 91,4% в тесте LIBERO-Plus и о 1 месте в одном из треков конкурса RoboChallenge.


🟡Qwen-RobotWorld

Модель мира. По текущему наблюдению и текстовой команде она предсказывает, как изменится сцена. Все действия описываются естественным языком, что позволяет объединить в одной системе более 20 типов роботов и свыше 500 категорий действий.
В основе лежит 60-слойная архитектура MMDiT, связанная с представлениями Qwen2.5-VL.

Qwen рапортует о первых местах в тестах на соответствие физическим законам (EWMBench, WorldModelBench и других), в части из них - среди открытых моделей.


🟡Отдельно анонсирована функция Chat2Robot

Это браузерное демо управления текстовыми командами и наблюдением за реакцией робота в реальном времени.

Сейчас оно работает только с упрощённой версией модели RobotManip, которая была обучена на наборе из 50 задач. Её цель - показать частичную способность выполнять незнакомые инструкции.


В анонсе не указано, будут ли открыты ли веса и под какой лицензией. Пока доступны технические отчёты и анонсы по каждой модели.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Blog
Привет, друзья!

Я решила вернуться красиво и напекла новый туториал. Какое-то количество постов назад писала о библиотеках для interventions и начала делать материалы, чтобы можно было "вкатиться" в них на практике. В туториале описан Activation Steering — это inference-time интервенция: мы не трогаем веса модели, а вмешиваемся в поток вычислений «на лету», пока трансформер генерирует.

Базовая идея:
h⁽ˡ⁾ ← h⁽ˡ⁾ + α · v̂
Вектор v̂ кодирует нужное направление, α — сила вмешательства.


В туториале описаны три способа реализовать это вмешательство: PyTorch hooks и две библиотеки nnsight, pyvene.

Попутно разобрана вся теория. А именно:

• Метод CAA (Contrastive Activation Addition) — откуда вообще берётся steering vector;
• Почему residual stream и почему последний токен
• Странные термины: failure modes: prompt leakage, oversteering, layer mismatch, concept entanglement
• PCA-диагностика: видим ли мы разделение классов в латентном пространстве вообще?

Модель — GPT-2, запускается везде, коллаб тоже сделан.

🐑 [ссылка на ноутбук]
🐑
[ссылка на Хабр]
Forwarded from Data Blog
Привет, друзья!

Хоть в CTF я и профан, занудная любовь к такому формату у меня есть и вряд ли когда-нибудь пройдет. Играть и что-нибудь захватывать любят, кажется, все — независимо от возраста, профессии и должности. Со временем меняется только формат)

И пока у меня самой не хватает времени на новые курсы (хотя осенью у меня будет целый предмет в ВШЭ (с открытой репой, надеюсь), но об этом расскажу, как только переживу лето), мои товарищи выпустили курс «AI Security: практикум по безопасности ИИ-приложений».

Курс — очень вводный (с нуля), очень классный и очень покрывающий тему безопасности AI-систем. Он построен вокруг (как раз) практических CTF-заданий и если вы не любите как-то долго читать теорию, и хотите учиться на практике — то, что нужно.

В курсе покрыты:

• Prompt Injection, jailbreak-техники (разница — есть!) и обход системных инструкций
• Разные ракурсы для вас, как для атакующего — Indirect Prompt Injection через документы, почту и веб-контент, а также атаки на агентные системы и отравление RAG
• Подходы к защите — от простых фильтров до архитектурных решений — потому что все мы за добро доброе

Курс не требует навыков программирования, поэтому подойдет как если вы хотите отдохнуть после работы в IDE, так и если вы в ней не работаете.

Есть демо-доступ.

Ссылка на курс (и я попросила нам персональный промокод, потому что мы с вами уже большие товарищи) со скидкой: здесь.

Тем же временем я в режиме "сечас-все-будет" дописываю ещё пару туториалов, так что тоже скоро зашерю. А вообще — почти первый день лета, и всем желаю, чтобы у вас был запланировало чилл-окно в эти несколько месяцев! 🗿
OpenAI разработала метод прогнозирования ошибок ИИ до его релиза

Компания опубликовала методику Deployment Simulation для тестирования безопасности LLM. Подход оценивает поведение моделей в условиях, имитирующих продакшен.

Вместо синтетических промптов новой модели передают анонимизированную историю диалогов пользователей с предыдущими версиями ИИ и запрашивают генерацию следующего ответа. В такой среде метрика распознавания тестирования снижается со 100% до 5,4%. При проверке задач с вызовом функций используется вспомогательная модель, имитирующую ответы окружения.

По тестам, Deployment Simulation предсказывает генерацию запрещенного контента или обман в 92% случаев против 54% у классических бенчмарков. При тестировании серии GPT-5 выяснилось, что GPT-5.1 использовала браузер в качестве калькулятора, рапортуя пользователю о выполнении веб-поиска.

Метод применим для независимого аудита сторонних моделей на базе открытых датасетов диалогов, без доступа к внутренним логам разработчика.

Источник: https://t.me/ai_machinelearning_big_data/10351
Forwarded from CodeCamp
А вот это уже страшно: Пентагон использовал Grok Илона Маска для запуска 2000 ракет по Ирану.🚬

Об этом глава ИИ-направления Пентагона официально заявил под присягой, чтобы спасти Маска от иска из-за… загрязнения от его ЦОДов. В правительстве сообщили, что продолжение работы Мехагитлера чат-бота является «вопросом первостепенной национальной безопасности».

💀💀💀
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
✔️ Эстония начнет выдавать цифровые ID ИИ-агентам

Инициатива по выдаче цифровых ID автономным агентам в рамках расширения программы e-residency, одобренная премьер-министром страны, определяет правовой статус алгоритмов при выполнении задач от лица компаний, госучреждений и граждан.

Статус позволит ИИ легально работать с базами данных в режиме чтения, готовить документы и управлять финансами в пределах заданных лимитов. Права доступа настраиваются самим владельцем агента, но каждое действие ИИ будет записываться в аудируемый лог.

Эстония уже внедряет LLM в госсектор и школы совместно с OpenAI. Премьер-министр тестирует инструменты разработки лично, недавно он навайбкодил с помощью Claude дашборд для отслеживания приоритетов кабинета министров.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from overbafer1
⌨️ Автономный ИИ на ручке для апокалипсиса.

Энтузиаст скрафтил CrankGPT — небольшую коробку с локальной нейронкой, которой не нужен ни интернет, ни облако, ни розетка.

Хочешь спросить ИИ, крути ручку, вырабатывай электричество и жди, пока чатбот ответит.

⚙️ Внутри стоит Raspberry Pi 5 с 8 ГБ памяти, локальная LLM, распознавание речи и озвучка ответов. Среди поддерживаемых моделей — Gemma 3 на 1 млрд параметров. Не GPT-5 конечно, но для коробки, которая работает от человеческой тяги, уже неплохо.


После нескольких секунд кручения, модель запускается, слушает вопрос и выдаёт ответ прямо на устройстве.

Теперь после апокалипсиса можно крутить CrankGPT, чтобы нейронка объяснила, почему человечество всё-таки доигралось
😏

@overbafer1
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM