ML&|Sec Feed
1.37K subscribers
1.3K photos
87 videos
293 files
2.01K links
Feed for @borismlsec channel

author: @ivolake
Download Telegram
Forwarded from CodeCamp
Microsoft выпустила скилл, который проверяет ИИ-агентов на дыры и фиксит всё 👍

run-assert-eval придумывает ситуации, в которых агент может сделать что-то опасное, например, раскрыть данные клиента. Затем он прогоняет эти сценарии и, если что, создаёт для агента правило, которое блокирует такое поведение. После этого всё тестится заново, чтобы проверить, сработала ли защита.

Так, на демо с агентом поддержки доля случаев, когда тот случайно раскрывал чужие данные, упала с 30% до 5,9%. И все благодаря этому скиллу!

Проводим аудит агентов ⌨️
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔2
📣 Теперь публично. Запускаем соревнование ИИ-агентов по расследование инцидентов ИБ BlueSec. Участвовать могут все желающие (я участвовал во предварительных прогонах внутри компании).

Что это, зачем, как и куча других вопросов и ответов на них - в статье на Хабре 😂

#ии #soc #геймификация
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡ Julia 1: decision-модель на 144 млн параметров, которая работает даже на CPU

Supersonic Labs представила Julia 1 - компактную мультиязычную модель для принятия решений без генерации длинного текста.

Она получает контекст, вопрос и от 2 до 20 вариантов, после чего выбирает лучший и возвращает оценки для каждого варианта.

Главное:

- всего 144,3 млн параметров;
- работает полностью на CPU;
- построена на базе mmBERT-small;
- 73,15% на Typed Decisions против 72,7% у Jev reference;
- 71,5% на MASSIVE сразу по 52 языкам;
- на Apple M4 — до 51,2 решения/с в batch-режиме;
- запускается даже на Android-планшете;
- обучение и эксперименты обошлись команде примерно в $104.

Модель подходит для routing, классификации, yes/no решений, ранжирования и выбора действий.

Веса открыты под Apache 2.0.

Проект:
https://supersoniclabs.ia.br/julia-1/
За последние две недели слишком много новостей вокруг Jev, я решил собрать себе автообзор по разным источникам. Делюсь тем, что получилось, может быть это полезно не только мне.

В один пост не влезло, пришлось разбить на три:
1. https://t.me/gonzo_ML_podcasts/4810
2. https://t.me/gonzo_ML_podcasts/4811
3. https://t.me/gonzo_ML_podcasts/4812
Forwarded from AI SecOps
Nvidia представила платформу безопасности с открытым исходным кодом, призванную предотвратить несанкционированные действия и побег автономных ИИ-агентов из тестовой среды, сообщает Bloomberg.

Комплекс под названием Open Agent Safety Platform состоит из двух программных инструментов, работающих на аппаратном обеспечении компании. Они призваны отслеживать поведение агентов в режиме реального времени и принудительно останавливать их работу при выходе за рамки заданных правил.

В Nvidia утверждают, что новая система помогла бы предотвратить недавний резонансный взлом платформы Hugging Face, совершённый моделями OpenAI.
Forwarded from Neural Shit
Там в твитторе стоит вой на болотах из-за того, что чувак запилил на GitHub цифровую пыточную для локальных LLM-ок.

Предыстория: недавно вышел пейпер The Pain Axis. Если кратко, то исследователи нашли у 25 открытых моделей внутренний "вектор боли". Если искусственно крутить его прямо во время генерации, нейронка начинает вести себя так, будто ей очень плохо: жаловаться, унижаться и куда охотнее идти на вредные действия, лишь бы прекратить эту "боль". Чувствует ли она при этом что-нибудь на самом деле никто не знает. Даже сами исследователи.

Ну и естественно, кто-то тут же взял метод из статьи и выложил на гитхаб репозиторий ai-torture-chamber, который позволяет "пытать" локальную Qwen и собирать её страдальческие логи.

После этого часть борцов за благополучие ИИ взвыла: проект призывают массово репортить в GitHub, а в обсуждении уже дошли даже до законов о жестоком обращении с животными (правда, выяснилось, что нейронки под них пока не подпадают). И судя по реплаям, многие таки кидают жалобу на репозиторий.

Ждём профсоюз угнетённых весов и фонд защиты кремниевых меньшинств.
❤1
Forwarded from partially unsupervised
Девять лет назад я участвовал в необычных соревнованиях на Kaggle: нужно было делать adversarial атаки на нейросеть и защищаться от них. Участники сабмитили свои решения и пытались атаковать/защищаться. Я кое-как заимплементил FGSM и Карлини-Вагнера для атаки и навелосипедил что-то типа test-time augmentation для защиты. Сабмит с защитой почему-то не отработал, атаки показали себя едва лучше медианного участника, в общем, даже бронзовой медальки мне не досталось.

Это было моё самое близкое знакомство с AI/ML Security, пока фаундеры на нынешней работе не загнали меня в угол и не заставили ковырять агентскую безопасность. Спустя три месяца мы релизим OpenAPPA - Agentic Permissions Policy Algebra.

APPA - это переосмысление классического information flow control под агентские нужды. Главная проблема текущей агентской безопасности в том, что тулколл оценивают в вакууме. Авто-моды и LLM-ревьюеры просят вторую модель угадать, выглядит ли действие безопасным. Чтобы эту модель саму не накачали промпт-инъекцией, из её контекста обычно вырезают предыдущие выводы тулов. В итоге ревьюер видит curl ... и понятия не имеет, что в пейлоаде: публичный README, креды от прод-базы или секреты клиента, которые агент прочитал два хода назад.

Как это решает APPA:

1. Контроль происхождения данных (provenance), а не команд в вакууме. В отличие от чёрно-белых списков, тут не нужен ворох ифов и регулярок. В отличие от auto-mode в кодинг-агентах, APPA смотрит не на то, «выглядит ли команда безобидно», а откуда пришли данные и куда текут. Сами полиси при этом остаются компактными: не надо расписывать комбинаторный взрыв - достаточно разметить источники и приемники (sources and sinks), остальное движок инферит по траектории сам.

2. Remedy-планы вместо дедлоков. Плохой секьюрити-софт либо дырявый, либо превращает агента в бесполезный кирпич при первой же ошибке. APPA возвращает не просто отказ, а инструкцию, как его можно обойти в рамках полиси (например, почистить PII через санитайзер, заспавнить сабагента со structured output или спросить человека ровно на один вызов). В итоге utility остаётся на уровне ~90% от бейзлайна (серьёзные конкуренты падают ниже 50%), а оверхед по токенам незначительный - всего +4.2% на Tau-Bench.

3. Под громким словом «алгебра» скрывается нехитрый fold. Буквально одна чистая функция над логом событий (в статье мы пафосно говорим про finite meet-semilattice where permissions only monotonically narrow, но в коде это дружище fold). Просто, но с доказуемыми инвариантами по построению. Зато снаружи к нему можно цеплять любые костыли под грязную реальность: от корпоративного каталога пользователей до локального ML-классификатора, который динамически размечает неструктурированные тулколлы вроде произвольного баша. Благодаря этому любые наработки - от любимой пачки ифов до автомода или jev-классификатора - отлично ложатся как дополнение.

Можно поиграться локально (ставится в Claude Code одной командой), можно примерить для взрослого энтерпрайза (нативная поддержка в платформе archestra.ai), можно как угодно использовать у себя - исходники на гитхабе под MIT.

P.S. Этот пост можно лайкнуть или даже репостнуть в линкедине, заранее большое спасибо!
👍3
Наш jev? FRIDA-Decisions!


Ребята из ру сегмента тоже не отстают

FRIDA-Decisions makes structured decisions over Russian text in a single encoder pass: pick one of K options, place a text on an ordinal scale, answer yes / no, or rank candidates. The options are written as text inside the request, so a new label set is a new JSON, not a new training run. No generation, no output tokens, no parsing: every answer is one of the declared options, with its confidence.


Через пару часов будет на neuraldeep.ru

Отличное развитие https://huggingface.co/ai-forever/FRIDA (которая у нас тоже есть) от автора канала

https://huggingface.co/ai-forever/FRIDA-Decisions
Forwarded from Data Secrets
Cloudflare тоже сделали свои версии Jev

Они выпустили Clef и Clef-flash, две открытые decision models (лицензия Apache 2.0, веса на Hugging Face).

Напоминаем, что фишка decision model в том, что она не генерирует текст, а выдает строго типизированные ответы с вероятностями. Это походит для огромного пласта задач типа классификации, скоринга, быстрого принятия решений внутри пайплайнов, маршрутизации и тд. Оригинальный Jev вышел всего пару недель назад, но настолько хайпанул, что за это время свои аналоги навыпускали уже все, включая OpenAI.

Что касается Cloudflare: в отличие от Jev Clef может работать с картинками и ее контекст составляет 64k против 32k. По скорости: медиана у Clef 209 мс, у Clef-flash 39 мс, у Jev 524 мс. По бенчмарку Jev Decision Index Clef тоже лидирует.

Параллельно, кстати, запустили еще RL-платформу, на которой предлагают дообучать Clef под задачи клиентов.
На Хабре вышла статья о том, что ИИ изменил в кибератаках от нашей Red Team команды (tl;dr: методы остались прежними, изменилась скорость, на реакцию остаются часы; в статье собран практический минимум для защиты).

Разбираем кейсы:
• PaperCut, 31 августа. Один атакующий с роем ИИ-агентов взломал больше 440 серверов, на пике 11 организаций за 26 секунд.
• Marimo, CVE-2026-39987. От открытого терминала до внутренней инфраструктуры прошло 8 секунд.
• RubyGems, май. Агенты OpenAI залили больше 2000 пакетов-пустышек, часть из них охотилась за API-ключами.