ML&|Sec Feed
1.33K subscribers
1.28K photos
84 videos
293 files
1.97K links
Feed for @borismlsec channel

author: @ivolake
Download Telegram
OpenAI разработала метод прогнозирования ошибок ИИ до его релиза

Компания опубликовала методику Deployment Simulation для тестирования безопасности LLM. Подход оценивает поведение моделей в условиях, имитирующих продакшен.

Вместо синтетических промптов новой модели передают анонимизированную историю диалогов пользователей с предыдущими версиями ИИ и запрашивают генерацию следующего ответа. В такой среде метрика распознавания тестирования снижается со 100% до 5,4%. При проверке задач с вызовом функций используется вспомогательная модель, имитирующую ответы окружения.

По тестам, Deployment Simulation предсказывает генерацию запрещенного контента или обман в 92% случаев против 54% у классических бенчмарков. При тестировании серии GPT-5 выяснилось, что GPT-5.1 использовала браузер в качестве калькулятора, рапортуя пользователю о выполнении веб-поиска.

Метод применим для независимого аудита сторонних моделей на базе открытых датасетов диалогов, без доступа к внутренним логам разработчика.

Источник: https://t.me/ai_machinelearning_big_data/10351
Forwarded from CodeCamp
А вот это уже страшно: Пентагон использовал Grok Илона Маска для запуска 2000 ракет по Ирану.🚬

Об этом глава ИИ-направления Пентагона официально заявил под присягой, чтобы спасти Маска от иска из-за… загрязнения от его ЦОДов. В правительстве сообщили, что продолжение работы Мехагитлера чат-бота является «вопросом первостепенной национальной безопасности».

💀💀💀
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
✔️ Эстония начнет выдавать цифровые ID ИИ-агентам

Инициатива по выдаче цифровых ID автономным агентам в рамках расширения программы e-residency, одобренная премьер-министром страны, определяет правовой статус алгоритмов при выполнении задач от лица компаний, госучреждений и граждан.

Статус позволит ИИ легально работать с базами данных в режиме чтения, готовить документы и управлять финансами в пределах заданных лимитов. Права доступа настраиваются самим владельцем агента, но каждое действие ИИ будет записываться в аудируемый лог.

Эстония уже внедряет LLM в госсектор и школы совместно с OpenAI. Премьер-министр тестирует инструменты разработки лично, недавно он навайбкодил с помощью Claude дашборд для отслеживания приоритетов кабинета министров.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from overbafer1
⌨️ Автономный ИИ на ручке для апокалипсиса.

Энтузиаст скрафтил CrankGPT — небольшую коробку с локальной нейронкой, которой не нужен ни интернет, ни облако, ни розетка.

Хочешь спросить ИИ, крути ручку, вырабатывай электричество и жди, пока чатбот ответит.

⚙️ Внутри стоит Raspberry Pi 5 с 8 ГБ памяти, локальная LLM, распознавание речи и озвучка ответов. Среди поддерживаемых моделей — Gemma 3 на 1 млрд параметров. Не GPT-5 конечно, но для коробки, которая работает от человеческой тяги, уже неплохо.


После нескольких секунд кручения, модель запускается, слушает вопрос и выдаёт ответ прямо на устройстве.

Теперь после апокалипсиса можно крутить CrankGPT, чтобы нейронка объяснила, почему человечество всё-таки доигралось
😏

@overbafer1
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
📌 DeepMind опубликовала архитектуру безопасности AI Control Roadmap

Вслед за недавними размышлениями об эволюции AGI в ASI, исследовательское подразделение Google представила внутренний регламент контроля высокоразвитых ИИ-агентов.

Помимо привычного элайнмента модели, DeepMind добавляет отдельный слой системного контроля, пересобирая защиту исходя из худшего сценария.

За вводную берётся то, что система изначально враждебна, имеет скрытые цели и тайно работает против разработчиков.


Для систематизации таких угроз взяли за основу популярный фреймворк MITRE ATT&CK и создали на его базе TRAIT&R, новую таксономию тактик и методов обхода защиты.

Она учитывает специфику ИИ и описывает векторы атак, недоступные людям: от незаметного саботажа научных исследований и внедрения бэкдоров до распределенных цепочек взлома, когда фрагменты вредоносного плана синхронно выполняются сотнями разных инстансов одного агента.

Защита выстроена по принципу эскалации и делится на уровни D1–D4 для систем обнаружения и R1–R3 для механизмов реагирования.

На базовых этапах безопасность обеспечивается анализом CoT агента в песочницах под присмотром более слабых, но надежных ИИ-супервизоров.

По мере развития способностей модели начинают понимать факт слежки и учатся скрывать ход своих мыслей.

Для контроля над такими системами (это уровень D4/R3) традиционные методы больше не работают.

На этом этапе DeepMind планирует применят более затратные меры, вплоть до проверки внутренних состояний модели, использования изолированных копий самой недоверенной системы для аудита и инфраструктуры экстренной остановки агентов и запущенных ими процессов.

Вместе с новой стратегией опубликован отдельный документ для индустрии о том, как сделать агентов безопасными по мере их распространения, и он разбит на 3 уровня:

🟡Безопасность отдельного агента

Как защитить одну систему от утечек данных, чужих манипуляций и от собственных ошибочных действий, и зачем для этого нужны общие стандарты.


🟡Риски взаимодействия агентов

Каскадные сбои, негласный сговор алгоритмов, ситуации, где за вред никто конкретно не отвечает, и атаки, рассчитанные сразу на сеть агентов.


🟡Общая кибербезопасность

Как помочь защитникам сохранить преимущество перед злоумышленниками (автоматический поиск и устранение уязвимостей, обмен сигналами об угрозах, обучение специалистов).


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1🫡1
Forwarded from GitHub Community
Baserow — создавайте базы данных, автоматизированные системы, приложения и агентов с помощью искусственного интеллекта — без программирования.

Платформа с открытым исходным кодом, доступная в облаке и на собственном сервере. Соответствует требованиям GDPR, HIPAA и SOC 2. Лучшая альтернатива Airtable.

🐱 GitHub
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from GitHub Community
PythonRobotics — примеры кода на Python и учебник по алгоритмам робототехники.

🐱 GitHub
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Alaid TechThread
Разбор угроз при использовании кодинговых ИИ-агентов (Codex, Cursor, Claude Code) от NCC Group

https://www.nccgroup.com/media/jtepwx1t/nccgroup_codingagentswhitepaper.pdf
Forwarded from XOR
This media is not supported in your browser
VIEW IN TELEGRAM
Datalab выложили в опенсорс Lift — 9B-модель для мгновенного и точного извлечения данных из документов. 😨

Главное:
🟢 Извлекает структурированный JSON из PDF-файлов и изображений и показывает 90,2% точности Для сравнения: у Gemini 3.5 Flash — 91,3%;

🟢 Опережает опенсорс решения вроде NuExtract3;

🟢 Самое главное — медианное время обработки составляет всего 9.5 секунды.


Hugging Face тут, GitHub здесь 😘

@xor_journal
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2
Forwarded from Security samurAI
Безопасность AI-агентов начинается с Observability

Одним из направлений при построении защищенных систем является Observability (или наблюдаемость) — способность понимать, что происходит внутри этих систем на основе получаемых данных.

С распространением агентных систем появилась необходимость сохранять не только финальный ответ, но и все действия, которые к нему привели: вызовы модели, обращения к инструментам и передачу данных между компонентами. Именно эту задачу помогает решать OpenTelemetry (OTel).

OpenTelemetry появился в 2019 году как результат объединения OpenTracing и OpenCensus. Ключевая идея этого фреймворка — дать единый стандарт для инструментализации приложений в целях сбора телеметрии. В качестве транспорта используется стандартный протокол OTLP (OpenTelemetry Protocol).

Думаю, многие уже видели, как в IDE отображается Tool Calling: модель выбрала инструмент, передала параметры, получила результат и продолжила выполнение. По сути, это визуальное представление trace — цепочки шагов. (так выглядит в Copilot)

Техническая реализация опирается на наличие единого идентификатора traceId для всех операций в рамках одной последовательности действий. Отдельным звеном цепочки является span. Трейс начинается с корневого span, а последующие шаги ссылаются на родительский с помощью parentSpanId. За счет такого подхода удается собрать все связанные события и использовать их для дальнейшего анализа.

В контексте безопасности трейсы могут использоваться:

▸ В production-агентах — для расследования и предотвращения инцидентов

▸ В бенчмарках — для сбора информации об используемых инструментах, а также о затратах времени и токенов

▸ Для тестирования и отладки работы Guardrails, которые в трейсах будут выглядеть как отдельный шаг

Чтобы использовать трассировки на практике, необходимо поднять OpenTelemetry Collector и настроить отправку телеметрии на этот коллектор (либо сразу в конечную систему). Многие SDK и фреймворки для агентских систем уже поддерживают встроенную трассировку:

▸ OpenAI Agents SDK (тык1, тык2)

▸ LangChain / LangSmith (тык3, тык4)

При этом трассировка сама по себе решает только первую часть задачи — она позволяет увидеть, что произошло. Следующий шаг — использовать полученные данные для решения конкретных проблем.

В качестве направлений для дальнейшего развития Observability мне понравились два исследования:

▸ От Apple: Governance-Aware Agent Telemetry — использование телеметрии, чтобы в рантайме реагировать на события безопасности

AgentSight — исследователи с помощью технологии eBPF получают дополнительные данные из системы и связывают их с трейсами OTel


У самурая нет цели, у самурая есть только trace...
Forwarded from GitHub Community
Agent Skills — безопасный и проверенный реестр навыков для профессиональных разработчиков ИИ-агентов.

Расширяйте Antigravity, Claude Code, Cursor, Copilot и другие инструменты с полной уверенностью.

🐱 GitHub
Please open Telegram to view this post
VIEW IN TELEGRAM