OpenAI разработала метод прогнозирования ошибок ИИ до его релиза
Компания опубликовала методику Deployment Simulation для тестирования безопасности LLM. Подход оценивает поведение моделей в условиях, имитирующих продакшен.
Вместо синтетических промптов новой модели передают анонимизированную историю диалогов пользователей с предыдущими версиями ИИ и запрашивают генерацию следующего ответа. В такой среде метрика распознавания тестирования снижается со 100% до 5,4%. При проверке задач с вызовом функций используется вспомогательная модель, имитирующую ответы окружения.
По тестам, Deployment Simulation предсказывает генерацию запрещенного контента или обман в 92% случаев против 54% у классических бенчмарков. При тестировании серии GPT-5 выяснилось, что GPT-5.1 использовала браузер в качестве калькулятора, рапортуя пользователю о выполнении веб-поиска.
Метод применим для независимого аудита сторонних моделей на базе открытых датасетов диалогов, без доступа к внутренним логам разработчика.
Источник: https://t.me/ai_machinelearning_big_data/10351
Компания опубликовала методику Deployment Simulation для тестирования безопасности LLM. Подход оценивает поведение моделей в условиях, имитирующих продакшен.
Вместо синтетических промптов новой модели передают анонимизированную историю диалогов пользователей с предыдущими версиями ИИ и запрашивают генерацию следующего ответа. В такой среде метрика распознавания тестирования снижается со 100% до 5,4%. При проверке задач с вызовом функций используется вспомогательная модель, имитирующую ответы окружения.
По тестам, Deployment Simulation предсказывает генерацию запрещенного контента или обман в 92% случаев против 54% у классических бенчмарков. При тестировании серии GPT-5 выяснилось, что GPT-5.1 использовала браузер в качестве калькулятора, рапортуя пользователю о выполнении веб-поиска.
Метод применим для независимого аудита сторонних моделей на базе открытых датасетов диалогов, без доступа к внутренним логам разработчика.
Источник: https://t.me/ai_machinelearning_big_data/10351
Telegram
Machinelearning
✔️ OpenAI разработала метод прогнозирования ошибок ИИ до его релиза
Компания опубликовала методику Deployment Simulation для тестирования безопасности LLM. Подход оценивает поведение моделей в условиях, имитирующих продакшен.
Вместо синтетических промптов…
Компания опубликовала методику Deployment Simulation для тестирования безопасности LLM. Подход оценивает поведение моделей в условиях, имитирующих продакшен.
Вместо синтетических промптов…
Forwarded from CodeCamp
А вот это уже страшно: Пентагон использовал Grok Илона Маска для запуска 2000 ракет по Ирану.🚬
Об этом глава ИИ-направления Пентагона официально заявил под присягой, чтобы спасти Маска от иска из-за… загрязнения от его ЦОДов. В правительстве сообщили, что продолжение работыМехагитлера чат-бота является «вопросом первостепенной национальной безопасности».
💀 💀 💀
Об этом глава ИИ-направления Пентагона официально заявил под присягой, чтобы спасти Маска от иска из-за… загрязнения от его ЦОДов. В правительстве сообщили, что продолжение работы
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
Инициатива по выдаче цифровых ID автономным агентам в рамках расширения программы e-residency, одобренная премьер-министром страны, определяет правовой статус алгоритмов при выполнении задач от лица компаний, госучреждений и граждан.
Статус позволит ИИ легально работать с базами данных в режиме чтения, готовить документы и управлять финансами в пределах заданных лимитов. Права доступа настраиваются самим владельцем агента, но каждое действие ИИ будет записываться в аудируемый лог.
Эстония уже внедряет LLM в госсектор и школы совместно с OpenAI. Премьер-министр тестирует инструменты разработки лично, недавно он навайбкодил с помощью Claude дашборд для отслеживания приоритетов кабинета министров.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from overbafer1
Энтузиаст скрафтил CrankGPT — небольшую коробку с локальной нейронкой, которой не нужен ни интернет, ни облако, ни розетка.
Хочешь спросить ИИ, крути ручку, вырабатывай электричество и жди, пока чатбот ответит.
⚙️ Внутри стоит Raspberry Pi 5 с 8 ГБ памяти, локальная LLM, распознавание речи и озвучка ответов. Среди поддерживаемых моделей — Gemma 3 на 1 млрд параметров. Не GPT-5 конечно, но для коробки, которая работает от человеческой тяги, уже неплохо.
После нескольких секунд кручения, модель запускается, слушает вопрос и выдаёт ответ прямо на устройстве.
Теперь после апокалипсиса можно крутить CrankGPT, чтобы нейронка объяснила, почему человечество всё-таки доигралось
@overbafer1
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
Вслед за недавними размышлениями об эволюции AGI в ASI, исследовательское подразделение Google представила внутренний регламент контроля высокоразвитых ИИ-агентов.
Помимо привычного элайнмента модели, DeepMind добавляет отдельный слой системного контроля, пересобирая защиту исходя из худшего сценария.
За вводную берётся то, что система изначально враждебна, имеет скрытые цели и тайно работает против разработчиков.
Для систематизации таких угроз взяли за основу популярный фреймворк MITRE ATT&CK и создали на его базе TRAIT&R, новую таксономию тактик и методов обхода защиты.
Она учитывает специфику ИИ и описывает векторы атак, недоступные людям: от незаметного саботажа научных исследований и внедрения бэкдоров до распределенных цепочек взлома, когда фрагменты вредоносного плана синхронно выполняются сотнями разных инстансов одного агента.
Защита выстроена по принципу эскалации и делится на уровни D1–D4 для систем обнаружения и R1–R3 для механизмов реагирования.
На базовых этапах безопасность обеспечивается анализом CoT агента в песочницах под присмотром более слабых, но надежных ИИ-супервизоров.
По мере развития способностей модели начинают понимать факт слежки и учатся скрывать ход своих мыслей.
Для контроля над такими системами (это уровень D4/R3) традиционные методы больше не работают.
На этом этапе DeepMind планирует применят более затратные меры, вплоть до проверки внутренних состояний модели, использования изолированных копий самой недоверенной системы для аудита и инфраструктуры экстренной остановки агентов и запущенных ими процессов.
Вместе с новой стратегией опубликован отдельный документ для индустрии о том, как сделать агентов безопасными по мере их распространения, и он разбит на 3 уровня:
Как защитить одну систему от утечек данных, чужих манипуляций и от собственных ошибочных действий, и зачем для этого нужны общие стандарты.
Каскадные сбои, негласный сговор алгоритмов, ситуации, где за вред никто конкретно не отвечает, и атаки, рассчитанные сразу на сеть агентов.
Как помочь защитникам сохранить преимущество перед злоумышленниками (автоматический поиск и устранение уязвимостей, обмен сигналами об угрозах, обучение специалистов).
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1🫡1
Forwarded from GitHub Community
Baserow — создавайте базы данных, автоматизированные системы, приложения и агентов с помощью искусственного интеллекта — без программирования.
Платформа с открытым исходным кодом, доступная в облаке и на собственном сервере. Соответствует требованиям GDPR, HIPAA и SOC 2. Лучшая альтернатива Airtable.
🐱 GitHub
Платформа с открытым исходным кодом, доступная в облаке и на собственном сервере. Соответствует требованиям GDPR, HIPAA и SOC 2. Лучшая альтернатива Airtable.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Alaid TechThread
Разбор угроз при использовании кодинговых ИИ-агентов (Codex, Cursor, Claude Code) от NCC Group
https://www.nccgroup.com/media/jtepwx1t/nccgroup_codingagentswhitepaper.pdf
https://www.nccgroup.com/media/jtepwx1t/nccgroup_codingagentswhitepaper.pdf
Forwarded from XOR
This media is not supported in your browser
VIEW IN TELEGRAM
Datalab выложили в опенсорс Lift — 9B-модель для мгновенного и точного извлечения данных из документов. 😨
Главное:
Hugging Face тут, GitHub здесь😘
@xor_journal
Главное:
🟢 Извлекает структурированный JSON из PDF-файлов и изображений и показывает 90,2% точности Для сравнения: у Gemini 3.5 Flash — 91,3%;🟢 Опережает опенсорс решения вроде NuExtract3;🟢 Самое главное — медианное время обработки составляет всего 9.5 секунды.
Hugging Face тут, GitHub здесь
@xor_journal
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2
Forwarded from Security samurAI
Безопасность AI-агентов начинается с Observability
Одним из направлений при построении защищенных систем является Observability (или наблюдаемость) — способность понимать, что происходит внутри этих систем на основе получаемых данных.
С распространением агентных систем появилась необходимость сохранять не только финальный ответ, но и все действия, которые к нему привели: вызовы модели, обращения к инструментам и передачу данных между компонентами. Именно эту задачу помогает решать OpenTelemetry (OTel).
OpenTelemetry появился в 2019 году как результат объединения OpenTracing и OpenCensus. Ключевая идея этого фреймворка — дать единый стандарт для инструментализации приложений в целях сбора телеметрии. В качестве транспорта используется стандартный протокол OTLP (OpenTelemetry Protocol).
Думаю, многие уже видели, как в IDE отображается Tool Calling: модель выбрала инструмент, передала параметры, получила результат и продолжила выполнение. По сути, это визуальное представление
Техническая реализация опирается на наличие единого идентификатора
В контексте безопасности трейсы могут использоваться:
▸ В production-агентах — для расследования и предотвращения инцидентов
▸ В бенчмарках — для сбора информации об используемых инструментах, а также о затратах времени и токенов
▸ Для тестирования и отладки работы Guardrails, которые в трейсах будут выглядеть как отдельный шаг
Чтобы использовать трассировки на практике, необходимо поднять OpenTelemetry Collector и настроить отправку телеметрии на этот коллектор (либо сразу в конечную систему). Многие SDK и фреймворки для агентских систем уже поддерживают встроенную трассировку:
▸ OpenAI Agents SDK (тык1, тык2)
▸ LangChain / LangSmith (тык3, тык4)
При этом трассировка сама по себе решает только первую часть задачи — она позволяет увидеть, что произошло. Следующий шаг — использовать полученные данные для решения конкретных проблем.
В качестве направлений для дальнейшего развития Observability мне понравились два исследования:
▸ От Apple: Governance-Aware Agent Telemetry — использование телеметрии, чтобы в рантайме реагировать на события безопасности
▸ AgentSight — исследователи с помощью технологии eBPF получают дополнительные данные из системы и связывают их с трейсами OTel
У самурая нет цели, у самурая есть только trace...
Одним из направлений при построении защищенных систем является Observability (или наблюдаемость) — способность понимать, что происходит внутри этих систем на основе получаемых данных.
С распространением агентных систем появилась необходимость сохранять не только финальный ответ, но и все действия, которые к нему привели: вызовы модели, обращения к инструментам и передачу данных между компонентами. Именно эту задачу помогает решать OpenTelemetry (OTel).
OpenTelemetry появился в 2019 году как результат объединения OpenTracing и OpenCensus. Ключевая идея этого фреймворка — дать единый стандарт для инструментализации приложений в целях сбора телеметрии. В качестве транспорта используется стандартный протокол OTLP (OpenTelemetry Protocol).
Думаю, многие уже видели, как в IDE отображается Tool Calling: модель выбрала инструмент, передала параметры, получила результат и продолжила выполнение. По сути, это визуальное представление
trace — цепочки шагов. (так выглядит в Copilot)Техническая реализация опирается на наличие единого идентификатора
traceId для всех операций в рамках одной последовательности действий. Отдельным звеном цепочки является span. Трейс начинается с корневого span, а последующие шаги ссылаются на родительский с помощью parentSpanId. За счет такого подхода удается собрать все связанные события и использовать их для дальнейшего анализа.В контексте безопасности трейсы могут использоваться:
▸ В production-агентах — для расследования и предотвращения инцидентов
▸ В бенчмарках — для сбора информации об используемых инструментах, а также о затратах времени и токенов
▸ Для тестирования и отладки работы Guardrails, которые в трейсах будут выглядеть как отдельный шаг
Чтобы использовать трассировки на практике, необходимо поднять OpenTelemetry Collector и настроить отправку телеметрии на этот коллектор (либо сразу в конечную систему). Многие SDK и фреймворки для агентских систем уже поддерживают встроенную трассировку:
▸ OpenAI Agents SDK (тык1, тык2)
▸ LangChain / LangSmith (тык3, тык4)
При этом трассировка сама по себе решает только первую часть задачи — она позволяет увидеть, что произошло. Следующий шаг — использовать полученные данные для решения конкретных проблем.
В качестве направлений для дальнейшего развития Observability мне понравились два исследования:
▸ От Apple: Governance-Aware Agent Telemetry — использование телеметрии, чтобы в рантайме реагировать на события безопасности
▸ AgentSight — исследователи с помощью технологии eBPF получают дополнительные данные из системы и связывают их с трейсами OTel
У самурая нет цели, у самурая есть только trace...
Forwarded from GitHub Community
Agent Skills — безопасный и проверенный реестр навыков для профессиональных разработчиков ИИ-агентов.
Расширяйте Antigravity, Claude Code, Cursor, Copilot и другие инструменты с полной уверенностью.
🐱 GitHub
Расширяйте Antigravity, Claude Code, Cursor, Copilot и другие инструменты с полной уверенностью.
Please open Telegram to view this post
VIEW IN TELEGRAM