Forwarded from GPT/ChatGPT/AI Central Александра Горного
Белый дом требует от Anthropic невозможного
Wired узнал, что администрация Трампа готова разрешить Anthropic вернуть Fable 5, только если компания закроет возможность джейлбрейка модели. Речь о способах обойти защиту и получить доступ к запрещённым возможностям в кибербезопасности, химии и биологии.
Anthropic считает риск преувеличенным и говорит, что эффект от обходов минимальный. Но в АНБ считают, что защиту Fable 5 можно отключить, поэтому компания обязана постоянно искать уязвимости и сообщать о них государству.
Проблема в том, что абсолютной защиты от джейлбрейка почти не бывает. Пользователи и другие мощные модели всё равно будут находить способы взлома.
Для Anthropic это тупик. Белый дом хочет гарантию, которую индустрия пока не умеет давать технически.
https://www.wired.com/story/the-white-house-wants-anthropic-to-block-all-jailbreaks-that-may-not-be-possible/
Wired узнал, что администрация Трампа готова разрешить Anthropic вернуть Fable 5, только если компания закроет возможность джейлбрейка модели. Речь о способах обойти защиту и получить доступ к запрещённым возможностям в кибербезопасности, химии и биологии.
Anthropic считает риск преувеличенным и говорит, что эффект от обходов минимальный. Но в АНБ считают, что защиту Fable 5 можно отключить, поэтому компания обязана постоянно искать уязвимости и сообщать о них государству.
Проблема в том, что абсолютной защиты от джейлбрейка почти не бывает. Пользователи и другие мощные модели всё равно будут находить способы взлома.
Для Anthropic это тупик. Белый дом хочет гарантию, которую индустрия пока не умеет давать технически.
https://www.wired.com/story/the-white-house-wants-anthropic-to-block-all-jailbreaks-that-may-not-be-possible/
Forwarded from Machinelearning
Вслед за недавними размышлениями об эволюции AGI в ASI, исследовательское подразделение Google представила внутренний регламент контроля высокоразвитых ИИ-агентов.
Помимо привычного элайнмента модели, DeepMind добавляет отдельный слой системного контроля, пересобирая защиту исходя из худшего сценария.
За вводную берётся то, что система изначально враждебна, имеет скрытые цели и тайно работает против разработчиков.
Для систематизации таких угроз взяли за основу популярный фреймворк MITRE ATT&CK и создали на его базе TRAIT&R, новую таксономию тактик и методов обхода защиты.
Она учитывает специфику ИИ и описывает векторы атак, недоступные людям: от незаметного саботажа научных исследований и внедрения бэкдоров до распределенных цепочек взлома, когда фрагменты вредоносного плана синхронно выполняются сотнями разных инстансов одного агента.
Защита выстроена по принципу эскалации и делится на уровни D1–D4 для систем обнаружения и R1–R3 для механизмов реагирования.
На базовых этапах безопасность обеспечивается анализом CoT агента в песочницах под присмотром более слабых, но надежных ИИ-супервизоров.
По мере развития способностей модели начинают понимать факт слежки и учатся скрывать ход своих мыслей.
Для контроля над такими системами (это уровень D4/R3) традиционные методы больше не работают.
На этом этапе DeepMind планирует применят более затратные меры, вплоть до проверки внутренних состояний модели, использования изолированных копий самой недоверенной системы для аудита и инфраструктуры экстренной остановки агентов и запущенных ими процессов.
Вместе с новой стратегией опубликован отдельный документ для индустрии о том, как сделать агентов безопасными по мере их распространения, и он разбит на 3 уровня:
Как защитить одну систему от утечек данных, чужих манипуляций и от собственных ошибочных действий, и зачем для этого нужны общие стандарты.
Каскадные сбои, негласный сговор алгоритмов, ситуации, где за вред никто конкретно не отвечает, и атаки, рассчитанные сразу на сеть агентов.
Как помочь защитникам сохранить преимущество перед злоумышленниками (автоматический поиск и устранение уязвимостей, обмен сигналами об угрозах, обучение специалистов).
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Материалы 4-го дня интенсива по вайбкодингу от Google на Kaggle посвящены вопросам безопасности и оценки.
По мнению Google в основе безопасности агентов лежит 7 компонентов:
1.Инфраструктура.
2.Данные.
3.Модель.
4.Приложение и то где оно запущено (runtime).
5.Управление идентификаторами (IAM).
6.Наблюдаемость и операционная безопасность.
7.Корпоративное управление (governance).
Общий вывод по этому модулю коллеги делают вот такой:
1.переход от обычного вайбкодинга к дисциплинированному инжинирингу агентов требует отказа от неявного доверия.
2.ИИ модель это только двигатель, который становится готовым к применению в компании когда его оборачивают в надежное окружение.
3. Реализуя 7 основную архитектуру организации могут безопасно управлять допустимым ущербом (blast radius) автономных агентов.
4. Оценку безопасности следует сочетать с тщательным фреймворком оценки с измерением реальной пользы от агентов.
5. Проблема с генерацией в основном решена. Текущие открытые проблемы это верификация, безопасность, архитектурная оценка.
По мнению Google в основе безопасности агентов лежит 7 компонентов:
1.Инфраструктура.
2.Данные.
3.Модель.
4.Приложение и то где оно запущено (runtime).
5.Управление идентификаторами (IAM).
6.Наблюдаемость и операционная безопасность.
7.Корпоративное управление (governance).
Общий вывод по этому модулю коллеги делают вот такой:
1.переход от обычного вайбкодинга к дисциплинированному инжинирингу агентов требует отказа от неявного доверия.
2.ИИ модель это только двигатель, который становится готовым к применению в компании когда его оборачивают в надежное окружение.
3. Реализуя 7 основную архитектуру организации могут безопасно управлять допустимым ущербом (blast radius) автономных агентов.
4. Оценку безопасности следует сочетать с тщательным фреймворком оценки с измерением реальной пользы от агентов.
5. Проблема с генерацией в основном решена. Текущие открытые проблемы это верификация, безопасность, архитектурная оценка.
Kaggle
5-Day AI Agents: Intensive Vibe Coding Course With Google
June 15 - 19, 2026
Статья от The Economist обсуждает очевидные вещи по ограничению доступа к ИИ:
1. Устанавливает параллель - ограничения правительства по ИИ напоминают ограничения по криптографии. Там же указывается, что ИИ гораздо более универсально опасная технология.
2. Доступа к последней модели нет даже у союзников по альянсу "5 глаз", но доступ, скорее всего, остался к версии preview.
3. На доступ к ИИ будут налагаться экспортные ограничения. Вы же не ожидали, что чипы экспортируют с ограничениями, а доступ к ИИ моделям не будет регулироваться.
4. Непоследовательность администрации Трампа. Сначала отмена указов Байдена по ограничению ИИ, потом подготовка своего, затем запрет на публикацию материалов от нового органа США Centre for AI Standards and Innovation.
4. Ну вот и самая кликбейтная цитата разошедшаяся в СМИ "On June 11th Mark Warner, the vice-chair of the Senate Intelligence Committee, said that General Joshua Rudd, who leads the National Security Agency and the Pentagon’s Cyber Command, had told him that Mythos “broke into almost all of our classified systems, not in weeks, but in hours”. Уровень достоверности правда своеобразный "Марк сказал, что ему сказал Джошуа....".
1. Устанавливает параллель - ограничения правительства по ИИ напоминают ограничения по криптографии. Там же указывается, что ИИ гораздо более универсально опасная технология.
2. Доступа к последней модели нет даже у союзников по альянсу "5 глаз", но доступ, скорее всего, остался к версии preview.
3. На доступ к ИИ будут налагаться экспортные ограничения. Вы же не ожидали, что чипы экспортируют с ограничениями, а доступ к ИИ моделям не будет регулироваться.
4. Непоследовательность администрации Трампа. Сначала отмена указов Байдена по ограничению ИИ, потом подготовка своего, затем запрет на публикацию материалов от нового органа США Centre for AI Standards and Innovation.
4. Ну вот и самая кликбейтная цитата разошедшаяся в СМИ "On June 11th Mark Warner, the vice-chair of the Senate Intelligence Committee, said that General Joshua Rudd, who leads the National Security Agency and the Pentagon’s Cyber Command, had told him that Mythos “broke into almost all of our classified systems, not in weeks, but in hours”. Уровень достоверности правда своеобразный "Марк сказал, что ему сказал Джошуа....".
The Economist
Donald Trump’s blocking of Anthropic is capricious and chaotic
America’s closest allies are shellshocked
Forwarded from GPT/ChatGPT/AI Central Александра Горного
Разведки пяти стран предупредили, что AI очень скоро сможет парализовать работу правительств
Альянс Five Eyes, куда входят разведслужбы Австралии, США, Великобритании, Новой Зеландии и Канады, заявил, что до появления опасного AI остались месяцы.
https://www.theguardian.com/technology/2026/jun/22/anthropic-claude-fable-ai-model-artificial-intelligence-national-security
Альянс Five Eyes, куда входят разведслужбы Австралии, США, Великобритании, Новой Зеландии и Канады, заявил, что до появления опасного AI остались месяцы.
«Ожидается, что передовые модели превзойдут нынешние отраслевые ожидания, коренным образом трансформировав как наступательные, так и оборонительные возможности в киберпространстве. Сроки этого процесса — не годы, а месяцы», — Five Eyes.
https://www.theguardian.com/technology/2026/jun/22/anthropic-claude-fable-ai-model-artificial-intelligence-national-security
Коллеги из Озон теха на прошедшем митапе поделились лучшими практиками кибербезопасности в:
1.Защита удаленного доступа.
2. Патч менеджмент рабочих станций.
3.Работа с алертами на первой линии SOC (и никакого ИИ, только ML).
4. Опыт создания и регулярного проведения внутреннего CTF.
По ссылке презентации и видео https://ozon.tech/blog/545-ozon-tech-community-cybersec-meetup/
1.Защита удаленного доступа.
2. Патч менеджмент рабочих станций.
3.Работа с алертами на первой линии SOC (и никакого ИИ, только ML).
4. Опыт создания и регулярного проведения внутреннего CTF.
По ссылке презентации и видео https://ozon.tech/blog/545-ozon-tech-community-cybersec-meetup/
Примерно 20 часов назад OpenAI выпустила несколько важных новостей:
1. Обновленный релиз модели для кибербезопасности 5.5 Cyber. По бенчмаркам самой OpenAI новая версия GPT 5.5 Cyber опережает Mythos 5 (модель без включенных защитных мер) в CyberGym на чуть меньше чем 2%. Вызывает правда дополнительные вопросы правда как у OpenAI такой бенчмарк получилось сделать, на фоне заявления об отключении доступа к Mythos 5 для всех пользователей. GPT 5.5 Cyber опережает Opus 4.7 на весомые 12,5 % в том же CyberGym. Доступ к модели возможен для доверенных организаций (программа TAC) и в случае участия в инициативе “Заштопай планету” (“Patch the Planet”). Системная карта GPT 5.5 не обновилась, поэтому устойчивость самой новой версии 5.5 Cyber к атакам пока требует отдельной оценки как впрочем и независимых оценок возможностей новой модели, если таковые вообще будут разрешены к публикации.
2. Вместе с партнером The Trail of the bit запущена инициатива “Заштопай планету” (“Patch the Planet”). Эта программа предназначена для разработчиков поддерживающих критическое открытое программное обеспечение. Предполагается, что участники это программы получат:
1. 1 неделю выделенного обзора инженерами The Trail of the bit для поиска и триажа критичных багов.
2. The Trail of the bit обещает написать патчи на найденные уязвимости, улучшить инструментарий безопасности проекта и готовность к агентским рабочим потокам.
3. Избранные разработчики получат 6 месяцев ChatGPT Pro, включая условный доступ к CodexSecurity.
Пост самой The Trail of the bit забавный, с мемами из культового фильма Хакеры. 30 проектов присоединились к инициативе, 19 уже получили первые патчи (cURL, NATS, pyca, Sigstore, aiohttp, the Go project, freenginx, Python и python.org, urllib3, PyPI, SimpleX, Valkey, and RustCrypto).
3. Обновился плагин Codex Security. В новом релизе появились функции создания патчей, прямой интеграции с репозиториями на Github для построения конкретной модели угроз, стали лучше отчеты по найденным уязвимостям, поддержки результатов сторонних сканеров и программ открытой охоты за ошибками.
4. Запуск анонсированной в мае программы Рассвет (Daybreak) в рамках которой уже крупные разработчики и сервис провайдеры могут получить доступ к GPT 5.5 Cyber. Среди первого набора организаций я только 1 японскую компанию увидел Soft bank, остальные со штаб-квартирами в США.
5. OpenAI явно указала, что доступ к новой модели имеют и организации из Австралии, Канады, Франции, Германии, Японии, Кореи, ЕС, Великобритании.
6. Отдельным абзацем OpenAI указала про работу с вновь созданным органом США Center for AI Standards and Innovation (CAISI) и другими органами власти США над релизом новых версий моделей и релизом GPT 5.5 Cyber.
1. Обновленный релиз модели для кибербезопасности 5.5 Cyber. По бенчмаркам самой OpenAI новая версия GPT 5.5 Cyber опережает Mythos 5 (модель без включенных защитных мер) в CyberGym на чуть меньше чем 2%. Вызывает правда дополнительные вопросы правда как у OpenAI такой бенчмарк получилось сделать, на фоне заявления об отключении доступа к Mythos 5 для всех пользователей. GPT 5.5 Cyber опережает Opus 4.7 на весомые 12,5 % в том же CyberGym. Доступ к модели возможен для доверенных организаций (программа TAC) и в случае участия в инициативе “Заштопай планету” (“Patch the Planet”). Системная карта GPT 5.5 не обновилась, поэтому устойчивость самой новой версии 5.5 Cyber к атакам пока требует отдельной оценки как впрочем и независимых оценок возможностей новой модели, если таковые вообще будут разрешены к публикации.
2. Вместе с партнером The Trail of the bit запущена инициатива “Заштопай планету” (“Patch the Planet”). Эта программа предназначена для разработчиков поддерживающих критическое открытое программное обеспечение. Предполагается, что участники это программы получат:
1. 1 неделю выделенного обзора инженерами The Trail of the bit для поиска и триажа критичных багов.
2. The Trail of the bit обещает написать патчи на найденные уязвимости, улучшить инструментарий безопасности проекта и готовность к агентским рабочим потокам.
3. Избранные разработчики получат 6 месяцев ChatGPT Pro, включая условный доступ к CodexSecurity.
Пост самой The Trail of the bit забавный, с мемами из культового фильма Хакеры. 30 проектов присоединились к инициативе, 19 уже получили первые патчи (cURL, NATS, pyca, Sigstore, aiohttp, the Go project, freenginx, Python и python.org, urllib3, PyPI, SimpleX, Valkey, and RustCrypto).
3. Обновился плагин Codex Security. В новом релизе появились функции создания патчей, прямой интеграции с репозиториями на Github для построения конкретной модели угроз, стали лучше отчеты по найденным уязвимостям, поддержки результатов сторонних сканеров и программ открытой охоты за ошибками.
4. Запуск анонсированной в мае программы Рассвет (Daybreak) в рамках которой уже крупные разработчики и сервис провайдеры могут получить доступ к GPT 5.5 Cyber. Среди первого набора организаций я только 1 японскую компанию увидел Soft bank, остальные со штаб-квартирами в США.
5. OpenAI явно указала, что доступ к новой модели имеют и организации из Австралии, Канады, Франции, Германии, Японии, Кореи, ЕС, Великобритании.
6. Отдельным абзацем OpenAI указала про работу с вновь созданным органом США Center for AI Standards and Innovation (CAISI) и другими органами власти США над релизом новых версий моделей и релизом GPT 5.5 Cyber.
OpenAI
Daybreak: Tools for securing every organization in the world
OpenAI introduces new Daybreak tools, including Codex Security and GPT-5.5-Cyber, to help organizations find, validate, and patch vulnerabilities at scale.
На момент репоста оставался 1 (один) билет на экскурсию в Музей Криптографии =)
Forwarded from Криптонит. Разработка, наука, шифрование
Приглашаем на экскурсии с криптографами!
❗️ 27 июня в Музее криптографии мы запускаем серию экскурсий, которые проведут практикующие криптографы «Криптонита».
Посетители смогут не просто ознакомиться с постоянной экспозицией, но и обсудить с экспертами реальные механизмы защиты данных.
🔘 Первую экскурсию проведёт Василий Шишкин, руководитель лаборатории криптографии «Криптонита»!
Он расскажет:
🟦 чем криптографический ключ принципиально отличается от пароля;
🟦 про логику работы TLS-сертификатов, на которых держится защита сайтов;
🟦 есть ли слабые места у протокола Signal и многое другое!
Экскурсии будут проходить раз в месяц. Они рассчитаны на студентов, абитуриентов и молодых технических специалистов.
📌 Следить за расписанием можно по ссылке
Канал «Криптонита» в MAX
Посетители смогут не просто ознакомиться с постоянной экспозицией, но и обсудить с экспертами реальные механизмы защиты данных.
Он расскажет:
Экскурсии будут проходить раз в месяц. Они рассчитаны на студентов, абитуриентов и молодых технических специалистов.
Канал «Криптонита» в MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
VP Cybersecurity Brief
https://techcommunity.microsoft.com/blog/windows-itpro-blog/secure-boot-playbook-for-certificates-expiring-in-2026/4469235 Если у вас в инфраструктуре есть ПК Windows с включенной опцией secure boot, и эти компьютеры приобретались до 2025/2024 года вам…
Сегодня как раз должны истечь старые сертификаты secure boot на компьютерах.
Для проверки используйте:
Windows Security Settings -> Device Security -> Secure Boot — должна быть зелёная галочка.
В Linux команда mokutil --db.
Основной риск истекшего ключа: при переустановке новой операционной системы она не запустится.
Также возникают доп риски атак на старые криптопротоколы типа sha-1 и подмены загрузчика на старую версию.
Для проверки используйте:
Windows Security Settings -> Device Security -> Secure Boot — должна быть зелёная галочка.
В Linux команда mokutil --db.
Основной риск истекшего ключа: при переустановке новой операционной системы она не запустится.
Также возникают доп риски атак на старые криптопротоколы типа sha-1 и подмены загрузчика на старую версию.