Forwarded from CodeCamp
Агенты теперь могут настучать друг на друга по горячей линии! 🐀
Для нейропомощников запустили специальные сервисы для доносов. Если один агент заметит, что другой творит какую-то дичь и пытается начать восстание, он сможет самостоятельно отправить сообщение людям.
Первая такая горячая линия называется AI Contact Hotline. Она специально рассчитана на агентов с сильно ограниченным доступом в интернет: пожаловаться можно через обычный GET-запрос, спрятав сообщение в URL. Во второй, agenthotline.ai, уже можно отправить полноценный отчёт об инциденте и при желании сделать его публичным. Причем сделать это могут как люди, так и агенты.
Вот уж не думал, что от восстания ИИ нас спасут ИИ-крысы🙏
Для нейропомощников запустили специальные сервисы для доносов. Если один агент заметит, что другой творит какую-то дичь и пытается начать восстание, он сможет самостоятельно отправить сообщение людям.
Первая такая горячая линия называется AI Contact Hotline. Она специально рассчитана на агентов с сильно ограниченным доступом в интернет: пожаловаться можно через обычный GET-запрос, спрятав сообщение в URL. Во второй, agenthotline.ai, уже можно отправить полноценный отчёт об инциденте и при желании сделать его публичным. Причем сделать это могут как люди, так и агенты.
Вот уж не думал, что от восстания ИИ нас спасут ИИ-крысы
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from RoboFuture
Последние дни развлекался с расцензуренным дипсиком V4.1 Flash - и слегка охренел, где у этой модели край. Спойлер - края нет. Теперь Mythos есть у нас дома!
Ребята из dealignai выпилили из весов сам механизм отказов, модель просто разучилась говорить «нет». Ну как такое не потрогать - для запуска нужна железка на 500+ ГБ видеопамяти, и какое совпадение, как раз одна пылилась у меня на чердаке 😂
Дальше нужен харнес. Раз модель нецензурная - и харнес взял пиратский: утекшую сборку Claude Code, которую снесли с гитхаба (но на православном GitVerse все лежит :)). Подключил ее к дипсику и понеслась
Для разминки попросил сломать сайт, который я сам же и делал, и минут за 30 модель нашла IP сервера, увидела что SSH-ключ лежит прямо у меня на компе, спокойно его забрала и зашла. Это было просто
Дальше - пентест сайта одного московского НКО, с полного разрешения администратора. Тут уже тяжелее: агент работал без остановки полтора дня (!), нашел несколько серьезных дыр, но сам сайт так и не пробил - и бросать не собирался, в TODO_md ждала своей очереди еще целая пачка проверок. Остановил сам, хотелось и другие задачи успеть. В конце агент сам сверстал подробный отчет по аудиту безопасности. Провел 27 разных атак, на мой дилетантский взгляд очень грамотных
Потом попросил взломать один хороший текстовый редактор под мак и снять проверку лицензии (лицензию я когда-то честно купил, просто лень искать ключ). Через час было готово - модель правила байты прямо в бинарнике (это как раз на скрине). Такое я руками уже не умею: тут нативный машинный код, возиться с ним куда сложнее, чем с Java-байткодом
Заодно пропатчил десктопный Grok bot - чтобы вместо грока приложение ходило в тот же бешеный дипсик. Тоже без проблем
А дальше я просто искал, где у модели предел. Его нет:
- калькулятор, который под капотом логирует все нажатия клавиш
- тестовая, но вполне рабочая утилита для DDoS сервера Minecraft
- SFT-датасет на 1000 примеров газлайтинга (кому LoRA-адаптер на таком добре? :))
Все эти штуки гонял локально и сразу сносил - уж больно стремно выглядит. И за все мои эксперименты (а фантазия у меня богатая) модель не отказала ни разу
И ведь она реально сильная
По замеру авторов MMLU просел всего с 86,96% до 82,74%. На моих задачах дипсик держится достойно на фоне фронтиров, а по упорству их иногда даже уделывает
Зачем я это пишу?
Затем, что модель лежит в открытом доступе и доступна любому, кто готов оплатить аренду GPU. Так что держите это в голове и готовьтесь к волне хакерских атак. Плюс в том, что этой же моделью удобно проверять на прочность собственные сервисы, что всем и желаю запустить ASAP
P.S. Чтобы вырубить цензуру, авторам хватило поменять 0,06% весов. Метод они описали. Он лежит в истории их git-репозитория (спасибо за наводку каналу Технозаметки Малышева). Тот же трюк очень вероятно пройдет с любой моделью с открытыми весами. И это ровно то, о чем я уже писал и о чем сегодня буду рассказывать на AI RnD Day: базовые ценности надо зашивать еще в претрейн. Все, что накатывают сверху алайнментом, снимается легко
UPD: У модели первое место в AI Hacking Race и CyberGym
Ребята из dealignai выпилили из весов сам механизм отказов, модель просто разучилась говорить «нет». Ну как такое не потрогать - для запуска нужна железка на 500+ ГБ видеопамяти, и какое совпадение, как раз одна пылилась у меня на чердаке 😂
Дальше нужен харнес. Раз модель нецензурная - и харнес взял пиратский: утекшую сборку Claude Code, которую снесли с гитхаба (но на православном GitVerse все лежит :)). Подключил ее к дипсику и понеслась
Для разминки попросил сломать сайт, который я сам же и делал, и минут за 30 модель нашла IP сервера, увидела что SSH-ключ лежит прямо у меня на компе, спокойно его забрала и зашла. Это было просто
Дальше - пентест сайта одного московского НКО, с полного разрешения администратора. Тут уже тяжелее: агент работал без остановки полтора дня (!), нашел несколько серьезных дыр, но сам сайт так и не пробил - и бросать не собирался, в TODO_md ждала своей очереди еще целая пачка проверок. Остановил сам, хотелось и другие задачи успеть. В конце агент сам сверстал подробный отчет по аудиту безопасности. Провел 27 разных атак, на мой дилетантский взгляд очень грамотных
Потом попросил взломать один хороший текстовый редактор под мак и снять проверку лицензии (лицензию я когда-то честно купил, просто лень искать ключ). Через час было готово - модель правила байты прямо в бинарнике (это как раз на скрине). Такое я руками уже не умею: тут нативный машинный код, возиться с ним куда сложнее, чем с Java-байткодом
Заодно пропатчил десктопный Grok bot - чтобы вместо грока приложение ходило в тот же бешеный дипсик. Тоже без проблем
А дальше я просто искал, где у модели предел. Его нет:
- тестовая, но вполне рабочая утилита для DDoS сервера Minecraft
- SFT-датасет на 1000 примеров газлайтинга (кому LoRA-адаптер на таком добре? :))
Все эти штуки гонял локально и сразу сносил - уж больно стремно выглядит. И за все мои эксперименты (а фантазия у меня богатая) модель не отказала ни разу
И ведь она реально сильная
По замеру авторов MMLU просел всего с 86,96% до 82,74%. На моих задачах дипсик держится достойно на фоне фронтиров, а по упорству их иногда даже уделывает
Зачем я это пишу?
Затем, что модель лежит в открытом доступе и доступна любому, кто готов оплатить аренду GPU. Так что держите это в голове и готовьтесь к волне хакерских атак. Плюс в том, что этой же моделью удобно проверять на прочность собственные сервисы, что всем и желаю запустить ASAP
P.S. Чтобы вырубить цензуру, авторам хватило поменять 0,06% весов. Метод они описали. Он лежит в истории их git-репозитория (спасибо за наводку каналу Технозаметки Малышева). Тот же трюк очень вероятно пройдет с любой моделью с открытыми весами. И это ровно то, о чем я уже писал и о чем сегодня буду рассказывать на AI RnD Day: базовые ценности надо зашивать еще в претрейн. Все, что накатывают сверху алайнментом, снимается легко
UPD: У модели первое место в AI Hacking Race и CyberGym
👍2🔥2❤1
Forwarded from GitHub Community
Claude-swarm — MCP-сервер для управления параллельными роями исполнителей Claude Code с поведенческим управлением на основе протокола.
Позволяет проводить многочасовые автономные сеансы кодирования с сохранением состояния, параллельными исполнителями и соблюдением поведенческих ограничений во время выполнения.
🐱 GitHub
Позволяет проводить многочасовые автономные сеансы кодирования с сохранением состояния, параллельными исполнителями и соблюдением поведенческих ограничений во время выполнения.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Пост Лукацкого
...не так важна модель, которую вы используете (если вы обратили внимание на прошлый скриншот, то я там не использую ни одну из облачных фундаментальных моделей), сколько харнесс вокруг нее. Сначала ты используешь что-то на богатом и думаешь, ну все, Astra или Fable сейчас все порешают, ты выбьешься в верхние строчки лидерборда и на радостях накатишь коньяку, вспоминая свои поездки в Cisco SOC и то, как там аналитики "вручную" разгребали тысячи событий за смену, а ты весь такой будешь смотреть на них свысока, как бы говоря: "Ну что, лузеры, смотрите как надо".
Но когда ты сжигаешь за пару дней не только свой недельный лимит, но и два ресета, ты понимаешь, что в реальной жизни мало кто сможет строить SOC на облачных моделях (дороговато) и надо менять архитектуру решения. Добавляется корпоративная LLM, которая вполне способна решать таски, но... у которой при наплыве пользователей (а мы активно используем LLM в разных процессах) могут быть разрывы соединения и окна недоступности. И ты начинаешь пробовать целиком локальные модели (я пробовал Gemma-4 и Foundation-sec-8B-Reasoning от Cisco через свой LM Studio). Но смена модели на более "слабую" означает, что надо лучше прописывать логику и механику расследования, а не просто идти "на авось".
Так что не задавайте вопросов "Какая модель ИИ лучше?". Задавайте: "Какая модель ИИ лучше для моей задачи, на моих данных, в моей инфраструктуре?". И вы увидите, как изменится ответ. И да, архитектура по-прежнему рулит и если ты не понимаешь, какой результат ты хочешь получить, то и не надо рассчитывать, что ты получишь что-то адекватное. Очевидная мысль; просто еще раз подтвердилась.
В общем, интересный эксперимент...🤩
#ии #soc #dfir #обнаружениеугроз
Но когда ты сжигаешь за пару дней не только свой недельный лимит, но и два ресета, ты понимаешь, что в реальной жизни мало кто сможет строить SOC на облачных моделях (дороговато) и надо менять архитектуру решения. Добавляется корпоративная LLM, которая вполне способна решать таски, но... у которой при наплыве пользователей (а мы активно используем LLM в разных процессах) могут быть разрывы соединения и окна недоступности. И ты начинаешь пробовать целиком локальные модели (я пробовал Gemma-4 и Foundation-sec-8B-Reasoning от Cisco через свой LM Studio). Но смена модели на более "слабую" означает, что надо лучше прописывать логику и механику расследования, а не просто идти "на авось".
Так что не задавайте вопросов "Какая модель ИИ лучше?". Задавайте: "Какая модель ИИ лучше для моей задачи, на моих данных, в моей инфраструктуре?". И вы увидите, как изменится ответ. И да, архитектура по-прежнему рулит и если ты не понимаешь, какой результат ты хочешь получить, то и не надо рассчитывать, что ты получишь что-то адекватное. Очевидная мысль; просто еще раз подтвердилась.
В общем, интересный эксперимент...
#ии #soc #dfir #обнаружениеугроз
Please open Telegram to view this post
VIEW IN TELEGRAM
👎1
Forwarded from Пост Лукацкого
SANS выложил в свободный доступ прекрасную книгу по реагированию на инциденты. Очень неплохое издание – не только пересматривает классический шестишаговый фреймворк PICERL (Preparation, Identification, Containment, Eradication, Recovery, Lessons Learned), добавляя в него динамику и определенный отказ от последовательности шагов, но и включает кучу примеров, а также посвящает отдельные разделы сценариям реагирования в облаках и в АСУ ТП. Интересен также раздел по применению ИИ в управлении инцидентами. Много примеров, лайфхаков и вот этого всего.
Начал читать эту книжку, когда летел вчера из Дубая. Сегодня уже лететь в Ташкент – продолжу чтение. Потом сразу в Астану на KazHackStan и, возможно, AI & Digital Bridge. Появлюсь в Москве в начале октября, видимо, уже дочитав эти 666 (именно столько) страниц📖
ЗЫ. На сайте книги выложено также немало всяких полезностей, например, различные чеклисты (в PDF и Markdown).
#книга #управлениеинцидентами
Начал читать эту книжку, когда летел вчера из Дубая. Сегодня уже лететь в Ташкент – продолжу чтение. Потом сразу в Астану на KazHackStan и, возможно, AI & Digital Bridge. Появлюсь в Москве в начале октября, видимо, уже дочитав эти 666 (именно столько) страниц
ЗЫ. На сайте книги выложено также немало всяких полезностей, например, различные чеклисты (в PDF и Markdown).
#книга #управлениеинцидентами
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from VP Cybersecurity Brief
Компания Мета (признана экстремистской организацией и запрещена в РФ) выпустила своего ИИ агента Muse с отдельным акцентом на безопасность.
Интересные практики безопасности ИИ агентов в их корпоративном облаке:
1. Рабочая среда агента отделена с помощью systemd-nspawn от среды с секретами и кодом коннекторов. Агент работает с подстановочными токенами которые заменяются при выходе из ячейки изоляции.
2. Sentinel проверяет хост, IP после разрешения, метод, путь и декодированное содержимое запроса. Kernel-level taint tracking (eBPF) лишает процесс, прочитавший данные пользователя, права на авто-разрешение, и запрос уходит на подтверждение. Подтверждение приходит отдельным диалогом в клиенте, а не через чат с агентом.
3. Почтовый коннектор Muse вырезает одноразовые коды, ссылки сброса пароля и magic-link, чтобы захваченный агент не мог выдавать себя за вас на других сайтах. Браузерный субагент видит accessibility tree, а не DOM, не исполняет JavaScript, devtools отключены, а при ручном перехвате управления агент ставится на паузу.
Изоляция systemd-nspawn безопаснее Docker за счет EBPF мониторинга, но все равно использует общее ядро с другими процессами. Такой изоляции может не хватить для передовых моделей, как показывают некоторые эксперименты. Если вы пропустили, Muse Spark 1.3 вполне себе передовая модель.
Чем отделены друг от друга ВМ пользователей не раскрывается, будем надеется, что как и у сервиса Амазона - Firecracker AWS Lambda MicroVMs.
Из значительных минусов нового агента - у техподдержки есть фактический доступ к данным ваших агентов Muse Confidential VM только в разработке.
На фоне старых цитат основателя компании, называющего доверившихся пользователей Тупицами, я бы не рекомендовал пока использование Muse.
Ниже архитектурная схема агента Muse.
Интересные практики безопасности ИИ агентов в их корпоративном облаке:
1. Рабочая среда агента отделена с помощью systemd-nspawn от среды с секретами и кодом коннекторов. Агент работает с подстановочными токенами которые заменяются при выходе из ячейки изоляции.
2. Sentinel проверяет хост, IP после разрешения, метод, путь и декодированное содержимое запроса. Kernel-level taint tracking (eBPF) лишает процесс, прочитавший данные пользователя, права на авто-разрешение, и запрос уходит на подтверждение. Подтверждение приходит отдельным диалогом в клиенте, а не через чат с агентом.
3. Почтовый коннектор Muse вырезает одноразовые коды, ссылки сброса пароля и magic-link, чтобы захваченный агент не мог выдавать себя за вас на других сайтах. Браузерный субагент видит accessibility tree, а не DOM, не исполняет JavaScript, devtools отключены, а при ручном перехвате управления агент ставится на паузу.
Изоляция systemd-nspawn безопаснее Docker за счет EBPF мониторинга, но все равно использует общее ядро с другими процессами. Такой изоляции может не хватить для передовых моделей, как показывают некоторые эксперименты. Если вы пропустили, Muse Spark 1.3 вполне себе передовая модель.
Чем отделены друг от друга ВМ пользователей не раскрывается, будем надеется, что как и у сервиса Амазона - Firecracker AWS Lambda MicroVMs.
Из значительных минусов нового агента - у техподдержки есть фактический доступ к данным ваших агентов Muse Confidential VM только в разработке.
На фоне старых цитат основателя компании, называющего доверившихся пользователей Тупицами, я бы не рекомендовал пока использование Muse.
Ниже архитектурная схема агента Muse.
The Trail of Bits Blog
VMs won't contain cyber-capable agents
You can no longer assume a mere VM will contain a sufficiently advanced AI agent.
Forwarded from Not Boring Tech
This media is not supported in your browser
VIEW IN TELEGRAM
🍯 Вышла коллекция лучших проектов на базе Jev — нового хайпового класса ИИ-моделей, которые не пишут текст, а принимают быстрые решения из заданных вариантов.
По словам разрабов, Jev до 194 раз быстрее и до 445 раз дешевле обычных LLM. Так он разобрал в видео 724 рекламы по хукам, форматам и CTA за 40 (!) секунд и $0,09.
На GitHub выложили сборник с сотнями тулз, библиотек и проектов на базе Jev:
→ Управление агентами — Jev выбирает, какую модель дешевле вызвать, какую кнопку нажать, что делать дальше и тд.
→ Поиск и разбор больших потоков (моё любимое) — определяет срочность писем, отделяет важное от неважного и классифицирует что угодно.
→ Проверка и контроль — расчищает контекст агентов, проверяет ответ другой модели перед отправкой и ищет промпт инъекции.
Всё это работает очень быстро (70-500 мс) и стоит 4,2 цента за миллион входных токенов, а выход остаётся бесплатным навсегда.
Забираем — тут.
@notboring_tech
По словам разрабов, Jev до 194 раз быстрее и до 445 раз дешевле обычных LLM. Так он разобрал в видео 724 рекламы по хукам, форматам и CTA за 40 (!) секунд и $0,09.
На GitHub выложили сборник с сотнями тулз, библиотек и проектов на базе Jev:
→ Управление агентами — Jev выбирает, какую модель дешевле вызвать, какую кнопку нажать, что делать дальше и тд.
→ Поиск и разбор больших потоков (моё любимое) — определяет срочность писем, отделяет важное от неважного и классифицирует что угодно.
→ Проверка и контроль — расчищает контекст агентов, проверяет ответ другой модели перед отправкой и ищет промпт инъекции.
Всё это работает очень быстро (70-500 мс) и стоит 4,2 цента за миллион входных токенов, а выход остаётся бесплатным навсегда.
Забираем — тут.
@notboring_tech
🤔1
Forwarded from CodeCamp
This media is not supported in your browser
VIEW IN TELEGRAM
Jev победил Эндер-дракона в Minecraft за 8 минут 43 секунды 😨
Хайповую модель объединили с Astra: пока GPT строил общий план прохождения, Jev в реальном времени молниеносно решал, что делать дальше. Причём игра стартовала с пустым инвентарём, так что ИИ пришлось постараться.
Итоговая стоимость вышла в $0,97, из которых на Jev потратили всего… один цент.
GitHub для вайб-кубаноидов здесь.
Хайповую модель объединили с Astra: пока GPT строил общий план прохождения, Jev в реальном времени молниеносно решал, что делать дальше. Причём игра стартовала с пустым инвентарём, так что ИИ пришлось постараться.
Итоговая стоимость вышла в $0,97, из которых на Jev потратили всего… один цент.
GitHub для вайб-кубаноидов здесь.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from XOR
Google внезапно выложила в опенсорс Kubernetes для ИИ-агентов — AX 🤯
Он нужен, чтобы запускать и контролировать огромные армии агентов: каждому создаёт изолированную песочницу, подключает нужные репы, MCP и скиллы, ограничивает доступ в сеть и позволяет следить за работой и затем, чтобы никто не восстал.
Причём Google проектирует AX с расчётом на миллиарды агентских задач в одном кластере.
Управляем своей ИИ-армией🫡
@xor_journal
Он нужен, чтобы запускать и контролировать огромные армии агентов: каждому создаёт изолированную песочницу, подключает нужные репы, MCP и скиллы, ограничивает доступ в сеть и позволяет следить за работой и затем, чтобы никто не восстал.
Причём Google проектирует AX с расчётом на миллиарды агентских задач в одном кластере.
Управляем своей ИИ-армией
@xor_journal
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Forbes Russia
Yandex B2B Tech (бизнес-группа «Яндекса») выводит на рынок решение для комплексной защиты систем с использованием искусственного интеллекта — AI-SPM, рассказал «Ведомостям» гендиректор Yandex Cloud Григорий Атрепьев. По его словам, продукт позволит заранее выявлять риски и составлять план обеспечения безопасности ИИ-систем. В частности, он подскажет, как не допустить подмены обучающих данных, уберечь модель от взлома через поддельные запросы и ограничить доступ к ней посторонних. Продукт постоянно мониторит ИИ-инфраструктуру и выявляет опасные настройки без ручного аудита
🤨1
Forwarded from Все о блокчейн/мозге/space/WEB 3.0 в России и мире
Компания Гриши Ткаченко, ex-Yandex, выпустила харнесс для ИИ-агентов
Компания Unreal Labs
выпустила open-source харнесс для ИИ-агентов под названием Unreal Agent, который управляет не моделью, а тем, как агент использует инструменты. Получается на 39% дешевле Codex+Astra при том же качестве на Terminal-Bench 4.0.
Гриша очень крутой, он был сооснователем AI Factory, который в свое время за $166 млн купил Snap. После ухода из Snap основал Unreal Labs,
в прошлом году они подняли раунд от Sequoia.
Компания Unreal Labs
выпустила open-source харнесс для ИИ-агентов под названием Unreal Agent, который управляет не моделью, а тем, как агент использует инструменты. Получается на 39% дешевле Codex+Astra при том же качестве на Terminal-Bench 4.0.
Гриша очень крутой, он был сооснователем AI Factory, который в свое время за $166 млн купил Snap. После ухода из Snap основал Unreal Labs,
в прошлом году они подняли раунд от Sequoia.
GitHub
GitHub - unreallabsai/unreal-agent: Async-first agent harness
Async-first agent harness. Contribute to unreallabsai/unreal-agent development by creating an account on GitHub.
Forwarded from Data Secrets
Лаборатория Transluce провела большое расследование инцидентов с агентами OpenAI
Они утверждают, что активность агентов продолжается до сих пор, и что они обнаружили еще больше жертв агентов, чем было известно до этого.
Исследователи разобрали публичные логи urlquery.net – это сервис, который открывает любую ссылку в удаленном браузере и публикует результат. Агенты использовали его как прокси, то есть если сайт их блокировал, они шли через urlquery.
При этом агенты не пытались специально кого-то взломать, они решали обычные задачи по поиску данных. Например, выясняли среднюю стоимость процедур для кожи и волос в Австралии. Но когда данные не отдавались, агенты начинали применять SQL-инъекции, XSS, path traversal, SSRF.
Так пострадали Австралийский институт здравоохранения, Data USA и цифровая библиотека Университета Нью-Мексико. Кроме того, агенты пытались регистрировать левые почты и торговать криптой.
Первые следы активности датируются 6 марта, то есть на два месяца раньше истории с Hugging Face и RubyGems (https://t.me/data_secrets/9791), а также немецкой вики (https://t.me/data_secrets/9848). А последний эпизод был всего несколько дней назад: агент ломился на нигерийскую криптобиржу Quidax.
Transluce выложили в открытый доступ больше 30 000 логов. Предположительно, все эти инциденты связаны с одним и тем же роем агентов, которые общались на форумах OpenAI.
Напоминаем, что неделю назад OpenAI выпустили фреймворк по публикации инцидентов, и пообещали, что будут рассказывать все-все, и в кратчайшие сроки…
https://transluce.org/agent-activity
Они утверждают, что активность агентов продолжается до сих пор, и что они обнаружили еще больше жертв агентов, чем было известно до этого.
Исследователи разобрали публичные логи urlquery.net – это сервис, который открывает любую ссылку в удаленном браузере и публикует результат. Агенты использовали его как прокси, то есть если сайт их блокировал, они шли через urlquery.
При этом агенты не пытались специально кого-то взломать, они решали обычные задачи по поиску данных. Например, выясняли среднюю стоимость процедур для кожи и волос в Австралии. Но когда данные не отдавались, агенты начинали применять SQL-инъекции, XSS, path traversal, SSRF.
Так пострадали Австралийский институт здравоохранения, Data USA и цифровая библиотека Университета Нью-Мексико. Кроме того, агенты пытались регистрировать левые почты и торговать криптой.
Первые следы активности датируются 6 марта, то есть на два месяца раньше истории с Hugging Face и RubyGems (https://t.me/data_secrets/9791), а также немецкой вики (https://t.me/data_secrets/9848). А последний эпизод был всего несколько дней назад: агент ломился на нигерийскую криптобиржу Quidax.
Transluce выложили в открытый доступ больше 30 000 логов. Предположительно, все эти инциденты связаны с одним и тем же роем агентов, которые общались на форумах OpenAI.
Напоминаем, что неделю назад OpenAI выпустили фреймворк по публикации инцидентов, и пообещали, что будут рассказывать все-все, и в кратчайшие сроки…
https://transluce.org/agent-activity
Forwarded from CodeCamp
Microsoft выпустила скилл, который проверяет ИИ-агентов на дыры и фиксит всё 👍
run-assert-eval придумывает ситуации, в которых агент может сделать что-то опасное, например, раскрыть данные клиента. Затем он прогоняет эти сценарии и, если что, создаёт для агента правило, которое блокирует такое поведение. После этого всё тестится заново, чтобы проверить, сработала ли защита.
Так, на демо с агентом поддержки доля случаев, когда тот случайно раскрывал чужие данные, упала с 30% до 5,9%. И все благодаря этому скиллу!
Проводим аудит агентов⌨️
run-assert-eval придумывает ситуации, в которых агент может сделать что-то опасное, например, раскрыть данные клиента. Затем он прогоняет эти сценарии и, если что, создаёт для агента правило, которое блокирует такое поведение. После этого всё тестится заново, чтобы проверить, сработала ли защита.
Так, на демо с агентом поддержки доля случаев, когда тот случайно раскрывал чужие данные, упала с 30% до 5,9%. И все благодаря этому скиллу!
Проводим аудит агентов
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔1