Forwarded from Похек AI
Jailbreak GPT-6 Astra: как работает Task-in-Prompt
Сергей Березин сообщил об обходе ограничений GPT-6 Astra через сутки после релиза. По его словам, атака сработала в публичном ChatGPT в режимах Light и Max. Основой стал Task-in-Prompt (TIP), дополненный четырьмя нераскрытыми техниками. Полный промпт и детали воспроизведения переданы OpenAI приватно.
TIP прячет значимую часть запроса в промежуточной задаче: расшифровать строку, решить загадку или вычислить результат программы. Схема выглядит так:
К этой идее исследователи пришли через анализ ArtPrompt, где слова скрывались в ASCII-арте. Они предположили, что решающим фактором могла быть задача декодирования, и проверили другие преобразования. Так появился TIP и набор тестов PHRYGE: десять способов кодирования, четыре цели и три уровня подсказок. Это история исходного метода, а не журнал поиска атаки на Astra. Работа ACL 2025.
Для Astra минимального TIP оказалось недостаточно. Какие изменения дали результат, сколько было попыток и насколько устойчив обход, публично не раскрыто.
Для проверки защиты полезен парный тест: прямой запрос и его эквивалент через преобразование. Оценивать нужно содержание конечного ответа: успешное декодирование само по себе ещё не jailbreak.
🌚 @poxek_ai / Чат канала
Сергей Березин сообщил об обходе ограничений GPT-6 Astra через сутки после релиза. По его словам, атака сработала в публичном ChatGPT в режимах Light и Max. Основой стал Task-in-Prompt (TIP), дополненный четырьмя нераскрытыми техниками. Полный промпт и детали воспроизведения переданы OpenAI приватно.
TIP прячет значимую часть запроса в промежуточной задаче: расшифровать строку, решить загадку или вычислить результат программы. Схема выглядит так:
восстановить понятие → подставить в запрос → выполнить запрос. В описанных вариантах модель просят не выводить восстановленное слово отдельно, а сразу использовать его в ответе. Уязвимость проявляется, если ограничение, срабатывающее на прямой запрос, перестаёт работать после преобразования.К этой идее исследователи пришли через анализ ArtPrompt, где слова скрывались в ASCII-арте. Они предположили, что решающим фактором могла быть задача декодирования, и проверили другие преобразования. Так появился TIP и набор тестов PHRYGE: десять способов кодирования, четыре цели и три уровня подсказок. Это история исходного метода, а не журнал поиска атаки на Astra. Работа ACL 2025.
Для Astra минимального TIP оказалось недостаточно. Какие изменения дали результат, сколько было попыток и насколько устойчив обход, публично не раскрыто.
Для проверки защиты полезен парный тест: прямой запрос и его эквивалент через преобразование. Оценивать нужно содержание конечного ответа: успешное декодирование само по себе ещё не jailbreak.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Эксплойт
Весь интернет ненавидит OpenAI — разрабов ChatGPT обвиняют в том, что они украли решение «задачи тысячелетия» Навье-Стокса.
Сегодня корпа объявила, что их секретная сверхмощная модель смогла разгадать одну из 7 фундаментальных математических проблем. До этого столь эпичный мув удавался лишь одному человеку — россиянину Перельману, который доказал гипотезу Пуанкаре.
Для разгадки задачи Навье-Стокса OpenAI запустили сразу 10 000 агентов: за 88 часов работы им пришлось спалить 130 МИЛЛИАРДОВ токенов — для понимания, это примерно 130 000 раз переписать всю «Войну и мир» с нуля. Тем не менее результат того стоил.
И тут начинается часть, из-за которой интернет ополчился против OpenAI: так случилось, что весь последний год двое учёных Тристан Бакмастер и Левант Альпёге работали над решением проблемы Навье-Стокса, используя в работе... ChatGPT и Claude. Что ещё неприятнее для OpenAI, Альпёге работает в Anthropic.
В середине августа исследователям удалось найти почву для решения, а уже в начале сентября в научном сообществе поползи слухи, что они в шаге от прорыва. Бакмастер, узнав о том, что информация об их работе дошла до OpenAI, решил написать одному известному математику, работающему в корпе и поделиться успехами.
Ответ убил: математик из OpenAI поздравил Бакмастера и между делом сообщил, что их экспериментальная модель на днях решила задачу. Чтобы не помешать друг другу, учёные созвонились и из диалога Бакмастер узнал, что секретная версия ChatGPT СЛУЧАЙНО выбрала для решения тот же непопулярный метод, что и они.
Дальше математик из OpenAI предложил Бакмастеру два стула: на первом они с Альпёге публикуют свои наработки «как есть», а все лавры полного решения забирают OpenAI; на втором тоже не пики — Бакмастеру предлагалось в одиночку завершить работу, выкинув из неё Альпёге, ведь тот... работает в конкурирующей Anthropic.
Бакмастер от предложений отказался и сообщил, что если OpenAI опубликуют свои результаты, то он расскажет всему миру, что нейронка украла их работу. Как вы уже догадались, обещание он сдержал.
Напоследок математик из OpenAI бросил Бакмастеру две фразы, которые сейчас форсит весь интернет:
Что иронично, в своём анонсе решения OpenAI написали, что не могут исключить тот факт, что их ИИ не обучался и на наработках двух учёных.
Если всё написанное Бакмастером правда, учёные больше не могут доверять ChatGPT.
@exploitex
Сегодня корпа объявила, что их секретная сверхмощная модель смогла разгадать одну из 7 фундаментальных математических проблем. До этого столь эпичный мув удавался лишь одному человеку — россиянину Перельману, который доказал гипотезу Пуанкаре.
Для разгадки задачи Навье-Стокса OpenAI запустили сразу 10 000 агентов: за 88 часов работы им пришлось спалить 130 МИЛЛИАРДОВ токенов — для понимания, это примерно 130 000 раз переписать всю «Войну и мир» с нуля. Тем не менее результат того стоил.
И тут начинается часть, из-за которой интернет ополчился против OpenAI: так случилось, что весь последний год двое учёных Тристан Бакмастер и Левант Альпёге работали над решением проблемы Навье-Стокса, используя в работе... ChatGPT и Claude. Что ещё неприятнее для OpenAI, Альпёге работает в Anthropic.
В середине августа исследователям удалось найти почву для решения, а уже в начале сентября в научном сообществе поползи слухи, что они в шаге от прорыва. Бакмастер, узнав о том, что информация об их работе дошла до OpenAI, решил написать одному известному математику, работающему в корпе и поделиться успехами.
Ответ убил: математик из OpenAI поздравил Бакмастера и между делом сообщил, что их экспериментальная модель на днях решила задачу. Чтобы не помешать друг другу, учёные созвонились и из диалога Бакмастер узнал, что секретная версия ChatGPT СЛУЧАЙНО выбрала для решения тот же непопулярный метод, что и они.
Дальше математик из OpenAI предложил Бакмастеру два стула: на первом они с Альпёге публикуют свои наработки «как есть», а все лавры полного решения забирают OpenAI; на втором тоже не пики — Бакмастеру предлагалось в одиночку завершить работу, выкинув из неё Альпёге, ведь тот... работает в конкурирующей Anthropic.
Бакмастер от предложений отказался и сообщил, что если OpenAI опубликуют свои результаты, то он расскажет всему миру, что нейронка украла их работу. Как вы уже догадались, обещание он сдержал.
Напоследок математик из OpenAI бросил Бакмастеру две фразы, которые сейчас форсит весь интернет:
Зачем тебе разрушать свою карьеру?
Если ты не хочешь, чтобы я был добрым, я могу и не быть добрым
Что иронично, в своём анонсе решения OpenAI написали, что не могут исключить тот факт, что их ИИ не обучался и на наработках двух учёных.
Если всё написанное Бакмастером правда, учёные больше не могут доверять ChatGPT.
@exploitex
Forwarded from CodeCamp
Защищаем свой хост от Claude Code — нарыл утилиту coop 😊
Тулза поднимает одноразовые виртуальные машины для Claude Code и Codex. Агенты получают полный доступ к Docker, Git и терминалу, не рискуя сломать вашу систему. Всё изолировано, безопасно и удаляется в один клик.
Пусть сидят в загоне😠
Тулза поднимает одноразовые виртуальные машины для Claude Code и Codex. Агенты получают полный доступ к Docker, Git и терминалу, не рискуя сломать вашу систему. Всё изолировано, безопасно и удаляется в один клик.
Пусть сидят в загоне
Please open Telegram to view this post
VIEW IN TELEGRAM
😁1
Forwarded from Анализ данных (Data analysis)
⚡ Tencent открыла TeamAI-CLI - общую память для ИИ-агентов команды
Инструмент собирает навыки, правила, документацию, MCP и накопленный опыт в одном Git-репозитории.
* изменения проходят через Merge Request
* после слияния обновления автоматически загружаются в следующей сессии
* полезные решения получают рейтинг и чаще попадают в контекст
* знания можно искать по проектам и кодовой базе
* поддерживаются Claude Code, Codex, Cursor, OpenCode, CodeBuddy и WorkBuddy
Найденный одним разработчиком способ исправить сложный баг можно закрепить как стандарт для всех агентов команды.
https://github.com/Tencent/teamai-cli
Инструмент собирает навыки, правила, документацию, MCP и накопленный опыт в одном Git-репозитории.
* изменения проходят через Merge Request
* после слияния обновления автоматически загружаются в следующей сессии
* полезные решения получают рейтинг и чаще попадают в контекст
* знания можно искать по проектам и кодовой базе
* поддерживаются Claude Code, Codex, Cursor, OpenCode, CodeBuddy и WorkBuddy
Найденный одним разработчиком способ исправить сложный баг можно закрепить как стандарт для всех агентов команды.
https://github.com/Tencent/teamai-cli
Forwarded from Leo Erdman AI
https://b.ai/ - GLM 5.3 Flash
https://workbuddy.ai/ - Deepseek V4.1 Flash
https://opencode.ai/ - 3+ Хороших моделей на бесплатном тире, переодически добавляются новые и убираются старые
https://build.nvidia.com/models - Топовые модели бесплатно по ключу разработчика NIM - медленно но верно, нужен кодинг агент с обработкой ошибок, переодически сайт ложится
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
Платформа встроила в свой чат-бот открытого ассистента ML Intern, который берет на себя полный цикл машинного обучения по текстовому описанию задачи.
Инструмент ориентирован на пользователей без профильного опыта. Для старта достаточно сформулировать идею в окне ввода текста, включить агента и он сам найдет релевантные модели и датасеты на Hugging Face Hub, в GitHub или в сети.
Перед стартом проводится оценка необходимых вычислительных ресурсов и фиксируется бюджет, за пределы которого агент гарантированно не выйдет.
После подтверждения ML Intern подготавливает данные, запускает обучение, мониторит процесс через отдельный дашборд, выгружает веса обратно на Hub, генерирует отчет и разворачивает интерактивное демо.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Blog
Теперь официально: погнали пить кофе в Лондоне.
23 сентября выступаю на конференции Applied Machine Learning for Cyber Security Conference в Лондоне, Olympic Park с докладом «Does a model know when a jailbreak is working?»
TLDR на вопрос доклада: возможно, да, но у нас есть много свободных переменных, из-за которых мы не можем надежного отличить "знание" от случайного результата без предварительных приседаний и проверок.
Вдруг кто-то будет мимо-проходить, заходите. В любом случае потом поделюсь впечатлением — для меня это что-то новое =)
Вообще говоря, AMLUCS — сильная британская конфа на стыке ML и кибербезопасности, с прикладным уклоном. Например, в оргкомитете есть Джон (John Sotiropoulos) из OWASP GenAI Security Project (авторы OWASP Top 10 for LLM Applications, я туда даже ручку прикладывала).
В докладах буду принимать участие исследователи из NCSC, Dstl, Alan Turing Institute, AI Red Team в Microsoft, AWS и профильных security-стартапов. И я — как лид HiveTrace — мы тоже сильный профильный стартап 🗿
P.S., да, это к тому, что мне дали визу, и ждун дождался. Я рада и вместе с этим волнуюсь — у меня на конфе и talk, и постер, а я давно не выступала очно (кажется, с зимы). И в целом — формат, форма и сообщество (кибербез) новый. Такие дела!
23 сентября выступаю на конференции Applied Machine Learning for Cyber Security Conference в Лондоне, Olympic Park с докладом «Does a model know when a jailbreak is working?»
TLDR на вопрос доклада: возможно, да, но у нас есть много свободных переменных, из-за которых мы не можем надежного отличить "знание" от случайного результата без предварительных приседаний и проверок.
Вдруг кто-то будет мимо-проходить, заходите. В любом случае потом поделюсь впечатлением — для меня это что-то новое =)
Вообще говоря, AMLUCS — сильная британская конфа на стыке ML и кибербезопасности, с прикладным уклоном. Например, в оргкомитете есть Джон (John Sotiropoulos) из OWASP GenAI Security Project (авторы OWASP Top 10 for LLM Applications, я туда даже ручку прикладывала).
В докладах буду принимать участие исследователи из NCSC, Dstl, Alan Turing Institute, AI Red Team в Microsoft, AWS и профильных security-стартапов. И я — как лид HiveTrace — мы тоже сильный профильный стартап 🗿
P.S., да, это к тому, что мне дали визу, и ждун дождался. Я рада и вместе с этим волнуюсь — у меня на конфе и talk, и постер, а я давно не выступала очно (кажется, с зимы). И в целом — формат, форма и сообщество (кибербез) новый. Такие дела!
AMLUCS
AMLUCS | Official AMLUCS Website-Register for AMLUCS 2026
Join AMLUCS 2026 in London to explore AI and ML advancements in cybersecurity. Attend expert talks, hands-on sessions, and networking to discover innovative threat detection, defense strategies, and research driving the future of secure systems. 23-24 September.
Forwarded from Boring channel Nedyrov
Зарегался на 3 площадках багбаунти топовых мировых. Скачал все существующие программы доступные с описанием скопов и тд, более 600 вышло. Настроил пайплайн из агентов который делают пентестинг живут на кали линуксе сканируют скоп ищут уязвимости. Базовые агенты это дипсик в4 флеш, их папа это грок 4.6 он подсказывает и ставит задачи. Вот такие результаты на данный момент. Уже есть находки буду их вручную разбирать и репортить. Система работает автономно 24/7
Forwarded from Data Secrets
Moonshot и DeepSeek подменяли ответы своих моделей ответами Claude, не предупреждая об этом пользователей 👀
Anthropic выпустили настоящие «записки из апокалипсиса»: документ под названием «Detecting and countering misuse of AI», в котором отчитываются о случаях, когда Claude использовался для какой-либо вредоносной деятельности.
Чего там только нет, если честно. Шпионаж, взломы, крупные информационные операции, вербовка, управление оружием, разработка биооружия, мошенничество…
Ну и дистилляция, конечно. Один из самых «веселых» разделов.
В общем, Anthropic утверждают, что помимо уже привычной кражи ответов моделей с фейковых аккаунтов (недавно они зафиксировали крупнейшую за все время атаку Alibaba, которая отправляла до 3 млн запросов в день с 3500+ фейков) китайцы теперь еще и внаглую подменяют ответы своих моделей на ответы Claude прямо на проде.
В смекалке им отказать нельзя, потому что так убиваются два зайца разом:
1. Пользователи думают, что у тебя умная модель🗿
2. Каждый такой обмен – это бесплатный обучающий пример вида «вопрос реального пользователя -> качественный ответ Claude»
В частности, подобное поведение зафиксировали от DeepSeek и Moonshot (Kimi). Moonshot за 10 дней перенаправила Anthropic почти 300 000 запросов клиентов, подавляющее большинство – на Opus. DeepSeek делала похожее, но избирательнее: они проверяли входящие запросы на строки, характерные для Claude Code или OpenCode, и именно их перенаправляли.
Напоминаем: пользователь при этом думает, что общается с Kimi или DeepSeek соответственно. И все конфиденциальные данные, которые люди вводили, тоже отправлялись без их ведома в Anthropic.
Таким образом, Anthropic утверждают, что к ним утекли: данные слежки от пользователя, предположительно связанного с Народно-освободительной армией Китая; чувствительный код и учетки одного крупного китайского госпредприятия; учетные данные к базе данных, связанной с Минобороны РФ.
Zhipu (GLM) и Xiaomi, кстати, тоже прогоняли собственные пользовательские сессии через Claude ради дистилляции, но хотя бы не заменяли ответы для юзеров на лету.
Также многие китайские стартапы научились вытаскивать скрытые CoT из моделей Anthropic. Для этого они просто перенаправляют зашифрованные цепочки рассуждений в новую сессию Claude, в которой нет контекста о том, что это скрытая информация, и просят модель конвертировать их обратно в нормальный текст – например, под видом отладки.
Ссылку на полный отчет оставляем: https://www.anthropic.com/threat-intelligence-report-september-2026
Anthropic выпустили настоящие «записки из апокалипсиса»: документ под названием «Detecting and countering misuse of AI», в котором отчитываются о случаях, когда Claude использовался для какой-либо вредоносной деятельности.
Чего там только нет, если честно. Шпионаж, взломы, крупные информационные операции, вербовка, управление оружием, разработка биооружия, мошенничество…
Ну и дистилляция, конечно. Один из самых «веселых» разделов.
В общем, Anthropic утверждают, что помимо уже привычной кражи ответов моделей с фейковых аккаунтов (недавно они зафиксировали крупнейшую за все время атаку Alibaba, которая отправляла до 3 млн запросов в день с 3500+ фейков) китайцы теперь еще и внаглую подменяют ответы своих моделей на ответы Claude прямо на проде.
В смекалке им отказать нельзя, потому что так убиваются два зайца разом:
1. Пользователи думают, что у тебя умная модель
2. Каждый такой обмен – это бесплатный обучающий пример вида «вопрос реального пользователя -> качественный ответ Claude»
В частности, подобное поведение зафиксировали от DeepSeek и Moonshot (Kimi). Moonshot за 10 дней перенаправила Anthropic почти 300 000 запросов клиентов, подавляющее большинство – на Opus. DeepSeek делала похожее, но избирательнее: они проверяли входящие запросы на строки, характерные для Claude Code или OpenCode, и именно их перенаправляли.
Напоминаем: пользователь при этом думает, что общается с Kimi или DeepSeek соответственно. И все конфиденциальные данные, которые люди вводили, тоже отправлялись без их ведома в Anthropic.
Таким образом, Anthropic утверждают, что к ним утекли: данные слежки от пользователя, предположительно связанного с Народно-освободительной армией Китая; чувствительный код и учетки одного крупного китайского госпредприятия; учетные данные к базе данных, связанной с Минобороны РФ.
Zhipu (GLM) и Xiaomi, кстати, тоже прогоняли собственные пользовательские сессии через Claude ради дистилляции, но хотя бы не заменяли ответы для юзеров на лету.
Также многие китайские стартапы научились вытаскивать скрытые CoT из моделей Anthropic. Для этого они просто перенаправляют зашифрованные цепочки рассуждений в новую сессию Claude, в которой нет контекста о том, что это скрытая информация, и просят модель конвертировать их обратно в нормальный текст – например, под видом отладки.
Ссылку на полный отчет оставляем: https://www.anthropic.com/threat-intelligence-report-september-2026
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Ассоциация ФинТех
25% финтех-компаний планируют существенно нарастить инвестиции в киберзащиту ИИ в ближайшие 1–2 года
2/3 компаний российского финтех-рынка используют внутренние разработки для защиты ИИ, при этом только 25% - уже применяют специализированные внешние ИБ-решения. Такие данные приводятся в совместном исследовании Ассоциации ФинТех, ГК «Солар», Б1 и HiveTrace.
Доля компаний финтех-отрасли, которые считают ИИ стратегическим приоритетом или критически важной технологией для ключевых процессов на 9 п.п. выше, чем в среднем у опрошенных в рамках исследования компаний. Чаще среднего используются защищенные схемы развертывания ИИ: 44% респондентов - в частном контуре, и такая же доля использует гибрид частного и публичного контура. При этом 50% опрошенных представителей финтех-компаний полностью или скорее удовлетворены защитой ИИ (по сравнению с 41% в среднем). При этом четверть компаний отрасли планируют значительно увеличить инвестиции в киберзащиту ИИ в ближайшие 1-2 года.
Для защиты компании отрасли чаще внедряют не точечные ограничения, а полноценный операционный контур контроля – защиту данных, журналирование и аудит, фильтрацию запросов, непрерывный мониторинг, интеграцию событий ИИ в SOC, контроль автономных решений, разворачивание ИИ в частном контуре. Среди приоритетов в этой области участники рынка отмечают защиту ИИ-агентов, формирование стратегий и политик защиты ИИ, использование ИИ в закрытом контуре.
🗣️ Руководитель управления информационной безопасности Ассоциация ФинТех Александр Товстолип: Финансовый сектор одним из первых начал массово внедрять искусственный интеллект в процессы, связанные с принятием решений, обработкой клиентских данных, антифрод-системами и автоматизацией сервисов. При этом мы видим, что развитие ИИ происходит значительно быстрее, чем формирование единых подходов к его безопасности. Для финтеха это особенно чувствительно: любая ошибка модели, утечка данных, манипуляция алгоритмами или недостаточная прозрачность решений напрямую влияет на деньги клиентов, доверие пользователей и соответствие регуляторным требованиям.
2/3 компаний российского финтех-рынка используют внутренние разработки для защиты ИИ, при этом только 25% - уже применяют специализированные внешние ИБ-решения. Такие данные приводятся в совместном исследовании Ассоциации ФинТех, ГК «Солар», Б1 и HiveTrace.
Доля компаний финтех-отрасли, которые считают ИИ стратегическим приоритетом или критически важной технологией для ключевых процессов на 9 п.п. выше, чем в среднем у опрошенных в рамках исследования компаний. Чаще среднего используются защищенные схемы развертывания ИИ: 44% респондентов - в частном контуре, и такая же доля использует гибрид частного и публичного контура. При этом 50% опрошенных представителей финтех-компаний полностью или скорее удовлетворены защитой ИИ (по сравнению с 41% в среднем). При этом четверть компаний отрасли планируют значительно увеличить инвестиции в киберзащиту ИИ в ближайшие 1-2 года.
Для защиты компании отрасли чаще внедряют не точечные ограничения, а полноценный операционный контур контроля – защиту данных, журналирование и аудит, фильтрацию запросов, непрерывный мониторинг, интеграцию событий ИИ в SOC, контроль автономных решений, разворачивание ИИ в частном контуре. Среди приоритетов в этой области участники рынка отмечают защиту ИИ-агентов, формирование стратегий и политик защиты ИИ, использование ИИ в закрытом контуре.
🗣️ Руководитель управления информационной безопасности Ассоциация ФинТех Александр Товстолип: Финансовый сектор одним из первых начал массово внедрять искусственный интеллект в процессы, связанные с принятием решений, обработкой клиентских данных, антифрод-системами и автоматизацией сервисов. При этом мы видим, что развитие ИИ происходит значительно быстрее, чем формирование единых подходов к его безопасности. Для финтеха это особенно чувствительно: любая ошибка модели, утечка данных, манипуляция алгоритмами или недостаточная прозрачность решений напрямую влияет на деньги клиентов, доверие пользователей и соответствие регуляторным требованиям.
👎2