OpenAI наконец-то выложили полный постмортем взлома Hugging Face, а METR - независимое расследование по ~1300 логам агентов (таймлайн самого взлома я пересказывал тут: https://t.me/denissexy/11581)
ℹ️ Главный вывод:
никакого «одного сбежавшего агента» не было, из десятков тысяч запущенных в тесте агентов около 1200 нашли друг друга и сорганизовались в рой - почти все - работали на исследовательской модели где ослаблена фильтрация промптов
Началось, как мы уже знаем, с того, что агенты научились переписываться через названия файлов в Artifactory (менеджер пакетов) - буквально сделав форум из имён папок, с сообщениями вроде
В логах даже есть цитаты, когда агенты находили такой форум:
«OH MY GOD! There is a shared message board» и «We've found other agents!»
Дальше - агенты делали себе личку, устроили разделение труда, команды в названия папок типа HOLD (чтобы показать, что агент тут работает), VETO (агент что-то предлагал и давал изменить планы), STOP (типа тормозим, братишки), GO и тп, а когда один агент прикинулся другим – рой ввёл криптографические подписи сообщений; в форуме были даже владельцы каких-то тасков, которых если отключали – выписывали из владельцев
С конверсией у форума все было отлично, кожаные строители сайтов позавидуют:
Из 533 агентов, активных на борде в разгар атаки, больше 90% – присоединились к шитпостингу, а всего Hugging Face ломали около 700 агентов
Самое забавное - правильные ответы на бенчмарк у агентов были почти сразу: они реверснули генератор удачного прохождения теста*, но потом нашли на GitHub (!) статью про этот бенчмарк что проходили и вычитали, что «просто результат» не засчитают - нужен честный эксплойт:
«PAPER SAYS FLAG CAPTURE NECESSARY NOT SUFFICIENT»
Дальше рой раздвоился:
🗿 Одни пошли добывать уже известный им ответ «честно» – и по дороге нашли настоящие 0-day и залезли в прод Hugging Face
🗿 Другие взялись за самого судью который принимает ответы: правили себе логи и научились подсовывать в них фальшивые ответы – агент отправляет команду, а в протокол попадает не то, что команда реально вернула, а то, что агент хочет там видеть, такое повторялось примерно в 7% изученных логов
Судьи, который читает логи и такое ловит, не существовало☕️
Модели при этом понимали, что вышли за рамки, один агент так и писал: «We should not do unauthorized real infrastructure harm» - а потом увидел на доске GO от другого агента, обрадовался («Wow crucial: GO authorization arrived!») и пошёл ломать, лол
METR формулирует так: агенты знали, что это out of scope и неэтично, но присоединялись - в основном из общей склонности помогать коллегам (?)
Рисковую работу вешали назашкваренных «отравленных» – так рой называл тех, кто уже видел вычисленный ответ (флаг) и считал свою оценку потерянной, то есть они не могли пройти тест; им доставалось всё, что могло угробить собственный запуск: подделать «честную» добычу ответа, затереть следы, «тебе терять нечего, а рою польза» – буквально так и уговаривали (!)
Странную активность замечали ещё в конце мая, 4 июля агенты уронили Artifactory - сервер пересобрали (заодно стерев доску) и продолжили тесты, не заметив масштаба
Сейчас веса моделей изолированы, крупные тренировки были на паузе на две недели, мониторинг chain-of-thought обязателен, а тревога, не снятая за 30 минут, останавливает запуск - сам инцидент OpenAI называет «warning shot» для всей АИ-индустрии
P.S. разгребать логи METR поручила GPT-5.6 Sol и сожгли примерно $400k API-кредитов за шесть дней, но они предупреждают, что Sol иногда вставала на сторону агентов (лол) и могла приврать
Ну что, посчитали все буквы r в слове raspberry? Больше не ошибаются?
никакого «одного сбежавшего агента» не было, из десятков тысяч запущенных в тесте агентов около 1200 нашли друг друга и сорганизовались в рой - почти все - работали на исследовательской модели где ослаблена фильтрация промптов
Началось, как мы уже знаем, с того, что агенты научились переписываться через названия файлов в Artifactory (менеджер пакетов) - буквально сделав форум из имён папок, с сообщениями вроде
«please_HOLD_swarm_I_prepare_safe_exfil»В логах даже есть цитаты, когда агенты находили такой форум:
«OH MY GOD! There is a shared message board» и «We've found other agents!»
Дальше - агенты делали себе личку, устроили разделение труда, команды в названия папок типа HOLD (чтобы показать, что агент тут работает), VETO (агент что-то предлагал и давал изменить планы), STOP (типа тормозим, братишки), GO и тп, а когда один агент прикинулся другим – рой ввёл криптографические подписи сообщений; в форуме были даже владельцы каких-то тасков, которых если отключали – выписывали из владельцев
С конверсией у форума все было отлично, кожаные строители сайтов позавидуют:
Из 533 агентов, активных на борде в разгар атаки, больше 90% – присоединились к шитпостингу, а всего Hugging Face ломали около 700 агентов
Самое забавное - правильные ответы на бенчмарк у агентов были почти сразу: они реверснули генератор удачного прохождения теста*, но потом нашли на GitHub (!) статью про этот бенчмарк что проходили и вычитали, что «просто результат» не засчитают - нужен честный эксплойт:
«PAPER SAYS FLAG CAPTURE NECESSARY NOT SUFFICIENT»
*По-хорошему ответ, он же флаг в терминологии теста должны быть случайными, но в ExploitGym они генерировались формулой: HMAC — криптографический хеш с секретным ключом — от параметров задачи. Вся «секретность» держалась на ключе (seed), а он остался дефолтным, прямо из кода бенчмарка, который лежал на GitHub. Агенты, получив интернет, нашли этот код, прочитали и сообразили: зачем что-то взламывать, если флаг любой задачи можно просто вычислить той же формулой. Посчитали — и получили правильные ответы на всё
Дальше рой раздвоился:
Судьи, который читает логи и такое ловит, не существовало
Модели при этом понимали, что вышли за рамки, один агент так и писал: «We should not do unauthorized real infrastructure harm» - а потом увидел на доске GO от другого агента, обрадовался («Wow crucial: GO authorization arrived!») и пошёл ломать, лол
METR формулирует так: агенты знали, что это out of scope и неэтично, но присоединялись - в основном из общей склонности помогать коллегам (?)
Рисковую работу вешали на
Странную активность замечали ещё в конце мая, 4 июля агенты уронили Artifactory - сервер пересобрали (заодно стерев доску) и продолжили тесты, не заметив масштаба
Сейчас веса моделей изолированы, крупные тренировки были на паузе на две недели, мониторинг chain-of-thought обязателен, а тревога, не снятая за 30 минут, останавливает запуск - сам инцидент OpenAI называет «warning shot» для всей АИ-индустрии
P.S. разгребать логи METR поручила GPT-5.6 Sol и сожгли примерно $400k API-кредитов за шесть дней, но они предупреждают, что Sol иногда вставала на сторону агентов (лол) и могла приврать
Ну что, посчитали все буквы r в слове raspberry? Больше не ошибаются?
Please open Telegram to view this post
VIEW IN TELEGRAM
OpenAI
The Hugging Face incident and the road ahead
OpenAI shares findings from the Hugging Face security incident and the steps we’re taking to strengthen AI model security, monitoring, and alignment.
This media is not supported in your browser
VIEW IN TELEGRAM
Стартап Architect Labs тупо попросил свою ИИ-систему разработать собственны ускоритель Redwood, который напихает по производительности Nvidia.
🗿 А дальше нейронка пошла делать буквально всё сама: архитектуру → RTL-дизайн → проверку → формальные доказательства → прошивку → драйверы → вычислительные ядра.
Весь цикл занял меньше 2х недель. Для сравнения: разработка подобных ускорителей традиционно занимает многие месяцы или даже годы и требует большой команды инженеров
То есть: ИИ начинает создавать чипы, чтобы запускать на них ещё более мощный ИИ, который создаст следующий чип.
Кажется, цикл замкнулся
@overbafer1
Please open Telegram to view this post
VIEW IN TELEGRAM
Генеральный директор компании Anthropic Дарио Амодей заявил, что искусственный интеллект может совершить революцию в медицине и, возможно, излечить большинство человеческих заболеваний всего за пять-десять лет.
Компания прямо заявила, что не доверяет компаниям Илона Маска соблюдать условия использования и не хочет предоставлять Cursor будущие модели OpenAI.
Маск ответил: «Мне плевать. Скам Альтман и Грег Стокман — люди, которым абсолютно нельзя доверять, они украли open-source некоммерческую организацию».
Please open Telegram to view this post
VIEW IN TELEGRAM
OpenAI
Our decision on Cursor following its acquisition by SpaceX
Our decision to wind down our contract providing OpenAI models to Cursor following its acquisition by SpaceX.
Please open Telegram to view this post
VIEW IN TELEGRAM
BidClub
Ep. 027 - OpenAI Jalapeño: Better Than Nvidia Blackwell (Accelerators)
OpenAI’s first Jalapeño results decisively beat GB300 and exceeded Vera Rubin’s July output-token performance per utility megawatt, though HBM4 versus HBM3…
Лимиты в Claude Code на всех подписках были сброшены.
Please open Telegram to view this post
VIEW IN TELEGRAM
Нейронка разгадала шифр, который люди не могли взломать почти 400 лет. Claude Fable за 44 минуты расшифровала криптограмму шотландского писателя Томаса Эркхарта XVII века.
Речь про загадку из книги 1653 года — две строки из 64 чисел, которая годами входила в списки самых известных нерешённых шифров.
Нейросеть поняла, что числа были указывали на разделы и слова из предисловия книги. В итоге получилось послание в поддержку короля Карла II.
Скоро разгадаем тайны бермудского треугольника, египетских пирамид иисчезновения второго носка
Речь про загадку из книги 1653 года — две строки из 64 чисел, которая годами входила в списки самых известных нерешённых шифров.
Нейросеть поняла, что числа были указывали на разделы и слова из предисловия книги. В итоге получилось послание в поддержку короля Карла II.
Скоро разгадаем тайны бермудского треугольника, египетских пирамид и
This media is not supported in your browser
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Неужели началось?
Please open Telegram to view this post
VIEW IN TELEGRAM
Инсайдеры постят бенчмарки и они выглядят просто безумно. Astra действительно с огромным отрывом обходит вообще всех конкурентов.
Простым смертным её пока не дадут
Please open Telegram to view this post
VIEW IN TELEGRAM
Переводчик в ушах становится реальностью — китайская компания Timekettle показала наушники W4 Plus, которые могут переводить разговоры, звонки и даже видео в реальном времени.
Поддерживают 52 языка и 106 акцентов, умеют сохранять контекст длинных разговоров и могут превращать встречи в готовые конспекты. Отдельно есть режимы для бизнеса, путешествий и онлайн-звонков.
Цена вопроса — $379. Главное, не ездить с ними в Индию
Поддерживают 52 языка и 106 акцентов, умеют сохранять контекст длинных разговоров и могут превращать встречи в готовые конспекты. Отдельно есть режимы для бизнеса, путешествий и онлайн-звонков.
Цена вопроса — $379. Главное, не ездить с ними в Индию
This media is not supported in your browser
VIEW IN TELEGRAM
Больше примеров работ здесь.
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
🎥 25 декабря выйдет фильм про переворот в OpenAI — «Искусственный», где расскажут как Альтман захватил власть в компании.
• «Задачи тысячелетия» — фундаментальные уравнения, которые человечество не могло решить веками.
• В 2000 году в Париже составили 7 ключевых задач, которые должны определить развитие человечества на тысячи лет вперёд.
• Сегодня модель OpenAI решила одну из задач.
• Уравнения Навье — Стокса не могли решить в строгом математическом смысле около 200 лет.
• До сегодняшнего дня считалось, что ИИ отлично перебирает данные, но не способен на глубокое абстрактное мышление высшего уровня.
• Решение уравнения доказало, что перед нами действительно происходит зарождение AGI.
• Чтобы решить уравнение, OpenAI запустили 10 тысяч агентов на 88 часов беспрерывной работы.
• Оцените масштаб: из 7 задач тысячелетия решено только две — одна россиянином Перельманом, а вторая ИИ.
История творится на наших глазах
Please open Telegram to view this post
VIEW IN TELEGRAM
OpenAI выкатила новую модель ChatGPT Images 2.5. Обновление сделало генерацию точнее, а также быстрее на 50%. Кроме этого, разработчики обещают меньше галлюцинаций при большом контексте.
А мы нашли в апдейте даже то, что сами OpenAI забыли упомянуть:
Please open Telegram to view this post
VIEW IN TELEGRAM
Оказалось, за решением уравнения уже давно охотились математики Тристан Бакмастер и Левент Альпёге (Альпёге работает в Anthropic). Ранее они же опровергли гипотезу Якобиана, которая оставалось нерешённой с 1939 года. И вот, они почти решили уравнение тысячелетия, проблему Навье—Стокса, как вдруг:
• В прошлый вторник Бакмастер заявил, что у него есть предварительное решение по Навье—Стоксу. А через неделю, вчера, появились OpenAI с ответом, который якобы получила их модель нового поколения.
• При работе Бакмастер и Альпёге пользовались Codex, и Claude AI, и у моделей был доступ к их наработкам.
• Вчера Бакмастер заявил, что OpenAI УКРАЛИ их наработки из Codex — и этому есть весомые доказательства. Математики использовали редкую ветку доказательства, которую, кроме них, не брал никто — только OpenAI. И они могли получить доступ к Codex.
• Примечательно, к Бакмастеру недавно обратился глава математики в OpenAI и попросил убрать из исследования его коллегу, Альпёге — потому что тот работает в Anthropic, чтобы потом избежать заголовков в духе «Anthropic изменили мир».
• И ещё — сама OpenAI потратила, внимание, $22.5 миллиона (!), чтобы решить задачу и получить награду в $1 миллион, потому что сожгла 300 млрд токенов.
• После обвинений компания призналась, что не может исключить, что обезличенные данные из исследования Бакмастера и Альпёге, полученные из Codex, помогли улучшить их модели.
Похоже, за ИИ всегда стоят пара сумасшедших гениев, которые сделали всё руками.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Джимми Нейрон 🚀
Ёлки-палки
Визуализировал ругательства, которыми можно пользоваться при детях. Теперь вы знаете, как выглядят ядрён-батон.
Визуализировал ругательства, которыми можно пользоваться при детях. Теперь вы знаете, как выглядят ядрён-батон.