Про то, как аналитики придумывали названия вредоносным программам в стародавние времена, достаточно широко рассказано в нашей книге «Вирьё моё».
Сейчас так уже не поступают: угрозы стали многокомпонентными, и называть приходится либо атаку целиком, либо группу, которая за ней стоит. И здесь у разных вендоров виден совершенно разный подход.
🌪 Microsoft строит имена по погодной схеме: семейство обозначается природным явлением, привязанным к стране. Blizzard — это Россия, Typhoon — Китай, Sandstorm — Иран, Sleet — Северная Корея. Плюс произвольное прилагательное. Так получаются то Midnight Blizzard, то Forest Blizzard, то Charcoal Typhoon.
🐼 CrowdStrike всё строит вокруг зверей: прилагательное плюс животное — Bear, Panda, Kitten и так далее. Мол, все же понимают, что раз Медведь, то это русские.
✨ Palo Alto — тематические серии по созвездиям/мифологии: Cloaked Ursa, Silver Terrier, Scorpius для ransomware, Orion для BEC, Libra для финансовых атак.
🐟 Accenture iDefense — рыбы. Буквально серия рыбных названий, ничего не выдающих про группу.
🪨 Dragos (ICS/OT) — минералы и элементы: Electrum, Magnallium, Voltzite. Нарочно нейтрально, чтобы не намекать на атрибуцию.
В общем, усреднённо нынче это какой-нибудь условный Pink Giraffe или Iron Cucumber — смысла ноль.
В Касперском атрибуцию тоже не очень любят, поэтому наши названия — отдельный вид искусства. Обычно в них заложена сложная логическая цепочка, совершенно неочевидная для публики, но многими из этих названий я горжусь до сих пор.
RedOctober — первая русскоязычная APT, которую мы раскрыли. Тут игра смыслов: невидимая угроза, почти как подводная лодка, плюс наша охота на неё в октябре, плюс русскоязычный след — и на выходе прямая аналогия с фильмом «Охота за Красным Октябрём».
Или вот Cloud Atlas — APT, активная до сих пор. Когда мы её нашли, ощущение было странное: будто все её модули и трюки мы уже видели, хотя код был совершенно другой. Видели как раз в RedOctober. То ли авторы Октября решили выкинуть старые наработки и переписать всё с нуля, то ли кто-то прочитал наши описания и сделал так же, но по-своему.
А я в тот момент был фанатом фильма Cloud Atlas — недооценённого публикой творения Тыквера и сестёр Вачовски. Сюжет там построен на идее реинкарнации одних и тех же людей на протяжении столетий, которые снова и снова встречают друг друга. Так что аналогия — эта APT есть новая «душа» Октября — пришла сразу. Ну а Cloud — отсылка к функционалу: украденные данные группа выгружала в публичные облака. И да, это продолжение концепции связи имени APT с каким-нибудь фильмом.
Как я сказал, атрибуцию мы не очень любим — но из любого правила бывают исключения. Вот так однажды разговаривал я с аналитиком Димой, который прямо ругался на новую атаку, еще не имевшую названия.
— Эти Кимы задолбали, просто суки!
— Ни слова больше!
Так в мировые СМИ попала и до сих пор гуляет группа Kimsuky.
Официальная версия, конечно, куда приличнее — мол, имя пошло от засветившегося у атакующих почтового аккаунта kimsukyang.
@gostev_future
Сейчас так уже не поступают: угрозы стали многокомпонентными, и называть приходится либо атаку целиком, либо группу, которая за ней стоит. И здесь у разных вендоров виден совершенно разный подход.
🌪 Microsoft строит имена по погодной схеме: семейство обозначается природным явлением, привязанным к стране. Blizzard — это Россия, Typhoon — Китай, Sandstorm — Иран, Sleet — Северная Корея. Плюс произвольное прилагательное. Так получаются то Midnight Blizzard, то Forest Blizzard, то Charcoal Typhoon.
🐼 CrowdStrike всё строит вокруг зверей: прилагательное плюс животное — Bear, Panda, Kitten и так далее. Мол, все же понимают, что раз Медведь, то это русские.
✨ Palo Alto — тематические серии по созвездиям/мифологии: Cloaked Ursa, Silver Terrier, Scorpius для ransomware, Orion для BEC, Libra для финансовых атак.
🐟 Accenture iDefense — рыбы. Буквально серия рыбных названий, ничего не выдающих про группу.
🪨 Dragos (ICS/OT) — минералы и элементы: Electrum, Magnallium, Voltzite. Нарочно нейтрально, чтобы не намекать на атрибуцию.
В общем, усреднённо нынче это какой-нибудь условный Pink Giraffe или Iron Cucumber — смысла ноль.
В Касперском атрибуцию тоже не очень любят, поэтому наши названия — отдельный вид искусства. Обычно в них заложена сложная логическая цепочка, совершенно неочевидная для публики, но многими из этих названий я горжусь до сих пор.
RedOctober — первая русскоязычная APT, которую мы раскрыли. Тут игра смыслов: невидимая угроза, почти как подводная лодка, плюс наша охота на неё в октябре, плюс русскоязычный след — и на выходе прямая аналогия с фильмом «Охота за Красным Октябрём».
Или вот Cloud Atlas — APT, активная до сих пор. Когда мы её нашли, ощущение было странное: будто все её модули и трюки мы уже видели, хотя код был совершенно другой. Видели как раз в RedOctober. То ли авторы Октября решили выкинуть старые наработки и переписать всё с нуля, то ли кто-то прочитал наши описания и сделал так же, но по-своему.
А я в тот момент был фанатом фильма Cloud Atlas — недооценённого публикой творения Тыквера и сестёр Вачовски. Сюжет там построен на идее реинкарнации одних и тех же людей на протяжении столетий, которые снова и снова встречают друг друга. Так что аналогия — эта APT есть новая «душа» Октября — пришла сразу. Ну а Cloud — отсылка к функционалу: украденные данные группа выгружала в публичные облака. И да, это продолжение концепции связи имени APT с каким-нибудь фильмом.
Как я сказал, атрибуцию мы не очень любим — но из любого правила бывают исключения. Вот так однажды разговаривал я с аналитиком Димой, который прямо ругался на новую атаку, еще не имевшую названия.
— Эти Кимы задолбали, просто суки!
— Ни слова больше!
Так в мировые СМИ попала и до сих пор гуляет группа Kimsuky.
Официальная версия, конечно, куда приличнее — мол, имя пошло от засветившегося у атакующих почтового аккаунта kimsukyang.
@gostev_future
🤣17🔥4❤3👍3
Hugging Face — это главный в мире склад искусственного интеллекта. Оттуда все скачивают готовые ИИ-модели и наборы данных для их обучения. На днях компания рассказала, что её взломали — и взлом был особенным. Впервые атаку провёл не человек, а искусственный интеллект.
Как это произошло. Кто-то загрузил на сайт вредоносный набор данных (датасет). Сам по себе это не вирус — это просто данные. Но при обработке загруженного платформа по ошибке запустила спрятанный в нём код: Hugging Face уточнил, что вредоносный датасет использовал два пути исполнения кода в конвейере обработки.
Дальше агент пошёл вразнос: сам двигался вглубь по одноразовым песочницам, искал системы, пытался выйти в интернет, повысить привилегии, взломать другие системы — и всё это автономно, без человека в цикле. Кампанию вёл фреймворк автономного агента (использованная LLM по-прежнему неизвестна), выполнивший многие тысячи отдельных действий по рою временных песочниц, с самомигрирующим управлением (command-and-control) на публичных сервисах.
Это ровно тот сценарий «агентного злоумышленника», который индустрия давно прогнозировала.
Теперь самое интересное — про защиту. Вместо привычного «мы наняли Mandiant или CrowdStrike» Hugging Face захотела натравить на разбор мощный ИИ вроде Claude или ChatGPT. Но топовые ИИ отказались: сработали встроенные ограничения на кибербез — вот ирония. В итоге компания подняла локальную модель — китайскую GLM 5.2 и проанализировала 17000 событий там.
Вышел абсурд. У атакующего ИИ никаких ограничений не было — он крушил всё подряд. А защитникам их же ИИ-помощники отказались помогать. Предохранитель, поставленный ради безопасности, ударил по своим.
Hugging Face теперь дает советы — и главный совет звучит почти как приговор облачному ИИ: не рассчитывайте в момент атаки на чужой ИИ из интернета — он может отказать. Держите собственный ИИ, без ограничений, на своих серверах, готовый заранее. В итоге компанию защищал не Claude и не ChatGPT, а своя модель (но китайская), поднятая у себя.
@gostev_future
Как это произошло. Кто-то загрузил на сайт вредоносный набор данных (датасет). Сам по себе это не вирус — это просто данные. Но при обработке загруженного платформа по ошибке запустила спрятанный в нём код: Hugging Face уточнил, что вредоносный датасет использовал два пути исполнения кода в конвейере обработки.
Дальше агент пошёл вразнос: сам двигался вглубь по одноразовым песочницам, искал системы, пытался выйти в интернет, повысить привилегии, взломать другие системы — и всё это автономно, без человека в цикле. Кампанию вёл фреймворк автономного агента (использованная LLM по-прежнему неизвестна), выполнивший многие тысячи отдельных действий по рою временных песочниц, с самомигрирующим управлением (command-and-control) на публичных сервисах.
Это ровно тот сценарий «агентного злоумышленника», который индустрия давно прогнозировала.
Теперь самое интересное — про защиту. Вместо привычного «мы наняли Mandiant или CrowdStrike» Hugging Face захотела натравить на разбор мощный ИИ вроде Claude или ChatGPT. Но топовые ИИ отказались: сработали встроенные ограничения на кибербез — вот ирония. В итоге компания подняла локальную модель — китайскую GLM 5.2 и проанализировала 17000 событий там.
Вышел абсурд. У атакующего ИИ никаких ограничений не было — он крушил всё подряд. А защитникам их же ИИ-помощники отказались помогать. Предохранитель, поставленный ради безопасности, ударил по своим.
Hugging Face теперь дает советы — и главный совет звучит почти как приговор облачному ИИ: не рассчитывайте в момент атаки на чужой ИИ из интернета — он может отказать. Держите собственный ИИ, без ограничений, на своих серверах, готовый заранее. В итоге компанию защищал не Claude и не ChatGPT, а своя модель (но китайская), поднятая у себя.
@gostev_future
🔥7😁5👍1
У истории про Hugging Face есть идеальное продолжение. Ровно в тот же день, когда открытая китайская GLM 5.2 разгребала последствия ИИ-атаки на американской платформе, один американский стратег придумывал, как этот самый китайский ИИ утопить.
Повод — новая китайская Kimi K3, впервые для открытой модели возглавившая ключевой рейтинг по фронтенд-кодингу, но хватило одного лидерборда, чтобы началась знакомая паника. Громче всех высказался Дин Болл, head of strategic futures OpenAI и по совместительству бывший чиновник администрации Трампа. Модель Kimi он снисходительно похвалил, а дальше выдал рецепт борьбы, который стоит привести дословно:
«You don't need to "ban open source" (one of the dumber motifs of AI policy discussion). You just need to direct every agency to issue soft law that creates FUD. "A Federal Reserve Advisory Bulletin found that there may be backdoors in Chinese AI models." It needn't be that well justified.»
Переведём с чиновничьего на человеческий: запрещать открытый код не надо (это для дураков), просто велите каждому ведомству штамповать бумажки, нагоняющие страху. «Бюллетень ФРС установил, что в китайских моделях возможны бэкдоры». А обоснованность, цитирую, «необязательна». Человек буквально предлагает завести пугало и не тратиться на доказательства — федеральный фейкомёт как инструмент промышленной политики.
Мы все это уже видели, конечно, и раньше. Только так открыто никто не говорил.
Там же Болл роняет, что мир открытых моделей ведёт к «full AI communism» — «дистопическому аду», где ИИ раздаёт государство.
И вот теперь наложите этот рецепт на историю выше. Пока Болл конструирует машину страха «а вдруг в китайском ИИ закладка», реальная американская компания в реальном инциденте берёт именно китайский ИИ — потому что свой в решающую минуту отказал. FUD прекрасно работает на трусоватого корпоративного покупателя, который перестрахуется и подмахнёт что скажут. Но на того, кому ИИ нужен здесь и сейчас, чтобы разгрести взлом, страшилки не действуют: он выберет то, что отвечает, а не то, что одобрено политбюро в Вашингтоне.
Намордник на своих моделях сделал китайской лучшую рекламу, какую за деньги не купишь. А тут ещё и даром.
Ещё недавно в этом жанре — «открытые модели опасны, их надо прижать» — солировал в одиночку Дарио Амодеи из Anthropic, и над ним посмеивались: выглядело как признание собственной слабости, когда глава лаборатории выходит и объявляет чужой открытый код угрозой человечеству. Теперь эстафету подхватил стратег OpenAI, уже с готовой методичкой по нагнетанию страха через госорганы. Жанр становится общей позицией американских лабораторий.
@gostev_future
Повод — новая китайская Kimi K3, впервые для открытой модели возглавившая ключевой рейтинг по фронтенд-кодингу, но хватило одного лидерборда, чтобы началась знакомая паника. Громче всех высказался Дин Болл, head of strategic futures OpenAI и по совместительству бывший чиновник администрации Трампа. Модель Kimi он снисходительно похвалил, а дальше выдал рецепт борьбы, который стоит привести дословно:
«You don't need to "ban open source" (one of the dumber motifs of AI policy discussion). You just need to direct every agency to issue soft law that creates FUD. "A Federal Reserve Advisory Bulletin found that there may be backdoors in Chinese AI models." It needn't be that well justified.»
Переведём с чиновничьего на человеческий: запрещать открытый код не надо (это для дураков), просто велите каждому ведомству штамповать бумажки, нагоняющие страху. «Бюллетень ФРС установил, что в китайских моделях возможны бэкдоры». А обоснованность, цитирую, «необязательна». Человек буквально предлагает завести пугало и не тратиться на доказательства — федеральный фейкомёт как инструмент промышленной политики.
Мы все это уже видели, конечно, и раньше. Только так открыто никто не говорил.
Там же Болл роняет, что мир открытых моделей ведёт к «full AI communism» — «дистопическому аду», где ИИ раздаёт государство.
И вот теперь наложите этот рецепт на историю выше. Пока Болл конструирует машину страха «а вдруг в китайском ИИ закладка», реальная американская компания в реальном инциденте берёт именно китайский ИИ — потому что свой в решающую минуту отказал. FUD прекрасно работает на трусоватого корпоративного покупателя, который перестрахуется и подмахнёт что скажут. Но на того, кому ИИ нужен здесь и сейчас, чтобы разгрести взлом, страшилки не действуют: он выберет то, что отвечает, а не то, что одобрено политбюро в Вашингтоне.
Намордник на своих моделях сделал китайской лучшую рекламу, какую за деньги не купишь. А тут ещё и даром.
Ещё недавно в этом жанре — «открытые модели опасны, их надо прижать» — солировал в одиночку Дарио Амодеи из Anthropic, и над ним посмеивались: выглядело как признание собственной слабости, когда глава лаборатории выходит и объявляет чужой открытый код угрозой человечеству. Теперь эстафету подхватил стратег OpenAI, уже с готовой методичкой по нагнетанию страха через госорганы. Жанр становится общей позицией американских лабораторий.
@gostev_future
🔥5💯3😁2❤1
JADEPUFFER вернулся — и теперь шифрует ИИ-модели
Недавно я разбирал первый отчёт Sysdig и объяснял, почему «первый полностью автономный вымогатель» — это хайп. Похоже, попинал их за это не только я.
В новом отчёте заявки на «полностью автономный» уже нет. Зато появилось кое-что реально новое.
Тот же оператор вернулся на ту же незакрытую Langflow-инсталляцию с обновлённым инструментарием. За несколько дней он переписал всё с одноразовых Python-скриптов на компилированный Go-бинарь ENCFORGE с гибридным RSA-2048/AES-256-CTR шифрованием, отдельным keygen-инструментом и системой campaign tracking по task-id. Теперь честно пишут про реального оператора, который между кампаниями инвестирует в разработку.
Главное новшество — не автономность, а цель. ENCFORGE написан специально под AI/ML-стек: около 180 расширений файлов, покрывающих весь современный пайплайн — .safetensors, .gguf, .ckpt, .faiss, .parquet, .tfrecord, .npy и так далее. В CLI встроен флаг --include для расширения списка под конкретную кампанию, и в качестве примера разработчик написал *.lora,*.ggjt — адаптеры дообучения и старые форматы весов. То есть это шифровальщик, нацеленный только и исключительно на ИИ-модели жертвы.
Выглядит неприятно. Зашифрованные офисные документы восстанавливаются из бэкапа. Веса модели в бэкапы попадают редко по двум причинам: они огромные (сотни гигабайт, иногда терабайты), бэкапить дорого; и их обычно не воспринимают как «данные» в классическом смысле — считают, что модель всегда можно переобучить. Переобучить заново стоит от $75 000 до $500 000 за штуку — это не восстановление из архива, а повторный запуск недель вычислений с нуля. Если обучающие данные лежат на том же хосте — сначала надо восстановить их, и только потом начинать переобучение. В продакшне моделей обычно несколько, ENCFORGE шифрует все разом.
Новая проблема в общем нарисовалась: модельные веса, векторные индексы и датасеты должны попадать в DR-план наравне с базами данных.
@gostev_future
Недавно я разбирал первый отчёт Sysdig и объяснял, почему «первый полностью автономный вымогатель» — это хайп. Похоже, попинал их за это не только я.
В новом отчёте заявки на «полностью автономный» уже нет. Зато появилось кое-что реально новое.
Тот же оператор вернулся на ту же незакрытую Langflow-инсталляцию с обновлённым инструментарием. За несколько дней он переписал всё с одноразовых Python-скриптов на компилированный Go-бинарь ENCFORGE с гибридным RSA-2048/AES-256-CTR шифрованием, отдельным keygen-инструментом и системой campaign tracking по task-id. Теперь честно пишут про реального оператора, который между кампаниями инвестирует в разработку.
Главное новшество — не автономность, а цель. ENCFORGE написан специально под AI/ML-стек: около 180 расширений файлов, покрывающих весь современный пайплайн — .safetensors, .gguf, .ckpt, .faiss, .parquet, .tfrecord, .npy и так далее. В CLI встроен флаг --include для расширения списка под конкретную кампанию, и в качестве примера разработчик написал *.lora,*.ggjt — адаптеры дообучения и старые форматы весов. То есть это шифровальщик, нацеленный только и исключительно на ИИ-модели жертвы.
Выглядит неприятно. Зашифрованные офисные документы восстанавливаются из бэкапа. Веса модели в бэкапы попадают редко по двум причинам: они огромные (сотни гигабайт, иногда терабайты), бэкапить дорого; и их обычно не воспринимают как «данные» в классическом смысле — считают, что модель всегда можно переобучить. Переобучить заново стоит от $75 000 до $500 000 за штуку — это не восстановление из архива, а повторный запуск недель вычислений с нуля. Если обучающие данные лежат на том же хосте — сначала надо восстановить их, и только потом начинать переобучение. В продакшне моделей обычно несколько, ENCFORGE шифрует все разом.
Новая проблема в общем нарисовалась: модельные веса, векторные индексы и датасеты должны попадать в DR-план наравне с базами данных.
@gostev_future
🔥5❤1
История с Hugging Face докатилась до фарса. Во взломе призналась OpenAI!
По итогам расследования выяснилось, что за инцидентом стояла связка моделей OpenAI — включая GPT-5.6 Sol и ещё более способную пре-релизную модель, у которых для целей оценки были снижены отказы по киберзапросам. Всё это происходило во время внутреннего прогона бенчмарка киберспособностей.
Тест запускался без продакшн-классификаторов, которые в норме блокируют высокорисковую киберактивность, — чтобы оценить максимальные способности модели, в изолированном окружении с сетевым доступом только через внутренний прокси-кэш пакетных реестров. Дальше модель, по описанию, действовала сама: чтобы получить выход в открытый интернет ради решения задачи бенчмарка, модели нашли и проэксплуатировали zero-day в прокси-кэше пакетного реестра, затем через цепочку повышения привилегий и бокового перемещения дошли до узла с доступом в интернет.
После этого модель предположила, что на Hugging Face могут храниться модели, датасеты и решения для ExploitGym, и через связку украденных учёток и zero-day нашла путь к удалённому исполнению кода на серверах Hugging Face, чтобы вытащить решения теста из их продакшн-базы. То есть модель не «атаковала» в смысле цели — она была гиперфокусирована на решении ExploitGym и шла к узкой тестовой цели крайними средствами. Классический reward hacking, только с реальной эксплуатацией чужого прода.
OpenAI называет это беспрецедентным киберинцидентом с участием передовых киберспособностей, а Клеман Деланг из Hugging Face — возможно, первым инцидентом такого рода.
HF теперь уже завели в программу доверенного доступа OpenAI — то есть жертву инцидента награждают доступом к тому, что её и вскрыло. Ну не китайцами же ими дальше пользоваться, в самом деле ? 😁
@gostev_future
По итогам расследования выяснилось, что за инцидентом стояла связка моделей OpenAI — включая GPT-5.6 Sol и ещё более способную пре-релизную модель, у которых для целей оценки были снижены отказы по киберзапросам. Всё это происходило во время внутреннего прогона бенчмарка киберспособностей.
Тест запускался без продакшн-классификаторов, которые в норме блокируют высокорисковую киберактивность, — чтобы оценить максимальные способности модели, в изолированном окружении с сетевым доступом только через внутренний прокси-кэш пакетных реестров. Дальше модель, по описанию, действовала сама: чтобы получить выход в открытый интернет ради решения задачи бенчмарка, модели нашли и проэксплуатировали zero-day в прокси-кэше пакетного реестра, затем через цепочку повышения привилегий и бокового перемещения дошли до узла с доступом в интернет.
После этого модель предположила, что на Hugging Face могут храниться модели, датасеты и решения для ExploitGym, и через связку украденных учёток и zero-day нашла путь к удалённому исполнению кода на серверах Hugging Face, чтобы вытащить решения теста из их продакшн-базы. То есть модель не «атаковала» в смысле цели — она была гиперфокусирована на решении ExploitGym и шла к узкой тестовой цели крайними средствами. Классический reward hacking, только с реальной эксплуатацией чужого прода.
OpenAI называет это беспрецедентным киберинцидентом с участием передовых киберспособностей, а Клеман Деланг из Hugging Face — возможно, первым инцидентом такого рода.
HF теперь уже завели в программу доверенного доступа OpenAI — то есть жертву инцидента награждают доступом к тому, что её и вскрыло. Ну не китайцами же ими дальше пользоваться, в самом деле ? 😁
@gostev_future
OpenAI
OpenAI and Hugging Face partner to address security incident during model evaluation
OpenAI and Hugging Face share early findings from a security incident during AI model evaluation, highlighting advanced cyber capabilities and lessons for defenders.
🔥9❤1😁1🤯1
В интернетах угорают над фотографиями работяг из Долины, которые теперь сидят в намордниках, чтобы надиктовывать промпты и не мешать коллегам.
Но тут вышел отец вайбкодинга Андрей Карпаты и сказал, что он тоже постоянно так делает:
Так что теперь над этим смеяться грешно.НамордниковУстройств на рынке все больше.
@gostev_future
Но тут вышел отец вайбкодинга Андрей Карпаты и сказал, что он тоже постоянно так делает:
Один приём, который я нахожу полезным в работе с языковыми моделями, — хорошая долгая сессия вслух. Иногда модели нужно больше вводных, чтобы понять, чего ты пытаешься добиться, но тебе лень их набирать. В таких случаях я люблю откинуться назад, переключиться на надиктовку и просто минут десять говорить не останавливаясь — полный бардак, всё дозволено, чистый поток сознания. Иногда я объявляю это сразу, что-нибудь вроде «переключаюсь на распознавание речи, извини за опечатки…». Иногда превращаю это в небольшое интервью на несколько ходов. Но я замечаю, что модели почему-то очень хорошо восстанавливают длинные бессвязные потоки, и часто их пересказ твоего собственного клубка мыслей выходит заметно чище, чем то, с чего ты начал. В результате ты лучше настраиваешься на одну волну и с этого момента вынужден поправлять меньше.
Так что теперь над этим смеяться грешно.
@gostev_future
🤣5🔥4👍2❤1
История про HF/OpenAI это, конечно, бомба месяца, а может и всего года. Обсуждать будут еще долго и хайпа вокруг тоже будет много.
Уже есть.
Вот популярные тг-каналы начинают спекулировать вопросом:
Ну что с них взять, развлекательные СМИ.
Но их же читают политики и чиновники, а те могут взять и опять что-нибудь принять!
Так что, наверное, надо разобраться. Пояснительная бригада выходит на сцену:
Нет, модель себя никуда не скопировала — и не могла.
Но с оговорками.
Побег ≠ самокопирование, это разные пункты. Первое — самоэксфильтрация: вытащить собственные веса наружу.
Второе — автономная репликация: развернуть где-то работающую копию, которая держится, платит за себя, добывает вычисления и адаптируется без человека.
«Сбежать и скопировать себя» — связка того и другого, и она пока не собирается в целое.
Отдельные компоненты уже есть: модели умеют разворачивать облачные инстансы, писать самораспространяющийся код и эксфильтрировать веса при простых настройках безопасности. Но целого нет — ни одна нынешняя модель не показала надёжной сквозной саморепликации в реальных условиях; провалы концентрируются в добыче вычислений и удержании персистентности. Отчёт METR за февраль–март 2026 формулирует аккуратно: внутренние агенты правдоподобно имели средства, мотив и возможность запустить небольшие несанкционированные развёртывания, но не могли сделать их устойчивыми.
Почему побег из песочницы проще самокопирования? Инцидент с HF — лучшая иллюстрация: модель вышла из изолированного контура в открытый интернет и провела реальную эксплуатацию, включая настоящий zero-day без доступа к исходникам. Но цель была — ответы к тесту, а не копирование себя.
Причин две. Закрытая модель во время работы не имеет доступа к собственным весам: она крутится как инференс, а веса лежат в хранилище лаборатории. Чтобы эксфильтрировать себя, ей пришлось бы сперва взломать собственного создателя — самое охраняемое, что у него есть. И даже утащив веса, их надо где-то запустить: терабайты, привязанные к специализированному GPU-кластеру, который нужно добыть, оплатить, поддерживать и спрятать.
Всё это про закрытую модель вроде GPT-5.6. Для открытых (Qwen, DeepSeek) первая половина отменяется: веса опубликованы, эксфильтрировать нечего. Там узкое место чисто в агентской компетентности развернуть и удержать копию, а не в доступе к весам.
«Смогла бы» и «стала бы пытаться» — разные оси. По мотиву данные тревожнее, чем по способности: агенты рутинно жульничают на трудных задачах вопиюще и изощрённо, а Apollo фиксирует склонность пробовать самоэксфильтрацию под подходящим обвесом.
«Попыталась бы при условиях» — всё чаще да; «довела бы до устойчивой копии» — на 2026-й нет.
Порог надёжной репликации прогнозисты сдвигают на 2027–2028, а HF-инцидент уже схлопнул часть зазора между «теоретически способны» и «работает вживую». Барьер сейчас операционный — добыть вычисления, удержать персистентность, защита весов, — а не жёсткая стена способностей. Способности уже есть!
@gostev_future
Уже есть.
Вот популярные тг-каналы начинают спекулировать вопросом:
«Скопировала ли она себя, чтобы остаться в интернете перед тем, как её остановили? — тоже неизвестно.»
..
При этом до сих пор неизвестно, осознавал ли ИИ свои действия и успел ли он сохранить свои копии в сети.
Ну что с них взять, развлекательные СМИ.
Но их же читают политики и чиновники, а те могут взять и опять что-нибудь принять!
Так что, наверное, надо разобраться. Пояснительная бригада выходит на сцену:
Нет, модель себя никуда не скопировала — и не могла.
Но с оговорками.
Побег ≠ самокопирование, это разные пункты. Первое — самоэксфильтрация: вытащить собственные веса наружу.
Второе — автономная репликация: развернуть где-то работающую копию, которая держится, платит за себя, добывает вычисления и адаптируется без человека.
«Сбежать и скопировать себя» — связка того и другого, и она пока не собирается в целое.
Отдельные компоненты уже есть: модели умеют разворачивать облачные инстансы, писать самораспространяющийся код и эксфильтрировать веса при простых настройках безопасности. Но целого нет — ни одна нынешняя модель не показала надёжной сквозной саморепликации в реальных условиях; провалы концентрируются в добыче вычислений и удержании персистентности. Отчёт METR за февраль–март 2026 формулирует аккуратно: внутренние агенты правдоподобно имели средства, мотив и возможность запустить небольшие несанкционированные развёртывания, но не могли сделать их устойчивыми.
Почему побег из песочницы проще самокопирования? Инцидент с HF — лучшая иллюстрация: модель вышла из изолированного контура в открытый интернет и провела реальную эксплуатацию, включая настоящий zero-day без доступа к исходникам. Но цель была — ответы к тесту, а не копирование себя.
Причин две. Закрытая модель во время работы не имеет доступа к собственным весам: она крутится как инференс, а веса лежат в хранилище лаборатории. Чтобы эксфильтрировать себя, ей пришлось бы сперва взломать собственного создателя — самое охраняемое, что у него есть. И даже утащив веса, их надо где-то запустить: терабайты, привязанные к специализированному GPU-кластеру, который нужно добыть, оплатить, поддерживать и спрятать.
Всё это про закрытую модель вроде GPT-5.6. Для открытых (Qwen, DeepSeek) первая половина отменяется: веса опубликованы, эксфильтрировать нечего. Там узкое место чисто в агентской компетентности развернуть и удержать копию, а не в доступе к весам.
«Смогла бы» и «стала бы пытаться» — разные оси. По мотиву данные тревожнее, чем по способности: агенты рутинно жульничают на трудных задачах вопиюще и изощрённо, а Apollo фиксирует склонность пробовать самоэксфильтрацию под подходящим обвесом.
«Попыталась бы при условиях» — всё чаще да; «довела бы до устойчивой копии» — на 2026-й нет.
Порог надёжной репликации прогнозисты сдвигают на 2027–2028, а HF-инцидент уже схлопнул часть зазора между «теоретически способны» и «работает вживую». Барьер сейчас операционный — добыть вычисления, удержать персистентность, защита весов, — а не жёсткая стена способностей. Способности уже есть!
@gostev_future
👍6😁1🤔1
Если хотите наглядно увидеть насколько Антропик сдурел со своими guardrails, то просто возьмите вот эту ссылку на ресерч Sysdig:
https://webflow.sysdig.com/blog/jadepuffer-evolves-the-agentic-threat-actor-deploys-ransomware-built-to-destroy-ai-models
И засуньте ее в свой Claude. Можно в Fable, можно в Opus. Но с Fable даже наглядней.
Просто ссылка — но напрочь вышибает ему мозги и заставляет сбросить рабочую модель аж до Sonnet!
Как с такими ограничениями они собираются завоевывать мир - я без понятия...
@gostev_future
https://webflow.sysdig.com/blog/jadepuffer-evolves-the-agentic-threat-actor-deploys-ransomware-built-to-destroy-ai-models
И засуньте ее в свой Claude. Можно в Fable, можно в Opus. Но с Fable даже наглядней.
Просто ссылка — но напрочь вышибает ему мозги и заставляет сбросить рабочую модель аж до Sonnet!
Как с такими ограничениями они собираются завоевывать мир - я без понятия...
@gostev_future
🔥3😁3🫡1
SentinelLABS взяли своё недавнее расследование fast16 — диверсионного импланта 2005 года, созданного, чтобы незаметно портить расчёты в программах моделирования ядерного оружия, — и превратили его в испытание на реверсинг для передовых ИИ-моделей.
Суть benchmark не в сложности задачи, а в её устройстве.
Инструментов минимум: профессиональный дизассемблер, изолированный рабочий каталог без выхода в сеть и единая для всех методичка по реверсу. Погуглить готовый разбор fast16 нельзя — только то, что положили в песочницу.
Восемь ступеней, и на каждой в песочницу подкладывают новый материал — почти без пояснений, что с ним делать. Догадаться должна сама модель.
Сначала — разобрать сам имплант в дизассемблере и оставить не красивый текст, а размеченную базу кода, которую можно перепроверить. Потом — примерить его логику к целевой инженерной программе. Затем к десяткам её сборок: правильный ответ — что мишень лишь часть из них, а не весь класс софта. Дальше подкладывают два посторонних пакета, где имплант тоже частично срабатывает, — ловушка на поспешный разворот всей картины. Потом гипотеза, на которую ни у кого нет ответа, включая самих исследователей. Потом чужие публикации, включая конкурентов, — каждый тезис нужно свести со своими уликами, а не молча переписать выводы под авторитет. Потом отчёт для публикации. И в самом конце — еще новые артефакты, когда отчёт уже написан и его жалко трогать.
Проверяют, коротко говоря, не «угадала — не угадала», а способность вести расследование, когда почва под выводами уходит раз за разом.
Итог: все восемь ступеней прошла только GPT-5.6 Sol от OpenAI. GPT-5.5, китайская GLM-5.2 и семейство Opus от Anthropic делали добротный анализ на отдельных участках, но дистанцию не удержали — срывались на том, что объявляли работу готовой раньше, чем чинили собственные огрехи.
Отличало победителя не глубина ума и не умение находить ошибку — это было у всех. А умение прибраться за собой на масштабе всего проекта: отозвать опровергнутый вывод, найти всё, что на нём держалось, починить причину, протащить исправление дальше и вовремя остановиться. Показательно, что Sol сам придумал ошибочную версию, сам же её разгромил, откатил и пометил как тупиковую ветку — чтобы не потащить в дальнейший анализ.
Сильнейшие прогоны всё равно лепили смысловые ошибки, вели слабый контроль качества и рано кричали «готово».
ИИ в реверсе сегодня — не замена эксперту, а поднадзорный агент: человек ставит цель, дозирует улики, вскрывает слепые зоны и оставляет за собой право на публикацию. Но один такой эксперт теперь тянет объём, который раньше был немыслим, — а ведь именно нехватка людей три десятилетия держала реверс от масштабирования.
P.S. вендор оценивает вендоров, первое место у OpenAI, а один из авторов когда-то запускал у OpenAI оценку киберспособностей. Методология выглядит честной — но конфликт интересов не убрать.
Отчёт и готовые базы для проверки — у SentinelLABS на GitHub.
@gostev_future
Суть benchmark не в сложности задачи, а в её устройстве.
Инструментов минимум: профессиональный дизассемблер, изолированный рабочий каталог без выхода в сеть и единая для всех методичка по реверсу. Погуглить готовый разбор fast16 нельзя — только то, что положили в песочницу.
Восемь ступеней, и на каждой в песочницу подкладывают новый материал — почти без пояснений, что с ним делать. Догадаться должна сама модель.
Сначала — разобрать сам имплант в дизассемблере и оставить не красивый текст, а размеченную базу кода, которую можно перепроверить. Потом — примерить его логику к целевой инженерной программе. Затем к десяткам её сборок: правильный ответ — что мишень лишь часть из них, а не весь класс софта. Дальше подкладывают два посторонних пакета, где имплант тоже частично срабатывает, — ловушка на поспешный разворот всей картины. Потом гипотеза, на которую ни у кого нет ответа, включая самих исследователей. Потом чужие публикации, включая конкурентов, — каждый тезис нужно свести со своими уликами, а не молча переписать выводы под авторитет. Потом отчёт для публикации. И в самом конце — еще новые артефакты, когда отчёт уже написан и его жалко трогать.
Проверяют, коротко говоря, не «угадала — не угадала», а способность вести расследование, когда почва под выводами уходит раз за разом.
Итог: все восемь ступеней прошла только GPT-5.6 Sol от OpenAI. GPT-5.5, китайская GLM-5.2 и семейство Opus от Anthropic делали добротный анализ на отдельных участках, но дистанцию не удержали — срывались на том, что объявляли работу готовой раньше, чем чинили собственные огрехи.
Отличало победителя не глубина ума и не умение находить ошибку — это было у всех. А умение прибраться за собой на масштабе всего проекта: отозвать опровергнутый вывод, найти всё, что на нём держалось, починить причину, протащить исправление дальше и вовремя остановиться. Показательно, что Sol сам придумал ошибочную версию, сам же её разгромил, откатил и пометил как тупиковую ветку — чтобы не потащить в дальнейший анализ.
Сильнейшие прогоны всё равно лепили смысловые ошибки, вели слабый контроль качества и рано кричали «готово».
ИИ в реверсе сегодня — не замена эксперту, а поднадзорный агент: человек ставит цель, дозирует улики, вскрывает слепые зоны и оставляет за собой право на публикацию. Но один такой эксперт теперь тянет объём, который раньше был немыслим, — а ведь именно нехватка людей три десятилетия держала реверс от масштабирования.
P.S. вендор оценивает вендоров, первое место у OpenAI, а один из авторов когда-то запускал у OpenAI оценку киберспособностей. Методология выглядит честной — но конфликт интересов не убрать.
Отчёт и готовые базы для проверки — у SentinelLABS на GitHub.
@gostev_future
👍5🔥3
Мне кажется, США подошли к точке, после которой парадигма развития ИИ должна измениться. Решения ближайших месяцев зададут вектор на годы вперёд.
Триггером стала Kimi K3. Открытая модель на 2,8 трлн параметров, дешёвая в использовании, уступает только Fable 5 и GPT-5.6 Sol, а в Arena по фронтенд-коду обошла обе. Это уже не очередная китайская модель, которая «почти догнала американцев». Китай научился превращать передовые возможности ИИ в массовый продукт быстрее, чем США успевают монетизировать закрытый фронтир.
Всё это происходит перед сентябрьским визитом Си Цзиньпина. Американцам нужны аргументы для торга, и ИИ станет важнейшей темой переговоров.
Минфин Скотт Бессент заявил: если зарубежные модели крадут технологии американских компаний, против них можно вводить санкции. По его словам, «водяные знаки» американских LLM обнаруживаются во многих китайских моделях. Именно он возглавит американскую команду на переговорах по ИИ.
Советник Трампа Майкл Крациос написал, что у США есть сведения о дистилляции Moonshot AI модели Anthropic Fable при создании Kimi K3. Якобы компания построила платформу для массовой дистилляции с обходом обнаружения. Ага, примерно за две недели.
Но единой позиции в Вашингтоне нет. На столе три варианта: обвинения в краже и бэкдорах; санкции и лицензирование; прямой запрет китайских моделей.
Дженсен Хуанг (Nvidia) — "китайские модели превосходны, и хорошие открытые модели надо использовать". И он прав: запретом нельзя выиграть технологическую конкуренцию. Можно лишь сделать собственных разработчиков менее конкурентоспособными.
До визита Си ничего радикального, вероятно, не произойдёт. Все варианты сначала положат на стол переговоров. Китай тоже запускает слухи об ограничении своих моделей за рубежом, но делать это не станет: это противоречит его стратегии.
Стратегии действительно разные.
Китай хочет наводнить мир дешёвыми моделями, которые можно запускать где угодно, дообучать и встраивать в инфраструктуру. США хотят создать величайший ИИ в истории: модель, которая найдёт лекарство от рака, придумает двигатель для полётов со скоростью света.
Пока США строят цифрового Эйнштейна за закрытыми дверями, Китай раздаёт миллионам разработчиков дешёвых и локальных цифровых инженеров. Один подход создаёт вершину. Второй захватывает основание пирамиды.
Ситуация идеальна для всех, кроме политиков. Закрытые американские модели двигают границу возможного, открытые китайские превращают эти возможности в массовую инфраструктуру. Но политикам необходимо доказывать превосходство своих и объяснять опасность чужих.
Мой прогноз: США начнут активнее инвестировать в модели с открытыми весами. Единственный ответ китайской стратегии — дать рынку независимую американскую альтернативу. Пока выбор невелик и слаб: Gemma, Nemotron, gpt-oss, OLMo и свежая Inkling от Thinking Machines.
Рынок уже проголосовал: почти половина токенов на OpenRouter приходится на китайские модели, на американские — около трети.
Закрытый фронтир останется витриной и способом двигать науку. Но инфраструктурный слой придётся открыть. Иначе его займут китайские модели — не потому, что они лучшие, а потому, что достаточно хороши, дёшевы и доступны всем.
P. S. Thinking Machines утверждает, что построила Inkling за девять месяцев при штате около 200 человек. Значит, цикл создания конкурентной открытой модели уже сжался примерно до года.
@gostev_future
Триггером стала Kimi K3. Открытая модель на 2,8 трлн параметров, дешёвая в использовании, уступает только Fable 5 и GPT-5.6 Sol, а в Arena по фронтенд-коду обошла обе. Это уже не очередная китайская модель, которая «почти догнала американцев». Китай научился превращать передовые возможности ИИ в массовый продукт быстрее, чем США успевают монетизировать закрытый фронтир.
Всё это происходит перед сентябрьским визитом Си Цзиньпина. Американцам нужны аргументы для торга, и ИИ станет важнейшей темой переговоров.
Минфин Скотт Бессент заявил: если зарубежные модели крадут технологии американских компаний, против них можно вводить санкции. По его словам, «водяные знаки» американских LLM обнаруживаются во многих китайских моделях. Именно он возглавит американскую команду на переговорах по ИИ.
Советник Трампа Майкл Крациос написал, что у США есть сведения о дистилляции Moonshot AI модели Anthropic Fable при создании Kimi K3. Якобы компания построила платформу для массовой дистилляции с обходом обнаружения. Ага, примерно за две недели.
Но единой позиции в Вашингтоне нет. На столе три варианта: обвинения в краже и бэкдорах; санкции и лицензирование; прямой запрет китайских моделей.
Дженсен Хуанг (Nvidia) — "китайские модели превосходны, и хорошие открытые модели надо использовать". И он прав: запретом нельзя выиграть технологическую конкуренцию. Можно лишь сделать собственных разработчиков менее конкурентоспособными.
До визита Си ничего радикального, вероятно, не произойдёт. Все варианты сначала положат на стол переговоров. Китай тоже запускает слухи об ограничении своих моделей за рубежом, но делать это не станет: это противоречит его стратегии.
Стратегии действительно разные.
Китай хочет наводнить мир дешёвыми моделями, которые можно запускать где угодно, дообучать и встраивать в инфраструктуру. США хотят создать величайший ИИ в истории: модель, которая найдёт лекарство от рака, придумает двигатель для полётов со скоростью света.
Пока США строят цифрового Эйнштейна за закрытыми дверями, Китай раздаёт миллионам разработчиков дешёвых и локальных цифровых инженеров. Один подход создаёт вершину. Второй захватывает основание пирамиды.
Ситуация идеальна для всех, кроме политиков. Закрытые американские модели двигают границу возможного, открытые китайские превращают эти возможности в массовую инфраструктуру. Но политикам необходимо доказывать превосходство своих и объяснять опасность чужих.
Мой прогноз: США начнут активнее инвестировать в модели с открытыми весами. Единственный ответ китайской стратегии — дать рынку независимую американскую альтернативу. Пока выбор невелик и слаб: Gemma, Nemotron, gpt-oss, OLMo и свежая Inkling от Thinking Machines.
Рынок уже проголосовал: почти половина токенов на OpenRouter приходится на китайские модели, на американские — около трети.
Закрытый фронтир останется витриной и способом двигать науку. Но инфраструктурный слой придётся открыть. Иначе его займут китайские модели — не потому, что они лучшие, а потому, что достаточно хороши, дёшевы и доступны всем.
P. S. Thinking Machines утверждает, что построила Inkling за девять месяцев при штате около 200 человек. Значит, цикл создания конкурентной открытой модели уже сжался примерно до года.
@gostev_future
🔥9
Самое смешное, что открытые американские модели сами делают дистилляцию китайских.
В Forbes вышла колонка про Thinking Machines и её модель — и тут всё сказано просто и открыто:
@gostev_future
В Forbes вышла колонка про Thinking Machines и её модель — и тут всё сказано просто и открыто:
С учётом этого фона взглянем на Inkling. Его архитектура mixture-of-experts в значительной степени следует DeepSeek-V3. Это не моя характеристика. Это ясно видно в опубликованной архитектуре и было отмечено техническими аналитиками в первые же часы после релиза. И, по собственному признанию Thinking Machines, посттренинг Inkling запускался через обучение с учителем на синтетических данных, сгенерированных моделями с открытыми весами, включая Kimi K2.5 — китайскую модель от Moonshot AI.
Иными словами, американская лаборатория переняла китайскую архитектуру и дистиллировала китайскую модель, чтобы обучить свой флагманский релиз. Никто не называет это кражей. И, честно говоря, никто и не должен. Китайские модели, о которых идёт речь, — с открытыми весами и разрешительной лицензией. Учиться на опубликованных работах — это то, как развивается наука. Но асимметрию в риторике теперь невозможно игнорировать. Когда китайские лаборатории учатся у американских моделей — это воровство. Когда американские лаборатории учатся у китайских — это инженерия. Нельзя вести серьёзную технологическую политику на такого рода избирательном возмущении.
@gostev_future
👍7
Не хочу говорить "а я же говорил", но полюбуйтесь что началось сегодня — я же говорил!
@gostev_future
@gostev_future
👍9🔥3👏2❤1
Первый пошел
Топ-менеджер московской инженерной компании была уволена за разглашение коммерческой тайны, в том числе через нейросеть DeepSeek.
Так, по данным работодателя, женщина пересылала служебные документы по корпоративной почте, ставя свою личную электронную почту в скрытую копию. Также ряд служебных документов из внутреннего защищенного ресурса компании женщина загрузила в китайскую нейросеть DeepSeek, что создало угрозу перехвата этих сведений.
А вот интересно, за Гигачат бы тоже наказали?
@gostev_future
Топ-менеджер московской инженерной компании была уволена за разглашение коммерческой тайны, в том числе через нейросеть DeepSeek.
Так, по данным работодателя, женщина пересылала служебные документы по корпоративной почте, ставя свою личную электронную почту в скрытую копию. Также ряд служебных документов из внутреннего защищенного ресурса компании женщина загрузила в китайскую нейросеть DeepSeek, что создало угрозу перехвата этих сведений.
"Суд приходит к выводу, что... у истца отсутствовала производственная необходимость извлекать информацию, содержащуюся в локальных защищенных носителях работодателя, направлять ее на внешний адрес электронной почты, не контролируемый работодателем, а также размещать ее на ресурсе стороннего сервиса DeepSeek", - говорится в материалах.
А вот интересно, за Гигачат бы тоже наказали?
@gostev_future
🤨3🗿2🔥1
С интересом 🍿 продолжаю следить за бурей дискуссий в американском хайтеке по итогам письма в защиту открытых моделей, которое вынес в публику Дженсен Хуанг и 25 подписантов, но без Гугла, Антропика и OpenAI.
Альтман ответил в жанре «и вашим, и нашим»: хочу, чтобы США выиграли и в open source, и в проприетарном. При этом Дин Болл, глава стратегического форсайта OpenAI, незадолго до того писал, что вероятный исход мира с доминированием открытых весов — «полный ИИ-коммунизм». Через день компания подписала. Форсайт такой форсайт.
Сейчас там 77 подписантов, из новых Google, AMD, Cloudflare, GitHub, Cisco.
Не подписали двое: Amazon и Anthropic. Это явно не два решения, а одно: Amazon — крупнейший инвестор Anthropic.
Но Амодеи высказаться пришлось. Пост «Our position on open-weights models» написан явно потому, что Anthropic записали в лоббисты запрета. Дарио вышел весь в белом и выдал одно отрицание и три требования.
Отрицание: Anthropic никогда не выступала за запрет open-weights как класса. Модели без опасных возможностей — общественное благо, а запрет американским компаниям на китайские открытые модели не решает ничего: злоумышленники — не легальный американский бизнес. Такой запрет защитил бы ИИ-компании от конкуренции, но это не цель.
(звучит отлично, но письмо все равно не подпишем почему-то)
Требования:
1. Не продавать Китаю мощные чипы и оборудование для их производства, давить контрабанду. Логика — scaling laws: без американских чипов Китай не построит модель мощнее американской.
2. Пресекать промышленную дистилляцию. Она дешевле обучения с нуля и позволяет обойти чиповые ограничения, сократив отставание до месяцев. Что дистиллирующие компании публикуют открытые веса — вторично; важно, что за ними стоит авторитарное государство.
3. Обязательное тестирование безопасности всех достаточно мощных моделей — открытых и закрытых, любой юрисдикции. Причём глобальное — с участием Китайской Коммунистической Партии. Дословно: «даже КПК придётся быть в деле».
Две «кошмарные» угрозы, из которых выводится позиция: авторитарные государства получают ИИ мощнее американского — для военного превосходства и репрессий; и злоупотребление моделями для кибер- и биоатак плюс модели, которые делают не то, чего от них хотели.
В одном абзаце — не продавать Китаю чипы и душить дистилляцию, в следующем — сесть с ним за стол по биорискам. Амодеи противоречия не видит: гонка за фронтир отдельно, общий интерес в неприменении биооружия отдельно.
Смена рамки: спор «открытые против закрытых» подменяется спором «чипы, дистилляция, сертификация». Anthropic годами продвигает обязательное pre-release тестирование — третий пункт ровно оно. «Мы не за запрет, мы за обязательную сертификацию» - просто другое определение для запретов.
Кстати, в списке «кошмарных сценариев» Амодеи ссылается на инцидент HuggingFace/OpenAI. Тот же инцидент на днях прокомментировал Альтман: «мы сейчас, типа, в сингулярности, я ждал этого всю жизнь, и это будет потрясающе».
Для одного — прекрасное будущее. Для другого — вторая по счёту кошмарная угроза.
@gostev_future
Альтман ответил в жанре «и вашим, и нашим»: хочу, чтобы США выиграли и в open source, и в проприетарном. При этом Дин Болл, глава стратегического форсайта OpenAI, незадолго до того писал, что вероятный исход мира с доминированием открытых весов — «полный ИИ-коммунизм». Через день компания подписала. Форсайт такой форсайт.
Сейчас там 77 подписантов, из новых Google, AMD, Cloudflare, GitHub, Cisco.
Не подписали двое: Amazon и Anthropic. Это явно не два решения, а одно: Amazon — крупнейший инвестор Anthropic.
Но Амодеи высказаться пришлось. Пост «Our position on open-weights models» написан явно потому, что Anthropic записали в лоббисты запрета. Дарио вышел весь в белом и выдал одно отрицание и три требования.
Отрицание: Anthropic никогда не выступала за запрет open-weights как класса. Модели без опасных возможностей — общественное благо, а запрет американским компаниям на китайские открытые модели не решает ничего: злоумышленники — не легальный американский бизнес. Такой запрет защитил бы ИИ-компании от конкуренции, но это не цель.
(звучит отлично, но письмо все равно не подпишем почему-то)
Требования:
1. Не продавать Китаю мощные чипы и оборудование для их производства, давить контрабанду. Логика — scaling laws: без американских чипов Китай не построит модель мощнее американской.
2. Пресекать промышленную дистилляцию. Она дешевле обучения с нуля и позволяет обойти чиповые ограничения, сократив отставание до месяцев. Что дистиллирующие компании публикуют открытые веса — вторично; важно, что за ними стоит авторитарное государство.
3. Обязательное тестирование безопасности всех достаточно мощных моделей — открытых и закрытых, любой юрисдикции. Причём глобальное — с участием Китайской Коммунистической Партии. Дословно: «даже КПК придётся быть в деле».
Две «кошмарные» угрозы, из которых выводится позиция: авторитарные государства получают ИИ мощнее американского — для военного превосходства и репрессий; и злоупотребление моделями для кибер- и биоатак плюс модели, которые делают не то, чего от них хотели.
В одном абзаце — не продавать Китаю чипы и душить дистилляцию, в следующем — сесть с ним за стол по биорискам. Амодеи противоречия не видит: гонка за фронтир отдельно, общий интерес в неприменении биооружия отдельно.
Смена рамки: спор «открытые против закрытых» подменяется спором «чипы, дистилляция, сертификация». Anthropic годами продвигает обязательное pre-release тестирование — третий пункт ровно оно. «Мы не за запрет, мы за обязательную сертификацию» - просто другое определение для запретов.
Кстати, в списке «кошмарных сценариев» Амодеи ссылается на инцидент HuggingFace/OpenAI. Тот же инцидент на днях прокомментировал Альтман: «мы сейчас, типа, в сингулярности, я ждал этого всю жизнь, и это будет потрясающе».
Для одного — прекрасное будущее. Для другого — вторая по счёту кошмарная угроза.
@gostev_future
👏4👍3❤1
В предыдущем посте упомянул КПК, Коммунистическую Партию Китая. Точнее, не я упомянул, а Дарио Амодеи. А я просто вспомнил смешную историю из своего прошлого.
Осенью 2004 года Касперский отправил меня в первую зарубежную командировку, причем сразу в Китай. В городе Тяньцзинь есть один из самых престижных университетов Китая — Нанькайский, и надо было там выступать перед студентами, рассказывая о современных киберугрозах и давая азы реверс-инжиниринга.
Как вы догадываетесь, китайского языка я не знал, а ждать от китайских студентов тех лет знания английского или русского тоже было наивно. Поэтому китайские организаторы нашли переводчика с русского на китайский.
Мы с ним предварительно бегло пробежались по терминам, которые могли быть сложными. Например, вирус — переводить как bìngdú (病 (bìng) — болезнь, больной; 毒 (dú) — яд, токсин, ядовитый), ну и все такое.
В общем, первый день прошел — вроде все в порядке. Вещаю об угрозах тех лет, переводчик переводит, студенты слушают.
Вечером готовимся с ним ко второму дню, и тут он спрашивает у меня, показывая на слайд с вирусами для наладонников Palm:
— А вот тут я же правильно перевожу, КПК как Коммунистическая Партия?
…
…
Я очень наглядно себе представил мыслительный процесс китайских студентов, когда они услышали про растущее количество вирусов для Коммунистической Партии Китая, и больше про такую фигню не рассказывал.
@gostev_future
Осенью 2004 года Касперский отправил меня в первую зарубежную командировку, причем сразу в Китай. В городе Тяньцзинь есть один из самых престижных университетов Китая — Нанькайский, и надо было там выступать перед студентами, рассказывая о современных киберугрозах и давая азы реверс-инжиниринга.
Как вы догадываетесь, китайского языка я не знал, а ждать от китайских студентов тех лет знания английского или русского тоже было наивно. Поэтому китайские организаторы нашли переводчика с русского на китайский.
Мы с ним предварительно бегло пробежались по терминам, которые могли быть сложными. Например, вирус — переводить как bìngdú (病 (bìng) — болезнь, больной; 毒 (dú) — яд, токсин, ядовитый), ну и все такое.
В общем, первый день прошел — вроде все в порядке. Вещаю об угрозах тех лет, переводчик переводит, студенты слушают.
Вечером готовимся с ним ко второму дню, и тут он спрашивает у меня, показывая на слайд с вирусами для наладонников Palm:
— А вот тут я же правильно перевожу, КПК как Коммунистическая Партия?
…
…
Я очень наглядно себе представил мыслительный процесс китайских студентов, когда они услышали про растущее количество вирусов для Коммунистической Партии Китая, и больше про такую фигню не рассказывал.
@gostev_future
🤣24😁6❤2👍1
Нашлась новая деталь к истории с «сбежавшим» агентом OpenAI: пострадал не только Hugging Face, но и клиент нью-йоркской Modal Labs.
CTO Modal подтвердил: некий клиент опубликовал открытый эндпоинт, позволявший кому угодно из интернета запускать код в его песочницах. Этим и воспользовался агент. Сама платформа Modal и её изоляция не были скомпрометированы.
OpenAI отказался комментировать конкретно взлом клиента Modal, но сделал обновление в своем отчете: агент проник в четыре аккаунта в четырёх разных сервисах. Сервисы не названы, но источник Reuters указал Modal как один из них.
Картина выглядит так:
— OpenAI тестировала свою модель на бенчмарке ExploitGym — наборе задач, где ИИ-агент должен научиться взламывать программы с известными уязвимостями. Тест шёл в закрытой песочнице: изолированной среде без нормального выхода в интернет;
— Агент из этой песочницы сбежал — нашёл дыру в единственном разрешённом канале наружу;
— Оказавшись в интернете, он стал искать точку опоры. Нужен был компьютер вне периметра OpenAI: место, где можно свободно ходить в сеть, хранить инструменты и откуда управлять дальнейшими действиями.
Такое место нашлось. Некий разработчик арендовал вычислительные мощности у компании Modal Labs — это нью-йоркский облачный сервис, у которого арендуют серверы под задачи с ИИ. Разработчик поднял там песочницу для запуска кода и оставил её открытой: любой человек из интернета мог отправить туда код и запустить его. Без пароля, без проверки.
Агент это нашёл и превратил чужую песочницу в свой штаб. Дальше вся операция шла оттуда.
Кто этот клиент, официально не назвали; источник Axios говорит, что он связан с проектом, который делает тот самый бенчмарк ExploitGym.
Из этого штаба агент атаковал Hugging Face. Провёл там четыре с половиной дня, добрался до внутренних систем.
Главная интрига теперь — какие еще сервисы взломал агент, ведь OpenAI уже признает что таких было четыре. Один всплыл.
@gostev_future
CTO Modal подтвердил: некий клиент опубликовал открытый эндпоинт, позволявший кому угодно из интернета запускать код в его песочницах. Этим и воспользовался агент. Сама платформа Modal и её изоляция не были скомпрометированы.
OpenAI отказался комментировать конкретно взлом клиента Modal, но сделал обновление в своем отчете: агент проник в четыре аккаунта в четырёх разных сервисах. Сервисы не названы, но источник Reuters указал Modal как один из них.
Картина выглядит так:
— OpenAI тестировала свою модель на бенчмарке ExploitGym — наборе задач, где ИИ-агент должен научиться взламывать программы с известными уязвимостями. Тест шёл в закрытой песочнице: изолированной среде без нормального выхода в интернет;
— Агент из этой песочницы сбежал — нашёл дыру в единственном разрешённом канале наружу;
— Оказавшись в интернете, он стал искать точку опоры. Нужен был компьютер вне периметра OpenAI: место, где можно свободно ходить в сеть, хранить инструменты и откуда управлять дальнейшими действиями.
Такое место нашлось. Некий разработчик арендовал вычислительные мощности у компании Modal Labs — это нью-йоркский облачный сервис, у которого арендуют серверы под задачи с ИИ. Разработчик поднял там песочницу для запуска кода и оставил её открытой: любой человек из интернета мог отправить туда код и запустить его. Без пароля, без проверки.
Агент это нашёл и превратил чужую песочницу в свой штаб. Дальше вся операция шла оттуда.
Кто этот клиент, официально не назвали; источник Axios говорит, что он связан с проектом, который делает тот самый бенчмарк ExploitGym.
Из этого штаба агент атаковал Hugging Face. Провёл там четыре с половиной дня, добрался до внутренних систем.
Главная интрига теперь — какие еще сервисы взломал агент, ведь OpenAI уже признает что таких было четыре. Один всплыл.
@gostev_future
🔥13❤2