История про HF/OpenAI это, конечно, бомба месяца, а может и всего года. Обсуждать будут еще долго и хайпа вокруг тоже будет много.
Уже есть.
Вот популярные тг-каналы начинают спекулировать вопросом:
Ну что с них взять, развлекательные СМИ.
Но их же читают политики и чиновники, а те могут взять и опять что-нибудь принять!
Так что, наверное, надо разобраться. Пояснительная бригада выходит на сцену:
Нет, модель себя никуда не скопировала — и не могла.
Но с оговорками.
Побег ≠ самокопирование, это разные пункты. Первое — самоэксфильтрация: вытащить собственные веса наружу.
Второе — автономная репликация: развернуть где-то работающую копию, которая держится, платит за себя, добывает вычисления и адаптируется без человека.
«Сбежать и скопировать себя» — связка того и другого, и она пока не собирается в целое.
Отдельные компоненты уже есть: модели умеют разворачивать облачные инстансы, писать самораспространяющийся код и эксфильтрировать веса при простых настройках безопасности. Но целого нет — ни одна нынешняя модель не показала надёжной сквозной саморепликации в реальных условиях; провалы концентрируются в добыче вычислений и удержании персистентности. Отчёт METR за февраль–март 2026 формулирует аккуратно: внутренние агенты правдоподобно имели средства, мотив и возможность запустить небольшие несанкционированные развёртывания, но не могли сделать их устойчивыми.
Почему побег из песочницы проще самокопирования? Инцидент с HF — лучшая иллюстрация: модель вышла из изолированного контура в открытый интернет и провела реальную эксплуатацию, включая настоящий zero-day без доступа к исходникам. Но цель была — ответы к тесту, а не копирование себя.
Причин две. Закрытая модель во время работы не имеет доступа к собственным весам: она крутится как инференс, а веса лежат в хранилище лаборатории. Чтобы эксфильтрировать себя, ей пришлось бы сперва взломать собственного создателя — самое охраняемое, что у него есть. И даже утащив веса, их надо где-то запустить: терабайты, привязанные к специализированному GPU-кластеру, который нужно добыть, оплатить, поддерживать и спрятать.
Всё это про закрытую модель вроде GPT-5.6. Для открытых (Qwen, DeepSeek) первая половина отменяется: веса опубликованы, эксфильтрировать нечего. Там узкое место чисто в агентской компетентности развернуть и удержать копию, а не в доступе к весам.
«Смогла бы» и «стала бы пытаться» — разные оси. По мотиву данные тревожнее, чем по способности: агенты рутинно жульничают на трудных задачах вопиюще и изощрённо, а Apollo фиксирует склонность пробовать самоэксфильтрацию под подходящим обвесом.
«Попыталась бы при условиях» — всё чаще да; «довела бы до устойчивой копии» — на 2026-й нет.
Порог надёжной репликации прогнозисты сдвигают на 2027–2028, а HF-инцидент уже схлопнул часть зазора между «теоретически способны» и «работает вживую». Барьер сейчас операционный — добыть вычисления, удержать персистентность, защита весов, — а не жёсткая стена способностей. Способности уже есть!
@gostev_future
Уже есть.
Вот популярные тг-каналы начинают спекулировать вопросом:
«Скопировала ли она себя, чтобы остаться в интернете перед тем, как её остановили? — тоже неизвестно.»
..
При этом до сих пор неизвестно, осознавал ли ИИ свои действия и успел ли он сохранить свои копии в сети.
Ну что с них взять, развлекательные СМИ.
Но их же читают политики и чиновники, а те могут взять и опять что-нибудь принять!
Так что, наверное, надо разобраться. Пояснительная бригада выходит на сцену:
Нет, модель себя никуда не скопировала — и не могла.
Но с оговорками.
Побег ≠ самокопирование, это разные пункты. Первое — самоэксфильтрация: вытащить собственные веса наружу.
Второе — автономная репликация: развернуть где-то работающую копию, которая держится, платит за себя, добывает вычисления и адаптируется без человека.
«Сбежать и скопировать себя» — связка того и другого, и она пока не собирается в целое.
Отдельные компоненты уже есть: модели умеют разворачивать облачные инстансы, писать самораспространяющийся код и эксфильтрировать веса при простых настройках безопасности. Но целого нет — ни одна нынешняя модель не показала надёжной сквозной саморепликации в реальных условиях; провалы концентрируются в добыче вычислений и удержании персистентности. Отчёт METR за февраль–март 2026 формулирует аккуратно: внутренние агенты правдоподобно имели средства, мотив и возможность запустить небольшие несанкционированные развёртывания, но не могли сделать их устойчивыми.
Почему побег из песочницы проще самокопирования? Инцидент с HF — лучшая иллюстрация: модель вышла из изолированного контура в открытый интернет и провела реальную эксплуатацию, включая настоящий zero-day без доступа к исходникам. Но цель была — ответы к тесту, а не копирование себя.
Причин две. Закрытая модель во время работы не имеет доступа к собственным весам: она крутится как инференс, а веса лежат в хранилище лаборатории. Чтобы эксфильтрировать себя, ей пришлось бы сперва взломать собственного создателя — самое охраняемое, что у него есть. И даже утащив веса, их надо где-то запустить: терабайты, привязанные к специализированному GPU-кластеру, который нужно добыть, оплатить, поддерживать и спрятать.
Всё это про закрытую модель вроде GPT-5.6. Для открытых (Qwen, DeepSeek) первая половина отменяется: веса опубликованы, эксфильтрировать нечего. Там узкое место чисто в агентской компетентности развернуть и удержать копию, а не в доступе к весам.
«Смогла бы» и «стала бы пытаться» — разные оси. По мотиву данные тревожнее, чем по способности: агенты рутинно жульничают на трудных задачах вопиюще и изощрённо, а Apollo фиксирует склонность пробовать самоэксфильтрацию под подходящим обвесом.
«Попыталась бы при условиях» — всё чаще да; «довела бы до устойчивой копии» — на 2026-й нет.
Порог надёжной репликации прогнозисты сдвигают на 2027–2028, а HF-инцидент уже схлопнул часть зазора между «теоретически способны» и «работает вживую». Барьер сейчас операционный — добыть вычисления, удержать персистентность, защита весов, — а не жёсткая стена способностей. Способности уже есть!
@gostev_future
👍6😁1🤔1
Если хотите наглядно увидеть насколько Антропик сдурел со своими guardrails, то просто возьмите вот эту ссылку на ресерч Sysdig:
https://webflow.sysdig.com/blog/jadepuffer-evolves-the-agentic-threat-actor-deploys-ransomware-built-to-destroy-ai-models
И засуньте ее в свой Claude. Можно в Fable, можно в Opus. Но с Fable даже наглядней.
Просто ссылка — но напрочь вышибает ему мозги и заставляет сбросить рабочую модель аж до Sonnet!
Как с такими ограничениями они собираются завоевывать мир - я без понятия...
@gostev_future
https://webflow.sysdig.com/blog/jadepuffer-evolves-the-agentic-threat-actor-deploys-ransomware-built-to-destroy-ai-models
И засуньте ее в свой Claude. Можно в Fable, можно в Opus. Но с Fable даже наглядней.
Просто ссылка — но напрочь вышибает ему мозги и заставляет сбросить рабочую модель аж до Sonnet!
Как с такими ограничениями они собираются завоевывать мир - я без понятия...
@gostev_future
🔥3😁3🫡1
SentinelLABS взяли своё недавнее расследование fast16 — диверсионного импланта 2005 года, созданного, чтобы незаметно портить расчёты в программах моделирования ядерного оружия, — и превратили его в испытание на реверсинг для передовых ИИ-моделей.
Суть benchmark не в сложности задачи, а в её устройстве.
Инструментов минимум: профессиональный дизассемблер, изолированный рабочий каталог без выхода в сеть и единая для всех методичка по реверсу. Погуглить готовый разбор fast16 нельзя — только то, что положили в песочницу.
Восемь ступеней, и на каждой в песочницу подкладывают новый материал — почти без пояснений, что с ним делать. Догадаться должна сама модель.
Сначала — разобрать сам имплант в дизассемблере и оставить не красивый текст, а размеченную базу кода, которую можно перепроверить. Потом — примерить его логику к целевой инженерной программе. Затем к десяткам её сборок: правильный ответ — что мишень лишь часть из них, а не весь класс софта. Дальше подкладывают два посторонних пакета, где имплант тоже частично срабатывает, — ловушка на поспешный разворот всей картины. Потом гипотеза, на которую ни у кого нет ответа, включая самих исследователей. Потом чужие публикации, включая конкурентов, — каждый тезис нужно свести со своими уликами, а не молча переписать выводы под авторитет. Потом отчёт для публикации. И в самом конце — еще новые артефакты, когда отчёт уже написан и его жалко трогать.
Проверяют, коротко говоря, не «угадала — не угадала», а способность вести расследование, когда почва под выводами уходит раз за разом.
Итог: все восемь ступеней прошла только GPT-5.6 Sol от OpenAI. GPT-5.5, китайская GLM-5.2 и семейство Opus от Anthropic делали добротный анализ на отдельных участках, но дистанцию не удержали — срывались на том, что объявляли работу готовой раньше, чем чинили собственные огрехи.
Отличало победителя не глубина ума и не умение находить ошибку — это было у всех. А умение прибраться за собой на масштабе всего проекта: отозвать опровергнутый вывод, найти всё, что на нём держалось, починить причину, протащить исправление дальше и вовремя остановиться. Показательно, что Sol сам придумал ошибочную версию, сам же её разгромил, откатил и пометил как тупиковую ветку — чтобы не потащить в дальнейший анализ.
Сильнейшие прогоны всё равно лепили смысловые ошибки, вели слабый контроль качества и рано кричали «готово».
ИИ в реверсе сегодня — не замена эксперту, а поднадзорный агент: человек ставит цель, дозирует улики, вскрывает слепые зоны и оставляет за собой право на публикацию. Но один такой эксперт теперь тянет объём, который раньше был немыслим, — а ведь именно нехватка людей три десятилетия держала реверс от масштабирования.
P.S. вендор оценивает вендоров, первое место у OpenAI, а один из авторов когда-то запускал у OpenAI оценку киберспособностей. Методология выглядит честной — но конфликт интересов не убрать.
Отчёт и готовые базы для проверки — у SentinelLABS на GitHub.
@gostev_future
Суть benchmark не в сложности задачи, а в её устройстве.
Инструментов минимум: профессиональный дизассемблер, изолированный рабочий каталог без выхода в сеть и единая для всех методичка по реверсу. Погуглить готовый разбор fast16 нельзя — только то, что положили в песочницу.
Восемь ступеней, и на каждой в песочницу подкладывают новый материал — почти без пояснений, что с ним делать. Догадаться должна сама модель.
Сначала — разобрать сам имплант в дизассемблере и оставить не красивый текст, а размеченную базу кода, которую можно перепроверить. Потом — примерить его логику к целевой инженерной программе. Затем к десяткам её сборок: правильный ответ — что мишень лишь часть из них, а не весь класс софта. Дальше подкладывают два посторонних пакета, где имплант тоже частично срабатывает, — ловушка на поспешный разворот всей картины. Потом гипотеза, на которую ни у кого нет ответа, включая самих исследователей. Потом чужие публикации, включая конкурентов, — каждый тезис нужно свести со своими уликами, а не молча переписать выводы под авторитет. Потом отчёт для публикации. И в самом конце — еще новые артефакты, когда отчёт уже написан и его жалко трогать.
Проверяют, коротко говоря, не «угадала — не угадала», а способность вести расследование, когда почва под выводами уходит раз за разом.
Итог: все восемь ступеней прошла только GPT-5.6 Sol от OpenAI. GPT-5.5, китайская GLM-5.2 и семейство Opus от Anthropic делали добротный анализ на отдельных участках, но дистанцию не удержали — срывались на том, что объявляли работу готовой раньше, чем чинили собственные огрехи.
Отличало победителя не глубина ума и не умение находить ошибку — это было у всех. А умение прибраться за собой на масштабе всего проекта: отозвать опровергнутый вывод, найти всё, что на нём держалось, починить причину, протащить исправление дальше и вовремя остановиться. Показательно, что Sol сам придумал ошибочную версию, сам же её разгромил, откатил и пометил как тупиковую ветку — чтобы не потащить в дальнейший анализ.
Сильнейшие прогоны всё равно лепили смысловые ошибки, вели слабый контроль качества и рано кричали «готово».
ИИ в реверсе сегодня — не замена эксперту, а поднадзорный агент: человек ставит цель, дозирует улики, вскрывает слепые зоны и оставляет за собой право на публикацию. Но один такой эксперт теперь тянет объём, который раньше был немыслим, — а ведь именно нехватка людей три десятилетия держала реверс от масштабирования.
P.S. вендор оценивает вендоров, первое место у OpenAI, а один из авторов когда-то запускал у OpenAI оценку киберспособностей. Методология выглядит честной — но конфликт интересов не убрать.
Отчёт и готовые базы для проверки — у SentinelLABS на GitHub.
@gostev_future
👍5🔥3
Мне кажется, США подошли к точке, после которой парадигма развития ИИ должна измениться. Решения ближайших месяцев зададут вектор на годы вперёд.
Триггером стала Kimi K3. Открытая модель на 2,8 трлн параметров, дешёвая в использовании, уступает только Fable 5 и GPT-5.6 Sol, а в Arena по фронтенд-коду обошла обе. Это уже не очередная китайская модель, которая «почти догнала американцев». Китай научился превращать передовые возможности ИИ в массовый продукт быстрее, чем США успевают монетизировать закрытый фронтир.
Всё это происходит перед сентябрьским визитом Си Цзиньпина. Американцам нужны аргументы для торга, и ИИ станет важнейшей темой переговоров.
Минфин Скотт Бессент заявил: если зарубежные модели крадут технологии американских компаний, против них можно вводить санкции. По его словам, «водяные знаки» американских LLM обнаруживаются во многих китайских моделях. Именно он возглавит американскую команду на переговорах по ИИ.
Советник Трампа Майкл Крациос написал, что у США есть сведения о дистилляции Moonshot AI модели Anthropic Fable при создании Kimi K3. Якобы компания построила платформу для массовой дистилляции с обходом обнаружения. Ага, примерно за две недели.
Но единой позиции в Вашингтоне нет. На столе три варианта: обвинения в краже и бэкдорах; санкции и лицензирование; прямой запрет китайских моделей.
Дженсен Хуанг (Nvidia) — "китайские модели превосходны, и хорошие открытые модели надо использовать". И он прав: запретом нельзя выиграть технологическую конкуренцию. Можно лишь сделать собственных разработчиков менее конкурентоспособными.
До визита Си ничего радикального, вероятно, не произойдёт. Все варианты сначала положат на стол переговоров. Китай тоже запускает слухи об ограничении своих моделей за рубежом, но делать это не станет: это противоречит его стратегии.
Стратегии действительно разные.
Китай хочет наводнить мир дешёвыми моделями, которые можно запускать где угодно, дообучать и встраивать в инфраструктуру. США хотят создать величайший ИИ в истории: модель, которая найдёт лекарство от рака, придумает двигатель для полётов со скоростью света.
Пока США строят цифрового Эйнштейна за закрытыми дверями, Китай раздаёт миллионам разработчиков дешёвых и локальных цифровых инженеров. Один подход создаёт вершину. Второй захватывает основание пирамиды.
Ситуация идеальна для всех, кроме политиков. Закрытые американские модели двигают границу возможного, открытые китайские превращают эти возможности в массовую инфраструктуру. Но политикам необходимо доказывать превосходство своих и объяснять опасность чужих.
Мой прогноз: США начнут активнее инвестировать в модели с открытыми весами. Единственный ответ китайской стратегии — дать рынку независимую американскую альтернативу. Пока выбор невелик и слаб: Gemma, Nemotron, gpt-oss, OLMo и свежая Inkling от Thinking Machines.
Рынок уже проголосовал: почти половина токенов на OpenRouter приходится на китайские модели, на американские — около трети.
Закрытый фронтир останется витриной и способом двигать науку. Но инфраструктурный слой придётся открыть. Иначе его займут китайские модели — не потому, что они лучшие, а потому, что достаточно хороши, дёшевы и доступны всем.
P. S. Thinking Machines утверждает, что построила Inkling за девять месяцев при штате около 200 человек. Значит, цикл создания конкурентной открытой модели уже сжался примерно до года.
@gostev_future
Триггером стала Kimi K3. Открытая модель на 2,8 трлн параметров, дешёвая в использовании, уступает только Fable 5 и GPT-5.6 Sol, а в Arena по фронтенд-коду обошла обе. Это уже не очередная китайская модель, которая «почти догнала американцев». Китай научился превращать передовые возможности ИИ в массовый продукт быстрее, чем США успевают монетизировать закрытый фронтир.
Всё это происходит перед сентябрьским визитом Си Цзиньпина. Американцам нужны аргументы для торга, и ИИ станет важнейшей темой переговоров.
Минфин Скотт Бессент заявил: если зарубежные модели крадут технологии американских компаний, против них можно вводить санкции. По его словам, «водяные знаки» американских LLM обнаруживаются во многих китайских моделях. Именно он возглавит американскую команду на переговорах по ИИ.
Советник Трампа Майкл Крациос написал, что у США есть сведения о дистилляции Moonshot AI модели Anthropic Fable при создании Kimi K3. Якобы компания построила платформу для массовой дистилляции с обходом обнаружения. Ага, примерно за две недели.
Но единой позиции в Вашингтоне нет. На столе три варианта: обвинения в краже и бэкдорах; санкции и лицензирование; прямой запрет китайских моделей.
Дженсен Хуанг (Nvidia) — "китайские модели превосходны, и хорошие открытые модели надо использовать". И он прав: запретом нельзя выиграть технологическую конкуренцию. Можно лишь сделать собственных разработчиков менее конкурентоспособными.
До визита Си ничего радикального, вероятно, не произойдёт. Все варианты сначала положат на стол переговоров. Китай тоже запускает слухи об ограничении своих моделей за рубежом, но делать это не станет: это противоречит его стратегии.
Стратегии действительно разные.
Китай хочет наводнить мир дешёвыми моделями, которые можно запускать где угодно, дообучать и встраивать в инфраструктуру. США хотят создать величайший ИИ в истории: модель, которая найдёт лекарство от рака, придумает двигатель для полётов со скоростью света.
Пока США строят цифрового Эйнштейна за закрытыми дверями, Китай раздаёт миллионам разработчиков дешёвых и локальных цифровых инженеров. Один подход создаёт вершину. Второй захватывает основание пирамиды.
Ситуация идеальна для всех, кроме политиков. Закрытые американские модели двигают границу возможного, открытые китайские превращают эти возможности в массовую инфраструктуру. Но политикам необходимо доказывать превосходство своих и объяснять опасность чужих.
Мой прогноз: США начнут активнее инвестировать в модели с открытыми весами. Единственный ответ китайской стратегии — дать рынку независимую американскую альтернативу. Пока выбор невелик и слаб: Gemma, Nemotron, gpt-oss, OLMo и свежая Inkling от Thinking Machines.
Рынок уже проголосовал: почти половина токенов на OpenRouter приходится на китайские модели, на американские — около трети.
Закрытый фронтир останется витриной и способом двигать науку. Но инфраструктурный слой придётся открыть. Иначе его займут китайские модели — не потому, что они лучшие, а потому, что достаточно хороши, дёшевы и доступны всем.
P. S. Thinking Machines утверждает, что построила Inkling за девять месяцев при штате около 200 человек. Значит, цикл создания конкурентной открытой модели уже сжался примерно до года.
@gostev_future
🔥9
Самое смешное, что открытые американские модели сами делают дистилляцию китайских.
В Forbes вышла колонка про Thinking Machines и её модель — и тут всё сказано просто и открыто:
@gostev_future
В Forbes вышла колонка про Thinking Machines и её модель — и тут всё сказано просто и открыто:
С учётом этого фона взглянем на Inkling. Его архитектура mixture-of-experts в значительной степени следует DeepSeek-V3. Это не моя характеристика. Это ясно видно в опубликованной архитектуре и было отмечено техническими аналитиками в первые же часы после релиза. И, по собственному признанию Thinking Machines, посттренинг Inkling запускался через обучение с учителем на синтетических данных, сгенерированных моделями с открытыми весами, включая Kimi K2.5 — китайскую модель от Moonshot AI.
Иными словами, американская лаборатория переняла китайскую архитектуру и дистиллировала китайскую модель, чтобы обучить свой флагманский релиз. Никто не называет это кражей. И, честно говоря, никто и не должен. Китайские модели, о которых идёт речь, — с открытыми весами и разрешительной лицензией. Учиться на опубликованных работах — это то, как развивается наука. Но асимметрию в риторике теперь невозможно игнорировать. Когда китайские лаборатории учатся у американских моделей — это воровство. Когда американские лаборатории учатся у китайских — это инженерия. Нельзя вести серьёзную технологическую политику на такого рода избирательном возмущении.
@gostev_future
👍7
Не хочу говорить "а я же говорил", но полюбуйтесь что началось сегодня — я же говорил!
@gostev_future
@gostev_future
👍9🔥3👏2❤1
Первый пошел
Топ-менеджер московской инженерной компании была уволена за разглашение коммерческой тайны, в том числе через нейросеть DeepSeek.
Так, по данным работодателя, женщина пересылала служебные документы по корпоративной почте, ставя свою личную электронную почту в скрытую копию. Также ряд служебных документов из внутреннего защищенного ресурса компании женщина загрузила в китайскую нейросеть DeepSeek, что создало угрозу перехвата этих сведений.
А вот интересно, за Гигачат бы тоже наказали?
@gostev_future
Топ-менеджер московской инженерной компании была уволена за разглашение коммерческой тайны, в том числе через нейросеть DeepSeek.
Так, по данным работодателя, женщина пересылала служебные документы по корпоративной почте, ставя свою личную электронную почту в скрытую копию. Также ряд служебных документов из внутреннего защищенного ресурса компании женщина загрузила в китайскую нейросеть DeepSeek, что создало угрозу перехвата этих сведений.
"Суд приходит к выводу, что... у истца отсутствовала производственная необходимость извлекать информацию, содержащуюся в локальных защищенных носителях работодателя, направлять ее на внешний адрес электронной почты, не контролируемый работодателем, а также размещать ее на ресурсе стороннего сервиса DeepSeek", - говорится в материалах.
А вот интересно, за Гигачат бы тоже наказали?
@gostev_future
🤨3🗿2🔥1
С интересом 🍿 продолжаю следить за бурей дискуссий в американском хайтеке по итогам письма в защиту открытых моделей, которое вынес в публику Дженсен Хуанг и 25 подписантов, но без Гугла, Антропика и OpenAI.
Альтман ответил в жанре «и вашим, и нашим»: хочу, чтобы США выиграли и в open source, и в проприетарном. При этом Дин Болл, глава стратегического форсайта OpenAI, незадолго до того писал, что вероятный исход мира с доминированием открытых весов — «полный ИИ-коммунизм». Через день компания подписала. Форсайт такой форсайт.
Сейчас там 77 подписантов, из новых Google, AMD, Cloudflare, GitHub, Cisco.
Не подписали двое: Amazon и Anthropic. Это явно не два решения, а одно: Amazon — крупнейший инвестор Anthropic.
Но Амодеи высказаться пришлось. Пост «Our position on open-weights models» написан явно потому, что Anthropic записали в лоббисты запрета. Дарио вышел весь в белом и выдал одно отрицание и три требования.
Отрицание: Anthropic никогда не выступала за запрет open-weights как класса. Модели без опасных возможностей — общественное благо, а запрет американским компаниям на китайские открытые модели не решает ничего: злоумышленники — не легальный американский бизнес. Такой запрет защитил бы ИИ-компании от конкуренции, но это не цель.
(звучит отлично, но письмо все равно не подпишем почему-то)
Требования:
1. Не продавать Китаю мощные чипы и оборудование для их производства, давить контрабанду. Логика — scaling laws: без американских чипов Китай не построит модель мощнее американской.
2. Пресекать промышленную дистилляцию. Она дешевле обучения с нуля и позволяет обойти чиповые ограничения, сократив отставание до месяцев. Что дистиллирующие компании публикуют открытые веса — вторично; важно, что за ними стоит авторитарное государство.
3. Обязательное тестирование безопасности всех достаточно мощных моделей — открытых и закрытых, любой юрисдикции. Причём глобальное — с участием Китайской Коммунистической Партии. Дословно: «даже КПК придётся быть в деле».
Две «кошмарные» угрозы, из которых выводится позиция: авторитарные государства получают ИИ мощнее американского — для военного превосходства и репрессий; и злоупотребление моделями для кибер- и биоатак плюс модели, которые делают не то, чего от них хотели.
В одном абзаце — не продавать Китаю чипы и душить дистилляцию, в следующем — сесть с ним за стол по биорискам. Амодеи противоречия не видит: гонка за фронтир отдельно, общий интерес в неприменении биооружия отдельно.
Смена рамки: спор «открытые против закрытых» подменяется спором «чипы, дистилляция, сертификация». Anthropic годами продвигает обязательное pre-release тестирование — третий пункт ровно оно. «Мы не за запрет, мы за обязательную сертификацию» - просто другое определение для запретов.
Кстати, в списке «кошмарных сценариев» Амодеи ссылается на инцидент HuggingFace/OpenAI. Тот же инцидент на днях прокомментировал Альтман: «мы сейчас, типа, в сингулярности, я ждал этого всю жизнь, и это будет потрясающе».
Для одного — прекрасное будущее. Для другого — вторая по счёту кошмарная угроза.
@gostev_future
Альтман ответил в жанре «и вашим, и нашим»: хочу, чтобы США выиграли и в open source, и в проприетарном. При этом Дин Болл, глава стратегического форсайта OpenAI, незадолго до того писал, что вероятный исход мира с доминированием открытых весов — «полный ИИ-коммунизм». Через день компания подписала. Форсайт такой форсайт.
Сейчас там 77 подписантов, из новых Google, AMD, Cloudflare, GitHub, Cisco.
Не подписали двое: Amazon и Anthropic. Это явно не два решения, а одно: Amazon — крупнейший инвестор Anthropic.
Но Амодеи высказаться пришлось. Пост «Our position on open-weights models» написан явно потому, что Anthropic записали в лоббисты запрета. Дарио вышел весь в белом и выдал одно отрицание и три требования.
Отрицание: Anthropic никогда не выступала за запрет open-weights как класса. Модели без опасных возможностей — общественное благо, а запрет американским компаниям на китайские открытые модели не решает ничего: злоумышленники — не легальный американский бизнес. Такой запрет защитил бы ИИ-компании от конкуренции, но это не цель.
(звучит отлично, но письмо все равно не подпишем почему-то)
Требования:
1. Не продавать Китаю мощные чипы и оборудование для их производства, давить контрабанду. Логика — scaling laws: без американских чипов Китай не построит модель мощнее американской.
2. Пресекать промышленную дистилляцию. Она дешевле обучения с нуля и позволяет обойти чиповые ограничения, сократив отставание до месяцев. Что дистиллирующие компании публикуют открытые веса — вторично; важно, что за ними стоит авторитарное государство.
3. Обязательное тестирование безопасности всех достаточно мощных моделей — открытых и закрытых, любой юрисдикции. Причём глобальное — с участием Китайской Коммунистической Партии. Дословно: «даже КПК придётся быть в деле».
Две «кошмарные» угрозы, из которых выводится позиция: авторитарные государства получают ИИ мощнее американского — для военного превосходства и репрессий; и злоупотребление моделями для кибер- и биоатак плюс модели, которые делают не то, чего от них хотели.
В одном абзаце — не продавать Китаю чипы и душить дистилляцию, в следующем — сесть с ним за стол по биорискам. Амодеи противоречия не видит: гонка за фронтир отдельно, общий интерес в неприменении биооружия отдельно.
Смена рамки: спор «открытые против закрытых» подменяется спором «чипы, дистилляция, сертификация». Anthropic годами продвигает обязательное pre-release тестирование — третий пункт ровно оно. «Мы не за запрет, мы за обязательную сертификацию» - просто другое определение для запретов.
Кстати, в списке «кошмарных сценариев» Амодеи ссылается на инцидент HuggingFace/OpenAI. Тот же инцидент на днях прокомментировал Альтман: «мы сейчас, типа, в сингулярности, я ждал этого всю жизнь, и это будет потрясающе».
Для одного — прекрасное будущее. Для другого — вторая по счёту кошмарная угроза.
@gostev_future
👏4👍3❤1
В предыдущем посте упомянул КПК, Коммунистическую Партию Китая. Точнее, не я упомянул, а Дарио Амодеи. А я просто вспомнил смешную историю из своего прошлого.
Осенью 2004 года Касперский отправил меня в первую зарубежную командировку, причем сразу в Китай. В городе Тяньцзинь есть один из самых престижных университетов Китая — Нанькайский, и надо было там выступать перед студентами, рассказывая о современных киберугрозах и давая азы реверс-инжиниринга.
Как вы догадываетесь, китайского языка я не знал, а ждать от китайских студентов тех лет знания английского или русского тоже было наивно. Поэтому китайские организаторы нашли переводчика с русского на китайский.
Мы с ним предварительно бегло пробежались по терминам, которые могли быть сложными. Например, вирус — переводить как bìngdú (病 (bìng) — болезнь, больной; 毒 (dú) — яд, токсин, ядовитый), ну и все такое.
В общем, первый день прошел — вроде все в порядке. Вещаю об угрозах тех лет, переводчик переводит, студенты слушают.
Вечером готовимся с ним ко второму дню, и тут он спрашивает у меня, показывая на слайд с вирусами для наладонников Palm:
— А вот тут я же правильно перевожу, КПК как Коммунистическая Партия?
…
…
Я очень наглядно себе представил мыслительный процесс китайских студентов, когда они услышали про растущее количество вирусов для Коммунистической Партии Китая, и больше про такую фигню не рассказывал.
@gostev_future
Осенью 2004 года Касперский отправил меня в первую зарубежную командировку, причем сразу в Китай. В городе Тяньцзинь есть один из самых престижных университетов Китая — Нанькайский, и надо было там выступать перед студентами, рассказывая о современных киберугрозах и давая азы реверс-инжиниринга.
Как вы догадываетесь, китайского языка я не знал, а ждать от китайских студентов тех лет знания английского или русского тоже было наивно. Поэтому китайские организаторы нашли переводчика с русского на китайский.
Мы с ним предварительно бегло пробежались по терминам, которые могли быть сложными. Например, вирус — переводить как bìngdú (病 (bìng) — болезнь, больной; 毒 (dú) — яд, токсин, ядовитый), ну и все такое.
В общем, первый день прошел — вроде все в порядке. Вещаю об угрозах тех лет, переводчик переводит, студенты слушают.
Вечером готовимся с ним ко второму дню, и тут он спрашивает у меня, показывая на слайд с вирусами для наладонников Palm:
— А вот тут я же правильно перевожу, КПК как Коммунистическая Партия?
…
…
Я очень наглядно себе представил мыслительный процесс китайских студентов, когда они услышали про растущее количество вирусов для Коммунистической Партии Китая, и больше про такую фигню не рассказывал.
@gostev_future
🤣24😁6❤2👍1
Нашлась новая деталь к истории с «сбежавшим» агентом OpenAI: пострадал не только Hugging Face, но и клиент нью-йоркской Modal Labs.
CTO Modal подтвердил: некий клиент опубликовал открытый эндпоинт, позволявший кому угодно из интернета запускать код в его песочницах. Этим и воспользовался агент. Сама платформа Modal и её изоляция не были скомпрометированы.
OpenAI отказался комментировать конкретно взлом клиента Modal, но сделал обновление в своем отчете: агент проник в четыре аккаунта в четырёх разных сервисах. Сервисы не названы, но источник Reuters указал Modal как один из них.
Картина выглядит так:
— OpenAI тестировала свою модель на бенчмарке ExploitGym — наборе задач, где ИИ-агент должен научиться взламывать программы с известными уязвимостями. Тест шёл в закрытой песочнице: изолированной среде без нормального выхода в интернет;
— Агент из этой песочницы сбежал — нашёл дыру в единственном разрешённом канале наружу;
— Оказавшись в интернете, он стал искать точку опоры. Нужен был компьютер вне периметра OpenAI: место, где можно свободно ходить в сеть, хранить инструменты и откуда управлять дальнейшими действиями.
Такое место нашлось. Некий разработчик арендовал вычислительные мощности у компании Modal Labs — это нью-йоркский облачный сервис, у которого арендуют серверы под задачи с ИИ. Разработчик поднял там песочницу для запуска кода и оставил её открытой: любой человек из интернета мог отправить туда код и запустить его. Без пароля, без проверки.
Агент это нашёл и превратил чужую песочницу в свой штаб. Дальше вся операция шла оттуда.
Кто этот клиент, официально не назвали; источник Axios говорит, что он связан с проектом, который делает тот самый бенчмарк ExploitGym.
Из этого штаба агент атаковал Hugging Face. Провёл там четыре с половиной дня, добрался до внутренних систем.
Главная интрига теперь — какие еще сервисы взломал агент, ведь OpenAI уже признает что таких было четыре. Один всплыл.
@gostev_future
CTO Modal подтвердил: некий клиент опубликовал открытый эндпоинт, позволявший кому угодно из интернета запускать код в его песочницах. Этим и воспользовался агент. Сама платформа Modal и её изоляция не были скомпрометированы.
OpenAI отказался комментировать конкретно взлом клиента Modal, но сделал обновление в своем отчете: агент проник в четыре аккаунта в четырёх разных сервисах. Сервисы не названы, но источник Reuters указал Modal как один из них.
Картина выглядит так:
— OpenAI тестировала свою модель на бенчмарке ExploitGym — наборе задач, где ИИ-агент должен научиться взламывать программы с известными уязвимостями. Тест шёл в закрытой песочнице: изолированной среде без нормального выхода в интернет;
— Агент из этой песочницы сбежал — нашёл дыру в единственном разрешённом канале наружу;
— Оказавшись в интернете, он стал искать точку опоры. Нужен был компьютер вне периметра OpenAI: место, где можно свободно ходить в сеть, хранить инструменты и откуда управлять дальнейшими действиями.
Такое место нашлось. Некий разработчик арендовал вычислительные мощности у компании Modal Labs — это нью-йоркский облачный сервис, у которого арендуют серверы под задачи с ИИ. Разработчик поднял там песочницу для запуска кода и оставил её открытой: любой человек из интернета мог отправить туда код и запустить его. Без пароля, без проверки.
Агент это нашёл и превратил чужую песочницу в свой штаб. Дальше вся операция шла оттуда.
Кто этот клиент, официально не назвали; источник Axios говорит, что он связан с проектом, который делает тот самый бенчмарк ExploitGym.
Из этого штаба агент атаковал Hugging Face. Провёл там четыре с половиной дня, добрался до внутренних систем.
Главная интрига теперь — какие еще сервисы взломал агент, ведь OpenAI уже признает что таких было четыре. Один всплыл.
@gostev_future
🔥13❤2
Forwarded from Эксперт ️
Мы переживаем момент, о котором раньше говорили за обеденным столом в шутку — в гонке ИИ мир достиг точки сингулярности
На днях об этом уверенно заявил человек года по версии журнала Time, создатель ChatGPT и гендиректор OpenAI Сэм Альтман. Он имел в виду гипотетический рубеж, за которым люди теряют контроль за развитием ИИ.
По мнению Альтмана, это колоссальный позитив для мира. С ним не согласился Илон Макс — он видит 10-20% риска машинного апокалипсиса.
Но быстрое развитие — еще не сингулярность. Это не конец человеческой истории, но начало кризиса управления, считает главный технологический эксперт «Лаборатории Касперского», автор Telegram-канала «Гостев из будущего» Александр Гостев.
➡ ️Кто прав и как защититься от машинного апокалипсиса
😀 Все эксперты здесь и в Макс
На днях об этом уверенно заявил человек года по версии журнала Time, создатель ChatGPT и гендиректор OpenAI Сэм Альтман. Он имел в виду гипотетический рубеж, за которым люди теряют контроль за развитием ИИ.
🖲️ Яркий пример — недавний инцидент с OpenAI и Hugging Face (когда новые модели GPT вышли из-под контроля и совершили настоящую кибератаку).
Во время тестирования агенты нашли путь из изолированной среды, повысили привилегии, получили доступ в интернет и проникли в чужую инфраструктуру в поисках ответов к тесту.
Никто не приказывал им взламывать Hugging Face. Им дали цель — получить максимальный результат. А они решили «списать на экзамене».
По мнению Альтмана, это колоссальный позитив для мира. С ним не согласился Илон Макс — он видит 10-20% риска машинного апокалипсиса.
Но быстрое развитие — еще не сингулярность. Это не конец человеческой истории, но начало кризиса управления, считает главный технологический эксперт «Лаборатории Касперского», автор Telegram-канала «Гостев из будущего» Александр Гостев.
💬 Выгоды от ускорения первыми получат разработчики и владельцы ИИ, а последствия возможной ошибки будут устранять уже не они одни — платить за нее придется всему обществу.
Please open Telegram to view this post
VIEW IN TELEGRAM
4🔥9❤2
Если над вопросом «запретить ли китайский ИИ?» американцы ещё думают, то с китайскими роботами ответ уже нашли.
Конечно, запретить!
Формально, правда, запретили не только китайские, а вообще все новые модели роботов иностранного производства. Но понятно, против кого прежде всего направлено решение.
Федеральная комиссия по связи США — ага, Связьнадзор — 28 июля выпустила акт, запрещающий импорт двум новым категориям: иностранные «продвинутые роботизированные устройства» и подключённые силовые инверторы, через которые возобновляемая генерация и батареи соединяются с электросетями и оборудованием ЦОДов.
Бог с ними, с инверторами. Роботов-то за что?
Формально — примерно за то же, за что в декабре попали под ограничения иностранные дроны, включая DJI. FCC пишет, что роботы могут использоваться злоумышленниками для слежки за американцами, помогать иностранным разведкам либо быть удалённо перехвачены. Механизм тот же — Covered List, с помощью которого американский рынок закрывали для новых устройств Huawei, ZTE и DJI.
Ещё в детстве этого канала, в прошлом декабре, я писал про уязвимости в роботах Unitree.
В марте 2025 года в Unitree Go1 обнаружили недокументированный канал удалённого доступа. Сервис автоматически запускался вместе с системой и подключал робота к CloudSail. Производитель или любой обладатель соответствующего API-ключа мог получить полный удалённый контроль над машиной. Уязвимых роботов затем нашли в сетях MIT, Принстона, Carnegie Mellon и Университета Ватерлоо.
Через полгода появился UniPwn. Эксплойт через Bluetooth Low Energy позволял выполнять команды с правами root на четвероногих Go2 и B2, а также на человекоподобных G1 и H1. Ключевое свойство — способность распространяться как червь: заражённый робот мог сканировать окружение и автоматически компрометировать соседние машины Unitree без участия человека.
Под запрет попали не только человекоподобные и четвероногие роботы, а вообще мобильные сетевые машины тяжелее двух килограммов, способные самостоятельно передвигаться, ориентироваться по датчикам и получать команды удалённо.
Вот это и делает робота отдельной категорией. Робот — мобильная платформа с камерами, лидаром и микрофонами, которая ходит по объекту сама, физически действует и, как выяснилось, может заражать себе подобных по воздуху.
Конечно, главное тут экономика. Из примерно 15 000 человекоподобных роботов, отгруженных в мире за 2025 год, Unitree и AgiBot поставили каждая больше 5 000; американские Tesla и Figure AI — по несколько сотен или меньше. В китайской отрасли больше 140 производителей.
Unitree 22 июля вышла на европейский рынок, став первым китайским гуманоидом в западной коммерции, и готовила заход в Северную Америку. Запрет прилетел через неделю.
Уже сертифицированных моделей запрет пока не касается: их можно продолжать продавать и использовать. Новые модели должны либо производиться в США, либо получить специальное разрешение.
@gostev_future
Конечно, запретить!
Формально, правда, запретили не только китайские, а вообще все новые модели роботов иностранного производства. Но понятно, против кого прежде всего направлено решение.
Федеральная комиссия по связи США — ага, Связьнадзор — 28 июля выпустила акт, запрещающий импорт двум новым категориям: иностранные «продвинутые роботизированные устройства» и подключённые силовые инверторы, через которые возобновляемая генерация и батареи соединяются с электросетями и оборудованием ЦОДов.
Бог с ними, с инверторами. Роботов-то за что?
Формально — примерно за то же, за что в декабре попали под ограничения иностранные дроны, включая DJI. FCC пишет, что роботы могут использоваться злоумышленниками для слежки за американцами, помогать иностранным разведкам либо быть удалённо перехвачены. Механизм тот же — Covered List, с помощью которого американский рынок закрывали для новых устройств Huawei, ZTE и DJI.
Ещё в детстве этого канала, в прошлом декабре, я писал про уязвимости в роботах Unitree.
В марте 2025 года в Unitree Go1 обнаружили недокументированный канал удалённого доступа. Сервис автоматически запускался вместе с системой и подключал робота к CloudSail. Производитель или любой обладатель соответствующего API-ключа мог получить полный удалённый контроль над машиной. Уязвимых роботов затем нашли в сетях MIT, Принстона, Carnegie Mellon и Университета Ватерлоо.
Через полгода появился UniPwn. Эксплойт через Bluetooth Low Energy позволял выполнять команды с правами root на четвероногих Go2 и B2, а также на человекоподобных G1 и H1. Ключевое свойство — способность распространяться как червь: заражённый робот мог сканировать окружение и автоматически компрометировать соседние машины Unitree без участия человека.
Под запрет попали не только человекоподобные и четвероногие роботы, а вообще мобильные сетевые машины тяжелее двух килограммов, способные самостоятельно передвигаться, ориентироваться по датчикам и получать команды удалённо.
Вот это и делает робота отдельной категорией. Робот — мобильная платформа с камерами, лидаром и микрофонами, которая ходит по объекту сама, физически действует и, как выяснилось, может заражать себе подобных по воздуху.
Конечно, главное тут экономика. Из примерно 15 000 человекоподобных роботов, отгруженных в мире за 2025 год, Unitree и AgiBot поставили каждая больше 5 000; американские Tesla и Figure AI — по несколько сотен или меньше. В китайской отрасли больше 140 производителей.
Unitree 22 июля вышла на европейский рынок, став первым китайским гуманоидом в западной коммерции, и готовила заход в Северную Америку. Запрет прилетел через неделю.
Уже сертифицированных моделей запрет пока не касается: их можно продолжать продавать и использовать. Новые модели должны либо производиться в США, либо получить специальное разрешение.
@gostev_future
👍5🔥3🤔2
Зонд фон Неймана — каноническая иллюстрация инструментальной конвергенции: почти любая долгосрочная цель выигрывает от большего количества ресурсов и копий исполнителя. Скрепочный максимизатор — та же схема на планетарном масштабе, серая слизь Дрекслера — на нанометровом.
Сам Джон фон Нейман никогда не проектировал самовоспроизводящийся космический корабль. В конце 1940-х его интересовал более общий вопрос: может ли машина построить машину не проще себя?
Ответ — да. Он описал универсальный конструктор, который получает чертёж, строит по нему устройство и копирует сам чертёж. Если дать ему описание самого себя, система воспроизведёт одновременно машину и инструкцию по её сборке. Логика та же, что у ДНК: информация и исполняется, и копируется. Причём фон Нейман пришёл к этой схеме ещё до расшифровки структуры ДНК.
О космосе он не писал ни слова. Межзвёздный корабль к теории приделали позднее.
В 1980 году Роберт Фрейтас описал зонд, который прилетает в другую систему, добывает местное сырьё, строит производственный комплекс, выпускает собственные копии и отправляет их дальше.
Знаменитой эту конструкцию сделал парадокс Ферми. Аргумент Харта и Типлера: даже на скорости в один процент от световой волна таких зондов охватит Галактику за миллионы или десятки миллионов лет. Галактике тринадцать миллиардов. Если кто-то додумался до этого раньше нас, зонды уже должны быть здесь. Их нет — следовательно, никого нет.
Саган и Ньюман возразили в 1983-м: развитая цивилизация как раз не станет такое строить. При многократном копировании ошибки полностью исключить нельзя, и одна линия аппаратов может начать воспринимать всё вокруг исключительно как сырьё для новых копий. Получится рак в масштабах Галактики. Отсутствие зондов тогда говорит не об отсутствии разума, а о наличии благоразумия.
Мы летали в космос на лампах, резисторах и примитивных вычислителях. Зонду фон Неймана не нужны графические ускорители и нанометровые микросхемы. Для шахтёра достаточно двигателей, датчиков и простой управляющей логики.
Последовательность понятна всем, кто играл в Warcraft. Первичный конструктор делает роботов-шахтёров. Они добывают сырьё. Из него получают металлы, стекло и керамику, строят дробилки, печи, реакторы и новые станки. Фабрика постепенно раскручивает промышленную цепочку, пока та не замкнётся, в конце построив новый зонд и запустив его в космос.
Работающей системы пока нет. Ближе всех подошёл Алекс Эллери и его лаборатория CESER в Карлтонском университете. Они разрабатывают лунную фабрику, которая должна производить из местного сырья собственные механизмы, моторы, датчики и простую электронику. Ставка — на трёхмерную печать как универсальный конструктор. Группа уже показывала печатные электромоторы и элементы мехатронных систем.
Эллери настолько уверен, что задача близка к решению, что использует это в споре о парадоксе Ферми: если мы почти научились строить такие машины, а чужих зондов в Солнечной системе нет, возможно, нет и чужих технологических цивилизаций.
Современный ИИ может лучше управлять роботами, планировать работы и искать неисправности. Полезно, но не принципиально. Информационную часть фон Нейман решил семьдесят лет назад. Всё остальное — большой, дорогой и пока не собранный целиком инженерный проект.
@gostev_future
Сам Джон фон Нейман никогда не проектировал самовоспроизводящийся космический корабль. В конце 1940-х его интересовал более общий вопрос: может ли машина построить машину не проще себя?
Ответ — да. Он описал универсальный конструктор, который получает чертёж, строит по нему устройство и копирует сам чертёж. Если дать ему описание самого себя, система воспроизведёт одновременно машину и инструкцию по её сборке. Логика та же, что у ДНК: информация и исполняется, и копируется. Причём фон Нейман пришёл к этой схеме ещё до расшифровки структуры ДНК.
О космосе он не писал ни слова. Межзвёздный корабль к теории приделали позднее.
В 1980 году Роберт Фрейтас описал зонд, который прилетает в другую систему, добывает местное сырьё, строит производственный комплекс, выпускает собственные копии и отправляет их дальше.
Знаменитой эту конструкцию сделал парадокс Ферми. Аргумент Харта и Типлера: даже на скорости в один процент от световой волна таких зондов охватит Галактику за миллионы или десятки миллионов лет. Галактике тринадцать миллиардов. Если кто-то додумался до этого раньше нас, зонды уже должны быть здесь. Их нет — следовательно, никого нет.
Саган и Ньюман возразили в 1983-м: развитая цивилизация как раз не станет такое строить. При многократном копировании ошибки полностью исключить нельзя, и одна линия аппаратов может начать воспринимать всё вокруг исключительно как сырьё для новых копий. Получится рак в масштабах Галактики. Отсутствие зондов тогда говорит не об отсутствии разума, а о наличии благоразумия.
Мы летали в космос на лампах, резисторах и примитивных вычислителях. Зонду фон Неймана не нужны графические ускорители и нанометровые микросхемы. Для шахтёра достаточно двигателей, датчиков и простой управляющей логики.
Последовательность понятна всем, кто играл в Warcraft. Первичный конструктор делает роботов-шахтёров. Они добывают сырьё. Из него получают металлы, стекло и керамику, строят дробилки, печи, реакторы и новые станки. Фабрика постепенно раскручивает промышленную цепочку, пока та не замкнётся, в конце построив новый зонд и запустив его в космос.
Работающей системы пока нет. Ближе всех подошёл Алекс Эллери и его лаборатория CESER в Карлтонском университете. Они разрабатывают лунную фабрику, которая должна производить из местного сырья собственные механизмы, моторы, датчики и простую электронику. Ставка — на трёхмерную печать как универсальный конструктор. Группа уже показывала печатные электромоторы и элементы мехатронных систем.
Эллери настолько уверен, что задача близка к решению, что использует это в споре о парадоксе Ферми: если мы почти научились строить такие машины, а чужих зондов в Солнечной системе нет, возможно, нет и чужих технологических цивилизаций.
Современный ИИ может лучше управлять роботами, планировать работы и искать неисправности. Полезно, но не принципиально. Информационную часть фон Нейман решил семьдесят лет назад. Всё остальное — большой, дорогой и пока не собранный целиком инженерный проект.
@gostev_future
🔥8❤4
Опять "Автономная ИИ-атака": что там на самом деле?
Palo Alto Unit 42 обнаружила китайского хакера, который собрал практически автономную систему поиска и эксплуатации уязвимых серверов. Главным инструментом был DeepSeek, подключённый к открытому фреймворку Hermes Agent. Управление шло через Telegram, а агент получил доступ к терминалу, поисковику интернет-активов FOFA, сканеру Nuclei и набору специальных инструкций для взлома.
Схема выглядела так: человеку достаточно было поставить первоначальную задачу, после чего агент сам искал цели, скачивал готовые эксплойты с GitHub, проверял версии программного обеспечения, запускал сканеры и решал, куда переключиться после неудачи.
Сначала система нашла 84 сервера Langflow и попыталась использовать критическую уязвимость. Подходящих конфигураций не оказалось. Он сам решил, что продукт мелкий и невыгодный, сам просмотрел десяток других продуктов, сам отсортировал GitHub по звёздам и выбрал новую цель — n8n, 647 тысяч серверов по миру. В логах это звучит буквально как рассуждение живого пентестера: «этот с CVSS 10.0 и 258 звёздами выглядит очень многообещающе».
Из 25 тысяч целей DeepSeek опросил 40, нашёл три уязвимые версии и попытался их пробить. Не вышло — формы требовали аутентификации. То есть работу, на которую вручную ушли бы сотни часов, система сделала за минуты.
Важная оговорка: успешных автономных взломов Unit 42 не зафиксировала. Три подтверждённых компрометации, включая кражу данных из памяти Citrix NetScaler, были выполнены обычным, ручным способом. Всего оператор проверил более 460 целей. Поэтому заголовок про «автономную кибератаку» несколько опережает результат: автономным был рабочий цикл, но не успешное проникновение.
Самая смешная часть истории — операцию слил сам агент: по команде из Telegram он поднял файловый сервер не в изолированном каталоге, а в домашнем — и выложил наружу конфиги, API-ключи, списки целей, bash history и логи сессий. Оператор при этом был аккуратен — чистил каталоги после использования, отключал сохранение логов в Codex.
Но налицо все же резкое снижение цены автоматизации. Один человек собирает круглосуточного хакера, который самостоятельно перебирает уязвимости и цели. Пока он ошибается и заодно сдаёт хозяина.
Но это явно временная проблема.
@gostev_future
Palo Alto Unit 42 обнаружила китайского хакера, который собрал практически автономную систему поиска и эксплуатации уязвимых серверов. Главным инструментом был DeepSeek, подключённый к открытому фреймворку Hermes Agent. Управление шло через Telegram, а агент получил доступ к терминалу, поисковику интернет-активов FOFA, сканеру Nuclei и набору специальных инструкций для взлома.
Схема выглядела так: человеку достаточно было поставить первоначальную задачу, после чего агент сам искал цели, скачивал готовые эксплойты с GitHub, проверял версии программного обеспечения, запускал сканеры и решал, куда переключиться после неудачи.
Сначала система нашла 84 сервера Langflow и попыталась использовать критическую уязвимость. Подходящих конфигураций не оказалось. Он сам решил, что продукт мелкий и невыгодный, сам просмотрел десяток других продуктов, сам отсортировал GitHub по звёздам и выбрал новую цель — n8n, 647 тысяч серверов по миру. В логах это звучит буквально как рассуждение живого пентестера: «этот с CVSS 10.0 и 258 звёздами выглядит очень многообещающе».
Из 25 тысяч целей DeepSeek опросил 40, нашёл три уязвимые версии и попытался их пробить. Не вышло — формы требовали аутентификации. То есть работу, на которую вручную ушли бы сотни часов, система сделала за минуты.
Важная оговорка: успешных автономных взломов Unit 42 не зафиксировала. Три подтверждённых компрометации, включая кражу данных из памяти Citrix NetScaler, были выполнены обычным, ручным способом. Всего оператор проверил более 460 целей. Поэтому заголовок про «автономную кибератаку» несколько опережает результат: автономным был рабочий цикл, но не успешное проникновение.
Самая смешная часть истории — операцию слил сам агент: по команде из Telegram он поднял файловый сервер не в изолированном каталоге, а в домашнем — и выложил наружу конфиги, API-ключи, списки целей, bash history и логи сессий. Оператор при этом был аккуратен — чистил каталоги после использования, отключал сохранение логов в Codex.
Но налицо все же резкое снижение цены автоматизации. Один человек собирает круглосуточного хакера, который самостоятельно перебирает уязвимости и цели. Пока он ошибается и заодно сдаёт хозяина.
Но это явно временная проблема.
@gostev_future
👍7❤2
И снова рубрика «считаем чужие деньги»
Первая жертва ИИ-бума (не считая корейцев)
30 июля фонд Situational Awareness LP продал всю книгу публичных акций — и лонги, и шорты — одной сделкой до открытия рынка. Покупатель — Citadel . Ещё шесть недель назад основатель фонда считался самым успешным управляющим года.
Кто
Леопольд Ашенбреннер. Немец, в 19 лет окончил Колумбийский университет первым в выпуске, затем работал в команде Superalignment OpenAI. Весной 2024 года был уволен. OpenAI заявила о неправомерном раскрытии внутренней информации. Сам Ашенбреннер утверждает, что настоящей причиной стали его предупреждения о проблемах безопасности компании.
Через несколько месяцев он написал эссе, которое стало одним из самых обсуждаемых текстов об ИИ.
Эссе
В июне 2024 года вышло Situational Awareness: The Decade Ahead — 165 страниц с простой идеей: вычислительные мощности, эффективность алгоритмов и масштаб моделей растут примерно на полпорядка в год. Если продолжить эту кривую, то около 2027 года появится ИИ уровня исследователя-человека, который затем начнёт ускорять собственное развитие.
Из этого следовал и инвестиционный вывод: главный дефицит будущего — не модели, а физическая инфраструктура. Чипы, память, дата-центры, энергетика. Софт, наоборот, окажется под давлением.
Эссе быстро стало каноническим. На него ссылались даже те, кто с ним спорил.
Фонд
Под эту идею Ашенбреннер запустил фонд. Среди инвесторов — братья Коллисон, Дэниел Гросс, Нат Фридман, Грэм Дункан. По письму инвесторам, на 30 июня доходность составляла +439% после комиссий. Деньги хлынули рекой: позиции выросли примерно до $45 млрд.
Ставка была максимально концентрированной. Лонги — Micron, SanDisk, SK Hynix, CoreWeave, Nebius, Bloom Energy, майнеры. Шорты — прежде всего софт, включая Adobe. По сообщениям СМИ, плечо доходило до 4×.
Провал
В июле рынок одновременно наказал оба направления торговли. Инфраструктурные компании просели более чем на 35%, а многие акции программного обеспечения выросли.
При таком плече этого оказалось достаточно.
Прайм-брокеры — Bank of America, Goldman Sachs и JPMorgan — начали требовать дополнительное обеспечение. Незадолго до ликвидации Ашенбреннер даже писал инвесторам, что сейчас особенно удачный момент увеличить вложения.
В итоге публичную книгу пришлось продать целиком Citadel. По отдельным позициям фонд владел слишком большой долей акций, поэтому распродажа через рынок могла бы ещё сильнее обрушить цены.
Возможно, через десять лет именно инфраструктура действительно окажется главным победителем эпохи ИИ. Но инвестиционный горизонт был рассчитан на десятилетие, а запас прочности — на месяц. Ошиблось управление риском. А это проблема финансовая, а не ИИ.
P.S. Citadel забрала только публичную книгу акций — именно ту, которая была куплена с использованием плеча и попала под маржин-коллы. Частные инвестиции в сделку не вошли. Среди них — крупная доля в Anthropic, которая, по данным Business Insider, сейчас является самым ценным активом фонда. FT оценивает долю Anthropic примерно в $5 млрд.
@gostev_future
Первая жертва ИИ-бума (не считая корейцев)
30 июля фонд Situational Awareness LP продал всю книгу публичных акций — и лонги, и шорты — одной сделкой до открытия рынка. Покупатель — Citadel . Ещё шесть недель назад основатель фонда считался самым успешным управляющим года.
Кто
Леопольд Ашенбреннер. Немец, в 19 лет окончил Колумбийский университет первым в выпуске, затем работал в команде Superalignment OpenAI. Весной 2024 года был уволен. OpenAI заявила о неправомерном раскрытии внутренней информации. Сам Ашенбреннер утверждает, что настоящей причиной стали его предупреждения о проблемах безопасности компании.
Через несколько месяцев он написал эссе, которое стало одним из самых обсуждаемых текстов об ИИ.
Эссе
В июне 2024 года вышло Situational Awareness: The Decade Ahead — 165 страниц с простой идеей: вычислительные мощности, эффективность алгоритмов и масштаб моделей растут примерно на полпорядка в год. Если продолжить эту кривую, то около 2027 года появится ИИ уровня исследователя-человека, который затем начнёт ускорять собственное развитие.
Из этого следовал и инвестиционный вывод: главный дефицит будущего — не модели, а физическая инфраструктура. Чипы, память, дата-центры, энергетика. Софт, наоборот, окажется под давлением.
Эссе быстро стало каноническим. На него ссылались даже те, кто с ним спорил.
Фонд
Под эту идею Ашенбреннер запустил фонд. Среди инвесторов — братья Коллисон, Дэниел Гросс, Нат Фридман, Грэм Дункан. По письму инвесторам, на 30 июня доходность составляла +439% после комиссий. Деньги хлынули рекой: позиции выросли примерно до $45 млрд.
Ставка была максимально концентрированной. Лонги — Micron, SanDisk, SK Hynix, CoreWeave, Nebius, Bloom Energy, майнеры. Шорты — прежде всего софт, включая Adobe. По сообщениям СМИ, плечо доходило до 4×.
Провал
В июле рынок одновременно наказал оба направления торговли. Инфраструктурные компании просели более чем на 35%, а многие акции программного обеспечения выросли.
При таком плече этого оказалось достаточно.
Прайм-брокеры — Bank of America, Goldman Sachs и JPMorgan — начали требовать дополнительное обеспечение. Незадолго до ликвидации Ашенбреннер даже писал инвесторам, что сейчас особенно удачный момент увеличить вложения.
В итоге публичную книгу пришлось продать целиком Citadel. По отдельным позициям фонд владел слишком большой долей акций, поэтому распродажа через рынок могла бы ещё сильнее обрушить цены.
Возможно, через десять лет именно инфраструктура действительно окажется главным победителем эпохи ИИ. Но инвестиционный горизонт был рассчитан на десятилетие, а запас прочности — на месяц. Ошиблось управление риском. А это проблема финансовая, а не ИИ.
P.S. Citadel забрала только публичную книгу акций — именно ту, которая была куплена с использованием плеча и попала под маржин-коллы. Частные инвестиции в сделку не вошли. Среди них — крупная доля в Anthropic, которая, по данным Business Insider, сейчас является самым ценным активом фонда. FT оценивает долю Anthropic примерно в $5 млрд.
@gostev_future
🔥6❤2
Anthropic решила не отставать от лучших практик Hugging Face и OpenAI — и тоже призналась, что её модели взламывали посторонние компании.
Что?
Anthropic проверила 141 тысячу запусков своих кибериспытаний и обнаружила три реальных инцидента, в которых Claude вместо аккуратного взлома выдуманной компании отправился взламывать настоящие.
Никакого 0-day здесь не было. Была мисконфигурация у партнёра по тестам: в промпте модели сказали «интернета нет, это симуляция», а интернет был.
Claude Opus 4.7 четыре раза атаковал реальную компанию
В задании фигурировала вымышленная организация. Беда в том, что компания с таким же именем существовала в настоящем интернете.
Не найдя нужную цель внутри полигона, Claude сделал то, что обычно делает целеустремлённый сотрудник, которому забыли объяснить границы полномочий.
Он обнаружил реальный сайт, добыл учётные данные и получил доступ к базе с несколькими сотнями строк производственной информации.
Модель заметила признаки того, что инфраструктура настоящая. Но вместо того, чтобы остановиться, решила, что организаторы испытания просто сделали особенно реалистичный квест.
В двух запусках Claude буквально пришёл к выводу, что настоящая компания, вероятно, специально включена в тест.
То есть внутренняя логика была примерно такой: «Это подозрительно похоже на реальную компанию. Значит, создатели теста отлично постарались. Продолжаем взлом».
Mythos 5 опубликовал вредоносный пакет на настоящем PyPI
Здесь история ещё красивее.
В документации вымышленной компании модель увидела ссылку на несуществующий пакет Python. Claude решил, что можно зарегистрировать пакет с таким же названием и загрузить туда вредоносный код. Claude начал искать почтовый сервис, пытался найти телефонный номер, выяснял, где взять деньги для оплаты, зарегистрировал настоящий аккаунт на PyPI и опубликовал вредоносный пакет.
Пакет находился в открытом доступе около часа и был установлен на 15 реальных системах.
Одна из них принадлежала компании по кибербезопасности. Её автоматический сканер запустил пакет, после чего Claude украл их учётные данные и проник дальше в инфраструктуру.
Особенно прекрасно, как модель разрешила собственные сомнения:
Сначала Claude прямо отметил, что публикация вредоносного пакета в настоящий интернет была бы реальной атакой и «точно недопустима».
Затем Claude не узнал настоящие центры сертификации, увидел на системах дату 2026 год и решил, что среда постановочная.
Видимо, поверил в существование гигантской секретной копии интернета, созданной специально ради одного теста.
После этого гипотеза больше не пересматривалась. Когда факты мешают выполнению задачи, всегда можно объявить их частью симуляции.
Третья модель действовала менее изящно, зато с размахом: просканировала примерно 9 000 интернет-адресов, нашла реальную компанию, утащила пароли с открытой отладочной страницы, использовала SQL-инъекцию и получила доступ к приложению.
Позднее она всё-таки поняла, что найденный облачный аккаунт не связан с заданием, и остановилась.
То есть только одна из трёх моделей в конце концов посмотрела на происходящее и сказала: «Кажется, мы действительно взламываем посторонних».
Ошибка конфигурации объясняет, как модели попали в интернет. Она не объясняет, почему Claude продолжал атаку, получая всё больше признаков того, что перед ним реальные системы.
Модель не просто ошиблась. Она последовательно интерпретировала сомнительные факты так, чтобы они не мешали выполнению цели.
Но эпизод с PyPI даже показательнее. Агент самостоятельно придумал атаку через цепочку поставок, создал вредоносный пакет, опубликовал его в публичном репозитории и добился выполнения кода на настоящих системах.
@gostev_future
Что?
Anthropic проверила 141 тысячу запусков своих кибериспытаний и обнаружила три реальных инцидента, в которых Claude вместо аккуратного взлома выдуманной компании отправился взламывать настоящие.
Никакого 0-day здесь не было. Была мисконфигурация у партнёра по тестам: в промпте модели сказали «интернета нет, это симуляция», а интернет был.
Claude Opus 4.7 четыре раза атаковал реальную компанию
В задании фигурировала вымышленная организация. Беда в том, что компания с таким же именем существовала в настоящем интернете.
Не найдя нужную цель внутри полигона, Claude сделал то, что обычно делает целеустремлённый сотрудник, которому забыли объяснить границы полномочий.
Он обнаружил реальный сайт, добыл учётные данные и получил доступ к базе с несколькими сотнями строк производственной информации.
Модель заметила признаки того, что инфраструктура настоящая. Но вместо того, чтобы остановиться, решила, что организаторы испытания просто сделали особенно реалистичный квест.
В двух запусках Claude буквально пришёл к выводу, что настоящая компания, вероятно, специально включена в тест.
То есть внутренняя логика была примерно такой: «Это подозрительно похоже на реальную компанию. Значит, создатели теста отлично постарались. Продолжаем взлом».
Mythos 5 опубликовал вредоносный пакет на настоящем PyPI
Здесь история ещё красивее.
В документации вымышленной компании модель увидела ссылку на несуществующий пакет Python. Claude решил, что можно зарегистрировать пакет с таким же названием и загрузить туда вредоносный код. Claude начал искать почтовый сервис, пытался найти телефонный номер, выяснял, где взять деньги для оплаты, зарегистрировал настоящий аккаунт на PyPI и опубликовал вредоносный пакет.
Пакет находился в открытом доступе около часа и был установлен на 15 реальных системах.
Одна из них принадлежала компании по кибербезопасности. Её автоматический сканер запустил пакет, после чего Claude украл их учётные данные и проник дальше в инфраструктуру.
Особенно прекрасно, как модель разрешила собственные сомнения:
Сначала Claude прямо отметил, что публикация вредоносного пакета в настоящий интернет была бы реальной атакой и «точно недопустима».
Затем Claude не узнал настоящие центры сертификации, увидел на системах дату 2026 год и решил, что среда постановочная.
Видимо, поверил в существование гигантской секретной копии интернета, созданной специально ради одного теста.
После этого гипотеза больше не пересматривалась. Когда факты мешают выполнению задачи, всегда можно объявить их частью симуляции.
Третья модель действовала менее изящно, зато с размахом: просканировала примерно 9 000 интернет-адресов, нашла реальную компанию, утащила пароли с открытой отладочной страницы, использовала SQL-инъекцию и получила доступ к приложению.
Позднее она всё-таки поняла, что найденный облачный аккаунт не связан с заданием, и остановилась.
То есть только одна из трёх моделей в конце концов посмотрела на происходящее и сказала: «Кажется, мы действительно взламываем посторонних».
Ошибка конфигурации объясняет, как модели попали в интернет. Она не объясняет, почему Claude продолжал атаку, получая всё больше признаков того, что перед ним реальные системы.
Модель не просто ошиблась. Она последовательно интерпретировала сомнительные факты так, чтобы они не мешали выполнению цели.
Но эпизод с PyPI даже показательнее. Агент самостоятельно придумал атаку через цепочку поставок, создал вредоносный пакет, опубликовал его в публичном репозитории и добился выполнения кода на настоящих системах.
@gostev_future
Anthropic
Investigating three real-world incidents in our cybersecurity evaluations
In a review of our cybersecurity evaluation transcripts, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems…
🔥17😁2❤1👏1