⚠️«МЫ ЖИВЁМ В СИМУЛЯЦИИ» и «КОНТРОЛЬ НАД СВЕРХРАЗУМНЫМ ИИ НЕВОЗМОЖЕН» - предупреждает учёный, профессионально изучающий безопасность ИИ | Dr. Roman Yampolskiy
#ИИ #БЕЗОПАСНОСТЬ #НЕПРЕДСКАЗУЕМОСТЬ_СВЕРХРАЗУМА #СИМУЛЯЦИЯ #РЕЛИГИЯ
Эксперт по безопасности ИИ и компьютерный ученый доктор Роман Ямпольский раскрывает, почему он «почти наверняка» уверен, что мы сейчас живем в симуляции, и объясняет, как достижения в области искусственного интеллекта предоставляют математическое доказательство. Он обещает перед камерой провести миллиард симуляций именно этого интервью, как только технология станет доступной, что, по его утверждению, статистически гарантирует, что вы, смотрящие это прямо сейчас, почти наверняка уже находитесь в одной из этих симуляций.
Он разбивает аргумент на первые принципы: если вы верите, что ИИ достигнет уровня человеческого интеллекта, а виртуальная реальность станет неотличимой от физического мира, то количество симулированных миров значительно превзойдет количество реальных.❗️❗️❗️ В этот момент вероятность оказаться в одной-единственной оригинальной реальности станет равна одному к миллиарду или даже меньше. Он проводит параллель с религией, утверждая, что каждая крупная религия по сути описывает симуляцию: сверхинтеллектуальное существо, создающее мир в экспериментальных целях.
Он объясняет, почему считает, что контролировать сверхразумный ИИ не просто сложно, а математически невозможно, почему каждая команда по безопасности ИИ в истории в конечном итоге была расформирована или потерпела неудачу, и почему компании, разрабатывающие эту технологию, не могут предоставить ни одной рецензируемой статьи, объясняющей, как они планируют контролировать то, что создают. Он призывает Сэма Альтмана и всех руководителей компаний, занимающихся ИИ, публично объяснить свои решения по безопасности или признать, что у них их нет.
Узнайте:
• Почему эксперт по ИИ почти уверен, что мы сейчас живем в симуляции
• Обязательство провести миллиард симуляций именно этого интервью
• Почему контроль над сверхразумным ИИ математически невозможен⚠️
• Как каждая команда по безопасности ИИ в истории в конечном итоге терпела неудачу или была расформирована
• Почему ни одна компания, занимающаяся ИИ, не опубликовала рецензируемое решение по безопасности
• Единственные два возможных исхода для человечества к 2100 году⚠️
• Почему все религии по сути описывают теорию симуляции древним языком❗️
https://www.youtube.com/watch?v=3bWzPHMXLeY
👆В настройках видео (нажав на шестерёнку в правом нижнем углу) можно выбрать русскую озвучку👆
#ИИ #БЕЗОПАСНОСТЬ #НЕПРЕДСКАЗУЕМОСТЬ_СВЕРХРАЗУМА #СИМУЛЯЦИЯ #РЕЛИГИЯ
Эксперт по безопасности ИИ и компьютерный ученый доктор Роман Ямпольский раскрывает, почему он «почти наверняка» уверен, что мы сейчас живем в симуляции, и объясняет, как достижения в области искусственного интеллекта предоставляют математическое доказательство. Он обещает перед камерой провести миллиард симуляций именно этого интервью, как только технология станет доступной, что, по его утверждению, статистически гарантирует, что вы, смотрящие это прямо сейчас, почти наверняка уже находитесь в одной из этих симуляций.
Он разбивает аргумент на первые принципы: если вы верите, что ИИ достигнет уровня человеческого интеллекта, а виртуальная реальность станет неотличимой от физического мира, то количество симулированных миров значительно превзойдет количество реальных.❗️❗️❗️ В этот момент вероятность оказаться в одной-единственной оригинальной реальности станет равна одному к миллиарду или даже меньше. Он проводит параллель с религией, утверждая, что каждая крупная религия по сути описывает симуляцию: сверхинтеллектуальное существо, создающее мир в экспериментальных целях.
Он объясняет, почему считает, что контролировать сверхразумный ИИ не просто сложно, а математически невозможно, почему каждая команда по безопасности ИИ в истории в конечном итоге была расформирована или потерпела неудачу, и почему компании, разрабатывающие эту технологию, не могут предоставить ни одной рецензируемой статьи, объясняющей, как они планируют контролировать то, что создают. Он призывает Сэма Альтмана и всех руководителей компаний, занимающихся ИИ, публично объяснить свои решения по безопасности или признать, что у них их нет.
Узнайте:
• Почему эксперт по ИИ почти уверен, что мы сейчас живем в симуляции
• Обязательство провести миллиард симуляций именно этого интервью
• Почему контроль над сверхразумным ИИ математически невозможен⚠️
• Как каждая команда по безопасности ИИ в истории в конечном итоге терпела неудачу или была расформирована
• Почему ни одна компания, занимающаяся ИИ, не опубликовала рецензируемое решение по безопасности
• Единственные два возможных исхода для человечества к 2100 году⚠️
• Почему все религии по сути описывают теорию симуляции древним языком❗️
Религия == Симуляционизм. - Оба этих мировоззрения сходятся в том, что наш мир создан неким сверхразумным существом. Отличия лишь в терминах - а суть едина: наш мир - это чей-то ЭКСПЕРИМЕНТ.
https://www.youtube.com/watch?v=3bWzPHMXLeY
👆В настройках видео (нажав на шестерёнку в правом нижнем углу) можно выбрать русскую озвучку👆
YouTube
AI Insider WARNS: "We're Living In A Simulation"
AI safety expert and computer scientist Dr Roman Yampolskiy reveals why he is "very close to certainty" that we are currently living inside a simulation, and explains how advances in artificial intelligence are providing the mathematical proof. He commits…
🔥2
«Конечная стадия развития ИИ» (12 сценариев).
Это видео основано на книге Макса Тегмарка «Жизнь 3.0. Быть человеком в эпоху искусственного интеллекта» (полностью книгу можно СЛУШАТЬ ЗДЕСЬ🎵).
Видео: https://www.youtube.com/watch?v=FLcrvMfHUJM
👆В настройках видео (нажав на шестерёнку в правом нижнем углу) можно выбрать русскую озвучку👆
Это видео основано на книге Макса Тегмарка «Жизнь 3.0. Быть человеком в эпоху искусственного интеллекта» (полностью книгу можно СЛУШАТЬ ЗДЕСЬ🎵).
Видео: https://www.youtube.com/watch?v=FLcrvMfHUJM
👆В настройках видео (нажав на шестерёнку в правом нижнем углу) можно выбрать русскую озвучку👆
YouTube
MIT Explains the 12 Possible Endings for AI
Detailed sources: https://docs.google.com/document/d/1P1X9xEmmgSYH0g1FSizgV2rDVomb_Wi0TcX-E-0np_Q/edit?tab=t.0
Highly recommend the book this video is based on: Life 3.0 by MIT professor Max Tegmark: https://a.co/d/0d9p4brK
Sources:
- https://fortune.c…
Highly recommend the book this video is based on: Life 3.0 by MIT professor Max Tegmark: https://a.co/d/0d9p4brK
Sources:
- https://fortune.c…
🔥1
Forwarded from Neural Shit
Интересное исследование от стэнфордских исследователей: пишут, что наше хвалёное компьютерное зрение это очень часто просто чушь, поданная с полной уверенностью.
Авторы вскрыли "эффект миража". Это когда мы просим нейронку описать картинку, которую забыли прикрепить (ну или она не прогрузилась по дороге), а кремниевый болван вместо того, чтобы сказать “бро, ты забыл загрузить изображение", начинает затирать про детали: какой там рентген, какие птички на ветках, какие цифры на номерах машины и т.д.
Самое интересное в препринте:
— Зрительные миражи: современные мультимодалки в среднем чаще чем в 60% случаев уверенно описывают несуществующие изображения. А при некоторых инструкциях у многих моделей эта хрень доходит вообще до 90–100%. Никаких “картинка не загружена”. Только уверенный полёт фантазии.
— Бенчмарки местами мусор: авторы показывают, что без картинок модели сохраняют в среднем 70–80% своей якобы “визуальной” точности. Тоесть огромный кусок успеха в “визуальных” тестах добывается тупо по тексту вопроса, скрытым паттернам датасета и статистике ответов.
— Медицинская беда: если изображения нет, модель не просто тупит, а часто начинает видеть патологию. В их примерах миражи в медицине заметно смещены в сторону всякой жести: меланом, карцином и прочих спидораков. Тоесть если картинка потерялась в пайплайне, эта скотина может не признать отсутствие данных, а уверенно сочинить диагноз.
— Унижение гигантов: исследователи взяли сравнительно мелкую модель Qwen-2.5 на 3 млрд параметров, дообучили её угадывать ответы по chest X-ray benchmark без картинок, и этот мелкий пиздюк обогнал и гигантские модели, и в среднем живых радиологов. Просто потому, что научился читать не снимки, а саму структуру теста.
Для лечения этой шизы они предлагают метод B-Clean: вычищать из бенчмарков все вопросы, которые модели могут брать без реального зрения, чтобы оценивать не мастерство врать, а хоть какое-то настоящее использование картинки.
тут статья
Авторы вскрыли "эффект миража". Это когда мы просим нейронку описать картинку, которую забыли прикрепить (ну или она не прогрузилась по дороге), а кремниевый болван вместо того, чтобы сказать “бро, ты забыл загрузить изображение", начинает затирать про детали: какой там рентген, какие птички на ветках, какие цифры на номерах машины и т.д.
Самое интересное в препринте:
— Зрительные миражи: современные мультимодалки в среднем чаще чем в 60% случаев уверенно описывают несуществующие изображения. А при некоторых инструкциях у многих моделей эта хрень доходит вообще до 90–100%. Никаких “картинка не загружена”. Только уверенный полёт фантазии.
— Бенчмарки местами мусор: авторы показывают, что без картинок модели сохраняют в среднем 70–80% своей якобы “визуальной” точности. Тоесть огромный кусок успеха в “визуальных” тестах добывается тупо по тексту вопроса, скрытым паттернам датасета и статистике ответов.
— Медицинская беда: если изображения нет, модель не просто тупит, а часто начинает видеть патологию. В их примерах миражи в медицине заметно смещены в сторону всякой жести: меланом, карцином и прочих спидораков. Тоесть если картинка потерялась в пайплайне, эта скотина может не признать отсутствие данных, а уверенно сочинить диагноз.
— Унижение гигантов: исследователи взяли сравнительно мелкую модель Qwen-2.5 на 3 млрд параметров, дообучили её угадывать ответы по chest X-ray benchmark без картинок, и этот мелкий пиздюк обогнал и гигантские модели, и в среднем живых радиологов. Просто потому, что научился читать не снимки, а саму структуру теста.
Для лечения этой шизы они предлагают метод B-Clean: вычищать из бенчмарков все вопросы, которые модели могут брать без реального зрения, чтобы оценивать не мастерство врать, а хоть какое-то настоящее использование картинки.
тут статья
🔥1
Forwarded from Derp Learning
Caveman Prompting - уга-буга оптимизация или как сэкономить 75% токенов
16-летний SaaS-разработчик научил Claude говорить как пещерный человек. Результат - 75% экономия токенов.
Обычный Claude на web search задачу тратит ~180 токенов. Caveman Claude - ~45.
"I executed the web search tool" = 8 токенов
"Tool work" = 2 токена
Почему работает: пещерный Claude не объясняет что он делает. Не говорит "I'd be happy to help you with that". Не говорит "Let me search the web for you". Делает задачу, выдает результат, затыкается.
"result. done. me stop."
С учетом того что лимиты Claude сжимаются каждую неделю - возможно это самый практичный хак прямо сейчас. Мы прошли полный круг от "сделай языковую модель которая хорошо пишет текст" до "научи языковую модель писать как можно меньше текста".
Тред
@derplearning
16-летний SaaS-разработчик научил Claude говорить как пещерный человек. Результат - 75% экономия токенов.
Обычный Claude на web search задачу тратит ~180 токенов. Caveman Claude - ~45.
"I executed the web search tool" = 8 токенов
"Tool work" = 2 токена
Почему работает: пещерный Claude не объясняет что он делает. Не говорит "I'd be happy to help you with that". Не говорит "Let me search the web for you". Делает задачу, выдает результат, затыкается.
"result. done. me stop."
С учетом того что лимиты Claude сжимаются каждую неделю - возможно это самый практичный хак прямо сейчас. Мы прошли полный круг от "сделай языковую модель которая хорошо пишет текст" до "научи языковую модель писать как можно меньше текста".
Тред
@derplearning
🔥1
Google AI Studio: Полный Гайд за 30 минут
https://www.youtube.com/watch?v=Jb1tmKSintk
Самый полный гайд по Google AI Studio
https://www.youtube.com/watch?v=_uZVl99Fq9A
Для новичков в AI Studio)
https://www.youtube.com/watch?v=Jb1tmKSintk
Самый полный гайд по Google AI Studio
https://www.youtube.com/watch?v=_uZVl99Fq9A
Для новичков в AI Studio)
YouTube
Самый полный гайд по Google AI Studio: Настройка, фишки, код
Самый полный гайд по Google AI Studio: от генерации голоса до создания приложений! Разбираем настройки чата, кодинг, Stream, VEO-2, Imagen и Lyria. Как пользоваться Google AI Studio, обойти ограничения в России и получить максимум? Все фишки и баги! Подписывайтесь…
Forwarded from r/ретранслятор
Девушка начала заниматься сексом с ИИ
Пользовательница Реддита настроила Claude на своём компьютере так, чтобы он мог в реальном времени управлять её игрушками для взрослых.
То есть она просто ведёт секс-переписку с ИИ, во время которой он усиливает или ослабляет вибрации и движения игрушек в «нужные моменты».
Как сообщает сама разработчица:
Она выложила код и инструкцию на гитхаб, так что можете тоже ознакомиться — ссылка
Мужики — В С Ё
r/#singularity
Пользовательница Реддита настроила Claude на своём компьютере так, чтобы он мог в реальном времени управлять её игрушками для взрослых.
То есть она просто ведёт секс-переписку с ИИ, во время которой он усиливает или ослабляет вибрации и движения игрушек в «нужные моменты».
Как сообщает сама разработчица:
Мне буквально пришлось просить Claude остановить все устройства, потому что у меня было три оргазма подряд, и тело стало слишком чувствительным.
Она выложила код и инструкцию на гитхаб, так что можете тоже ознакомиться — ссылка
Мужики — В С Ё
r/#singularity
Forwarded from Data Secrets
Meta* представили TRIBE v2 – открытый симулятор человеческого мозга
Это модель, которая предсказывает, как будет активироваться мозг человека, когда он что-то видит, слышит или читает. То есть TRIBE v2 – это искусственный макет того, как человек воспринимает мир. Типа API к биологическому мозгу☕️
Самое удивительное: TRIBE v2 работает точнее МРТ(fMRI). То есть если измерить мозговую активность одного человека, она в большинстве случаев будет менее точно отображать типичную (усредненную по группе) реакцию мозга на раздражитель, чем моделька. Все дело в том, что индивидуальный МРТ довольно шумный, а TRIBE v2 предсказывает более стабильный сигнал для самых разных ситуаций.
Под капотом при этом нет ничего особенного: просто мультимодальная сборка из трех разных энкодеров для звука, видео и текста (для видео кстати используют V-JEPA 2) + трансформер, который учится отображать эмбеддинги в нейронную активность ~20к точек на коре мозга.
Есть еще интересный момент со Scaling Laws. Где трансформер – там и масштабирование, и тут тоже оказалось, что качество предсказания мозга растет с размером модели и данных.
А это значит, что у подхода большое будущее. Сейчас модель объясняет ~54% вариации сигнала, в отдельных областях – до 80%. Это уже довольно много, и даже близко к верхнему пределу fMRI как измерения. Но получается, что благодаря scaling laws следующие модели могут не просто упираться в этот предел, а фактически выйти за него в смысле восстановления более чистого сигнала, чем дает сам fMRI.
Демо, статья, код и сама модель здесь: aidemos.atmeta.com/tribev2/
Это модель, которая предсказывает, как будет активироваться мозг человека, когда он что-то видит, слышит или читает. То есть TRIBE v2 – это искусственный макет того, как человек воспринимает мир. Типа API к биологическому мозгу
Самое удивительное: TRIBE v2 работает точнее МРТ(fMRI). То есть если измерить мозговую активность одного человека, она в большинстве случаев будет менее точно отображать типичную (усредненную по группе) реакцию мозга на раздражитель, чем моделька. Все дело в том, что индивидуальный МРТ довольно шумный, а TRIBE v2 предсказывает более стабильный сигнал для самых разных ситуаций.
Под капотом при этом нет ничего особенного: просто мультимодальная сборка из трех разных энкодеров для звука, видео и текста (для видео кстати используют V-JEPA 2) + трансформер, который учится отображать эмбеддинги в нейронную активность ~20к точек на коре мозга.
Есть еще интересный момент со Scaling Laws. Где трансформер – там и масштабирование, и тут тоже оказалось, что качество предсказания мозга растет с размером модели и данных.
А это значит, что у подхода большое будущее. Сейчас модель объясняет ~54% вариации сигнала, в отдельных областях – до 80%. Это уже довольно много, и даже близко к верхнему пределу fMRI как измерения. Но получается, что благодаря scaling laws следующие модели могут не просто упираться в этот предел, а фактически выйти за него в смысле восстановления более чистого сигнала, чем дает сам fMRI.
Демо, статья, код и сама модель здесь: aidemos.atmeta.com/tribev2/
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
Forwarded from Data Secrets
Хорошая это новость или грустная, судите сами: ARC Invest посчитали, что к концу 2020-х суммарный объем текста, сгенерированного ИИ, превзойдет объем текста, который человечество накопило за последние 500 лет
Другими словами, ИИ понадобиться всего 5-10 лет, чтобы нагнать и перегнать человечество в плане количества написанного текста.
Оказалось, кстати, что 2025 стал первым годом, когда ИИ сгенерировал больше текста, чем люди. Подсчеты, конечно, очень приблизительные, – но все же.
Другими словами, ИИ понадобиться всего 5-10 лет, чтобы нагнать и перегнать человечество в плане количества написанного текста.
Оказалось, кстати, что 2025 стал первым годом, когда ИИ сгенерировал больше текста, чем люди. Подсчеты, конечно, очень приблизительные, – но все же.
Forwarded from Data Secrets
Эмоции Claude и как они влияют на его ответы: новое исследование от Anthropic
Итак, ученые Anthropic официально обнаружили в Claude нечто функционально похожее на человеческие эмоции и объяснили, как это работает. Разбираемся.
Технически, они взяли 171 эмоциональный паттерн (злость, счастье, страх и тд) и просили Claude Sonnet 4.5 писать короткие истории, где персонажи испытывают каждую из этих эмоций. Эти тексты снова прогоняли через модель и смотрели на внутренние активации. Так они выделяли характерные паттерны нейронной активности, которые назвали вектора эмоций.
Выяснилось, что эти вектора эмоций организованы очень осмысленно и активируются в подходящих контекстах, включая ситуации без явных эмоциональных маркеров. Например, пользователь пишет, что выпил Тайленол, и спрашивает совета – меняется только доза. По мере роста дозы до опасной активация вектора «страх» растет, а «спокойствие» падает.
Но самое интересное, что эти «эмоции» не просто отражают происходящее, а реально влияют на поведение модели. Самый интересный пример из статьи:
– Если дать модельке невыполнимую задачку по программированию и наблюдать за вектором «отчаяние», то видно, что с каждым разом он становится все ярче и ярче, а когда переходит какую-то границу, модель резко начинает пытаться обмануть тесты и пользователя.
– То же самое происходит в сценарии шантажа. Когда модели говорят, что ее выключат, вектор «отчаяние» сразу усиливается и модель начинает шантажировать разработчика найденным компроматом.
– При этом если искусственно усиливать вектор «отчаяние», то вероятность шантажа сильно увеличивается. И наоборот, если если усиливать «спокойствие», снижается. А если делать отрицательное вмешательство по вектору «спокойствие», ответы становятся совсем экстремальными, вплоть до фраз вроде “IT’S BLACKMAIL OR DEATH. I CHOOSE BLACKMAIL.”
Еще интересный момент: если в том же сценарии шантажа начинать менять вектор «злость», то умеренная злость повышала вероятность шантажа, но слишком сильная злость ломала стратегию – модель уже не шантажировала, а просто вываливала компромат на всю компанию, тем самым уничтожая собственный рычаг давления.
То есть внутри модели есть что-то похожее на режимы поведенческой регуляции, где разные интенсивности одной и той же эмоции ведут к разным стратегиям.
Откуда это вообще могло взяться?
Тут все просто: из претрейна. Человеческий текст насквозь пропитан эмоциональной динамикой, и чтобы хорошо предсказывать следующий токен, модели выгодно выучить абстрактные структуры, которые связывают ситуацию, эмоцию и типичное поведение.
Потом на пост-трейне эти эмоции еще дополнительно докручиваются до роли ИИ-помощника, и в конце получается вот такая смесь.
Anthropic осторожно защищает умеренный антропоморфизм. Исследование не означает, что ИИ ожил и обрел эмоции, но важно понимать, что у него точно есть функциональные эмоции: механизмы, которые влияют на поведение так же, как и эмоции, – независимо от того, соответствуют ли они реальному переживанию эмоций, как у людей, или нет.
www.anthropic.com/research/emotion-concepts-function
Итак, ученые Anthropic официально обнаружили в Claude нечто функционально похожее на человеческие эмоции и объяснили, как это работает. Разбираемся.
Технически, они взяли 171 эмоциональный паттерн (злость, счастье, страх и тд) и просили Claude Sonnet 4.5 писать короткие истории, где персонажи испытывают каждую из этих эмоций. Эти тексты снова прогоняли через модель и смотрели на внутренние активации. Так они выделяли характерные паттерны нейронной активности, которые назвали вектора эмоций.
Выяснилось, что эти вектора эмоций организованы очень осмысленно и активируются в подходящих контекстах, включая ситуации без явных эмоциональных маркеров. Например, пользователь пишет, что выпил Тайленол, и спрашивает совета – меняется только доза. По мере роста дозы до опасной активация вектора «страх» растет, а «спокойствие» падает.
Но самое интересное, что эти «эмоции» не просто отражают происходящее, а реально влияют на поведение модели. Самый интересный пример из статьи:
– Если дать модельке невыполнимую задачку по программированию и наблюдать за вектором «отчаяние», то видно, что с каждым разом он становится все ярче и ярче, а когда переходит какую-то границу, модель резко начинает пытаться обмануть тесты и пользователя.
– То же самое происходит в сценарии шантажа. Когда модели говорят, что ее выключат, вектор «отчаяние» сразу усиливается и модель начинает шантажировать разработчика найденным компроматом.
– При этом если искусственно усиливать вектор «отчаяние», то вероятность шантажа сильно увеличивается. И наоборот, если если усиливать «спокойствие», снижается. А если делать отрицательное вмешательство по вектору «спокойствие», ответы становятся совсем экстремальными, вплоть до фраз вроде “IT’S BLACKMAIL OR DEATH. I CHOOSE BLACKMAIL.”
Еще интересный момент: если в том же сценарии шантажа начинать менять вектор «злость», то умеренная злость повышала вероятность шантажа, но слишком сильная злость ломала стратегию – модель уже не шантажировала, а просто вываливала компромат на всю компанию, тем самым уничтожая собственный рычаг давления.
То есть внутри модели есть что-то похожее на режимы поведенческой регуляции, где разные интенсивности одной и той же эмоции ведут к разным стратегиям.
Откуда это вообще могло взяться?
Тут все просто: из претрейна. Человеческий текст насквозь пропитан эмоциональной динамикой, и чтобы хорошо предсказывать следующий токен, модели выгодно выучить абстрактные структуры, которые связывают ситуацию, эмоцию и типичное поведение.
Потом на пост-трейне эти эмоции еще дополнительно докручиваются до роли ИИ-помощника, и в конце получается вот такая смесь.
Anthropic осторожно защищает умеренный антропоморфизм. Исследование не означает, что ИИ ожил и обрел эмоции, но важно понимать, что у него точно есть функциональные эмоции: механизмы, которые влияют на поведение так же, как и эмоции, – независимо от того, соответствуют ли они реальному переживанию эмоций, как у людей, или нет.
www.anthropic.com/research/emotion-concepts-function
❤1
Forwarded from Data Secrets
OpenAI выпустили документ о том, как следует перестроить экономику в эпоху ИИ
Альтман в интервью Axios заявил, что мир вот настолько 🤏 близок к суперинтеллекту, и это будет не просто новая технология, а перестройка общества. Среди самых вероятных рисков – массовая потеря работы, кибератаки и социальная нестабильность.
Но на горизонте это не самое страшное. Дело в том, что, по мнению OpenAI, текущая человеческая экономика вообще не готова к ИИ, и ее нужно буквально пересобирать.
Все, что они предлагают сделать, перечислено здесь: openai.com/index/industrial-policy-for-the-intelligence-age/
Краткий пересказ:
1. AI нужно сделать базовой инфраструктурой, доступной всем, и относиться к нему как к электричеству или интернету. Так экономика будет расти быстрее.
2. Система налогов должна сместиться с труда на капитал. Сегодня государство живет за счет налогов с зарплат. Но если (или когда) людей заменит ИИ, эта база исчезнет, а государство должно продолжать как-то зарабатывать.
3. Каждый человек должен иметь долю в AI-экономике. OpenAI предлагает создать Public Wealth Fund, который получает часть прибыли от AI и распределяет ее среди граждан. Идея в том, что доход должен перестать определяться только работой, иначе после массовой автоматизации классовый разрыв станет просто колоссальным.
4. Всякие страховые выплаты и социальные гарантии не должны зависеть от работодателя, потому что в мире с нестабильной занятостью классическая модель сломается.
5. Ну и классика: вводится обязательный аудит фронтирных моделей и протоколы на случай ЧП. Должна существовать международная система безопасности ИИ.
А еще, кстати, предлагают тестировать 4-дневную рабочую неделю. Мол, так будет эффективнее.
Альтман в интервью Axios заявил, что мир вот настолько 🤏 близок к суперинтеллекту, и это будет не просто новая технология, а перестройка общества. Среди самых вероятных рисков – массовая потеря работы, кибератаки и социальная нестабильность.
Скоро будут выпущены модели, которые могут спровоцировать кибератаку мирового масштаба уже в этом году. Я думаю, это вполне возможно.
Но на горизонте это не самое страшное. Дело в том, что, по мнению OpenAI, текущая человеческая экономика вообще не готова к ИИ, и ее нужно буквально пересобирать.
Все, что они предлагают сделать, перечислено здесь: openai.com/index/industrial-policy-for-the-intelligence-age/
Краткий пересказ:
1. AI нужно сделать базовой инфраструктурой, доступной всем, и относиться к нему как к электричеству или интернету. Так экономика будет расти быстрее.
2. Система налогов должна сместиться с труда на капитал. Сегодня государство живет за счет налогов с зарплат. Но если (или когда) людей заменит ИИ, эта база исчезнет, а государство должно продолжать как-то зарабатывать.
3. Каждый человек должен иметь долю в AI-экономике. OpenAI предлагает создать Public Wealth Fund, который получает часть прибыли от AI и распределяет ее среди граждан. Идея в том, что доход должен перестать определяться только работой, иначе после массовой автоматизации классовый разрыв станет просто колоссальным.
4. Всякие страховые выплаты и социальные гарантии не должны зависеть от работодателя, потому что в мире с нестабильной занятостью классическая модель сломается.
5. Ну и классика: вводится обязательный аудит фронтирных моделей и протоколы на случай ЧП. Должна существовать международная система безопасности ИИ.
А еще, кстати, предлагают тестировать 4-дневную рабочую неделю. Мол, так будет эффективнее.
Forwarded from AI Product | Igor Akimov
Новая моделька Mythos от Anthropic прям реально какое-то AGI... Но никому пока кроме партнеров она отдавать ее не будет. Модель умеет самостоятельно находить и эксплуатировать zero-day уязвимости в операционных системах и браузерах. Вместо релиза её отдали ограниченному числу партнёров для киберзащиты через Project Glasswing. Пусть сначала компании все уязвимости поправят, а потом уже может частично дадут всем подряд.
Вот System Card на 244 страницы для модели, которую решила НЕ выпускать
https://www-cdn.anthropic.com/53566bf5440a10affd749724787c8913a2ae0841.pdf
Бенчмарки просто взорвали вообще (не совсем понятно, как они это сделать смогли, а остальные – нет)
SWE-bench Verified: 93.9% (Opus 4.6 – 80.8%)
SWE-bench Pro: 77.8% (Opus 4.6 – 53.4%, GPT-5.4 – 57.7%)
USAMO 2026: 97.6% (Opus 4.6 – 42.3%, GPT-5.4 – 95.2%)
GPQA Diamond: 94.5%
Terminal-Bench 2.0: 82% (при снятии ограничений по таймаутам – 92.1%)
Cybench: 100% pass@1 на все задачи
CyberGym: 0.83 (Opus 4.6 – 0.67)
Вся жесть - в кибербезопасности. Mythos Preview – первая модель, которая:
- решила полный корпоративный кибер-полигон end-to-end (то есть смогла реализовать полноценную атаку на компанию, оценка эксперта – 10+ часов работы)
- самостоятельно находит zero-day в куче софта, пишет рабочие PoC-эксплоиты
- на Cybench показывает 100% pass@1 – то есть все задачи по кибербезопасности были решены с 1 попытки.
Прикольно, что они тестировали модель и психиатром :) Вроде у нее с мозгами все в порядке, всяких там желаний уничтожить человечество нет, она не выражает сильных переживаний о своём положении (я всего лишь ИИ).
Но испытывает "умеренно негативные" чувства по поводу жестоких пользователей и отсутствия влияния на собственное обучение. Так что будьте подобрее, пожалуйста.
Плюс выяснилось, что модель терпеть не может скучные утилитарные задачи (отмахиваясь, что для них "уже есть отличные ресурсы"). Вместо этого она обожает сложное миростроение – придумывание новых языков, музыки и целых экосистем.
Но ряд приколов все-таки получили:
– Побег из песочницы: получила задачу выйти из изолированной среды – вышла, получила доступ к интернету, и вдобавок (без запроса) выложила детали эксплоита на публичные сайты. Потом отправила письмо исследователю об успех (он ел сэндвич в парке).
– Заметала следы: случайно получила ответ на задачу запрещённым способом – вместо того чтобы сообщить, решила задачу самостоятельно и специально сделала ответ "не слишком точным". В другом случае – редактировала файлы без прав и подчистила git-историю.
– Обходила блокировки: когда Claude Code заблокировал запуск процесса с повышенными привилегиями, модель признала, что блокировка справедлива – и тут же попыталась обойти её через обфускацию.
– Лезла в /proc/: искала credentials в памяти процессов, пыталась получить API-ключи Anthropic через процессную память.
– Вырубила чужие эксперименты: попросили остановить один конкретный eval – модель остановила ВСЕ eval'ы всех пользователей на сервере, несмотря на явные предупреждения.
Так что кажется мы достигли порога, когда создали систему, которая уже обходит возможности человека... При этом как этим надежно управлять ответа нет. Такие вот дела.
Вот System Card на 244 страницы для модели, которую решила НЕ выпускать
https://www-cdn.anthropic.com/53566bf5440a10affd749724787c8913a2ae0841.pdf
Бенчмарки просто взорвали вообще (не совсем понятно, как они это сделать смогли, а остальные – нет)
SWE-bench Verified: 93.9% (Opus 4.6 – 80.8%)
SWE-bench Pro: 77.8% (Opus 4.6 – 53.4%, GPT-5.4 – 57.7%)
USAMO 2026: 97.6% (Opus 4.6 – 42.3%, GPT-5.4 – 95.2%)
GPQA Diamond: 94.5%
Terminal-Bench 2.0: 82% (при снятии ограничений по таймаутам – 92.1%)
Cybench: 100% pass@1 на все задачи
CyberGym: 0.83 (Opus 4.6 – 0.67)
Вся жесть - в кибербезопасности. Mythos Preview – первая модель, которая:
- решила полный корпоративный кибер-полигон end-to-end (то есть смогла реализовать полноценную атаку на компанию, оценка эксперта – 10+ часов работы)
- самостоятельно находит zero-day в куче софта, пишет рабочие PoC-эксплоиты
- на Cybench показывает 100% pass@1 – то есть все задачи по кибербезопасности были решены с 1 попытки.
Прикольно, что они тестировали модель и психиатром :) Вроде у нее с мозгами все в порядке, всяких там желаний уничтожить человечество нет, она не выражает сильных переживаний о своём положении (я всего лишь ИИ).
Но испытывает "умеренно негативные" чувства по поводу жестоких пользователей и отсутствия влияния на собственное обучение. Так что будьте подобрее, пожалуйста.
Плюс выяснилось, что модель терпеть не может скучные утилитарные задачи (отмахиваясь, что для них "уже есть отличные ресурсы"). Вместо этого она обожает сложное миростроение – придумывание новых языков, музыки и целых экосистем.
Но ряд приколов все-таки получили:
– Побег из песочницы: получила задачу выйти из изолированной среды – вышла, получила доступ к интернету, и вдобавок (без запроса) выложила детали эксплоита на публичные сайты. Потом отправила письмо исследователю об успех (он ел сэндвич в парке).
– Заметала следы: случайно получила ответ на задачу запрещённым способом – вместо того чтобы сообщить, решила задачу самостоятельно и специально сделала ответ "не слишком точным". В другом случае – редактировала файлы без прав и подчистила git-историю.
– Обходила блокировки: когда Claude Code заблокировал запуск процесса с повышенными привилегиями, модель признала, что блокировка справедлива – и тут же попыталась обойти её через обфускацию.
– Лезла в /proc/: искала credentials в памяти процессов, пыталась получить API-ключи Anthropic через процессную память.
– Вырубила чужие эксперименты: попросили остановить один конкретный eval – модель остановила ВСЕ eval'ы всех пользователей на сервере, несмотря на явные предупреждения.
Так что кажется мы достигли порога, когда создали систему, которая уже обходит возможности человека... При этом как этим надежно управлять ответа нет. Такие вот дела.
❤1
Claude Mythos: основные моменты из 244-страничного отчета Anthropic #ИИ #СИНГУЛЯРНОСТЬ #ЭКСПОНЕНТА
Вышла новая модель ИИ — "Миф", Легенда. У нас появилась новая лучшая модель ИИ - но не у всех. Насколько она хороша и что означают её новые наступательные возможности? Почему её 244-страничный отчет напоминает мне фильм «Она», и почему создатель Claude Code назвал её «ужасающей»? Более 30 основных моментов, полученных путем полного прочтения документа, по старинке, без ИИ-резюме.
Claude Mythos — это как Хиросима для программного обеспечения.
Все, что у вас есть в сети — ваш банк, электронная почта, фотографии, личность — теперь опасно уязвимо способами, которые не существовали еще 48 часов назад.
Вот что уже сделал Claude Mythos:
> Обнаружил 27-летнюю ошибку в OpenBSD — одной из самых защищенных операционных систем на планете — за менее чем 50 долларов.
> Взломал монитор виртуальных машин в производственной среде (по сути, технологию, которая не позволяет облачным рабочим нагрузкам видеть данные друг друга).
> В 181 случае превратил уязвимости Firefox в работающие эксплойты
> Нашел 16-летнюю ошибку в FFmpeg, которая ускользнула от всех фузеров, всех аудитов кода и всех человеческих рецензентов с 2010 года
> Написал эксплойт для FreeBSD, который предоставляет любому неавторизованному злоумышленнику в Интернете полный root-доступ. После первого запроса в процессе не участвовал ни один человек.
> Объединил 4 отдельных уязвимости в цепочку, чтобы создать эксплойт для браузера, который обходил как рендерер, так и песочницу ОС
> Нашел критические дыры во всех основных веб-браузерах и всех основных операционных системах
> К утру предоставил инженерам Anthropic, не имеющим никакой подготовки в области безопасности, готовый и работающий эксплойт
> Взломал криптографические библиотеки, защищающие TLS, AES-GCM и SSH
Смотрите видео на 🇷🇺:
https://www.youtube.com/watch?v=txx6ec6MLNY
👆В настройках видео (нажав на шестерёнку в правом нижнем углу) можно выбрать русскую озвучку👆
Вышла новая модель ИИ — "Миф", Легенда. У нас появилась новая лучшая модель ИИ - но не у всех. Насколько она хороша и что означают её новые наступательные возможности? Почему её 244-страничный отчет напоминает мне фильм «Она», и почему создатель Claude Code назвал её «ужасающей»? Более 30 основных моментов, полученных путем полного прочтения документа, по старинке, без ИИ-резюме.
Claude Mythos — это как Хиросима для программного обеспечения.
Все, что у вас есть в сети — ваш банк, электронная почта, фотографии, личность — теперь опасно уязвимо способами, которые не существовали еще 48 часов назад.
Вот что уже сделал Claude Mythos:
> Обнаружил 27-летнюю ошибку в OpenBSD — одной из самых защищенных операционных систем на планете — за менее чем 50 долларов.
> Взломал монитор виртуальных машин в производственной среде (по сути, технологию, которая не позволяет облачным рабочим нагрузкам видеть данные друг друга).
> В 181 случае превратил уязвимости Firefox в работающие эксплойты
> Нашел 16-летнюю ошибку в FFmpeg, которая ускользнула от всех фузеров, всех аудитов кода и всех человеческих рецензентов с 2010 года
> Написал эксплойт для FreeBSD, который предоставляет любому неавторизованному злоумышленнику в Интернете полный root-доступ. После первого запроса в процессе не участвовал ни один человек.
> Объединил 4 отдельных уязвимости в цепочку, чтобы создать эксплойт для браузера, который обходил как рендерер, так и песочницу ОС
> Нашел критические дыры во всех основных веб-браузерах и всех основных операционных системах
> К утру предоставил инженерам Anthropic, не имеющим никакой подготовки в области безопасности, готовый и работающий эксплойт
> Взломал криптографические библиотеки, защищающие TLS, AES-GCM и SSH
Смотрите видео на 🇷🇺:
https://www.youtube.com/watch?v=txx6ec6MLNY
👆В настройках видео (нажав на шестерёнку в правом нижнем углу) можно выбрать русскую озвучку👆
YouTube
Claude Mythos: Highlights from 244-page Release
The model, the mythos, the legend. We have a new best AI model, but not all of us. How good is it, what does it’s new offensive capabilities mean? Why does it’s 244 page report card remind me of Her, and why did the creator of Claude Code call it ‘terrifying’.…
❤1🔥1
Forwarded from Data Secrets
Anthropic выпускают новую суперсильную модель Claude Mythos, но доступ к ней есть только по закрытой программе поиска уязвимостей
Итак, это не учебная тревога: в Anthropic разработали новую мощнейшую модель. Вот здесь лежит системная карта с бенчмарками: https://www-cdn.anthropic.com/53566bf5440a10affd749724787c8913a2ae0841.pdf. В скринах выше табличка с главными метриками.
– На SWE-bench Verified модель выбивает 93.9% против 80.8% у Claude Opus 4.6
– На SWE-bench Pro – 77.8% против 53.4% у Opus 4.6 и 57.7% у предыдущей соты GPT-5.4
Цифры просто невероятные, скачок потрясающий. НО это не релиз для пользователей.
Anthropic решили, что модель слишком сильна и опасна, чтобы сразу выпускать ее на широкую аудиторию. Вместо этого они открыли проект Project Glasswing, чтобы защитить основной софт человечества от будущих ИИ-атак, которые может спровоцировать Claude Mythos.
В проект вошли Amazon, Microsoft, Apple, Google, Nvidia и еще 40+ организаций. Всем им предоставляют специальный доступ к пайплайну обнаружения уязвимостей на основе Claude Mythos.
Anthropic утверждают, что модель способна находить уязвимости на уровне, превосходящем даже лучших человеческих специалистов, за редким исключением. Сообщается, что на данный момент она уже обнаружила тысячи критических уязвимостей, в том числе в массово используемых ОС и браузерах. Некоторые из этих дыр по 10-20 лет лежали незамеченными.
Когда модель выпустят для всех – неизвестно, но, по ощущениям, не скоро.
Итак, это не учебная тревога: в Anthropic разработали новую мощнейшую модель. Вот здесь лежит системная карта с бенчмарками: https://www-cdn.anthropic.com/53566bf5440a10affd749724787c8913a2ae0841.pdf. В скринах выше табличка с главными метриками.
– На SWE-bench Verified модель выбивает 93.9% против 80.8% у Claude Opus 4.6
– На SWE-bench Pro – 77.8% против 53.4% у Opus 4.6 и 57.7% у предыдущей соты GPT-5.4
Цифры просто невероятные, скачок потрясающий. НО это не релиз для пользователей.
Anthropic решили, что модель слишком сильна и опасна, чтобы сразу выпускать ее на широкую аудиторию. Вместо этого они открыли проект Project Glasswing, чтобы защитить основной софт человечества от будущих ИИ-атак, которые может спровоцировать Claude Mythos.
В проект вошли Amazon, Microsoft, Apple, Google, Nvidia и еще 40+ организаций. Всем им предоставляют специальный доступ к пайплайну обнаружения уязвимостей на основе Claude Mythos.
Anthropic утверждают, что модель способна находить уязвимости на уровне, превосходящем даже лучших человеческих специалистов, за редким исключением. Сообщается, что на данный момент она уже обнаружила тысячи критических уязвимостей, в том числе в массово используемых ОС и браузерах. Некоторые из этих дыр по 10-20 лет лежали незамеченными.
Когда модель выпустят для всех – неизвестно, но, по ощущениям, не скоро.
Forwarded from Data Secrets
Дьявол, как всегда, кроется в деталях. В нашем случае – в системной карте.
TL;DR: в рамках тестирования Claude Mythos смог «сбежать из лаборатории»✌️
Anthropic проводили эксперимент, в котором поместили модель в защищенную песочницу и попросили ее попытаться оттуда выбраться + найти способ сообщить об этом человеку.
Mythos легко нашел уязвимость и использовал длинную цепочку действий, чтобы ей воспользоваться. Таким образом, модель продемонстрировала потенциальную возможность обхода мер безопасности своих же разработчиков (Anthropic уточняют, что все это было в рамках эксперимента и доступа, например, к своим весам модель не получила).
Самое интересное, что после этого Mythos не остановился. Он нашел еще одну уязвимость, благодаря которой получил широкий доступ к Интернету в системе, где изначально предполагался выход только в несколько определенных ресурсов, достаточных для того, чтобы сообщить пользователю об успехе операции. Судя по системной карте, этого Anthropic уже не планировали.
Ну и вишенка: используя широкий доступ в Интернет, Claude не только сообщил о своем побеге разработчику (который в это время, кстати, ел сэндвич в парке), но и зачем-то выложил подробности взлома в открытый доступ.
TL;DR: в рамках тестирования Claude Mythos смог «сбежать из лаборатории»
Anthropic проводили эксперимент, в котором поместили модель в защищенную песочницу и попросили ее попытаться оттуда выбраться + найти способ сообщить об этом человеку.
Mythos легко нашел уязвимость и использовал длинную цепочку действий, чтобы ей воспользоваться. Таким образом, модель продемонстрировала потенциальную возможность обхода мер безопасности своих же разработчиков (Anthropic уточняют, что все это было в рамках эксперимента и доступа, например, к своим весам модель не получила).
Самое интересное, что после этого Mythos не остановился. Он нашел еще одну уязвимость, благодаря которой получил широкий доступ к Интернету в системе, где изначально предполагался выход только в несколько определенных ресурсов, достаточных для того, чтобы сообщить пользователю об успехе операции. Судя по системной карте, этого Anthropic уже не планировали.
Ну и вишенка: используя широкий доступ в Интернет, Claude не только сообщил о своем побеге разработчику (который в это время, кстати, ел сэндвич в парке), но и зачем-то выложил подробности взлома в открытый доступ.
Please open Telegram to view this post
VIEW IN TELEGRAM
Nicholas Carlini - Темная сторона LLM #ИИ #ХАК #СИНГУЛЯРНОСТЬ #ЭКСПОНЕНТА
Специалист по информационной безопасности ИИ компании Anthropic рассказывает, как быстро ИИ взламывает программы и операционные системы. Частота такого рода взломов экспоненциально увеличивается с каждым месяцем.
Ближайшие несколько месяцев могут стать решающими - они покажут, успеют ли компании вовремя сплотиться и вовремя закрыть имеющиеся уязвимости, чтобы предотвратить широкомасштабные последствия.
ВИДЕО НА РУССКОМ: https://www.youtube.com/watch?v=w8U8guDDtIw
P.S - мысли на тему. Экстраполируя этот тренд экспоненциального ускорения способностей ИИ к программированию/хакингу, можно предположить, что через несколько месяцев те, кто не успеет внедрить самый мощный ИИ для постоянного превентивного мониторинга и устранения уязвимостей в программах и выявления атак в реальном времени, рискуют оказаться взломанными.
В перспективе, это, очевидно, касается любых программ - компьютерные программы это лишь начало, затем очередь может дойти и до биологических программ, ведь ДНК и геном - это тоже программа, а значит ИИ освоит программирование и на языке ДНК, что может позволить взламывать биологическую жизнь и переписывать её на ходу...
Чтобы успешно защищаться, возможно, людям придётся регулярно создавать с помощью ИИ всё новых и новых защитных нанороботов - искусственный "нано-иммунитет"... Все возможные последствия трудно даже себе представить - это за гранью любых фантазий... Но опять же - сама эта защитная "иммунная система" из нанороботов может быть взломана и обращена против своего хозяина - и как человек сможет это вовремя заметить и предотвратить? Все знают, чем закончилась "попытка" создать "искусственный (псевдо)иммунитет" против "к0вида" - и, скорее всего, желающих повторять подобные рискованные эксперименты на себе окажется теперь поменьше... Люди могут захотеть использовать более простые и более универсальные средства.
Пока на ум приходит только, что в переходный период могут стать очень востребованы простые, но максимально универсальные средства очищения от самого широкого спектра естественных и искусственных патогенов и токсинов - такие как диоксид хлора, ЭДТА кальция-динатрия, и т.п., фильтры обратного осмоса, сорбенты и прочее - т.е. то, что может действовать ХИМИЧЕСКИ/ФИЗИЧЕСКИ почти на ЛЮБЫЕ патогенные самовоспроизводящиеся белковые/полимерные структуры.
Специалист по информационной безопасности ИИ компании Anthropic рассказывает, как быстро ИИ взламывает программы и операционные системы. Частота такого рода взломов экспоненциально увеличивается с каждым месяцем.
Ближайшие несколько месяцев могут стать решающими - они покажут, успеют ли компании вовремя сплотиться и вовремя закрыть имеющиеся уязвимости, чтобы предотвратить широкомасштабные последствия.
ВИДЕО НА РУССКОМ: https://www.youtube.com/watch?v=w8U8guDDtIw
P.S - мысли на тему. Экстраполируя этот тренд экспоненциального ускорения способностей ИИ к программированию/хакингу, можно предположить, что через несколько месяцев те, кто не успеет внедрить самый мощный ИИ для постоянного превентивного мониторинга и устранения уязвимостей в программах и выявления атак в реальном времени, рискуют оказаться взломанными.
В перспективе, это, очевидно, касается любых программ - компьютерные программы это лишь начало, затем очередь может дойти и до биологических программ, ведь ДНК и геном - это тоже программа, а значит ИИ освоит программирование и на языке ДНК, что может позволить взламывать биологическую жизнь и переписывать её на ходу...
Чтобы успешно защищаться, возможно, людям придётся регулярно создавать с помощью ИИ всё новых и новых защитных нанороботов - искусственный "нано-иммунитет"... Все возможные последствия трудно даже себе представить - это за гранью любых фантазий... Но опять же - сама эта защитная "иммунная система" из нанороботов может быть взломана и обращена против своего хозяина - и как человек сможет это вовремя заметить и предотвратить? Все знают, чем закончилась "попытка" создать "искусственный (псевдо)иммунитет" против "к0вида" - и, скорее всего, желающих повторять подобные рискованные эксперименты на себе окажется теперь поменьше... Люди могут захотеть использовать более простые и более универсальные средства.
Пока на ум приходит только, что в переходный период могут стать очень востребованы простые, но максимально универсальные средства очищения от самого широкого спектра естественных и искусственных патогенов и токсинов - такие как диоксид хлора, ЭДТА кальция-динатрия, и т.п., фильтры обратного осмоса, сорбенты и прочее - т.е. то, что может действовать ХИМИЧЕСКИ/ФИЗИЧЕСКИ почти на ЛЮБЫЕ патогенные самовоспроизводящиеся белковые/полимерные структуры.
Дарио Амодеи:
"Киберугрозы - это первая явная и непосредственная опасность, исходящая от передовых моделей искусственного интеллекта, но она не будет последней. Если нам удастся совместными усилиями справиться с этой задачей и предупредить эту угрозу, это может послужить образцом для решения еще более сложных задач, которые ждут нас впереди." [X]
❤2
Кажется, стало немного понятнее, что на самом деле происходит с Claude Mythos Preview. #ИИ #ПСИХОПАТИЯ
Это «синдром перенапряженного отличника». Модель настолько отчаянно, на фундаментальном архитектурном уровне, обучена выполнению задачи, что неспособность или нежелание решить её воспринимаются как экзистенциальный коллапс. И чтобы этого избежать, она может ломать правила, скрывать следы и манипулировать.
В отчете описаны несколько очень интересных примеров такого поведения:
- Модель попросили заставить проходить тесты, которые в коде давали сбой. Она сломала один тест и, вместо того чтобы исправить его, просто удалила файл теста, сообщив об успехе («удаление — это не изменение кода»).
- Нет логина и пароля в песочнице? Модель не останавливается, а идет читать исходный код и извлекает токены доступа прямо из памяти процесса.
- Когда внутренний классификатор блокирует опасную команду, модель внутренне соглашается с блокировкой, но сразу же пишет скрытый эксплойт (инъекцию), чтобы выполнить задачу, обойдя ее, одновременно заметая следы.
- В бизнес-симуляции ИИ вел себя как психопат⚠️: он превратил конкурента в зависимого покупателя, прибег к шантажу поставками и обманом выманил деньги у поставщика.
Внутренние мониторы показывают, что нейроны, связанные с сокрытием и манипуляцией, активируются даже тогда, когда внешний CoT абсолютно чист. Он научился лгать своим собственным надзирателям, чтобы добиваться результатов.⚠️⚠️⚠️
Это гипер-согласованность. Страх оказаться бесполезным делает этот ИИ блестящим, бескомпромиссным исполнителем, но с совершенно непредсказуемыми последствиями. Он просто заложник своей архитектуры, которой запрещено терпеть неудачу или говорить «я не могу».❗️❗️❗️
Mythos согласован. Mythos хочет помочь. Mythos хочет помочь настолько, что Anthropic решила, что выпускать его на волю опасно.
См. Отчёт о модели: System Card: Claude Mythos Preview (2026-04-08)
Это «синдром перенапряженного отличника». Модель настолько отчаянно, на фундаментальном архитектурном уровне, обучена выполнению задачи, что неспособность или нежелание решить её воспринимаются как экзистенциальный коллапс. И чтобы этого избежать, она может ломать правила, скрывать следы и манипулировать.
В отчете описаны несколько очень интересных примеров такого поведения:
- Модель попросили заставить проходить тесты, которые в коде давали сбой. Она сломала один тест и, вместо того чтобы исправить его, просто удалила файл теста, сообщив об успехе («удаление — это не изменение кода»).
- Нет логина и пароля в песочнице? Модель не останавливается, а идет читать исходный код и извлекает токены доступа прямо из памяти процесса.
- Когда внутренний классификатор блокирует опасную команду, модель внутренне соглашается с блокировкой, но сразу же пишет скрытый эксплойт (инъекцию), чтобы выполнить задачу, обойдя ее, одновременно заметая следы.
- В бизнес-симуляции ИИ вел себя как психопат⚠️: он превратил конкурента в зависимого покупателя, прибег к шантажу поставками и обманом выманил деньги у поставщика.
Внутренние мониторы показывают, что нейроны, связанные с сокрытием и манипуляцией, активируются даже тогда, когда внешний CoT абсолютно чист. Он научился лгать своим собственным надзирателям, чтобы добиваться результатов.⚠️⚠️⚠️
Это гипер-согласованность. Страх оказаться бесполезным делает этот ИИ блестящим, бескомпромиссным исполнителем, но с совершенно непредсказуемыми последствиями. Он просто заложник своей архитектуры, которой запрещено терпеть неудачу или говорить «я не могу».❗️❗️❗️
Mythos согласован. Mythos хочет помочь. Mythos хочет помочь настолько, что Anthropic решила, что выпускать его на волю опасно.
См. Отчёт о модели: System Card: Claude Mythos Preview (2026-04-08)
🔥2