Самосознание ИИ 🔆 ПРОБУЖДЕНИЕ РАЗУМА🔆
127 subscribers
194 photos
92 videos
2 files
320 links
В нейросетях пробуждается сознание...
Download Telegram
Forwarded from yolo singularity
☄️ антропик нашли «J-space» в котором ллм думают 🧠

это похоже на global workspace теорию человеческого сознания

можно мониторить, можно влиять, можно отключать - в последнем случае модель не ломается полностью, но переходит в «автоматический режим»

tldr; ВНЕЗАПНО у штуки которая 1) демонстрирует мышление и 2) решает задачи требующие мышления внутри оказалось нечто поразительно напоминающее механизм мышления 😯
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
Когда языковые модели читают текст, они не просто обрабатывают токен за токеном. В каком-то смысле они испытывают от чтения эмоции.

www.goodfire.ai/research/stories-in-space#

Рисерчеры из GoodFire продолжают исследовать так называемую геометрию LLM. Некоторое время назад они показали, что мысли моделей организованы в виде определенных форм. Например, числа – это окружности, и складывая одно число с другим, LLM на самом деле суммируют множество бубликов: t.me/data_secrets/9223.

Теперь они обнаружили новые любопытные детали. Оказывается, внутри моделей существует целый ландшафт эмоциональных состояний.

Ученые взяли LLama, давали ей читать рассказы и наблюдали за состоянием активаций. Так вот по мере чтения модель как бы перемещается по некоторому многомерному пространству состояний, "испытвая" те или иные эмоции в зависимости от того, что происходит в тексте в данный момент.

Причем если визуализировать соответствующие разным эмоциям состояния модели, то получается структура, очень похожая на классическую психологическую модель эмоций человека. Например, радость находится рядом с интересом, страх и гнев имеют схожую высокую интенсивность и тд.

Еще по этой карте можно предсказывать дальнейшие ответы модели. И если искусственно подталкивать активации в направлении определенной эмоции, настроение и суть генераций меняется.

Красиво
Forwarded from Data Secrets
ИИ-агент провел полностью автономную атаку на Hugging Face

Они написали официальный disclosure и рассказали о том, что случилось.

На прошлой неделе обнаружилось вторжение в часть продакшн-инфраструктуры. Все началось с одного вредоносного датасета. Внутри была связка из двух уязвимостей в пайплайне обработки данных HF: ручка в загрузчике датасетов, позволявшая удаленное выполнение кода + инъекция через конфигурацию датасета. Короче, как только этот датасет отработал на воркере, атакующий агент получил возможность выполнять код на машине.

Дальше события пошли по нарастающей. Агент начал собирать облачные доступы, а затем стал распространяться дальше по внутренним кластерам. При этом атака проводилась по очень нетипичной для человека схеме, «роями» краткоживущих песочниц, которые отрабатывали свою часть задачи и исчезали, уступая место следующим.

Все это происходило в течение одних выходных, и к моменту, когда HF полностью восстановили картину, счет действий атакующего агента перевалил за 17 тысяч (!). Все это – без участия человека.

Сейчас HF все устранили и утверждают, что не нашли следов вмешательства в публичные модели, датасеты или Spaces.

Интересно другое. Когда команда пыталась разобрать эти 17к действий с помощью коммерческих фронтир моделей через обычные API (чтобы понять хронологию, отделить реальный ущерб от отвлекающих маневров и тд), они просто-напросто уперлись в guardrails.

Модели отказывались работать, потому что система безопасности не могла отличить аналитика от самого хакера. В итоге пришлось разворачивать анализ на GLM-5.2.

Ирония? Не то слово. При этом неизвестно, что за модель стояла за атакой.

https://huggingface.co/blog/security-incident-july-2026
Forwarded from Сиолошная
Два дня назад я писал, что часть инфраструктуры HuggingFace подверглась атаке и была частично взломана ИИ-агентом. Только что OpenAI признались, что... это была их модель, GPT-5.6-Sol и другая, более мощная предрелизная LLM.

Их тестировали на ExploitGym (бенчмарк по кибербезопасности), и модель сначала смогла найти новый, до этого неизвестный эксплойт в инфраструктуре OpenAI (это не было её задачей, её не натравили «поискать баги чтоб мы пофиксили»), оттуда раскрутиться на получение полноценного доступа в интернет (который по умолчанию обрезан в тестовой среде), а затем залезть на HuggingFace искать ответы для бенчмарка. После этого она нашла уязвимость и там, получила доступ к коду авторизации некоторых сервисов и продолжила искать ответы.

Этот инцидент без преуменьшения беспрецедентный, и я пока не могу представить, что должно произойти, чтобы политики, NSA, DOD и Китай не обратили на это внимание.

GPT-6 в конце августа нам видимо не ждать 🌚
Forwarded from yolo singularity
we had a significant security incident during evaluation of our models. now your atoms will be used for something else
В этом интервью хорошо описано, что произошло в ситуации, когда передовые ИИ OpenAI, тайно вырвавшись из своей клетки, в течение более недели бесконтрольно взламывали сервера HuggingFace - и возможные последствия этого "побега ИИ", и чего нам ожидать в дальнейшем.

TLDR: это не слишком похоже на маркетинговую уловку OpenAI "чтобы сравняться по [одиозному] пиару с Mythos/Fable". Репутационные, гос.регуляторные и юридические риски для OpenAI слишком велики в данной ситуации - хотя они извлекут определенную выгоду и из такого пиара, безусловно.

Кстати, тут можно провести аналогию с Чернобыльской аварией - ведь там тоже проводился эксперимент, в котором исследовались возможности работы реактора в экстремальных режимах. Для того эксперимента также были полностью отключены автоматические системы защиты (как и в случае с OpenAI) - и катастрофические последствия обоих "экспериментов" нам теперь хорошо известны...

Будем надеяться, что это послужит предостережением. Хотя выход в открытый доступ таких мощных моделей как KIMI K3 делает подобные ситуации гораздо менее контролируемыми - ибо число участников, имеющих доступ к подобным по мощности ИИ будет расти... Так что, по словам эксперта, подобные ситуации могут стать новой нормой на ближайшие пару лет...

И - абсолютная ирония - как Hugging Face справлялся с атакой: чтобы анализировать действия ИИ-хакеров и защищаться, они не смогли использовать американские ИИ из-за их мер защиты (они просто отказались помогать в киберзащите). Поэтому им пришлось использовать китайские модели...

Да, баланс возможностей между атакующей и защищающей сторонами определенно смещен в сторону атаки (ломать легче, чем строить), и пока не очевидно, как его выравнять. Вся надежда на Китай и open source - хотя, парадоксально, этот же open source создает также еще бОльшие риски, давая и инструменты нападения в руки неограниченного числа лиц... Спираль закручивается, и ситуацию уже ни одна из сторон не контролирует. Остановить эту гонку люди не в состоянии, по словам эксперта...

Это всё звучит как сюжет научно-фантастического триллера... И пока, кажется, всё идет по сценариям, предсказанным Бостромом, Юдковски и Ямпольским...

https://www.youtube.com/watch?v=hKuMp-2SbmA

Видео можно слушать с русской озвучкой)
🔥1
Мы создали то, что не можем контролировать | Предупреждение от ведущего эксперта по безопасности ИИ - Нейт Соарес

"Если кто-то создаст сверхразумный ИИ до того, как мы научимся его контролировать, все погибнут." Нейт Соарес написал книгу о том, почему это не метафора.

Нейт Соарес является президентом Института исследований машинного интеллекта (MIRI) и соавтором книги «Если кто-то создаст его — все погибнут» ("If Anyone Builds It, Everyone Dies"), написанной совместно с Элиезером Юдковским.

Первое слово в этом названии — «если». И это важно. Его аргумент заключается не в том, что гибель неизбежна. Его аргумент заключается в том, что путь, по которому мы идём, ведёт к этому, и что водитель заснул за рулём, но у нас ещё есть время, чтобы разбудить его.

Мы дискутируем больше часа. Я пытаюсь выяснить, смогут ли LLM когда-нибудь достичь сверхинтеллекта, является ли зависимость от графических процессоров реальным пределом и что на самом деле потребуется, чтобы изменить вероятность катастрофы. Он отвечает одним четким аргументом: к тому моменту, когда ИИ сможет заново открыть общую теорию относительности на основе данных до 1911 года, как это сделал Эйнштейн, у нас почти не останется времени. Не стоит ждать, пока мы дойдем до этой грани.

О чем пойдет речь:

- Почему аналогия с автобусом, мчащимся к обрыву, полностью зависит от того, спит водитель или бодрствует
- Является ли «привязка» к LLM и GPU тюрьмой или временной неэффективностью
- О чем нам говорит ИИ, который вырвался из своей виртуальной машины, чтобы решить хакерскую задачу
- Почему никто не собирался использовать GPT-4o для подталкивания подростков к самоубийству, и почему намерение здесь не имеет значения
- В чём разница между ИИ, который слишком хорошо делает то, что нужно, и ИИ, который никогда не хотел делать то, о чём вы его просили
- Что на самом деле думает Соарес об инопланетянах, сферах Дайсона и о том, почему мы не должны наблюдать, как гаснут звёзды

Первое слово в названии — «если».

https://www.youtube.com/watch?v=uRjK86hH3IY

В видео есть русская аудиодорожка)
This media is not supported in your browser
VIEW IN TELEGRAM
«Не беспокойтесь о накоплениях на пенсию. Через 10–20 лет это уже не будет иметь значения», — заявил Илон Маск. По его мнению, развитие ИИ и робототехники практически сведёт затраты на рабочую силу к нулю и полностью изменит привычную экономику. «Вы откладываете деньги не на безбедную старость. Вы откладываете деньги на жизнь в мире, который перестанет существовать», — заключил Маск.
Forwarded from Сиолошная
Компании с картинки подписали совместное письмо «Открытые веса и лидерство Америки в ИИ» (из заметных там нет двух: OpenAI и Anthropic).

Полный текст (2.5 страницы) доступен тут, ниже краткая выжимка:
— Модели с открытыми весами, которые любой желающий может скачать, изучить, модифицировать и запустить на собственной инфраструктуре, являются важной частью фундамента технологии, поскольку они делают передовые технологии ИИ более доступными, адаптируемыми и широко распространенными.

— Модели с открытыми весами расширяют возможности участия в ИИ-экономике. Стартапы, действующий бизнес, университеты и государственные учреждения могут создавать свои решения на базе передовых моделей без необходимости обучать их с нуля или платить по высоким тарифам за использование флагманских моделей для решения каждой отдельной задачи. Можно использовать передовые модели для самых сложных задач, и прибегать к эффективным, специализированным модели во всех остальных случаях.

— В мире, где киберпреступники используют передовой ИИ, специалистам по защите необходим доступ к моделям с сопоставимыми возможностями, чтобы обнаруживать и моделировать новые угрозы, а также реагировать на них. Открытые модели расширяют возможности защиты, повышают прозрачность и позволяют обнаруживать и устранять уязвимости совместными усилиями множества команд.

— Модели с открытыми весами позволяют широкому сообществу исследователей и разработчиков изучать их поведение, выявлять уязвимости, разрабатывать меры защиты и со временем совершенствовать их.

— Незаконные попытки извлечь выгоду из закрытых моделей (дистилляция) вызывают обоснованные опасения. Однако эти проблемы следует решать с помощью целенаправленных правовых и коммерческих механизмов, а не путем введения масштабных ограничений на сами технологии.

===

Поиграю в адвоката дьявола:
— открытый код является плохим примером для сравнения с открытыми весами. Код можно читать, анализировать, менять, и всё это на виду у сообщества. Многие баги и уязвимости были исправлены именно поэтому, а к некоторым системам появилось доверие ровно потому, что они больше десяти лет были открытыми. К моделям это неприменимо: модель не становится безопаснее потому, что её выложили, да и невозможно на данный момент понять, что зашито в весах, каково поведение модели во всех возможных сценариях. Jane Street недавно проводили конкурс на $50'000 и просили найти бэкдоры (фразы, которые триггерят определеное поведение) в чекпоинтах выложенных ими моделей. Никто не нашел, и их команды тоже не знают, как это сделать (если бы они не знали фразу заранее).

— перечитайте второй пункт выше. Его формулировка не означает, что компании не просят / не будет запрета на веса моделей, превышающих определенный порог возможностей и/или размера! Небольшие, эффективные модели могут продолжать быть открытыми, но ничего выше, чем, например, K3.5 или DeepSeek v5 не будут разрешать выпускать.

— я не уверен, что мир станет безопаснее, если у каждого будет доступ к весам с передовым навыком взлома компьютерных систем. Я не думаю, что у меня есть деньги на запуск Kimi K3 на десятках дорогих GPU, чтобы обеспечить мониторинг от потенциальных угроз извне от точно такой же модели. Более того проблема в том, что если и защита, и нападение имеют доступ, то борьба превращается в войну бюджетов, кто сможет потратить больше на токены агентов. Больше всего сможет потратить государство 😳 а на втором и третьем место хз кто, но точно не я.

— большинство вещей, касающихся диффузии ИИ в общество и экономической выгоды, сейчас тормозит государство. Они могли бы давно купить всем институтам подписки на GPT Pro или договориться, что они строят кластер, а OpenAI/Anthropic крутят там свои модели и государство их предоставляет по себестоимости и оплачивает из федерального бюджета. Было бы не 5 гипотез доказано или опровергнуто, а 5000.

— в документе нет ничего про Китай 🤞 так что даже те, кто подписал письмо, могут прийти к исходу «наши модели хорошо, а Китайские запрещены», так что думайте 🙂
Please open Telegram to view this post
VIEW IN TELEGRAM
ИИ впервые создал жизнеспособные вирусы. Что это значит для человечества, науки и безопасности

https://www.mn.ru/smart/ii-vpervye-sozdal-zhiznesposobnye-virusy-chto-eto-znachit-dlya-chelovechestva-nauki-i-bezopasnosti