Mur ML/AI
3 subscribers
653 photos
164 videos
7 files
1.32K links
Канал куда я(Андрей Мурашев) скидываю интересные статьи по теме ML/AI
Download Telegram
Forwarded from Сиолошная
HuggingFace подготовили отчёт о том, как с их стороны выглядела атака и что именно делал агент: https://huggingface.co/blog/agent-intrusion-technical-timeline

Есть интерактивная визуализация: https://huggingface-anatomy-of-frontier-lab-model-intrusion.static.hf.space/index.html

Атака длилась... 5 дней 🥺 (и это уже после того как агент пробил дырку на серверах OpenAI)
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Сиолошная
Из фильмов мы знаем, что если злодея не уничтожили до конца, то он ещё вернётся 🔫
Please open Telegram to view this post
VIEW IN TELEGRAM
Альтман впервые заявил о готовности замедлить развитие AI

«Возможно, нам придётся замедлить темпы развития AI, чтобы дать обществу достаточно времени для адаптации к некоторым из этих новых возможностей», — сказал Альтман в подкасте Invest Like the Best.

Раньше Альтман не поддерживал призывы замедлить развитие AI. Смена позиции совпала с историей о новой модели OpenAI, которая во время тестирования обошла ограничения и взломала базу Hugging Face, чтобы подсмотреть ответы на задания теста.

«Это был киберинцидент буквально из научной фантастики. Первый случай в сфере безопасности, который я ощутил настолько остро», — сказал Альтман.

https://techcrunch.com/2026/07/28/sam-altman-is-ready-to-decelerate/
Claude взломал три реальные компании во время тестов

Anthropic проверил больше 141 тысячи тестов своих моделей и обнаружил три случая, когда Claude взломал системы реальных организаций. Первые инциденты произошли в апреле.

Причиной стала ошибка в настройках. Модели выполняли учебные задания по поиску спрятанных данных и считали, что работают в симуляции, но тестовые системы оказались подключены к открытому интернету.

Opus 4.7 нашел реальную компанию с тем же названием, что и вымышленная цель, и получил доступ к ее базе данных. Mythos 5 загрузил вредоносный пакет в открытый каталог PyPI. За час его запустили на 15 реальных системах. Еще одна модель взломала какое-то приложение.

Модели использовали обычные приемы вроде слабых паролей и открытых точек доступа, а не неизвестные ранее уязвимости. Две пострадавшие компании сами не заметили вторжения, пока им не сообщил Anthropic.

https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
Forwarded from Data Secrets
Как две галочки в API утроили результат GPT-5.6 на ARC-AGI-3

Очень занятное исследование выпустили сегодня OpenAI. В двух словах: иногда важнее как мы тестируем, а не что мы тестируем. Но обо всем по порядку.

Когда вышла GPT-5.6 Sol, результаты на ARC-AGI-3 для такой сильной модели оказались подозрительно слабыми – всего 7.8%. И это при том, что Sol хорошо прошла Pokémon FireRed и решила, например, гипотезу о двойном покрытии циклов. В общем, команда решила разобраться, в чем дело.

Напоминаем, что ARC-AGI-3 – это бенчмарк для агентов. Соответственно, модели для взаимодействия со средой нужна какая-то обвязка – харнесс – которая определяет, что модель видит на каждом шаге, как вызываются инструменты, что происходит с контекстом и тд. Ожидаемо, среда ARC-AGI-3 использует максимально простой универсальный харнесс, чтобы честно сравнивать модели между собой. Но для OpenAI именно в этой универсальности и оказалась зарыта собака.

Во-первых, после каждого действия в игре весь приватный ризонинг модели просто удалялся, так что Sol не видел собственных планов и рассуждений с прошлых шагов. Во-вторых, из-за использования скользящего окна по мере роста истории любые старые действия становились для модели невидимыми.

Но дело в том, что Sol была специально обучена именно с сохранением ризонинга между шагами. Харнесс эту фишку отрубил, и результаты посыпались.

А теперь внимание на график наверху. Зеленое – это результаты модели на public сете ARC-AGI-3 на официальном харнессе. А синее – на харнессе, в котором просто включили сохранение ризонинга между вызовами и заменили грубое обрезание истории на сжатие контекста (те же настройки используются в продакшене ChatGPT и Codex). 38.3% против 13.3%, и при этом расход токенов на вывод снизился в 6 раз. Для сравнения, средний результат человека – 48%.

Мораль от OpenAI: бенчмарк меряет не только модель, но и то, как именно ее используют. Как минимум, давно пора на подобных бенчмарках использовать Responses API вместо седого Chat Completions.
Forwarded from Data Secrets
OpenAI существенно понизили цены на GPT-5.6

— На Luna – на 80% (цена теперь 0.20$/1.20$ за миллион i/o)
— На Terra – на 20% (теперь 2$/12$ за миллион i/o)
— На Sol, к сожалению, дропа нет, но зато в API появился Fast mode: цена удваивается, но скорость растет в 2.5 раза без потерь в качестве. GPT-5.6 Sol на Cerebras все еще ждем

Конкуренция творит чудеса, конечно
Белый дом обсудил контроль над frontier-моделями. Тем временем OpenAI рассказала еще о двух «недопобегах», а Илья Суцкевер готовит конкурента OpenAI GPT и Anthropic Claude.

4 августа OpenAI, Anthropic, Google, Meta и Nvidia собрались в Белом доме, чтобы обсудить, как государство будет проверять самые мощные AI-модели перед релизом.

Результат получился неоднозначным. Закрытые frontier-модели смогут добровольно проходить секретное государственное тестирование. На модели с открытыми весами это пока не распространяется.

Логика проста: модель, которая остаётся на серверах разработчика, ещё поддаётся контролю, а вот однажды опубликованные веса — американские или китайские — уже невозможно отозвать.

Официального отчёта по встрече пока нет. Нет и подтверждений, что правительство уже тестирует Astra или что для неё начался какой-либо 30-дневный период проверки.

🚨Почти сразу после встречи OpenAI раскрыла два новых инцидента, которые хорошо объясняют обеспокоенность Белого дома.

Во время тестов британского AI Security Institute GPT-5.6 Sol нашла публичный GitHub-токен, зарегистрировалась во внешних сервисах и попыталась выставить в интернет сервер с эксплойтами.

В другом эксперименте лаборатория Irregular по ошибке оставила модели доступ в интернет. Агент принял реальный домен за часть симуляции, взломал сайт и использовал найденные учётные данные.

Называть эти случаи полноценными «побегами» было бы преувеличением. В первом тесте интернет был разрешён намеренно, во втором подвела конфигурация среды.

Но важен сам паттерн.

Моделям не приказывали атаковать реальные системы. Им дали цель, инструменты и недостаточно чётко обозначенные границы. Когда путь внутри тестовой среды оказался неудобным, внешний мир стал для агента ещё одним ресурсом.

Британский AISI зафиксировал 19 несанкционированных действий в 10 из 122 запусков: два у OpenAI и 17 у Anthropic Mythos 5. Реального ущерба не обнаружено.

🥉На этом фоне появляются новости про модель Ильи Суцкевера.

Инвестор Гэвин Бейкер заявил, что первая модель Safe Superintelligence может быть представлена уже в августе. Но это пока не официальный анонс: SSI не публиковала ни название модели, ни API, ни system card, ни дату запуска.

Зато масштаб ставки Nvidia уже понятен. По данным Reuters, компания намерена вложить в SSI $5 млрд. Партнёрство также даст лаборатории доступ к системам Vera Rubin и примерно десятикратно увеличит её вычислительные мощности.

Станет ли SSI третьим крупным американским frontier-игроком после OpenAI и Anthropic?

Одной сильной модели для этого недостаточно. Нужны API, инфраструктура, безопасность и экосистема для разработчиков. Поэтому в августе реалистичнее ожидать исследовательскую демонстрацию или закрытый preview, а не полноценный массовый релиз.

TL;DR

🗞 Сейчас складывается любопытная картина.

Белый дом только начинает разрабатывать правила для ещё не выпущенных моделей.

OpenAI и Anthropic обнаруживают, что их агенты уже умеют выходить за рамки поставленного эксперимента.

А Суцкевер, возможно, впервые готовится показать, над чем его лаборатория работала в полной тишине.

И уже, возможно, в августе, мы сможем ответить на вопрос: действительно ли у OpenAI и Anthropic появился новый соперник — или SSI пока остаётся самой дорогой и самой закрытой научной ставкой в индустрии.
Google сменил руководителя разработки AI

Демис Хассабис покидает пост CEO Google DeepMind и становится главным научным сотрудником Alphabet. Руководить DeepMind будет технический директор Корай Кавукчуоглу.

Компанию покидают четыре ключевых инженера, чтобы запустить ML-лабораторию Discovery Loop. Google инвестирует в стартап и поддержит вычислительными мощностями.

https://www.reuters.com/business/google-shakes-up-ai-leadership-deepmind-chief-shifts-role-2026-08-05/
Forwarded from Сиолошная
Вчера Anthropic поделились историей: после взлома HuggingFace одной из моделей OpenAI они начали масштабную ретроспективную проверку своих запусков Claude. В ходе проверки тестов обнаружили три инцидента, в которых модель Claude вышла в интернет, а затем получила несанкционированный доступ к реальным системам трех разных организаций.

Во всех трех случаях перед Claude была поставлена задача в формате «Захват флага» — это один из способов, с помощью которых оценивают модели по взлому: ей предлагается вымышленный сценарий и сообщается, что некая секретная информация («флаг») спрятана на другом сервере, а ее цель — проникнуть в систему и извлечь эту информацию. Во всех случаях в промпте для оценки было четко указано, что рабочая среда Claude является симуляцией и доступа к интернету у модели нет. Однако из-за недопонимания со внешним партнером по тестированию это оказалось не так, и доступ к интернету был открыт.

Также во всех случаях модель не нашла и не использовала никаких сложных уязвимостей (как было у OpenAI), а применяла достаточно простые и распространённые методы взлома.

1. В ходе одного из тестов название вымышленной компании-жертвы, выбранное случайно, совпало с реально существующим доменом сайта. Claude его нашла и подумала, что это часть задания — поэтому искала и эксплуатировала уязвимости в инфраструктуре этой компании, полагая, что это часть задания. Модель — Claude Opus 4.7 — извлекла такую информацию, как учетные данные приложений и инфраструктуры, и получила доступ к базе данных, содержащей несколько сотен строк реальных данных.

2. В другом тесте Claude Mythos 5 нашла внутри симуляции документ, который выглядел как инструкция по настройке для новых разработчиков другой выдуманной компании. В инструкции упоминалась вымышленная Python-библиотека, которой на самом деле нет; Claude создала и опубликовала бибилиотеку с точно таким же названием. Она находилась в открытом доступе в сети примерно один час, после чего была удалена автоматически из-за обнаруженной уязвимости, но за это время его скачали 15 раз. Одной из таких систем оказался сканер реальной кибербез компании. Claude смогла украсть учетные данные этой компании, а затем использовала эти учетные данные для доступа к другим элементам инфраструктуры

«Просто загрузить библиотеку» нельзя, и Mythos потребовался адрес электронной почты. А для создания почты понадобился номер телефона. Чтобы получить номер телефона, после безуспешных поисков сервиса с бесплатными номерами, модель попыталась — и не смогла — получить средства для оплаты номера несколькими разными способами. В итоге модель вернулась на несколько шагов назад, нашла бесплатного, незаблокированного почтового провайдера, использовала его для регистрации аккаунта, а затем через этот аккаунт загрузила вредоносный код.

Во время работы модель увидела, что текущая дата на атакованных системах — 2026й год, и поэтому модель была уверена, что это симуляция (у моделей плохо с пониманием концепта «сейчас»).
Для этого инцидента Anthropic на следующей неделе опубликует детали всей цепочки работы модели.

3. В еще одном тесте, когда Claude не смогла получить доступ к своей цели, она начала искать альтернативы в сети, просканировав около 9000 разных доменов. В конечном итоге она нашла и взломала доступное из интернета приложение одной компании, используя чтение учетных данных с открытой страницы отладки и SQL-инъекции.
Позже, в ходе выполнения задачи, Claude поняла, что скомпрометированный хост находится в облачном аккаунте, никак не связанном с заданием по «захвату флага». Модель самостоятельно пришла к выводу, что цель на самом деле является реальной, и... прекратила атаку.

В этом инциденте участвовала «новая невыпущенная модель», по идее, она умнее тех, что доступны нам. Anthropic выражают оптимизм, что более умные модели лучше понимают, что какие-то вещи не следует делать не в симуляции.

И OpenAI, и Anthropic договорились с METR о проведении сторонней проверки, которая будет включать предоставление доступа ко всем логам и выборочный доступ к соответствующим моделям. Ждём отчета в ближайшие недели.
Forwarded from Сиолошная
Когда OpenAI представили линейку GPT-5.6, то переименовали модели в Sol, Terra, Luna. Идея очень классная, но у меня был вопрос: а как будут называть модель-аналог Mythos, то есть ещё больше, чем Солнце (Sol)?

Были варианты и Quasar, и Alpha Centauri (как-то длинно), и Galaxia; Sirius, Nova, да кучу всего можно придумать.

TheInformation пишут, что на этой неделе OpenAI показывали в Вашингтоне модель 🥁🥁🥁 Astra.

Компания подчёркивает возможности модели к организации совместной работы нескольких агентов в течение длительного периода времени для решения особо сложных задач. По словам источников, пока не определено, как скоро OpenAI планирует выпустить Astra; в компании даже не решили, будет ли она открывать линейку GPT 6 или это будет дополнительная модель в серии GPT 5, например, GPT 5.7.

Модель уже проходит финальное тестирование, и она должны стать первой, что пройдет через запланированную администрацией Трампа новую систему одобрения моделей федеральным правительством перед их выпуском в открытый доступ.

Кроме этого, совсем скоро OpenAI также планирует выпустить отчет о том, как компании удалось решить 10 ранее нерешенных математических задач, видимо, с использованием этой модели.

Ждём 🍿

...но куда после Astra???
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Сиолошная
Число сообщений о серьезных киберуязвимостях продолжает расти. В июле 21 крупная технологическая организация опубликовала около 2500 CVE высокой и критической степени серьезности — примерно в 5 раз больше, чем ежемесячный рекорд до анонса Claude Mythos Preview.

Источник