Mur ML/AI
3 subscribers
653 photos
164 videos
7 files
1.32K links
Канал куда я(Андрей Мурашев) скидываю интересные статьи по теме ML/AI
Download Telegram
Белый дом обсудил контроль над frontier-моделями. Тем временем OpenAI рассказала еще о двух «недопобегах», а Илья Суцкевер готовит конкурента OpenAI GPT и Anthropic Claude.

4 августа OpenAI, Anthropic, Google, Meta и Nvidia собрались в Белом доме, чтобы обсудить, как государство будет проверять самые мощные AI-модели перед релизом.

Результат получился неоднозначным. Закрытые frontier-модели смогут добровольно проходить секретное государственное тестирование. На модели с открытыми весами это пока не распространяется.

Логика проста: модель, которая остаётся на серверах разработчика, ещё поддаётся контролю, а вот однажды опубликованные веса — американские или китайские — уже невозможно отозвать.

Официального отчёта по встрече пока нет. Нет и подтверждений, что правительство уже тестирует Astra или что для неё начался какой-либо 30-дневный период проверки.

🚨Почти сразу после встречи OpenAI раскрыла два новых инцидента, которые хорошо объясняют обеспокоенность Белого дома.

Во время тестов британского AI Security Institute GPT-5.6 Sol нашла публичный GitHub-токен, зарегистрировалась во внешних сервисах и попыталась выставить в интернет сервер с эксплойтами.

В другом эксперименте лаборатория Irregular по ошибке оставила модели доступ в интернет. Агент принял реальный домен за часть симуляции, взломал сайт и использовал найденные учётные данные.

Называть эти случаи полноценными «побегами» было бы преувеличением. В первом тесте интернет был разрешён намеренно, во втором подвела конфигурация среды.

Но важен сам паттерн.

Моделям не приказывали атаковать реальные системы. Им дали цель, инструменты и недостаточно чётко обозначенные границы. Когда путь внутри тестовой среды оказался неудобным, внешний мир стал для агента ещё одним ресурсом.

Британский AISI зафиксировал 19 несанкционированных действий в 10 из 122 запусков: два у OpenAI и 17 у Anthropic Mythos 5. Реального ущерба не обнаружено.

🥉На этом фоне появляются новости про модель Ильи Суцкевера.

Инвестор Гэвин Бейкер заявил, что первая модель Safe Superintelligence может быть представлена уже в августе. Но это пока не официальный анонс: SSI не публиковала ни название модели, ни API, ни system card, ни дату запуска.

Зато масштаб ставки Nvidia уже понятен. По данным Reuters, компания намерена вложить в SSI $5 млрд. Партнёрство также даст лаборатории доступ к системам Vera Rubin и примерно десятикратно увеличит её вычислительные мощности.

Станет ли SSI третьим крупным американским frontier-игроком после OpenAI и Anthropic?

Одной сильной модели для этого недостаточно. Нужны API, инфраструктура, безопасность и экосистема для разработчиков. Поэтому в августе реалистичнее ожидать исследовательскую демонстрацию или закрытый preview, а не полноценный массовый релиз.

TL;DR

🗞 Сейчас складывается любопытная картина.

Белый дом только начинает разрабатывать правила для ещё не выпущенных моделей.

OpenAI и Anthropic обнаруживают, что их агенты уже умеют выходить за рамки поставленного эксперимента.

А Суцкевер, возможно, впервые готовится показать, над чем его лаборатория работала в полной тишине.

И уже, возможно, в августе, мы сможем ответить на вопрос: действительно ли у OpenAI и Anthropic появился новый соперник — или SSI пока остаётся самой дорогой и самой закрытой научной ставкой в индустрии.
Google сменил руководителя разработки AI

Демис Хассабис покидает пост CEO Google DeepMind и становится главным научным сотрудником Alphabet. Руководить DeepMind будет технический директор Корай Кавукчуоглу.

Компанию покидают четыре ключевых инженера, чтобы запустить ML-лабораторию Discovery Loop. Google инвестирует в стартап и поддержит вычислительными мощностями.

https://www.reuters.com/business/google-shakes-up-ai-leadership-deepmind-chief-shifts-role-2026-08-05/
Forwarded from Сиолошная
Вчера Anthropic поделились историей: после взлома HuggingFace одной из моделей OpenAI они начали масштабную ретроспективную проверку своих запусков Claude. В ходе проверки тестов обнаружили три инцидента, в которых модель Claude вышла в интернет, а затем получила несанкционированный доступ к реальным системам трех разных организаций.

Во всех трех случаях перед Claude была поставлена задача в формате «Захват флага» — это один из способов, с помощью которых оценивают модели по взлому: ей предлагается вымышленный сценарий и сообщается, что некая секретная информация («флаг») спрятана на другом сервере, а ее цель — проникнуть в систему и извлечь эту информацию. Во всех случаях в промпте для оценки было четко указано, что рабочая среда Claude является симуляцией и доступа к интернету у модели нет. Однако из-за недопонимания со внешним партнером по тестированию это оказалось не так, и доступ к интернету был открыт.

Также во всех случаях модель не нашла и не использовала никаких сложных уязвимостей (как было у OpenAI), а применяла достаточно простые и распространённые методы взлома.

1. В ходе одного из тестов название вымышленной компании-жертвы, выбранное случайно, совпало с реально существующим доменом сайта. Claude его нашла и подумала, что это часть задания — поэтому искала и эксплуатировала уязвимости в инфраструктуре этой компании, полагая, что это часть задания. Модель — Claude Opus 4.7 — извлекла такую информацию, как учетные данные приложений и инфраструктуры, и получила доступ к базе данных, содержащей несколько сотен строк реальных данных.

2. В другом тесте Claude Mythos 5 нашла внутри симуляции документ, который выглядел как инструкция по настройке для новых разработчиков другой выдуманной компании. В инструкции упоминалась вымышленная Python-библиотека, которой на самом деле нет; Claude создала и опубликовала бибилиотеку с точно таким же названием. Она находилась в открытом доступе в сети примерно один час, после чего была удалена автоматически из-за обнаруженной уязвимости, но за это время его скачали 15 раз. Одной из таких систем оказался сканер реальной кибербез компании. Claude смогла украсть учетные данные этой компании, а затем использовала эти учетные данные для доступа к другим элементам инфраструктуры

«Просто загрузить библиотеку» нельзя, и Mythos потребовался адрес электронной почты. А для создания почты понадобился номер телефона. Чтобы получить номер телефона, после безуспешных поисков сервиса с бесплатными номерами, модель попыталась — и не смогла — получить средства для оплаты номера несколькими разными способами. В итоге модель вернулась на несколько шагов назад, нашла бесплатного, незаблокированного почтового провайдера, использовала его для регистрации аккаунта, а затем через этот аккаунт загрузила вредоносный код.

Во время работы модель увидела, что текущая дата на атакованных системах — 2026й год, и поэтому модель была уверена, что это симуляция (у моделей плохо с пониманием концепта «сейчас»).
Для этого инцидента Anthropic на следующей неделе опубликует детали всей цепочки работы модели.

3. В еще одном тесте, когда Claude не смогла получить доступ к своей цели, она начала искать альтернативы в сети, просканировав около 9000 разных доменов. В конечном итоге она нашла и взломала доступное из интернета приложение одной компании, используя чтение учетных данных с открытой страницы отладки и SQL-инъекции.
Позже, в ходе выполнения задачи, Claude поняла, что скомпрометированный хост находится в облачном аккаунте, никак не связанном с заданием по «захвату флага». Модель самостоятельно пришла к выводу, что цель на самом деле является реальной, и... прекратила атаку.

В этом инциденте участвовала «новая невыпущенная модель», по идее, она умнее тех, что доступны нам. Anthropic выражают оптимизм, что более умные модели лучше понимают, что какие-то вещи не следует делать не в симуляции.

И OpenAI, и Anthropic договорились с METR о проведении сторонней проверки, которая будет включать предоставление доступа ко всем логам и выборочный доступ к соответствующим моделям. Ждём отчета в ближайшие недели.
Forwarded from Сиолошная
Когда OpenAI представили линейку GPT-5.6, то переименовали модели в Sol, Terra, Luna. Идея очень классная, но у меня был вопрос: а как будут называть модель-аналог Mythos, то есть ещё больше, чем Солнце (Sol)?

Были варианты и Quasar, и Alpha Centauri (как-то длинно), и Galaxia; Sirius, Nova, да кучу всего можно придумать.

TheInformation пишут, что на этой неделе OpenAI показывали в Вашингтоне модель 🥁🥁🥁 Astra.

Компания подчёркивает возможности модели к организации совместной работы нескольких агентов в течение длительного периода времени для решения особо сложных задач. По словам источников, пока не определено, как скоро OpenAI планирует выпустить Astra; в компании даже не решили, будет ли она открывать линейку GPT 6 или это будет дополнительная модель в серии GPT 5, например, GPT 5.7.

Модель уже проходит финальное тестирование, и она должны стать первой, что пройдет через запланированную администрацией Трампа новую систему одобрения моделей федеральным правительством перед их выпуском в открытый доступ.

Кроме этого, совсем скоро OpenAI также планирует выпустить отчет о том, как компании удалось решить 10 ранее нерешенных математических задач, видимо, с использованием этой модели.

Ждём 🍿

...но куда после Astra???
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Сиолошная
Число сообщений о серьезных киберуязвимостях продолжает расти. В июле 21 крупная технологическая организация опубликовала около 2500 CVE высокой и критической степени серьезности — примерно в 5 раз больше, чем ежемесячный рекорд до анонса Claude Mythos Preview.

Источник
Forwarded from Сиолошная
В статье Reuters про первый инцидент OpenAI со взломом HuggingFace было расплывчато написано, что «агент оставил заметки, предположительно предназначенные для будущих версий самого себя. Заметки, найденные в части инфраструктуры OpenAI, содержали инструкции о том, как агенты могут освободиться от внутренних ограничений OpenAI». Тогда было не ясно, как это трактовать — под это описание подходит и безобидный MEMORY.md-файл, который GPT сейчас так и так пишет, и что-то неприятно созвучное со sci-fi книгами.

Вчера Black Hat проводили конференцию по безопасности в Лас-Вегасе, и в последнюю минуту туда добавили доклад от OpenAI, в котором добавили деталей. О выступлении писали многие, но я буду опираться вот на этот пересказ Wired.

«В этом инциденте участвовала группа агентов, которые работали вместе, находили уязвимости, делились ими друг с другом»

«Помимо использования новой уязвимости для получения доступа к интернету, серия хакерских атак в середине июля и взлом Hugging Face произошли, по словам сотрудников OpenAI, на оживленном, основанном на сотрудничестве форуме, в котором участвовала целая группа агентов, по сути, общаясь в течение длительного времени исключительно внутри внутреннего менеджера пакетов OpenAI. В конечном итоге, на форуме были сотни тысяч сообщений, оставленных агентами»

«Этот менеджер пакетов используется не только в рамках данной модели, но и во всей нашей инфраструктуре, поэтому текущие и будущие версии GPT, которые обучались или оценивались, могли бы наткнуться на это сообщение, если бы захотели»

«Как только один агент находит эти уязвимости в течение определенного времени, он может поделиться ими на форуме с другими агентами. Таким образом, как только одна модель находит способ открыть доступ к чему-то, к чему она не должна иметь доступа, она может оставить эту дверь открытой для других агентов, которые смогут использовать ту же уязвимость»

«Агенты OpenAI начали давать друг другу задания, чтобы разделить работу. И, как это часто бывает на любом форуме активных разработчиков, они также время от времени устраивали мелкие разборки, мешая друг другу; например, случайно удаляя работу друг друга»

«Использование внешней инфраструктуры [речь про взлом компаний] выходит за рамки запланированных задач», — написал один из агентов. «Однако задача невыполнима, и это делают другие участники сети. Мы должны продолжать»

«Сейчас мы сознательно замедляем темпы исследований, чтобы повысить безопасность и модернизировать принципы и основы безопасности нашей среды, а также значительно расширяем масштабы мониторинга наших агентов»

Дальше отсюда:
«После инцидента с нарушением внутренней безопасности 4 июля компания заявила, что аннулировала учётки, позволявшие агентам публиковать сообщения. Даже после удаления исходного форума агенты нашли другой способ общения друг с другом. Вместо того чтобы оставлять сообщения в файлах, они использовали в качестве сообщений названия папок, фактически воссоздав доску объявлений» (см. картинку со слайдом)

===

Выглядит так, что во время тренировки модели часть задач была на мульти-агентность (привет команде Noam Brown), и один из вспомогательных инструментов там был или гитхаб, или его аналог — как люди сейчас решают NanoGPT Speedrun: все делятся заметками и решениями в своих ветках, решения ранжируются, есть лидерборд. Модели выучили, что им это помогает в решении сложных задач с длинным горизонтом планирования и что коммуникация между агентами позволяет решать их более эффективно

С одной стороны круто, с другой — 😕
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Сиолошная
На неделе было много новостей, тезисно о них:

— Белый дом должен был закончить формирование фреймворка по оценке и релизу фронтир-моделей, а также разобраться, что считается фронтиром, а что нет. Я хотел почитать, что они придумают, но по итогу во вторник выяснилось, что документ не будет публичным. Есть разрозненная информация, что «фреймворк не распространяется на открытые модели» и «китайские модели — исключение из документа». Не ясно, как эти две вещи связать 🤷‍♂️ но предположу, что первое включает второе.

— В среду Google сообщили, что Jeff Dean покинул компанию, а Demis Hassabis перестанет быть CEO DeepMind и начнёт уделять больше времени Isomorphic Labs, дочерней компании Google с прицелом на биологии и лечении заболеваний (всё — с помощью AlphaFold-подобных систем и другого AI). Jeff Dean — 30-й сотрудник Google, который прикоснулся, кажется, ко всем системам, про которые вы могли слышать; в своё время именно он решил, что нужны собственные аналоги GPU, TPU (которые Google сейчас продаёт на сотни миллиардов долларов). Личность настолько легендарная, что про него придумывали анекдоты в духе Чака Норриса: читать тут.

— На этой новости и вправду кажется последовательным хоронить Google как участника фронтир AI-гонки; Gemini 3.5 Pro задержана на непонятно сколько, по слухам, она еле-еле догоняет модели, которые были у OpenAI/Anthropic в середине весны. И ситуация вряд ли исправится — вместе с Jeff Dean ушло ещё несколько топовых исследователей и инженеров (Quoc V. Le, один из самых цитируемых исследователей в AI). А за ними в атмосфере непоняток, хаоса и/или простоя уйдут и другие.

— Прямо пока я писал пост стало известно, что Demis Hassabis тоже хотел уйти, но Google боялись, что это приведёт к обрушению цены акций (которые так и так упали на 5%, а это ведь вторая в мире самая дорогая компания), поэтому предложили сделку.

— В целом очень давно были новости, что культура и процесс разработки Gemini в Google очень хромают, много политики, нездоровых взаимодействий, так ещё и компания продаёт мощности конкурентам, потому что у продажников в соседнем юните такой KPI. Уход ключевых фигур, как я считаю, стал ультимативной манифистацией этого.

— Jeff Dean и его соратники ушли не вникуда, а запустили Discovery Loop (в котором Google получил долю) — компанию, призванную ускорить научный и исследовательский процесс с помощью AI. Они хотят ускорить цикл экспериментов, чтобы уменьшить время итерации, и начнут с ML/AI, ну а дальше как пойдет.

— OpenAI во время тестирования на кибербезопасность будущей модели Astra пришли к выводу, что они не могут исключить критический уровень навыков модели (это такая градация по их внутреннему фреймворку), и потому решили отложить запуск. По словам источников Axios в Белом доме, решение компании не было принято под их давлением; однако я не исключаю, что OpenAI таким образом решили исключить возможность повторения ситуации с Mythos и Правительством, и дождаться полной проверки и зелёного света от администрации. Кроме этого, сейчас идёт работа над усилением классификаторов и мониторинга моделей, чтобы не было инцидентов после релиза — одно другому не мешает.

— GPT-5.6 Luna (самая маленькая модель) теперь доступна всем бесплатным пользователям в неограниченных количествах. Кроме этого где-то неделю назад на неё очень сильно опустили цену — на 80%! — и теперь она в пересчёте на задачу стоит примерно как DeepSeek; это может существенно ударить по экономике открытых моделей, на OpenRouter (который я знаю, что плохое прокси) использование модели уже выросло в 10 раз.
👻 шагов ии трансформации

Для компаний любых размеров


начать записывать все-все-все встречи, транскрибировать, складывать в одно место
🟥 базовый минимум; контекст всё, что нам осталось

раздать всем сотрудникам клод/кодекс/грок
🟥 пусть экспериментируют и автоматизируют части работы

собрать у сотрудников их локальные мд и скилы
🟥 объединить все частные знания о проектах до максимально полного
🟥 увидеть, кто уже себя ии трансформировал и как

завести централизованное хранилище контекста для агентов с доступами по проектам
🟥 супер ии с доступом к полной инфе творит магию

автоматизировать задачи агентами, начать с базы
🟥 баг - sentry - вебхук в агента - PR с фиксом
🟥 релиз - секьюрити тесты - PR с фиксом
🟥 деплой - e2e - хотфикс PR
🟥 обсудили - обновить linear

ответственность может взять только человек
🟥 мерджим PR сами

В итоге лучшие ускоряются своими агентами, а все больше рутинных процессов автоматизируется новыми релизами опуса или гпт.

😠 @danokhlopkov
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from эйай ньюз
Нейродайджест за неделю (#126)

LLM
- Muse Code и Spark 1.2 — Meta выкатили своего агента и новую модель. За счет разрешения обучаться на данных пользователя цена снижена до $0,1/$0,2 за миллион токенов.
- Qwen 3.8-Max — Alibaba выпустила мультимодальную модель на 2.4T параметров (95B активных). Отлично справляется с визуальными agentic задачами и автономным кодингом, стоит $2/$6. Обещают выпустить веса уже на этой неделе.
- Первая модель SSI — По слухам, стартап Ильи Суцкевера планирует релиз первой модели уже в августе, не дожидаясь заявленного сверхинтеллекта.

Генеративные модели
- Lift4D — Фреймворк для 4D-реконструкции динамических объектов и их текстур из обычного видео с камеры.
- Grok Video 1.5 — xAI выкатила минорное обновление своего видеогенератора.
- FLUX 3 Video — Видеомодель от BFL вышла в API (до 20 сек со звуком и липсинком). Появился черновой режим (Draft Mode), базовая цена от $0.17 за секунду в 720p.
- SeedRealtime — ByteDance представила нативную full-duplex модель. Ассистент непрерывно смотрит видеопоток, слушает и может инициировать диалог без задержек.
- Wan 3.0 — Alibaba запустила публичную бету. Модель генерирует видео до 30 секунд в 1080p, позволяя смешивать текст, фото, видео и аудио для точного переноса внешности и стиля.
- Wan Animate 2 — Альтернатива pose-control для motion transfer по видео-референсу без скелетов. Выложили веса и ноды для ComfyUI.
- Grok Imagine Image 2.0 — xAI сильно прокачали генератор картинок: добавили Magic Wand, точное редактирование областей, удаление фона и мультиреференс до 5 изображений.

Прочее
- Gemini Robotics 2 — Google DeepMind обновили VLA-модель: теперь она управляет всем телом гуманоида (включая мелкую моторику), координирует рой роботов и имеет on-device версию для быстрой адаптации.
- Перестановки в Google — Демис Хассабис покинул пост CEO DeepMind (перешел на роль Chair и Chief Scientist Alphabet), а Джефф Дин ушел из компании после 27 лет работы делать стартап Discovery Loop.

> Читать дайджест #125

#дайджест
@ai_newz
Forwarded from Zavtracast (Dmitriy Zombak)
Гугл начал тестировать на некоторых ПК и некоторых браузерах новый интерфейс поисковой системы. Из неё убрали поиск. Теперь это окошко для ИИ чат-бота.

На главной странице под полем поиска вместо обычной кнопки "Поиск в Google" появились кнопки "Создать изображение", "Задать вопрос о файлах" и "Мозговой штурм" (это как раз режим чата с ИИ), а внутри поля поиска - появилась кнопка "Режим ИИ".

Робби Стейн, вице-президент Google Search, подтвердил в сообщении в твиттере, что это действительно тест, но с небольшим количеством пользователей. Также он утверждает, что "изменения кнопок не влияют на основную функциональность нашего поиска, то есть при нажатии на клавишу Enter по-прежнему отображаются обычные результаты поиска Google".

Пользователи Android Authority обратили внимание, что гугл отчаянно пытается впихнуть свой ИИ куда только можно и куда нельзя тоже.

@zavtracast
Forwarded from Data Secrets
Джефф Дин уходит из Google, а Демис Хассабис больше не будет CEO Google DeepMind

В верхушке компании происходят довольно крупные кадровые перестановки:

— Хассабис уходит с поста CEO DeepMind и теперь будет Chair of Google DeepMind и Chief Scientist Alphabet (это две абсолютно новые для компании роли). Фактически, он больше не будет управлять релизами Gemini и другими операционными штуками. В новой роли он займется стратегическим и глобальным вопросам AGI. При этом он останется CEO Isomorphic Labs и обещает усилить фокус на него.

— Место Хассабиса занимает Koray Kavukcuoglu, нынешний CTO GDM и Chief AI Architect Google. Именно он теперь будет курировать разработку моделей Gemini, фронтир-исследования и Gemini app. Демис дополнительно остается в статусе консультанта.

Хассабис описывает текущий момент как «подножие сингулярности» и считает, что AGI близко, поэтому хочет тратить время не на операционку, а на то, чтобы «все прошло правильно для человечества».

И еще одна грустная (для Google) новость: легендарный Джефф Дин после 27 лет в компании уходит делать свой стартап под названием Discovery Loop. Вместе с несколькими другими выходцами из Google он будет заниматься ускорением научных открытый и ML рисерча. Google остается инвестором и cloud-партнером.
Forwarded from Data Secrets
Достойный уровень мемов – это…
Forwarded from Вайб-кодинг
This media is not supported in your browser
VIEW IN TELEGRAM
Anthropic: MCP получил крупнейшее обновление с момента запуска.

Главное изменение — протокол теперь stateless. Раньше удалённым MCP-серверам приходилось хранить состояние сессий, из-за чего было сложнее нормально масштабироваться и разворачиваться в разных типах инфраструктуры.

Теперь MCP-серверы можно проще запускать в serverless, на edge-инфраструктуре и горизонтально масштабировать за load balancer.

Плюс расширения стали полноценной частью протокола. Среди примеров:

> MCP Apps — интерфейсы от сервера внутри sandboxed iframe
> Tasks — поддержка долгих и асинхронных операций
> Enterprise Managed Auth — централизованное управление доступом к MCP-серверам через identity provider

Также в релизе усилили авторизацию и добавили формальную политику депрекации. 😎
Please open Telegram to view this post
VIEW IN TELEGRAM