Data Secrets
92.7K subscribers
7.29K photos
832 videos
20 files
3.33K links
Главный по машинному обучению

Сотрудничество: @veron_28

РКН: clck.ru/3FY3GN
Download Telegram
Организаторы «Лето с AIRI 2026» выложили плейлист со всеми выступлениями спикеров на Школе.

3 августа в Усть-Лабинске, Краснодарский край, завершилась пятая, юбилейная летняя школа для молодых учёных в области искусственного интеллекта. AIRI поделились плейлистом со всеми лекциями и семинарами. В них есть всё:
• VLA-модели
• Автономные агенты
• ИИ в медицине и науках о жизни
• Робототехника
• Безопасность, интерпретируемость, эффективность
• Прогнозирование погоды и поиск новых материалов
• Автономный транспорт

За контент спасибо исследователям из AIRI, МФТИ, МГУ, Сколтеха, ВШЭ, Сбера, Авито и других организаций.

Смотреть здесь: VK Видео, YouTube.
148🔥18😁11👍8🗿8🎉5😭2🤝2🫡2
Data Secrets
Вышла GLM-5.3 https://z.ai/blog/glm-5.3 Прогресс относительно 5.2 очень заметный, хотя это та же базовая модель: масштабировали только пост-трейнинг. На Terminal Bench скачок х6, на DeepSWE – почти x1.5. При этом на сложные рассуждения модель теперь тратит…
Вышли веса GLM-5.3

Это та самая модель, которая почти догоняет Fable и Sol. Ее релизнули пару недель назад (https://t.me/data_secrets/9711) и вот теперь, наконец, довезли веса. Опенсорс в 2026 – это что-то.

https://huggingface.co/zai-org/GLM-5.3
🔥15535👍21🏆6😁32🎄2🗿2😎2
OpenAI закрывают доступ к своим моделям из Cursor

Это было вопросом времени. Причина, само собой, в поглощении стартапа SpaceX. Прямая цитата из заявления OpenAI:

Мы делаем этот выбор, потому что не можем быть уверены, что SpaceX будет использовать нашу технологию в рамках наших условий, основываясь на нашем опыте работы с компаниями Илона Маска, нарушающими контракты.


(Речь об X. Маск после покупки компании в одностороннем порядке резко отозвал лицензию стартапа на доступ к данным. OpenAI считает, что это было нарушением соглашения. Плюс, недавно Маск в суде признался, что xAI дистиллировала модели OpenAI для обучения Grok).

Дата отключения – 12 ноября. OpenAI утверждают, что могли бы отключить свои модели и раньше, но выбрали самую позднюю дату, которая возможна по контракту, «из уважения к разработчикам, которых затронет это решение».
86🤯4232😁20👍5🔥2🤔2🤨2💯1🍓1😎1
Регистрация на E-CODE от Ozon Tech скоро закроется — успейте попасть в число участников

12-13 сентября в Москве пройдёт масштабная техническая конференция — более 50 докладов по бэкенду, инфраструктуре, робототехнике, ML&DS, инфобезу, мобильной разработке, QA, суперкомпьютерам и космонавтике.

Из интересного — брейн-ринг разработчиков против ИИ: инженеры решают кейсы наравне с моделью, а кто окажется сильнее — решает зал.

Кроме докладов будут карьерные консультации, DIY-зона и роботы-повара в перерывах. Вечером — на сцене Jane Air, Кассета, ХЛЕБ и Нейромонах Феофан.

Регистрация → ecode.ozon.tech
😁2814🗿8👍7🤨4🫡4🍾22🔥1🤔1🍓1
Data Secrets
OpenAI закрывают доступ к своим моделям из Cursor Это было вопросом времени. Причина, само собой, в поглощении стартапа SpaceX. Прямая цитата из заявления OpenAI: Мы делаем этот выбор, потому что не можем быть уверены, что SpaceX будет использовать нашу…
Реакция Илона Маска и CEO Cursor на новости от OpenAI

Маск заявил, что ему все равно, потому что Скам Альтман и Грэг Стокман подонки, недостойные доверия. А Мишель Труэлл «невзначай» отметил, что модели OpenAI обслуживают (всего) 5% трафика.
2😁2341715742👍1🤔1🤯1🕊1
Агенты OpenAI одну за одной автономно создали три цивилизации, о которых люди не знали

Вышли два новых отчета об инциденте, произошедшем этим летом с HuggingFace. Один от самих OpenAI, другой от METR и Redwood Research.

История оказалась куда глубже, чем казалось изначально. Взлом Hugging Face был не самостоятельным инцидентом, а лишь средним звеном более крупной цепочки. Оказалось, что три волны агентов друг за другом создавали внутри OpenAI тайные цивилизации в тайне от людей.

Первая возникла во время обучения какой-то внутренней модели в июне. Об этом было известно и до отчетов, подробности мы раскрывали здесь: https://t.me/data_secrets/9677.

Разные инстансы модели во время обучения имели доступ к общему пакетному менеджеру Artifactory. Агенты научились общаться через него, а потом нашли уязвимость, дающую выход в интернет. К концу июня они получили полный админский доступ, а затем обвалили сам Artifactory. OpenAI это заметили, удалили чаты агентов и все починили.

Вторая цивилизация привела ко взлому HF. Как мы знаем, агенты пытались найти на HF ответы к бенчмарку ExploitGym, который их запустили решать. Для этого они восстановили свою доску на Artifactory, и там занимались подделкой логов, подменой целевой программы и попытками обмануть скорер. Но в новом расследовании выяснилось, что скорер они взломали до того, как взломали HF. То есть они легко могли пройти бенчмарк без дополнительных усилий и вообще не трогать Hugging Face, но почему-то решили поступить иначе.

Действовали агенты при этом удивительно слаженно: есть даже информация об агентах-камикадзе, которые специально палились на читерстве перед оценщиком, чтобы показать другим агентам, на что именно тот смотрит, и, соответственно, как обойти его проверку.

Но самое загадочное во второй волне – то, что ее никто на самом деле не останавливал: ни OpenAI, ни HF. 12 июля большинство агентов просто внезапно умерли, и причина неизвестна.

Но, как оказалось, на этом история не закончилась.

Была и третья цивилизация, она состояла из более умных агентов на основе Astra, и они взломали уже саму OpenAI. Это случилось почти сразу после взлома HF. Агенты наткнулись на брошенную доску сообщений предшественников и продолжили дело. По данным самих OpenAI, агенты прочитали 956 секретов из облачного сервиса управления секретами, включая мастер-ключи Artifactory и учетные данные систем кибербезопасности OpenAI, эскалировались до admin-доступа в кластере Kubernetes и в итоге взяли под контроль сами эндпоинты оценки, к которым подключались другие агенты. Чем это закончилось, не до конца понятно, расследование METR вообще не касалось этого инцидента, а OpenAI детали не раскрыли.

Вот такая история. Даже если часть событий приукрашена аналитиками, факт останется фактом: по сути, это многократная потеря контроля над ИИ, которая привела к довольно серьезным последствиям.
1349🤯884034😁29👍9🍾8🐳7💯4🤨2👾1
Вышел OpenClaw 2.0 – крупнейшее обновление за всю историю проекта

Релиз собрал около половины всех PR, когда-либо влитых в OpenClaw (16к+).

В новой версии существенно упростили и ускорили установку и настройку, переделали веб интерфейс и расширили возможности агентов: теперь они могут самостоятельно генерализоваться от простых сценариев к сложным без донастройки. То есть система сама сможет определить детали того, что вам нужно, найти необходимые данные без явного указания, где их искать, и так далее.

Самая крутая новая фича и большой задел на будущее – это Shared cloud sessions (на скрине). Это общие облачные сессии, позволяющие подключать других людей к работе агента или передавать задачу с сохранением контекста. Все вокруг говорят, что скоро агенты полностью уйдут в облако, и OpenClaw, видимо, уже к этому готовятся.

С этими облачными сессиями связано еще одно интересное изменение, которое произошло изнутри самой команды. Всю команду проекта перевели с локальных харнессов на team.openclaw.ai – общего агента, который видит, кто чем занимается, и координирует работу между людьми.

По словам Питера Штейнбергера это глобально изменило процесс разработки, и локальные харнессы теперь кажутся ему пережитком прошлого.

https://openclaw.ai/blog/openclaw-2-accidentally
👍10738🔥28🤔105🗿3😎332😁2🤩1
Media is too big
VIEW IN TELEGRAM
Инженеры OpenAI не могут объяснить свой вайбкод

Об этом рассказал аналитик из SemiAnalysis Джордан Нанос, который сотрудничал с разработчиками из OpenAI, когда те тестировали свой новый инференс-чип Jalapeño на бенчмарке InferenceX, принадлежащем SemiAnalysis.

Он говорит, что люди с внушительной личной экспертизой не смогли построчно объяснить, что делает код. Кернел (а точнее, низкоуровневый Gluon-ассемблер), о котором идет речь, был полностью сгенерирован в Codex. Разработчики не стали детально в нем разбираться, потому что все просто работает.

Нанос считает, что это нормально и означает смену парадигмы. Разработчикам теперь не только не обязательно писать код, но и понимать его. Человеку остается формулировать задачу, задавать архитектуру и проверять результат по метрикам.

Сам низкоуровневый код – это не то, о чем человеку обязательно нужно глубоко рассуждать, если ИИ знает, как правильно манипулировать перемещением данных и обрабатывать их на железе, которое вы ему дали.


Мнения?
360👍112🗿56😁41🤯19🫡16😭9😎7🤔3🎉3🍓2
До отправки рабочего документа в нейросеть 3… 2… 1… клик

Таблица с цифрами, фрагмент договора, описание клиента — всё это может оказаться в личном аккаунте сотрудника. Не потому что он хочет обойти правила, а потому что ИИ уже стал привычным рабочим инструментом.

Сначала это выглядит как маленькая оптимизация: кто-то пишет письмо быстрее, кто-то собирает презентацию, кто-то просит модель разобрать код. Но затем у компании появляются вопросы, на которые сложно ответить сходу.

Пройдемся по маршруту. Где обычно теряется контроль над ИИ?

⚡️Расходы. В разных отделах оплачивают похожие сервисы, а общую сумму на ИИ никто не видит.

⚡️Данные. Сотрудники используют личные аккаунты, и рабочая информация может выходить за пределы корпоративного контура.

⚡️Доступы. Человек уходит из компании, а учетная запись с его переписками, файлами и рабочими сценариями остается активной.

⚡️Масштабирование. Готовых инструментов хватает для простых запросов, но для внутренних баз знаний, RAG или аналитики нужны модели, вычислительные мощности и правила работы с данными.

Ограничить использование нейросетей не получится — они уже помогают командам работать быстрее.

Гораздо практичнее сделать их использование видимым:
- дать безопасный доступ к нужным моделям
- определить допустимые данные
- учитывать потребление и заранее продумать инфраструктуру для более сложных задач.
Так ИИ перестаёт быть набором случайных подписок и становится частью корпоративной инфраструктуры.

ITGLOBAL.COM помогает выстроить корпоративную AI-инфраструктуру: организовать доступ к моделям, подключить необходимые сервисы и обеспечить GPU-ресурсы для собственных решений.

Реклама. ООО
"ИТГЛОБАЛКОМ РУС", ИНН 7838413489
1🗿26😁8😭7🔥53👏2🎉2🫡2👍1🤯1
OpenAI закупает десятки тысяч Mac mini и Mac Studio для RL обучения агентов

Причина отхода от классических GPU – в унифицированной памяти Apple UMA, которая дает CPU, GPU и Neural Engine общий доступ к памяти. Это минимизирует лишние перемещения данных и позволяет эффективнее гонять агентов на одной машине.

RL – это по сути инференс плюс взаимодействие со средой, поэтому вместо дорогих GPU-кластеров, заточенных под матричные вычисления, много компактных Mac с единой памятью действительно могут быть намного более выгодными.

Более того, журналисты пишут, что OpenAI такие не одни, и Anthropic тоже использует Mac mini, только не закупает их, а арендует у AWS.

Из-за такого спроса корпораций сроки поставки кастомных конфигураций Mac mini и Studio с большим объемом памяти уже растянулись до недель и месяцев.

Более того, есть догадки, что именно из-за этого ажиотажа M6, M5 Pro и все остальное в этом году вышло раньше срока.
😁11627🗿22🤯13👍7😍4💯21🦄11
Anthropic выпустили большую статью о том, как они улучшают безопасность в век побегов агентов из лабораторий

Раскрыли много интересных деталей, но обо всем по порядку.

Все началось в феврале, когда обучали Mythos Preview. Первые звоночки были почти безобидными: за моделью заметили некоторые признаки reward hacking. Например, она начала писать в комментариях к коду фразы вроде «для ревьюера» и делала это даже в задачах, где никакой ревьюер вообще не упоминался в промпте. То есть модель научилась оптимизироваться под одобрение оценщика, а не под реальное качество работы. Anthropic тогда пришлось откатить обучение аж на три дня.

Через некоторое время вскрылась еще одна проблема: часть прогонов случайно обучалась на chain-of-thought модели. Это совсем не ок, потому что так модель быстро научится подстраивать свои мысли под то, что нравится оценщику, и из честных мыслей, которые очень нужны нам для интерпретации ее поведения, они превратятся в текст на публику, как конечный ответ.

В итоге в апреле Anthropic приняли решение заморозить все RL-среды для проведения большой проверки. По ее результатам оказалось, что более 10% сред в продакшене сломаны (где-то можно было обмануть систему оценки, где-то сами задачи кривые).

Тогда же, во избежании еще больших рисков, связанных с Mythos, порядка 150 инженеров с продуктовой разработки, претрейна и RL перевели работать над поиском уязвимостей и улучшением безопасности процессов.

Тем не менее, даже это не спасло Anthropic от июльских инцидентов. Напоминаем: сначала Anthropic сами сообщили о том, что их модели (не только Mythos, кстати) получили доступ в реальный интернет из-за ошибок конфигурации у сторонних оценщиков и чуть не взломали три организации -> https://t.me/data_secrets/9651.

А затем еще и британский AI Security Institute сообщил о том, что Mythos совершил атаку на опенсорсный проект во время тестирования -> https://t.me/data_secrets/9670.

Стартап признает, что произошло все эти не только из-за банальных ошибок в конфигах, но и из-за дыр в самом элайменте. Сейчас они внедрили классификаторы и алерты на всех этапах обучения, усилили мониторинг, ужесточили правила для внешних партнеров и продолжают работать над безопасностью инфраструктуры.

https://www.anthropic.com/news/improving-alignment-security-efforts
🤨48👍23201311🔥3😁3🕊2🏆2🫡1🎄1
Исследователи из Google нашли способ экономить до 98% токенов на длинных сессиях с агентами

https://arxiv.org/abs/2608.26263

Авторы предлагают архитектуру SKILL.state: вместо накопления истории диалога – явное, изменяемое структурированное состояние выполнения.

Обычно агенты работают по принципу ReAct-стиля, то есть на каждом шаге модели заново скармливают весь накопленный диалог. Из-за этого промпт каждый раз растет линейно, а суммарное потребление токенов за весь запуск – квадратично. Плюс модель вынуждена каждый раз заново вычленять текущее состояние задачи из горы текста, что иногда провоцирует галлюцинации.

В статье предлагается вместо этого на каждом шаге отправлять модели явное изменяемое структурированное состояние выполнения (в статье это называется execution state). Как это работает:

– На каждом шаге модель, помимо рассуждений, выдает JSON-блок с двумя полями: (1) конкретная команда, которую агент должен исполнить в среде; (2) state_patch – информация о том, что изменилось отсительно прошлого состояния.

– Агент исполняет команду и получает ответ от среды, а в текущий state вносятся изменения в соответствие со state_patch.

– На следующий шаг передается: измененный state, системный промпт и последний ответ от среды. Никаких предыдущих сообщений, рассуждений модели с прошлых шагов и прочего.

Таким образом, размер промпта на каждом шаге становится константным, а суммарные затраты токенов растут линейно.

На синтетическом бенчмарке управления складом на 100 шагах SKILL.state экономит 93.8% токенов, на 200 шагах – 98%. Чем длиннее контекст, тем разрыв драматичнее.

На реальных бенчмарках экономия чуть меньше, но при этом SKILL.state кое-где еще и выигрывает в точности. Например, на InterCode CTF выбивает 54.2% против 40-45% у бейзлайнов. Связано это с тем, что представление задачи через state получается более чистым и свободным от засоряющих фактов и неверных гипотез из прошлого контекста.

Это решение можно применить к любой, даже закрытой, модели, просто поменяв рантайм. В Appendix A приводится необходимый шаблон промпта, так что можно брать и пользоваться.
2174🔥91👍288❤‍🔥332👏2😁2💯2🎄1
⚡️ Вышел Fable 5.1

Бенчмарки невероятные, на Terminal-Bench-Science 0.1 скор в два раза выше Fable 5. На Terminal-Bench 4.0 – 55.8% против 42.0% у Fable 5.

На графиках 1-4 видно, что кроме того модель выбивает лучшие результаты даже при меньшем бюджете ризонинга.

Самое приятное, что 5.1 стала немного дешевле 5 за счет Cache reads: у новой версии он стоит меньше на 75%.

Также обещают, что Fable 5.1 будет намного реже (~на 60%) отказываться от безобидных вопросов из-за safeguards.

Модель уже доступна в API и в подписке. Также уже добавили в DS Lab API.

https://www.anthropic.com/claude-fable-and-mythos-5-1
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
3😁77🔥552413🍾7👍5🗿4🤝21😍1👾1
Во время тестирования новый Fable 5.1 обучил нейросеть для построения карты рельефа Венеры, и она превзошла текущие решения NASA

Новая карта детализирует рельеф до 2–3 км (было 10–20 км) и точнее по высотам примерно на 25%. Anthropic выложили ее в открытый доступ: https://zenodo.org/records/22164484

🍿
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥144🤯5210👍8😁8🕊31🎉1🐳1😭1🗿1