Data Secrets
Герой дня – Дарио Амодеи на свежем репортаже из Белого Дома, где техлидеры обсуждали контроль ИИ (Да, на этот раз его позвали)
Media is too big
VIEW IN TELEGRAM
Кстати, по итогу этой встречи ИИ-лидеры подписали добровольное соглашение о контроле
В нем написано, что они обязуются ввести внутренний контроль, внутреннюю команду надзора, внешние аудиты и независимый наблюдательный совет.
Никаких санкций за нарушение соглашения нет. Трамп на вопрос, обязательно ли оно, ответил, что оно «морально» обязывающее.
Также на этой встрече Трамп подписал указ, по которому федеральные ведомства в официальных материалах теперь должны говорить «Super Intelligence» («SI») вместо «AI».
В нем написано, что они обязуются ввести внутренний контроль, внутреннюю команду надзора, внешние аудиты и независимый наблюдательный совет.
Никаких санкций за нарушение соглашения нет. Трамп на вопрос, обязательно ли оно, ответил, что оно «морально» обязывающее.
Также на этой встрече Трамп подписал указ, по которому федеральные ведомства в официальных материалах теперь должны говорить «Super Intelligence» («SI») вместо «AI».
😁214👍17👌10❤6🗿5🦄5😎3🎄2💯1
Data Secrets
OpenAI релизнули Dots – always-on агентов на основе Astra Это агенты, которые работают постоянно и сопровождают вас во всех рабочих процессах. Им можно делегировать длинные задачи и все, что связано с кодом, компьютером и браузером. Можно дать ему коннектор…
После презентации нового агента Dots от OpenAI домен dot.com начал перенаправлять пользователей на страницу Grok Bot.
Компания Маска приобрела домен еще в июле, задолго до анонса. Было ли это совпадением или заранее спланированным троллингом, пока неизвестно🍷
Компания Маска приобрела домен еще в июле, задолго до анонса. Было ли это совпадением или заранее спланированным троллингом, пока неизвестно
Please open Telegram to view this post
VIEW IN TELEGRAM
😁269 22❤11👍3🔥2👏2 2🕊1💯1
Т-Технологии показали на ACM RecSys 2026 три инструмента для рекомендаций, и все они в опенсорсе
Рекомендательные системы часто упираются в нехватку данных. В новом сервисе у пользователя нет истории, а у редких товаров почти нет взаимодействий. Это называется холодным стартом.
Исследователи Т-Технологий занялись этой проблемой и сделали три инструмента, нацеленных на ее решение: фреймворк Perseus, библиотеку Scikit-Rank и метод ScaL³AE.
Работы команда на днях представила на ACM RecSys 2026. Это конференция уровня A по рекомендательным системам, которая проходит в Миннеаполисе, США.
— Perseus решает проблему разрозненных данных внутри экосистемы. Например, человек покупает в «Шопинге», получает кэшбэк, пишет в поддержку и тд, но при этом в каждом сервисе о нем своя обрывочная история. Perseus собирает все эти действия в одну последовательность и обучает на ней нейросеть, так что даже новый сервис сразу знает клиента.
На собственных данных T-ECD качество рекомендаций выросло на 16-39% в зависимости от домена. При этом Perseus универсален, и применить его можно почти в любом продукте. Подробнее про этот фреймворк мы писали здесь: https://t.me/data_secrets/9576.
— Библиотека Scikit-Rank закрывает другую боль. Даже если вы сделали отличную нейросеть для ранжирования и она уверенно прошла тесты, встроить ее в текущий пайплайн отдельная головная боль: код приходится переписывать чуть ли не с нуля. Scikit-Rank снимает эту проблему тем, что ведет себя как обычная модель из scikit-learn. Ее можно поставить в паре с Perseus: он подбирает кандидатов, Scikit-Rank их ранжирует, и оба этапа рекомендательной системы становятся нейросетевыми. При этом по качеству она не хуже XGBoost, LightGBM и CatBoost, а на рекомендации новостей заметно их обходит.
— ScaL³AE нужен для каталогов, где по многим товарам мало данных о взаимодействиях. Он подтягивает описания товаров от языковых моделей и при этом работает на каталогах промышленного масштаба, в то время как предыдущая версия этого метода упиралась в память.
Каждую из этих разработок сообщество может щупать и переиспользовать: открытый код Perseus и ScaL³AE лежит на GitHub, Scikit-Rank доступен на PyPI, плюс есть интерактивное демо в Google Colab.
Рекомендательные системы часто упираются в нехватку данных. В новом сервисе у пользователя нет истории, а у редких товаров почти нет взаимодействий. Это называется холодным стартом.
Исследователи Т-Технологий занялись этой проблемой и сделали три инструмента, нацеленных на ее решение: фреймворк Perseus, библиотеку Scikit-Rank и метод ScaL³AE.
Работы команда на днях представила на ACM RecSys 2026. Это конференция уровня A по рекомендательным системам, которая проходит в Миннеаполисе, США.
— Perseus решает проблему разрозненных данных внутри экосистемы. Например, человек покупает в «Шопинге», получает кэшбэк, пишет в поддержку и тд, но при этом в каждом сервисе о нем своя обрывочная история. Perseus собирает все эти действия в одну последовательность и обучает на ней нейросеть, так что даже новый сервис сразу знает клиента.
На собственных данных T-ECD качество рекомендаций выросло на 16-39% в зависимости от домена. При этом Perseus универсален, и применить его можно почти в любом продукте. Подробнее про этот фреймворк мы писали здесь: https://t.me/data_secrets/9576.
— Библиотека Scikit-Rank закрывает другую боль. Даже если вы сделали отличную нейросеть для ранжирования и она уверенно прошла тесты, встроить ее в текущий пайплайн отдельная головная боль: код приходится переписывать чуть ли не с нуля. Scikit-Rank снимает эту проблему тем, что ведет себя как обычная модель из scikit-learn. Ее можно поставить в паре с Perseus: он подбирает кандидатов, Scikit-Rank их ранжирует, и оба этапа рекомендательной системы становятся нейросетевыми. При этом по качеству она не хуже XGBoost, LightGBM и CatBoost, а на рекомендации новостей заметно их обходит.
— ScaL³AE нужен для каталогов, где по многим товарам мало данных о взаимодействиях. Он подтягивает описания товаров от языковых моделей и при этом работает на каталогах промышленного масштаба, в то время как предыдущая версия этого метода упиралась в память.
Каждую из этих разработок сообщество может щупать и переиспользовать: открытый код Perseus и ScaL³AE лежит на GitHub, Scikit-Rank доступен на PyPI, плюс есть интерактивное демо в Google Colab.
👍89❤69🔥54😁11🍾6☃3❤🔥2🤩1🕊1
DeepSeek вместе с Huawei разрабатывают альтернативу CUDA
Компании выложили в опенсорс набор инструментов для чипов Huawei Ascend. Сейчас это главные китайские AI-ускорители, на которые переходят все их стартапы. Большая проблема с переходом на новое железо заключается в софте: вся индустрия 10+ лет писала все под CUDA от Nvidia, и теперь Китаю предстоит восстановить то же самое для своих чипов.
Собственно, этим DeepSeek и занимается. В частности, они выпустили в опенсорс Ascend-версии своих фирменных библиотек, на которых держатся ее собственные модели: DeepGEMM (умножение матриц), DeepEP (связь между чипами для MoE-моделей), FlashMLA (attention) и еще несколько. API у них такая же, как у Nvidia-версий, поэтому код с Nvidia переезжает почти без переписывания.
Весь этот стек работает на TileLang: это тоже китайский проект. DeepSeek утверждает, что язык компактнее CUDA, а все TileLang-ядра, на которых она обучает свои модели, уже работают на Ascend.
Понятно, что это замена не всего стека CUDA, а только написания ядер, но направление понятное: Китай методично закрывает зависимость от Nvidia на всех уровнях.
Компании выложили в опенсорс набор инструментов для чипов Huawei Ascend. Сейчас это главные китайские AI-ускорители, на которые переходят все их стартапы. Большая проблема с переходом на новое железо заключается в софте: вся индустрия 10+ лет писала все под CUDA от Nvidia, и теперь Китаю предстоит восстановить то же самое для своих чипов.
Собственно, этим DeepSeek и занимается. В частности, они выпустили в опенсорс Ascend-версии своих фирменных библиотек, на которых держатся ее собственные модели: DeepGEMM (умножение матриц), DeepEP (связь между чипами для MoE-моделей), FlashMLA (attention) и еще несколько. API у них такая же, как у Nvidia-версий, поэтому код с Nvidia переезжает почти без переписывания.
Весь этот стек работает на TileLang: это тоже китайский проект. DeepSeek утверждает, что язык компактнее CUDA, а все TileLang-ядра, на которых она обучает свои модели, уже работают на Ascend.
Понятно, что это замена не всего стека CUDA, а только написания ядер, но направление понятное: Китай методично закрывает зависимость от Nvidia на всех уровнях.
👍173❤41🔥29👏4🤔4🍾2🫡2😎2😁1 1
Каждую осень у бизнеса просыпается спрос на подрядчиков – бухгалтеров, юристов, маркетологов, дизайнеров, разработчиков и других фрилансеров. Для тех, кто оказывает такие услуги, это сезон, когда стоит активнее искать заказчиков — вопрос только где.
Ответ – Авито Услуги. По данным внутреннего исследования платформы, ежемесячно услуги там ищут 37,3 млн человек, и из них 7 млн – с деловыми задачами, то есть уже с конкретным запросом и бюджетом. Платформа позволяет заказчику и исполнителю быстро и просто найти друг друга.
— Начать довольно просто. Оформляете профиль, размещаете объявление и описываете, какие задачи можете решить, указав прайс-лист, портфолио и другие немаловажные детали.
— Инструменты продвижения уже встроены в площадку: обучающие материалы, персональный менеджер и личный кабинет с аналитикой, где видно, что ищут прямо сейчас.
В части категорий доступен безопасный сценарий сделки: условия фиксируются заранее, оплата резервируется и списывается только после приемки работы.
Если оставить заявку на сайте, менеджер Авито Услуг бесплатно поможет с оформлением профиля и объявления и начислит до 10 000 бонусов на продвижение
Ответ – Авито Услуги. По данным внутреннего исследования платформы, ежемесячно услуги там ищут 37,3 млн человек, и из них 7 млн – с деловыми задачами, то есть уже с конкретным запросом и бюджетом. Платформа позволяет заказчику и исполнителю быстро и просто найти друг друга.
— Начать довольно просто. Оформляете профиль, размещаете объявление и описываете, какие задачи можете решить, указав прайс-лист, портфолио и другие немаловажные детали.
— Инструменты продвижения уже встроены в площадку: обучающие материалы, персональный менеджер и личный кабинет с аналитикой, где видно, что ищут прямо сейчас.
В части категорий доступен безопасный сценарий сделки: условия фиксируются заранее, оплата резервируется и списывается только после приемки работы.
Если оставить заявку на сайте, менеджер Авито Услуг бесплатно поможет с оформлением профиля и объявления и начислит до 10 000 бонусов на продвижение
🗿27❤6👍4😁2😎2❤🔥1🔥1👌1
Data Secrets
Кстати, по итогу этой встречи ИИ-лидеры подписали добровольное соглашение о контроле В нем написано, что они обязуются ввести внутренний контроль, внутреннюю команду надзора, внешние аудиты и независимый наблюдательный совет. Никаких санкций за нарушение…
Anthropic призывают ограничить GLM-5.3
В стартапе протестировали модель на способности в области поиске уязвимостей, и их главный тезис такой: способности к автономной разработке эксплойтов, которые пять месяцев назад были только у Claude Mythos Preview, теперь есть в открытой модели, причем без серьезных ограничений на злоупотребление. "Так делать нельзя, айайай".
— На бенчмарке ExploitBench (эксплуатация известных уязвимостей в V8) GLM-5.3 довела дело до работающего эксплойта в 50 из 410 попыток, а Mythos Preview в 56.
— На внутреннем бенчмарке Anthropic по бинарной эксплуатации результат 4% против 6% у Mythos. Предыдущие модели, вроде Claude Opus 4.6 и GLM-5.2, там не справились ни разу.
— Всего за 8 часов модель нашла в JS-движке популярного браузера неизвестные уязвимости и собрала из них эксплойт для кражи файлов. Это потребовало 20 минут внимания человека + примерно $20 по тарифам API.
При этом исследователи утверждают, что защиты от вредоносных запросов у модели почти нет. Из коробки она формально отказывается от явно вредных запросов, но обойти это просто: Anthropic это удалось в 92% случаев с помощью банальных джейлбрейков, и в 100% случаев после абляции, то есть удаления механизма отказов из весов.
Авторы напрямую не пишут, что подобные модели надо ограничить, но "слегка" намекают, что, по их мнению, правительства должны проводить safety-тесты мощных моделей, а разработчикам стоит уделять больше внимания безопасности. И, естественно, между строк они напоминают, что вот они-то молодцы, и дают доступ к Mythos 5.1 только проверенным специалистам, и вообще Claude умничка и не ведется на злые джейлбрейки злых хакеров 😇
Забавно, кстати, что пост этот Anthropic выложили именно в день, когда в Белом Доме все американские лидеры подписали соглашение о контроле ИИ с Трампом
В стартапе протестировали модель на способности в области поиске уязвимостей, и их главный тезис такой: способности к автономной разработке эксплойтов, которые пять месяцев назад были только у Claude Mythos Preview, теперь есть в открытой модели, причем без серьезных ограничений на злоупотребление. "Так делать нельзя, айайай".
— На бенчмарке ExploitBench (эксплуатация известных уязвимостей в V8) GLM-5.3 довела дело до работающего эксплойта в 50 из 410 попыток, а Mythos Preview в 56.
— На внутреннем бенчмарке Anthropic по бинарной эксплуатации результат 4% против 6% у Mythos. Предыдущие модели, вроде Claude Opus 4.6 и GLM-5.2, там не справились ни разу.
— Всего за 8 часов модель нашла в JS-движке популярного браузера неизвестные уязвимости и собрала из них эксплойт для кражи файлов. Это потребовало 20 минут внимания человека + примерно $20 по тарифам API.
При этом исследователи утверждают, что защиты от вредоносных запросов у модели почти нет. Из коробки она формально отказывается от явно вредных запросов, но обойти это просто: Anthropic это удалось в 92% случаев с помощью банальных джейлбрейков, и в 100% случаев после абляции, то есть удаления механизма отказов из весов.
Авторы напрямую не пишут, что подобные модели надо ограничить, но "слегка" намекают, что, по их мнению, правительства должны проводить safety-тесты мощных моделей, а разработчикам стоит уделять больше внимания безопасности. И, естественно, между строк они напоминают, что вот они-то молодцы, и дают доступ к Mythos 5.1 только проверенным специалистам, и вообще Claude умничка и не ведется на злые джейлбрейки злых хакеров 😇
Забавно, кстати, что пост этот Anthropic выложили именно в день, когда в Белом Доме все американские лидеры подписали соглашение о контроле ИИ с Трампом
😁240🐳40❤26👍11 8🔥4🤯3💯3🗿3⚡1🤗1
Что, простите?
Google только что вернулся в гонку с новой моделью, которая превосходит Astra и Fable 5.1
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
Google только что вернулся в гонку с новой моделью, которая превосходит Astra и Fable 5.1
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
1😁211🔥112🤯42👍10❤8🤔3☃2💯2
Gemini 4 Argon, сводка:
— По бенчмам все супермощно, на многих тестах это новая SOTA, включая DeepSWE
— Попробовать пока нельзя, уже по классике выдают на тесты только кибербезопасникам. Далее раскапывать начнут с Google AI Ultra
— Сначала будет действовать introductory pricing $2/$10, затем будет повышение, но цена все равно будет ощутимо ниже той же Astra
— Эта модель может выдать до 1 млн токенов в одном ответе: прежний лимит составлял 64к токенов
— Внутри Google Argon уже помогал искать более эффективные квантовые схемы, оптимизировал потребление памяти в датацентрах и использовался для масштабной миграции кодовой базы на десятки тысяч строк с C++ на Rust
Google доказали что они еще живы, ура!
— По бенчмам все супермощно, на многих тестах это новая SOTA, включая DeepSWE
— Попробовать пока нельзя, уже по классике выдают на тесты только кибербезопасникам. Далее раскапывать начнут с Google AI Ultra
— Сначала будет действовать introductory pricing $2/$10, затем будет повышение, но цена все равно будет ощутимо ниже той же Astra
— Эта модель может выдать до 1 млн токенов в одном ответе: прежний лимит составлял 64к токенов
— Внутри Google Argon уже помогал искать более эффективные квантовые схемы, оптимизировал потребление памяти в датацентрах и использовался для масштабной миграции кодовой базы на десятки тысяч строк с C++ на Rust
Google доказали что они еще живы, ура!
❤271🔥101👍41🕊12😁10🤯9 6🎉3🍓2❤🔥1💯1
Media is too big
VIEW IN TELEGRAM
FigureAI заставляют своих роботов предыдущего поколения бросаться в лаву, чтобы избавиться от них
В конце августа CEO стартапа объявил, что роботов Figure 02 утилизируют (потому что с началом разработки новой версии гуманоида в штаб-квартире начинает заканчиваться место) и спросил у подписчиков в X, как лучше это сделать.
На что в комменты пришел Арнольд Шварцнеггер и ответил ему: «Вы должны их расплавить».
Figure не растерялись и не только последовали этому совету, но и пригласили Шварцнегера поучаствовать. Вчера они выпустили эпичный ролик, в котором роботы бросаются в ковш в расплавленной сталью и повторяют знаменитую сцену из Терминатора с высунутым вверх большим пальцем.
Роботов специально обучали автономно сбрасываться вниз. Для этого в симуляции натренировали новую модель по движениям каскадеров, а затем заставляли роботов прыгать со второго этажа на воздушные подушки.
Кстати, всю операцию пришлось проводить в Финляндии, потому что ни один литейный завод в США и Мексике не взял на плавку роботов с литий-ионными батареями.
Из полученного металла Figure сделают ограниченную серию памятных сувениров.
В конце августа CEO стартапа объявил, что роботов Figure 02 утилизируют (потому что с началом разработки новой версии гуманоида в штаб-квартире начинает заканчиваться место) и спросил у подписчиков в X, как лучше это сделать.
На что в комменты пришел Арнольд Шварцнеггер и ответил ему: «Вы должны их расплавить».
Figure не растерялись и не только последовали этому совету, но и пригласили Шварцнегера поучаствовать. Вчера они выпустили эпичный ролик, в котором роботы бросаются в ковш в расплавленной сталью и повторяют знаменитую сцену из Терминатора с высунутым вверх большим пальцем.
Роботов специально обучали автономно сбрасываться вниз. Для этого в симуляции натренировали новую модель по движениям каскадеров, а затем заставляли роботов прыгать со второго этажа на воздушные подушки.
Кстати, всю операцию пришлось проводить в Финляндии, потому что ни один литейный завод в США и Мексике не взял на плавку роботов с литий-ионными батареями.
Из полученного металла Figure сделают ограниченную серию памятных сувениров.
1❤137😁63🔥48😭40🫡27🤯18👍8 4🍾3😎3👌1
ИИ все чаще пишет код сам. Тогда чем теперь занимается разработчик?
На конфе Яндекса по образованию YaC/e говорили о том, как теперь учить айтишников: часть задач уже можно отдать нейронке, но понимать, как все работает вместе, все равно придется самому.
Если кратко, нужны три навыка:
— Разговаривать с ИИ на одном языке. Понимать устройство технологий, контекст, RAG и работу языковых моделей;
— Видеть ограничения технологий, которые требуют инженерной доработки;
— Смотреть на задачу не только как разработчик, но и как аналитик и продакт — пройти мысленно путь от идеи до конечного результата и видеть проект целиком.
Поэтому ИТ-универам предлагают готовить «архитекторов сложных систем». Больше внимания — математике, физике и естественно-научному мышлению: такая база помогает быстрее разобраться с новой задачей.
Стек поменяется. А разобраться, что именно ты построил вместе с ИИ, все равно придется.
На конфе Яндекса по образованию YaC/e говорили о том, как теперь учить айтишников: часть задач уже можно отдать нейронке, но понимать, как все работает вместе, все равно придется самому.
Если кратко, нужны три навыка:
— Разговаривать с ИИ на одном языке. Понимать устройство технологий, контекст, RAG и работу языковых моделей;
— Видеть ограничения технологий, которые требуют инженерной доработки;
— Смотреть на задачу не только как разработчик, но и как аналитик и продакт — пройти мысленно путь от идеи до конечного результата и видеть проект целиком.
Поэтому ИТ-универам предлагают готовить «архитекторов сложных систем». Больше внимания — математике, физике и естественно-научному мышлению: такая база помогает быстрее разобраться с новой задачей.
Стек поменяется. А разобраться, что именно ты построил вместе с ИИ, все равно придется.
🗿80🔥39🤯15❤9💯6 4❤🔥3☃2😢2🕊2🍓1
OpenAI обнаружила массовую кампанию по дистилляции своих моделей
Не так давно Anthropic утверждали, что Moonshot подменяли ответы Kimi ответами Claude (https://t.me/data_secrets/9895), а теперь со своим расследованием вышли OpenAI.
Компания обнаружила массовую попытку вытащить скрытые рассуждения своих моделей. В пике за два дня прошло 16 000 таких запросов с более чем 4 000 аккаунтов.
При этом шифрование никто не взламывал: CoT просто переносили из одного диалога в другой и просили модель воспроизвести его обычным текстом. Подробнее про эту архитектурную дыру мы писали тут: https://t.me/data_secrets/9719.
OpenAI не утверждает, что за всем этим стояла Moonshot. Но основной кластер активности компания связывает с разработчиками Kimi, а происходящее считает попыткой дистилляции своих моделей.
После расследования OpenAI закрыли возможность переносить такие зашифрованные блоки между пользователями и рабочими пространствами, усилили проверки аккаунтов и добавили отдельную защиту от вывода скрытых рассуждений. Результатами расследования также поделились с другими AI-лабораториями и властями.
https://openai.com/index/disrupting-a-coordinated-model-distillation-campaign/
Не так давно Anthropic утверждали, что Moonshot подменяли ответы Kimi ответами Claude (https://t.me/data_secrets/9895), а теперь со своим расследованием вышли OpenAI.
Компания обнаружила массовую попытку вытащить скрытые рассуждения своих моделей. В пике за два дня прошло 16 000 таких запросов с более чем 4 000 аккаунтов.
При этом шифрование никто не взламывал: CoT просто переносили из одного диалога в другой и просили модель воспроизвести его обычным текстом. Подробнее про эту архитектурную дыру мы писали тут: https://t.me/data_secrets/9719.
OpenAI не утверждает, что за всем этим стояла Moonshot. Но основной кластер активности компания связывает с разработчиками Kimi, а происходящее считает попыткой дистилляции своих моделей.
После расследования OpenAI закрыли возможность переносить такие зашифрованные блоки между пользователями и рабочими пространствами, усилили проверки аккаунтов и добавили отдельную защиту от вывода скрытых рассуждений. Результатами расследования также поделились с другими AI-лабораториями и властями.
https://openai.com/index/disrupting-a-coordinated-model-distillation-campaign/
Исследователи из Meta* предложили дать моделям полный контроль над собственным контекстом
Обычно контекст агента устроен довольно просто: старый контекст + новый ответ -> новый контекст. История постепенно растет, а когда становится слишком большой, ее приходится отдельно сжимать или чистить.
В Context Language Models (CLM) авторы предлагают вообще убрать заранее заданную логику управления контекстом и дать модели возможность самой переписывать собственную историю.
Технически весь текущий контекст хранится в обычном файле, к которому у модели есть доступ через Bash. Она может в любой момент удалить ненужные сообщения, заменить большой кусок истории короткой заметкой, сохранить важный результат дословно или полностью перестроить содержимое. После каждого изменения файл становится новым контекстом модели.
При этом никаких правил о том, как именно управлять историей, модели не дают. В экспериментах агенты сами начинали заводить внутри контекста пометки, писать функции для удаления старых результатов поиска и собирать компактные таблицы с состоянием других агентов. Например, в одном из тестов модель за 163 редактирования удерживала рабочий контекст в пределах 6–8K токенов.
Авторы пошли дальше и попробовали отдельно обучить модель этому навыку через RL. После обучения Qwen3.5-9B на BrowseComp-Plus выросла с 28.8% до 42.5%, при этом на вычисления ушло на 38.8% меньше, чем у обученного тем же способом бейзлайна с обычной суммаризацией.
Произвольное редактирование контекста, правда, ломает обычное кеширование. Если изменить что-то в середине истории, все состояния после этого места формально приходится считать заново. Для этого авторы сделали Suffix Cache Reuse: для неизменившихся частей контекста продолжают использовать старый KV-cache, даже если текст перед ними поменялся. В экспериментах это сократило серверные вычисления еще примерно на 35% без заметной потери качества.
На длинных задачах разница становится уже довольно большой. На 12-часовом EdgeBench CLM получил на 5% больше баллов при сокращении объема вычислений на 59%. В 24-часовом тесте на оптимизацию кода CLM при том же вычислительном бюджете показал на 65% лучший результат, чем бейзлайн.
И все это работает поверх обычных LLM, без изменения архитектуры самой модели.
Код | Статья
Обычно контекст агента устроен довольно просто: старый контекст + новый ответ -> новый контекст. История постепенно растет, а когда становится слишком большой, ее приходится отдельно сжимать или чистить.
В Context Language Models (CLM) авторы предлагают вообще убрать заранее заданную логику управления контекстом и дать модели возможность самой переписывать собственную историю.
Технически весь текущий контекст хранится в обычном файле, к которому у модели есть доступ через Bash. Она может в любой момент удалить ненужные сообщения, заменить большой кусок истории короткой заметкой, сохранить важный результат дословно или полностью перестроить содержимое. После каждого изменения файл становится новым контекстом модели.
При этом никаких правил о том, как именно управлять историей, модели не дают. В экспериментах агенты сами начинали заводить внутри контекста пометки, писать функции для удаления старых результатов поиска и собирать компактные таблицы с состоянием других агентов. Например, в одном из тестов модель за 163 редактирования удерживала рабочий контекст в пределах 6–8K токенов.
Авторы пошли дальше и попробовали отдельно обучить модель этому навыку через RL. После обучения Qwen3.5-9B на BrowseComp-Plus выросла с 28.8% до 42.5%, при этом на вычисления ушло на 38.8% меньше, чем у обученного тем же способом бейзлайна с обычной суммаризацией.
Произвольное редактирование контекста, правда, ломает обычное кеширование. Если изменить что-то в середине истории, все состояния после этого места формально приходится считать заново. Для этого авторы сделали Suffix Cache Reuse: для неизменившихся частей контекста продолжают использовать старый KV-cache, даже если текст перед ними поменялся. В экспериментах это сократило серверные вычисления еще примерно на 35% без заметной потери качества.
На длинных задачах разница становится уже довольно большой. На 12-часовом EdgeBench CLM получил на 5% больше баллов при сокращении объема вычислений на 59%. В 24-часовом тесте на оптимизацию кода CLM при том же вычислительном бюджете показал на 65% лучший результат, чем бейзлайн.
И все это работает поверх обычных LLM, без изменения архитектуры самой модели.
Код | Статья
❤111🔥58👍25😁4🤔4👏3🫡2⚡1🏆1 1
OpenAI пытаются задобрить пользователей после понижения лимитов
Напоминаем, что стартап на днях объявил, что в подписке за 200 долларов пользователи теперь будут получать не 20х, а всего 10х лимитов, объяснив это тем, что модели стали эффективнее использовать токены.
Естественно, это вызвало волну недовольств. И, видимо, чтобы как-то сгладить ситуацию, всем действующим подписчикам Pro 200 выдали аж 62 500 бесплатных кредитов API на аккаунт (это примерно $2500). Их можно тратить до конца года.
А лучше бы оставили квоты как было…
Напоминаем, что стартап на днях объявил, что в подписке за 200 долларов пользователи теперь будут получать не 20х, а всего 10х лимитов, объяснив это тем, что модели стали эффективнее использовать токены.
Естественно, это вызвало волну недовольств. И, видимо, чтобы как-то сгладить ситуацию, всем действующим подписчикам Pro 200 выдали аж 62 500 бесплатных кредитов API на аккаунт (это примерно $2500). Их можно тратить до конца года.
А лучше бы оставили квоты как было…
😁136☃16👍11❤8🤯4💯4🔥2🤔2😢2🏆2😎1
регистрация открыта
Этой осенью Cloud․ru снова собирает ИТ-специалистов, чтобы вместе обсудить, как строить платформы и сервисы в эпоху ИИ.
В программе три трека:
▶️ Инфраструктура▶️ Разработка▶️ Данные и ML
А еще вас ждут:
▶️ Технозоны, где можно изучить устройство сервисов и познакомиться с их создателями▶️ Воркшопы, где можно собрать решение под руководством экспертов▶️ Лаборатория карьеры, где можно получить консультацию экспертов
Где и когда:
15 октября, офлайн в Москве и онлайн
Please open Telegram to view this post
VIEW IN TELEGRAM
😁10🗿9❤5🎉2👌2☃1
GPT-6 Astra за 6 часов взломала шифр генерала Наполеона, который числился нераскрытым 217 лет
Картер Черч (не криптограф), как он описывает в своем блоге, отправил модели только изображение и промпт, и она сама нарезала скан письма на строки, прочитала знаки, свела все символы к списку уникальных, а затем использовала отжиг для подбора значений по французскому словарю.
Вся работа заняла 6 часов. Само письмо датируется концом марта 1809 года, за две недели до вторжения Австрии в Баварию. Его написал генерал Мармон. Как оказалось, в письме содержалась сводка от штаба вице-короля Италии для изолированного в Далмации Мармона: где стоят французские и союзные армии, что русские якобы идут на Австрию и что Австрия «спешит к своей гибели». Состав войск совпал с приказом Наполеона от 16 марта 1809 года.
Сатоши Токиемо, составитель каталога шифров Cryptiana, проверил решение, и письмо теперь помечено как решенное.
Напоминаем, что недавно Astra также решила ранее зашифрованную немецкую радиограмму времен Второй Мировой войны (https://t.me/data_secrets/9949)
Картер Черч (не криптограф), как он описывает в своем блоге, отправил модели только изображение и промпт, и она сама нарезала скан письма на строки, прочитала знаки, свела все символы к списку уникальных, а затем использовала отжиг для подбора значений по французскому словарю.
Вся работа заняла 6 часов. Само письмо датируется концом марта 1809 года, за две недели до вторжения Австрии в Баварию. Его написал генерал Мармон. Как оказалось, в письме содержалась сводка от штаба вице-короля Италии для изолированного в Далмации Мармона: где стоят французские и союзные армии, что русские якобы идут на Австрию и что Австрия «спешит к своей гибели». Состав войск совпал с приказом Наполеона от 16 марта 1809 года.
Сатоши Токиемо, составитель каталога шифров Cryptiana, проверил решение, и письмо теперь помечено как решенное.
Напоминаем, что недавно Astra также решила ранее зашифрованную немецкую радиограмму времен Второй Мировой войны (https://t.me/data_secrets/9949)
👍174🔥72❤37🍓5😁3👏2🦄2⚡1🎄1