Data Secrets
✔
94.4K subscribers
7.48K photos
880 videos
20 files
3.44K links
Главный по машинному обучению

Сотрудничество: @veron_28

РКН: clck.ru/3FY3GN
Download Telegram
Исследователи из Meta* предложили дать моделям полный контроль над собственным контекстом

Обычно контекст агента устроен довольно просто: старый контекст + новый ответ -> новый контекст. История постепенно растет, а когда становится слишком большой, ее приходится отдельно сжимать или чистить.

В Context Language Models (CLM) авторы предлагают вообще убрать заранее заданную логику управления контекстом и дать модели возможность самой переписывать собственную историю.

Технически весь текущий контекст хранится в обычном файле, к которому у модели есть доступ через Bash. Она может в любой момент удалить ненужные сообщения, заменить большой кусок истории короткой заметкой, сохранить важный результат дословно или полностью перестроить содержимое. После каждого изменения файл становится новым контекстом модели.

При этом никаких правил о том, как именно управлять историей, модели не дают. В экспериментах агенты сами начинали заводить внутри контекста пометки, писать функции для удаления старых результатов поиска и собирать компактные таблицы с состоянием других агентов. Например, в одном из тестов модель за 163 редактирования удерживала рабочий контекст в пределах 6–8K токенов.

Авторы пошли дальше и попробовали отдельно обучить модель этому навыку через RL. После обучения Qwen3.5-9B на BrowseComp-Plus выросла с 28.8% до 42.5%, при этом на вычисления ушло на 38.8% меньше, чем у обученного тем же способом бейзлайна с обычной суммаризацией.

Произвольное редактирование контекста, правда, ломает обычное кеширование. Если изменить что-то в середине истории, все состояния после этого места формально приходится считать заново. Для этого авторы сделали Suffix Cache Reuse: для неизменившихся частей контекста продолжают использовать старый KV-cache, даже если текст перед ними поменялся. В экспериментах это сократило серверные вычисления еще примерно на 35% без заметной потери качества.

На длинных задачах разница становится уже довольно большой. На 12-часовом EdgeBench CLM получил на 5% больше баллов при сокращении объема вычислений на 59%. В 24-часовом тесте на оптимизацию кода CLM при том же вычислительном бюджете показал на 65% лучший результат, чем бейзлайн.

И все это работает поверх обычных LLM, без изменения архитектуры самой модели.

Код | Статья
❤123🔥65👍34🤔6😁4👏33🫡2⚡1🏆1
OpenAI пытаются задобрить пользователей после понижения лимитов

Напоминаем, что стартап на днях объявил, что в подписке за 200 долларов пользователи теперь будут получать не 20х, а всего 10х лимитов, объяснив это тем, что модели стали эффективнее использовать токены.

Естественно, это вызвало волну недовольств. И, видимо, чтобы как-то сгладить ситуацию, всем действующим подписчикам Pro 200 выдали аж 62 500 бесплатных кредитов API на аккаунт (это примерно $2500). Их можно тратить до конца года.

А лучше бы оставили квоты как было…
😁160☃21👍12❤11🤯6💯4😢3🏆3🔥2🤔2😎1
😎 GoCloud Tech 2026:
регистрация открыта


Этой осенью Cloud․ru снова собирает ИТ-специалистов, чтобы вместе обсудить, как строить платформы и сервисы в эпоху ИИ.

В программе три трека:
▶️Инфраструктура
▶️Разработка
▶️Данные и ML


А еще вас ждут:
▶️Технозоны, где можно изучить устройство сервисов и познакомиться с их создателями
▶️Воркшопы, где можно собрать решение под руководством экспертов
▶️Лаборатория карьеры, где можно получить консультацию экспертов


Где и когда:
15 октября, офлайн в Москве и онлайн

✨ Количество офлайн-мест ограничено: регистрируйтесь уже сейчас
Please open Telegram to view this post
VIEW IN TELEGRAM
😁10🗿9❤6🎉2👌2☃1
GPT-6 Astra за 6 часов взломала шифр генерала Наполеона, который числился нераскрытым 217 лет

Картер Черч (не криптограф), как он описывает в своем блоге, отправил модели только изображение и промпт, и она сама нарезала скан письма на строки, прочитала знаки, свела все символы к списку уникальных, а затем использовала отжиг для подбора значений по французскому словарю.

Вся работа заняла 6 часов. Само письмо датируется концом марта 1809 года, за две недели до вторжения Австрии в Баварию. Его написал генерал Мармон. Как оказалось, в письме содержалась сводка от штаба вице-короля Италии для изолированного в Далмации Мармона: где стоят французские и союзные армии, что русские якобы идут на Австрию и что Австрия «спешит к своей гибели». Состав войск совпал с приказом Наполеона от 16 марта 1809 года.

Сатоши Токиемо, составитель каталога шифров Cryptiana, проверил решение, и письмо теперь помечено как решенное.

Напоминаем, что недавно Astra также решила ранее зашифрованную немецкую радиограмму времен Второй Мировой войны (https://t.me/data_secrets/9949)
👍219🔥94❤44🍓5😁3⚡2👏2🦄2👌1🎄1
Стартап Tavus представил Griffin – первую в мире модель, которая прошла видео-тест Тьюринга

В живом видеозвонке на минуту 48% участников (26 из 54) решили, что говорили с реальным человеком, когда говорили с Griffin. Прежде чем читать дальше, посмотрите демки, они правда выглядят пугающе живо и уже потрясли соцсети (на анонсе Tavus уже 10 миллионов просмотров).

Модель смеется, меняет тон, перебивает и позволяет перебить себя, хорошо чувствует паузы. Плюс отлично следует инструкциям, и видит/понимает собеседника и его окружение (например, может помочь собрать кубик рубика). И это уже не говоря о таких мелких вещах, как покрутиться на стуле или, например, улыбнуться, как живой собеседник.

Griffin работает как единая full-duplex video-to-video система. Каждые доли секунды она решает, стоить ли сейчас молчать, кивнуть, поддакнуть или перехватить реплику, и все это время продолжает смотреть и слушать, в том числе пока говорит сама. Поверх этого менеджера работают стриминговые генераторы речи и видео, которые превращают эти сигналы в голос и лицо в реальном времени. Некоторые детали архитектуры есть в блогпосте.

Модель пока доступна только избранным тестировщикам как research preview, потому что Tavus действительно уверены, что она способна обмануть человека, заставив его думать, что он говорит не с ИИ. Релиз обещают «очень скоро» после проработки безопасности и разработки водяных знаков.
🔥166🤯81😁24❤14👍10🤔9🍓2🤗2😎2
Data Secrets
В Твиттере заметили, что Андрей Карпаты ничего не постит уже 2 месяца, хотя раньше делал это достаточно часто Он даже ничего не написал про Opus 5.5 Anthropic держат его в заложниках?..
Карпаты рассказал, как теперь правильно общаться с LLM

Совсем недавно переживали, что Андрей Карпаты уже два месяца ничего не пишет. Все хорошо, сегодня вернулся с довольно интересной мыслью: по мере развития моделей человеку придется все меньше делать самому и все больше разбираться в результатах их работы.

И здесь обычный текст далеко не всегда лучший интерфейс. Карпаты предлагает буквально менять формат ответа в зависимости от задачи:

– Для текста просить модель писать в ASD-STE100. Это стандарт контролируемого английского, изначально разработанный для технической документации в авиации. Там жестко ограничены словарь и структура предложений, поэтому ответы получаются сильно чище. Сам Карпаты иногда просит модель следовать стандарту примерно «на 80%», чтобы текст не становился совсем технической инструкцией.

– Вместо длинного объяснения просить диаграмму или картинку.

– Для более сложных тем сразу генерировать интерактивную HTML-страницу с визуализациями и анимациями.

– А следующий шаг, на который Карпаты ставит больше всего, это одноразовые объясняющие видео под конкретный вопрос. Например, уже сейчас он предлагает просить модель собрать ролик в стиле 3Blue1Brown с озвучкой через ElevenLabs.

Идея тут шире конкретных промптов. Если код и генерация контента становятся достаточно дешевыми, под один вопрос можно создавать целое одноразовое приложение, визуализацию или видео, которое раньше просто не имело экономического смысла делать. По мнению Карпаты, по мере роста автономности моделей именно понимание и контроль их работы будут занимать все большую часть времени человека.

https://x.com/karpathy/status/2105819303471976479?s=46
1👍241❤57🔥15⚡13😁9🤔9💯8🤯3🫡3🤓2🎄1
Как проходит тихая революция в рекомендательных системах

Рекомендательные системы последние пару лет проходят примерно тот же путь, что раньше прошел поиск: от вороха ручных фичей и каскадов моделей все больше хотят перейти к одной большой генеративной модели. Тренд общий для индустрии: TikTok, Netflix и китайские e-commerce гиганты один за другим публикуют статьи о переходе на generative recommenders. Идея в том, что вместо обычного ранжирования кандидатов модель буквально предсказывает следующий айтем, как LLM предсказывает следующий токен.

Работает это на удивление хорошо, давайте разбираться почему. На deep tech night на эту тему выступал Алексей Гусаков, CTO бизнес-группы поисковых сервисов и ИИ в Яндексе. На его материале эту эволюцию удобно проследить по шагам.

Примерно 10 лет назад классическая рекомендательная система была конвейером из пяти стадий: сотни вручную сконструированных фичей, десятки отдельных генераторов кандидатов, затем преранк, ранжирование и постранк. Каждая стадия – отдельная модель и часто отдельная команда. Масштабировать такую телегу довольно тяжело.

2019 год – случился первый большой сдвиг. Тогда трансформеры впервые завезли в поиск. Это был всем известный BERT.

Через 4 года, в 2023, та же архитектура докатилась и до рекомендаций. Это был первый скачок в профите, и первое доказательство работоспособности трансформеров. В компании BERT поднял ключевую метрику качества с 0,56 до 0,84 всего за один год. Это куда больше, чем годами давали точечные улучшения в старой каскадной схеме.

Примерно тогда же стрельнул ChatGPT, и в рексис игру вступили настоящие LLM. Идея "будем делать вообще все через одну языковую модель" почти сразу захватила область. Но на практике переход оказался не таким простым. LLM, как мы знаем, довольно капризны в плане инфраструктуры и экономики вычислений.

В 2025 Яндекс выкатил Argus – свою первую модель, которая опиралась на масштабирование по данным и вычислениям, то есть на те самые scaling laws, которые лежат в основе развития современных LLM. Метрика подскочила более чем в два раза: до 1.93. Однако из-за стоимости инференса Argus поначалу использовали точечно, в стадии преранка, а не во всем пайплайне.

Логичный следующий шаг – убрать ручной фича-инжиниринг вообще и сделать end-to-end систему, которая генерирует рекомендации напрямую, без промежуточных каскадов. Именно к такой схеме (история -> единая модель -> рекомендации) весь мир и движется.

Несколько недель назад Яндекс выпускает Sona – одну из первых систем рекомендаций, построенных по такому принципу . Подробный разбор техрепорта мы делали здесь.

По архитектуре это устроено так: трек прогоняется через замороженную мультимодальную LLM, дообучаемый трансформер сжимает его в компактные semantic ID (aka словарные токены для треков), а дальше эти ID предсказываются по истории пользователя и уходят в ранжирующий модуль. Результат по метрике – 4.53. Это рост почти в 2.5 раза относительно Argus и самый большой скачок в истории рексис в самой компании.

Если вынести за скобки компанию, тренд общий: рекомендации повторяют путь поиска и компьютерного зрения и движутся от ручных фичей и десятков моделей к одной системе, растущей на данных и вычислениях. Пока что это дорого и не всегда стабильно, требует перестройки инфраструктуры и огромных вложений на инференс и эксперименты. Зато качество растет не на проценты, а в разы.
❤61👍28🗿19😁7🔥5🤨2👏1🤔1💯1🍾1
arXiv ввел лимит на публикацию статей

С 1 октября пользователь сможет отправить на arXiv не больше двух статей в месяц. Отклоненные модераторами статьи тоже входят в этот лимит.

Причина простая: в сентябре 2024 года на arXiv отправили 20 569 работ, а в сентябре этого года уже 40 363. Категория cs.AI за последние два года выросла больше чем в 6 раз.

В arXiv напрямую связывают часть этого роста с ИИ. Модераторы все чаще сталкиваются с работами, где научной новизны совсем немного, одно исследование искусственно разбито на несколько статей, а значительная часть текста сгенерирована ИИ.

Ограничение пока называют временным: arXiv хочет понять, как вообще должна работать модерация научных публикаций, когда статьи можно генерировать практически без ограничений.

https://blog.arxiv.org/2026/10/01/updated-rate-limit-policy/
👍148❤32😁24🔥7🗿6🕊2🫡2🤯1🤩1🍾1
OpenAI уволили трех рисерчеров из отдела safety: они поделились конфиденциальной информацией с внешней организацией, которая занимается безопасностью ИИ

Ни имена исследователей, ни организация-получатель, ни тип информации не названы. Но компания сообщила, что расследование выявило «паттерн нарушений» в обращении с конфиденциальными данными.

NYT, кстати, совсем недавно писали о том, что OpenAI якобы систематически игнорировала сигналы сотрудников о рисках в тестировании новых моделей на протяжение месяцев до инцидента с Hugging Face.
81❤50😢12😁7🫡5☃1🤔1🤩1👌1😍1
Ученый из Гарварда придумал, как искать задачи специально под ИИ

Мэтью Шварц, который ранее за две недели написал с Claude полноценную работу по теоретической физике, продолжил эксперимент. На этот раз он решил не заставлять модель работать как ученого, а искать научные задачи, которые хорошо подходят под сильные стороны современных LLM.

Он называет их Claude-shaped problems. Идея в том, что в разных областях науки постоянно встречаются очень похожие математические конструкции, но ученые из одной области могут просто не знать, что нужный метод уже давно существует в другой. А LLM как раз очень хорошо умеют находить такие связи между огромным количеством разрозненной литературы.

Под это Шварц вместе с Claude собрал BootLoops, набор инструментов для точных математических вычислений. Изначально он создавался для теоретической физики, но затем Claude начал находить практически те же задачи в экологии, генетике, экономике, лингвистике и других областях.

Например, в экологии модель нашла уравнение из теории биоразнообразия, которое около 20 лет не умели эффективно считать на больших данных, и решила его методами из математической физики. А в популяционной генетике Claude нашел способ точно вычислить интеграл, который около 30 лет приходилось оценивать приближенно. Это позволило исследователям проверить модель рекомбинации ДНК на огромном массиве генетических данных и обнаружить следы генной конверсии, которые раньше было сложно выделить.

Но тут обнаружилась важная проблема. Claude довольно хорошо находил технически правильные результаты и очень плохо понимал, насколько они вообще интересны для конкретной науки. Шварц несколько раз приносил такие находки профильным специалистам и получал примерно один ответ: технически впечатляет, научно не очень интересно.

Поэтому дальше схема работы стала другой. Claude ищет связи между областями, пишет код, считает и перебирает гипотезы, а профильный ученый определяет, какой вопрос действительно стоит задавать. Так из первоначально неинтересного результата по экологии вместе с экспертом сделали новую модель динамики лесов, а из расчета по генетике пришли к анализу миллиардов пар мутаций.

Шварц считает, что именно здесь современные модели уже могут заметно ускорять науку. Огромный пласт научных задач можно решить не новым методом, а переносом уже существующего метода из другой области.

https://www.anthropic.com/research/claude-shaped-science
❤162👍61🔥367😁6🤔5🎉2🍓2⚡1🤝1🫡1
Yandex B2B Tech добавила гибридный поиск: теперь полнотекстовый и векторный индексы можно держать в одной СУБД

YDB — распределённая платформа обработки данных для бизнес-критичных систем. В ней можно хранить и обрабатывать данные, на которых работают корпоративные сервисы и приложения. Теперь в ней появился гибридный поиск, который объединяет два подхода:

– Полнотекстовый индекс работает с точными совпадениями: словами, фразами, номерами и кодами. 

– Векторный переводит запросы и данные в представления, по которым можно искать уже не буквальное совпадение, а близость по смыслу.


Проблема в том, что на практике эти два поиска часто приходится собирать из нескольких компонентов: основная СУБД + поисковый движок + отдельная векторная база. А значит, появляются ETL-пайплайны, синхронизация индексов и ещё одна точка отказа.

В YDB оба индекса реализованы как обычные распределённые таблицы. Они обновляются в рамках одной транзакции вместе с основными данными. Поэтому не возникает ситуации, когда запись уже появилась в основной базе, а поисковый индекс ещё не успел обновиться.

Это особенно важно для RAG-систем и ИИ-ассистентов, где качество ответа напрямую зависит от того, насколько хорошо retrieval достал нужный контекст. Только семантического поиска недостаточно: он может потерять точный номер документа или код. Только keyword search — не всегда поймёт, что два разных запроса описывают одну сущность или ситуацию.

В результате поиск, документы, корпоративные базы знаний, тикеты, каталоги и данные для ИИ-ассистентов можно строить поверх одной системы, не разводя инфраструктуру на несколько специализированных хранилищ, что очень удобно!

⚡15 октября на митапе, вы узнаете, как искать в одной СУБД по смыслу и совпадению и улучшить ответы ИИ-агентов или выдачу рекомендательных систем.

Регистрируйтесь!
🗿25😁7❤5😭5🤯3👌2🤨2⚡1🕊1🍓1🫡1
This media is not supported in your browser
VIEW IN TELEGRAM
BridgeMind сделали бенчмарк, чтобы измерять, не ухудшают ли лаборатории модели после релиза

Пользователи чат-ботов и агентов без конца пишут о том, что модели глупеют после своего релиза и/или перед релизом следующей версии. Этот процесс прозвали «нёрф».

Так вот BridgeMind выпустили специальный бенч NerfBench, чтобы ловить такие сдвиги.

Это работает так: в день релиза модель прогоняют по тестам, и этот результат принимают за 100%. Затем ее периодически тестируют заново, измеряя качество, расход токенов и стоимость задачи. Диапазон 90–110% считается нормальным статистическим разбросом, все что ниже 90% уже помечается как подозрительное. Если модели нужно больше токенов или денег на ту же работу, это тоже считается потерей мощности.

Например, многие пользователи сейчас жалуются, что Opus 5.5 стал сильно проседать. И действительно, после очередного замера скор оказался в районе 94% от запуска (да, формально все еще в нормальном диапазоне, но никакие другие модели так не ослабли). В X уже поговаривают, что это означает скорый выход Fable 5.5.

Следить за обновлениями бенчмарка можно здесь: https://bridgebench.ai/nerf-bench

BridgeMind также пообещали выделить $10 000 на финансирование будущих перепроверок: планируются новые модели и более частые замеры.
🔥122❤33😁17👍11👏4🕊1💯1😎1
Cloudflare тоже сделали свои версии Jev

Они выпустили Clef и Clef-flash, две открытые decision models (лицензия Apache 2.0, веса на Hugging Face).

Напоминаем, что фишка decision model в том, что она не генерирует текст, а выдает строго типизированные ответы с вероятностями. Это походит для огромного пласта задач типа классификации, скоринга, быстрого принятия решений внутри пайплайнов, маршрутизации и тд. Оригинальный Jev вышел всего пару недель назад, но настолько хайпанул, что за это время свои аналоги навыпускали уже все, включая OpenAI.

Что касается Cloudflare: в отличие от Jev Clef может работать с картинками и ее контекст составляет 64k против 32k. По скорости: медиана у Clef 209 мс, у Clef-flash 39 мс, у Jev 524 мс. По бенчмарку Jev Decision Index Clef тоже лидирует.

Параллельно, кстати, запустили еще RL-платформу, на которой предлагают дообучать Clef под задачи клиентов.
⚡30🔥22😁12👍4❤3☃2💘1