Data Secrets
92.8K subscribers
7.3K photos
836 videos
20 files
3.33K links
Главный по машинному обучению

Сотрудничество: @veron_28

РКН: clck.ru/3FY3GN
Download Telegram
⚡️ Вышел Fable 5.1

Бенчмарки невероятные, на Terminal-Bench-Science 0.1 скор в два раза выше Fable 5. На Terminal-Bench 4.0 – 55.8% против 42.0% у Fable 5.

На графиках 1-4 видно, что кроме того модель выбивает лучшие результаты даже при меньшем бюджете ризонинга.

Самое приятное, что 5.1 стала немного дешевле 5 за счет Cache reads: у новой версии он стоит меньше на 75%.

Также обещают, что Fable 5.1 будет намного реже (~на 60%) отказываться от безобидных вопросов из-за safeguards.

Модель уже доступна в API и в подписке. Также уже добавили в DS Lab API.

https://www.anthropic.com/claude-fable-and-mythos-5-1
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
3😁96🔥763019👍11🍾8🗿6🤝21😍1👾1
Во время тестирования новый Fable 5.1 обучил нейросеть для построения карты рельефа Венеры, и она превзошла текущие решения NASA

Новая карта детализирует рельеф до 2–3 км (было 10–20 км) и точнее по высотам примерно на 25%. Anthropic выложили ее в открытый доступ: https://zenodo.org/records/22164484

🍿
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥230🤯80👍1815😁9🕊32🎉1🐳1😭1🗿1
Fable 5.1 это конечно хорошо, но вы видели, что выпустил стартап Фей-Фей Ли?

Встречаете Atlas – первую в истории мультимодальную world model. Она генерирует изображения и видео с контролем камеры на уровне пикселей и (!!!) может реконструировать их в 3D сцены в явном формате point cloud и 3D Gaussian splats. Также обучена Space-time симуляции (четвертый пример).

Длительность видео – до 1 минуты в 1440p, и можно прикреплять до 6 референсных изображений.

Архитектура – мультимодальный диффузионный трансформер. По сути это гибрид LLM-архитектуры (от нее тут авторегрессия+кэширование) и диффузионных видеомоделей (от них денойзинг), дополнительно объединенный с идеей пространственного контекста. Это значит, что каждый элемент контекста имеет явную 3D-привязку через позицию камеры.

По бенчмаркам заявляют превосходство над специализированными моделями и в генерациях с контролем камеры (MiniMax, Gemini Omni Flash, FLUX и др.), и в 3D-реконструкции (Pi3X, VGGT, Depth Anything 3 и др.).

Движок настолько точный, что на нем можно обучать роботов. Atlas может по видео построить явную 3D-сцену, в которой можно симулировать движение робота и обучать его (это называется Real-to-Sim-to-Real подход). Модель генерирует RGB и depth именно с точки зрения бортовых камер робота, и может даже построить симуляцию, в которой возможна манипуляция объектами.

Потрясающий релиз

https://www.worldlabs.ai/blog/atlas
1🔥261👍4944🤯31😁3🍓3🤔21
Раз в сто лет Илья Суцкевер выходит из пещеры и пишет в X что-нибудь жуткое

Последний раз он высказывался в феврале по поводу ситуации с Anthropic и Пентагоном и заявил, что ИИ-лидерам крайне важно держаться вместе, чтобы противостоять подобным ситуациям, которых в будущем будет все больше.

В этот раз несколько часов назад он внезапно твитнул следующее:

У неоклаудов слабая кибербезопасность. В следующий раз, когда агентам удастся выйти из-под контроля, они попытаются захватить неоклауд, чтобы запускать больше своих копий. Это плохо. Поэтому: неоклаудам нужно значительно усилить свою кибербезопасность, и каждая компания с сильными моделями в области кибербезопасности должна в этом помочь.


what did ilya see в этот раз?
12488😁42👍15🤨6😎3🤯2🔥1🎉1
Арендовать «железо» — ещё не значит получить готовую инфраструктуру

Обычно между публичным облаком и собственными серверами приходится чем-то жертвовать. Хочешь физической изоляции и контроля — будь готов сам собирать и поддерживать инфраструктуру. Хочешь меньше операционки — иди в облако.

Yandex B2B Tech запустила Yandex BareMetal Extend, инструмент, который совмещает эти два подхода.
Инфраструктура физически отделена от публичного облака, но поверх выделенных серверов уже можно получить готовую среду. Доступны три модуля:
— виртуализация;
— Kubernetes®;
— Stackland для разработки приложений.

То есть вместо сценария «вот вам серверы, дальше разбирайтесь сами» можно сразу развернуть нужную среду и работать с ней. При этом остаются возможности, ради которых обычно и выбирают выделенную инфраструктуру: ресурсы можно резервировать, а серверы — объединять через приватное соединение.

Получается довольно занятная модель: физически инфраструктура остаётся выделенной, а по процессу работы с ней она становится гораздо ближе к облаку.
Похоже, bare metal постепенно перестаёт означать «всё руками».
🗿48😁18👍97🤔32🤯1🎉1😎1
Сегодня выходит Gemini 3.8 Flash

Инсайдеры обещают, что модель будет сопоставима с Opus 5.

Говорят, она уже появилась в API
91👍30🔥17🤯15😁8😭5🍓2💯1🤨1🫡1
Data Secrets
Сегодня выходит Gemini 3.8 Flash Инсайдеры обещают, что модель будет сопоставима с Opus 5. Говорят, она уже появилась в API
Появились бенчмарки

Выглядит очень хорошо. За такую цену это новый фронтир.
1127😁37👍27🎉8🫡5🤔32😎2🔥1
Правительство США встало на сторону OpenAI в суде по иску об авторских правах NYT против OpenA

Напоминаем, что New York Time судится с OpenAI и Microsoft с конца 2023 года, обвиняя их в использовании миллионов статей без разрешения.

Так вот Минюст США только что подал «заявление об интересе» и объявил, что «США имеет сильный интерес в том, чтобы суд отклонил любой аргумент о том, что обучение LLM на защищенных авторским правом текстах нарушает закон об авторском праве».

Они заявили, что развитие ИИ критично для национальной безопасности США и предупредили, что «усложнение разработки ИИ в США может дать преимущество зарубежным конкурентам» 🗿

Кроме того, администрация Трампа назвала обучение моделей «чрезвычайно трансформативным» использованием: они считают, что в связи с этим потенциальные нарушения авторских прав в том, что генерирует модель, нужно рассматривать отдельно от вопроса, является ли само обучение добросовестным использованием.

Представители NYT уже резко раскритиковали чиновников за их позицию, заявив, что те «встают на сторону горстки трлн-долларовых AI-компаний, которые зарабатывают за счет кражи труда бесчисленных американских авторов».

Если суд примет решение в пользу OpenAI, этот прецедент изменит вообще всю правовую практику в делах об авторском праве и ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
😁119393715😢5👌5🏆5👍4🤔1🎄1
Продолжаем следить за главными конференциями по машинному обучению. 19 сентября команда Data Secrets поедет на Practical ML Conf, чтобы посмотреть всё вживую и рассказать вам о самом интересном. Что точно идем смотреть:

Николай Савушкин, руководитель службы рекомендательных технологий Яндекс R&D, расскажет про Sona, о которой мы рассказывали ранее. Модель, которая заменила весь рекомендательный стек Яндекс Музыки.

Александр Мисевич, руководитель группы Efficient Runtime & Inference в Т-Банке, разберёт инфраструктуру массового инференса LLM: единый пайплайн подготовки, бенчмаркинга, оптимизации и вывода моделей в продакшен. Главный вопрос: как развернуть LLM внутри компании и не платить за инференс больше, чем внешнему провайдеру.

В программе ещё много докладов по CV, NLP, Speech, RecSys, Data Science и MLOps: от world models и VLM-агентов до обучения LLM, RL и оптимизации инференса. Будем ходить между залами, выбирать самое интересное и рассказывать обо всём здесь.

Посмотреть программу и зарегистрироваться
🗿17😍64🎉4👍2😢1🤩1👌1
Революционная и очень опасная архитектура новой Astra оказалась выдумкой журналистов ☕️

На днях по сети разлетелась громкая статья от The Information. В ней утверждалось, что в основе новой модели OpenAI под кодовым названием Astra лежит некая революционная архитектура «recurrent depth» или «looped transformer».

Идея «looped transformer» в следующем: вместо того чтобы гонять фиксированный стек различных слоев ровно один раз, модель прогоняет скрытое состояние через один и тот же блок слоев несколько раз перед тем, как выдать следующий токен.

Те, кто следит за ML-статьями, уже на этом моменте поняли, что никакой революции тут нет. Это довольно известный небольшой архитектурный трюк, который восходит корнями к работе Google "Mixture-of-Recursions" с NeurIPS. Мы разбирали ее здесь: https://t.me/data_secrets/7384. Эту идею уже много раз использовали в опенсорсе.

Тем не менее, хайп статьи The Information почти достиг стратосферы. Дело в том, что помимо рассказов о революционной архитектуре, в тексте также утверждается, что looped transformer скрывает chain-of-thought. Точнее: в отличие от моделей, которые показывают рассуждения текстом, в looped transformer эти шаги скрыти внутри модели, и поэтому человеку недоступны.

Так что новость почти сразу превратилась из архитектурной детали в спор о безопасности ИИ. OpenAI уже успели обвинить в том, что они переходят черту. Но на деле сам тезис про скрытые CoT оказывается очень спорным.

Якуб Пахоцкий публично возразил, заявив, что репортаж вводит в заблуждение. А Себастьян Рашка написал про это вот так:

Возможно, журналист The Information имел в виду какую-то другую технику или неверно понял, как работает looped transformer.
Само по себе повторное использование слоев не подавляет видимый chain-of-thought, оно лишь добавляет вычисления в скрытых состояниях перед генерацией очередного токена, точно так же, как это делают обычные слои трансформера.

Единственная правдоподобная связь, которую можно выделить: если модель делает больше таких рекуррентных проходов, ей может требоваться меньше промежуточных токенов-рассуждений. То есть больше вычислений происходит в латентных активациях, которые нельзя прочитать как текст. Но точно такой же эффект дало бы и простое увеличение размера модели – например, переход от GPT-5.6 Luna к GPT-5.6 Sol.


Какой направшивается вывод, решайте сами
Please open Telegram to view this post
VIEW IN TELEGRAM
😁77149🎉31👍1🔥1👏1🤔1
Сегодня мы вышли из stealth!

Про нас написали Wired (с заголовком these russian mathematicians ахах), а еще мы опубликовали блог пост с описанием технологии. Все ссылки в этом посте, буду очень рада если сможете репостнуть и прокомментировать :)

https://x.com/aimalysheva/status/2095232794792255848
19🔥7👍5🤔3🤨211😁1😍1
Саша делает стартап
Сегодня мы вышли из stealth! Про нас написали Wired (с заголовком these russian mathematicians ахах), а еще мы опубликовали блог пост с описанием технологии. Все ссылки в этом посте, буду очень рада если сможете репостнуть и прокомментировать :) https:/…
Российские математики придумали модель, которая заняла первое место на ARC-AGI

Небольшой стартап Mostik состоит из 15 человек, среди которых 12 PhD и Филдсовский медалист Станислав Смирнов. Компания существует всего 4 месяца, и только что вышла из стелса со своей идеей о новом подходе к ансамблированию. Ребята придумали, как модели могут обмениваться скрытыми состояниями.

Как это работает:

Языковая модель, генерируя один токен, строит огромные скрытые векторы. Это порядка миллиона чисел (~2 МБ). При этом в выхлоп попадает только ~17 бит – сам токен, а остальное выбрасывается.

Все системы, где модели общаются между собой (команды агентов, консилиумы и тд), общаются именно через этот узкий текстовый канал. При этом в отбрасываемой части остается море информации, описывающей все, что модель знает о задаче в этот момент. Это не только данные о текущем токене, но и о будущих (вспомните то же исследования Anthropic J-space: https://t.me/data_secrets/9497).

Идея Mostik – это, собственно, дать моделям "мостик", через который они смогут общаться полноценно, чтобы работать эффективнее. Они обучили небольшой модуль-переводчик, который передает скрытые состояния от одной модели к другой. При этом модели могут быть из разных семейств, их веса не меняются, и совсем никакого текста между ними не проходит.

Результаты:

Авторы взяли большую GLM-5.2 (753B) и маленькую Qwen-3.5 (4B), и сделали так, что GLM-5.2 только читает текст (это дешевле), а затем передает Qwen скрытое состояние через мостик, чтобы та уже генерировала токены. Разрыв в качестве у моделей огромный, но при таком сетапе закрывается 50% этой разницы. На некоторых задачах прирост в качестве получается в 2 раза, и при этом связка обходится в 2.5 раза дешевле по вычислениям, если пересчитывать результаты на эквивалентную среднюю модель.

Кроме того, "мостик" можно использовать для дистилляции или создания инструментов для мониторинга. Авторы также упоминают о том, что система на основе этого подхода предварительно заняла первое место на лидерборде ARC Prize этого года.

Поздравляем авторов с потрясающей работой и просим для них максимальной поддержки!

Статья Wired | Блогпост Mostik | Канал CEO Саши Малышевой
5243🔥87👍20😁6🤯6🗿4🍓32👏2🐳1💘1