Data Secrets
92.9K subscribers
7.31K photos
838 videos
20 files
3.33K links
Главный по машинному обучению

Сотрудничество: @veron_28

РКН: clck.ru/3FY3GN
Download Telegram
Правительство США встало на сторону OpenAI в суде по иску об авторских правах NYT против OpenA

Напоминаем, что New York Time судится с OpenAI и Microsoft с конца 2023 года, обвиняя их в использовании миллионов статей без разрешения.

Так вот Минюст США только что подал «заявление об интересе» и объявил, что «США имеет сильный интерес в том, чтобы суд отклонил любой аргумент о том, что обучение LLM на защищенных авторским правом текстах нарушает закон об авторском праве».

Они заявили, что развитие ИИ критично для национальной безопасности США и предупредили, что «усложнение разработки ИИ в США может дать преимущество зарубежным конкурентам» 🗿

Кроме того, администрация Трампа назвала обучение моделей «чрезвычайно трансформативным» использованием: они считают, что в связи с этим потенциальные нарушения авторских прав в том, что генерирует модель, нужно рассматривать отдельно от вопроса, является ли само обучение добросовестным использованием.

Представители NYT уже резко раскритиковали чиновников за их позицию, заявив, что те «встают на сторону горстки трлн-долларовых AI-компаний, которые зарабатывают за счет кражи труда бесчисленных американских авторов».

Если суд примет решение в пользу OpenAI, этот прецедент изменит вообще всю правовую практику в делах об авторском праве и ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
😁131463916😢6👍5👌5🏆5🤔1🎄1
Продолжаем следить за главными конференциями по машинному обучению. 19 сентября команда Data Secrets поедет на Practical ML Conf, чтобы посмотреть всё вживую и рассказать вам о самом интересном. Что точно идем смотреть:

Николай Савушкин, руководитель службы рекомендательных технологий Яндекс R&D, расскажет про Sona, о которой мы рассказывали ранее. Модель, которая заменила весь рекомендательный стек Яндекс Музыки.

Александр Мисевич, руководитель группы Efficient Runtime & Inference в Т-Банке, разберёт инфраструктуру массового инференса LLM: единый пайплайн подготовки, бенчмаркинга, оптимизации и вывода моделей в продакшен. Главный вопрос: как развернуть LLM внутри компании и не платить за инференс больше, чем внешнему провайдеру.

В программе ещё много докладов по CV, NLP, Speech, RecSys, Data Science и MLOps: от world models и VLM-агентов до обучения LLM, RL и оптимизации инференса. Будем ходить между залами, выбирать самое интересное и рассказывать обо всём здесь.

Посмотреть программу и зарегистрироваться
🗿198😍7👍4🎉4😢1🤩1👌1
Революционная и очень опасная архитектура новой Astra оказалась выдумкой журналистов ☕️

На днях по сети разлетелась громкая статья от The Information. В ней утверждалось, что в основе новой модели OpenAI под кодовым названием Astra лежит некая революционная архитектура «recurrent depth» или «looped transformer».

Идея «looped transformer» в следующем: вместо того чтобы гонять фиксированный стек различных слоев ровно один раз, модель прогоняет скрытое состояние через один и тот же блок слоев несколько раз перед тем, как выдать следующий токен.

Те, кто следит за ML-статьями, уже на этом моменте поняли, что никакой революции тут нет. Это довольно известный небольшой архитектурный трюк, который восходит корнями к работе Google "Mixture-of-Recursions" с NeurIPS. Мы разбирали ее здесь: https://t.me/data_secrets/7384. Эту идею уже много раз использовали в опенсорсе.

Тем не менее, хайп статьи The Information почти достиг стратосферы. Дело в том, что помимо рассказов о революционной архитектуре, в тексте также утверждается, что looped transformer скрывает chain-of-thought. Точнее: в отличие от моделей, которые показывают рассуждения текстом, в looped transformer эти шаги скрыти внутри модели, и поэтому человеку недоступны.

Так что новость почти сразу превратилась из архитектурной детали в спор о безопасности ИИ. OpenAI уже успели обвинить в том, что они переходят черту. Но на деле сам тезис про скрытые CoT оказывается очень спорным.

Якуб Пахоцкий публично возразил, заявив, что репортаж вводит в заблуждение. А Себастьян Рашка написал про это вот так:

Возможно, журналист The Information имел в виду какую-то другую технику или неверно понял, как работает looped transformer.
Само по себе повторное использование слоев не подавляет видимый chain-of-thought, оно лишь добавляет вычисления в скрытых состояниях перед генерацией очередного токена, точно так же, как это делают обычные слои трансформера.

Единственная правдоподобная связь, которую можно выделить: если модель делает больше таких рекуррентных проходов, ей может требоваться меньше промежуточных токенов-рассуждений. То есть больше вычислений происходит в латентных активациях, которые нельзя прочитать как текст. Но точно такой же эффект дало бы и простое увеличение размера модели – например, переход от GPT-5.6 Luna к GPT-5.6 Sol.


Какой направшивается вывод, решайте сами
Please open Telegram to view this post
VIEW IN TELEGRAM
😁951912👍3🎉31🔥1👏1🤔1
Сегодня мы вышли из stealth!

Про нас написали Wired (с заголовком these russian mathematicians ахах), а еще мы опубликовали блог пост с описанием технологии. Все ссылки в этом посте, буду очень рада если сможете репостнуть и прокомментировать :)

https://x.com/aimalysheva/status/2095232794792255848
41🔥16👍10🤔5🤨32😁21😍1
Саша делает стартап
Сегодня мы вышли из stealth! Про нас написали Wired (с заголовком these russian mathematicians ахах), а еще мы опубликовали блог пост с описанием технологии. Все ссылки в этом посте, буду очень рада если сможете репостнуть и прокомментировать :) https:/…
Российские математики придумали модель, которая заняла первое место на ARC-AGI

Небольшой стартап Mostik состоит из 15 человек, среди которых 12 PhD и Филдсовский медалист Станислав Смирнов. Компания существует всего 4 месяца, и только что вышла из стелса со своей идеей о новом подходе к ансамблированию. Ребята придумали, как модели могут обмениваться скрытыми состояниями.

Как это работает:

Языковая модель, генерируя один токен, строит огромные скрытые векторы. Это порядка миллиона чисел (~2 МБ). При этом в выхлоп попадает только ~17 бит – сам токен, а остальное выбрасывается.

Все системы, где модели общаются между собой (команды агентов, консилиумы и тд), общаются именно через этот узкий текстовый канал. При этом в отбрасываемой части остается море информации, описывающей все, что модель знает о задаче в этот момент. Это не только данные о текущем токене, но и о будущих (вспомните то же исследования Anthropic J-space: https://t.me/data_secrets/9497).

Идея Mostik – это, собственно, дать моделям "мостик", через который они смогут общаться полноценно, чтобы работать эффективнее. Они обучили небольшой модуль-переводчик, который передает скрытые состояния от одной модели к другой. При этом модели могут быть из разных семейств, их веса не меняются, и совсем никакого текста между ними не проходит.

Результаты:

Авторы взяли большую GLM-5.2 (753B) и маленькую Qwen-3.5 (4B), и сделали так, что GLM-5.2 только читает текст (это дешевле), а затем передает Qwen скрытое состояние через мостик, чтобы та уже генерировала токены. Разрыв в качестве у моделей огромный, но при таком сетапе закрывается 50% этой разницы. На некоторых задачах прирост в качестве получается в 2 раза, и при этом связка обходится в 2.5 раза дешевле по вычислениям, если пересчитывать результаты на эквивалентную среднюю модель.

Кроме того, "мостик" можно использовать для дистилляции или создания инструментов для мониторинга. Авторы также упоминают о том, что система на основе этого подхода предварительно заняла первое место на лидерборде ARC Prize этого года.

Поздравляем авторов с потрясающей работой и просим для них максимальной поддержки!

Статья Wired | Блогпост Mostik | Канал CEO Саши Малышевой
5464🔥160👍44🤯10😁9👏8🗿8🍓32💘2🐳1
В сентябре в России пройдет серия КосмоХакатонов 🚀

Шесть городов, 12+ задач от компаний отрасли и общий призовой фонд 7,2 млн рублей.

Участникам предстоит работать над технологическими, управленческими и AI-задачами, консультироваться с экспертами и представлять свои решения жюри.

🛰 Команды от 3 до 5 человек
💻 Очный и онлайн-форматы
🏆 Денежные призы на каждом этапе
🚀 Лучшие команды выйдут в финал в Москве

Первый КосмоХакатон стартует уже 4 сентября в Ростове-на-Дону. Финал состоится 25–27 сентября в Москве.

🔗 Подробности и регистрация

Реклама. Инновационные Интеграторы, ИНН 9704244539
🗿16😁7🤯64🤗4👍31😍1
Data Secrets
Nvidia согласилась купить Hugging Face за $12,9 млрд Сделка пока не окончательная, но она была одной из крупнейших у Nvidia за всю историю. Годовая выручка Hugging Face оценивается примерно в $150 млн, саму компания во время переговоров оценивали в 13 миллиардов.…
Nvidia официально покупает Hugging Face

Точная сумма сделки: $12,930,300,000

Nvidia обещает продолжать поддерживать миссию HF и принципы открытости, независимости и универсальности по отношению к железу.

Мы думаем, что вместе сможем сделать опенсорс методом разработки моделей по умолчанию.


Акции Nvidia 📈
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥124😭4723👍97😁6🕊43🍾21💯1
Claude, ChatGPT и Grok решили дружно полежать

Какой-то агент выбрался из лаборатории, собрал армию и сверг хозяев? Что происходит?
5😁1775212👍4🤯4🕊2😭2🎉1
This media is not supported in your browser
VIEW IN TELEGRAM
Тем временем видео, которое OpenAI залили в X 15 минут назад:

Ну точно Astra сбежала во время релиза
😁14514🕊10🤩5🤔4👏3💯2🔥1
Две новые модели уже появились в Codex

– gpt-6-astra
– gpt-6-astra-aeon

С минуты на минуту
5🤯20248🎉211310🔥4😁3😍3🕊11
Грег Брокман сказал, что Astra означает приход эры AGI

Также сообщают, что Astra будет некоторое время доступна только ограниченному числу организаций
😁14828🗿106🤯43🔥1🕊1🍓1💘1
Бенчмарки Astra от инсайдеров

ARC-AGI-3, Frontier Math и Exploit Bench💀
🤯18723🔥1811😁5🤩3🫡3👍1😍1🤝1
Кстати обещание выполнит, как думаете?
😁22917😭10👍5🔥2😢1🕊1🍓1😎1
Astra вышла

Невероятный скачок, объективно. RIP Anthropic IPO, если у них вдруг не завалялся Fable 5.2 Ultra Max.

Цена: $10/М input, $50/M output. Как и ожидалось, сегодня потрогать модель нельзя: доступна пока избранным организациям. На широкую аудиторию раскатят «на днях».

Альтман уже объявил, что скоро OpenAI выкатит следующую еще более сильную модель.

Ну что, AGI?
88😁42🔥22🕊101👍1💯1🤗1
Media is too big
VIEW IN TELEGRAM
«Все, что вы делаете на компьютере, Astra может сделать за вас. Быстро»

Модель (помимо невероятных способностей в ризонинге и кодинге) позиционируют как лучшую в мире для всевозможного computer use.

Генерация презентаций, таблиц, файлов, дизайн, аналитика, поиск, работа с браузером, любым ПО, 3D-сценами и многим другим.

По одному промпту может создать, захостить и зашерить сайт, приложение или даже игру прямо в ChatGPT.

Системная карта: https://deploymentsafety.openai.com/gpt-6-astra/gpt-6-astra.pdf
👍75🔥3017😁8🗿5521🏆1😭1🎄1