Data Secrets
93.9K subscribers
7.4K photos
859 videos
20 files
3.38K links
Главный по машинному обучению

Сотрудничество: @veron_28

РКН: clck.ru/3FY3GN
Download Telegram
Сегодня встречаемся на Practical ML Conf!

Это крупнейшая хардовая конференция Яндекса для ML-экспертов и практиков. Мы с командой тоже приехали послушать доклады от экспертов и поучаствовать в инженерных экскурсиях.

Три основных направления сегодняшнего дня, ради которых мы приехали:

1. Вызовы и подводные камни в обучении LLM;
2. Продуктовый AI: честная экономика и эффекты применения LLM в масштабе;
3. Эффективная инфраструктура для моделей и агентов.

Будет несколько параллельных треков, в том числе онлайн (расписание). А если вы сегодня здесь и любите хардовые доклады как мы, то вот выступления, которые мы особенно рекомендуем посетить:

— Доклад про Алису на Поиске от CTO Alice AI Search: Артур Петросян расскажет про то, что работает под капотом ответа на Поиске: какая LLM-архитектура используется, за счет чего ее ускоряют и как обучают.

— Рассказ про генеративные модели в рексис Яндекс Музыки от Николая Савушкина – руководитель службы рекомендательных технологий.

— Практический спич про экономически эффективный инференс для агентских сценариев от руководителя группы инференса LLM в Yandex AI Studio Владислава Носивского. Он на примерах разберет, как снижать стоимость инференса с помощью схем параллелизма, разделения prefill и decode и работой с KV-кешем.

Кроме докладов на площадке повсюду антураж ML и куча интересных активностей. Например, можно участвовать в лотерее, ответив на несколько вопросов по ML (мы уже!)

Кто тоже здесь, что уже успели посмотреть и послушать?
1🔥28🗿20113🍓3👍2😍1
Reuters пишут, что Anthropic готовятся выпускать новую модель, которая составит конкуренцию Astra

Если верить источникам, прямо сейчас стартап тестирует безопасность этой модели, и выйти она может совсем скоро.

Прошла всего неделя с момента, когда Дарио Амодеи настаивал на замедлении прогресса AI…
1😁283🔥41💯1285🤯5🗿3👍1🤝1🫡1🎄1
На этой неделе Яндекс опенсорснул Alice AI‑T5-35B‑A0.6B. Это обученная с нуля претрейн модель, которая отвечает за быстрые ответы на Поиске.

Только что на Practical ML Conf мы слушали про этот релиз из первых рук: Артур Петросян, CTO Alice AI Search, рассказал о том, как команда обучила систему, которая дала +0.34% к продуктовой метрике Sessions Per User и в 56.7% случаев выигрывает в попарных сравнениях против Google AI Overview.

— Одна из главных интересных особенностей этой модели – ее архитектура. Это Encoder‑Decoder + MoE. Последние такие модели выходили в 2021–2023 годах (не считая недавнего DeepSeek-V4.1-Flash, который вышел почти в один день с Alice AI‑T5), так что выбирать такую архитектуру было довольно необычным и рискованным решением.

Не обошлось без сложностей при разработке: например, на претрейне сколлапсировал роутинг в энкодере, и пришлось сменить схему балансировки экспертов. Зато архитектура себя оправдала. Энкодер один раз читает длинный контекст из документов, а легкий декодер быстро пишет короткий ответ, что идеально для задачи «много на входе, мало на выходе». MoE при этом дает знания уровня 35B параметров при вычислениях как у 0.6B.

— После претрейна с моделью также колдовали с помощью SFT и RLHF. На этих этапах модель училась писать ответ так, чтобы он был максимально полезен для живого пользователя. Интересно, что при этом команда обошлась без эталонных ответов, написанных людьми: на запрос генерировалось много ответов от разных систем, лучший отбирался автоматически по набору сигналов качества, а на этапе RL модель дополнительно училась на сигналах реального поведения пользователей Поиска.

— Еще одна интересная деталь пайплайна – сжатие контекста. Чтобы не гонять через LLM огромные пачки документов, команда с нуля обучила маленькую BERT‑подобную модель на 80 млн параметров, которая занимается тем, что определяет релевантность каждого токена запросу. Далее поверх этого накладывается метод под названием Cross‑Entropy RL, и в итоге получается экстрактор, который понимает, какую именно информацию модель уже знает из весов, и какой минимальный контекст ей нужен для хорошего ответа.

И да, все это – только некоторые детали работы. Про остальные нюансы обучения и строения системы можно почитать вот в этой статье на Хабр. Поздравляем команду с релизом!
4👍136🗿49😁2925🔥13🤨3🍓32👌2👏1
Все, что нужно знать о развитии ИИ сегодня: миллиардер Тобиас Лютке (который CEO Shopify) переделал винный погреб в серверную

В холодильнике для вина теперь охлаждаются GPU: по виду там как минимум Dell Pro Max с GB300, RTX PRO 2000, 16TB NVMe и Dual 400GbE. Можно запустить GLM.

Новый вид понтов выглядит так
1😁2574621👍135🤯3😭33🤝1🎄1👾1
Data Secrets
Помните, мы писали про то, что компании платят авторам контента за рассказы об опасностях ИИ? Так вот, тут один независимый исследователь Кевин Басс провел расследование, в ходе которого вскрылась интересная финансовая связь между заказчиками подобного контента…
Anthropic объявила первого «независимого оценщика» в рамках компании Embedded Evaluators, которую Дарио Амодеи продвигал в своем эссе о замедлении

Им стала компания Accenture. В независимую оценку включен red-teaming, alignment-проверки, тестирование safeguards и так далее.

Вот только насколько независимыми можно назвать Accenture – это вопрос. Accenture обучает ~30 000 своих сотрудников работе с Claude, у компаний есть совместный многолетний контракт еще с конца 2025 года, и Anthropic прямо с посте пишут, что будут сами финансировать работу Accenture.

Напоминаем, что за некоторое время до этого Anthropic также предоставили «независимый доступ» компании METR, чтобы те провели расследование инцидентов с агентами.

Однако METR, как оказалось, тоже косвенно финансируется из акций Anthropic, то есть напрямую заинтересована в финансовом успехе стартапа (об этом расследовании мы писали здесь: https://t.me/data_secrets/9931).

В сухом остатке: Anthropic заявляют, что будут подключать независимых оценщиков, а сами тем временем выбирают их из числа компаний, с которыми их уже связывают деловые отношения. Учимся замедляться грамотно 🗿
Please open Telegram to view this post
VIEW IN TELEGRAM
😁15022👍211310🫡4🔥1😍1🍓1👨‍💻1
Еще один итог Practical ML Conf. Вчера там вручали Yandex ML Prize — премию для преподавателей и руководителей программ, которые меняют ML-образование

Лауреаты запускают курсы по большим языковым и генеративным моделям, учат создавать рекомендательные системы и развивают физический ИИ — технологию, которая помогает роботам воспринимать пространство и действовать в нем. Кто-то вырастил магистратуру с 12 человек до нескольких сотен, а у кого-то открытые материалы курсов собирают тысячи слушателей за пределами родного вуза.

В этом году премию получили восемь человек из НИУ ВШЭ, МФТИ, МГУ, ИТМО, НГУ и Школы анализа данных, а ещё двое вошли в «Зал славы». Посмотреть всех лауреатов →
https://www.kommersant.ru/doc/8970568
26👍15🗿8😁6🎉5🕊2🤨2😎1
Media is too big
VIEW IN TELEGRAM
Математики продолжают высказывать опасения по поводу влияния ИИ на математику

Президент Математического общества Франции заявил, что это «допинг», вторгшийся в профессию. Аспиранты переживают, что им негде будет работать после защиты, и многие говорят о разрушении математики как формы человеческой деятельности в целом.

Известный филдсовский лауреат Седрик Виллани тут заявил, что он был потрясен, когда узнал о решении Навье-Стокса.

«Атмосфера конца истории... Это катаклизм, которого математика еще не знала».

Интересно, что раньше он был скептиком LLM, называл их «просто функциями f(x)=y» и утверждал, что они вообще ничего не понимают 😐

Теренс Тао, кстати, присоединился к тем, кто выступает за замедление разработки ИИ. Он сказал, что «темп прогресса сумасшедший, и нет причин идти такими быстрыми шагами – никаких причин вообще». Однако после этого в соцсетях его раскритиковали за то, что он стал высказываться таким образом только после того, как ИИ начал угрожать его собственной профессии.
Please open Telegram to view this post
VIEW IN TELEGRAM
😁18542🤯16😭8😎42👍21🔥1
Теперь у нас есть Nano Banana 2.0 дома!

Alibaba выпустили в опенсорс Qwen-Image-2.1: генератор изображений, который весит всего 7В, и обходит GPT Image 1.5 и Nano Banana 2.0 на собственном бенчмарке Qwen.

Модель принимает на вход до 10 референсных картинок, поддерживает точный локальный контроль, может генерировать и редактировать картинки без фона, отлично работает с текстом и инфографикой.

Веса
GitHub
Блог
98🤯34🔥23👍8😁3❤‍🔥1😍1🫡1🗿1💘1