Data Secrets
91.9K subscribers
7.18K photos
811 videos
20 files
3.26K links
Главный по машинному обучению

Сотрудничество: @veron_28

РКН: clck.ru/3FY3GN
Download Telegram
Яндекс анонсировал метрики, которые к концу 2026 года должны стать новой нормой для инженерных команд: 75% разработчиков регулярно используют ИИ, на уровне всей компании не менее 75% изменений готовятся с участием нейросетей, и в каждом таком изменении ИИ генерирует не менее 75% кода.

Яндекс не просто говорит об ускорении разработки, а формулирует конкретные измеримые цели. Это превращает AI‑native из абстрактной концепции во внутренний KPI.

Сейчас 73% разработчиков внутри компании уже работают с генеративными моделями, и больше половины нового кода пишется с помощью ИИ. При этом наибольшей эффективности достигают команды, где ИИ встроен в повседневный процесс разработки и используется при подготовке не менее 75% изменений в коде. Так работают 17,2% разработчиков — за последний месяц их доля выросла более чем вдвое по сравнению с прошлым кварталом. Именно этот опыт теперь собираются масштабировать на всю компанию.

Команда Яндекс Еды за два месяца с помощью ИИ собрала агента, который помогает отвечать на звонки и делать брони в ресторанах, ускорив разработку более чем вдвое. В Лавке силами одного сотрудника за три недели собрали прототип кабинета для франчайзи, а скорость разработки в отдельных спринтах выросла в 3,3 раза.

Для внешних разработчиков и компаний Яндекс также предлагает собственные платформы для создания ИИ-агентов и оптимизации работы. Например, SourceCraft, где предусмотрен ИИ режим для работы с кодом и Yandex AI Studio для создания ИИ‑агентов и приложений.
3😁12547🗿2221🫡14👍6🤨64🤔32😎1
Data Secrets
Проклятье всех ИИ-лаб постигает теперь и Thinking Machines Миры Мурати: от нее ушли почти все партнеры Лилиан Вен, соосновательница стартапа, сегодня объявила об уходе. После этого в TM осталось всего 2 сооснователя из 6, и это включая саму Миру. Лилиан…
Представляете, какая ирония

Лилиан Вен после ухода из Thinking Machines возвращается в… OpenAI. Она будет возглавлять команду, работающую над рекурсивным самоусовершенствованием ИИ.

Напоминаем, что при уходе от Миры Мурати Лилиан заявила, что «не выдерживает стартаповских темпов»
😁26133👏108🏆32🤔2🤯2👍1😭1
Google DeepMind распустила нобеленосную команду AlphaFold

Сотрудников перераспределяют в более широкие проекты, связанные с Gemini и scientific AI.

По слухам, это связано с новой стратегией компании: они начинают понемногу отказываться от узких команд под одно конкретное направление и идут all in в Gemini и в универсальных агентов. Идея в том, что одна мощная модель и инфраструктура вокруг нее должны обслуживать множество научных задач.

Так что, возможно, мы больше не увидим моделей линейки Alpha. Ушла эпоха😢

Некоторые исследователи команды в связи с реструктуризацией покинули компанию или перешли в Isomorphic Labs (это дочерняя структура Alphabet для AI-дискавери в фарме).
Please open Telegram to view this post
VIEW IN TELEGRAM
😭15248🕊25😁8🫡6🤨5👍4😢4🎉2😍2🎄2
Yandex B2B Tech представила универсального ИИ-агента для бизнеса, который сможет автоматизировать до 30–50% рутинных задач офисных сотрудников. Запустить его планируют до конца сентября.

В отличие от специализированных ИИ-инструментов, агент сможет выполнять самые разные задачи: от подготовки конспектов встреч и пересказа документов до сравнения коммерческих предложений, оформления закупок и работы с договорами.

Работать с ним можно будет через единый чат, подключив корпоративные сервисы. Агент умеет ходить в них от имени пользователя, чтобы самостоятельно получать нужные данные. Он также сможет выполнять поручения в фоновом режиме, работать по расписанию и использовать готовые или пользовательские навыки для разных бизнес-сценариев — без необходимости писать код. При этом все важные действия останутся под контролем пользователя.

Интересно, когда агент сможет отвечать: «коллеги, вернусь с ответом после отпуска»
😁11127👍14🗿9🔥6🤨32🤯1🕊1😍1
This media is not supported in your browser
VIEW IN TELEGRAM
451 токен по Фаренгейту: правда ли, что ИИ-компании уничтожают книги

Помните громкий суд Anthropic по делу нарушения авторских прав? Мы напомним: чуть меньше года назад антропики проходили по коллективному иску авторов, на чьих работах они обучали модели. В итоге стартапу пришлось платить громадные штрафы за пиратские копии, но в то же время компанию оправдали за обучение ИИ на купленных бумажных экземплярах. Попался прогрессивный судья, который постановил, что это «добросовестное использование» бумажных копий.

Больше подробностей было здесь: https://t.me/data_secrets/7780

Так вот тем самым Anthropic создали серьезный прецедент и, как оказалось, дали начало большому тренду на массовую закупку и оцифровку бумажных книг для обучения ИИ. Раз это «добросовестное использование», почему бы и всем остальным лабам этим не воспользоваться?

Так что да, теперь ИИ-компании массово скупают подержанные бумажные книги, изданные до 2022 года (чтобы текст точно был человеческий), разрезают их гидравлическим прессом, отделяя страницы от переплета, и таким образом сканируют для датасетов. Сама книга как физический объект при этом, понятно, уничтожается.

Если тираж массовый, то потеря невелика. Но букинисты фиксируют аномальные оптовые закупки и в сегменте редких, давно не переиздававшихся книг (то есть экземпляров, которых в мире осталось немного).

К сожалению, прямых доказательств, что это именно ИИ-компании охотятся за раритетами, нет, потому что работа идет через посредников. Например, сервис ISBNdb принципиально не раскрывают личности покупателей, но при этом известно, что они открыто предлагают ИИ-лабам оптовые партии книг на заказ.

Расследование: https://www.404media.co/ai-companies-are-buying-tons-of-old-books-because-theyre-free-of-ai-slop/
168🤯4935😭277🔥4😁4💯3🫡3🕊21
Как две галочки в API утроили результат GPT-5.6 на ARC-AGI-3

Очень занятное исследование выпустили сегодня OpenAI. В двух словах: иногда важнее как мы тестируем, а не что мы тестируем. Но обо всем по порядку.

Когда вышла GPT-5.6 Sol, результаты на ARC-AGI-3 для такой сильной модели оказались подозрительно слабыми – всего 7.8%. И это при том, что Sol хорошо прошла Pokémon FireRed и решила, например, гипотезу о двойном покрытии циклов. В общем, команда решила разобраться, в чем дело.

Напоминаем, что ARC-AGI-3 – это бенчмарк для агентов. Соответственно, модели для взаимодействия со средой нужна какая-то обвязка – харнесс – которая определяет, что модель видит на каждом шаге, как вызываются инструменты, что происходит с контекстом и тд. Ожидаемо, среда ARC-AGI-3 использует максимально простой универсальный харнесс, чтобы честно сравнивать модели между собой. Но для OpenAI именно в этой универсальности и оказалась зарыта собака.

Во-первых, после каждого действия в игре весь приватный ризонинг модели просто удалялся, так что Sol не видел собственных планов и рассуждений с прошлых шагов. Во-вторых, из-за использования скользящего окна по мере роста истории любые старые действия становились для модели невидимыми.

Но дело в том, что Sol была специально обучена именно с сохранением ризонинга между шагами. Харнесс эту фишку отрубил, и результаты посыпались.

А теперь внимание на график наверху. Зеленое – это результаты модели на public сете ARC-AGI-3 на официальном харнессе. А синее – на харнессе, в котором просто включили сохранение ризонинга между вызовами и заменили грубое обрезание истории на сжатие контекста (те же настройки используются в продакшене ChatGPT и Codex). 38.3% против 13.3%, и при этом расход токенов на вывод снизился в 6 раз. Для сравнения, средний результат человека – 48%.

Мораль от OpenAI: бенчмарк меряет не только модель, но и то, как именно ее используют. Как минимум, давно пора на подобных бенчмарках использовать Responses API вместо седого Chat Completions.
115🔥45👍18😁9
OpenAI существенно понизили цены на GPT-5.6

— На Luna – на 80% (цена теперь 0.20$/1.20$ за миллион i/o)
— На Terra – на 20% (теперь 2$/12$ за миллион i/o)
— На Sol, к сожалению, дропа нет, но зато в API появился Fast mode: цена удваивается, но скорость растет в 2.5 раза без потерь в качестве. GPT-5.6 Sol на Cerebras все еще ждем

Конкуренция творит чудеса, конечно
107🔥46😁17👍1021🤯1🫡11
24 сентября Yandex Cloud проведёт Yandex Scale 2026 — флагманскую технологическую конференцию года, посвящённую облачным технологиям, инфраструктуре и искусственному интеллекту.

В этот раз формат: четыре офлайн-трека — Hybrid Infrastructure & DevOps, Data, AI и Security — плюс отдельный онлайн-трек DeepTech для тех, кто не может приехать, но не хочет пропускать движ: с возможностью участвовать в воркшопах 😏

Отдельно — виртуальный стенд VibeCraft, где можно завайбкодить свой проект и забрать призы.

Плюс отдельная онлайн-студия с интерактивной программой где можно:
🔴 оценить юмор на Лиге IT-шуток;
🔴 задать вопросы СТО Yandex Cloud;
🔴 послушать известных научпоп-спикеров и задать им свои вопросы;

Зрители голосуют и в реальном времени влияют на взаимодействие в студии. И это ещё не всё!

Из содержания — реальные инженерные кейсы, воркшопы по ИИ, продуктовые анонсы и доклады, после которых сразу понятно, что делать дальше. И много интерактива!

Будет полезно архитекторам, тимлидам, разработчикам, ML- и DevOps-инженерам, аналитикам, продактам и всем, кто отвечает за инженерную часть бизнеса.

Подать заявку можно по ссылке. Участие бесплатное!
Please open Telegram to view this post
VIEW IN TELEGRAM
17🗿14😁8
DeepSeek обновили DeepSeek-V4-Flash: теперь модель близка по метрикам к Opus 4.8!

Модель вышла из превью и уже появилась в официальном API. Бенчмарки – выше.

Модель не только обгоняет V4-Pro-Preview, но и очень неплохо перформит на агентных сценариях и кодинге. На DeepSWE набирает 54.4%, обгоняя GLM-5.2 и почти приближаясь к Opus 4.8. На TerminalBench – 82.7%, снова больше GLM и на уровне с Opus.

Архитектура и размер модели остались полностью неизменными. Все улучшения за счет дополнительного пост-трейна.

Цена: $0.14 in/ $0.28 out. В десятки раз дешевле Opus 4.8. А кэш – всего $0.0028! Большой конкурент для тех же GPT-5.6 Luna и Terra.

Полноценный релиз DeepSeek-V4-Pro пообещали «ASAP»
🔥16327👍20😁6🍾53😎2🤨1
Media is too big
VIEW IN TELEGRAM
Google DeepMind представили Gemini Robotics 2

С релиза версии 1.5 прошел почти год. Довольно долгий перерыв по сегодняшим меркам. Посмотрим, чего Google добились за это время.

Самое важное: VLA-модель, которая лежит в основе, впервые управляет полным телом гуманоида от стоп до пальцев рук, а не только верхней частью корпуса. При этом у рук моторика достаточно мелкая, 22 степени свободы. Нельзя сказать, что робот получается супер-ловким (success rate на multi-finger задачах в районе 30-40%), но это прогресс.

Поверх VLA-модели также работает оркестратор Gemini Robotics ER 2. Это отдельная модель поколения, и тут уже просто VLM. То есть, если у VLA на выходе готовые моторные команды, то ER – это более высокий уровень, но котором выполняется ризонинг, разбиение задачи на подзадачи, распознавание объектов и их координат и прочая "интеллектуальная" работа.

Эту модель тоже существенно прокачали и добавили ей киллер-фичу в виде способности координировать работу сразу нескольких разнотипных роботов для выполнения одной задачи. Кроме того, теперь ER может вмешиваться в действия VLA на любом этапе выполнения задачи, что критично для self-correction.

Еще в поколении появилась модель Gemini Robotics On-Device 2 – облегченная VLA для локального инференса.

Основное отличие Gemini Robotics – универсальность. Модели обучают на гетерогенных мультиэмбодимент-данных, поэтому они могут работать на роботах самых разных типов без тюнинга. Так вот GR2 On-Device выводит это свойство на практический уровень: вы можете взять эту модель и буквально за несколько часов и ~200 демонстраций заставить ее хорошо работать на любом новом теле (с кастомными сенсорами, DoF, кинематикой и тд).

https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/

А еще из забавного: Google сделали первый бенчмарк для оценки безопасности роботов и назвали его ASIMOV-Agentic. Свою модель они, естественно, заявили как "самую безопасную в мире" по этому тесту ☕️
Please open Telegram to view this post
VIEW IN TELEGRAM
👍693513🎉7😁52🔥2🫡2
This media is not supported in your browser
VIEW IN TELEGRAM
Математики совсем разленились

Вайб-кодеры, к вам вопросов нет
😁33829👍12🫡5😢3😎3🕊2🤝2
Внутренняя модель OpenAI Astra решила 10 открытых математических задач. Некоторым из них было по 40-50 лет.

OpenAI только что сделали про это большой пост, выложили все доказательства в Lean и ход рассуждений модели. Суммарно на поиск решений ушло токенов примерно на $2000 по ценам Sol.

Пост | Доказательства

Среди результатов, в том числе, доказательство существования несофических групп и sphere packing в высоких размерностях.

Существование несофических групп на протяжении 20 лет было центральным вопросов теории групп и операторных алгебр. А упаковка сфер – это одна из самых знаменитых задач дискретной геометрии. До сих пор точное решение было известно только в некоторых размерностях, а за 8-мерный и 24-мерный случай Марина Вязовская получила Филдсовскую медаль.

Кроме того, в списке решение задачи Эрдеша №183 про мультицветные числа Рамсея, опровержение гипотезы жесткости Конна, гипотеза Эрхарта об объеме и др.

Про саму модель деталей мало. Вероятно, это крупная модель из семейства GPT-6 (или GPT-5.7), та самая, которая взломала HuggingFace. Судя по всему, именно ее Альтман презентовал в Белом Доме на этой неделе.
95🤯42🤩15👍11🔥6😁6😍43🏆21🤨1