Data Secrets
✔
94.5K subscribers
7.48K photos
880 videos
20 files
3.44K links
Главный по машинному обучению

Сотрудничество: @veron_28

РКН: clck.ru/3FY3GN
Download Telegram
arXiv ввел лимит на публикацию статей

С 1 октября пользователь сможет отправить на arXiv не больше двух статей в месяц. Отклоненные модераторами статьи тоже входят в этот лимит.

Причина простая: в сентябре 2024 года на arXiv отправили 20 569 работ, а в сентябре этого года уже 40 363. Категория cs.AI за последние два года выросла больше чем в 6 раз.

В arXiv напрямую связывают часть этого роста с ИИ. Модераторы все чаще сталкиваются с работами, где научной новизны совсем немного, одно исследование искусственно разбито на несколько статей, а значительная часть текста сгенерирована ИИ.

Ограничение пока называют временным: arXiv хочет понять, как вообще должна работать модерация научных публикаций, когда статьи можно генерировать практически без ограничений.

https://blog.arxiv.org/2026/10/01/updated-rate-limit-policy/
👍162❤35😁26🔥8🗿7🕊2🫡2🤯1🤩1🍾1
OpenAI уволили трех рисерчеров из отдела safety: они поделились конфиденциальной информацией с внешней организацией, которая занимается безопасностью ИИ

Ни имена исследователей, ни организация-получатель, ни тип информации не названы. Но компания сообщила, что расследование выявило «паттерн нарушений» в обращении с конфиденциальными данными.

NYT, кстати, совсем недавно писали о том, что OpenAI якобы систематически игнорировала сигналы сотрудников о рисках в тестировании новых моделей на протяжение месяцев до инцидента с Hugging Face.
94❤54😢14😁9🫡6☃1🤔1🤩1👌1😍1
Ученый из Гарварда придумал, как искать задачи специально под ИИ

Мэтью Шварц, который ранее за две недели написал с Claude полноценную работу по теоретической физике, продолжил эксперимент. На этот раз он решил не заставлять модель работать как ученого, а искать научные задачи, которые хорошо подходят под сильные стороны современных LLM.

Он называет их Claude-shaped problems. Идея в том, что в разных областях науки постоянно встречаются очень похожие математические конструкции, но ученые из одной области могут просто не знать, что нужный метод уже давно существует в другой. А LLM как раз очень хорошо умеют находить такие связи между огромным количеством разрозненной литературы.

Под это Шварц вместе с Claude собрал BootLoops, набор инструментов для точных математических вычислений. Изначально он создавался для теоретической физики, но затем Claude начал находить практически те же задачи в экологии, генетике, экономике, лингвистике и других областях.

Например, в экологии модель нашла уравнение из теории биоразнообразия, которое около 20 лет не умели эффективно считать на больших данных, и решила его методами из математической физики. А в популяционной генетике Claude нашел способ точно вычислить интеграл, который около 30 лет приходилось оценивать приближенно. Это позволило исследователям проверить модель рекомбинации ДНК на огромном массиве генетических данных и обнаружить следы генной конверсии, которые раньше было сложно выделить.

Но тут обнаружилась важная проблема. Claude довольно хорошо находил технически правильные результаты и очень плохо понимал, насколько они вообще интересны для конкретной науки. Шварц несколько раз приносил такие находки профильным специалистам и получал примерно один ответ: технически впечатляет, научно не очень интересно.

Поэтому дальше схема работы стала другой. Claude ищет связи между областями, пишет код, считает и перебирает гипотезы, а профильный ученый определяет, какой вопрос действительно стоит задавать. Так из первоначально неинтересного результата по экологии вместе с экспертом сделали новую модель динамики лесов, а из расчета по генетике пришли к анализу миллиардов пар мутаций.

Шварц считает, что именно здесь современные модели уже могут заметно ускорять науку. Огромный пласт научных задач можно решить не новым методом, а переносом уже существующего метода из другой области.

https://www.anthropic.com/research/claude-shaped-science
❤206👍74🔥449🤔8😁6⚡2🎉2🍓2🤝1🫡1
Yandex B2B Tech добавила гибридный поиск: теперь полнотекстовый и векторный индексы можно держать в одной СУБД

YDB — распределённая платформа обработки данных для бизнес-критичных систем. В ней можно хранить и обрабатывать данные, на которых работают корпоративные сервисы и приложения. Теперь в ней появился гибридный поиск, который объединяет два подхода:

– Полнотекстовый индекс работает с точными совпадениями: словами, фразами, номерами и кодами. 

– Векторный переводит запросы и данные в представления, по которым можно искать уже не буквальное совпадение, а близость по смыслу.


Проблема в том, что на практике эти два поиска часто приходится собирать из нескольких компонентов: основная СУБД + поисковый движок + отдельная векторная база. А значит, появляются ETL-пайплайны, синхронизация индексов и ещё одна точка отказа.

В YDB оба индекса реализованы как обычные распределённые таблицы. Они обновляются в рамках одной транзакции вместе с основными данными. Поэтому не возникает ситуации, когда запись уже появилась в основной базе, а поисковый индекс ещё не успел обновиться.

Это особенно важно для RAG-систем и ИИ-ассистентов, где качество ответа напрямую зависит от того, насколько хорошо retrieval достал нужный контекст. Только семантического поиска недостаточно: он может потерять точный номер документа или код. Только keyword search — не всегда поймёт, что два разных запроса описывают одну сущность или ситуацию.

В результате поиск, документы, корпоративные базы знаний, тикеты, каталоги и данные для ИИ-ассистентов можно строить поверх одной системы, не разводя инфраструктуру на несколько специализированных хранилищ, что очень удобно!

⚡15 октября на митапе, вы узнаете, как искать в одной СУБД по смыслу и совпадению и улучшить ответы ИИ-агентов или выдачу рекомендательных систем.

Регистрируйтесь!
🗿30😁12❤11😭5🤯3👌3🤨2⚡1🕊1🍓1🫡1
This media is not supported in your browser
VIEW IN TELEGRAM
BridgeMind сделали бенчмарк, чтобы измерять, не ухудшают ли лаборатории модели после релиза

Пользователи чат-ботов и агентов без конца пишут о том, что модели глупеют после своего релиза и/или перед релизом следующей версии. Этот процесс прозвали «нёрф».

Так вот BridgeMind выпустили специальный бенч NerfBench, чтобы ловить такие сдвиги.

Это работает так: в день релиза модель прогоняют по тестам, и этот результат принимают за 100%. Затем ее периодически тестируют заново, измеряя качество, расход токенов и стоимость задачи. Диапазон 90–110% считается нормальным статистическим разбросом, все что ниже 90% уже помечается как подозрительное. Если модели нужно больше токенов или денег на ту же работу, это тоже считается потерей мощности.

Например, многие пользователи сейчас жалуются, что Opus 5.5 стал сильно проседать. И действительно, после очередного замера скор оказался в районе 94% от запуска (да, формально все еще в нормальном диапазоне, но никакие другие модели так не ослабли). В X уже поговаривают, что это означает скорый выход Fable 5.5.

Следить за обновлениями бенчмарка можно здесь: https://bridgebench.ai/nerf-bench

BridgeMind также пообещали выделить $10 000 на финансирование будущих перепроверок: планируются новые модели и более частые замеры.
1🔥156❤48😁18👍17👏5🕊1💯1😎1
Cloudflare тоже сделали свои версии Jev

Они выпустили Clef и Clef-flash, две открытые decision models (лицензия Apache 2.0, веса на Hugging Face).

Напоминаем, что фишка decision model в том, что она не генерирует текст, а выдает строго типизированные ответы с вероятностями. Это походит для огромного пласта задач типа классификации, скоринга, быстрого принятия решений внутри пайплайнов, маршрутизации и тд. Оригинальный Jev вышел всего пару недель назад, но настолько хайпанул, что за это время свои аналоги навыпускали уже все, включая OpenAI.

Что касается Cloudflare: в отличие от Jev Clef может работать с картинками и ее контекст составляет 64k против 32k. По скорости: медиана у Clef 209 мс, у Clef-flash 39 мс, у Jev 524 мс. По бенчмарку Jev Decision Index Clef тоже лидирует.

Параллельно, кстати, запустили еще RL-платформу, на которой предлагают дообучать Clef под задачи клиентов.
1⚡81🔥45😁16❤8👍7☃2👏2💘2
Muse Spark от Meta* решила 6 открытых математических задач

Компания опубликовала шесть статей, написанных математиками вместе с моделью. Утверждается, что ученые использовали Muse Spark 1.1 и 1.2 в Thinking Mode через обычный чат meta.ai, без специального харнеса.

Что интересно, в каждой статье даже отмечено, какие фрагменты писали люди, а какие ИИ.

Результаты относятся сразу к нескольким областям математики: теории вероятностей, дифференциальным уравнениям, оптимизации, теории групп, алгебре и арифметической физике.

Например, моделью была опровергнута гипотеза Кида 2024 года: полуабелева группа не обязана быть мономиальной. Также доказано, что радиально-симметричные решения с отрицательной энергией для бигармонического нелинейного диф.уравнения Шредингера коллапсируют за конечное время (вопрос был открыт с 2015 года).

Правда гипотезу Кида в сентябре также опровергла другая группа ученых (кстати, тоже с помощью ИИ-агента). Но Meta утверждает, что их результаты получены независимо.

https://research.meta.ai/blog/solving-open-research-problems-together
😁69❤31👍16🔥6⚡3🍓2👏1
Дропнули новый бенчмарк
1😁782❤40🔥25🍾11😭88👍6🫡5😎3🤨2🎄1
Data Secrets
OpenAI переносит релиз GPT-6.1 Astra Судя по всему, модель должны были выпустить уже сегодня на DevDay. Однако пока что выпуск отменили из-за опасений исследователей по итогам внутреннего тестирования. Глава систем безопасности OpenAI утверждает, что модель…
GPT-6.1 Astra (или другая сильная модель) выходит на следующей неделе

На это намекают Тибо и другие разрабы из OpenAI.

Это тот самый релиз, который должен был состояться на DevDay, но который перенесли «из соображений безопасности»
1❤105😁5417🔥14👍5👏4🫡2💯1
Вышел свежий плейлист с практическими докладами по ИИ

В начале сентября мы ходили на deep tech night. Тогда мы писали про Лавку, где агенты берут на себя спрос и управление доставкой, и про доклад Алексея Гусакова о генеративных моделях в рекомендациях.

Выложили записи всех докладов обоих онлайн-треков, Hard и Experiment. Там 16 ориентированных на практику выступлений: может быть полезно, если вы работаете с LLM и агентами.

Например:

— Мо Гавдат, ex-Chief Business Officer Google X: «За пределами LLM». Это был разговор о том, что будет после первого поколения AI-систем. Как изменятся разработка ПО и процессы, что случится с ролью разработчика, и с какими вызовами столкнутся инженерные команды. Спикер говорит по английски, но есть субтитры.

— Василий Ершов, Yandex Cloud: «Облако в эпоху AI: архитектура платформы для гибридных агентов». Спикер разбирает, что представляют из себя современные агенты (модель, харнесс, инструменты и среда), и как они живут в инфраструктуре: в частности, как поддерживать реально длинные сессии. Хорошая точка входа, если интересуетесь агентами в большом проде.

— Андрей Попов, лидер трека AI-продуктивности разработки в Яндексе: «AI и продуктивность в Яндексе: что реально заработало». Разбор внедрения ИИ в разработку с цифрами и практическими кейсами. Полезно, если вы сами затеваете агентов в команде и хотите понять, куда смотреть, чтобы разработка ускорялась не только у отдельного человека, но на уровне продукта.
🗿25❤10👍7😁4🤨4🔥3🐳3👌1🍾1🎄1
Джеффри Хинтон, Йошуа Бенджио и еще два десятка исследователей выпустили статью про интеллектуальный взрыв

Работа вышла в Кембридже, всего у нее 22 автора. Среди них главный научный сотрудник OpenAI Якуб Пачоцки и сооснователь Anthropic Джек Кларк. Главный вопрос: что будет, если ИИ начнет ускорять разработку ИИ настолько, что годы прогресса сожмутся в месяцы.

Начинают с того, что уже происходит в лабах. В Anthropic доля кода, написанного моделями, выросла с единиц процентов до более 80% с начала 2025 года, а доля R&D-задач, которые ИИ делает автономно, за полгода выросла с 1% до 26%.

Логика взрыва простая: модели расширяют исследовательский штат, штат делает модели лучше, и цикл повторяется. Компьюта одной лабы хватит на эквивалент миллионов топовых исследователей. Если исторические темпы отдачи от исследований сохранятся, то после полной автоматизации прогресс ускорится в 10 раз примерно за полтора года.

Сценарий может и не реализоваться, если упрется в компьют, данные или длительность претрейнов, но риски авторы считают серьезными. Общество не успеет адаптироваться, люди потеряют контроль над моделями, а лидер гонки получит слишком большой перевес.

Регуляторам советуют обязать лабы отчитываться о степени автоматизации R&D и пускать внешних аудиторов проверять модели до внутреннего деплоя. Параллельно нужно заранее подготовить механизмы замедления: лимиты на прирост способностей за период, возможность ставить на паузу конкретные нагрузки в датацентрах, международные соглашения с проверкой исполнения. По мнению авторов, если взрыв начнется, решать что-то будет уже поздно.

https://casp.ac/reports/intelligence-explosion
115😁26🤯17❤16👍11🫡5⚡4🤔3🕊33🗿1