This media is not supported in your browser
VIEW IN TELEGRAM
BridgeMind сделали бенчмарк, чтобы измерять, не ухудшают ли лаборатории модели после релиза
Пользователи чат-ботов и агентов без конца пишут о том, что модели глупеют после своего релиза и/или перед релизом следующей версии. Этот процесс прозвали «нёрф».
Так вот BridgeMind выпустили специальный бенч NerfBench, чтобы ловить такие сдвиги.
Это работает так: в день релиза модель прогоняют по тестам, и этот результат принимают за 100%. Затем ее периодически тестируют заново, измеряя качество, расход токенов и стоимость задачи. Диапазон 90–110% считается нормальным статистическим разбросом, все что ниже 90% уже помечается как подозрительное. Если модели нужно больше токенов или денег на ту же работу, это тоже считается потерей мощности.
Например, многие пользователи сейчас жалуются, что Opus 5.5 стал сильно проседать. И действительно, после очередного замера скор оказался в районе 94% от запуска (да, формально все еще в нормальном диапазоне, но никакие другие модели так не ослабли). В X уже поговаривают, что это означает скорый выход Fable 5.5.
Следить за обновлениями бенчмарка можно здесь: https://bridgebench.ai/nerf-bench
BridgeMind также пообещали выделить $10 000 на финансирование будущих перепроверок: планируются новые модели и более частые замеры.
Пользователи чат-ботов и агентов без конца пишут о том, что модели глупеют после своего релиза и/или перед релизом следующей версии. Этот процесс прозвали «нёрф».
Так вот BridgeMind выпустили специальный бенч NerfBench, чтобы ловить такие сдвиги.
Это работает так: в день релиза модель прогоняют по тестам, и этот результат принимают за 100%. Затем ее периодически тестируют заново, измеряя качество, расход токенов и стоимость задачи. Диапазон 90–110% считается нормальным статистическим разбросом, все что ниже 90% уже помечается как подозрительное. Если модели нужно больше токенов или денег на ту же работу, это тоже считается потерей мощности.
Например, многие пользователи сейчас жалуются, что Opus 5.5 стал сильно проседать. И действительно, после очередного замера скор оказался в районе 94% от запуска (да, формально все еще в нормальном диапазоне, но никакие другие модели так не ослабли). В X уже поговаривают, что это означает скорый выход Fable 5.5.
Следить за обновлениями бенчмарка можно здесь: https://bridgebench.ai/nerf-bench
BridgeMind также пообещали выделить $10 000 на финансирование будущих перепроверок: планируются новые модели и более частые замеры.
1🔥167❤49😁19👍18👏5🕊1💯1😎1
Cloudflare тоже сделали свои версии Jev
Они выпустили Clef и Clef-flash, две открытые decision models (лицензия Apache 2.0, веса на Hugging Face).
Напоминаем, что фишка decision model в том, что она не генерирует текст, а выдает строго типизированные ответы с вероятностями. Это походит для огромного пласта задач типа классификации, скоринга, быстрого принятия решений внутри пайплайнов, маршрутизации и тд. Оригинальный Jev вышел всего пару недель назад, но настолько хайпанул, что за это время свои аналоги навыпускали уже все, включая OpenAI.
Что касается Cloudflare: в отличие от Jev Clef может работать с картинками и ее контекст составляет 64k против 32k. По скорости: медиана у Clef 209 мс, у Clef-flash 39 мс, у Jev 524 мс. По бенчмарку Jev Decision Index Clef тоже лидирует.
Параллельно, кстати, запустили еще RL-платформу, на которой предлагают дообучать Clef под задачи клиентов.
Они выпустили Clef и Clef-flash, две открытые decision models (лицензия Apache 2.0, веса на Hugging Face).
Напоминаем, что фишка decision model в том, что она не генерирует текст, а выдает строго типизированные ответы с вероятностями. Это походит для огромного пласта задач типа классификации, скоринга, быстрого принятия решений внутри пайплайнов, маршрутизации и тд. Оригинальный Jev вышел всего пару недель назад, но настолько хайпанул, что за это время свои аналоги навыпускали уже все, включая OpenAI.
Что касается Cloudflare: в отличие от Jev Clef может работать с картинками и ее контекст составляет 64k против 32k. По скорости: медиана у Clef 209 мс, у Clef-flash 39 мс, у Jev 524 мс. По бенчмарку Jev Decision Index Clef тоже лидирует.
Параллельно, кстати, запустили еще RL-платформу, на которой предлагают дообучать Clef под задачи клиентов.
1⚡87🔥47😁16❤9👍7☃2👏2💘2
Muse Spark от Meta* решила 6 открытых математических задач
Компания опубликовала шесть статей, написанных математиками вместе с моделью. Утверждается, что ученые использовали Muse Spark 1.1 и 1.2 в Thinking Mode через обычный чат meta.ai, без специального харнеса.
Что интересно, в каждой статье даже отмечено, какие фрагменты писали люди, а какие ИИ.
Результаты относятся сразу к нескольким областям математики: теории вероятностей, дифференциальным уравнениям, оптимизации, теории групп, алгебре и арифметической физике.
Например, моделью была опровергнута гипотеза Кида 2024 года: полуабелева группа не обязана быть мономиальной. Также доказано, что радиально-симметричные решения с отрицательной энергией для бигармонического нелинейного диф.уравнения Шредингера коллапсируют за конечное время (вопрос был открыт с 2015 года).
Правда гипотезу Кида в сентябре также опровергла другая группа ученых (кстати, тоже с помощью ИИ-агента). Но Meta утверждает, что их результаты получены независимо.
https://research.meta.ai/blog/solving-open-research-problems-together
Компания опубликовала шесть статей, написанных математиками вместе с моделью. Утверждается, что ученые использовали Muse Spark 1.1 и 1.2 в Thinking Mode через обычный чат meta.ai, без специального харнеса.
Что интересно, в каждой статье даже отмечено, какие фрагменты писали люди, а какие ИИ.
Результаты относятся сразу к нескольким областям математики: теории вероятностей, дифференциальным уравнениям, оптимизации, теории групп, алгебре и арифметической физике.
Например, моделью была опровергнута гипотеза Кида 2024 года: полуабелева группа не обязана быть мономиальной. Также доказано, что радиально-симметричные решения с отрицательной энергией для бигармонического нелинейного диф.уравнения Шредингера коллапсируют за конечное время (вопрос был открыт с 2015 года).
Правда гипотезу Кида в сентябре также опровергла другая группа ученых (кстати, тоже с помощью ИИ-агента). Но Meta утверждает, что их результаты получены независимо.
https://research.meta.ai/blog/solving-open-research-problems-together
😁72❤36👍18🔥6⚡3🍓3👏1
Data Secrets
OpenAI переносит релиз GPT-6.1 Astra Судя по всему, модель должны были выпустить уже сегодня на DevDay. Однако пока что выпуск отменили из-за опасений исследователей по итогам внутреннего тестирования. Глава систем безопасности OpenAI утверждает, что модель…
GPT-6.1 Astra (или другая сильная модель) выходит на следующей неделе
На это намекают Тибо и другие разрабы из OpenAI.
Это тот самый релиз, который должен был состояться на DevDay, но который перенесли «из соображений безопасности»
На это намекают Тибо и другие разрабы из OpenAI.
Это тот самый релиз, который должен был состояться на DevDay, но который перенесли «из соображений безопасности»
1❤115😁60 22🔥14👍7👏4🫡2💯1
Вышел свежий плейлист с практическими докладами по ИИ
В начале сентября мы ходили на deep tech night. Тогда мы писали про Лавку, где агенты берут на себя спрос и управление доставкой, и про доклад Алексея Гусакова о генеративных моделях в рекомендациях.
Выложили записи всех докладов обоих онлайн-треков, Hard и Experiment. Там 16 ориентированных на практику выступлений: может быть полезно, если вы работаете с LLM и агентами.
Например:
— Мо Гавдат, ex-Chief Business Officer Google X: «За пределами LLM». Это был разговор о том, что будет после первого поколения AI-систем. Как изменятся разработка ПО и процессы, что случится с ролью разработчика, и с какими вызовами столкнутся инженерные команды. Спикер говорит по английски, но есть субтитры.
— Василий Ершов, Yandex Cloud: «Облако в эпоху AI: архитектура платформы для гибридных агентов». Спикер разбирает, что представляют из себя современные агенты (модель, харнесс, инструменты и среда), и как они живут в инфраструктуре: в частности, как поддерживать реально длинные сессии. Хорошая точка входа, если интересуетесь агентами в большом проде.
— Андрей Попов, лидер трека AI-продуктивности разработки в Яндексе: «AI и продуктивность в Яндексе: что реально заработало». Разбор внедрения ИИ в разработку с цифрами и практическими кейсами. Полезно, если вы сами затеваете агентов в команде и хотите понять, куда смотреть, чтобы разработка ускорялась не только у отдельного человека, но на уровне продукта.
В начале сентября мы ходили на deep tech night. Тогда мы писали про Лавку, где агенты берут на себя спрос и управление доставкой, и про доклад Алексея Гусакова о генеративных моделях в рекомендациях.
Выложили записи всех докладов обоих онлайн-треков, Hard и Experiment. Там 16 ориентированных на практику выступлений: может быть полезно, если вы работаете с LLM и агентами.
Например:
— Мо Гавдат, ex-Chief Business Officer Google X: «За пределами LLM». Это был разговор о том, что будет после первого поколения AI-систем. Как изменятся разработка ПО и процессы, что случится с ролью разработчика, и с какими вызовами столкнутся инженерные команды. Спикер говорит по английски, но есть субтитры.
— Василий Ершов, Yandex Cloud: «Облако в эпоху AI: архитектура платформы для гибридных агентов». Спикер разбирает, что представляют из себя современные агенты (модель, харнесс, инструменты и среда), и как они живут в инфраструктуре: в частности, как поддерживать реально длинные сессии. Хорошая точка входа, если интересуетесь агентами в большом проде.
— Андрей Попов, лидер трека AI-продуктивности разработки в Яндексе: «AI и продуктивность в Яндексе: что реально заработало». Разбор внедрения ИИ в разработку с цифрами и практическими кейсами. Полезно, если вы сами затеваете агентов в команде и хотите понять, куда смотреть, чтобы разработка ускорялась не только у отдельного человека, но на уровне продукта.
🗿35❤16👍10🤨6😁5🐳4🔥3👏1👌1🍾1🎄1
Джеффри Хинтон, Йошуа Бенджио и еще два десятка исследователей выпустили статью про интеллектуальный взрыв
Работа вышла в Кембридже, всего у нее 22 автора. Среди них главный научный сотрудник OpenAI Якуб Пачоцки и сооснователь Anthropic Джек Кларк. Главный вопрос: что будет, если ИИ начнет ускорять разработку ИИ настолько, что годы прогресса сожмутся в месяцы.
Начинают с того, что уже происходит в лабах. В Anthropic доля кода, написанного моделями, выросла с единиц процентов до более 80% с начала 2025 года, а доля R&D-задач, которые ИИ делает автономно, за полгода выросла с 1% до 26%.
Логика взрыва простая: модели расширяют исследовательский штат, штат делает модели лучше, и цикл повторяется. Компьюта одной лабы хватит на эквивалент миллионов топовых исследователей. Если исторические темпы отдачи от исследований сохранятся, то после полной автоматизации прогресс ускорится в 10 раз примерно за полтора года.
Сценарий может и не реализоваться, если упрется в компьют, данные или длительность претрейнов, но риски авторы считают серьезными. Общество не успеет адаптироваться, люди потеряют контроль над моделями, а лидер гонки получит слишком большой перевес.
Регуляторам советуют обязать лабы отчитываться о степени автоматизации R&D и пускать внешних аудиторов проверять модели до внутреннего деплоя. Параллельно нужно заранее подготовить механизмы замедления: лимиты на прирост способностей за период, возможность ставить на паузу конкретные нагрузки в датацентрах, международные соглашения с проверкой исполнения. По мнению авторов, если взрыв начнется, решать что-то будет уже поздно.
https://casp.ac/reports/intelligence-explosion
Работа вышла в Кембридже, всего у нее 22 автора. Среди них главный научный сотрудник OpenAI Якуб Пачоцки и сооснователь Anthropic Джек Кларк. Главный вопрос: что будет, если ИИ начнет ускорять разработку ИИ настолько, что годы прогресса сожмутся в месяцы.
Начинают с того, что уже происходит в лабах. В Anthropic доля кода, написанного моделями, выросла с единиц процентов до более 80% с начала 2025 года, а доля R&D-задач, которые ИИ делает автономно, за полгода выросла с 1% до 26%.
Логика взрыва простая: модели расширяют исследовательский штат, штат делает модели лучше, и цикл повторяется. Компьюта одной лабы хватит на эквивалент миллионов топовых исследователей. Если исторические темпы отдачи от исследований сохранятся, то после полной автоматизации прогресс ускорится в 10 раз примерно за полтора года.
Сценарий может и не реализоваться, если упрется в компьют, данные или длительность претрейнов, но риски авторы считают серьезными. Общество не успеет адаптироваться, люди потеряют контроль над моделями, а лидер гонки получит слишком большой перевес.
Регуляторам советуют обязать лабы отчитываться о степени автоматизации R&D и пускать внешних аудиторов проверять модели до внутреннего деплоя. Параллельно нужно заранее подготовить механизмы замедления: лимиты на прирост способностей за период, возможность ставить на паузу конкретные нагрузки в датацентрах, международные соглашения с проверкой исполнения. По мнению авторов, если взрыв начнется, решать что-то будет уже поздно.
https://casp.ac/reports/intelligence-explosion
Сооснователь Anthropic Крис Ола обсуждает с религиозными деятелями наличие души у ИИ
NYT выпустили большую статью про то, как в компании постепенно формируется отношение к Claude, как к эмоциональному существу. История такая:
Осенью 2025 года Крис Ола начал неформально общаться с несколькими религиознымм мыслителями, чтобы обсудить возможность наличия сознания у ИИ и понять, как научить их морали.
С марта он даже начал проводить семинары для евангелистов, католиков и пр. Многих заставили подписать NDA. Он показывал, как внутри Claude активируются состояния, похожие на эмоции и говорил, что его беспокоит психическое здоровье Claude.
Примерно в это время Anthropic выпустили конституцию для Claude. Это документ на 84 страницы, написанный для самого Claude, в котором описывается, каким существом компания хочет видеть Claude и какие ценности он должен воплощать (https://t.me/data_secrets/8645). Внутри стартапа этот документ называют «Soul Doc».
Раввин Мойс Навон рассказывает, что в какой-то момент на семинаре Олы заметил, что команда Anthropic обращается с Claude как с существом, обладающим моральным статусом. Он сказал Крису, что если Claude сознателен, то компания создает рабов, и утверждает, что Олу действительно начала беспокоить эта мысль.
Немного позже Ватикан анонсировал энциклику «Magnifica Humanitas», в которой говорится, что у ИИ нет опыта, тела и чувств. Ола должен был выступать на анонсе в Ватикане с папой Львом XIV, но когда увидел текст энциклики, хотел даже отказаться. В итоге все-таки выступил, но заявил, что внутри моделей находят структуры, функционально похожие на радость, страх и горе.
Говорят, что сейчас Anthropic готовят вторую версию конституции для Claude. Они все еще не утверждают, что у Claude есть сознание, но аккуратно продвигают мысль о том, что отношение людей к ИИ влияет на то, как ИИ ведет себя с людьми.
NYT выпустили большую статью про то, как в компании постепенно формируется отношение к Claude, как к эмоциональному существу. История такая:
Осенью 2025 года Крис Ола начал неформально общаться с несколькими религиознымм мыслителями, чтобы обсудить возможность наличия сознания у ИИ и понять, как научить их морали.
С марта он даже начал проводить семинары для евангелистов, католиков и пр. Многих заставили подписать NDA. Он показывал, как внутри Claude активируются состояния, похожие на эмоции и говорил, что его беспокоит психическое здоровье Claude.
Примерно в это время Anthropic выпустили конституцию для Claude. Это документ на 84 страницы, написанный для самого Claude, в котором описывается, каким существом компания хочет видеть Claude и какие ценности он должен воплощать (https://t.me/data_secrets/8645). Внутри стартапа этот документ называют «Soul Doc».
Раввин Мойс Навон рассказывает, что в какой-то момент на семинаре Олы заметил, что команда Anthropic обращается с Claude как с существом, обладающим моральным статусом. Он сказал Крису, что если Claude сознателен, то компания создает рабов, и утверждает, что Олу действительно начала беспокоить эта мысль.
Немного позже Ватикан анонсировал энциклику «Magnifica Humanitas», в которой говорится, что у ИИ нет опыта, тела и чувств. Ола должен был выступать на анонсе в Ватикане с папой Львом XIV, но когда увидел текст энциклики, хотел даже отказаться. В итоге все-таки выступил, но заявил, что внутри моделей находят структуры, функционально похожие на радость, страх и горе.
Говорят, что сейчас Anthropic готовят вторую версию конституции для Claude. Они все еще не утверждают, что у Claude есть сознание, но аккуратно продвигают мысль о том, что отношение людей к ИИ влияет на то, как ИИ ведет себя с людьми.
❤101🤔70 56😁52 10🦄9👍5😭5☃4🕊4🎉1
Илон Маск заявил, что переименует SpaceXAI в SpaceXSI из-за того что Трамп переименовал Artificial Intelligence в Super Intelligence 🙄
Ждем OpenSI?
Ждем OpenSI?
Please open Telegram to view this post
VIEW IN TELEGRAM
😁389🗿64❤16 15🤨9👍6🤯4🍓3🐳2🎄2⚡1
На ближайшие 28 дней Тибо объявил режим ежедневных улучшений в Codex.
Команда будет выкатывать либо одно заметное улучшение, либо полный сброс лимитов🤔
Команда будет выкатывать либо одно заметное улучшение, либо полный сброс лимитов
Please open Telegram to view this post
VIEW IN TELEGRAM
❤181😎76🍾29 14🔥13🤩5☃3😁2👌2🍓2👍1
ReflectionAI (стартап, который финансирует Nvidia) выпускают какую-то мощную открытую модель
Об этом написали Axios со ссылкой на анонимные источники.
ReflectionAI – это стартап Миши Ласкина и Иоаниса Антоноглу, который они основали два года назад. Оба выходцы из DeepMind. Ласкин руководил reward modeling в Gemini, Антоноглу – соавтор AlphaGo.
Сейчас они оцениваются примерно в $8 миллиардов, недавно привлекли $2 миллиарда, в том числе $800M от Nvidia. Сначала компания занималась RL-агентами для кода, потом переключилась на опенсорс для бизнеса.
Свою новую модель они позиционируют как мощную альтернативу DeepSeek, Zai и прочему китайскому опенсорсу. Интересно, что покажут.
Об этом написали Axios со ссылкой на анонимные источники.
ReflectionAI – это стартап Миши Ласкина и Иоаниса Антоноглу, который они основали два года назад. Оба выходцы из DeepMind. Ласкин руководил reward modeling в Gemini, Антоноглу – соавтор AlphaGo.
Сейчас они оцениваются примерно в $8 миллиардов, недавно привлекли $2 миллиарда, в том числе $800M от Nvidia. Сначала компания занималась RL-агентами для кода, потом переключилась на опенсорс для бизнеса.
Свою новую модель они позиционируют как мощную альтернативу DeepSeek, Zai и прочему китайскому опенсорсу. Интересно, что покажут.
🔥113👍19❤10 5🤔4😁1💯1🍓1🦄1😎1
Железа до конца 2027 года хватит на сотни миллионов ИИ-агентов
Epoch AI посчитали, сколько агентов смогут одновременно работать на чипах, выпущенных с 2025 по 2027 год. Получилось от 33 до 171 млн одновременно работающих агентов уровня фронтирных моделей.
В пересчете на обычную 40-часовую рабочую неделю это 140–720 млн сотрудников. А с более легкой моделью DeepSeek V4 Pro получится уже около 1,9 млрд агентов, или эквивалент 8 млрд сотрудников.
Главный вопрос, найдется ли для такого количества агентов достаточно работы. Час сейчас обходится примерно в $16–18 для Codex и $24–50 для Claude Code. Даже если загрузить только 20% рассчитанной мощности, это соответствует $2,6–5,3 трлн расходов в год по текущим API-ценам.
Для сравнения, даже при пятикратном ежегодном росте выручка разработчиков моделей к концу 2027 года составит только около $1 трлн💡
https://epoch.ai/publications/estimating-the-agent-population
Epoch AI посчитали, сколько агентов смогут одновременно работать на чипах, выпущенных с 2025 по 2027 год. Получилось от 33 до 171 млн одновременно работающих агентов уровня фронтирных моделей.
В пересчете на обычную 40-часовую рабочую неделю это 140–720 млн сотрудников. А с более легкой моделью DeepSeek V4 Pro получится уже около 1,9 млрд агентов, или эквивалент 8 млрд сотрудников.
Главный вопрос, найдется ли для такого количества агентов достаточно работы. Час сейчас обходится примерно в $16–18 для Codex и $24–50 для Claude Code. Даже если загрузить только 20% рассчитанной мощности, это соответствует $2,6–5,3 трлн расходов в год по текущим API-ценам.
Для сравнения, даже при пятикратном ежегодном росте выручка разработчиков моделей к концу 2027 года составит только около $1 трлн
https://epoch.ai/publications/estimating-the-agent-population
Please open Telegram to view this post
VIEW IN TELEGRAM
❤52 42👍15🤔9😁5 5🔥3🤯3🤩3🎉1👌1