Стартап Tavus представил Griffin – первую в мире модель, которая прошла видео-тест Тьюринга
В живом видеозвонке на минуту 48% участников (26 из 54) решили, что говорили с реальным человеком, когда говорили с Griffin. Прежде чем читать дальше, посмотрите демки, они правда выглядят пугающе живо и уже потрясли соцсети (на анонсе Tavus уже 10 миллионов просмотров).
Модель смеется, меняет тон, перебивает и позволяет перебить себя, хорошо чувствует паузы. Плюс отлично следует инструкциям, и видит/понимает собеседника и его окружение (например, может помочь собрать кубик рубика). И это уже не говоря о таких мелких вещах, как покрутиться на стуле или, например, улыбнуться, как живой собеседник.
Griffin работает как единая full-duplex video-to-video система. Каждые доли секунды она решает, стоить ли сейчас молчать, кивнуть, поддакнуть или перехватить реплику, и все это время продолжает смотреть и слушать, в том числе пока говорит сама. Поверх этого менеджера работают стриминговые генераторы речи и видео, которые превращают эти сигналы в голос и лицо в реальном времени. Некоторые детали архитектуры есть в блогпосте.
Модель пока доступна только избранным тестировщикам как research preview, потому что Tavus действительно уверены, что она способна обмануть человека, заставив его думать, что он говорит не с ИИ. Релиз обещают «очень скоро» после проработки безопасности и разработки водяных знаков.
В живом видеозвонке на минуту 48% участников (26 из 54) решили, что говорили с реальным человеком, когда говорили с Griffin. Прежде чем читать дальше, посмотрите демки, они правда выглядят пугающе живо и уже потрясли соцсети (на анонсе Tavus уже 10 миллионов просмотров).
Модель смеется, меняет тон, перебивает и позволяет перебить себя, хорошо чувствует паузы. Плюс отлично следует инструкциям, и видит/понимает собеседника и его окружение (например, может помочь собрать кубик рубика). И это уже не говоря о таких мелких вещах, как покрутиться на стуле или, например, улыбнуться, как живой собеседник.
Griffin работает как единая full-duplex video-to-video система. Каждые доли секунды она решает, стоить ли сейчас молчать, кивнуть, поддакнуть или перехватить реплику, и все это время продолжает смотреть и слушать, в том числе пока говорит сама. Поверх этого менеджера работают стриминговые генераторы речи и видео, которые превращают эти сигналы в голос и лицо в реальном времени. Некоторые детали архитектуры есть в блогпосте.
Модель пока доступна только избранным тестировщикам как research preview, потому что Tavus действительно уверены, что она способна обмануть человека, заставив его думать, что он говорит не с ИИ. Релиз обещают «очень скоро» после проработки безопасности и разработки водяных знаков.
🔥173🤯81😁24❤15👍10🤔10🍓2🤗2😎2
Data Secrets
В Твиттере заметили, что Андрей Карпаты ничего не постит уже 2 месяца, хотя раньше делал это достаточно часто Он даже ничего не написал про Opus 5.5 Anthropic держат его в заложниках?..
Карпаты рассказал, как теперь правильно общаться с LLM
Совсем недавно переживали, что Андрей Карпаты уже два месяца ничего не пишет. Все хорошо, сегодня вернулся с довольно интересной мыслью: по мере развития моделей человеку придется все меньше делать самому и все больше разбираться в результатах их работы.
И здесь обычный текст далеко не всегда лучший интерфейс. Карпаты предлагает буквально менять формат ответа в зависимости от задачи:
– Для текста просить модель писать в ASD-STE100. Это стандарт контролируемого английского, изначально разработанный для технической документации в авиации. Там жестко ограничены словарь и структура предложений, поэтому ответы получаются сильно чище. Сам Карпаты иногда просит модель следовать стандарту примерно «на 80%», чтобы текст не становился совсем технической инструкцией.
– Вместо длинного объяснения просить диаграмму или картинку.
– Для более сложных тем сразу генерировать интерактивную HTML-страницу с визуализациями и анимациями.
– А следующий шаг, на который Карпаты ставит больше всего, это одноразовые объясняющие видео под конкретный вопрос. Например, уже сейчас он предлагает просить модель собрать ролик в стиле 3Blue1Brown с озвучкой через ElevenLabs.
Идея тут шире конкретных промптов. Если код и генерация контента становятся достаточно дешевыми, под один вопрос можно создавать целое одноразовое приложение, визуализацию или видео, которое раньше просто не имело экономического смысла делать. По мнению Карпаты, по мере роста автономности моделей именно понимание и контроль их работы будут занимать все большую часть времени человека.
https://x.com/karpathy/status/2105819303471976479?s=46
Совсем недавно переживали, что Андрей Карпаты уже два месяца ничего не пишет. Все хорошо, сегодня вернулся с довольно интересной мыслью: по мере развития моделей человеку придется все меньше делать самому и все больше разбираться в результатах их работы.
И здесь обычный текст далеко не всегда лучший интерфейс. Карпаты предлагает буквально менять формат ответа в зависимости от задачи:
– Для текста просить модель писать в ASD-STE100. Это стандарт контролируемого английского, изначально разработанный для технической документации в авиации. Там жестко ограничены словарь и структура предложений, поэтому ответы получаются сильно чище. Сам Карпаты иногда просит модель следовать стандарту примерно «на 80%», чтобы текст не становился совсем технической инструкцией.
– Вместо длинного объяснения просить диаграмму или картинку.
– Для более сложных тем сразу генерировать интерактивную HTML-страницу с визуализациями и анимациями.
– А следующий шаг, на который Карпаты ставит больше всего, это одноразовые объясняющие видео под конкретный вопрос. Например, уже сейчас он предлагает просить модель собрать ролик в стиле 3Blue1Brown с озвучкой через ElevenLabs.
Идея тут шире конкретных промптов. Если код и генерация контента становятся достаточно дешевыми, под один вопрос можно создавать целое одноразовое приложение, визуализацию или видео, которое раньше просто не имело экономического смысла делать. По мнению Карпаты, по мере роста автономности моделей именно понимание и контроль их работы будут занимать все большую часть времени человека.
https://x.com/karpathy/status/2105819303471976479?s=46
1👍246❤63🔥17⚡13🤔10😁9💯8🤯3🫡3🤓2🎄1
Как проходит тихая революция в рекомендательных системах
Рекомендательные системы последние пару лет проходят примерно тот же путь, что раньше прошел поиск: от вороха ручных фичей и каскадов моделей все больше хотят перейти к одной большой генеративной модели. Тренд общий для индустрии: TikTok, Netflix и китайские e-commerce гиганты один за другим публикуют статьи о переходе на generative recommenders. Идея в том, что вместо обычного ранжирования кандидатов модель буквально предсказывает следующий айтем, как LLM предсказывает следующий токен.
Работает это на удивление хорошо, давайте разбираться почему. На deep tech night на эту тему выступал Алексей Гусаков, CTO бизнес-группы поисковых сервисов и ИИ в Яндексе. На его материале эту эволюцию удобно проследить по шагам.
Примерно 10 лет назад классическая рекомендательная система была конвейером из пяти стадий: сотни вручную сконструированных фичей, десятки отдельных генераторов кандидатов, затем преранк, ранжирование и постранк. Каждая стадия – отдельная модель и часто отдельная команда. Масштабировать такую телегу довольно тяжело.
2019 год – случился первый большой сдвиг. Тогда трансформеры впервые завезли в поиск. Это был всем известный BERT.
Через 4 года, в 2023, та же архитектура докатилась и до рекомендаций. Это был первый скачок в профите, и первое доказательство работоспособности трансформеров. В компании BERT поднял ключевую метрику качества с 0,56 до 0,84 всего за один год. Это куда больше, чем годами давали точечные улучшения в старой каскадной схеме.
Примерно тогда же стрельнул ChatGPT, и в рексис игру вступили настоящие LLM. Идея "будем делать вообще все через одну языковую модель" почти сразу захватила область. Но на практике переход оказался не таким простым. LLM, как мы знаем, довольно капризны в плане инфраструктуры и экономики вычислений.
В 2025 Яндекс выкатил Argus – свою первую модель, которая опиралась на масштабирование по данным и вычислениям, то есть на те самые scaling laws, которые лежат в основе развития современных LLM. Метрика подскочила более чем в два раза: до 1.93. Однако из-за стоимости инференса Argus поначалу использовали точечно, в стадии преранка, а не во всем пайплайне.
Логичный следующий шаг – убрать ручной фича-инжиниринг вообще и сделать end-to-end систему, которая генерирует рекомендации напрямую, без промежуточных каскадов. Именно к такой схеме (история -> единая модель -> рекомендации) весь мир и движется.
Несколько недель назад Яндекс выпускает Sona – одну из первых систем рекомендаций, построенных по такому принципу . Подробный разбор техрепорта мы делали здесь.
По архитектуре это устроено так: трек прогоняется через замороженную мультимодальную LLM, дообучаемый трансформер сжимает его в компактные semantic ID (aka словарные токены для треков), а дальше эти ID предсказываются по истории пользователя и уходят в ранжирующий модуль. Результат по метрике – 4.53. Это рост почти в 2.5 раза относительно Argus и самый большой скачок в истории рексис в самой компании.
Если вынести за скобки компанию, тренд общий: рекомендации повторяют путь поиска и компьютерного зрения и движутся от ручных фичей и десятков моделей к одной системе, растущей на данных и вычислениях. Пока что это дорого и не всегда стабильно, требует перестройки инфраструктуры и огромных вложений на инференс и эксперименты. Зато качество растет не на проценты, а в разы.
Рекомендательные системы последние пару лет проходят примерно тот же путь, что раньше прошел поиск: от вороха ручных фичей и каскадов моделей все больше хотят перейти к одной большой генеративной модели. Тренд общий для индустрии: TikTok, Netflix и китайские e-commerce гиганты один за другим публикуют статьи о переходе на generative recommenders. Идея в том, что вместо обычного ранжирования кандидатов модель буквально предсказывает следующий айтем, как LLM предсказывает следующий токен.
Работает это на удивление хорошо, давайте разбираться почему. На deep tech night на эту тему выступал Алексей Гусаков, CTO бизнес-группы поисковых сервисов и ИИ в Яндексе. На его материале эту эволюцию удобно проследить по шагам.
Примерно 10 лет назад классическая рекомендательная система была конвейером из пяти стадий: сотни вручную сконструированных фичей, десятки отдельных генераторов кандидатов, затем преранк, ранжирование и постранк. Каждая стадия – отдельная модель и часто отдельная команда. Масштабировать такую телегу довольно тяжело.
2019 год – случился первый большой сдвиг. Тогда трансформеры впервые завезли в поиск. Это был всем известный BERT.
Через 4 года, в 2023, та же архитектура докатилась и до рекомендаций. Это был первый скачок в профите, и первое доказательство работоспособности трансформеров. В компании BERT поднял ключевую метрику качества с 0,56 до 0,84 всего за один год. Это куда больше, чем годами давали точечные улучшения в старой каскадной схеме.
Примерно тогда же стрельнул ChatGPT, и в рексис игру вступили настоящие LLM. Идея "будем делать вообще все через одну языковую модель" почти сразу захватила область. Но на практике переход оказался не таким простым. LLM, как мы знаем, довольно капризны в плане инфраструктуры и экономики вычислений.
В 2025 Яндекс выкатил Argus – свою первую модель, которая опиралась на масштабирование по данным и вычислениям, то есть на те самые scaling laws, которые лежат в основе развития современных LLM. Метрика подскочила более чем в два раза: до 1.93. Однако из-за стоимости инференса Argus поначалу использовали точечно, в стадии преранка, а не во всем пайплайне.
Логичный следующий шаг – убрать ручной фича-инжиниринг вообще и сделать end-to-end систему, которая генерирует рекомендации напрямую, без промежуточных каскадов. Именно к такой схеме (история -> единая модель -> рекомендации) весь мир и движется.
Несколько недель назад Яндекс выпускает Sona – одну из первых систем рекомендаций, построенных по такому принципу . Подробный разбор техрепорта мы делали здесь.
По архитектуре это устроено так: трек прогоняется через замороженную мультимодальную LLM, дообучаемый трансформер сжимает его в компактные semantic ID (aka словарные токены для треков), а дальше эти ID предсказываются по истории пользователя и уходят в ранжирующий модуль. Результат по метрике – 4.53. Это рост почти в 2.5 раза относительно Argus и самый большой скачок в истории рексис в самой компании.
Если вынести за скобки компанию, тренд общий: рекомендации повторяют путь поиска и компьютерного зрения и движутся от ручных фичей и десятков моделей к одной системе, растущей на данных и вычислениях. Пока что это дорого и не всегда стабильно, требует перестройки инфраструктуры и огромных вложений на инференс и эксперименты. Зато качество растет не на проценты, а в разы.
❤61👍29🗿19😁7🔥6🤨2👏1🤔1💯1🍾1
arXiv ввел лимит на публикацию статей
С 1 октября пользователь сможет отправить на arXiv не больше двух статей в месяц. Отклоненные модераторами статьи тоже входят в этот лимит.
Причина простая: в сентябре 2024 года на arXiv отправили 20 569 работ, а в сентябре этого года уже 40 363. Категория cs.AI за последние два года выросла больше чем в 6 раз.
В arXiv напрямую связывают часть этого роста с ИИ. Модераторы все чаще сталкиваются с работами, где научной новизны совсем немного, одно исследование искусственно разбито на несколько статей, а значительная часть текста сгенерирована ИИ.
Ограничение пока называют временным: arXiv хочет понять, как вообще должна работать модерация научных публикаций, когда статьи можно генерировать практически без ограничений.
https://blog.arxiv.org/2026/10/01/updated-rate-limit-policy/
С 1 октября пользователь сможет отправить на arXiv не больше двух статей в месяц. Отклоненные модераторами статьи тоже входят в этот лимит.
Причина простая: в сентябре 2024 года на arXiv отправили 20 569 работ, а в сентябре этого года уже 40 363. Категория cs.AI за последние два года выросла больше чем в 6 раз.
В arXiv напрямую связывают часть этого роста с ИИ. Модераторы все чаще сталкиваются с работами, где научной новизны совсем немного, одно исследование искусственно разбито на несколько статей, а значительная часть текста сгенерирована ИИ.
Ограничение пока называют временным: arXiv хочет понять, как вообще должна работать модерация научных публикаций, когда статьи можно генерировать практически без ограничений.
https://blog.arxiv.org/2026/10/01/updated-rate-limit-policy/
👍156❤34😁26🔥8🗿7🕊2🫡2🤯1🤩1🍾1
OpenAI уволили трех рисерчеров из отдела safety: они поделились конфиденциальной информацией с внешней организацией, которая занимается безопасностью ИИ
Ни имена исследователей, ни организация-получатель, ни тип информации не названы. Но компания сообщила, что расследование выявило «паттерн нарушений» в обращении с конфиденциальными данными.
NYT, кстати, совсем недавно писали о том, что OpenAI якобы систематически игнорировала сигналы сотрудников о рисках в тестировании новых моделей на протяжение месяцев до инцидента с Hugging Face.
Ни имена исследователей, ни организация-получатель, ни тип информации не названы. Но компания сообщила, что расследование выявило «паттерн нарушений» в обращении с конфиденциальными данными.
NYT, кстати, совсем недавно писали о том, что OpenAI якобы систематически игнорировала сигналы сотрудников о рисках в тестировании новых моделей на протяжение месяцев до инцидента с Hugging Face.
Ученый из Гарварда придумал, как искать задачи специально под ИИ
Мэтью Шварц, который ранее за две недели написал с Claude полноценную работу по теоретической физике, продолжил эксперимент. На этот раз он решил не заставлять модель работать как ученого, а искать научные задачи, которые хорошо подходят под сильные стороны современных LLM.
Он называет их Claude-shaped problems. Идея в том, что в разных областях науки постоянно встречаются очень похожие математические конструкции, но ученые из одной области могут просто не знать, что нужный метод уже давно существует в другой. А LLM как раз очень хорошо умеют находить такие связи между огромным количеством разрозненной литературы.
Под это Шварц вместе с Claude собрал BootLoops, набор инструментов для точных математических вычислений. Изначально он создавался для теоретической физики, но затем Claude начал находить практически те же задачи в экологии, генетике, экономике, лингвистике и других областях.
Например, в экологии модель нашла уравнение из теории биоразнообразия, которое около 20 лет не умели эффективно считать на больших данных, и решила его методами из математической физики. А в популяционной генетике Claude нашел способ точно вычислить интеграл, который около 30 лет приходилось оценивать приближенно. Это позволило исследователям проверить модель рекомбинации ДНК на огромном массиве генетических данных и обнаружить следы генной конверсии, которые раньше было сложно выделить.
Но тут обнаружилась важная проблема. Claude довольно хорошо находил технически правильные результаты и очень плохо понимал, насколько они вообще интересны для конкретной науки. Шварц несколько раз приносил такие находки профильным специалистам и получал примерно один ответ: технически впечатляет, научно не очень интересно.
Поэтому дальше схема работы стала другой. Claude ищет связи между областями, пишет код, считает и перебирает гипотезы, а профильный ученый определяет, какой вопрос действительно стоит задавать. Так из первоначально неинтересного результата по экологии вместе с экспертом сделали новую модель динамики лесов, а из расчета по генетике пришли к анализу миллиардов пар мутаций.
Шварц считает, что именно здесь современные модели уже могут заметно ускорять науку. Огромный пласт научных задач можно решить не новым методом, а переносом уже существующего метода из другой области.
https://www.anthropic.com/research/claude-shaped-science
Мэтью Шварц, который ранее за две недели написал с Claude полноценную работу по теоретической физике, продолжил эксперимент. На этот раз он решил не заставлять модель работать как ученого, а искать научные задачи, которые хорошо подходят под сильные стороны современных LLM.
Он называет их Claude-shaped problems. Идея в том, что в разных областях науки постоянно встречаются очень похожие математические конструкции, но ученые из одной области могут просто не знать, что нужный метод уже давно существует в другой. А LLM как раз очень хорошо умеют находить такие связи между огромным количеством разрозненной литературы.
Под это Шварц вместе с Claude собрал BootLoops, набор инструментов для точных математических вычислений. Изначально он создавался для теоретической физики, но затем Claude начал находить практически те же задачи в экологии, генетике, экономике, лингвистике и других областях.
Например, в экологии модель нашла уравнение из теории биоразнообразия, которое около 20 лет не умели эффективно считать на больших данных, и решила его методами из математической физики. А в популяционной генетике Claude нашел способ точно вычислить интеграл, который около 30 лет приходилось оценивать приближенно. Это позволило исследователям проверить модель рекомбинации ДНК на огромном массиве генетических данных и обнаружить следы генной конверсии, которые раньше было сложно выделить.
Но тут обнаружилась важная проблема. Claude довольно хорошо находил технически правильные результаты и очень плохо понимал, насколько они вообще интересны для конкретной науки. Шварц несколько раз приносил такие находки профильным специалистам и получал примерно один ответ: технически впечатляет, научно не очень интересно.
Поэтому дальше схема работы стала другой. Claude ищет связи между областями, пишет код, считает и перебирает гипотезы, а профильный ученый определяет, какой вопрос действительно стоит задавать. Так из первоначально неинтересного результата по экологии вместе с экспертом сделали новую модель динамики лесов, а из расчета по генетике пришли к анализу миллиардов пар мутаций.
Шварц считает, что именно здесь современные модели уже могут заметно ускорять науку. Огромный пласт научных задач можно решить не новым методом, а переносом уже существующего метода из другой области.
https://www.anthropic.com/research/claude-shaped-science
❤189👍69🔥39🤔8 8😁6⚡2🎉2🍓2🤝1🫡1
Yandex B2B Tech добавила гибридный поиск: теперь полнотекстовый и векторный индексы можно держать в одной СУБД
YDB — распределённая платформа обработки данных для бизнес-критичных систем. В ней можно хранить и обрабатывать данные, на которых работают корпоративные сервисы и приложения. Теперь в ней появился гибридный поиск, который объединяет два подхода:
Проблема в том, что на практике эти два поиска часто приходится собирать из нескольких компонентов: основная СУБД + поисковый движок + отдельная векторная база. А значит, появляются ETL-пайплайны, синхронизация индексов и ещё одна точка отказа.
В YDB оба индекса реализованы как обычные распределённые таблицы. Они обновляются в рамках одной транзакции вместе с основными данными. Поэтому не возникает ситуации, когда запись уже появилась в основной базе, а поисковый индекс ещё не успел обновиться.
Это особенно важно для RAG-систем и ИИ-ассистентов, где качество ответа напрямую зависит от того, насколько хорошо retrieval достал нужный контекст. Только семантического поиска недостаточно: он может потерять точный номер документа или код. Только keyword search — не всегда поймёт, что два разных запроса описывают одну сущность или ситуацию.
В результате поиск, документы, корпоративные базы знаний, тикеты, каталоги и данные для ИИ-ассистентов можно строить поверх одной системы, не разводя инфраструктуру на несколько специализированных хранилищ, что очень удобно!
⚡15 октября на митапе, вы узнаете, как искать в одной СУБД по смыслу и совпадению и улучшить ответы ИИ-агентов или выдачу рекомендательных систем.
Регистрируйтесь!
YDB — распределённая платформа обработки данных для бизнес-критичных систем. В ней можно хранить и обрабатывать данные, на которых работают корпоративные сервисы и приложения. Теперь в ней появился гибридный поиск, который объединяет два подхода:
– Полнотекстовый индекс работает с точными совпадениями: словами, фразами, номерами и кодами.
– Векторный переводит запросы и данные в представления, по которым можно искать уже не буквальное совпадение, а близость по смыслу.
Проблема в том, что на практике эти два поиска часто приходится собирать из нескольких компонентов: основная СУБД + поисковый движок + отдельная векторная база. А значит, появляются ETL-пайплайны, синхронизация индексов и ещё одна точка отказа.
В YDB оба индекса реализованы как обычные распределённые таблицы. Они обновляются в рамках одной транзакции вместе с основными данными. Поэтому не возникает ситуации, когда запись уже появилась в основной базе, а поисковый индекс ещё не успел обновиться.
Это особенно важно для RAG-систем и ИИ-ассистентов, где качество ответа напрямую зависит от того, насколько хорошо retrieval достал нужный контекст. Только семантического поиска недостаточно: он может потерять точный номер документа или код. Только keyword search — не всегда поймёт, что два разных запроса описывают одну сущность или ситуацию.
В результате поиск, документы, корпоративные базы знаний, тикеты, каталоги и данные для ИИ-ассистентов можно строить поверх одной системы, не разводя инфраструктуру на несколько специализированных хранилищ, что очень удобно!
⚡15 октября на митапе, вы узнаете, как искать в одной СУБД по смыслу и совпадению и улучшить ответы ИИ-агентов или выдачу рекомендательных систем.
Регистрируйтесь!
🗿28😁11❤8😭5🤯3👌3🤨2⚡1🕊1🍓1🫡1
This media is not supported in your browser
VIEW IN TELEGRAM
BridgeMind сделали бенчмарк, чтобы измерять, не ухудшают ли лаборатории модели после релиза
Пользователи чат-ботов и агентов без конца пишут о том, что модели глупеют после своего релиза и/или перед релизом следующей версии. Этот процесс прозвали «нёрф».
Так вот BridgeMind выпустили специальный бенч NerfBench, чтобы ловить такие сдвиги.
Это работает так: в день релиза модель прогоняют по тестам, и этот результат принимают за 100%. Затем ее периодически тестируют заново, измеряя качество, расход токенов и стоимость задачи. Диапазон 90–110% считается нормальным статистическим разбросом, все что ниже 90% уже помечается как подозрительное. Если модели нужно больше токенов или денег на ту же работу, это тоже считается потерей мощности.
Например, многие пользователи сейчас жалуются, что Opus 5.5 стал сильно проседать. И действительно, после очередного замера скор оказался в районе 94% от запуска (да, формально все еще в нормальном диапазоне, но никакие другие модели так не ослабли). В X уже поговаривают, что это означает скорый выход Fable 5.5.
Следить за обновлениями бенчмарка можно здесь: https://bridgebench.ai/nerf-bench
BridgeMind также пообещали выделить $10 000 на финансирование будущих перепроверок: планируются новые модели и более частые замеры.
Пользователи чат-ботов и агентов без конца пишут о том, что модели глупеют после своего релиза и/или перед релизом следующей версии. Этот процесс прозвали «нёрф».
Так вот BridgeMind выпустили специальный бенч NerfBench, чтобы ловить такие сдвиги.
Это работает так: в день релиза модель прогоняют по тестам, и этот результат принимают за 100%. Затем ее периодически тестируют заново, измеряя качество, расход токенов и стоимость задачи. Диапазон 90–110% считается нормальным статистическим разбросом, все что ниже 90% уже помечается как подозрительное. Если модели нужно больше токенов или денег на ту же работу, это тоже считается потерей мощности.
Например, многие пользователи сейчас жалуются, что Opus 5.5 стал сильно проседать. И действительно, после очередного замера скор оказался в районе 94% от запуска (да, формально все еще в нормальном диапазоне, но никакие другие модели так не ослабли). В X уже поговаривают, что это означает скорый выход Fable 5.5.
Следить за обновлениями бенчмарка можно здесь: https://bridgebench.ai/nerf-bench
BridgeMind также пообещали выделить $10 000 на финансирование будущих перепроверок: планируются новые модели и более частые замеры.
1🔥144❤41😁18👍17👏5🕊1💯1😎1
Cloudflare тоже сделали свои версии Jev
Они выпустили Clef и Clef-flash, две открытые decision models (лицензия Apache 2.0, веса на Hugging Face).
Напоминаем, что фишка decision model в том, что она не генерирует текст, а выдает строго типизированные ответы с вероятностями. Это походит для огромного пласта задач типа классификации, скоринга, быстрого принятия решений внутри пайплайнов, маршрутизации и тд. Оригинальный Jev вышел всего пару недель назад, но настолько хайпанул, что за это время свои аналоги навыпускали уже все, включая OpenAI.
Что касается Cloudflare: в отличие от Jev Clef может работать с картинками и ее контекст составляет 64k против 32k. По скорости: медиана у Clef 209 мс, у Clef-flash 39 мс, у Jev 524 мс. По бенчмарку Jev Decision Index Clef тоже лидирует.
Параллельно, кстати, запустили еще RL-платформу, на которой предлагают дообучать Clef под задачи клиентов.
Они выпустили Clef и Clef-flash, две открытые decision models (лицензия Apache 2.0, веса на Hugging Face).
Напоминаем, что фишка decision model в том, что она не генерирует текст, а выдает строго типизированные ответы с вероятностями. Это походит для огромного пласта задач типа классификации, скоринга, быстрого принятия решений внутри пайплайнов, маршрутизации и тд. Оригинальный Jev вышел всего пару недель назад, но настолько хайпанул, что за это время свои аналоги навыпускали уже все, включая OpenAI.
Что касается Cloudflare: в отличие от Jev Clef может работать с картинками и ее контекст составляет 64k против 32k. По скорости: медиана у Clef 209 мс, у Clef-flash 39 мс, у Jev 524 мс. По бенчмарку Jev Decision Index Clef тоже лидирует.
Параллельно, кстати, запустили еще RL-платформу, на которой предлагают дообучать Clef под задачи клиентов.
1⚡71🔥42😁15❤8👍7☃2💘2👏1
Muse Spark от Meta* решила 6 открытых математических задач
Компания опубликовала шесть статей, написанных математиками вместе с моделью. Утверждается, что ученые использовали Muse Spark 1.1 и 1.2 в Thinking Mode через обычный чат meta.ai, без специального харнеса.
Что интересно, в каждой статье даже отмечено, какие фрагменты писали люди, а какие ИИ.
Результаты относятся сразу к нескольким областям математики: теории вероятностей, дифференциальным уравнениям, оптимизации, теории групп, алгебре и арифметической физике.
Например, моделью была опровергнута гипотеза Кида 2024 года: полуабелева группа не обязана быть мономиальной. Также доказано, что радиально-симметричные решения с отрицательной энергией для бигармонического нелинейного диф.уравнения Шредингера коллапсируют за конечное время (вопрос был открыт с 2015 года).
Правда гипотезу Кида в сентябре также опровергла другая группа ученых (кстати, тоже с помощью ИИ-агента). Но Meta утверждает, что их результаты получены независимо.
https://research.meta.ai/blog/solving-open-research-problems-together
Компания опубликовала шесть статей, написанных математиками вместе с моделью. Утверждается, что ученые использовали Muse Spark 1.1 и 1.2 в Thinking Mode через обычный чат meta.ai, без специального харнеса.
Что интересно, в каждой статье даже отмечено, какие фрагменты писали люди, а какие ИИ.
Результаты относятся сразу к нескольким областям математики: теории вероятностей, дифференциальным уравнениям, оптимизации, теории групп, алгебре и арифметической физике.
Например, моделью была опровергнута гипотеза Кида 2024 года: полуабелева группа не обязана быть мономиальной. Также доказано, что радиально-симметричные решения с отрицательной энергией для бигармонического нелинейного диф.уравнения Шредингера коллапсируют за конечное время (вопрос был открыт с 2015 года).
Правда гипотезу Кида в сентябре также опровергла другая группа ученых (кстати, тоже с помощью ИИ-агента). Но Meta утверждает, что их результаты получены независимо.
https://research.meta.ai/blog/solving-open-research-problems-together
😁57❤23👍13🔥5⚡3🍓2