По словам многих пользователей, на сайте DeepSeek появились режимы Instant и Expert. Модели в них ведут себя по-разному.
В Instant используется ускоренная модель, что вполне ожидаемо.
В Expert уже стоит новая модель, ограниченная данными до 2025 года.
Многие успели протестировать её на задачах вроде SVG и логики. В SVG она показывает уровень выше всех текущих китайских моделей, но всё ещё не дотягивает до моделей из американских лабораторий. В логических задачах результат тоже неидеальный, лучше большинства, но уступает США.
Ждём полноценный релиз уже на этой неделе.
Пока официальных объявлений не было.
Сайт DeepSeek.
Следить за выходом можно в их официальном X-аккаунте.
В Instant используется ускоренная модель, что вполне ожидаемо.
В Expert уже стоит новая модель, ограниченная данными до 2025 года.
Многие успели протестировать её на задачах вроде SVG и логики. В SVG она показывает уровень выше всех текущих китайских моделей, но всё ещё не дотягивает до моделей из американских лабораторий. В логических задачах результат тоже неидеальный, лучше большинства, но уступает США.
В остальном модель выглядит современной и, вероятно, подойдёт для школьников из СНГ. Но в некоторых аспектах заметен регресс по сравнению с тем, что было несколько дней назад. — Это 100%
Ждём полноценный релиз уже на этой неделе.
Пока официальных объявлений не было.
Сайт DeepSeek.
Следить за выходом можно в их официальном X-аккаунте.
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔2
GLM-5.1 только сейчас вышла в open-source, но была доступна ещё полторы недели назад.
Похоже, GLM-5.1 лучше всего раскрывается в коде
Все сразу офигели с SWE-Bench Pro.
По их таблице у модели GLM 5.1 больше всех: 58.4 против 57.7 у GPT-5.4 и 57.3 у Opus 4.6.
Как отмечают другие и по моим наблюдениям в X, модель очень хорошо работает с кодовыми базами.
Так это в целом это не удивляет, потому что у GLM код уже давно одна из главных ставок. И вы это всё знаете.
Такие вещи вполне можно натренировать именно под подобные задачи.
Да и в целом ребята делают вид, что у них модель универсальная, хотя по ряду других бенчей она уступает многим конкурентам. Я не со зла.
Например, в GPQA-Diamond у неё 86.2, когда у Gemini 3.1 Pro — 94.3, а у Opus 4.6 — 91.3.
В HLE у GLM-5.1 вообще 31.0 против 39.8 у GPT-5.4 и 45.0 у Gemini 3.1 Pro.
Вообще Z.ai, видимо, пытаются лезть сразу во всё.
Делают и обычные модели, и кодовые, и даже image gen модели. (Где GLM-5-code?)
Пока всё выглядит так, что GLM-5.1 - это в первую очередь сильная модель под код, а не какая-то лучшая нейросеть на всё подряд.
Open-source обнимающее лицо 🤗
Похоже, GLM-5.1 лучше всего раскрывается в коде
Все сразу офигели с SWE-Bench Pro.
По их таблице у модели GLM 5.1 больше всех: 58.4 против 57.7 у GPT-5.4 и 57.3 у Opus 4.6.
Как отмечают другие и по моим наблюдениям в X, модель очень хорошо работает с кодовыми базами.
Так это в целом это не удивляет, потому что у GLM код уже давно одна из главных ставок. И вы это всё знаете.
Такие вещи вполне можно натренировать именно под подобные задачи.
Да и в целом ребята делают вид, что у них модель универсальная, хотя по ряду других бенчей она уступает многим конкурентам. Я не со зла.
Например, в GPQA-Diamond у неё 86.2, когда у Gemini 3.1 Pro — 94.3, а у Opus 4.6 — 91.3.
В HLE у GLM-5.1 вообще 31.0 против 39.8 у GPT-5.4 и 45.0 у Gemini 3.1 Pro.
Вообще Z.ai, видимо, пытаются лезть сразу во всё.
Делают и обычные модели, и кодовые, и даже image gen модели. (Где GLM-5-code?)
Пока всё выглядит так, что GLM-5.1 - это в первую очередь сильная модель под код, а не какая-то лучшая нейросеть на всё подряд.
Open-source обнимающее лицо 🤗
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔2
Светлый Уголок | ии
Помимо Mythos v1, есть ещё и Capybara v2. Capybara (v2) — это продолжение Mythos. Anthropic пошли дальше, продолжили обучать v1, и получилась Capybara. Возможно, её бенчмарки (если они есть) даже выше, чем те, что вы наблюдаете у Mythos на данной картинке.…
Anthropic
Project Glasswing: Securing critical software for the AI era
A new initiative to secure the world’s most critical software and give defenders a durable advantage in the coming AI-driven era of cybersecurity.
Светлый Уголок | ии
Помимо Mythos v1, есть ещё и Capybara v2. Capybara (v2) — это продолжение Mythos. Anthropic пошли дальше, продолжили обучать v1, и получилась Capybara. Возможно, её бенчмарки (если они есть) даже выше, чем те, что вы наблюдаете у Mythos на данной картинке.…
Mythos Preview у Anthropic выглядит очень сильно.
На SWE-bench Pro у неё 77.8% / 53.4% у Opus 4.6.
На Terminal-Bench 2.0 вообще 82.0% / 65.4%.
SWE-bench Verified 93.9% / 80.8%.
Anthropic не выкатила Mythos как обычную модель. Вместо этого они запустили «Project Glasswing» и отдали её партнёрам под кибербезопасность. Сами пишут, что модель уже находила тысячи сильных серверных уязвимостей, включая баги в крупных ОС и браузерах. Это мощно.
Claude Mythos Preview будет доступна участникам по $25 / $125 за миллион входных и выходных токенов.
Кстати, это всё ещё дешевле, чем GPT-5.4 Pro.
Кстати, тот svg — это был mythos. Секрет раскрыт.
На SWE-bench Pro у неё 77.8% / 53.4% у Opus 4.6.
На Terminal-Bench 2.0 вообще 82.0% / 65.4%.
SWE-bench Verified 93.9% / 80.8%.
Anthropic не выкатила Mythos как обычную модель. Вместо этого они запустили «Project Glasswing» и отдали её партнёрам под кибербезопасность. Сами пишут, что модель уже находила тысячи сильных серверных уязвимостей, включая баги в крупных ОС и браузерах. Это мощно.
Claude Mythos Preview будет доступна участникам по $25 / $125 за миллион входных и выходных токенов.
Кстати, это всё ещё дешевле, чем GPT-5.4 Pro.
Это сильный скачок, уверен эта модель работает медленно, но зато очень круто.
Кстати, тот svg — это был mythos. Секрет раскрыт.
А теперь ждем sonnet 5 (или opus 5) в этом месяце.😁
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Не кажется ли вам, что все модели становятся хуже после релиза?
Элита получает лучшие модели, а крестьяне объедки.
Это как начало технологического феодализма. Это к вам господа:🤖 ,🤖 ,🤖 и🤖 .
Элита получает лучшие модели, а крестьяне объедки.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from 🚨 AI News | TestingCatalog (Alexey)
BREAKING 🚨: Meta updated its Meta AI app with a slightly new design as well as its underlying model.
“I am Meta AI, powered by Muse Spark from the Muse model family.”
It constantly refers to the Muse model family and responses seem to be a bit different from earlier tested Avocado models.
Stealth launch 👀
“I am Meta AI, powered by Muse Spark from the Muse model family.”
It constantly refers to the Muse model family and responses seem to be a bit different from earlier tested Avocado models.
Stealth launch 👀
🚨 AI News | TestingCatalog
Photo
Я и ещё несколько человек, и даже Chetas (тот, что из X) уже протестировали эту модель на нескольких задачах.
Модель, хоть и маленькая, но показывает крутые способности в рассуждениях и мыслит очень здраво. Не хуже чем Opus 4.6.
(Нет, это не значит, что она во всём лучше него, читайте внимательнее, на всякий случай.)
Также у модели наблюдаются отличные способности в визуальных рассуждениях: она хорошо видит.
В другом задачах ещё не тестировали.
Модель, хоть и маленькая, но показывает крутые способности в рассуждениях и мыслит очень здраво. Не хуже чем Opus 4.6.
(Нет, это не значит, что она во всём лучше него, читайте внимательнее, на всякий случай.)
Также у модели наблюдаются отличные способности в визуальных рассуждениях: она хорошо видит.
В другом задачах ещё не тестировали.
Светлый Уголок | ии
Я и ещё несколько человек, и даже Chetas (тот, что из X) уже протестировали эту модель на нескольких задачах. Модель, хоть и маленькая, но показывает крутые способности в рассуждениях и мыслит очень здраво. Не хуже чем Opus 4.6. (Нет, это не значит, что…
Компания Meta анонсирует Muse Spark, первую модель MSL, и новый режим размышлений Muse Spark.
Режим размышлений Muse Spark продемонстрировал результат 58,4% в тесте HLE с использованием инструментов.
В коддинге эта модель не показывает хорошие результаты, зато модель достаточно умная.
Источник.
Meta* — признана экстремистской организацией, деятельность которой запрещена на территории Российской Федерации.
Режим размышлений Muse Spark продемонстрировал результат 58,4% в тесте HLE с использованием инструментов.
В коддинге эта модель не показывает хорошие результаты, зато модель достаточно умная.
Источник.
Meta* — признана экстремистской организацией, деятельность которой запрещена на территории Российской Федерации.
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
— Axios
Так же, как и Anthropic с Mythos.
Однако лично у меня большие сомнения насчёт этого.
Please open Telegram to view this post
VIEW IN TELEGRAM
Axios
Scoop: OpenAI plans new product for cybersecurity use
Model-makers are now so worried about the havoc their own tools could cause that they're reluctant to release them into the wild.
Светлый Уголок | ии
Статья была опубликована, но потом сразу же удалена. Хотя, open ai когда-то уже делала так ранее.
🤔1
Кстати, ребята, сегодня ничего не выйдет, в принципе на этой неделе ничего не выйдет.
Gpt image 2 ещё в начале недели стал появляться у некоторых людей.
Хотяяя... Я дейсвительно писал, что GPT Image может выйти на этой неделе — да. Но в начале это было неясно, поэтому я думал так.
OpenAI хотят создать супер-мультимодальную модель, которая будет генерировать видео...
Так что ваша Sora 2, будет перенесена в GPT-модель. (Это мой инсайд, пока не многие имеют понятия, откуда я это взял, и нет, не тот самый Leo).
На мой взгляд, это ответ Gemin Veo4, которая вот-вот могла бы... Блин, стать первой моделью, аналогичной Nano Banana, но с генерацией видео. Но нет. OpenAI явно хочет поторопиться обойти Google.
Так что для Sora 2 потом перенесут свою дату отключения, и естественно, её полностью заменит другая, более умная видео-модель от OpenAI.
Отличной вам недели.🤣
Ну а если выйдет, то я прогадал, но всё равно впринципе очевидно, что не выйдет, не было особых намёков "на сегодня", да и сам сотрудник из OpenAI уже намекнул на релизы на следующих неделях, а не на этой.
Gpt image 2 ещё в начале недели стал появляться у некоторых людей.
(то что сейчас в вебе это v3, на Lm arena индикатор был v5, в a/b тестах - это v3 и v5, но, думаю, что у них есть ещё более новые варианты)
Хотяяя... Я дейсвительно писал, что GPT Image может выйти на этой неделе — да. Но в начале это было неясно, поэтому я думал так.
OpenAI хотят создать супер-мультимодальную модель, которая будет генерировать видео...
Так что ваша Sora 2, будет перенесена в GPT-модель. (Это мой инсайд, пока не многие имеют понятия, откуда я это взял, и нет, не тот самый Leo).
На мой взгляд, это ответ Gemin Veo4, которая вот-вот могла бы... Блин, стать первой моделью, аналогичной Nano Banana, но с генерацией видео. Но нет. OpenAI явно хочет поторопиться обойти Google.
Так что для Sora 2 потом перенесут свою дату отключения, и естественно, её полностью заменит другая, более умная видео-модель от OpenAI.
Отличной вам недели.
Please open Telegram to view this post
VIEW IN TELEGRAM
Светлый Уголок | ии
Кстати, ребята, сегодня ничего не выйдет, в принципе на этой неделе ничего не выйдет. Ну а если выйдет, то я прогадал, но всё равно впринципе очевидно, что не выйдет, не было особых намёков "на сегодня", да и сам сотрудник из OpenAI уже намекнул на релизы…
Ну... Не вышла же ведь. 🤷♂
🤔1