MiniMax M2.5 vs GLM-5.
Официально вышли 2 (а точнее 3) мощные китайские модели сегодня!
Китайские лаборатории явно решили завалить рынок релизами перед праздниками.
К гонке присоединились MiniMax M2.5, GLM-5 и долгожданное обновление от DeepSeek, deepseek V4 (видимо пока lite).
MiniMax M2.5 лидирует во фронтенде. Он идеально подходит для создания сайтов и работы с визуальными элементами. Как видно по SVG-тесту с пеликаном на велосипеде, MiniMax справился чище.
GLM-5 также хорош в верстке, но его истинная сила — в сложном программировании. Используйте его для написания чистого кода и в качестве умного агента. Это мощная и гибкая модель для серьезных задач.
Пока информации о Deepseek V4 lite (наверное) ещё нет, как и инфы о бенчмарках всех этих моделей.
#Новости / #Мысли
Подписаться: t.me/Geometry90
Официально вышли 2 (а точнее 3) мощные китайские модели сегодня!
Китайские лаборатории явно решили завалить рынок релизами перед праздниками.
К гонке присоединились MiniMax M2.5, GLM-5 и долгожданное обновление от DeepSeek, deepseek V4 (видимо пока lite).
MiniMax M2.5 лидирует во фронтенде. Он идеально подходит для создания сайтов и работы с визуальными элементами. Как видно по SVG-тесту с пеликаном на велосипеде, MiniMax справился чище.
GLM-5 также хорош в верстке, но его истинная сила — в сложном программировании. Используйте его для написания чистого кода и в качестве умного агента. Это мощная и гибкая модель для серьезных задач.
Пока информации о Deepseek V4 lite (наверное) ещё нет, как и инфы о бенчмарках всех этих моделей.
#Новости / #Мысли
Подписаться: t.me/Geometry90
❤🔥3
Светлый Уголок | ии
Сегодня кажись, произошло массовое увольнение/уход сотрудников из xAI. За сегодняшний день я увидел около 10, нет 20+ постов об уходе сотрудников xAI. На деле за последние 48 часов ещё и два ко-фаундера подряд свалили. И ещё 20 человек с лишним. Причины…
Причина раскрыта. Моё видение ситуации:
Сотрудники получили долгосрочные выплаты за свою тяжелую работу, и, судя по всему, сумма их не впечатлила.
Вторая версия — уход был спланирован заранее ради создания собственного стартапа. Команда пошла на этот шаг, понимая, что у xAI сейчас туманное будущее, и перспектив там значительно меньше, чем в собственном проекте.
Я склоняюсь к первому.
Один из разработчиков, Дев Шах, открыто написал, что в xAI «не самая лучшая еда».
В мире бигтеха «еда» — это не просто обеды, это метафора базового обеспечения и зарплаты. Видимо, условия перестали соответствовать нагрузке.
Вот так вот. Согласны?
#Мысли / #Новости
Подписаться: t.me/Geometry90
Сотрудники получили долгосрочные выплаты за свою тяжелую работу, и, судя по всему, сумма их не впечатлила.
Вторая версия — уход был спланирован заранее ради создания собственного стартапа. Команда пошла на этот шаг, понимая, что у xAI сейчас туманное будущее, и перспектив там значительно меньше, чем в собственном проекте.
Я склоняюсь к первому.
Один из разработчиков, Дев Шах, открыто написал, что в xAI «не самая лучшая еда».
В мире бигтеха «еда» — это не просто обеды, это метафора базового обеспечения и зарплаты. Видимо, условия перестали соответствовать нагрузке.
Вот так вот. Согласны?
#Мысли / #Новости
Подписаться: t.me/Geometry90
👍2
Это мощь!!! Вот даты выхода Seedance 2, там ещё PRO-версия будет!
Оказывается, всё это время (и это подтвердилось) мы использовали обычную версию Seedance 2.0.
Никто даже не знает, на что реально способна Seedance 2.0 Pro и какие крутые штуки на ней уже успели наворотить...
Это жесть...
График релизов:
• 14 февраля: Seed-2.0-mini
• 24 февраля: Seedance-2.0-pro
• 24 февраля: Seedance-2.0-pro-fast
• 24 февраля: Seedream-5.0
#Новости
Подписаться: t.me/Geometry90
Оказывается, всё это время (и это подтвердилось) мы использовали обычную версию Seedance 2.0.
Никто даже не знает, на что реально способна Seedance 2.0 Pro и какие крутые штуки на ней уже успели наворотить...
Это жесть...
График релизов:
• 14 февраля: Seed-2.0-mini
• 24 февраля: Seedance-2.0-pro
• 24 февраля: Seedance-2.0-pro-fast
• 24 февраля: Seedream-5.0
#Новости
Подписаться: t.me/Geometry90
👍2
Сначала я посмотрел на этот пост и подумал: ха-ха, они прикалываются?
Зашёл в Gemini app, дал промт «Create a pelican on a bike svg» и получил это...
Эмм... Ну бля, вы понимаете, да? Вам на подписке Pro не Pro, а втирают ебаную, извините меня, дичь.
Вы понимаете, на что готовы пойти Google? Я не вдупляю, в чем прикол, но вы должны обратить внимание: в Gemini app сейчас засунули максимально кастрированные Gemini 3 Pro и Flash. Это просто пиздец...
Теория о том, что Google может ослаблять свои модели теперь официально доказана.
#Мысли / #Новости
Зашёл в Gemini app, дал промт «Create a pelican on a bike svg» и получил это...
Эмм... Ну бля, вы понимаете, да? Вам на подписке Pro не Pro, а втирают ебаную, извините меня, дичь.
Вы понимаете, на что готовы пойти Google? Я не вдупляю, в чем прикол, но вы должны обратить внимание: в Gemini app сейчас засунули максимально кастрированные Gemini 3 Pro и Flash. Это просто пиздец...
Теория о том, что Google может ослаблять свои модели теперь официально доказана.
#Мысли / #Новости
🤔1
На сайте Artificial Analysis засветилось упоминание Gemini 3.1 Preview.
Хм.
Это реально первый раз, когда Google выкатывает промежуточную «x.1» в таком формате. Раньше такого не было. Выглядит как попытка закрыть дыры в репутации после того, как 3 Pro так и не вышла из превью нормально.
И тут есть мысль. Gemini 3 Pro в последнее время стала работать заметно слабее. Совпадение? Возможно нет. Ослабили старую, чтобы новая 3.1 выглядела как серьёзный апгрейд. Вопросы есть.
Источник
#Новости / #Инсайд
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥3
А если быть честным, то модель уже замечена в продуктах Google.
Это будет быстрое внедрение. Если не сегодня, то завтра, но это случится уже на этой неделе.
Источник
Также OpenAI тоже должна выпустить свой продукт — это либо GPT-5.3, либо музыкальная модель. Но Google тоже припасла свою собственную модель, про которую все забыли — Lyria 2/3.
#Новости
Подписаться: t.me/Geometry90
Это будет быстрое внедрение. Если не сегодня, то завтра, но это случится уже на этой неделе.
Источник
Также OpenAI тоже должна выпустить свой продукт — это либо GPT-5.3, либо музыкальная модель. Но Google тоже припасла свою собственную модель, про которую все забыли — Lyria 2/3.
#Новости
Подписаться: t.me/Geometry90
Извините, я не много не успеваю, поэтому заново опубликую некоторые посты сегодня, что бы улучшить качество поставки новостей.
👌3
https://t.me/Geometry903/3
Создал временную группу.
https://t.me/Geometry903
https://t.me/Geometry903
https://t.me/Geometry903
Там выложу свежие посты, которые ещё нигде не публиковались — у каждого два варианта. Надо выбрать, какой заходит лучше.
Зачем? — Адаптация.
Хочу понять, как вам удобнее читать — развёрнуто с моими мыслями или коротко по фактам. Ваши голоса реально повлияют на формат ЭТОГО канала.
Как это работает:
Вы оцениваете так, как вам хочется. Ну, думаю вы поймёте в чем суть этих 2 постов.
После этого все посты выйдут здесь в основном канале. Но один важный пост выложу сегодня сюда отдельно — не пропустите.
#Щитпост
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegram
Черный уголёк — временный канал.
Проголосуйте какой вариант лучше в опроснике, опросы анонимные.
Поставьте оценку этому посту с помощью 2 доступных всем реакций:
👍 Ок 👎 Не ок
Спасибо за оценку!
Поставьте оценку этому посту с помощью 2 доступных всем реакций:
👍 Ок 👎 Не ок
Спасибо за оценку!
👍2
IMO-ProofBench Advanced — самый жёсткий тест.
Я всегда говорил — у Google есть модели помощнее. Они либо экономили, либо делали кое-что другое. Пока OpenAI выкатывали версию за версией и набирали по 7%... 28%... 35%... — DeepMind тихо собирали агентную систему, которая выдала 92% и попутно решила несколько открытых задач Эрдёша. Задач, которые люди не могли закрыть годами.
Три месяца между GPT-5.1 (7%) и Aletheia (92%). Это не конкуренция — это демонстрация того, что Google просто ждали момента. И дождались.
Источники:
— Официальный релиз DeepMind
— Мой пост с тем инсайдом
Источник
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥3
Важная иформация о модели:
• Скорость: 50–100 tps
• SWE-Bench Verified: 80.2
• Фронтенд: отлично / Бэкенд: удовлетворительно
• Заточена под агенты, кодинг, поиск, tool use.
Честно:
По бенчмаркам она обходит кучу топовых моделей. На бумаге — уровень Claude 4.5 Opus. Но на практике уступает, и это нормально, потому что бенчмарки и реальные задачи это две разные вещи. Зато дешевле в 10–20 раз. А для многих задач этого хватает с головой!!!
Источники:
— Юзать официально.
— Официальный релиз: пост от @MiniMax_AI.
— Первый спот: где её заметили до анонса.
— Мини критика и сравнение с GLM-5
Моё мнение по китайским моделям в целом: Догоняют, местами обгоняют, и темп у них бешеный. Но пока не хватает стабильности на длинных задачах и репутации. Большие компании всё ещё боятся ставить на них в проде, и их можно понять.
Но если так пойдёт дальше — через полгода разговор будет уже другой.
Кто пробовал через их агент? Как ощущения на реальных задачах? Пишите в комменты.
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥1 1 1 1
Помните, я писал про «истину» и папку в репозитории? Теперь всё официально — они представили Aletheia.
Цифры и механика (для вашей осведомленности):
• 91.9% на IMO-ProofBench Advanced — новый рекорд. Один из самых жёстких тестов на доказательства в стиле Межнара по математике.
• Движок — Gemini Deep Think. Решение строится в три этапа: генерация → верификация → корректировка.
• При этом работает лучше и дешевле, чем сама Gemini Deep Think Advanced в чистом виде. Агентная обвязка тут реально даёт выигрыш, а не просто обёртка.
Что уже сделала помимо бенчмарков:
— Решила 4 открытых задачи из списка Эрдеша (Эпштейна). Одна из них вообще не была закрыта ни в какой литературе до этого.
— Автономно написала статью с правильными математическими результатами.
— Помогала реальным математикам в написании не-игрушечных научных работ.
Моё мнение:
Google подчёркивают, что Aletheia — пруф того, что законы масштабирования всё ещё работают. Даже на доказательной математике качество растёт не за счёт тупого наращивания параметров, а за счёт архитектуры рассуждений. Умнее агент — лучше результат за меньшие деньги.
Помните папку Aletheia в репозитории superhuman? Я писал, что ждём мощный анонс. Ну вот он.
P.s — Позже сегодня на том же движке вышла обновлённая Gemini 3 Deep Think — набрала 84.6% на ARC-AGI-2, лучший результат на данный момент.
Источники:
— Официальный релиз DeepMind
— Мой пост с инсайдом про superhuman
Кто верил, что задачи Эрдеша закроют настолько быстро? Пишите в комменты.
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2 2 2 2
Forwarded from Нейронавт | Нейросети в творчестве
Итак, тест ARC-AGI-2 пройден Gemini 3 Deep Think
Франсуа Шолле, создатель тестов ARC-AGI, говорит, что уже работает над версией 4. Всего будет около 7 версий.
ARC-AGI-3 выйдет в марте.
ARC-AGI-4 будет связан с играми.
ARC-AGI-5 уже в планах.
ARC-AGI-6 и 7, вероятно, последние версии
Человеки: создают тест на AGI
ИИ: проходит тест
Человеки: создают новый более сложный тест
ИИ: проходит тест
Человеки: да когда же уже AGI?!
#news
Франсуа Шолле, создатель тестов ARC-AGI, говорит, что уже работает над версией 4. Всего будет около 7 версий.
ARC-AGI-3 выйдет в марте.
ARC-AGI-4 будет связан с играми.
ARC-AGI-5 уже в планах.
ARC-AGI-6 и 7, вероятно, последние версии
Человеки: создают тест на AGI
ИИ: проходит тест
Человеки: создают новый более сложный тест
ИИ: проходит тест
Человеки: да когда же уже AGI?!
#news
❤🔥1
Нейронавт | Нейросети в творчестве
Итак, тест ARC-AGI-2 пройден Gemini 3 Deep Think Франсуа Шолле, создатель тестов ARC-AGI, говорит, что уже работает над версией 4. Всего будет около 7 версий. ARC-AGI-3 выйдет в марте. ARC-AGI-4 будет связан с играми. ARC-AGI-5 уже в планах. ARC-AGI…
Шолле планирует 7 версий ARC-AGI.
По сути, человек публично признаёт: чтобы доказать отсутствие AGI, ему нужно ещё минимум 5 попыток. Темп, с которым модели ломают эти бенчмарки, растёт быстрее, чем темп их создания. Математика тут не на стороне скептиков.
Кстати, настоящий ARC-AGI-3 можно попробовать здесь.
Только представьте, что ближе к Марту модели уже смогут проходить его на 20-30% при старте.
Хроники AGI:
ИИ: проходит невозможный тест
Люди: срочно придумывают тест еще сложнее.
Также люди: «Ну тупы-ы-ые!»
А что думаете вы?
#Новости
Подписаться: t.me/Geometry90
По сути, человек публично признаёт: чтобы доказать отсутствие AGI, ему нужно ещё минимум 5 попыток. Темп, с которым модели ломают эти бенчмарки, растёт быстрее, чем темп их создания. Математика тут не на стороне скептиков.
Кстати, настоящий ARC-AGI-3 можно попробовать здесь.
Только представьте, что ближе к Марту модели уже смогут проходить его на 20-30% при старте.
Хроники AGI:
ИИ: проходит невозможный тест
Люди: срочно придумывают тест еще сложнее.
Также люди: «Ну тупы-ы-ые!»
А что думаете вы?
#Новости
Подписаться: t.me/Geometry90