Помните, я писал про «истину» и папку в репозитории? Теперь всё официально — они представили Aletheia.
Цифры и механика (для вашей осведомленности):
• 91.9% на IMO-ProofBench Advanced — новый рекорд. Один из самых жёстких тестов на доказательства в стиле Межнара по математике.
• Движок — Gemini Deep Think. Решение строится в три этапа: генерация → верификация → корректировка.
• При этом работает лучше и дешевле, чем сама Gemini Deep Think Advanced в чистом виде. Агентная обвязка тут реально даёт выигрыш, а не просто обёртка.
Что уже сделала помимо бенчмарков:
— Решила 4 открытых задачи из списка Эрдеша (Эпштейна). Одна из них вообще не была закрыта ни в какой литературе до этого.
— Автономно написала статью с правильными математическими результатами.
— Помогала реальным математикам в написании не-игрушечных научных работ.
Моё мнение:
Google подчёркивают, что Aletheia — пруф того, что законы масштабирования всё ещё работают. Даже на доказательной математике качество растёт не за счёт тупого наращивания параметров, а за счёт архитектуры рассуждений. Умнее агент — лучше результат за меньшие деньги.
Помните папку Aletheia в репозитории superhuman? Я писал, что ждём мощный анонс. Ну вот он.
P.s — Позже сегодня на том же движке вышла обновлённая Gemini 3 Deep Think — набрала 84.6% на ARC-AGI-2, лучший результат на данный момент.
Источники:
— Официальный релиз DeepMind
— Мой пост с инсайдом про superhuman
Кто верил, что задачи Эрдеша закроют настолько быстро? Пишите в комменты.
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2 2 2 2
Forwarded from Нейронавт | Нейросети в творчестве
Итак, тест ARC-AGI-2 пройден Gemini 3 Deep Think
Франсуа Шолле, создатель тестов ARC-AGI, говорит, что уже работает над версией 4. Всего будет около 7 версий.
ARC-AGI-3 выйдет в марте.
ARC-AGI-4 будет связан с играми.
ARC-AGI-5 уже в планах.
ARC-AGI-6 и 7, вероятно, последние версии
Человеки: создают тест на AGI
ИИ: проходит тест
Человеки: создают новый более сложный тест
ИИ: проходит тест
Человеки: да когда же уже AGI?!
#news
Франсуа Шолле, создатель тестов ARC-AGI, говорит, что уже работает над версией 4. Всего будет около 7 версий.
ARC-AGI-3 выйдет в марте.
ARC-AGI-4 будет связан с играми.
ARC-AGI-5 уже в планах.
ARC-AGI-6 и 7, вероятно, последние версии
Человеки: создают тест на AGI
ИИ: проходит тест
Человеки: создают новый более сложный тест
ИИ: проходит тест
Человеки: да когда же уже AGI?!
#news
❤🔥1
Нейронавт | Нейросети в творчестве
Итак, тест ARC-AGI-2 пройден Gemini 3 Deep Think Франсуа Шолле, создатель тестов ARC-AGI, говорит, что уже работает над версией 4. Всего будет около 7 версий. ARC-AGI-3 выйдет в марте. ARC-AGI-4 будет связан с играми. ARC-AGI-5 уже в планах. ARC-AGI…
Шолле планирует 7 версий ARC-AGI.
По сути, человек публично признаёт: чтобы доказать отсутствие AGI, ему нужно ещё минимум 5 попыток. Темп, с которым модели ломают эти бенчмарки, растёт быстрее, чем темп их создания. Математика тут не на стороне скептиков.
Кстати, настоящий ARC-AGI-3 можно попробовать здесь.
Только представьте, что ближе к Марту модели уже смогут проходить его на 20-30% при старте.
Хроники AGI:
ИИ: проходит невозможный тест
Люди: срочно придумывают тест еще сложнее.
Также люди: «Ну тупы-ы-ые!»
А что думаете вы?
#Новости
Подписаться: t.me/Geometry90
По сути, человек публично признаёт: чтобы доказать отсутствие AGI, ему нужно ещё минимум 5 попыток. Темп, с которым модели ломают эти бенчмарки, растёт быстрее, чем темп их создания. Математика тут не на стороне скептиков.
Кстати, настоящий ARC-AGI-3 можно попробовать здесь.
Только представьте, что ближе к Марту модели уже смогут проходить его на 20-30% при старте.
Хроники AGI:
ИИ: проходит невозможный тест
Люди: срочно придумывают тест еще сложнее.
Также люди: «Ну тупы-ы-ые!»
А что думаете вы?
#Новости
Подписаться: t.me/Geometry90
Я просто в шоке от Gemini 3.1 DeepThink и того что она творит 😱
Посмотрите на ASCII арты. Не одна модель не справляется с этим, эта же, просто прекрасно понимает как это делать.
Посмотрите на ASCII арты. Не одна модель не справляется с этим, эта же, просто прекрасно понимает как это делать.
❤🔥5 3
Возможно, они вносят последние корректировки, ожидается, что и Gemini 3.1, и ChatGPT5.3 выйдут на следующей неделе.
А что вы больше всего ждёте?
#Инсайд
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥5 2 1
Сейчас существуют:
• Seed 2 Pro — Для всех задач
• Seed 2 Code — Быстрая, agentic для кода.
• Seed 2 Lite — Упрощённая версия
• Seed 2 Mini — Самая лёгкая версия.
Pro поддерживает глубокое рассуждение (deep reasoning). Модели линейки Seed 2 получили качественную мультимодальность, обработку данных и точный вывод
Даже так, теперь эти модели дешевле ВСЕХ ближайших конкурентов.
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Источник
Судя по всему, DeepSeek V4 выкатят уже на следующей неделе. И походу это первый раз, когда open-source модель реально встаёт вровень с закрытыми Сотами.
Короче, что я хочу сказать.
Я наблюдаю за этим и пока наблюдал у меня сформировалось мнение на этот счёт:
Китайцы не просто догоняют. Они придумывают новые архитектуры, а не тупо заливают всё вычислительной мощностью. DeepSeek — это про умные инженерные решения: модель будет весить сравнительно мало, а контекст держать на уровне 1М токенов. Мы с вами уже смотрели на предполагаемый DeepSeek V4 Lite — даже на неофициальном графике было видно, как он хорошо контекст тянет.
Но. С момента выхода Gemini 3 Pro и Opus 4.5 прошло уже 2–3 месяца. И только щас китайцы подтягиваются к этому уровню.
Gemini 3.0 сама по себе спорная для реальных задач, но разрыв есть — стабильные 2–3 месяца отставания. Сокращают его умными решениями, не скейлингом, но всё равно отстают.
Теперь про главную проблему, о которой мало говорят.
У китайцев нет данных — у Google бесконечный интернет, поиск, ютуб, вся экосистема. У OpenAI партнёрства с кучей издательств. В Китае полтора миллиарда людей и свой интернет, ок, но по объёму и разнообразию это не то же самое что весь западный веб.
И отсюда растёт то, что скоро станет главной войной — юридической. Потому что тот же GLM-5, (Minimax M2.2, Kimi k2.5) — кринж. Модель обучалась на дистиллированных ответах Opus 4.5. Она иногда отвечает что она Claude, а не GLM. Это не слух, это видели кучу людей.
Да, это нечестно. Да, это нарушение условий. Но а что им делать? Данных меньше, доступ к железу порезан санкциями, гонку сливать нельзя. Дистилляция чужих моделей — по сути единственный быстрый способ закрыть разрыв.
Стоит сделать вывод: либо западные компании начнут судиться и закручивать API, либо просто смирятся. Модели в открытом доступе и веса нахуй утекают, этот процесс уже не остановить.
Следующая неделя покажет, на что способен DeepSeek. МНЕ Будет интересно. Вам то самим будет интересно?...
#Новости / #Мысли
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥5
много всякого.Итак, следующая неделя обещает быть по-настоящему крутой и, по сути, заключительной в этом марафоне — потом нас ждет некоторое затишье, как, например, в январе, когда толком ничего не выходило.
У меня на руках есть сводки и инсайды, но перечислять их здесь я не стану. Скажу сразу, чего стоит ожидать. Ниже — список только тех глобальных релизов, которые вы все так ждете и вероятность выхода которых на этой неделе максимальна:
⚪️ DeepSeek v4 (Ждём)⚪️ Gemini Pro 3 GA / 3.1 (фиксики и новые баги, ЖДЁМ)⚪️ Claude Sonnet 5 (Новое поколение от Anthropic, ждём)⚪️ Qwen 3.5 (Ребята сделают полноценный релиз своих небольших версий 3.5 — ждём)⚪️ GPT-5.3 ( Полное обновление флагмана OpenAI, ждём)⚪️ Grok 4.20 (Ну ладно, хотя бы один источник от инсайда представляю)⚪️ Avocado (КТО ЭТО? А это Meta. Ладно, вот ещё источник. Сабку покупайте чтобы почитать, ищите источники с пересказами и так далее. Ждём)
И еще: не факт, что всё выйдет день в день, потому что мы не можем предсказывать будущее — всё может перенестись, так что имейте это в виду.
Meta* — признана экстремистской организацией, деятельность которой запрещена на территории Российской Федерации.
#Щитпост
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔2 1
В сумерках, когда солнце уже скрылось за горизонтом, но его лучи ещё освещали верхние слои атмосферы, выхлоп второй ступени ракеты начал расширяться. Ветра в стратосфере закрутили его в огромную спираль, в кольцо с изящным хвостом — точь-в-точь как логотип Grok от xAI. Если что, это было сделано специально, то есть не случайно, не продумайте там.
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥7
Светлый Уголок | ии
Сколько же релизов должно быть на этой неделе...
Представьте себе плнидельн
Представьте себе плнидельн
😁1
Светлый Уголок | ии
2 новые модели доступны прямо сейчас на их сайте.
— Qwen 3.5-Plus
Последняя крупная языковая модель серии Qwen3.5, поддерживающая текстовые и мультимодальные задачи.
— Qwen 3.5-397B-A17B
Флагманский крупная языковая модель из серии Qwen3.5 с открытым исходным кодом,
поддерживающая текстовые и мультимодальные задачи.
Это ведь даже не Max версия, а модель уже достаточно умная, мне нравиться.
Протестировать
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥1
Что это и с чем это едят? А это не едят — это хавают! Те, кто ждал настоящий Grok 4.20 — вы схавали!
Больше всего драмы — это релиз. Релиз Grok 4.2 значительно задержали. Все ждали его летом–осенью 2025, переносили раз 5–7, задержка около полугода.
И вот что мы получили:
Через HTTPS-запросы было замечено, что в коде Grok 4.20 обозначен как 4.1. Либо воображение играет, либо «крупное обновление» оказалось не таким уж крупным.
Что удалось выявить:
Grok теперь работает как координатор четырёх агентов одновременно для одного ответа. Всего в системе их 16, но назначение каждого пока неясно. Складывается впечатление, что это тот же Grok 4.10 под видом четырёх параллельных агентов. Подробности из комментариев — источник тут.
Похоже, мы получили Grok 4.1 под видом 4.2. Но это бета! Справедливости ради — работает действительно неплохо, SVG рисует заметно лучше чем 4.1.
Хотя сама затея с reasoning в стиле мессенджера, где 4 бота переписываются между собой — выглядит странно.
1⃣ Галлюцинаций НЕ МЕНЬШЕ, путается даже больше чем 4.102⃣ Reasoning с фишкой агентов, которые общаются между собой.3⃣ Скорость чуть ниже чем у 4.1, но качество подросло.4⃣ Зато поиск улучшили! Спасибо, я этому рад. Grok стал ещё лучше искать.
Бенчмарков пока нет.
Напишите в комментариях, что заметили первым делом.
#Новости
Автор — @Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
😁2
Forwarded from 🚨 AI News | TestingCatalog (Alexey)
Google I/O is scheduled for May 19!
Save the date 👀
Save the date 👀
❤🔥3