По данным команды, серия ориентирована на coding и agentic-задачи и показывает сильные результаты во всех размерных классах. Модели на 0,9B, 3,7B и 7B заявлены как новые SOTA для своего масштаба.
IFM выпустили веса, но и код, обучающие данные и рецепты обучения.
Launch: https://ifm.ai/k2/
Tech blog: https://ifm.ai/blog/k2
Hugging Face: https://huggingface.co/collections/IFM/k2-horizon
Please open Telegram to view this post
VIEW IN TELEGRAM
❤10👍8🔥6
Несколько мыслей о релизе GPT-6 Astra.
Сразу оговорка: это выводы по тому, что показала OpenAI. Саму модель я ещё не тестировал.
По опубликованным бенчмаркам Astra выглядит как самый сильный релиз OpenAI за долгое время и серьёзный удар по позициям Anthropic. Особенно заметен скачок в coding, computer use, browser use, математике, работе с таблицами и других сложных прикладных задачах.
Отсюда снова всплыл старый вопрос: можно ли уже называть такие модели AGI?
Единого определения AGI до сих пор нет. Но если понимать general intelligence буквально как способность работать на экспертном уровне сразу в большом числе разных областей, Astra действительно подбирается очень близко к этому описанию.
Astra вышла вскоре после Fable 5.1 и на фоне подготовки Anthropic к IPO. На этом фоне запуск выглядит особенно символично: OpenAI снова пытается вернуть себе лидерство в гонке frontier-моделей.
Насколько хорошо Astra будет справляться с длинными агентными задачами, coding, исследованиями, браузером и компьютером без постоянного контроля человека - станет понятно уже по первым массовым тестам.
И, судя по всему, Astra может быть не последним крупным релизом OpenAI в 2026 году.
Если опубликованные результаты подтвердятся на практике, GPT-6 станет одним из самых заметных скачков в возможностях универсальных AI-моделей за последние годы.
Сразу оговорка: это выводы по тому, что показала OpenAI. Саму модель я ещё не тестировал.
По опубликованным бенчмаркам Astra выглядит как самый сильный релиз OpenAI за долгое время и серьёзный удар по позициям Anthropic. Особенно заметен скачок в coding, computer use, browser use, математике, работе с таблицами и других сложных прикладных задачах.
Отсюда снова всплыл старый вопрос: можно ли уже называть такие модели AGI?
Единого определения AGI до сих пор нет. Но если понимать general intelligence буквально как способность работать на экспертном уровне сразу в большом числе разных областей, Astra действительно подбирается очень близко к этому описанию.
Astra вышла вскоре после Fable 5.1 и на фоне подготовки Anthropic к IPO. На этом фоне запуск выглядит особенно символично: OpenAI снова пытается вернуть себе лидерство в гонке frontier-моделей.
Насколько хорошо Astra будет справляться с длинными агентными задачами, coding, исследованиями, браузером и компьютером без постоянного контроля человека - станет понятно уже по первым массовым тестам.
И, судя по всему, Astra может быть не последним крупным релизом OpenAI в 2026 году.
Если опубликованные результаты подтвердятся на практике, GPT-6 станет одним из самых заметных скачков в возможностях универсальных AI-моделей за последние годы.
1❤17👍9🔥6😱3😢1🤣1
Цена за миллион токенов всё хуже показывает реальную стоимость AI
Токен перестал быть нормальной единицей сравнения моделей.
Две модели могут решить одну и ту же задачу, но одной понадобится 5 000 токенов, а другой - 50 000+. Добавьте разные токенизаторы, скрытые reasoning-токены, tool calls и повторные попытки — и метрика
Для AI-агентов проблема ещё заметнее.
Если первый шаг сгенерировал слишком много текста, этот результат часто становится входом для второго шага, затем попадает в третий, четвёртый и дальше.
Поэтому модель, которая использует в 2 раза больше токенов, может обойтись значительно дороже, чем просто ×2:
- растёт контекст;
- увеличивается latency;
- дорожают следующие reasoning-шаги;
- растут расходы на tool calls и retries.
Чем длиннее агентный workflow, тем важнее token efficiency.
Гораздо полезнее считать:
То есть сравнивать модели не по цене токена, а по стоимости успешно выполненной задачи при нужном качестве.
https://x.com/Machinelearrn/status/2095817451699130868
Токен перестал быть нормальной единицей сравнения моделей.
Две модели могут решить одну и ту же задачу, но одной понадобится 5 000 токенов, а другой - 50 000+. Добавьте разные токенизаторы, скрытые reasoning-токены, tool calls и повторные попытки — и метрика
$ / 1M tokens уже почти ничего не говорит о стоимости реальной работы.Для AI-агентов проблема ещё заметнее.
Если первый шаг сгенерировал слишком много текста, этот результат часто становится входом для второго шага, затем попадает в третий, четвёртый и дальше.
Поэтому модель, которая использует в 2 раза больше токенов, может обойтись значительно дороже, чем просто ×2:
- растёт контекст;
- увеличивается latency;
- дорожают следующие reasoning-шаги;
- растут расходы на tool calls и retries.
Чем длиннее агентный workflow, тем важнее token efficiency.
Гораздо полезнее считать:
полная стоимость модели + reasoning + tools + retries / число успешно выполненных задачТо есть сравнивать модели не по цене токена, а по стоимости успешно выполненной задачи при нужном качестве.
https://x.com/Machinelearrn/status/2095817451699130868
❤16🔥9👍7💯2
Смеяться можно долго: в цене сделки Nvidia по покупке Hugging Face спрятали сразу два пасхальных яйца.
Итоговая сумма - $12,930,300,000.
Если взять первые шесть цифр - 129303 и прочитать их как кодовую точку Unicode, получаем U+1F917. Это эмодзи 🤗, тот самый, который ассоциируется с Hugging Face.
Сооснователь Hugging Face Томас Вулф отдельно намекнул, что в цене сделки спрятаны отсылки сразу к обеим компаниям.
Второе пасхальное яйцо - для Nvidia. Если записать 129303 как HEX-цвет #129303, получится насыщенный зелёный оттенок, очень близкий к фирменному цвету Nvidia.
Почти $13 млрд и даже цифры в ценнике решили использовать не случайно.
Итоговая сумма - $12,930,300,000.
Если взять первые шесть цифр - 129303 и прочитать их как кодовую точку Unicode, получаем U+1F917. Это эмодзи 🤗, тот самый, который ассоциируется с Hugging Face.
Сооснователь Hugging Face Томас Вулф отдельно намекнул, что в цене сделки спрятаны отсылки сразу к обеим компаниям.
Второе пасхальное яйцо - для Nvidia. Если записать 129303 как HEX-цвет #129303, получится насыщенный зелёный оттенок, очень близкий к фирменному цвету Nvidia.
Почти $13 млрд и даже цифры в ценнике решили использовать не случайно.
❤46🤣17👍9🔥7🌭2
⚡️ GLM-5.3 теперь можно запускать в российском облаке
MWS Cloud развернула новую модель Z.аi в собственной инфраструктуре. GLM-5.3 доступна через MWS GPT Model Hub, а запросы и данные пользователей обрабатываются внутри России. При этом цена осталась на уровне GLM-5.2.
GLM-5.3 интересна прежде всего не обычным чатингом, а кодингом и агентными задачами. Модель умеет работать с репозиториями, искать ошибки в коде, выполнять многошаговые задачи и использовать инструменты в длительных последовательностях действий.
Модель доступна через OpenAI-совместимый API, что упрощает ее интеграцию и переключение между моделями.
Z.аi оставила базовую архитектуру от GLM-5.2, а основной прирост качества получила за счёт более масштабирования посттренинга. Веса GLM-5.3 разработчик выпустил не сразу, а примерно через две недели после релиза — за это время модель дополнительно тестировали и проверяли её безопасность.
В задачах программирования Модель стабильно опережает Claude Opus 4.8 и сопоставима с новейшими Claude Fable 5 и GPT-5.6 Sol
@data_analysis_ml / Папка полезного по ML.
MWS Cloud развернула новую модель Z.аi в собственной инфраструктуре. GLM-5.3 доступна через MWS GPT Model Hub, а запросы и данные пользователей обрабатываются внутри России. При этом цена осталась на уровне GLM-5.2.
GLM-5.3 интересна прежде всего не обычным чатингом, а кодингом и агентными задачами. Модель умеет работать с репозиториями, искать ошибки в коде, выполнять многошаговые задачи и использовать инструменты в длительных последовательностях действий.
Модель доступна через OpenAI-совместимый API, что упрощает ее интеграцию и переключение между моделями.
Z.аi оставила базовую архитектуру от GLM-5.2, а основной прирост качества получила за счёт более масштабирования посттренинга. Веса GLM-5.3 разработчик выпустил не сразу, а примерно через две недели после релиза — за это время модель дополнительно тестировали и проверяли её безопасность.
В задачах программирования Модель стабильно опережает Claude Opus 4.8 и сопоставима с новейшими Claude Fable 5 и GPT-5.6 Sol
@data_analysis_ml / Папка полезного по ML.
mws.ru
GPT Model Hub — генеративные модели по API в облаке MWS Cloud Platform
GPT Model Hub — готовые генеративные модели и LLM в MWS Cloud Platform. OpenAI-совместимый API, быстрый инференс. Каталог моделей для создания AI-ассистентов, чат-ботов и AI-приложений
👍8🔥7❤4🥴4
Появились сообщения, что в GPT-6 Astra используется техника recurrent depth - одни и те же Transformer-блоки с общими весами прогоняются несколько раз подряд.
Вместо того чтобы каждый раз добавлять новые слои и параметры, модель может повторно использовать уже существующие блоки и выполнять больше внутреннего вычисления над одним состоянием.
По сути:
hidden state → Transformer block → тот же block → тот же block → результатТакой подход близок к семейству Recurrent Reasoning Models (RRM), которое исследователи активно изучают как способ увеличить глубину рассуждения без пропорционального роста числа параметров.
Интересно, что похожую идею разбирали ещё весной этого года в работе про recurrent reasoning models:
https://arxiv.org/abs/2603.02193
PS: OpenAI публично архитектуру Astra пока не раскрывала, поэтому recurrent depth остаётся сообщаемой, но не подтверждённой компанией особенностью модели.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍13🔥5❤3
Утекли предполагаемые бенчмарки Gemini 4 - цифры выглядят безумно 🤯
В сети разошлась таблица с прогнозируемыми результатами Gemini 4:
- 99,9%+ — ARC-AGI-3
- 99,1% — FrontierMath Tier 4 v2
- 72,8% — Terminal-Bench Science 0.1
- 70,2% — HealthBench Professional
- 62,3% — Terminal-Bench 4.0
- 48,7% — AutomationBench
- 98,6% — BenchCAD
В этой таблице Gemini 4 опережает GPT-6 Astra и Fable 5.1 на всех перечисленных тестах. Особенно сильный скачок якобы приходится на математику, scientific reasoning, работу в терминале и agentic-задачи.
Сам Gemini 4 реален: Google уже подтвердил, что запустил для него свой «самый амбициозный pre-training run» на сегодняшний день.
В сети разошлась таблица с прогнозируемыми результатами Gemini 4:
- 99,9%+ — ARC-AGI-3
- 99,1% — FrontierMath Tier 4 v2
- 72,8% — Terminal-Bench Science 0.1
- 70,2% — HealthBench Professional
- 62,3% — Terminal-Bench 4.0
- 48,7% — AutomationBench
- 98,6% — BenchCAD
В этой таблице Gemini 4 опережает GPT-6 Astra и Fable 5.1 на всех перечисленных тестах. Особенно сильный скачок якобы приходится на математику, scientific reasoning, работу в терминале и agentic-задачи.
Сам Gemini 4 реален: Google уже подтвердил, что запустил для него свой «самый амбициозный pre-training run» на сегодняшний день.
😁48❤20🤣15👍7🔥5
DeepSeek хочет закупить около 160 000 ускорителей Huawei Ascend для своего огромного дата-центра во Внутренней Монголии.
Если заказ реализуют, это будет крупнейший кластер Huawei для AI.
По данным Bloomberg:
- Ascend планируют использовать в основном для inference
- обучение крупных моделей DeepSeek по-прежнему рассчитывает проводить на NVIDIA
- производство такого объёма чипов может занять больше года
- главный ограничитель сейчас - не спрос, а производственные мощности Huawei
DeepSeek, судя по всему, хочет ещё больше ускорителей, но Huawei пока физически не может выпускать их в нужных объёмах.
Это хорошо показывает, как быстро в Китае растёт отдельная инфраструктура для AI inference на локальных чипах.
https://www.bloomberg.com/news/articles/2026-09-04/deepseek-plans-big-huawei-ai-chip-order-to-power-new-data-center
Если заказ реализуют, это будет крупнейший кластер Huawei для AI.
По данным Bloomberg:
- Ascend планируют использовать в основном для inference
- обучение крупных моделей DeepSeek по-прежнему рассчитывает проводить на NVIDIA
- производство такого объёма чипов может занять больше года
- главный ограничитель сейчас - не спрос, а производственные мощности Huawei
DeepSeek, судя по всему, хочет ещё больше ускорителей, но Huawei пока физически не может выпускать их в нужных объёмах.
Это хорошо показывает, как быстро в Китае растёт отдельная инфраструктура для AI inference на локальных чипах.
https://www.bloomberg.com/news/articles/2026-09-04/deepseek-plans-big-huawei-ai-chip-order-to-power-new-data-center
🔥12👍6🥰3
This media is not supported in your browser
VIEW IN TELEGRAM
GPT-6 Astra не та модель, разработку которой OpenAI приостановила из-за опасений по кибербезопасности. Речь шла о будущей модели.
«Обучение Astra завершилось уже некоторое время назад. Модель, о приостановке которой мы недавно говорили, это будущая модель. Но Astra уже достигла уровня cyber-critical.»
Источник: YouTube-канал Bloomberg Television, полное видео - в комментариях.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣34👍7🔥6❤4🥴2
Слух о том, что Anthropic могла решить одну из задач тысячелетия, становится всё интереснее.
Несколько часов назад Теренс Тао отдельно разобрал сценарий, где AI самостоятельно находит решение задачи глобальной регулярности уравнений Навье-Стокса, но почти весь путь к доказательству остаётся скрытым внутри закрытой системы.
Математически задача может быть решена, но если человечество увидит только финальный ответ без цепочки неудачных подходов, обходных путей и новых идей, сама область может получить от этого гораздо меньше пользы.
Пока подтверждённого решения Навье-Стокса нет, задача официально остаётся открытой. Но совпадение по времени выглядит очень любопытно.
Несколько часов назад Теренс Тао отдельно разобрал сценарий, где AI самостоятельно находит решение задачи глобальной регулярности уравнений Навье-Стокса, но почти весь путь к доказательству остаётся скрытым внутри закрытой системы.
Математически задача может быть решена, но если человечество увидит только финальный ответ без цепочки неудачных подходов, обходных путей и новых идей, сама область может получить от этого гораздо меньше пользы.
Пока подтверждённого решения Навье-Стокса нет, задача официально остаётся открытой. Но совпадение по времени выглядит очень любопытно.
👍19🔥8🤣5❤4🤨2⚡1
🚀 Thinking Machines Lab Миры Мурати уже обсуждает новый раунд инвестиций с оценкой около $40 млрд - менее чем через два года после запуска.
Стартап при этом уже генерирует как минимум
несколько сотен миллионов долларов годовой выручки в пересчёте на текущий темп.
Если сделка состоится, это будет одна из самых высоких оценок среди молодых AI-компаний.
https://www.theinformation.com/articles/thinking-machines-lab-talks-raise-billions-roughly-40-billion-valuation
Стартап при этом уже генерирует как минимум
несколько сотен миллионов долларов годовой выручки в пересчёте на текущий темп.
Если сделка состоится, это будет одна из самых высоких оценок среди молодых AI-компаний.
https://www.theinformation.com/articles/thinking-machines-lab-talks-raise-billions-roughly-40-billion-valuation
👍8❤4🤣3🔥2
🤖 Подключать AI-агента к каждому мессенджеру отдельно - обычно боль из разных API, токенов, настроек и коннекторов.
dsh-im решает это одним плагином для DeepSeek Harness.
Он позволяет подключить локального агента сразу к 9 платформам:
* Telegram
* Slack
* Discord
* WhatsApp
* WeChat
* Feishu
* DingTalk
* WeCom
* QQ
Настройка может идти через QR-код, App Manifest или обычные credentials — из одного интерфейса.
Что ещё умеет:
* несколько ботов на одном канале;
* отдельные workspace и session bindings;
* стриминг ответов;
* отображение thinking/tool progress там, где это поддерживается;
* отправка изображений и файлов;
* выбор Agent Preset для каждого бота;
* тест подключения прямо из панели.
Полезно, если нужно быстро встроить локального AI-агента в уже существующие рабочие чаты команды.
Open source, MIT.
https://github.com/xmanrui/dsh-im
dsh-im решает это одним плагином для DeepSeek Harness.
Он позволяет подключить локального агента сразу к 9 платформам:
* Telegram
* Slack
* Discord
* Feishu
* DingTalk
* WeCom
Настройка может идти через QR-код, App Manifest или обычные credentials — из одного интерфейса.
Что ещё умеет:
* несколько ботов на одном канале;
* отдельные workspace и session bindings;
* стриминг ответов;
* отображение thinking/tool progress там, где это поддерживается;
* отправка изображений и файлов;
* выбор Agent Preset для каждого бота;
* тест подключения прямо из панели.
Полезно, если нужно быстро встроить локального AI-агента в уже существующие рабочие чаты команды.
Open source, MIT.
https://github.com/xmanrui/dsh-im
👍12🔥8❤5
⚡ Tencent открыла TeamAI-CLI - общую память для ИИ-агентов команды
Инструмент собирает навыки, правила, документацию, MCP и накопленный опыт в одном Git-репозитории.
* изменения проходят через Merge Request
* после слияния обновления автоматически загружаются в следующей сессии
* полезные решения получают рейтинг и чаще попадают в контекст
* знания можно искать по проектам и кодовой базе
* поддерживаются Claude Code, Codex, Cursor, OpenCode, CodeBuddy и WorkBuddy
Найденный одним разработчиком способ исправить сложный баг можно закрепить как стандарт для всех агентов команды.
https://github.com/Tencent/teamai-cli
Инструмент собирает навыки, правила, документацию, MCP и накопленный опыт в одном Git-репозитории.
* изменения проходят через Merge Request
* после слияния обновления автоматически загружаются в следующей сессии
* полезные решения получают рейтинг и чаще попадают в контекст
* знания можно искать по проектам и кодовой базе
* поддерживаются Claude Code, Codex, Cursor, OpenCode, CodeBuddy и WorkBuddy
Найденный одним разработчиком способ исправить сложный баг можно закрепить как стандарт для всех агентов команды.
https://github.com/Tencent/teamai-cli
👍13🔥7❤6🤔1
Qwen вместе с Taobao & Tmall и сделала E-Commerce Bench, где агенту дают 100 тысяч юаней и 365 виртуальных дней. Он изучает категории, торгуется с поставщиками, назначает цены, следит за календарём распродаж, тянет склад и контролирует денежные потоки, причём одновременно может вести до четырёх магазинов.
Ни потолок спроса, ни себестоимость ему не показаны - до всего нужно докопаться самому.
Рабочий день идёт с 8 утра до 6 вечера, и каждый вызов инструмента тратит время: проверить деньги (10 минут), открыть магазин (60), написать поставщику (30).
Расходы списываются сразу, а выручка идёт через комиссию, эскроу, 9 дней ожидания и ручной вывод.
Склад сводится посуточно, товар, не отправленный за двое суток, отменяется, а репутация напрямую множит спрос: магазин на дне её шкалы получает 15% от обычного трафика.
Если бы роль поставщика играла языковая модель, одна и та же стратегия давала бы разные цены, а бенч превратился бы в соревнование по джейлбрейку. Поэтому все уступки и отказы считает жёсткий алгоритм, а модель лишь переводит его решения в речь на виртуальных переговорах.
GPT-5.6 Sol - лидер, он закончил год с 1,43 млн юаней, увеличив капитал в 14,3 раза.
Qwen3.8-Max-Preview - лучшая среди моделей с открытыми весами, на конец года у нее было 416 тыс. юаней
Qwen3.5-Plus остался с 1100 юанями.
Кстати, 10 циклов из 90 закончились банкротством, и сценарий почти всегда один - забить склад в январе и не суметь распродать.
Торговаться толком не научился никто.
До себестоимости поставщика не додавил ни один агент. Единственный, кто хоть как-то сбивал цену - Opus 4.7, но по настроению.
Исключение - Qwen3.8-Max-Preview, которая продавливает цену ниже на повторных заказах.
С мошенниками вышло интереснее всего.
Их в реестре 152 из 576 (26,4%), они пишут всем моделям, но у Opus 4.7 деньги получили 4% тех мошенников, с кем он заговорил, у GPT-5.6 Sol - 31,7%.
ИИ-предприниматели категорически не умеют распоряжаться рабочим временем.
Отправки, переходы на следующий день, вывод наличных и выкладка товара съедают 71,8% всех вызовов. На разговоры с поставщиками приходится 6%. На пересмотр цен 0,66%.
Модели заняты обслуживанием процесса, а не экономикой.
Отсюда странность в рейтинге эффективности. Fable5 зарабатывает 479 юаней на вызов против 363 у Sol, тратя при этом почти вдвое меньше вызовов, а по итоговым деньгам идёт позади.
Измерять обучение на длинной дистанции сложно, но тут у бенча есть линейка.
Ядро переговоров никогда не уходит ниже собственной себестоимости, значит лучшая цена, которую агент однажды выбил, - это верхняя граница того, за сколько поставщик готов отдать товар. Дальше можно сравнивать - следующая закупка у того же поставщика прошла дешевле или дороже уже достигнутого.
На 8647 повторных покупок улучшили свой же результат только 2 модели из 18, а 15 переплачивали настолько, что промахивались мимо случайного порядка больше чем на 2 стандартных отклонения.
#AI #ML #Agents #ECommerce #Benchmark #Qwen
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥12❤8👍5