⚡️ GLM-5.3 теперь можно запускать в российском облаке
MWS Cloud развернула новую модель Z.аi в собственной инфраструктуре. GLM-5.3 доступна через MWS GPT Model Hub, а запросы и данные пользователей обрабатываются внутри России. При этом цена осталась на уровне GLM-5.2.
GLM-5.3 интересна прежде всего не обычным чатингом, а кодингом и агентными задачами. Модель умеет работать с репозиториями, искать ошибки в коде, выполнять многошаговые задачи и использовать инструменты в длительных последовательностях действий.
Модель доступна через OpenAI-совместимый API, что упрощает ее интеграцию и переключение между моделями.
Z.аi оставила базовую архитектуру от GLM-5.2, а основной прирост качества получила за счёт более масштабирования посттренинга. Веса GLM-5.3 разработчик выпустил не сразу, а примерно через две недели после релиза — за это время модель дополнительно тестировали и проверяли её безопасность.
В задачах программирования Модель стабильно опережает Claude Opus 4.8 и сопоставима с новейшими Claude Fable 5 и GPT-5.6 Sol
@data_analysis_ml / Папка полезного по ML.
MWS Cloud развернула новую модель Z.аi в собственной инфраструктуре. GLM-5.3 доступна через MWS GPT Model Hub, а запросы и данные пользователей обрабатываются внутри России. При этом цена осталась на уровне GLM-5.2.
GLM-5.3 интересна прежде всего не обычным чатингом, а кодингом и агентными задачами. Модель умеет работать с репозиториями, искать ошибки в коде, выполнять многошаговые задачи и использовать инструменты в длительных последовательностях действий.
Модель доступна через OpenAI-совместимый API, что упрощает ее интеграцию и переключение между моделями.
Z.аi оставила базовую архитектуру от GLM-5.2, а основной прирост качества получила за счёт более масштабирования посттренинга. Веса GLM-5.3 разработчик выпустил не сразу, а примерно через две недели после релиза — за это время модель дополнительно тестировали и проверяли её безопасность.
В задачах программирования Модель стабильно опережает Claude Opus 4.8 и сопоставима с новейшими Claude Fable 5 и GPT-5.6 Sol
@data_analysis_ml / Папка полезного по ML.
mws.ru
GPT Model Hub — генеративные модели по API в облаке MWS Cloud Platform
GPT Model Hub — готовые генеративные модели и LLM в MWS Cloud Platform. OpenAI-совместимый API, быстрый инференс. Каталог моделей для создания AI-ассистентов, чат-ботов и AI-приложений
👍8🔥7❤4🥴4
Появились сообщения, что в GPT-6 Astra используется техника recurrent depth - одни и те же Transformer-блоки с общими весами прогоняются несколько раз подряд.
Вместо того чтобы каждый раз добавлять новые слои и параметры, модель может повторно использовать уже существующие блоки и выполнять больше внутреннего вычисления над одним состоянием.
По сути:
hidden state → Transformer block → тот же block → тот же block → результатТакой подход близок к семейству Recurrent Reasoning Models (RRM), которое исследователи активно изучают как способ увеличить глубину рассуждения без пропорционального роста числа параметров.
Интересно, что похожую идею разбирали ещё весной этого года в работе про recurrent reasoning models:
https://arxiv.org/abs/2603.02193
PS: OpenAI публично архитектуру Astra пока не раскрывала, поэтому recurrent depth остаётся сообщаемой, но не подтверждённой компанией особенностью модели.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍14🔥5❤3
Утекли предполагаемые бенчмарки Gemini 4 - цифры выглядят безумно 🤯
В сети разошлась таблица с прогнозируемыми результатами Gemini 4:
- 99,9%+ — ARC-AGI-3
- 99,1% — FrontierMath Tier 4 v2
- 72,8% — Terminal-Bench Science 0.1
- 70,2% — HealthBench Professional
- 62,3% — Terminal-Bench 4.0
- 48,7% — AutomationBench
- 98,6% — BenchCAD
В этой таблице Gemini 4 опережает GPT-6 Astra и Fable 5.1 на всех перечисленных тестах. Особенно сильный скачок якобы приходится на математику, scientific reasoning, работу в терминале и agentic-задачи.
Сам Gemini 4 реален: Google уже подтвердил, что запустил для него свой «самый амбициозный pre-training run» на сегодняшний день.
В сети разошлась таблица с прогнозируемыми результатами Gemini 4:
- 99,9%+ — ARC-AGI-3
- 99,1% — FrontierMath Tier 4 v2
- 72,8% — Terminal-Bench Science 0.1
- 70,2% — HealthBench Professional
- 62,3% — Terminal-Bench 4.0
- 48,7% — AutomationBench
- 98,6% — BenchCAD
В этой таблице Gemini 4 опережает GPT-6 Astra и Fable 5.1 на всех перечисленных тестах. Особенно сильный скачок якобы приходится на математику, scientific reasoning, работу в терминале и agentic-задачи.
Сам Gemini 4 реален: Google уже подтвердил, что запустил для него свой «самый амбициозный pre-training run» на сегодняшний день.
😁49❤21🤣15👍7🔥5
DeepSeek хочет закупить около 160 000 ускорителей Huawei Ascend для своего огромного дата-центра во Внутренней Монголии.
Если заказ реализуют, это будет крупнейший кластер Huawei для AI.
По данным Bloomberg:
- Ascend планируют использовать в основном для inference
- обучение крупных моделей DeepSeek по-прежнему рассчитывает проводить на NVIDIA
- производство такого объёма чипов может занять больше года
- главный ограничитель сейчас - не спрос, а производственные мощности Huawei
DeepSeek, судя по всему, хочет ещё больше ускорителей, но Huawei пока физически не может выпускать их в нужных объёмах.
Это хорошо показывает, как быстро в Китае растёт отдельная инфраструктура для AI inference на локальных чипах.
https://www.bloomberg.com/news/articles/2026-09-04/deepseek-plans-big-huawei-ai-chip-order-to-power-new-data-center
Если заказ реализуют, это будет крупнейший кластер Huawei для AI.
По данным Bloomberg:
- Ascend планируют использовать в основном для inference
- обучение крупных моделей DeepSeek по-прежнему рассчитывает проводить на NVIDIA
- производство такого объёма чипов может занять больше года
- главный ограничитель сейчас - не спрос, а производственные мощности Huawei
DeepSeek, судя по всему, хочет ещё больше ускорителей, но Huawei пока физически не может выпускать их в нужных объёмах.
Это хорошо показывает, как быстро в Китае растёт отдельная инфраструктура для AI inference на локальных чипах.
https://www.bloomberg.com/news/articles/2026-09-04/deepseek-plans-big-huawei-ai-chip-order-to-power-new-data-center
🔥12👍6🥰3
This media is not supported in your browser
VIEW IN TELEGRAM
GPT-6 Astra не та модель, разработку которой OpenAI приостановила из-за опасений по кибербезопасности. Речь шла о будущей модели.
«Обучение Astra завершилось уже некоторое время назад. Модель, о приостановке которой мы недавно говорили, это будущая модель. Но Astra уже достигла уровня cyber-critical.»
Источник: YouTube-канал Bloomberg Television, полное видео - в комментариях.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣35👍7🔥6❤4🥴2
Слух о том, что Anthropic могла решить одну из задач тысячелетия, становится всё интереснее.
Несколько часов назад Теренс Тао отдельно разобрал сценарий, где AI самостоятельно находит решение задачи глобальной регулярности уравнений Навье-Стокса, но почти весь путь к доказательству остаётся скрытым внутри закрытой системы.
Математически задача может быть решена, но если человечество увидит только финальный ответ без цепочки неудачных подходов, обходных путей и новых идей, сама область может получить от этого гораздо меньше пользы.
Пока подтверждённого решения Навье-Стокса нет, задача официально остаётся открытой. Но совпадение по времени выглядит очень любопытно.
Несколько часов назад Теренс Тао отдельно разобрал сценарий, где AI самостоятельно находит решение задачи глобальной регулярности уравнений Навье-Стокса, но почти весь путь к доказательству остаётся скрытым внутри закрытой системы.
Математически задача может быть решена, но если человечество увидит только финальный ответ без цепочки неудачных подходов, обходных путей и новых идей, сама область может получить от этого гораздо меньше пользы.
Пока подтверждённого решения Навье-Стокса нет, задача официально остаётся открытой. Но совпадение по времени выглядит очень любопытно.
👍21🔥8🤣5❤4🤨2⚡1
🚀 Thinking Machines Lab Миры Мурати уже обсуждает новый раунд инвестиций с оценкой около $40 млрд - менее чем через два года после запуска.
Стартап при этом уже генерирует как минимум
несколько сотен миллионов долларов годовой выручки в пересчёте на текущий темп.
Если сделка состоится, это будет одна из самых высоких оценок среди молодых AI-компаний.
https://www.theinformation.com/articles/thinking-machines-lab-talks-raise-billions-roughly-40-billion-valuation
Стартап при этом уже генерирует как минимум
несколько сотен миллионов долларов годовой выручки в пересчёте на текущий темп.
Если сделка состоится, это будет одна из самых высоких оценок среди молодых AI-компаний.
https://www.theinformation.com/articles/thinking-machines-lab-talks-raise-billions-roughly-40-billion-valuation
👍9❤4🤣3🔥2
🤖 Подключать AI-агента к каждому мессенджеру отдельно - обычно боль из разных API, токенов, настроек и коннекторов.
dsh-im решает это одним плагином для DeepSeek Harness.
Он позволяет подключить локального агента сразу к 9 платформам:
* Telegram
* Slack
* Discord
* WhatsApp
* WeChat
* Feishu
* DingTalk
* WeCom
* QQ
Настройка может идти через QR-код, App Manifest или обычные credentials — из одного интерфейса.
Что ещё умеет:
* несколько ботов на одном канале;
* отдельные workspace и session bindings;
* стриминг ответов;
* отображение thinking/tool progress там, где это поддерживается;
* отправка изображений и файлов;
* выбор Agent Preset для каждого бота;
* тест подключения прямо из панели.
Полезно, если нужно быстро встроить локального AI-агента в уже существующие рабочие чаты команды.
Open source, MIT.
https://github.com/xmanrui/dsh-im
dsh-im решает это одним плагином для DeepSeek Harness.
Он позволяет подключить локального агента сразу к 9 платформам:
* Telegram
* Slack
* Discord
* Feishu
* DingTalk
* WeCom
Настройка может идти через QR-код, App Manifest или обычные credentials — из одного интерфейса.
Что ещё умеет:
* несколько ботов на одном канале;
* отдельные workspace и session bindings;
* стриминг ответов;
* отображение thinking/tool progress там, где это поддерживается;
* отправка изображений и файлов;
* выбор Agent Preset для каждого бота;
* тест подключения прямо из панели.
Полезно, если нужно быстро встроить локального AI-агента в уже существующие рабочие чаты команды.
Open source, MIT.
https://github.com/xmanrui/dsh-im
👍13🔥8❤5
⚡ Tencent открыла TeamAI-CLI - общую память для ИИ-агентов команды
Инструмент собирает навыки, правила, документацию, MCP и накопленный опыт в одном Git-репозитории.
* изменения проходят через Merge Request
* после слияния обновления автоматически загружаются в следующей сессии
* полезные решения получают рейтинг и чаще попадают в контекст
* знания можно искать по проектам и кодовой базе
* поддерживаются Claude Code, Codex, Cursor, OpenCode, CodeBuddy и WorkBuddy
Найденный одним разработчиком способ исправить сложный баг можно закрепить как стандарт для всех агентов команды.
https://github.com/Tencent/teamai-cli
Инструмент собирает навыки, правила, документацию, MCP и накопленный опыт в одном Git-репозитории.
* изменения проходят через Merge Request
* после слияния обновления автоматически загружаются в следующей сессии
* полезные решения получают рейтинг и чаще попадают в контекст
* знания можно искать по проектам и кодовой базе
* поддерживаются Claude Code, Codex, Cursor, OpenCode, CodeBuddy и WorkBuddy
Найденный одним разработчиком способ исправить сложный баг можно закрепить как стандарт для всех агентов команды.
https://github.com/Tencent/teamai-cli
👍13🔥8❤6🤔1
Qwen вместе с Taobao & Tmall и сделала E-Commerce Bench, где агенту дают 100 тысяч юаней и 365 виртуальных дней. Он изучает категории, торгуется с поставщиками, назначает цены, следит за календарём распродаж, тянет склад и контролирует денежные потоки, причём одновременно может вести до четырёх магазинов.
Ни потолок спроса, ни себестоимость ему не показаны - до всего нужно докопаться самому.
Рабочий день идёт с 8 утра до 6 вечера, и каждый вызов инструмента тратит время: проверить деньги (10 минут), открыть магазин (60), написать поставщику (30).
Расходы списываются сразу, а выручка идёт через комиссию, эскроу, 9 дней ожидания и ручной вывод.
Склад сводится посуточно, товар, не отправленный за двое суток, отменяется, а репутация напрямую множит спрос: магазин на дне её шкалы получает 15% от обычного трафика.
Если бы роль поставщика играла языковая модель, одна и та же стратегия давала бы разные цены, а бенч превратился бы в соревнование по джейлбрейку. Поэтому все уступки и отказы считает жёсткий алгоритм, а модель лишь переводит его решения в речь на виртуальных переговорах.
GPT-5.6 Sol - лидер, он закончил год с 1,43 млн юаней, увеличив капитал в 14,3 раза.
Qwen3.8-Max-Preview - лучшая среди моделей с открытыми весами, на конец года у нее было 416 тыс. юаней
Qwen3.5-Plus остался с 1100 юанями.
Кстати, 10 циклов из 90 закончились банкротством, и сценарий почти всегда один - забить склад в январе и не суметь распродать.
Торговаться толком не научился никто.
До себестоимости поставщика не додавил ни один агент. Единственный, кто хоть как-то сбивал цену - Opus 4.7, но по настроению.
Исключение - Qwen3.8-Max-Preview, которая продавливает цену ниже на повторных заказах.
С мошенниками вышло интереснее всего.
Их в реестре 152 из 576 (26,4%), они пишут всем моделям, но у Opus 4.7 деньги получили 4% тех мошенников, с кем он заговорил, у GPT-5.6 Sol - 31,7%.
ИИ-предприниматели категорически не умеют распоряжаться рабочим временем.
Отправки, переходы на следующий день, вывод наличных и выкладка товара съедают 71,8% всех вызовов. На разговоры с поставщиками приходится 6%. На пересмотр цен 0,66%.
Модели заняты обслуживанием процесса, а не экономикой.
Отсюда странность в рейтинге эффективности. Fable5 зарабатывает 479 юаней на вызов против 363 у Sol, тратя при этом почти вдвое меньше вызовов, а по итоговым деньгам идёт позади.
Измерять обучение на длинной дистанции сложно, но тут у бенча есть линейка.
Ядро переговоров никогда не уходит ниже собственной себестоимости, значит лучшая цена, которую агент однажды выбил, - это верхняя граница того, за сколько поставщик готов отдать товар. Дальше можно сравнивать - следующая закупка у того же поставщика прошла дешевле или дороже уже достигнутого.
На 8647 повторных покупок улучшили свой же результат только 2 модели из 18, а 15 переплачивали настолько, что промахивались мимо случайного порядка больше чем на 2 стандартных отклонения.
#AI #ML #Agents #ECommerce #Benchmark #Qwen
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥13❤9👍6
⚡️ ИИ-агенты хорошо проходят короткие тесты, но ломаются на длинных задачах
Инженер Microsoft AI протестировал девять моделей на 10 664 многошаговых запусках. Чем больше зависимых действий требовалось выполнить, тем ниже становилась итоговая надёжность: ошибка на одном этапе влияла на все последующие.
На ToolQA модели, показывавшие почти 100% на двух-четырёх шагах, к 16 шагам сохраняли лишь 0–33% успешных выполнений.
Сокращение контекста не помогло, а ускорило падение качества: агент терял историю собственных решений.
Авторы рекомендуют тестировать агентов на реальной длине рабочих сценариев, измерять надёжность каждого шага и добавлять промежуточные проверки.
Исследование:
https://arxiv.org/abs/2609.01660
Код и данные:
https://github.com/shubmittal/agent-horizon-degradation
Инженер Microsoft AI протестировал девять моделей на 10 664 многошаговых запусках. Чем больше зависимых действий требовалось выполнить, тем ниже становилась итоговая надёжность: ошибка на одном этапе влияла на все последующие.
На ToolQA модели, показывавшие почти 100% на двух-четырёх шагах, к 16 шагам сохраняли лишь 0–33% успешных выполнений.
Сокращение контекста не помогло, а ускорило падение качества: агент терял историю собственных решений.
Авторы рекомендуют тестировать агентов на реальной длине рабочих сценариев, измерять надёжность каждого шага и добавлять промежуточные проверки.
Исследование:
https://arxiv.org/abs/2609.01660
Код и данные:
https://github.com/shubmittal/agent-horizon-degradation
❤4👍3🔥3