Анализ данных (Data analysis)
50.6K subscribers
3.55K photos
446 videos
1 file
2.9K links
Data science, наука о данных.

@haarrp - админ

РКН: clck.ru/3FmyAp
Download Telegram
✔️ IFM представила K2 Horizon - линейку из шести foundation-моделей размером от 0,9B до 375B параметров.

По данным команды, серия ориентирована на coding и agentic-задачи и показывает сильные результаты во всех размерных классах. Модели на 0,9B, 3,7B и 7B заявлены как новые SOTA для своего масштаба.

IFM выпустили веса, но и код, обучающие данные и рецепты обучения.


Launch: https://ifm.ai/k2/

Tech blog: https://ifm.ai/blog/k2

Hugging Face: https://huggingface.co/collections/IFM/k2-horizon
Please open Telegram to view this post
VIEW IN TELEGRAM
10👍8🔥6
Несколько мыслей о релизе GPT-6 Astra.

Сразу оговорка: это выводы по тому, что показала OpenAI. Саму модель я ещё не тестировал.

По опубликованным бенчмаркам Astra выглядит как самый сильный релиз OpenAI за долгое время и серьёзный удар по позициям Anthropic. Особенно заметен скачок в coding, computer use, browser use, математике, работе с таблицами и других сложных прикладных задачах.

Отсюда снова всплыл старый вопрос: можно ли уже называть такие модели AGI?

Единого определения AGI до сих пор нет. Но если понимать general intelligence буквально как способность работать на экспертном уровне сразу в большом числе разных областей, Astra действительно подбирается очень близко к этому описанию.

Astra вышла вскоре после Fable 5.1 и на фоне подготовки Anthropic к IPO. На этом фоне запуск выглядит особенно символично: OpenAI снова пытается вернуть себе лидерство в гонке frontier-моделей.

Насколько хорошо Astra будет справляться с длинными агентными задачами, coding, исследованиями, браузером и компьютером без постоянного контроля человека - станет понятно уже по первым массовым тестам.

И, судя по всему, Astra может быть не последним крупным релизом OpenAI в 2026 году.

Если опубликованные результаты подтвердятся на практике, GPT-6 станет одним из самых заметных скачков в возможностях универсальных AI-моделей за последние годы.
117👍9🔥6😱3😢1🤣1
Цена за миллион токенов всё хуже показывает реальную стоимость AI

Токен перестал быть нормальной единицей сравнения моделей.

Две модели могут решить одну и ту же задачу, но одной понадобится 5 000 токенов, а другой - 50 000+. Добавьте разные токенизаторы, скрытые reasoning-токены, tool calls и повторные попытки — и метрика $ / 1M tokens уже почти ничего не говорит о стоимости реальной работы.

Для AI-агентов проблема ещё заметнее.

Если первый шаг сгенерировал слишком много текста, этот результат часто становится входом для второго шага, затем попадает в третий, четвёртый и дальше.

Поэтому модель, которая использует в 2 раза больше токенов, может обойтись значительно дороже, чем просто ×2:

- растёт контекст;
- увеличивается latency;
- дорожают следующие reasoning-шаги;
- растут расходы на tool calls и retries.

Чем длиннее агентный workflow, тем важнее token efficiency.

Гораздо полезнее считать:

полная стоимость модели + reasoning + tools + retries / число успешно выполненных задач

То есть сравнивать модели не по цене токена, а по стоимости успешно выполненной задачи при нужном качестве.

https://x.com/Machinelearrn/status/2095817451699130868
16🔥9👍7💯2
Смеяться можно долго: в цене сделки Nvidia по покупке Hugging Face спрятали сразу два пасхальных яйца.

Итоговая сумма - $12,930,300,000.

Если взять первые шесть цифр - 129303 и прочитать их как кодовую точку Unicode, получаем U+1F917. Это эмодзи 🤗, тот самый, который ассоциируется с Hugging Face.

Сооснователь Hugging Face Томас Вулф отдельно намекнул, что в цене сделки спрятаны отсылки сразу к обеим компаниям.

Второе пасхальное яйцо - для Nvidia. Если записать 129303 как HEX-цвет #129303, получится насыщенный зелёный оттенок, очень близкий к фирменному цвету Nvidia.

Почти $13 млрд и даже цифры в ценнике решили использовать не случайно.
46🤣17👍9🔥7🌭2
⚡️ GLM-5.3 теперь можно запускать в российском облаке

MWS Cloud развернула новую модель Z.аi в собственной инфраструктуре. GLM-5.3 доступна через MWS GPT Model Hub, а запросы и данные пользователей обрабатываются внутри России. При этом цена осталась на уровне GLM-5.2.

GLM-5.3 интересна прежде всего не обычным чатингом, а кодингом и агентными задачами. Модель умеет работать с репозиториями, искать ошибки в коде, выполнять многошаговые задачи и использовать инструменты в длительных последовательностях действий.

Модель доступна через OpenAI-совместимый API, что упрощает ее интеграцию и переключение между моделями.
 
Z.аi оставила базовую архитектуру от GLM-5.2, а основной прирост качества получила за счёт более масштабирования посттренинга. Веса GLM-5.3 разработчик выпустил не сразу, а примерно через две недели после релиза — за это время модель дополнительно тестировали и проверяли её безопасность.

В задачах программирования Модель стабильно опережает Claude Opus 4.8 и сопоставима с новейшими Claude Fable 5 и GPT-5.6 Sol

@data_analysis_ml / Папка полезного по ML.
👍8🔥74🥴4
✔️ В GPT-6 Astra может использоваться recurrent depth 👀

Появились сообщения, что в GPT-6 Astra используется техника recurrent depth - одни и те же Transformer-блоки с общими весами прогоняются несколько раз подряд.

Вместо того чтобы каждый раз добавлять новые слои и параметры, модель может повторно использовать уже существующие блоки и выполнять больше внутреннего вычисления над одним состоянием.

По сути:

hidden state → Transformer block → тот же block → тот же block → результат

Такой подход близок к семейству Recurrent Reasoning Models (RRM), которое исследователи активно изучают как способ увеличить глубину рассуждения без пропорционального роста числа параметров.

Интересно, что похожую идею разбирали ещё весной этого года в работе про recurrent reasoning models:

https://arxiv.org/abs/2603.02193

PS: OpenAI публично архитектуру Astra пока не раскрывала, поэтому recurrent depth остаётся сообщаемой, но не подтверждённой компанией особенностью модели.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍13🔥53
Проверьте свои аккаунты, друзья! OpenAI раскалывают Astra!!
👍20🔥135
Утекли предполагаемые бенчмарки Gemini 4 - цифры выглядят безумно 🤯

В сети разошлась таблица с прогнозируемыми результатами Gemini 4:

- 99,9%+ — ARC-AGI-3
- 99,1% — FrontierMath Tier 4 v2
- 72,8% — Terminal-Bench Science 0.1
- 70,2% — HealthBench Professional
- 62,3% — Terminal-Bench 4.0
- 48,7% — AutomationBench
- 98,6% — BenchCAD

В этой таблице Gemini 4 опережает GPT-6 Astra и Fable 5.1 на всех перечисленных тестах. Особенно сильный скачок якобы приходится на математику, scientific reasoning, работу в терминале и agentic-задачи.

Сам Gemini 4 реален: Google уже подтвердил, что запустил для него свой «самый амбициозный pre-training run» на сегодняшний день.
😁4820🤣15👍7🔥5
DeepSeek хочет закупить около 160 000 ускорителей Huawei Ascend для своего огромного дата-центра во Внутренней Монголии.

Если заказ реализуют, это будет крупнейший кластер Huawei для AI.

По данным Bloomberg:

- Ascend планируют использовать в основном для inference
- обучение крупных моделей DeepSeek по-прежнему рассчитывает проводить на NVIDIA
- производство такого объёма чипов может занять больше года
- главный ограничитель сейчас - не спрос, а производственные мощности Huawei

DeepSeek, судя по всему, хочет ещё больше ускорителей, но Huawei пока физически не может выпускать их в нужных объёмах.

Это хорошо показывает, как быстро в Китае растёт отдельная инфраструктура для AI inference на локальных чипах.

https://www.bloomberg.com/news/articles/2026-09-04/deepseek-plans-big-huawei-ai-chip-order-to-power-new-data-center
🔥12👍6🥰3
This media is not supported in your browser
VIEW IN TELEGRAM
✔️ Сэм Альтман в эфире Bloomberg Television:

GPT-6 Astra не та модель, разработку которой OpenAI приостановила из-за опасений по кибербезопасности. Речь шла о будущей модели.

«Обучение Astra завершилось уже некоторое время назад. Модель, о приостановке которой мы недавно говорили, это будущая модель. Но Astra уже достигла уровня cyber-critical.»

Источник: YouTube-канал Bloomberg Television, полное видео - в комментариях.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣34👍7🔥64🥴2
Слух о том, что Anthropic могла решить одну из задач тысячелетия, становится всё интереснее.

Несколько часов назад Теренс Тао отдельно разобрал сценарий, где AI самостоятельно находит решение задачи глобальной регулярности уравнений Навье-Стокса, но почти весь путь к доказательству остаётся скрытым внутри закрытой системы.

Математически задача может быть решена, но если человечество увидит только финальный ответ без цепочки неудачных подходов, обходных путей и новых идей, сама область может получить от этого гораздо меньше пользы.

Пока подтверждённого решения Навье-Стокса нет, задача официально остаётся открытой. Но совпадение по времени выглядит очень любопытно.
👍19🔥8🤣54🤨21
🚀 Thinking Machines Lab Миры Мурати уже обсуждает новый раунд инвестиций с оценкой около $40 млрд - менее чем через два года после запуска.

Стартап при этом уже генерирует как минимум
несколько сотен миллионов долларов годовой выручки в пересчёте на текущий темп.

Если сделка состоится, это будет одна из самых высоких оценок среди молодых AI-компаний.


https://www.theinformation.com/articles/thinking-machines-lab-talks-raise-billions-roughly-40-billion-valuation
👍84🤣3🔥2
🤖 Подключать AI-агента к каждому мессенджеру отдельно - обычно боль из разных API, токенов, настроек и коннекторов.

dsh-im решает это одним плагином для DeepSeek Harness.

Он позволяет подключить локального агента сразу к 9 платформам:

* Telegram
* Slack
* Discord
* WhatsApp
* WeChat
* Feishu
* DingTalk
* WeCom
* QQ

Настройка может идти через QR-код, App Manifest или обычные credentials — из одного интерфейса.

Что ещё умеет:

* несколько ботов на одном канале;
* отдельные workspace и session bindings;
* стриминг ответов;
* отображение thinking/tool progress там, где это поддерживается;
* отправка изображений и файлов;
* выбор Agent Preset для каждого бота;
* тест подключения прямо из панели.

Полезно, если нужно быстро встроить локального AI-агента в уже существующие рабочие чаты команды.

Open source, MIT.

https://github.com/xmanrui/dsh-im
👍12🔥85
Tencent открыла TeamAI-CLI - общую память для ИИ-агентов команды

Инструмент собирает навыки, правила, документацию, MCP и накопленный опыт в одном Git-репозитории.

* изменения проходят через Merge Request
* после слияния обновления автоматически загружаются в следующей сессии
* полезные решения получают рейтинг и чаще попадают в контекст
* знания можно искать по проектам и кодовой базе
* поддерживаются Claude Code, Codex, Cursor, OpenCode, CodeBuddy и WorkBuddy

Найденный одним разработчиком способ исправить сложный баг можно закрепить как стандарт для всех агентов команды.

https://github.com/Tencent/teamai-cli
👍13🔥76🤔1
✔️ Qwen выпустил бенчмарк, где агент год управляет бизнесом

Qwen вместе с Taobao & Tmall и сделала E-Commerce Bench, где агенту дают 100 тысяч юаней и 365 виртуальных дней. Он изучает категории, торгуется с поставщиками, назначает цены, следит за календарём распродаж, тянет склад и контролирует денежные потоки, причём одновременно может вести до четырёх магазинов.

Ни потолок спроса, ни себестоимость ему не показаны - до всего нужно докопаться самому.


🟡 Детали экономики

Рабочий день идёт с 8 утра до 6 вечера, и каждый вызов инструмента тратит время: проверить деньги (10 минут), открыть магазин (60), написать поставщику (30).

Расходы списываются сразу, а выручка идёт через комиссию, эскроу, 9 дней ожидания и ручной вывод.

Склад сводится посуточно, товар, не отправленный за двое суток, отменяется, а репутация напрямую множит спрос: магазин на дне её шкалы получает 15% от обычного трафика.

🟡Ядро переговоров

Если бы роль поставщика играла языковая модель, одна и та же стратегия давала бы разные цены, а бенч превратился бы в соревнование по джейлбрейку. Поэтому все уступки и отказы считает жёсткий алгоритм, а модель лишь переводит его решения в речь на виртуальных переговорах.

🟡Что показали тесты

GPT-5.6 Sol - лидер, он закончил год с 1,43 млн юаней, увеличив капитал в 14,3 раза.

Qwen3.8-Max-Preview - лучшая среди моделей с открытыми весами, на конец года у нее было 416 тыс. юаней

Qwen3.5-Plus остался с 1100 юанями.

Кстати, 10 циклов из 90 закончились банкротством, и сценарий почти всегда один - забить склад в январе и не суметь распродать.


🟡Дополнительные оси оценки

Торговаться толком не научился никто.

До себестоимости поставщика не додавил ни один агент. Единственный, кто хоть как-то сбивал цену - Opus 4.7, но по настроению.

Исключение - Qwen3.8-Max-Preview, которая продавливает цену ниже на повторных заказах.


С мошенниками вышло интереснее всего.

Их в реестре 152 из 576 (26,4%), они пишут всем моделям, но у Opus 4.7 деньги получили 4% тех мошенников, с кем он заговорил, у GPT-5.6 Sol - 31,7%.


ИИ-предприниматели категорически не умеют распоряжаться рабочим временем.

Отправки, переходы на следующий день, вывод наличных и выкладка товара съедают 71,8% всех вызовов. На разговоры с поставщиками приходится 6%. На пересмотр цен 0,66%.


Модели заняты обслуживанием процесса, а не экономикой.

Отсюда странность в рейтинге эффективности. Fable5 зарабатывает 479 юаней на вызов против 363 у Sol, тратя при этом почти вдвое меньше вызовов, а по итоговым деньгам идёт позади.



🟡За год почти никто ничему не научился

Измерять обучение на длинной дистанции сложно, но тут у бенча есть линейка.

Ядро переговоров никогда не уходит ниже собственной себестоимости, значит лучшая цена, которую агент однажды выбил, - это верхняя граница того, за сколько поставщик готов отдать товар. Дальше можно сравнивать - следующая закупка у того же поставщика прошла дешевле или дороже уже достигнутого.

На 8647 повторных покупок улучшили свой же результат только 2 модели из 18, а 15 переплачивали настолько, что промахивались мимо случайного порядка больше чем на 2 стандартных отклонения.



📌Лицензирование: Apache 2.0 License


🟡Страница проекта
🟡Arxiv
🖥Github

#AI #ML #Agents #ECommerce #Benchmark #Qwen
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥128👍5