This media is not supported in your browser
VIEW IN TELEGRAM
Google запустила агентный анализ видео сразу в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite.
Теперь модель не обязана одинаково подробно обрабатывать весь ролик. Она сама решает, какие фрагменты стоит изучить внимательнее, где можно снизить частоту кадров и какие части видео вообще не требуют глубокого анализа.
По данным Google, новый подход даёт:
- до 88% меньше токенов
- до 66% ниже стоимость анализа
- более высокую точность на видео-задачах
Особенно полезно это для длинных роликов, где раньше модель тратила огромное количество токенов на кадры, которые почти не влияли на ответ.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/
Теперь модель не обязана одинаково подробно обрабатывать весь ролик. Она сама решает, какие фрагменты стоит изучить внимательнее, где можно снизить частоту кадров и какие части видео вообще не требуют глубокого анализа.
По данным Google, новый подход даёт:
- до 88% меньше токенов
- до 66% ниже стоимость анализа
- более высокую точность на видео-задачах
Особенно полезно это для длинных роликов, где раньше модель тратила огромное количество токенов на кадры, которые почти не влияли на ответ.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/
❤15👍6🔥1
Исследователи UC Berkeley показали новую проблему безопасности AI-агентов: иногда скрытый навык можно почти восстановить, вообще не видя его системный промпт, SKILL.md или внутренние файлы.
В работе Daydreaming атакующий просто даёт агенту специально подобранные обычные задачи и изучает ответы.
Этого оказалось достаточно, чтобы восстановить до 86,8% поведения скрытого навыка.
Самое неприятное - точная копия исходных файлов даже не нужна. Реконструированные версии могли сильно отличаться от оригинала, но всё равно воспроизводили большую часть поведения на новых задачах.
То есть навык может оставаться секретным на уровне файлов, но его логика всё равно постепенно «утекает» через нормальное использование.
Авторы советуют защищать не только промпты и внутренние файлы, но и сам рабочий интерфейс:
- не отдавать лишние детали в ответах
- скрывать ненужные трассировки выполнения
- ограничивать или отслеживать адаптивные серии запросов
Особенно важно для компаний, которые продают закрытые agent skills как сервис.
https://arxiv.org/abs/2608.26733
В работе Daydreaming атакующий просто даёт агенту специально подобранные обычные задачи и изучает ответы.
Этого оказалось достаточно, чтобы восстановить до 86,8% поведения скрытого навыка.
Самое неприятное - точная копия исходных файлов даже не нужна. Реконструированные версии могли сильно отличаться от оригинала, но всё равно воспроизводили большую часть поведения на новых задачах.
То есть навык может оставаться секретным на уровне файлов, но его логика всё равно постепенно «утекает» через нормальное использование.
Авторы советуют защищать не только промпты и внутренние файлы, но и сам рабочий интерфейс:
- не отдавать лишние детали в ответах
- скрывать ненужные трассировки выполнения
- ограничивать или отслеживать адаптивные серии запросов
Особенно важно для компаний, которые продают закрытые agent skills как сервис.
https://arxiv.org/abs/2608.26733
👍8🔥8❤3
Главное:
- NVGEMM добавляет в Inductor CUTLASS-ядра, сгенерированные через CuTeDSL
- появился новый backend
nccl2 для PyTorch Distributed- отказоустойчивость стала частью c10d: можно перенастраивать process group без полного перезапуска
- на Apple Silicon появилась нативная линейная алгебра: SVD,
eigh, QR и Cholesky-
torch.switch добавляет многостороннее ветвление-
torch.while_loop теперь можно захватывать в CUDA Graph-
@dynamic_spec задаёт динамические формы декларативно для torch.compile, torch.export и make_fx- Intel XPU получил нативный graph capture
- Inductor добавил поддержку Rubin
sm_107-
torch.compile экспериментально научился работать с комплексными числамиОтдельно NVGEMM умеет epilogue fusion, scaled GEMM, NVFP4 GEMM и autotuning вместе с Triton и ATen.
В релиз вошло 2995 коммитов от 487 участников.
17 сентября команда PyTorch проведёт live Q&A по версии 2.14.
Release blog: https://pytorch.org/blog/pytorch-2-14-release-blog/
Q&A: https://pytorch.org/event/pytorch-2-14-release-live-qa/
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9👍5❤4
⚡️ Покупка Hugging Face компанией NVIDIA может неожиданно стать одним из лучших сценариев для open-source AI.
Бизнес компании хорошо совпадает с интересами открытой экосистемы.
NVIDIA не нужно, чтобы победила одна конкретная модель. Компания зарабатывает, когда миллионы разработчиков обучают, дообучают и запускают миллионы разных моделей.
Hugging Face при этом контролирует один из важнейших каналов распространения open-source AI.
Если сделка состоится, Hugging Face получит доступ к огромной инфраструктуре и капиталу, а NVIDIA - ещё более сильную позицию в экосистеме разработчиков.
При условии, что NVIDIA действительно сохранит поддержку разных моделей, облаков и ускорителей, такая покупка может пойти на благо всем разработчикам.
https://x.com/JensenHuang/status/2095482647355244762
@data_analysis_ml / Папка полезного по ML.
Бизнес компании хорошо совпадает с интересами открытой экосистемы.
NVIDIA не нужно, чтобы победила одна конкретная модель. Компания зарабатывает, когда миллионы разработчиков обучают, дообучают и запускают миллионы разных моделей.
Hugging Face при этом контролирует один из важнейших каналов распространения open-source AI.
Если сделка состоится, Hugging Face получит доступ к огромной инфраструктуре и капиталу, а NVIDIA - ещё более сильную позицию в экосистеме разработчиков.
При условии, что NVIDIA действительно сохранит поддержку разных моделей, облаков и ускорителей, такая покупка может пойти на благо всем разработчикам.
https://x.com/JensenHuang/status/2095482647355244762
@data_analysis_ml / Папка полезного по ML.
❤13👍8🔥7🤣2🌚1
По данным команды, серия ориентирована на coding и agentic-задачи и показывает сильные результаты во всех размерных классах. Модели на 0,9B, 3,7B и 7B заявлены как новые SOTA для своего масштаба.
IFM выпустили веса, но и код, обучающие данные и рецепты обучения.
Launch: https://ifm.ai/k2/
Tech blog: https://ifm.ai/blog/k2
Hugging Face: https://huggingface.co/collections/IFM/k2-horizon
Please open Telegram to view this post
VIEW IN TELEGRAM
❤10👍8🔥6
Несколько мыслей о релизе GPT-6 Astra.
Сразу оговорка: это выводы по тому, что показала OpenAI. Саму модель я ещё не тестировал.
По опубликованным бенчмаркам Astra выглядит как самый сильный релиз OpenAI за долгое время и серьёзный удар по позициям Anthropic. Особенно заметен скачок в coding, computer use, browser use, математике, работе с таблицами и других сложных прикладных задачах.
Отсюда снова всплыл старый вопрос: можно ли уже называть такие модели AGI?
Единого определения AGI до сих пор нет. Но если понимать general intelligence буквально как способность работать на экспертном уровне сразу в большом числе разных областей, Astra действительно подбирается очень близко к этому описанию.
Astra вышла вскоре после Fable 5.1 и на фоне подготовки Anthropic к IPO. На этом фоне запуск выглядит особенно символично: OpenAI снова пытается вернуть себе лидерство в гонке frontier-моделей.
Насколько хорошо Astra будет справляться с длинными агентными задачами, coding, исследованиями, браузером и компьютером без постоянного контроля человека - станет понятно уже по первым массовым тестам.
И, судя по всему, Astra может быть не последним крупным релизом OpenAI в 2026 году.
Если опубликованные результаты подтвердятся на практике, GPT-6 станет одним из самых заметных скачков в возможностях универсальных AI-моделей за последние годы.
Сразу оговорка: это выводы по тому, что показала OpenAI. Саму модель я ещё не тестировал.
По опубликованным бенчмаркам Astra выглядит как самый сильный релиз OpenAI за долгое время и серьёзный удар по позициям Anthropic. Особенно заметен скачок в coding, computer use, browser use, математике, работе с таблицами и других сложных прикладных задачах.
Отсюда снова всплыл старый вопрос: можно ли уже называть такие модели AGI?
Единого определения AGI до сих пор нет. Но если понимать general intelligence буквально как способность работать на экспертном уровне сразу в большом числе разных областей, Astra действительно подбирается очень близко к этому описанию.
Astra вышла вскоре после Fable 5.1 и на фоне подготовки Anthropic к IPO. На этом фоне запуск выглядит особенно символично: OpenAI снова пытается вернуть себе лидерство в гонке frontier-моделей.
Насколько хорошо Astra будет справляться с длинными агентными задачами, coding, исследованиями, браузером и компьютером без постоянного контроля человека - станет понятно уже по первым массовым тестам.
И, судя по всему, Astra может быть не последним крупным релизом OpenAI в 2026 году.
Если опубликованные результаты подтвердятся на практике, GPT-6 станет одним из самых заметных скачков в возможностях универсальных AI-моделей за последние годы.
1❤16👍8🔥6😱3😢1🤣1
Цена за миллион токенов всё хуже показывает реальную стоимость AI
Токен перестал быть нормальной единицей сравнения моделей.
Две модели могут решить одну и ту же задачу, но одной понадобится 5 000 токенов, а другой - 50 000+. Добавьте разные токенизаторы, скрытые reasoning-токены, tool calls и повторные попытки — и метрика
Для AI-агентов проблема ещё заметнее.
Если первый шаг сгенерировал слишком много текста, этот результат часто становится входом для второго шага, затем попадает в третий, четвёртый и дальше.
Поэтому модель, которая использует в 2 раза больше токенов, может обойтись значительно дороже, чем просто ×2:
- растёт контекст;
- увеличивается latency;
- дорожают следующие reasoning-шаги;
- растут расходы на tool calls и retries.
Чем длиннее агентный workflow, тем важнее token efficiency.
Гораздо полезнее считать:
То есть сравнивать модели не по цене токена, а по стоимости успешно выполненной задачи при нужном качестве.
https://x.com/Machinelearrn/status/2095817451699130868
Токен перестал быть нормальной единицей сравнения моделей.
Две модели могут решить одну и ту же задачу, но одной понадобится 5 000 токенов, а другой - 50 000+. Добавьте разные токенизаторы, скрытые reasoning-токены, tool calls и повторные попытки — и метрика
$ / 1M tokens уже почти ничего не говорит о стоимости реальной работы.Для AI-агентов проблема ещё заметнее.
Если первый шаг сгенерировал слишком много текста, этот результат часто становится входом для второго шага, затем попадает в третий, четвёртый и дальше.
Поэтому модель, которая использует в 2 раза больше токенов, может обойтись значительно дороже, чем просто ×2:
- растёт контекст;
- увеличивается latency;
- дорожают следующие reasoning-шаги;
- растут расходы на tool calls и retries.
Чем длиннее агентный workflow, тем важнее token efficiency.
Гораздо полезнее считать:
полная стоимость модели + reasoning + tools + retries / число успешно выполненных задачТо есть сравнивать модели не по цене токена, а по стоимости успешно выполненной задачи при нужном качестве.
https://x.com/Machinelearrn/status/2095817451699130868
❤14🔥8👍6💯2
Смеяться можно долго: в цене сделки Nvidia по покупке Hugging Face спрятали сразу два пасхальных яйца.
Итоговая сумма - $12,930,300,000.
Если взять первые шесть цифр - 129303 и прочитать их как кодовую точку Unicode, получаем U+1F917. Это эмодзи 🤗, тот самый, который ассоциируется с Hugging Face.
Сооснователь Hugging Face Томас Вулф отдельно намекнул, что в цене сделки спрятаны отсылки сразу к обеим компаниям.
Второе пасхальное яйцо - для Nvidia. Если записать 129303 как HEX-цвет #129303, получится насыщенный зелёный оттенок, очень близкий к фирменному цвету Nvidia.
Почти $13 млрд и даже цифры в ценнике решили использовать не случайно.
Итоговая сумма - $12,930,300,000.
Если взять первые шесть цифр - 129303 и прочитать их как кодовую точку Unicode, получаем U+1F917. Это эмодзи 🤗, тот самый, который ассоциируется с Hugging Face.
Сооснователь Hugging Face Томас Вулф отдельно намекнул, что в цене сделки спрятаны отсылки сразу к обеим компаниям.
Второе пасхальное яйцо - для Nvidia. Если записать 129303 как HEX-цвет #129303, получится насыщенный зелёный оттенок, очень близкий к фирменному цвету Nvidia.
Почти $13 млрд и даже цифры в ценнике решили использовать не случайно.
❤43🤣17👍9🔥7🌭1
⚡️ GLM-5.3 теперь можно запускать в российском облаке
MWS Cloud развернула новую модель Z.аi в собственной инфраструктуре. GLM-5.3 доступна через MWS GPT Model Hub, а запросы и данные пользователей обрабатываются внутри России. При этом цена осталась на уровне GLM-5.2.
GLM-5.3 интересна прежде всего не обычным чатингом, а кодингом и агентными задачами. Модель умеет работать с репозиториями, искать ошибки в коде, выполнять многошаговые задачи и использовать инструменты в длительных последовательностях действий.
Модель доступна через OpenAI-совместимый API, что упрощает ее интеграцию и переключение между моделями.
Z.аi оставила базовую архитектуру от GLM-5.2, а основной прирост качества получила за счёт более масштабирования посттренинга. Веса GLM-5.3 разработчик выпустил не сразу, а примерно через две недели после релиза — за это время модель дополнительно тестировали и проверяли её безопасность.
В задачах программирования Модель стабильно опережает Claude Opus 4.8 и сопоставима с новейшими Claude Fable 5 и GPT-5.6 Sol
@data_analysis_ml / Папка полезного по ML.
MWS Cloud развернула новую модель Z.аi в собственной инфраструктуре. GLM-5.3 доступна через MWS GPT Model Hub, а запросы и данные пользователей обрабатываются внутри России. При этом цена осталась на уровне GLM-5.2.
GLM-5.3 интересна прежде всего не обычным чатингом, а кодингом и агентными задачами. Модель умеет работать с репозиториями, искать ошибки в коде, выполнять многошаговые задачи и использовать инструменты в длительных последовательностях действий.
Модель доступна через OpenAI-совместимый API, что упрощает ее интеграцию и переключение между моделями.
Z.аi оставила базовую архитектуру от GLM-5.2, а основной прирост качества получила за счёт более масштабирования посттренинга. Веса GLM-5.3 разработчик выпустил не сразу, а примерно через две недели после релиза — за это время модель дополнительно тестировали и проверяли её безопасность.
В задачах программирования Модель стабильно опережает Claude Opus 4.8 и сопоставима с новейшими Claude Fable 5 и GPT-5.6 Sol
@data_analysis_ml / Папка полезного по ML.
mws.ru
GPT Model Hub — генеративные модели по API в облаке MWS Cloud Platform
GPT Model Hub — готовые генеративные модели и LLM в MWS Cloud Platform. OpenAI-совместимый API, быстрый инференс. Каталог моделей для создания AI-ассистентов, чат-ботов и AI-приложений
👍7❤4🔥4🥴4
Появились сообщения, что в GPT-6 Astra используется техника recurrent depth - одни и те же Transformer-блоки с общими весами прогоняются несколько раз подряд.
Вместо того чтобы каждый раз добавлять новые слои и параметры, модель может повторно использовать уже существующие блоки и выполнять больше внутреннего вычисления над одним состоянием.
По сути:
hidden state → Transformer block → тот же block → тот же block → результатТакой подход близок к семейству Recurrent Reasoning Models (RRM), которое исследователи активно изучают как способ увеличить глубину рассуждения без пропорционального роста числа параметров.
Интересно, что похожую идею разбирали ещё весной этого года в работе про recurrent reasoning models:
https://arxiv.org/abs/2603.02193
PS: OpenAI публично архитектуру Astra пока не раскрывала, поэтому recurrent depth остаётся сообщаемой, но не подтверждённой компанией особенностью модели.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍10🔥4❤3
Утекли предполагаемые бенчмарки Gemini 4 - цифры выглядят безумно 🤯
В сети разошлась таблица с прогнозируемыми результатами Gemini 4:
- 99,9%+ — ARC-AGI-3
- 99,1% — FrontierMath Tier 4 v2
- 72,8% — Terminal-Bench Science 0.1
- 70,2% — HealthBench Professional
- 62,3% — Terminal-Bench 4.0
- 48,7% — AutomationBench
- 98,6% — BenchCAD
В этой таблице Gemini 4 опережает GPT-6 Astra и Fable 5.1 на всех перечисленных тестах. Особенно сильный скачок якобы приходится на математику, scientific reasoning, работу в терминале и agentic-задачи.
Сам Gemini 4 реален: Google уже подтвердил, что запустил для него свой «самый амбициозный pre-training run» на сегодняшний день.
В сети разошлась таблица с прогнозируемыми результатами Gemini 4:
- 99,9%+ — ARC-AGI-3
- 99,1% — FrontierMath Tier 4 v2
- 72,8% — Terminal-Bench Science 0.1
- 70,2% — HealthBench Professional
- 62,3% — Terminal-Bench 4.0
- 48,7% — AutomationBench
- 98,6% — BenchCAD
В этой таблице Gemini 4 опережает GPT-6 Astra и Fable 5.1 на всех перечисленных тестах. Особенно сильный скачок якобы приходится на математику, scientific reasoning, работу в терминале и agentic-задачи.
Сам Gemini 4 реален: Google уже подтвердил, что запустил для него свой «самый амбициозный pre-training run» на сегодняшний день.
😁20❤17🤣8👍7🔥5