На 1M токенов - 9.7x ускорение префилла и 15.6x на декоде против M2.
В марте их лид по претрейну писал, почему для M2 откатились на full attention: эффективные варианты не были готовы к проду.
Спустя полгода готовы.
Схема двухстадийная. Сначала лёгкая index-ветка выбирает релевантные блоки KV. Дальше sparse attention считается только по ним, а не по всему контексту.
Дешёвый 1M-контекст в опенсорсе - это другой режим работы с длинным контекстом и другая экономика инференса для агентов.
Ждём техрепорт и замеры качества. Ну и приятно, что всё это в опенсорсе.
https://x.com/MiniMax_AI/status/2059286515155599595
#MSA #OpenSource #M3
Please open Telegram to view this post
VIEW IN TELEGRAM
👍58❤35👨💻24🔥8👏8🎉6
Media is too big
VIEW IN TELEGRAM
Власти Китая ввели обязательное согласование зарубежных поездок для ключевых ИИ-специалистов из частных компаний, включая Alibaba и DeepSeek. Теперь инженерам, исследователям и основателям стартапов требуется официальное разрешение на выезд из страны вместо прежнего уведомительного порядка.
Ведомства формируют ограничительные списки, оценивая фактическую значимость конкретного разработчика для технологической отрасли, а не его должность в штатном расписании.
Ранее государство контролировало перемещения преимущественно чиновников, топ-менеджеров госкорпораций и ученых из стратегических секторов экономики.
bloomberg.com
Anthropic выпустила плагин Security Guidance для автоматического поиска уязвимостей в Claude Code. Инструмент работает на базе хуков и выявляет баги безопасности в процессе написания кода.
Проверка проходит на 3-х уровнях: при редактировании файлов система ищет опасные паттерны и ошибки использования библиотек; после генерации кода анализирует diff, а на этапе коммита проверяет окружающий контекст.
По данным Anthropic, использование этой системы как предварительного фильтра перед код-ревью снизило количество замечаний по безопасности PR на 30–40%. Расширение доступно в маркетплейсе плагинов Claude Code.
Claude Devs в сети Х
xAI открыла доступ к CLI-ассистенту Grok Build подписчикам SuperGrok и X Premium+. На этапе беты инструмент работал только на флагманском тарифе SuperGrok Heavy за $300 в месяц.
Grok Build предназначен для отладки и рефакторинга локального кода. Режим Plan Mode предварительно анализирует весь проект и составляет пошаговый план изменений - кодовая база обновляется только после подтверждения разработчиком.
Инструмент поддерживает MCP, параллельную работу нескольких агентов и режим для сред без графической оболочки. Дополнительно в CLI интегрирована Imagine для генерации изображений и видео напрямую из терминала.
xAI в сети Х
Вторая версия модели для генерации музыки получила поддержку перегенерации отдельного фрагмента трека, без изменения всей композиции.
Также добавлена возможность создания сложных вокальных структур, смена музыкального жанра по ходу воспроизведения и интеграция немузыкальных звуковых эффектов.
Модель обучена на лицензированных датасетах, сгенерированные треки разрешены к коммерческому использованию. В ближайшее время доступ к ней откроют через API со сниженной на 50% стоимостью вызовов.
elevenlabs.io
Автоматическая система модерации Google безвозвратно заблокировала аккаунт японского художника Масахиро Итосуги. Он потерял доступ к Gmail, YouTube и всем файлам в Google Drive.
Внутренний ИИ-алгоритм без предупреждения пометил приватные черновики художника в облаке как недопустимый контент. Апелляция на восстановление доступа была отклонена.
От непредсказуемой модерации, основанной на ИИ страдают не только художники, но и технические специалисты. Ранее в IT-сообществе вызвал резонанс случай конца 2025 года, когда разработчик из Греции лишился всех рабочих файлов на облачном диске из-за ошибочных действий Gemini 3 Pro.
Masahiro Itosugi в сети Х
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔93🔥82👍41😢25❤20🤬17🤨9🤩1
Для флагманской MiMo-V2.5-Pro стоимость 1 млн токенов на входе при попадании в prompt cache составит $0,0036. Цена без кеширования снижена на 78% до $0,435, стоимость генерации - на 86%, до $0,87 за 1 млн токенов.
Для базовой версии MiMo-V2.5 кешированный инпут обойдется в $0,0028. Токены на входе без кеширования стоят $0,14, токены на выходе - $0,28 за миллион.
Подписки переведены на балльную систему биллинга. Месячные тарифы остались прежними ($6, $16, $50 и $100), но лимиты увеличены от 4,1 млрд до 82 млрд токенов.
Списание для MiMo-V2.5 рассчитывается по ставке: 2 балла за токен из кеша, 100 баллов при cache miss и 200 баллов за токен генерации.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍60👏24❤13💯10🔥6🙈4
This media is not supported in your browser
VIEW IN TELEGRAM
При обычном обучении градиенты проходят через весь граф, а память под активации растёт вместе с глубиной модели. DiffusionBlocks предлагает разрезать сеть на отдельные блоки и обучать каждый независимо.
Каждому блоку дают свою локальную задачу: сдвинуть представление чуть ближе к целевому состоянию, чем это сделал предыдущий блок. Формально это похоже на один шаг диффузионного процесса, поэтому каждый блок оптимизирует собственный лосс и не зависит от соседних блоков.
Главный плюс - память. Для тренировки нужна память под один блок, а не под всю сеть целиком.
Авторы проверили подход на разных архитектурах:
- ViT
- DiT
- masked diffusion
- авторегрессионные трансформеры
- recurrent-depth / Looped-трансформеры
По качеству результаты сопоставимы со сквозным обучением, но с куда меньшими требованиями к памяти.
В Looped-трансформерами один и тот же блок прогоняется много раз подряд, как будто модель «думает» несколькими итерациями. Обычно для обучения приходится разворачивать весь этот процесс через BPTT, из-за чего память и вычисления быстро дорожают
Это ещё один аргумент в пользу идеи, что диффузия - не только про генерацию картинок, а более универсальная рамка для обучения моделей.
Если модель упирается в VRAM из-за глубины, DiffusionBlocks выглядит как подход, за которым стоит следить.
Пейпер: arxiv.org/abs/2506.14202
Код: github.com/SakanaAI/DiffusionBlocks
@ai_machinelearning_big_data
#sakana #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍124👏27🔥20❤15🤔11💯6🤣5
Media is too big
VIEW IN TELEGRAM
Американский вендор поможет довести готовую внутреннюю архитектуру китайской компании до стадии массового производства. Оборудование предназначено для развертывания и масштабирования ИИ-агентов.
Контракт выводит Qualcomm за рамки мобильных процессоров в сегмент серверной ИИ-инфраструктуры, позволяя конкурировать с Broadcom и Marvell.
Ожидается, что партнерство не нарушит ограничения США на экспорт технологий. Вычислительная мощность выпускаемых ASIC спроектирована с учетом актуальных лимитов американских регуляторов на поставку чипов китайским корпорациям.
bloomberg.com
Главы OpenAI и Anthropic отказались от прогнозов о массовых сокращениях из-за внедрения ИИ. Сэм Альтман и Дарио Амодей заявили, что переоценили скорость автоматизации рабочих мест.
Альтман признал ошибку в оценках исчезновения джуниор-позиций. В качестве примера он привел собственный опыт: попытка полностью делегировать LLM ответы в электронной почте и Slack провалилась. CEO OpenAI вернулся к ручной коммуникации из-за необходимости человеческого участия.
Амодей теперь называет модели мультипликатором эффективности. По его словам, передача 90% рутины алгоритмам кратно повышает ценность оставшейся человеческой работы. Эффект описывается парадоксом Джевонса: удешевление процессов не снижает спрос на людей, а расширяет рынок.
Позиция сблизилась с оценками традиционного бизнеса. Независимые исследования не фиксируют всплеска безработицы в сферах, уязвимых для автоматизации.
fortune.com
Обновление модели MAI-Image до версии 2.5 принесло место в тройке лидеров бенчмарка Arena, где новинка делит пьедестал с Nano Banana 2 от Google, уступая Image-2 от OpenAI.
В версии 2.5 улучшили рендеринг текста, работу со сложными промптами и генерацию коммерческой графики. Microsoft говорит, что модель теперь реалистичнее выстраивает освещение, глубину сцены и пространственные связи между объектами.
MAI-Image 2.5 доступна для тестирования на платформе Arena. В течение 2-х недель Microsoft интегрирует ее в собственные сервисы MAI Playground и Foundry.
microsoft.ai
Основой обновления стал Data Science Agent. Инструмент автономно выстраивает аналитику: изучает датасеты, генерирует и выполняет код, делает выводы и визуализирует результаты. Пользователь может вмешиваться и корректировать план на любом этапе выполнения.
Также в Colab добавили инструменты для рефакторинга и поиска багов. Предложенные исправления кода выгружаются в diff-формате для оценки до принятия изменений. Управлять агентом можно через инлайн-команды прямо в ячейке кода или через боковую панель.
По оценкам Google, переход на агентную архитектуру ускорит написание кода минимум в 2 раза.
developers.googleblog.com
КНР модернизирует национальную систему видеонаблюдения, перенося вычисления на периферию и внедряя поиск по видео через промпты. Архитектура базируется на локальных серверах и камерах Hikvision и Huawei со встроенными ИИ-моделями.
Переход от трансляции потока в ЦОДы к обработке данных на местах снижает нагрузку на облачную инфраструктуру и уменьшает задержку. Предыдущие поколения камер использовались для сверки лиц с базами данных. Интеграция мультимодальных моделей меняет формат мониторинга.
Параллельно CV-алгоритмы автономно детектируют аномалии. Камеры фиксируют опасное вождение, несанкционированные митинги, подозрительную активность и проникновение на закрытые территории, уведомляя операторов об инцидентах.
ft.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍66❤34🤔16👏7🥰3🤓3😎2😁1
Модель оптимизирована под сценарии, где критичны скорость ответа и стоимость инференса: модерация контента, техподдержка, классификация обращений, поиск по базам знаний и другие массовые задачи.
Что заявляет компания:
«Яндекс выходит на новый для себя рынок моделей, созданных специально под запросы бизнеса. Alice AI LLM Flash поможет российским компаниям перейти на российские нейросети для автоматизации работы с огромными объемами данных», — руководитель платформы Yandex AI Studio Артур Самигуллин
Интересно, что рынок постепенно приходит к разделению моделей по специализации: тяжёлые reasoning-модели отдельно, быстрые и дешёвые inference-модели для high-load production-задач — отдельно. Попробовать новую модель уже можно в Yandex AI Studio.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍82🤣52❤12👏10🤔7🔥6😁5😭2😎2🤨1🗿1
Издание Phoronix выпустило один из первых публичных обзоров серверного процессора NVIDIA Vera - нового ARM-чипа с 88 ядрами архитектуры Olympus, который компания позиционирует для ИИ-инфраструктуры.
По оценке основателя Phoronix Майкла Ларабела, это первый ARM-процессор, который на серверных нагрузках сопоставим с актуальными Intel Xeon и AMD EPYC.
В среднем по протестированным задачам Vera оказался примерно на 10% быстрее 64-ядерного AMD EPYC 9575F и в 1,55 раза быстрее Intel Xeon 6980P, флагмана линейки Granite Rapids.
По сравнению с предыдущим процессором NVIDIA Grace производительность выросла примерно на 63%.
В тесте сборки ядра Linux со стандартной конфигурацией Vera показал лучший результат среди всех испытуемых - 20 секунд.
Конфигурация Vera включала 88 ядер и 176 потоков, 8 модулей памяти LPDDR5-9600 общим объёмом 768 ГБ и TDP 450 Вт.
С учётом потребления памяти полная нагрузка системы составила около 500 Вт. У топовых EPYC Turin и Xeon Granite Rapids аналогичный показатель относится только к самому процессору, без памяти.
При этом публиковать полные данные об энергопотреблении NVIDIA не разрешила, поэтому реальная энергоэффективность остаётся неизвестной.
Набор бенчмарков был ограничен самой NVIDIA - тестировались сценарии, под которые компания и позиционирует чип: компиляция кода, Python, Java, база данных ClickHouse, сжатие Zstd, кодирование видео SVT-AV1, 7-Zip и ряд других.
Тестов агентного ИИ (ключевого, по заявлениям NVIDIA, сценария применения процессора) в этом раунде не проводилось, их обещают опубликовать позднее.
Цена и сроки массовой доступности вне крупных облачных и ИИ-клиентов также не объявлены. Поставки партнёрам запланированы на вторую половину 2026 года.
AMD готовит EPYC Venice на архитектуре Zen 6 с планами по выходу до конца года, Intel Xeon Diamond Rapids ожидается в 2027-м.
По оценке Phoronix, после выхода Venice, AMD может вернуть лидерство за пределами целевых для Vera сценариев, поэтому многое будет зависеть от того, как быстро NVIDIA сможет выпустить рефреш Olympus.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔85❤42🔥35👍23👏8💘2
This media is not supported in your browser
VIEW IN TELEGRAM
🐟 Китай придумал, как выжать из одного водоёма больше пользы.
Сверху - плавучие солнечные панели, которые дают электричество.
Снизу - фермы, где выращивают рыбу, креветок и крабов.
Такую схему называют FPC - fishery-photovoltaic complementary.
Водоём одновременно становится и солнечной электростанцией, и рыбной фермой.
Больше чистой энергии и дополнительный доход от выращивания морепродуктов.
@ai_machinelearning_big_data
Сверху - плавучие солнечные панели, которые дают электричество.
Снизу - фермы, где выращивают рыбу, креветок и крабов.
Такую схему называют FPC - fishery-photovoltaic complementary.
Водоём одновременно становится и солнечной электростанцией, и рыбной фермой.
Больше чистой энергии и дополнительный доход от выращивания морепродуктов.
@ai_machinelearning_big_data
👍201❤29🔥26🤩24🤨5🤔4💔1🗿1
Проблема классическая: алгоритму нужны сигналы (дослушивания, лайки, скипы, сохранения), чтобы понять, кому рекомендовать новый объект. Но у свежего трека статистики еще нет. В итоге рекомендации часто начинают работать слишком поздно. А в музыке, где у релиза буквально несколько дней на разгон, это критично.
Вместо ожидания накопления данных VK Микс по сути делает искусственный контролируемый warm start. Сначала показывает новый трек ядру самых лояльных слушателей артиста. Так модель быстро получает первичную статистику и начинает масштабировать показ дальше.
Дополнительно в системе сделали почасовое обновление счетчиков. В результате новые треки начинают попадать в рекомендации менее чем за 30 минут. По данным VK, это в 24 раза быстрее среднего по рынку.
Интересный пример того, как проблему холодного старта начинают решать не только моделью, но и через продуманную организацию работы всей рекомендательной системы.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍81🤣33👏26🗿20🤩19🔥11💯6❤3🤷♂1🐳1🙈1
Opus 4.8 появился в выборе моделей Claude Code в десктопном приложении.
Похоже, сегодня день релиза🚀
https://x.com/Machinelearrn/status/2060014943781412903
@ai_machinelearning_big_data
#claude #opus
Похоже, сегодня день релиза
https://x.com/Machinelearrn/status/2060014943781412903
@ai_machinelearning_big_data
#claude #opus
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥103🎉58❤16💯16🤩11👍9👏7🗿1
Together AI выложила метод квантования KV-кэша до 2-х бит - OSCAR (Offline Spectral Covariance-Aware Rotation).
KV-кэш - структура, в которой модель хранит промежуточные представления токенов при генерации.
На длинных контекстах он занимает значительную часть памяти GPU, и его сжатие позволяет либо обслуживать больше запросов одновременно, либо ускорять чтение из памяти.
Прежние попытки сжать кэш до 2-х бит ухудшали качество ответов.
OSCAR обходит это ограничение за счёт того, что поворот активаций перед квантованием рассчитывается исходя из статистики внимания.
Метод предлагает сначала собрать на калибровочном наборе ковариационные матрицы запросов и значений, взвешенных оценками внимания, и из них вывести персональный поворот для ключей и значений каждого слоя.
После этого применяется преобразование Адамара, выравнивающее значимость каналов, и перестановка с побитовым реверсом, чтобы соседние каналы попадали в один диапазон при поквантовом сжатии.
Первые 64 и последние 256 токенов контекста при этом хранятся в полной точности BF16 как опорные, всё остальное - в 2-х битах.
Калибровка выполняется один раз, поворот и пороги отсечения фиксируются, а онлайн-наценка по вычислениям скрывается внутри ядер декодирования.
На задачах AIME25, GPQA-Diamond, HumanEval, LiveCodeBench v6, MATH500 метод удерживается близко к точности базового режима BF16.
Разрыв составляет 3,78 пункта на Qwen3-4B-Thinking-2507, 1,42 пункта на Qwen3-8B и около нуля на Qwen3-32B и GLM-4.7-FP8.
По бенчмарку RULER-NIAH OSCAR работает стабильнее остальных двухбитных методов, но для меньших моделей разрыв с BF16 растёт по мере увеличения контекста: на Qwen3-4B-Thinking-2507 при 128 тыс. токенов точность падает с 81,0 до 39,5 пункта.
Для GLM-4.7-FP8 кривая практически совпадает с BF16.
В замерах на NVIDIA H100 скорость декодирования при контексте в 100 тыс. токенов выросла в 2,8–3,1 раза относительно BF16.
OSCAR совместим с paged attention и встраивается в SGLang без изменений на стороне клиента. Для экспериментов Together AI выложила предвычисленные матрицы для Qwen3-4B-Thinking, Qwen3-8B, Qwen3-32B и GLM-4.7-FP8.
@ai_machinelearning_big_data
#AI #ML #LLM #Quantization #OSCAR #TogetherAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍94👨💻40💯25🤔18🔥14👌11❤8👏4😐4🕊2🎃1
Anthropic только что выпустила Claude Opus 4.8.
Anthropic только что выпустила Claude Opus 4.8.
Три конкретных изменения по сравнению с 4.7: точнее судит о ситуации, честнее говорит о собственных ограничениях и дольше держит контекст при самостоятельной работе без подсказок.
По бенчмаркам: agentic coding (SWE-Bench Pro) 69.2% против 64.3% у 4.7 и 58.6% у GPT-5.5. Computer use (OSWorld) 83.4%. Knowledge work (GDPval-AA) 1890 против 1753 у предыдущей версии. В терминальном кодинге GPT-5.5 пока впереди с 78.2% против 74.6%, но разрыв небольшой.
Цена не изменилась.
В релизе упоминается апдейт про "более честную оценку собственного прогресса" — это прямо отвечает на одну из главных болей при работе с агентами: модель уверенно сообщает, что задача выполнена, хотя на самом деле застряла. Посмотрим, насколько это реально изменилось на практике.
claude.com/blog/introducing-dynamic-workflows-in-claude-code
Anthropic только что выпустила Claude Opus 4.8.
Три конкретных изменения по сравнению с 4.7: точнее судит о ситуации, честнее говорит о собственных ограничениях и дольше держит контекст при самостоятельной работе без подсказок.
По бенчмаркам: agentic coding (SWE-Bench Pro) 69.2% против 64.3% у 4.7 и 58.6% у GPT-5.5. Computer use (OSWorld) 83.4%. Knowledge work (GDPval-AA) 1890 против 1753 у предыдущей версии. В терминальном кодинге GPT-5.5 пока впереди с 78.2% против 74.6%, но разрыв небольшой.
Цена не изменилась.
В релизе упоминается апдейт про "более честную оценку собственного прогресса" — это прямо отвечает на одну из главных болей при работе с агентами: модель уверенно сообщает, что задача выполнена, хотя на самом деле застряла. Посмотрим, насколько это реально изменилось на практике.
claude.com/blog/introducing-dynamic-workflows-in-claude-code
1❤100👍43🤔32🔥20👏14🤓4😁2💘1
This media is not supported in your browser
VIEW IN TELEGRAM
Обновление позволяет писать JavaScript-скрипты для оркестрации субагентов в рамках одной сессии. Скрипты берут на себя логические ветвления и хранение промежуточных результатов.
Для сложных задач добавлен профиль конфигурации ultracode. В нем модель самостоятельно решает, когда запустить мультиагентный пайплайн для перекрестного код-ревью и автоматического исправления ошибок.
Воркфлоу доступны через CLI и расширения для IDE на тарифах Max и Team. Инструмент кратно увеличивает расход токенов.
claude.com
Французский ИИ-стартап обновил чат-бота Le Chat, переформатировав его в автономного агента Vibe, который интегрируется с Google Workspace, Outlook, Slack, GitHub, SharePoint и Notion.
Агент сканирует почту, парсит таблицы и верстает отчеты, предварительно согласовывая пошаговый план действий. Сценарии можно автоматизировать по расписанию или сохранять как шаблоны.
Появился Code Mode, где агенты работают в изолированных песочницах: пишут код, исправляют баги, создают тесты и доводят задачу до открытия PR. Фоновые сессии выполняются параллельно и не зависят от локального устройства.
Доступна бесплатная версия и тарифы: Pro (15 евро), Team (25 евро) и Enterprise. Точные лимиты не раскрываются - квоты подписок указаны как кратные множители.
mistral.ai
Google показала одноплатный компьютер Coral Board для локального запуска модели Gemma 3 270M.
В основе платы - открытый нейромодуль Coral NPU на архитектуре RISC-V от Google Research. Вычислительным ядром выступает SoC Synaptics Astra SL2619: двухъядерный процессор с частотой 2 ГГц, 2 ГБ оперативной памяти и производительностью 1 TOPS. Этого объема ресурсов хватает для инференса компактной LLM.
Плата спроектирована для интеграции в AR-очки, умные часы и наушники. На презентации показали работу синхронного переводчика, голосовое управление периферией и генерацию звука в реальном времени - модель YOLOv8 отслеживала движения медуз и конвертировала их в музыку.
Исходный код демо-проектов выложен на GitHub. Поставки стартуют летом, цена пока неизвестна.
Google Gemma в сети Х
Алгоритмы видеохостинга будут принудительно добавлять предупреждающую плашку при выявлении генерации, если создатель не указал это сам.
Маркировка станет жестко привязанной и неудаляемой для медиафайлов с метаданными стандарта C2PA, а также для роликов, созданных в Veo и Dream Screen. При ложном срабатывании решение можно оспорить через YouTube Studio.
Визуально метки разместятся под плеером в длинных видео и поверх контента в Shorts. Наличие плашки не влияет на монетизацию и алгоритмы рекомендаций.
Дополнительно YouTube делает общедоступным инструмент Likeness Detection для поиска дипфейков, систему откроют для авторов старше 18 лет.
blog.youtube
Amazon MGM Studios и AWS запустили фонд GenAI Creators и платформу Project Nara для ИИ-видеопроизводства. Участники грантовой программы получат финансирование и доступ к новой облачной инфраструктуре.
Project Nara автоматически маршрутизирует задачи и подбирает модель для каждого этапа генерации. Платформа комбинирует сторонние видеомодели и проприетарные решения Amazon, обученные на контенте студии.
Инфраструктура интегрирует ИИ-агентов напрямую с Maya, Blender, Nuke, Unreal Engine и пакетом Adobe. Встроенная система трекинга документирует происхождение всех сгенерированных ассетов для контроля авторских прав.
amazonmgmstudios.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍36❤13🔥6🤔5🎉2🤣1