Борис опять

#дайджест

Дайджест AI/ML за две недели 25 мая–7 июня 2026

NVIDIA: конференция Computex
Nemotron 3 Ultra - 550B MoE (55B активных), гибрид Mamba-2 + MoE + Attention с Multi-Token Prediction, контекст 1M, оупенсорс. Бесплатно на OpenRouter, платно цена - $0.50/$2.50.
Isaac GR00T Reference Humanoid Robot - открытый дизайн человекоподобного робота. Тело от Unitree, кисти от сингапурской Sharpa, мозг Jetson AGX Thor 128 ГБ VRAM и открытый стек Isaac GR00T с моделями, данными и симуляцией.
RTX Spark - спаситель твоей спины от тяжелых ноутбуков с GPU. 20-ядерный ARM-процессор+Blackwell GPU 128 ГБ и все в одном чипе. В продаже осенью.
SANA-Streaming - редактирование видео текстом в реальном времени, на одной RTX 5090: 1280×704/24 FPS на 5.56 ГБ VRAM, визуально не супер, скорее концепт. Статья
Cosmos3 - семейство омнимодальных моделей (давайте не пойдем на третий уровень вложенности новостей и я не буду их перечислять), например Cosmos3-Super-Text2Image - лучший оупенсорсный Text2Image на ArtificiAlanalysis.

Microsoft: Microsoft AI
семейство моделей разных модельностей, впервые от мелкомягких.
MAI-Thinking-1: ризонер на 1T параметров (35B активных), 256K контекста.
Выложили подробный техрепорт на 108 страниц. Бенчи: AIME 2025 97.0, SWE-bench Verified 73.5, LiveCodeBench v6 87.7.
MAI-Image-2.5 - на LMArena второе место в редактировании картинок, и уже встроена в PowerPoint.
MAI-Code-1-Flash - модель для агентного программирования, уже в GitHub Copilot.
MAI Transcribe-1.5 - SOTA переводчик на 43 языка,
MAI-Voice-2 - tts на 15 языков, есть русский
Все модели уже есть на OpenRouter.
Блогпост, Техрепорт

Anthropic: Claude Opus 4.8 Новый Opus по прежней цене $5/$25, прирост в основном на агентных и кодинг-задачах: SWE-bench Verified 88.6%, SWE-bench Pro 69.2%, Terminal-Bench 2.1 74.6%, на Online-Mind2Web 84%. Вместе с моделью в Claude Code завезли Dynamic Workflows: модель сама пишет оркестрацию и гоняет сотни параллельных саб-агентов. Блогпост

MiniMax: M3 Превью открытой M3 - уже доступна через API и бесплатно в OpenCode, веса и техрепорт обещают "в течение 10 дней". По собственным бенчам метят в уровень GPT-5.5 - ждём независимых замеров. Блогпост

Google: Gemma 4 12B Мультимодальный ризонер (текст, картинки, видео до 60 сек, аудио до 30 сек). Что необычно: мультимодальность без отдельного энкодера - сырые патчи и аудио-волну проецируют прямо в эмбеддинг-пространство LLM. Техрепорта пока нет. Заодно Google выложила квантированные версии линейки Gemma 4. Веса, QAT

Alibaba: Qwen-VLA Единая vision-language-action модель от команды Qwen под управление роботами: манипуляция, навигация и предсказание траекторий для разных платформ через DiT-декодер действий. Статья

Reve: Reve 2.0 Image модель со ставкой на слои как в фотошопе: модель сначала собирает композицию, где у каждого объекта свои координаты, слой и описание, а потом рендерит в 4K. В итоге можно править отдельные объекты без деградации качества.
Блогпост, Попробовать

Ideogram: Ideogram 4 - первая открытая модель Ideogram 9.3B. Лучшая среди открытых по внутренней дизайнерской арене. GitHub, Блогпост

xAI: Grok Imagine Video 1.5 Preview - видеогенератор 15 сек, 720p, нативный звук. По качеству где-то на фронтире. цена API $0.14/сек. FAL

ByteDance (Dreamina): OCTO - видео-вайб-режиссеринг(?)-агент. Делает сценарий, концепт, раскадровку и генерацию поверх Seedream 5.0 и Seedance 2.0. Dreamina

Genesis AI: Genesis World 1.0 - открытый стек симуляции для робототехники (физический движок + path-traced рендер + кросс-платформенный GPU-компилятор). Заявляют ускорение оценки политик в 400раз и 89% корреляции с реальным железом. Блогпост

Google: Magenta RealTime 2 - реалтайм генеративный синтезатор музыки. Работает локально на Мак. Латентность управления ~200 мс. Блогпост

🔥9❤3

7.36K viewsedited 18:02