Бесконечный контекст без полного внимания (by Tencent Hunyuan)
Главная проблема sparse attention — неточный выбор нужных чанков. Существующие методы суммируют чанки средним пулингом ключей, но это математически не совпадает с тем, что нужно (LogSumExp), и важные чанки теряются.
HiLS-Attention решает это двумя шагами: добавляет к каждому чанку специальный landmark-токен как сжатый ключ, а выбор чанков строит через иерархический softmax — сначала распределяет массу внимания по чанкам, потом внутри чанка. Ключевое: суррогатные оценки чанков участвуют в прямом проходе, поэтому градиенты LM-лосса напрямую обучают chunk summaries.
Результаты впечатляют: модель 345M, обученная на 8K контексте, экстраполирует до 4M токенов с точностью >90% на needle-in-a-haystack. На 7B достаточно 50B токенов дообучения, чтобы конвертировать full-attention модель и обогнать её на LongBench.
https://arxiv.org/abs/2607.02980
Главная проблема sparse attention — неточный выбор нужных чанков. Существующие методы суммируют чанки средним пулингом ключей, но это математически не совпадает с тем, что нужно (LogSumExp), и важные чанки теряются.
HiLS-Attention решает это двумя шагами: добавляет к каждому чанку специальный landmark-токен как сжатый ключ, а выбор чанков строит через иерархический softmax — сначала распределяет массу внимания по чанкам, потом внутри чанка. Ключевое: суррогатные оценки чанков участвуют в прямом проходе, поэтому градиенты LM-лосса напрямую обучают chunk summaries.
Результаты впечатляют: модель 345M, обученная на 8K контексте, экстраполирует до 4M токенов с точностью >90% на needle-in-a-haystack. На 7B достаточно 50B токенов дообучения, чтобы конвертировать full-attention модель и обогнать её на LongBench.
https://arxiv.org/abs/2607.02980
👍1
Microsoft Research представила Flint — язык визуализации, созданный специально для работы с AI-агентами.
Проблема была простой: чтобы получить красивый график в Vega-Lite или ECharts, нужно писать длинные и хрупкие спецификации. LLM-агенты с этим справляются плохо — ошибаются в деталях, код сложно проверить и исправить.
Flint решает это через семантические типы данных. Агент указывает, что поле — это «дата» или «прибыль», а компилятор сам выбирает масштаб, цвета, отступы и форматирование. Одна компактная спецификация компилируется сразу в Vega-Lite, ECharts или Chart.js.
В тестах Flint обошёл прямую генерацию Vega-Lite по оценкам GPT-моделей. Уже используется в проекте Data Formulator.
Для интеграции с агентами выпущен MCP-сервер flint-chart-mcp. Проект открытый: github.com/microsoft/flint-chart
https://www.microsoft.com/en-us/research/blog/flint-a-visualization-language-for-the-ai-era/
Проблема была простой: чтобы получить красивый график в Vega-Lite или ECharts, нужно писать длинные и хрупкие спецификации. LLM-агенты с этим справляются плохо — ошибаются в деталях, код сложно проверить и исправить.
Flint решает это через семантические типы данных. Агент указывает, что поле — это «дата» или «прибыль», а компилятор сам выбирает масштаб, цвета, отступы и форматирование. Одна компактная спецификация компилируется сразу в Vega-Lite, ECharts или Chart.js.
В тестах Flint обошёл прямую генерацию Vega-Lite по оценкам GPT-моделей. Уже используется в проекте Data Formulator.
Для интеграции с агентами выпущен MCP-сервер flint-chart-mcp. Проект открытый: github.com/microsoft/flint-chart
https://www.microsoft.com/en-us/research/blog/flint-a-visualization-language-for-the-ai-era/
GitHub
GitHub - microsoft/flint-chart: 🪄 Flint is a visualization language that lets AI agents reliably create expressive, good-looking…
🪄 Flint is a visualization language that lets AI agents reliably create expressive, good-looking charts from simple, human-editable chart specs. - microsoft/flint-chart
Nvidia: GPU-ускоренный Presto на GB200 NVL72 бьёт CPU-кластеры в 8 раз
Nvidia опубликовала результаты тестов аналитической системы Presto, запущенной на GPU-серверах DGX B200 и GB200 NVL72. Итог впечатляет: один узел с 8 GPU обходит кластер из 8-10 CPU-серверов по скорости в 8 раз.
Что под капотом: библиотека cuDF для выполнения SQL-запросов на GPU, NVLink 5.0 с пропускной способностью 1800 ГБ/с для связи между GPU, и GPUDirect Storage — данные идут прямо из хранилища IBM Storage Scale в память GPU, минуя CPU.
На наборах данных от 1 до 30 ТБ оптимизация ввода-вывода и коммуникаций дала ещё +64% к скорости запросов.
Для пользователей это означает: меньше железа, меньше задержек, быстрее итерации — особенно актуально для AI-агентов, которым нужны оперативные аналитические ответы.
https://developer.nvidia.com/blog/running-low-latency-analytical-workloads-with-gpu-accelerated-presto-on-nvidia-gb200-nvl72/
Nvidia опубликовала результаты тестов аналитической системы Presto, запущенной на GPU-серверах DGX B200 и GB200 NVL72. Итог впечатляет: один узел с 8 GPU обходит кластер из 8-10 CPU-серверов по скорости в 8 раз.
Что под капотом: библиотека cuDF для выполнения SQL-запросов на GPU, NVLink 5.0 с пропускной способностью 1800 ГБ/с для связи между GPU, и GPUDirect Storage — данные идут прямо из хранилища IBM Storage Scale в память GPU, минуя CPU.
На наборах данных от 1 до 30 ТБ оптимизация ввода-вывода и коммуникаций дала ещё +64% к скорости запросов.
Для пользователей это означает: меньше железа, меньше задержек, быстрее итерации — особенно актуально для AI-агентов, которым нужны оперативные аналитические ответы.
https://developer.nvidia.com/blog/running-low-latency-analytical-workloads-with-gpu-accelerated-presto-on-nvidia-gb200-nvl72/
NVIDIA Technical Blog
Running Low-Latency Analytical Workloads with GPU-Accelerated Presto on NVIDIA GB200 NVL72
Presto is an open source, distributed SQL engine for running fast, interactive queries on very large datasets. On NVIDIA GPUs, Presto delivers peak performance for analytical query workloads and…
Nvidia Tech — как прокачать открытую модель без дообучения
Nvidia опубликовала туториал по «харнес-инжинирингу» для Nemotron 3 Ultra в связке с LangChain Deep Agents. Суть: вместо дорогостоящего файнтюнинга можно настроить поведение агента через профили харнеса — промпты, middleware и кастомные инструкции.
Пример из практики: модель проваливала тест на чтение большого файла — останавливалась на первой странице и давала неверный ответ. Разработчики добавили один middleware-класс, который подсказывает модели, что файл не закончился и нужно листать дальше. Результат: все 3 падавших теста прошли, общий бенчмарк вырос с 94 до 96 из 127.
Важно: такой подход позволяет open-source моделям приближаться по точности к проприетарным фронтирным моделям без затрат на обучение. Процесс итеративный и поддаётся автоматизации через LangSmith.
https://developer.nvidia.com/blog/create-a-langchain-deep-agents-harness-profile-for-nvidia-nemotron-3-ultra-to-improve-performance/
Nvidia опубликовала туториал по «харнес-инжинирингу» для Nemotron 3 Ultra в связке с LangChain Deep Agents. Суть: вместо дорогостоящего файнтюнинга можно настроить поведение агента через профили харнеса — промпты, middleware и кастомные инструкции.
Пример из практики: модель проваливала тест на чтение большого файла — останавливалась на первой странице и давала неверный ответ. Разработчики добавили один middleware-класс, который подсказывает модели, что файл не закончился и нужно листать дальше. Результат: все 3 падавших теста прошли, общий бенчмарк вырос с 94 до 96 из 127.
Важно: такой подход позволяет open-source моделям приближаться по точности к проприетарным фронтирным моделям без затрат на обучение. Процесс итеративный и поддаётся автоматизации через LangSmith.
https://developer.nvidia.com/blog/create-a-langchain-deep-agents-harness-profile-for-nvidia-nemotron-3-ultra-to-improve-performance/
NVIDIA Technical Blog
Create a LangChain Deep Agents Harness Profile for NVIDIA Nemotron 3 Ultra to Improve Performance
Agentic systems often face a trade-off between accuracy and cost. The highest-performing proprietary frontier models and harnesses provide top accuracy but are expensive. Fine-tuning offers one way to…
Vidu S1: видеогенерация в реальном времени с голосовым управлением (by Tsinghua University)
Sora, Wan и другие модели генерируют видео по принципу "жди минуты, получи результат". Нельзя вмешаться в процесс, нельзя говорить голосом — только ждать.
Vidu S1 меняет парадигму: это потоковая авторегрессионная модель, которая генерирует видео прямо во время взаимодействия с пользователем. Ключевые фишки:
1. Голос как управляющий сигнал — речь пользователя напрямую направляет, что генерировать дальше.
2. Бесконечный стрим без деградации — специальные механизмы борются с накоплением ошибок, которые обычно приводят к "распаду" видео.
3. Реальное время — 42 FPS при разрешении 540p на обычных GPU благодаря TurboDiffusion и TurboServe.
На бенчмарках Vidu-StreamBench и HDTF модель показывает лучшие результаты по синхронизации губ, качеству и консистентности.
https://arxiv.org/abs/2607.03118
Sora, Wan и другие модели генерируют видео по принципу "жди минуты, получи результат". Нельзя вмешаться в процесс, нельзя говорить голосом — только ждать.
Vidu S1 меняет парадигму: это потоковая авторегрессионная модель, которая генерирует видео прямо во время взаимодействия с пользователем. Ключевые фишки:
1. Голос как управляющий сигнал — речь пользователя напрямую направляет, что генерировать дальше.
2. Бесконечный стрим без деградации — специальные механизмы борются с накоплением ошибок, которые обычно приводят к "распаду" видео.
3. Реальное время — 42 FPS при разрешении 540p на обычных GPU благодаря TurboDiffusion и TurboServe.
На бенчмарках Vidu-StreamBench и HDTF модель показывает лучшие результаты по синхронизации губ, качеству и консистентности.
https://arxiv.org/abs/2607.03118
ИИ, который объясняет ПОЧЕМУ структура определяет свойства, а не просто предсказывает ответ (by Shanghai AI Lab)
SciReasoner — мультимодальная модель, которая работает с белками, молекулами и кристаллами как с "родными" объектами, а не переводит их в текст. Ключевая идея: структурные токены — это не описания, а единицы доказательств, на которые модель ссылается в цепочке рассуждений.
Как это работает: специальные токенизаторы (ConfSeq для молекул, Foldseek для белков, SLICES для кристаллов) кодируют геометрию, топологию и симметрию. LLM-бэкбон (Qwen3) генерирует рассуждения, которые явно ссылаются на конкретные фрагменты структуры.
Результаты на 86 бенчмарках: SOTA на 67 задачах. На ретросинтезе точность выросла с 0.63 до 0.72, на предсказании функций белков-сирот Fmax с 0.42 до 0.55.
https://arxiv.org/abs/2607.07708
SciReasoner — мультимодальная модель, которая работает с белками, молекулами и кристаллами как с "родными" объектами, а не переводит их в текст. Ключевая идея: структурные токены — это не описания, а единицы доказательств, на которые модель ссылается в цепочке рассуждений.
Как это работает: специальные токенизаторы (ConfSeq для молекул, Foldseek для белков, SLICES для кристаллов) кодируют геометрию, топологию и симметрию. LLM-бэкбон (Qwen3) генерирует рассуждения, которые явно ссылаются на конкретные фрагменты структуры.
Результаты на 86 бенчмарках: SOTA на 67 задачах. На ретросинтезе точность выросла с 0.63 до 0.72, на предсказании функций белков-сирот Fmax с 0.42 до 0.55.
https://arxiv.org/abs/2607.07708
👍1
LingBot-Video: первая open-source MoE-модель для видео с физическим здравым смыслом
Большинство видеомоделей умеют делать красивые ролики, но не понимают физику. LingBot-Video пытается это исправить сразу тремя ходами.
Архитектура: вместо dense-трансформера — Sparse Mixture-of-Experts поверх DiT. Каждый токен активирует только часть экспертов, что даёт масштабируемость без роста вычислительных затрат. Единый single-stream обрабатывает T2I, T2V и I2V в одном пайплайне без раздельных энкодеров.
Данные: интернет-видео смешивается с роботизированными датасетами (манипуляции, навигация, egocentric). Специальный data profiling engine фильтрует и балансирует источники.
Обучение: мультидимензиональная reward-система добавляет сигналы физической правдоподобности и успешности задачи поверх стандартных перцептивных метрик.
Идея простая: красивое видео и физически корректное видео — разные задачи, и архитектура должна это учитывать.
https://arxiv.org/abs/2607.07675
Большинство видеомоделей умеют делать красивые ролики, но не понимают физику. LingBot-Video пытается это исправить сразу тремя ходами.
Архитектура: вместо dense-трансформера — Sparse Mixture-of-Experts поверх DiT. Каждый токен активирует только часть экспертов, что даёт масштабируемость без роста вычислительных затрат. Единый single-stream обрабатывает T2I, T2V и I2V в одном пайплайне без раздельных энкодеров.
Данные: интернет-видео смешивается с роботизированными датасетами (манипуляции, навигация, egocentric). Специальный data profiling engine фильтрует и балансирует источники.
Обучение: мультидимензиональная reward-система добавляет сигналы физической правдоподобности и успешности задачи поверх стандартных перцептивных метрик.
Идея простая: красивое видео и физически корректное видео — разные задачи, и архитектура должна это учитывать.
https://arxiv.org/abs/2607.07675
NVIDIA представила процессор Vera CPU для AI-фабрик
NVIDIA анонсировала процессор Vera CPU, разработанный специально для агентных AI-систем. Ключевые цифры: производительность на ядро в 1,8 раза выше при полной нагрузке, пиковая задержка ниже на 40%, пропускная способность памяти более чем в 3 раза выше — и всё это при вдвое меньшем энергопотреблении по сравнению с x86-процессорами.
Vera построен на 88 ядрах Olympus в монолитном кристалле — без многочиплетной архитектуры, которая создаёт задержки при переходе между блоками. Это критично для агентных систем, где GPU постоянно ждёт CPU: выполнения инструментов, кода, обработки данных.
Для пользователей это означает более быстрые ответы AI-агентов, лучшее качество обучения с подкреплением и более высокую утилизацию GPU. Проще говоря — больше полезной работы за тот же бюджет на железо.
https://developer.nvidia.com/blog/nvidia-vera-cpu-boosts-ai-factory-throughput-to-accelerate-agentic-workloads/
NVIDIA анонсировала процессор Vera CPU, разработанный специально для агентных AI-систем. Ключевые цифры: производительность на ядро в 1,8 раза выше при полной нагрузке, пиковая задержка ниже на 40%, пропускная способность памяти более чем в 3 раза выше — и всё это при вдвое меньшем энергопотреблении по сравнению с x86-процессорами.
Vera построен на 88 ядрах Olympus в монолитном кристалле — без многочиплетной архитектуры, которая создаёт задержки при переходе между блоками. Это критично для агентных систем, где GPU постоянно ждёт CPU: выполнения инструментов, кода, обработки данных.
Для пользователей это означает более быстрые ответы AI-агентов, лучшее качество обучения с подкреплением и более высокую утилизацию GPU. Проще говоря — больше полезной работы за тот же бюджет на железо.
https://developer.nvidia.com/blog/nvidia-vera-cpu-boosts-ai-factory-throughput-to-accelerate-agentic-workloads/
NVIDIA Technical Blog
NVIDIA Vera CPU Boosts AI Factory Throughput to Accelerate Agentic Workloads
Agentic systems turn model reasoning into action through multi-step workflows that combine inference, tool use, code execution, retrieval, orchestration, and result handling. As these systems scale…
Amazon Science выпустила Turnstile — небольшой прокси-сервер на Rust для обучения языковых моделей с подкреплением (RL).
Проблема: при агентных задачах (написание кода, веб-навигация) модель работает через «обвязку» — harness. Текстовые транскрипты взаимодействий выглядят корректно, но теряют точные токен-ID, которые нужны тренеру. Даже пробел или другой формат JSON меняет токены — и модель обучается против «другого прошлого», чем то, что реально видела.
Turnstile встаёт между harness и бэкендом, перехватывает каждый запрос и записывает точные токен-ID, логарифмические вероятности и маски потерь прямо в момент генерации.
Главное: harness менять не нужно — он продолжает говорить стандартный OpenAI Chat Completions API. Amazon уже использует Turnstile в реальных RL-тренировках двух агентов — текстового и мультимодального.
Turnstile открыт и доступен прямо сейчас.
https://www.amazon.science/blog/capturing-token-ids-during-agentic-interactions-for-better-reinforcement-learning
Проблема: при агентных задачах (написание кода, веб-навигация) модель работает через «обвязку» — harness. Текстовые транскрипты взаимодействий выглядят корректно, но теряют точные токен-ID, которые нужны тренеру. Даже пробел или другой формат JSON меняет токены — и модель обучается против «другого прошлого», чем то, что реально видела.
Turnstile встаёт между harness и бэкендом, перехватывает каждый запрос и записывает точные токен-ID, логарифмические вероятности и маски потерь прямо в момент генерации.
Главное: harness менять не нужно — он продолжает говорить стандартный OpenAI Chat Completions API. Amazon уже использует Turnstile в реальных RL-тренировках двух агентов — текстового и мультимодального.
Turnstile открыт и доступен прямо сейчас.
https://www.amazon.science/blog/capturing-token-ids-during-agentic-interactions-for-better-reinforcement-learning
Amazon Science
Capturing token IDs during agentic interactions for better reinforcement learning
A new Rust proxy called Turnstile sits between the model backend and the agent harness to capture information lost in mere text transcripts.
IBM Research предлагает заменить «скелет» трансформеров
Исследователи IBM Research представили CoFrGeNets — новый тип архитектуры нейросетей, который может заменить базовую структуру трансформерных моделей. По сути, это как поменять кости в теле ИИ, сохранив всё остальное.
Главная идея: стандартные трансформеры обучаются в условиях, которые могут закреплять нежелательное поведение модели. CoFrGeNets предлагают более предсказуемую и объяснимую основу — что особенно важно для планирования и генеративного ИИ.
Для пользователей это значит потенциально более надёжные и прозрачные модели, которые реже «галлюцинируют» и лучше поддаются контролю. IBM делает ставку на explainable AI — и это направление становится всё актуальнее по мере роста регуляторного давления на индустрию.
https://research.ibm.com/blog/cofrgenets-replace-the-bones-of-transformer-based-models?utm_medium=rss&utm_source=rss
Исследователи IBM Research представили CoFrGeNets — новый тип архитектуры нейросетей, который может заменить базовую структуру трансформерных моделей. По сути, это как поменять кости в теле ИИ, сохранив всё остальное.
Главная идея: стандартные трансформеры обучаются в условиях, которые могут закреплять нежелательное поведение модели. CoFrGeNets предлагают более предсказуемую и объяснимую основу — что особенно важно для планирования и генеративного ИИ.
Для пользователей это значит потенциально более надёжные и прозрачные модели, которые реже «галлюцинируют» и лучше поддаются контролю. IBM делает ставку на explainable AI — и это направление становится всё актуальнее по мере роста регуляторного давления на индустрию.
https://research.ibm.com/blog/cofrgenets-replace-the-bones-of-transformer-based-models?utm_medium=rss&utm_source=rss
IBM Research
CoFrGeNets replace the ‘bones’ of transformer-based models
This new approach, a practical and conceptual shift, points to lighter-weight generative AI models that perform competitively, and in many cases even better.
Ускорить LLM-инференс на 60–85% — без потери качества
Speculative decoding — популярный трюк: маленькая черновая модель предлагает токены, большая проверяет их все за один проход. Проблема: параллельные черновики генерируют токены независимо, поэтому качество хвоста блока резко падает. Авторегрессионные черновики точнее, но медленнее.
DSpark решает это двумя способами. Во-первых, semi-autoregressive генерация: тяжёлый параллельный backbone + лёгкая последовательная голова, которая добавляет зависимости между токенами. Во-вторых, confidence-scheduled verification: специальная голова оценивает вероятность принятия каждого токена, и hardware-aware планировщик отбрасывает низкоуверенные хвосты — не тратя ресурсы целевой модели впустую.
Результат: +30% к принятой длине блока по сравнению с Eagle3, +18% по сравнению с DFlash. В продакшне DeepSeek-V4 — ускорение генерации для пользователей на 60–85% при том же throughput.
https://arxiv.org/abs/2607.05147
Speculative decoding — популярный трюк: маленькая черновая модель предлагает токены, большая проверяет их все за один проход. Проблема: параллельные черновики генерируют токены независимо, поэтому качество хвоста блока резко падает. Авторегрессионные черновики точнее, но медленнее.
DSpark решает это двумя способами. Во-первых, semi-autoregressive генерация: тяжёлый параллельный backbone + лёгкая последовательная голова, которая добавляет зависимости между токенами. Во-вторых, confidence-scheduled verification: специальная голова оценивает вероятность принятия каждого токена, и hardware-aware планировщик отбрасывает низкоуверенные хвосты — не тратя ресурсы целевой модели впустую.
Результат: +30% к принятой длине блока по сравнению с Eagle3, +18% по сравнению с DFlash. В продакшне DeepSeek-V4 — ускорение генерации для пользователей на 60–85% при том же throughput.
https://arxiv.org/abs/2607.05147
LLM-как-верификатор: новая ось масштабирования
Мы умеем масштабировать генерацию — данные, compute, RLHF. А верификацию? Оказывается, и она масштабируется, просто никто не смотрел в ту сторону.
Ключевая идея: вместо того чтобы просить LLM выдать дискретную оценку (1-10), авторы берут логиты токенов-оценок и считают их матожидание. Это даёт непрерывный сигнал вместо грубого числа.
Три оси масштабирования верификации:
1. Гранулярность шкалы (больше токенов-оценок → точнее)
2. Повторные оценки (снижает дисперсию)
3. Декомпозиция критериев (снижает bias промпта)
Результат: SWE-Bench Verified 78.2%, Terminal-Bench V2 86.5%, и x1.8 прирост sample efficiency в robotics RL — без дополнительного обучения верификатора.
Бонус: скор верификатора коррелирует с прогрессом агента по времени — можно мониторить, насколько агент продвинулся к цели.
https://arxiv.org/abs/2607.05391
Мы умеем масштабировать генерацию — данные, compute, RLHF. А верификацию? Оказывается, и она масштабируется, просто никто не смотрел в ту сторону.
Ключевая идея: вместо того чтобы просить LLM выдать дискретную оценку (1-10), авторы берут логиты токенов-оценок и считают их матожидание. Это даёт непрерывный сигнал вместо грубого числа.
Три оси масштабирования верификации:
1. Гранулярность шкалы (больше токенов-оценок → точнее)
2. Повторные оценки (снижает дисперсию)
3. Декомпозиция критериев (снижает bias промпта)
Результат: SWE-Bench Verified 78.2%, Terminal-Bench V2 86.5%, и x1.8 прирост sample efficiency в robotics RL — без дополнительного обучения верификатора.
Бонус: скор верификатора коррелирует с прогрессом агента по времени — можно мониторить, насколько агент продвинулся к цели.
https://arxiv.org/abs/2607.05391
Как честно сравнить 30 роботов-манипуляторов сразу в симуляции и реальном мире?
Главная боль в робототехнике: симуляция быстрая, но не отражает реальность; реальные эксперименты точные, но дорогие и нервоспроизводимые. RoboDojo решает это, объединяя оба мира в одном бенчмарке.
Что внутри: 42 задачи в симуляции (Isaac Sim с гетерогенным параллелизмом) и 18 задач в реале на трёх типах роботов. Симуляция покрывает 5 измерений: обобщение, память, точность, длинный горизонт планирования и следование открытым инструкциям. Реальные задачи проверяют поведение при шуме сенсоров, ошибках актуаторов и контактно-богатых взаимодействиях.
Фишка: RoboDojo-RealEval — стандартизированная система с удалённым облачным доступом. Один раз интегрировал политику в XPolicyLab — и она сразу тестируется везде. Оценили 30 политик, опубликовали публичный лидерборд.
Сайт: robodojo-benchmark.com
https://arxiv.org/abs/2607.04434
Главная боль в робототехнике: симуляция быстрая, но не отражает реальность; реальные эксперименты точные, но дорогие и нервоспроизводимые. RoboDojo решает это, объединяя оба мира в одном бенчмарке.
Что внутри: 42 задачи в симуляции (Isaac Sim с гетерогенным параллелизмом) и 18 задач в реале на трёх типах роботов. Симуляция покрывает 5 измерений: обобщение, память, точность, длинный горизонт планирования и следование открытым инструкциям. Реальные задачи проверяют поведение при шуме сенсоров, ошибках актуаторов и контактно-богатых взаимодействиях.
Фишка: RoboDojo-RealEval — стандартизированная система с удалённым облачным доступом. Один раз интегрировал политику в XPolicyLab — и она сразу тестируется везде. Оценили 30 политик, опубликовали публичный лидерборд.
Сайт: robodojo-benchmark.com
https://arxiv.org/abs/2607.04434
Microsoft Research выпустила Aurora 1.5 — крупное обновление своей AI-модели для прогнозирования погоды и анализа состояния Земли.
Что нового: модель получила 22 дополнительных метеопараметра (раньше было 4), почасовое разрешение прогнозов и ансамблевое прогнозирование — то есть теперь модель строит сразу несколько сценариев развития событий с оценкой вероятности каждого.
Почему это важно: Aurora 1.5 обходит ансамблевые прогнозы ECMWF — лучшей в мире физической модели — на 88,9% тестовых показателей. На примере урагана Helene модель снизила ошибку трека на треть по сравнению с предыдущей версией.
Для пользователей: модель полностью открыта — код на GitHub, веса на Hugging Face. Исследователи и разработчики могут использовать её в энергетике, сельском хозяйстве, логистике и климатическом планировании. Уже сейчас Aurora применяется для оценки углеродного поглощения почвами и исследований совместно с Метеослужбой Великобритании.
https://www.microsoft.com/en-us/research/blog/aurora-1-5-extending-open-foundation-models-for-weather-and-earth-system-applications/
Что нового: модель получила 22 дополнительных метеопараметра (раньше было 4), почасовое разрешение прогнозов и ансамблевое прогнозирование — то есть теперь модель строит сразу несколько сценариев развития событий с оценкой вероятности каждого.
Почему это важно: Aurora 1.5 обходит ансамблевые прогнозы ECMWF — лучшей в мире физической модели — на 88,9% тестовых показателей. На примере урагана Helene модель снизила ошибку трека на треть по сравнению с предыдущей версией.
Для пользователей: модель полностью открыта — код на GitHub, веса на Hugging Face. Исследователи и разработчики могут использовать её в энергетике, сельском хозяйстве, логистике и климатическом планировании. Уже сейчас Aurora применяется для оценки углеродного поглощения почвами и исследований совместно с Метеослужбой Великобритании.
https://www.microsoft.com/en-us/research/blog/aurora-1-5-extending-open-foundation-models-for-weather-and-earth-system-applications/
Microsoft Research
Aurora 1.5: Extending open foundation models for weather and Earth-system applications - Microsoft Research
Aurora 1.5 adds 22 more variables, hourly temporal resolution, and probabilistic ensemble forecasting to the Aurora foundation model, making it more useful for real-world weather, climate, and energy applications.
👍1
Nvidia Tech: хост-оффлоадинг активаций ускоряет обучение LLM на 57%
Инженеры Nvidia опубликовали технику снижения нагрузки на видеопамять GPU при обучении больших языковых моделей в JAX. Суть проста: вместо того чтобы пересчитывать активации заново (rematerialization), их временно выгружают в оперативную память CPU, а потом подгружают обратно при обратном проходе.
Особенно хорошо это работает на Grace Blackwell — там CPU и GPU соединены через NVLink-C2C с пропускной способностью 900 ГБ/с, что делает перенос данных практически незаметным.
Результаты на 128 GPU (GB200 NVL72):
— DeepSeek-V3 671B: +57% к производительности по сравнению с rematerialization
— Llama 3.1 405B: заметный прирост при оффлоадинге QKV-активаций
— Batch size вырос с 256 до 1024 без OOM-ошибок
Для пользователей это означает возможность обучать более крупные модели с большими батчами без апгрейда железа — просто за счёт грамотного управления памятью.
https://developer.nvidia.com/blog/reducing-high-bandwidth-memory-bottlenecks-in-jax-based-llm-training-with-host-offloading/
Инженеры Nvidia опубликовали технику снижения нагрузки на видеопамять GPU при обучении больших языковых моделей в JAX. Суть проста: вместо того чтобы пересчитывать активации заново (rematerialization), их временно выгружают в оперативную память CPU, а потом подгружают обратно при обратном проходе.
Особенно хорошо это работает на Grace Blackwell — там CPU и GPU соединены через NVLink-C2C с пропускной способностью 900 ГБ/с, что делает перенос данных практически незаметным.
Результаты на 128 GPU (GB200 NVL72):
— DeepSeek-V3 671B: +57% к производительности по сравнению с rematerialization
— Llama 3.1 405B: заметный прирост при оффлоадинге QKV-активаций
— Batch size вырос с 256 до 1024 без OOM-ошибок
Для пользователей это означает возможность обучать более крупные модели с большими батчами без апгрейда железа — просто за счёт грамотного управления памятью.
https://developer.nvidia.com/blog/reducing-high-bandwidth-memory-bottlenecks-in-jax-based-llm-training-with-host-offloading/
NVIDIA Technical Blog
Reducing High-Bandwidth Memory Bottlenecks in JAX-Based LLM Training with Host Offloading
Large language model (LLM) training workloads increasingly run into GPU memory limits before compute is fully used. Model weights, gradients, optimizer states, communication buffers…
Nvidia Tech обновила документацию и инструменты CUDA: вышел подробный гайд по kernel fusion — технике объединения нескольких GPU-операций в одно ядро.
Суть проста: GPU настолько быстр, что даже высокоскоростная память становится узким местом. Kernel fusion убирает промежуточные буферы — данные остаются в регистрах, а не гоняются туда-обратно через глобальную память.
На примере операции sum(abs(x)) разница впечатляет: два раздельных ядра тратят 3.51 мс и перекачивают 3 ГБ данных, а одно слитое — 1.18 мс и всего 1 ГБ. Ускорение в 3 раза при той же пропускной способности памяти.
Разобраны три подхода: ручное написание на CUDA C++, автоматическая компиляция через torch.compile в PyTorch и использование библиотек вроде CUB. Примеры используют новый CCCL Runtime из CUDA 13.2.
Полезно всем, кто оптимизирует ML-инференс или любые GPU-вычисления.
https://developer.nvidia.com/blog/kernel-fusion-in-nvidia-cuda-optimizing-memory-traffic-and-launch-overhead/
Суть проста: GPU настолько быстр, что даже высокоскоростная память становится узким местом. Kernel fusion убирает промежуточные буферы — данные остаются в регистрах, а не гоняются туда-обратно через глобальную память.
На примере операции sum(abs(x)) разница впечатляет: два раздельных ядра тратят 3.51 мс и перекачивают 3 ГБ данных, а одно слитое — 1.18 мс и всего 1 ГБ. Ускорение в 3 раза при той же пропускной способности памяти.
Разобраны три подхода: ручное написание на CUDA C++, автоматическая компиляция через torch.compile в PyTorch и использование библиотек вроде CUB. Примеры используют новый CCCL Runtime из CUDA 13.2.
Полезно всем, кто оптимизирует ML-инференс или любые GPU-вычисления.
https://developer.nvidia.com/blog/kernel-fusion-in-nvidia-cuda-optimizing-memory-traffic-and-launch-overhead/
NVIDIA Technical Blog
Kernel Fusion in NVIDIA CUDA: Optimizing Memory Traffic and Launch Overhead
There are many ways to optimize code for GPUs. In this post, you’ll learn how kernel fusion can improve memory bandwidth and reduce kernel launch overhead, along with multiple ways to apply it in…
Jet-Long: расширяем контекст LLM до 128K без дообучения (by NVIDIA)
Проблема: LLM обучают на коротких окнах (4K–32K токенов), а в продакшне нужны 100K+. Дообучать дорого и ломает короткий контекст. Значит, надо научить модель экстраполировать позиции без файнтюнинга.
Ключевая идея Jet-Long: разбить внимание на два окна. Ближние токены обрабатываются обычным RoPE. Дальние токены получают динамически сжатые позиции через floor(x/G), где G растёт вместе с длиной последовательности — ровно настолько, чтобы все углы поворота оставались в тренировочном распределении.
Фишка в том, что G пересчитывается на лету, а KV-кэш не трогается: вместо переписывания кэша применяется коррекционная ротация прямо в FlashAttention.
Результат: +4.79 pp над лучшим zero-shot бейзлайном на RULER, скорость 1.28–1.39× быстрее FA2 на H100, overhead на генерацию ≤4%.
https://arxiv.org/abs/2607.07740
Проблема: LLM обучают на коротких окнах (4K–32K токенов), а в продакшне нужны 100K+. Дообучать дорого и ломает короткий контекст. Значит, надо научить модель экстраполировать позиции без файнтюнинга.
Ключевая идея Jet-Long: разбить внимание на два окна. Ближние токены обрабатываются обычным RoPE. Дальние токены получают динамически сжатые позиции через floor(x/G), где G растёт вместе с длиной последовательности — ровно настолько, чтобы все углы поворота оставались в тренировочном распределении.
Фишка в том, что G пересчитывается на лету, а KV-кэш не трогается: вместо переписывания кэша применяется коррекционная ротация прямо в FlashAttention.
Результат: +4.79 pp над лучшим zero-shot бейзлайном на RULER, скорость 1.28–1.39× быстрее FA2 на H100, overhead на генерацию ≤4%.
https://arxiv.org/abs/2607.07740
👍1
Линейное внимание: как не потерять качество в погоне за скоростью? (by ETH Zurich)
Стандартный трансформер работает за O(T²) — квадратично от длины контекста. Линейное внимание решает это через рекуррентную память фиксированного размера: O(T) при обучении и O(1) на токен при инференсе. Но за скорость платишь качеством.
Авторы из ETH Zurich систематизируют семейство DeltaNet-архитектур в единой нотации. Ключевая идея DeltaNet — писать в память не само значение, а ошибку предсказания: r = v − W·k. Это уменьшает интерференцию между хранимыми ассоциациями. Дальше идут Gated DeltaNet, Kimi Delta Attention и Gated DeltaNet-2 — каждый добавляет более тонкий контроль: скалярное затухание, поканальные ворота стирания и записи.
Плюс авторы вводят Cross-Layer Value Routing (CLVR) — лёгкий способ передавать сигнал между слоями без потери линейности. Маршрутизация значений (а не ошибок) между слоями даёт небольшое снижение validation loss.
https://arxiv.org/abs/2607.07953
Стандартный трансформер работает за O(T²) — квадратично от длины контекста. Линейное внимание решает это через рекуррентную память фиксированного размера: O(T) при обучении и O(1) на токен при инференсе. Но за скорость платишь качеством.
Авторы из ETH Zurich систематизируют семейство DeltaNet-архитектур в единой нотации. Ключевая идея DeltaNet — писать в память не само значение, а ошибку предсказания: r = v − W·k. Это уменьшает интерференцию между хранимыми ассоциациями. Дальше идут Gated DeltaNet, Kimi Delta Attention и Gated DeltaNet-2 — каждый добавляет более тонкий контроль: скалярное затухание, поканальные ворота стирания и записи.
Плюс авторы вводят Cross-Layer Value Routing (CLVR) — лёгкий способ передавать сигнал между слоями без потери линейности. Маршрутизация значений (а не ошибок) между слоями даёт небольшое снижение validation loss.
https://arxiv.org/abs/2607.07953
👍1
Sparse Delta Memory: RNN с памятью в миллион слотов (by Meta AI)
Главная беда линейных RNN — крошечное состояние. Трансформер хранит весь KV-кэш, но он растёт линейно. RNN держит константную память, но забывает всё дальше 10k токенов.
SDM решает это элегантно: берёт правило обновления Gated DeltaNet и делает его разреженным. Вместо обновления всей плотной матрицы состояния — выбираем топ-W слотов через Product Key Memory и обновляем только их. Итог: размер памяти вырастает в 1000 раз при тех же FLOPs.
Бонус: большое состояние можно инициализировать как обучаемый параметр — модель запоминает знания из претрейнинга прямо в M0, без затрат на инференс.
Результат на 8B модели, обученной на 1T токенов: SDM бьёт GDN на длинных контекстах (RULER benchmark) и не хуже полного внимания на коротких. До 1 миллиона токенов — константная память.
https://arxiv.org/abs/2607.07386
Главная беда линейных RNN — крошечное состояние. Трансформер хранит весь KV-кэш, но он растёт линейно. RNN держит константную память, но забывает всё дальше 10k токенов.
SDM решает это элегантно: берёт правило обновления Gated DeltaNet и делает его разреженным. Вместо обновления всей плотной матрицы состояния — выбираем топ-W слотов через Product Key Memory и обновляем только их. Итог: размер памяти вырастает в 1000 раз при тех же FLOPs.
Бонус: большое состояние можно инициализировать как обучаемый параметр — модель запоминает знания из претрейнинга прямо в M0, без затрат на инференс.
Результат на 8B модели, обученной на 1T токенов: SDM бьёт GDN на длинных контекстах (RULER benchmark) и не хуже полного внимания на коротких. До 1 миллиона токенов — константная память.
https://arxiv.org/abs/2607.07386
Nvidia Research представила RoboLab — платформу для оценки роботизированных AI-систем.
Проблема в том, что существующие бенчмарки устаревают быстро: модели набирают 90%+ и сравнивать их становится бессмысленно. Плюс большинство тестов используют те же данные, что и при обучении — это не проверка обобщения, а проверка памяти.
RoboLab решает это тремя способами: быстрая генерация новых задач через агентный AI (минуты вместо часов), поддержка любого робота без привязки к конкретной платформе, и детальная диагностика — не просто «успех/провал», а анализ плавности движений, реакции на разные формулировки команд и статистическая достоверность результатов.
Интеграция в NVIDIA Isaac Lab-Arena запланирована на август 2026 года.
https://developer.nvidia.com/blog/how-to-evaluate-general-purpose-robot-policies-for-real-world-deployment/
Проблема в том, что существующие бенчмарки устаревают быстро: модели набирают 90%+ и сравнивать их становится бессмысленно. Плюс большинство тестов используют те же данные, что и при обучении — это не проверка обобщения, а проверка памяти.
RoboLab решает это тремя способами: быстрая генерация новых задач через агентный AI (минуты вместо часов), поддержка любого робота без привязки к конкретной платформе, и детальная диагностика — не просто «успех/провал», а анализ плавности движений, реакции на разные формулировки команд и статистическая достоверность результатов.
Интеграция в NVIDIA Isaac Lab-Arena запланирована на август 2026 года.
https://developer.nvidia.com/blog/how-to-evaluate-general-purpose-robot-policies-for-real-world-deployment/
NVIDIA Technical Blog
How to Evaluate General-Purpose Robot Policies for Real-World Deployment
Robotics foundation models have made remarkable progress. Today’s best systems can follow natural language instructions to pick, place, sort, and manipulate a wide variety of objects.
Nvidia Tech рассказала, как правильно проектировать LLM-модели под железо, чтобы выжать максимум из GPU.
Суть простая: форма модели напрямую влияет на скорость и стоимость инференса. Три главных правила от инженеров Nvidia:
1. Делай линейные слои близкими к квадратным — это повышает арифметическую интенсивность и переводит вычисления из memory-bound в compute-bound режим.
2. Выравнивай размерности под тайловые размеры GPU — кратность 128, а лучше 256 или 512. Иначе часть вычислительных ядер просто простаивает.
3. Используй ширину, а не глубину — больше ширина модели при меньшем числе слоёв лучше масштабируется на несколько GPU.
Дополнительно: квантизация NVFP4 и инструменты TensorRT дают высокий throughput с минимальной потерей точности на Blackwell-чипах.
Для разработчиков моделей это практический гайд: правильная архитектура ещё до обучения экономит деньги на деплое и ускоряет отклик для пользователей.
https://developer.nvidia.com/blog/ai-model-co-design-hardware-friendly-llm-design/
Суть простая: форма модели напрямую влияет на скорость и стоимость инференса. Три главных правила от инженеров Nvidia:
1. Делай линейные слои близкими к квадратным — это повышает арифметическую интенсивность и переводит вычисления из memory-bound в compute-bound режим.
2. Выравнивай размерности под тайловые размеры GPU — кратность 128, а лучше 256 или 512. Иначе часть вычислительных ядер просто простаивает.
3. Используй ширину, а не глубину — больше ширина модели при меньшем числе слоёв лучше масштабируется на несколько GPU.
Дополнительно: квантизация NVFP4 и инструменты TensorRT дают высокий throughput с минимальной потерей точности на Blackwell-чипах.
Для разработчиков моделей это практический гайд: правильная архитектура ещё до обучения экономит деньги на деплое и ускоряет отклик для пользователей.
https://developer.nvidia.com/blog/ai-model-co-design-hardware-friendly-llm-design/
NVIDIA Technical Blog
AI Model Co-Design: Hardware-Friendly LLM Design
AI performance comes down to three dimensions: Deployments must balance all three: High accuracy is wasted if responses are slow, and raw throughput means little if each user’s experience is laggy.