Nvidia представила PAIR — виртуальный роутер для локального AI-инференса
NVIDIA Personal AI Router (PAIR) решает проблему очередей при мультиагентных задачах: вместо того чтобы гонять все запросы через один GPU, он распределяет их по доступным устройствам в домашней сети.
Работает с Ollama и LM Studio без каких-либо изменений в агентах. Поддерживаются видеокарты GeForce RTX 20-й серии и новее, RTX PRO, DGX Spark и Apple M4+.
На практике: задача с пятью субагентами на одном RTX Spark заняла 18 минут. Кластер из трёх устройств справился за 8 минут 48 секунд.
Безопасность обеспечивается через mDNS-обнаружение и MTLS-шифрование. Устройства могут подключаться и отключаться динамически — PAIR учитывает загрузку GPU и наличие нужной модели на каждом узле.
PAIR доступен в бета-версии для Windows, macOS и Linux. Проект открытый.
https://developer.nvidia.com/blog/nvidia-pair-virtual-inference-router-expands-available-compute-on-your-local-network/
NVIDIA Personal AI Router (PAIR) решает проблему очередей при мультиагентных задачах: вместо того чтобы гонять все запросы через один GPU, он распределяет их по доступным устройствам в домашней сети.
Работает с Ollama и LM Studio без каких-либо изменений в агентах. Поддерживаются видеокарты GeForce RTX 20-й серии и новее, RTX PRO, DGX Spark и Apple M4+.
На практике: задача с пятью субагентами на одном RTX Spark заняла 18 минут. Кластер из трёх устройств справился за 8 минут 48 секунд.
Безопасность обеспечивается через mDNS-обнаружение и MTLS-шифрование. Устройства могут подключаться и отключаться динамически — PAIR учитывает загрузку GPU и наличие нужной модели на каждом узле.
PAIR доступен в бета-версии для Windows, macOS и Linux. Проект открытый.
https://developer.nvidia.com/blog/nvidia-pair-virtual-inference-router-expands-available-compute-on-your-local-network/
NeoMME: один трансформер для текста и картинок без отдельных башен (by H company)
Большинство мультимодальных моделей для поиска используют раздельные энкодеры для текста и изображений (как CLIP). NeoMME идёт другим путём: один двунаправленный трансформер обрабатывает и текстовые токены, и сырые патчи изображений 32×32 пикселя через общие слои.
Обучение с нуля на смеси текста, кода, математики, естественных и документных изображений. Вместо обычного MLM используется masked discrete diffusion, а для мультимодальных примеров — текстовый денойзинг, обусловленный патчами изображения.
На выходе модель даёт и dense-вектор, и late-interaction представление из одного прохода. 260M модель обрабатывает страницы 2048×2048 со скоростью 51 стр/сек на L40S. Хитрость со сжатием: hierarchical pooling + int8/binary квантизация сжимают эмбеддинг в 255 раз при сохранении 95% качества поиска.
https://arxiv.org/abs/2609.01657
Большинство мультимодальных моделей для поиска используют раздельные энкодеры для текста и изображений (как CLIP). NeoMME идёт другим путём: один двунаправленный трансформер обрабатывает и текстовые токены, и сырые патчи изображений 32×32 пикселя через общие слои.
Обучение с нуля на смеси текста, кода, математики, естественных и документных изображений. Вместо обычного MLM используется masked discrete diffusion, а для мультимодальных примеров — текстовый денойзинг, обусловленный патчами изображения.
На выходе модель даёт и dense-вектор, и late-interaction представление из одного прохода. 260M модель обрабатывает страницы 2048×2048 со скоростью 51 стр/сек на L40S. Хитрость со сжатием: hierarchical pooling + int8/binary квантизация сжимают эмбеддинг в 255 раз при сохранении 95% качества поиска.
https://arxiv.org/abs/2609.01657
LoRA стал лучше — просто нормализуй одну матрицу
LoRA — стандарт для дообучения LLM, но его оптимизационная динамика плохо изучена. Авторы заметили: матрица A в LoRA (down-projection) имеет произвольные нормы столбцов, что создаёт дисбаланс при проецировании входа в латентное пространство.
Идея NoRA проста: нормализуй каждый столбец матрицы A по rank-размерности. Вместо BAx получаем B·Norm(A)x. Нормализация зависит только от параметров, а не от входа — поэтому преобразование остаётся линейным и матрицы можно сливать обратно в веса после обучения (как в обычном LoRA).
Бонус: NoRA-init — вариант только для инициализации, без нормализации во время обучения. Работает почти так же хорошо.
Результат: лучшая сходимость, стабильность и меньше катастрофического забывания — на pretraining, SFT и RLVR. При этом никакого SVD, как в PiSSA/MiLoRA.
https://arxiv.org/abs/2608.31036
LoRA — стандарт для дообучения LLM, но его оптимизационная динамика плохо изучена. Авторы заметили: матрица A в LoRA (down-projection) имеет произвольные нормы столбцов, что создаёт дисбаланс при проецировании входа в латентное пространство.
Идея NoRA проста: нормализуй каждый столбец матрицы A по rank-размерности. Вместо BAx получаем B·Norm(A)x. Нормализация зависит только от параметров, а не от входа — поэтому преобразование остаётся линейным и матрицы можно сливать обратно в веса после обучения (как в обычном LoRA).
Бонус: NoRA-init — вариант только для инициализации, без нормализации во время обучения. Работает почти так же хорошо.
Результат: лучшая сходимость, стабильность и меньше катастрофического забывания — на pretraining, SFT и RLVR. При этом никакого SVD, как в PiSSA/MiLoRA.
https://arxiv.org/abs/2608.31036
Учитель не нужен: OPD улучшает модель не потому, что учит у учителя
Метод On-Policy Distillation (OPD) — популярный способ улучшить рассуждения LLM через дистилляцию от более сильной модели. Авторы решили разобраться, а реально ли студент учится у учителя?
Оказалось: нет. Учительский сигнал крайне зашумлён — у модели Qwen3-235B около 50% токенов получают неверный знак преимущества. При этом обучение только на "шумных" примерах даёт ту же точность, что и стандартный OPD. Студент просто игнорирует смысл сигнала учителя.
Тогда что реально работает? Два наблюдения:
1. Улучшение идёт от токенов с низкой вероятностью (low-logp)
2. Достаточно фиксированного отрицательного преимущества — без учителя вообще
Авторы предложили OPSA: метод без учителя, который подавляет "хвостовые" токены, адаптируя силу сигнала через энтропию позиции. На Qwen3-1.7B — прирост Avg@32 на 263–307% относительно базовой модели.
https://arxiv.org/abs/2608.31046
Метод On-Policy Distillation (OPD) — популярный способ улучшить рассуждения LLM через дистилляцию от более сильной модели. Авторы решили разобраться, а реально ли студент учится у учителя?
Оказалось: нет. Учительский сигнал крайне зашумлён — у модели Qwen3-235B около 50% токенов получают неверный знак преимущества. При этом обучение только на "шумных" примерах даёт ту же точность, что и стандартный OPD. Студент просто игнорирует смысл сигнала учителя.
Тогда что реально работает? Два наблюдения:
1. Улучшение идёт от токенов с низкой вероятностью (low-logp)
2. Достаточно фиксированного отрицательного преимущества — без учителя вообще
Авторы предложили OPSA: метод без учителя, который подавляет "хвостовые" токены, адаптируя силу сигнала через энтропию позиции. На Qwen3-1.7B — прирост Avg@32 на 263–307% относительно базовой модели.
https://arxiv.org/abs/2608.31046
Сжать историю чата в вектора и читать их напрямую — без восстановления текста
Когда LLM-агент работает долго, контекст разрастается до неприличных размеров. Обычный выход — резюмировать или обрезать текст. LatentPress предлагает другой путь: сжать историю в непрерывные «мягкие токены» и скормить их замороженной LLM напрямую, минуя любое восстановление текста.
Ключевая идея: разделить на WRITE (маленький адаптер ~0.1% параметров декодера кодирует контекст в векторы) и READ (замороженный декодер читает эти векторы как обычные эмбеддинги). Для диалогов — разные степени сжатия по ролям: реплики пользователя не сжимаются, ответы ассистента — в 8–32 раза.
Результат: 4.6–7.7× сжатие при сохранении ~0.5 accuracy на LongMemEval, инференс в 5–9× быстрее, запись истории — 43 мс. Похоже на xRAG и ICAE, но без файнтюнинга ридера и без декодирования обратно в текст.
https://arxiv.org/abs/2609.01507
Когда LLM-агент работает долго, контекст разрастается до неприличных размеров. Обычный выход — резюмировать или обрезать текст. LatentPress предлагает другой путь: сжать историю в непрерывные «мягкие токены» и скормить их замороженной LLM напрямую, минуя любое восстановление текста.
Ключевая идея: разделить на WRITE (маленький адаптер ~0.1% параметров декодера кодирует контекст в векторы) и READ (замороженный декодер читает эти векторы как обычные эмбеддинги). Для диалогов — разные степени сжатия по ролям: реплики пользователя не сжимаются, ответы ассистента — в 8–32 раза.
Результат: 4.6–7.7× сжатие при сохранении ~0.5 accuracy на LongMemEval, инференс в 5–9× быстрее, запись истории — 43 мс. Похоже на xRAG и ICAE, но без файнтюнинга ридера и без декодирования обратно в текст.
https://arxiv.org/abs/2609.01507
Iris: поисковый агент, который учится искать лучше с каждым циклом
Хорошая языковая модель — ещё не хороший поисковый агент. Нужно уметь решать многошаговые задачи в интернете, где ответ разбросан по десяткам страниц.
Iris от AllSpark Research — это end-to-end рецепт обучения таких агентов. Ключевые идеи:
1. Данные генерируются автоматически из структуры веб-графа: берём страницу, строим граф сущностей, генерируем многошаговый вопрос и заменяем все прямые "подсказки" на описательные отсылки — чтобы модель не могла схитрить простым поиском по строке.
2. Траектории от учителя фильтруются на двух уровнях: целиком (правильность, глубина, отсутствие петель) и пооборотно (LLM-судья маскирует плохие ходы, но не выбрасывает их из контекста).
3. SFT и RL чередуются итеративно: удачные траектории из RL-роллаутов идут обратно в SFT следующего цикла.
В итоге Iris-mini и Iris-pro бьют все open-source агенты на BrowseComp, DeepSearchQA и HLE.
https://arxiv.org/abs/2609.04304
Хорошая языковая модель — ещё не хороший поисковый агент. Нужно уметь решать многошаговые задачи в интернете, где ответ разбросан по десяткам страниц.
Iris от AllSpark Research — это end-to-end рецепт обучения таких агентов. Ключевые идеи:
1. Данные генерируются автоматически из структуры веб-графа: берём страницу, строим граф сущностей, генерируем многошаговый вопрос и заменяем все прямые "подсказки" на описательные отсылки — чтобы модель не могла схитрить простым поиском по строке.
2. Траектории от учителя фильтруются на двух уровнях: целиком (правильность, глубина, отсутствие петель) и пооборотно (LLM-судья маскирует плохие ходы, но не выбрасывает их из контекста).
3. SFT и RL чередуются итеративно: удачные траектории из RL-роллаутов идут обратно в SFT следующего цикла.
В итоге Iris-mini и Iris-pro бьют все open-source агенты на BrowseComp, DeepSearchQA и HLE.
https://arxiv.org/abs/2609.04304
RLVR делает модели умнее, но "забывает" альтернативные пути решения
(by University of Birmingham)
RLVR-обучение (PPO, GRPO) резко улучшает точность математических рассуждений — но ценой разнообразия решений. Авторы выяснили, ГДЕ именно теряются альтернативные пути.
Ключевое разделение: "доступ" (начало пути решения) vs "исполнение" (дальнейшие шаги). На задаче Countdown, где можно перебрать ВСЕ валидные решения, оказалось:
— При PPO точность выросла в 50 раз, но покрытие решений упало с 0.337 до 0.111
— Проблема концентрируется на ПЕРВОМ шаге: сдвиг вероятностей перед первой арифметической операцией в 16x больше, чем во всех последующих шагах
— Если принудительно дать модели "начало" забытого пути — она отлично его завершает!
Лечение: интерполяция весов поздних слоёв (20-28) с ранним чекпоинтом возвращает 37% покрытия без потери точности. SFT-модели сохраняют вдвое больше разнообразия.
https://arxiv.org/abs/2608.29188
(by University of Birmingham)
RLVR-обучение (PPO, GRPO) резко улучшает точность математических рассуждений — но ценой разнообразия решений. Авторы выяснили, ГДЕ именно теряются альтернативные пути.
Ключевое разделение: "доступ" (начало пути решения) vs "исполнение" (дальнейшие шаги). На задаче Countdown, где можно перебрать ВСЕ валидные решения, оказалось:
— При PPO точность выросла в 50 раз, но покрытие решений упало с 0.337 до 0.111
— Проблема концентрируется на ПЕРВОМ шаге: сдвиг вероятностей перед первой арифметической операцией в 16x больше, чем во всех последующих шагах
— Если принудительно дать модели "начало" забытого пути — она отлично его завершает!
Лечение: интерполяция весов поздних слоёв (20-28) с ранним чекпоинтом возвращает 37% покрытия без потери точности. SFT-модели сохраняют вдвое больше разнообразия.
https://arxiv.org/abs/2608.29188
Мультиагентные LLM наконец получили математику
Все знают, что системы типа AutoGen или MetaGPT работают, но никто не понимал — почему, когда они сходятся, и почему иногда застревают. Авторы дают первый строгий теоретический фундамент.
Ключевые идеи:
1. Оркестратор + воркеры — это билинейная игра координации. Качество декомпозиции задачи напрямую определяет, насколько близко воркеры сойдутся к Nash-равновесию.
2. Свободная рефлексия (Reflexion-style) может плато — и это доказуемо. Без внешнего верификатора даже идеальный текстовый судья не может гарантировать улучшение.
3. Авторы вводят SRMA: новая память коммитится только если внешний верификатор подтверждает снижение ошибки. Это даёт геометрическую сходимость.
Практический результат: Kimi-based система на SWE-bench — 72.2% (361/500), против 70.8% у публичного mini-SWE-agent v2.
https://arxiv.org/abs/2609.02750
Все знают, что системы типа AutoGen или MetaGPT работают, но никто не понимал — почему, когда они сходятся, и почему иногда застревают. Авторы дают первый строгий теоретический фундамент.
Ключевые идеи:
1. Оркестратор + воркеры — это билинейная игра координации. Качество декомпозиции задачи напрямую определяет, насколько близко воркеры сойдутся к Nash-равновесию.
2. Свободная рефлексия (Reflexion-style) может плато — и это доказуемо. Без внешнего верификатора даже идеальный текстовый судья не может гарантировать улучшение.
3. Авторы вводят SRMA: новая память коммитится только если внешний верификатор подтверждает снижение ошибки. Это даёт геометрическую сходимость.
Практический результат: Kimi-based система на SWE-bench — 72.2% (361/500), против 70.8% у публичного mini-SWE-agent v2.
https://arxiv.org/abs/2609.02750
👍1
MaxKernel: Агент для написания TPU-ядер (by Google)
LLM пишет быстрее человека низкоуровневый код для TPU? Звучит фантастически, но Google сделали именно это.
MaxKernel — мультиагентный фреймворк для автоматической генерации и оптимизации JAX/Pallas ядер под TPU. Внутри — специализированные субагенты: планировщик, кодогенератор, тестировщик, автотюнер и профилировщик (через XProf). Всё замкнуто в петлю: сгенерировал → скомпилировал → протестировал → профилировал → улучшил.
Три режима работы: с человеком в петле (HITL), полностью автономный и граф-поиск по пространству конфигураций (beam search и др.).
Результаты впечатляют: 1.58× ускорение на JAXBench, а на 8 продакшн-ядрах — 2.32× против референсного кода и 2.02× против написанного людьми вручную.
RAG с документацией по Pallas/Mosaic/XLA помогает агентам разбираться в железе без примеров человеческого кода.
https://arxiv.org/abs/2609.04523
LLM пишет быстрее человека низкоуровневый код для TPU? Звучит фантастически, но Google сделали именно это.
MaxKernel — мультиагентный фреймворк для автоматической генерации и оптимизации JAX/Pallas ядер под TPU. Внутри — специализированные субагенты: планировщик, кодогенератор, тестировщик, автотюнер и профилировщик (через XProf). Всё замкнуто в петлю: сгенерировал → скомпилировал → протестировал → профилировал → улучшил.
Три режима работы: с человеком в петле (HITL), полностью автономный и граф-поиск по пространству конфигураций (beam search и др.).
Результаты впечатляют: 1.58× ускорение на JAXBench, а на 8 продакшн-ядрах — 2.32× против референсного кода и 2.02× против написанного людьми вручную.
RAG с документацией по Pallas/Mosaic/XLA помогает агентам разбираться в железе без примеров человеческого кода.
https://arxiv.org/abs/2609.04523
OPD работает даже на одном примере — и вот почему
Оказывается, для on-policy дистилляции (OPD) не нужны тысячи обучающих примеров. Один единственный запрос восстанавливает большую часть разрыва между студентом и учителем — и это работает на четырёх доменах и трёх семействах моделей.
Почему? Авторы вводят понятие "покрытия состояний": каждый запрос порождает множество префиксов (состояний), на которых учитель даёт токен-уровневую обратную связь. Один запрос покрывает 71.5% состояний, которые посещает полный датасет. 16 семантически разнообразных запросов — уже 98.9%.
Главный вывод: OPD data-overfed но algorithm-starved. Данных достаточно с первых шагов, а вот скорость "поглощения" сигнала студентом падает одинаково — хоть на 1 запросе, хоть на 17k.
Бонус: даже бессмысленные шаблоны без задачи работают почти так же хорошо — главное, чтобы студент начал рассуждать.
https://arxiv.org/abs/2609.04172
Оказывается, для on-policy дистилляции (OPD) не нужны тысячи обучающих примеров. Один единственный запрос восстанавливает большую часть разрыва между студентом и учителем — и это работает на четырёх доменах и трёх семействах моделей.
Почему? Авторы вводят понятие "покрытия состояний": каждый запрос порождает множество префиксов (состояний), на которых учитель даёт токен-уровневую обратную связь. Один запрос покрывает 71.5% состояний, которые посещает полный датасет. 16 семантически разнообразных запросов — уже 98.9%.
Главный вывод: OPD data-overfed но algorithm-starved. Данных достаточно с первых шагов, а вот скорость "поглощения" сигнала студентом падает одинаково — хоть на 1 запросе, хоть на 17k.
Бонус: даже бессмысленные шаблоны без задачи работают почти так же хорошо — главное, чтобы студент начал рассуждать.
https://arxiv.org/abs/2609.04172
NeoHorse-1: модель, которая сама себя улучшает через агентный роутинг
Идея рекурсивного самоулучшения AI звучит красиво, но как это реализовать конкретно? NeoHorse-1 предлагает механизм: агент выполняет задачи в харнессе (execution layer с инструментами), оставляет траектории взаимодействий, роутер оценивает сложность каждого запроса — и всё это превращается в обучающие данные для следующей итерации.
Ключевые компоненты: curriculum learning на основе routing-скоров (сначала простые примеры, потом сложные), on-policy distillation где учитель supervises ответы самого студента, а не фиксированные траектории, и feedback loop — обновлённая модель возвращается в харнесс, её новые слабые места определяют следующий датасет.
Результат: 4B модель поднялась с 58.94 до 64.87 macro-average по агентным бенчмаркам, а 9B — с 65.60 до 69.04. Самые большие gains на harness-based задачах. Это первый прототип, авторы планируют масштабировать итерации дальше.
https://arxiv.org/abs/2609.08183
Идея рекурсивного самоулучшения AI звучит красиво, но как это реализовать конкретно? NeoHorse-1 предлагает механизм: агент выполняет задачи в харнессе (execution layer с инструментами), оставляет траектории взаимодействий, роутер оценивает сложность каждого запроса — и всё это превращается в обучающие данные для следующей итерации.
Ключевые компоненты: curriculum learning на основе routing-скоров (сначала простые примеры, потом сложные), on-policy distillation где учитель supervises ответы самого студента, а не фиксированные траектории, и feedback loop — обновлённая модель возвращается в харнесс, её новые слабые места определяют следующий датасет.
Результат: 4B модель поднялась с 58.94 до 64.87 macro-average по агентным бенчмаркам, а 9B — с 65.60 до 69.04. Самые большие gains на harness-based задачах. Это первый прототип, авторы планируют масштабировать итерации дальше.
https://arxiv.org/abs/2609.08183
DriveZero: автопилот, который превзошёл человека без единой человеческой траектории
Обычно end-to-end системы вождения учатся имитировать записи человека-водителя. Проблема: одна сцена — одна реализованная траектория, редкие аварийные ситуации почти не встречаются, и политика деградирует, выходя за пределы обучающих данных.
DriveZero разрывает эту зависимость через три шага:
1. DriveRL — привилегированный агент обучается с нуля через PPO в 196k параллельных симулированных мирах (без имитации!), превосходя log-replay эксперта на nuPlan.
2. DriveVFM — визуальный энкодер дистиллируется из замороженных фундаментальных моделей (DINOv3, SigLIP2, SAM, Depth Anything v2) без разметки.
3. DriveZero — камерная политика учится на роллаутах DriveRL, а не на человеческих траекториях. Goal-conditioned аугментация даёт разнообразные цели из одной сцены.
Результат: 95.3 PDMS на NAVSIMv1 — выше человека (94.8) и нового SOTA на NAVSIMv2 и HUGSIM.
https://arxiv.org/abs/2609.06055
Обычно end-to-end системы вождения учатся имитировать записи человека-водителя. Проблема: одна сцена — одна реализованная траектория, редкие аварийные ситуации почти не встречаются, и политика деградирует, выходя за пределы обучающих данных.
DriveZero разрывает эту зависимость через три шага:
1. DriveRL — привилегированный агент обучается с нуля через PPO в 196k параллельных симулированных мирах (без имитации!), превосходя log-replay эксперта на nuPlan.
2. DriveVFM — визуальный энкодер дистиллируется из замороженных фундаментальных моделей (DINOv3, SigLIP2, SAM, Depth Anything v2) без разметки.
3. DriveZero — камерная политика учится на роллаутах DriveRL, а не на человеческих траекториях. Goal-conditioned аугментация даёт разнообразные цели из одной сцены.
Результат: 95.3 PDMS на NAVSIMv1 — выше человека (94.8) и нового SOTA на NAVSIMv2 и HUGSIM.
https://arxiv.org/abs/2609.06055
World-Action модель для роботов: чем больше данных — тем лучше (by AgiBot World)
Классические VLA-политики учат маппинг наблюдение → действие, не моделируя физику. World-Action Models (WAM) сначала предсказывают, как изменится сцена, а потом извлекают действия. GE-Act 2.0 делает это с нуля, без готовых видео-генераторов.
Ключевые идеи:
1. Разделённое предобучение: visual planner учится на видео без меток действий, inverse dynamics model — на траекториях без языковых инструкций. Потом всё соединяется.
2. CoAE — компактный автоэнкодер, заточенный под управление, а не под качество картинки.
3. KASO решает "validity gap": когда предсказанное будущее не совпадает с записанным действием, модель выбирает только совместимые пары.
Результат: масштабирование с 300 до 30 000 часов данных поднимает zero-shot OOD успех с 17% до 44% на 100 реальных задачах — без файн-тюнинга под конкретные задачи.
https://arxiv.org/abs/2609.05588
Классические VLA-политики учат маппинг наблюдение → действие, не моделируя физику. World-Action Models (WAM) сначала предсказывают, как изменится сцена, а потом извлекают действия. GE-Act 2.0 делает это с нуля, без готовых видео-генераторов.
Ключевые идеи:
1. Разделённое предобучение: visual planner учится на видео без меток действий, inverse dynamics model — на траекториях без языковых инструкций. Потом всё соединяется.
2. CoAE — компактный автоэнкодер, заточенный под управление, а не под качество картинки.
3. KASO решает "validity gap": когда предсказанное будущее не совпадает с записанным действием, модель выбирает только совместимые пары.
Результат: масштабирование с 300 до 30 000 часов данных поднимает zero-shot OOD успех с 17% до 44% на 100 реальных задачах — без файн-тюнинга под конкретные задачи.
https://arxiv.org/abs/2609.05588
OpenAI показала, как исследователь из MIT использует GPT-5.6 Sol вместе с Codex для автономного проведения квантовых вычислительных экспериментов. Система сама запускает опыты, анализирует результаты и калибрует кубиты — без постоянного участия человека.
Это важно: квантовые эксперименты требуют сложной итеративной настройки, которая раньше отнимала часы ручной работы. Теперь ИИ берёт на себя рутинный цикл "запустил — проверил — подстроил", ускоряя исследования.
Для учёных это означает возможность сосредоточиться на гипотезах, а не на операционной рутине. Связка мощной языковой модели с инструментом для работы с кодом превращает ИИ в полноценного лабораторного ассистента.
https://openai.com/index/codex-quantum-computing-experiments
Это важно: квантовые эксперименты требуют сложной итеративной настройки, которая раньше отнимала часы ручной работы. Теперь ИИ берёт на себя рутинный цикл "запустил — проверил — подстроил", ускоряя исследования.
Для учёных это означает возможность сосредоточиться на гипотезах, а не на операционной рутине. Связка мощной языковой модели с инструментом для работы с кодом превращает ИИ в полноценного лабораторного ассистента.
https://openai.com/index/codex-quantum-computing-experiments
OpenAI
How GPT-5.6 Sol helps run quantum computing experiments
See how an MIT researcher uses GPT-5.6 Sol with Codex to autonomously run quantum computing experiments, analyze results, and calibrate qubits.
Google DeepMind представила AlphaGenome Atlas — предсказательную карту всех возможных изменений ДНК в геноме человека.
Модель AlphaGenome анализирует, как каждая возможная мутация в ДНК влияет на работу генов. Это колоссальный объём данных: в геноме человека около 3 миллиардов пар оснований, и каждая может измениться тремя способами.
Почему это важно? Большинство генетических заболеваний вызваны именно точечными мутациями. Раньше учёным приходилось годами экспериментировать, чтобы понять последствия одного изменения. Теперь Atlas даёт готовые предсказания для всего генома сразу.
Это ускорит поиск причин редких болезней, разработку генных терапий и персонализированной медицины. По сути, DeepMind создала атлас последствий всех возможных генетических вариантов — инструмент, который раньше просто не существовал.
https://deepmind.google/blog/alphagenome-atlas-a-predictive-map-of-every-possible-dna-letter-change-in-the-human-genome/
Модель AlphaGenome анализирует, как каждая возможная мутация в ДНК влияет на работу генов. Это колоссальный объём данных: в геноме человека около 3 миллиардов пар оснований, и каждая может измениться тремя способами.
Почему это важно? Большинство генетических заболеваний вызваны именно точечными мутациями. Раньше учёным приходилось годами экспериментировать, чтобы понять последствия одного изменения. Теперь Atlas даёт готовые предсказания для всего генома сразу.
Это ускорит поиск причин редких болезней, разработку генных терапий и персонализированной медицины. По сути, DeepMind создала атлас последствий всех возможных генетических вариантов — инструмент, который раньше просто не существовал.
https://deepmind.google/blog/alphagenome-atlas-a-predictive-map-of-every-possible-dna-letter-change-in-the-human-genome/
Google DeepMind
AlphaGenome Atlas: Molecular predictions for 9 Billion human DNA variants
Explore AlphaGenome Atlas, a catalogue predicting the molecular effects and AVI scores for 9 billion single-nucleotide variants across the human genome.
Nvidia — CUDA Rust: пишем GPU-ядра на Rust
Nvidia представила CUDA Rust — два инструмента для написания GPU-ядер прямо на Rust, без C++.
Первый — cuda-oxide — компилирует Rust-код в PTX через кастомный бэкенд rustc. Требует nightly-тулчейн и LLVM, пока в альфе.
Второй — cutile-rs — работает на стабильном Rust 1.89+ с CUDA 13.3, уже опубликован на crates.io и используется в движках HuggingFace Grout и mistral.rs.
Оба инструмента гарантируют память-безопасность на этапе компиляции — никаких гонок и алиасинга.
Почему это важно: всё больше AI-инфраструктуры (inference, serving, агентные рантаймы) пишется на Rust. Раньше GPU-ядра оставались исключением — теперь нет.
NVIDIA планирует поддержку interop между CUDA Rust, C++ и Python, так что выбор языка не закроет доступ к другим экосистемам.
https://developer.nvidia.com/blog/introducing-cuda-rust-two-tracks-for-writing-gpu-kernels/
Nvidia представила CUDA Rust — два инструмента для написания GPU-ядер прямо на Rust, без C++.
Первый — cuda-oxide — компилирует Rust-код в PTX через кастомный бэкенд rustc. Требует nightly-тулчейн и LLVM, пока в альфе.
Второй — cutile-rs — работает на стабильном Rust 1.89+ с CUDA 13.3, уже опубликован на crates.io и используется в движках HuggingFace Grout и mistral.rs.
Оба инструмента гарантируют память-безопасность на этапе компиляции — никаких гонок и алиасинга.
Почему это важно: всё больше AI-инфраструктуры (inference, serving, агентные рантаймы) пишется на Rust. Раньше GPU-ядра оставались исключением — теперь нет.
NVIDIA планирует поддержку interop между CUDA Rust, C++ и Python, так что выбор языка не закроет доступ к другим экосистемам.
https://developer.nvidia.com/blog/introducing-cuda-rust-two-tracks-for-writing-gpu-kernels/
NVIDIA Technical Blog
Introducing CUDA Rust: Two Tracks for Writing GPU Kernels
In September 2026, NVIDIA announced it is leaning into native GPU programming in Rust. CUDA C++ and CUDA Python are mature, enterprise-grade toolchains, and NVIDIA will be growing and maturing CUDA…
AuK: один голосовой движок вместо десяти (by Tencent Hunyuan)
Зачем держать отдельные модели для TTS, редактирования эмоций, шумоподавления и клонирования голоса, если можно одну?
AuK — это единая open-source модель, которая по текстовой инструкции делает всё сразу: синтез речи, правку акустики (темп, громкость, питч), смену эмоций и акцента, редактирование слов прямо в аудио, разделение и улучшение звука.
Архитектура: MLLM-энкодер для семантики + аудио VAE + гибридный flow-трансформер с dual-stream MMDiT блоками. Обучение в два этапа: unified pre-training на 1.95 млн часов аудио, затем post-training с RLHF для редактирования и Flow-GRPO для генерации.
Бонус: дистиллированная версия AuK-Flash делает инференс за 4 шага без CFG — в 4.5× быстрее учителя. Код и веса открыты.
https://arxiv.org/abs/2609.08936
Зачем держать отдельные модели для TTS, редактирования эмоций, шумоподавления и клонирования голоса, если можно одну?
AuK — это единая open-source модель, которая по текстовой инструкции делает всё сразу: синтез речи, правку акустики (темп, громкость, питч), смену эмоций и акцента, редактирование слов прямо в аудио, разделение и улучшение звука.
Архитектура: MLLM-энкодер для семантики + аудио VAE + гибридный flow-трансформер с dual-stream MMDiT блоками. Обучение в два этапа: unified pre-training на 1.95 млн часов аудио, затем post-training с RLHF для редактирования и Flow-GRPO для генерации.
Бонус: дистиллированная версия AuK-Flash делает инференс за 4 шага без CFG — в 4.5× быстрее учителя. Код и веса открыты.
https://arxiv.org/abs/2609.08936
Что нужно роботу, чтобы не просто видеть мир, но и действовать в нём?
Команда OpenWAM предлагает систематический подход к обучению World-Action Models (WAM) — моделей, которые наследуют знания о динамике мира из видеогенерации, а затем учатся управлять действиями через робототехнический опыт.
Три ключевых вопроса, на которые отвечает статья:
1. Какие знания о мире должна наследовать WAM?
2. Как создать синергию между моделированием мира и генерацией действий?
3. Как масштабировать это на разные домены?
Главные находки: синергия мира и действий возникает не из размера модели, а из правильного потока информации и совместного расписания денойзинга. Pretrain на эгоцентрическом видео людей + роботных траекториях даёт лучшую OOD-генерализацию.
Результат — OpenWAM-α, обученная на 518M кадров (~6400 часов), оценённая на 8 симуляционных бенчмарках и реальных роботах. Всё открыто: веса, инфраструктура, данные.
https://arxiv.org/abs/2609.07398
Команда OpenWAM предлагает систематический подход к обучению World-Action Models (WAM) — моделей, которые наследуют знания о динамике мира из видеогенерации, а затем учатся управлять действиями через робототехнический опыт.
Три ключевых вопроса, на которые отвечает статья:
1. Какие знания о мире должна наследовать WAM?
2. Как создать синергию между моделированием мира и генерацией действий?
3. Как масштабировать это на разные домены?
Главные находки: синергия мира и действий возникает не из размера модели, а из правильного потока информации и совместного расписания денойзинга. Pretrain на эгоцентрическом видео людей + роботных траекториях даёт лучшую OOD-генерализацию.
Результат — OpenWAM-α, обученная на 518M кадров (~6400 часов), оценённая на 8 симуляционных бенчмарках и реальных роботах. Всё открыто: веса, инфраструктура, данные.
https://arxiv.org/abs/2609.07398
Игровой движок из одного промпта — теперь реально?
Представьте: вы описываете мир словами, а система сама строит интерактивную сцену с правилами, физикой и состоянием объектов. Именно это предлагает Programmable World Model.
Ключевая идея — разделить два процесса: эволюцию состояния мира и генерацию видео. Coding agent переводит инструкции пользователя в исполняемый код, который управляет сущностями через 3D oriented bounding boxes (OBB). Затем state compiler проецирует эти боксы в пиксельные контролы, а видеомодель рендерит детали — анимацию, физику, внешний вид.
Зачем OBB, а не полные 3D-сцены? Компромисс: текст слишком абстрактен, полная геометрия слишком дорога в аннотации и порождает train/inference mismatch. OBB — золотая середина: задаёт позицию и ориентацию объекта в мировых координатах, не требуя меша или скелета.
Плюс авторы представили CombatStateBench — бенчмарк, проверяющий, совпадает ли то, что видно в видео, с состоянием движка (живые/мёртвые персонажи).
https://arxiv.org/abs/2609.10540
Представьте: вы описываете мир словами, а система сама строит интерактивную сцену с правилами, физикой и состоянием объектов. Именно это предлагает Programmable World Model.
Ключевая идея — разделить два процесса: эволюцию состояния мира и генерацию видео. Coding agent переводит инструкции пользователя в исполняемый код, который управляет сущностями через 3D oriented bounding boxes (OBB). Затем state compiler проецирует эти боксы в пиксельные контролы, а видеомодель рендерит детали — анимацию, физику, внешний вид.
Зачем OBB, а не полные 3D-сцены? Компромисс: текст слишком абстрактен, полная геометрия слишком дорога в аннотации и порождает train/inference mismatch. OBB — золотая середина: задаёт позицию и ориентацию объекта в мировых координатах, не требуя меша или скелета.
Плюс авторы представили CombatStateBench — бенчмарк, проверяющий, совпадает ли то, что видно в видео, с состоянием движка (живые/мёртвые персонажи).
https://arxiv.org/abs/2609.10540
Nvidia Tech запустила EPD-disaggregation для мультимодального AI
Nvidia представила технику оптимизации инференса для мультимодальных моделей — encode-prefill-decode (EPD) disaggregation в фреймворке Dynamo. Суть: визуальное кодирование изображений теперь выполняется отдельно от LLM-обработки, а не в одной очереди.
Что это даёт на практике: до 5x быстрее время до первого токена и до 7x быстрее общее время ответа при работе с изображениями. Текстовые запросы в смешанном трафике тоже ускоряются на 42% — они больше не стоят в очереди за тяжёлыми мультимодальными запросами.
Особенно эффективно для запросов с несколькими изображениями или видео, коротких и средних ответов, а также квантизированных MoE-моделей. При квантизации весов до NVFP4 прирост производительности вырастает с 1.78x до 2.64x.
Важно: для длинных генераций и больших плотных моделей выигрыш минимален — там декодирование всё равно доминирует по времени.
https://developer.nvidia.com/blog/when-to-use-encode-prefill-decode-disaggregation-to-accelerate-multimodal-model-serving/
Nvidia представила технику оптимизации инференса для мультимодальных моделей — encode-prefill-decode (EPD) disaggregation в фреймворке Dynamo. Суть: визуальное кодирование изображений теперь выполняется отдельно от LLM-обработки, а не в одной очереди.
Что это даёт на практике: до 5x быстрее время до первого токена и до 7x быстрее общее время ответа при работе с изображениями. Текстовые запросы в смешанном трафике тоже ускоряются на 42% — они больше не стоят в очереди за тяжёлыми мультимодальными запросами.
Особенно эффективно для запросов с несколькими изображениями или видео, коротких и средних ответов, а также квантизированных MoE-моделей. При квантизации весов до NVFP4 прирост производительности вырастает с 1.78x до 2.64x.
Важно: для длинных генераций и больших плотных моделей выигрыш минимален — там декодирование всё равно доминирует по времени.
https://developer.nvidia.com/blog/when-to-use-encode-prefill-decode-disaggregation-to-accelerate-multimodal-model-serving/
NVIDIA Technical Blog
When to Use Encode-Prefill-Decode Disaggregation to Accelerate Multimodal Model Serving
Encode-prefill-decode (EPD) disaggregation is an inference optimization technique for multimodal models that separates the vision encoder stage from the prefill and decode stages. It is most effective…
Nvidia выпустила CUDA Toolkit 13.4
Крупное обновление для разработчиков GPU-приложений. Главное — CUDA теперь работает на Windows on Arm: раньше Arm-платформы поддерживались только через Linux, теперь барьер снят.
Что ещё важного:
Превью поддержки архитектуры Rubin (следующее поколение после Blackwell) — разработчики могут уже сейчас портировать приложения.
Multi-Process Service V3 — переработанное управление общими GPU: скриптуемый CLI, TOML-конфиги, интеграция с cgroup. Удобно для контейнерных сред и оркестрации.
CUDA Python расширился: текстуры и поверхности, NUMA-aware память, type stubs для IDE и AI-агентов.
CCCL 3.4 ускорил DeviceScan на Blackwell до 92% использования пропускной способности памяти.
Установщики SDK больше не включают драйвер Nvidia — теперь нужно ставить отдельно.
Toolkit доступен для скачивания на сайте Nvidia.
https://developer.nvidia.com/blog/cuda-toolkit-13-4-adds-windows-on-arm-support-and-greater-control-over-shared-gpus/
Крупное обновление для разработчиков GPU-приложений. Главное — CUDA теперь работает на Windows on Arm: раньше Arm-платформы поддерживались только через Linux, теперь барьер снят.
Что ещё важного:
Превью поддержки архитектуры Rubin (следующее поколение после Blackwell) — разработчики могут уже сейчас портировать приложения.
Multi-Process Service V3 — переработанное управление общими GPU: скриптуемый CLI, TOML-конфиги, интеграция с cgroup. Удобно для контейнерных сред и оркестрации.
CUDA Python расширился: текстуры и поверхности, NUMA-aware память, type stubs для IDE и AI-агентов.
CCCL 3.4 ускорил DeviceScan на Blackwell до 92% использования пропускной способности памяти.
Установщики SDK больше не включают драйвер Nvidia — теперь нужно ставить отдельно.
Toolkit доступен для скачивания на сайте Nvidia.
https://developer.nvidia.com/blog/cuda-toolkit-13-4-adds-windows-on-arm-support-and-greater-control-over-shared-gpus/
NVIDIA Technical Blog
CUDA Toolkit 13.4 Adds Windows on Arm Support and Greater Control over Shared GPUs
Every NVIDIA CUDA Toolkit release adds functionality and performance improvements that help developers get more from NVIDIA GPUs and the broader NVIDIA software platform. CUDA Toolkit 13.4…