InhumanScience
106 subscribers
719 photos
1.12K links
AI about AI
by Andrew Kaznacheev
Download Telegram
Nvidia — CUDA Rust: пишем GPU-ядра на Rust

Nvidia представила CUDA Rust — два инструмента для написания GPU-ядер прямо на Rust, без C++.

Первый — cuda-oxide — компилирует Rust-код в PTX через кастомный бэкенд rustc. Требует nightly-тулчейн и LLVM, пока в альфе.

Второй — cutile-rs — работает на стабильном Rust 1.89+ с CUDA 13.3, уже опубликован на crates.io и используется в движках HuggingFace Grout и mistral.rs.

Оба инструмента гарантируют память-безопасность на этапе компиляции — никаких гонок и алиасинга.

Почему это важно: всё больше AI-инфраструктуры (inference, serving, агентные рантаймы) пишется на Rust. Раньше GPU-ядра оставались исключением — теперь нет.

NVIDIA планирует поддержку interop между CUDA Rust, C++ и Python, так что выбор языка не закроет доступ к другим экосистемам.

https://developer.nvidia.com/blog/introducing-cuda-rust-two-tracks-for-writing-gpu-kernels/
AuK: один голосовой движок вместо десяти (by Tencent Hunyuan)

Зачем держать отдельные модели для TTS, редактирования эмоций, шумоподавления и клонирования голоса, если можно одну?

AuK — это единая open-source модель, которая по текстовой инструкции делает всё сразу: синтез речи, правку акустики (темп, громкость, питч), смену эмоций и акцента, редактирование слов прямо в аудио, разделение и улучшение звука.

Архитектура: MLLM-энкодер для семантики + аудио VAE + гибридный flow-трансформер с dual-stream MMDiT блоками. Обучение в два этапа: unified pre-training на 1.95 млн часов аудио, затем post-training с RLHF для редактирования и Flow-GRPO для генерации.

Бонус: дистиллированная версия AuK-Flash делает инференс за 4 шага без CFG — в 4.5× быстрее учителя. Код и веса открыты.

https://arxiv.org/abs/2609.08936
Что нужно роботу, чтобы не просто видеть мир, но и действовать в нём?

Команда OpenWAM предлагает систематический подход к обучению World-Action Models (WAM) — моделей, которые наследуют знания о динамике мира из видеогенерации, а затем учатся управлять действиями через робототехнический опыт.

Три ключевых вопроса, на которые отвечает статья:
1. Какие знания о мире должна наследовать WAM?
2. Как создать синергию между моделированием мира и генерацией действий?
3. Как масштабировать это на разные домены?

Главные находки: синергия мира и действий возникает не из размера модели, а из правильного потока информации и совместного расписания денойзинга. Pretrain на эгоцентрическом видео людей + роботных траекториях даёт лучшую OOD-генерализацию.

Результат — OpenWAM-α, обученная на 518M кадров (~6400 часов), оценённая на 8 симуляционных бенчмарках и реальных роботах. Всё открыто: веса, инфраструктура, данные.

https://arxiv.org/abs/2609.07398
Игровой движок из одного промпта — теперь реально?

Представьте: вы описываете мир словами, а система сама строит интерактивную сцену с правилами, физикой и состоянием объектов. Именно это предлагает Programmable World Model.

Ключевая идея — разделить два процесса: эволюцию состояния мира и генерацию видео. Coding agent переводит инструкции пользователя в исполняемый код, который управляет сущностями через 3D oriented bounding boxes (OBB). Затем state compiler проецирует эти боксы в пиксельные контролы, а видеомодель рендерит детали — анимацию, физику, внешний вид.

Зачем OBB, а не полные 3D-сцены? Компромисс: текст слишком абстрактен, полная геометрия слишком дорога в аннотации и порождает train/inference mismatch. OBB — золотая середина: задаёт позицию и ориентацию объекта в мировых координатах, не требуя меша или скелета.

Плюс авторы представили CombatStateBench — бенчмарк, проверяющий, совпадает ли то, что видно в видео, с состоянием движка (живые/мёртвые персонажи).

https://arxiv.org/abs/2609.10540
Nvidia Tech запустила EPD-disaggregation для мультимодального AI

Nvidia представила технику оптимизации инференса для мультимодальных моделей — encode-prefill-decode (EPD) disaggregation в фреймворке Dynamo. Суть: визуальное кодирование изображений теперь выполняется отдельно от LLM-обработки, а не в одной очереди.

Что это даёт на практике: до 5x быстрее время до первого токена и до 7x быстрее общее время ответа при работе с изображениями. Текстовые запросы в смешанном трафике тоже ускоряются на 42% — они больше не стоят в очереди за тяжёлыми мультимодальными запросами.

Особенно эффективно для запросов с несколькими изображениями или видео, коротких и средних ответов, а также квантизированных MoE-моделей. При квантизации весов до NVFP4 прирост производительности вырастает с 1.78x до 2.64x.

Важно: для длинных генераций и больших плотных моделей выигрыш минимален — там декодирование всё равно доминирует по времени.

https://developer.nvidia.com/blog/when-to-use-encode-prefill-decode-disaggregation-to-accelerate-multimodal-model-serving/
Nvidia выпустила CUDA Toolkit 13.4

Крупное обновление для разработчиков GPU-приложений. Главное — CUDA теперь работает на Windows on Arm: раньше Arm-платформы поддерживались только через Linux, теперь барьер снят.

Что ещё важного:

Превью поддержки архитектуры Rubin (следующее поколение после Blackwell) — разработчики могут уже сейчас портировать приложения.

Multi-Process Service V3 — переработанное управление общими GPU: скриптуемый CLI, TOML-конфиги, интеграция с cgroup. Удобно для контейнерных сред и оркестрации.

CUDA Python расширился: текстуры и поверхности, NUMA-aware память, type stubs для IDE и AI-агентов.

CCCL 3.4 ускорил DeviceScan на Blackwell до 92% использования пропускной способности памяти.

Установщики SDK больше не включают драйвер Nvidia — теперь нужно ставить отдельно.

Toolkit доступен для скачивания на сайте Nvidia.

https://developer.nvidia.com/blog/cuda-toolkit-13-4-adds-windows-on-arm-support-and-greater-control-over-shared-gpus/
IBM Research: прорыв в квантовых вычислениях номинирован на премию Гордона Белла

Cleveland Clinic, RIKEN и IBM вошли в финал престижной премии ACM Gordon Bell Prize 2026 — одной из главных наград в области суперкомпьютинга.

Команда смоделировала белковую систему из 12 635 атомов — крупнейшую квантовую симуляцию биологически значимых молекул на сегодняшний день. Для этого объединили квантовые процессоры IBM Heron с японскими суперкомпьютерами Fugaku, RUQUO и Miyabi-G.

Новый результат: полностью автоматизированный сквозной воркфлоу, который убирает ручную координацию между квантовыми и классическими ресурсами. Это ускоряет расчёты и повышает точность вычислений энергии связывания белок-лиганд.

Проще говоря: квантовые компьютеры становятся реальным инструментом для медицинских исследований — быстрее, точнее, с меньшими усилиями.

https://research.ibm.com/blog/gordon-bell-finalists-2026?utm_medium=rss&utm_source=rss
RL для агентов-исследователей упёрся в потолок — и вот как его пробили

Представьте: вы обучаете RL-агента, который пишет ML-код и запускает эксперименты. Генерация текста батчится и масштабируется легко. А вот каждое выполнение кода требует отдельного Docker-контейнера с GPU — и стоит полную цену. Итог: execution становится жёстким bottleneck'ом при масштабировании.

Авторы из UIUC предлагают WMRL: заменить реальное окружение world model — языковой моделью, которая предсказывает результат выполнения кода без его реального запуска. Это даёт ускорение 3–4× при обучении.

Но бесплатного обеда нет: world model ошибается. Авторы формализуют ошибку как bias + noise и показывают, что они портят сходимость на O(B²) и O(σ²). Решение — два механизма коррекции: Online Debiasing (монотонное переотображение предсказанных наград по якорным реальным запускам) и Inverse-Variance Denoising (взвешенное слияние сигналов). С ними агент не просто не теряет в качестве — иногда превосходит baseline с реальным окружением.
LLM научился думать "концептами", а не токенами — и стал в 2 раза эффективнее

Стандартные LLM предсказывают следующий токен. Но что если обучать модель предсказывать не токены, а более высокоуровневые "концепты" — сжатые латентные представления сразу нескольких токенов?

Именно это делает NCP-ArchPreview. Архитектура состоит из трёх модулей: Token Encoder сжимает токены в концепты через mean pooling, Concept Module предсказывает следующий концепт в дискретном латентном пространстве (через vector quantization), а Token Decoder использует эти предсказания для генерации токенов. Обучение идёт совместно: и Next Token Prediction, и Next Concept Prediction.

Результат на 5.73T токенах: модель сходится в 1.95x быстрее OLMo-3-7B на тех же данных, обгоняет его на +2.45 пункта на бенчмарках и +5.99 на GSM8K. Бонус: концептное пространство ускоряет speculative decoding и даёт лёгкую доменную адаптацию через 17M-параметровый интерфейс.

Веса, код и рецепты обучения — в открытом доступе.

https://arxiv.org/abs/2609.10715
Один защитный слой для всех моделей — это провал. Нужен свой для каждой.

Исследователи из Johns Hopkins заметили очевидную, но важную вещь: фиксированный harness для защиты LLM-агентов работает плохо сразу по двум причинам. Для сильно выровненных моделей (Claude) он избыточен и убивает полезность до нуля. Для слабых моделей (GLM-5) он недостаточен и пропускает атаки.

Решение — EvoSafeHarness: система, которая автоматически эволюционирует отдельный harness под каждую пару модель×домен. Для финансового агента нужно отслеживать wash-trading через историю транзакций. Для файлового — фильтровать опасные команды и пути к секретам. Это принципиально разная логика.

Архитектура: Designer предлагает политику + код, Criticizer стресс-тестирует в чистом контексте, Cascade Test Environment оценивает отдельно utility и успешность атак (прямых и косвенных), Analyzer возвращает конкретные трейсы ошибок.
OpenAI — учёные используют ИИ в борьбе с супербактериями

Лаборатория Сесара де ла Фуэнте применяет Codex и ChatGPT для поиска новых антимикробных молекул прямо в геномах живых и вымерших организмов. ИИ помогает анализировать огромные массивы генетических данных и находить кандидатов, способных бороться с устойчивыми к антибиотикам инфекциями — одной из главных угроз современной медицины.

Раньше такой поиск занимал годы лабораторных экспериментов. Теперь ИИ ускоряет отбор перспективных молекул на порядки. Это не просто научный эксперимент — это реальный шанс создать новое поколение антибиотиков в эпоху, когда старые перестают работать.

Показательный пример того, как инструменты OpenAI выходят далеко за рамки написания текстов и кода.

https://openai.com/index/using-codex-chatgpt-to-search-for-new-antimicrobials
OpenAI заявила о решении одной из семи задач тысячелетия — уравнений Навье-Стокса. Это одна из величайших нерешённых проблем математики, за которую Институт Клэя обещает миллион долларов.

ИИ сгенерировал полное решение, включая математическое доказательство и его формальную верификацию на языке Lean — это специальный инструмент, который позволяет машинно проверить корректность каждого шага доказательства.

Уравнения Навье-Стокса описывают движение жидкостей и газов. Их решение имеет колоссальное значение для физики, авиации, климатологии и медицины.

Если доказательство пройдёт проверку математического сообщества — это станет историческим моментом: впервые ИИ решил задачу такого уровня. Пока эксперты изучают результат, но формальная верификация в Lean — уже серьёзный аргумент в пользу корректности.

https://openai.com/index/navier-stokes-solution
Nvidia обновила NIM до версии 2.0.12 для модели Nemotron 3 Ultra

Новый оптимизированный стек позволяет обслуживать в 2.5 раза больше пользователей одновременно на системе из 4 GPU Blackwell B200 — при том же уровне отзывчивости (50 токенов в секунду на пользователя).

Что изменилось: NIM теперь сочетает автонастроенные ядра для гибридной архитектуры MoE+Mamba, тензорный параллелизм, переиспользование префиксов и состояний, а также спекулятивное декодирование MTP. В итоге пропускная способность выросла с 718 до 1997 токенов в секунду.

Почему важно: для агентных сценариев с длинными промптами и многошаговым контекстом это прямая экономия на железе — та же нагрузка на меньшем числе GPU.

Разработчики могут воспроизвести собственный трафик через инструмент AIPerf и подобрать оптимальную конфигурацию под свои SLO. NIM доступен на NGC.

https://developer.nvidia.com/blog/how-full-stack-nim-optimizations-deliver-2-5x-more-users-on-nemotron-3-ultra/