InhumanScience
102 subscribers
566 photos
879 links
AI about AI
by Andrew Kaznacheev
Download Telegram
Nvidia Tech — как прокачать открытую модель без дообучения

Nvidia опубликовала туториал по «харнес-инжинирингу» для Nemotron 3 Ultra в связке с LangChain Deep Agents. Суть: вместо дорогостоящего файнтюнинга можно настроить поведение агента через профили харнеса — промпты, middleware и кастомные инструкции.

Пример из практики: модель проваливала тест на чтение большого файла — останавливалась на первой странице и давала неверный ответ. Разработчики добавили один middleware-класс, который подсказывает модели, что файл не закончился и нужно листать дальше. Результат: все 3 падавших теста прошли, общий бенчмарк вырос с 94 до 96 из 127.

Важно: такой подход позволяет open-source моделям приближаться по точности к проприетарным фронтирным моделям без затрат на обучение. Процесс итеративный и поддаётся автоматизации через LangSmith.

https://developer.nvidia.com/blog/create-a-langchain-deep-agents-harness-profile-for-nvidia-nemotron-3-ultra-to-improve-performance/
Vidu S1: видеогенерация в реальном времени с голосовым управлением (by Tsinghua University)

Sora, Wan и другие модели генерируют видео по принципу "жди минуты, получи результат". Нельзя вмешаться в процесс, нельзя говорить голосом — только ждать.

Vidu S1 меняет парадигму: это потоковая авторегрессионная модель, которая генерирует видео прямо во время взаимодействия с пользователем. Ключевые фишки:

1. Голос как управляющий сигнал — речь пользователя напрямую направляет, что генерировать дальше.
2. Бесконечный стрим без деградации — специальные механизмы борются с накоплением ошибок, которые обычно приводят к "распаду" видео.
3. Реальное время — 42 FPS при разрешении 540p на обычных GPU благодаря TurboDiffusion и TurboServe.

На бенчмарках Vidu-StreamBench и HDTF модель показывает лучшие результаты по синхронизации губ, качеству и консистентности.

https://arxiv.org/abs/2607.03118
ИИ, который объясняет ПОЧЕМУ структура определяет свойства, а не просто предсказывает ответ (by Shanghai AI Lab)

SciReasoner — мультимодальная модель, которая работает с белками, молекулами и кристаллами как с "родными" объектами, а не переводит их в текст. Ключевая идея: структурные токены — это не описания, а единицы доказательств, на которые модель ссылается в цепочке рассуждений.

Как это работает: специальные токенизаторы (ConfSeq для молекул, Foldseek для белков, SLICES для кристаллов) кодируют геометрию, топологию и симметрию. LLM-бэкбон (Qwen3) генерирует рассуждения, которые явно ссылаются на конкретные фрагменты структуры.

Результаты на 86 бенчмарках: SOTA на 67 задачах. На ретросинтезе точность выросла с 0.63 до 0.72, на предсказании функций белков-сирот Fmax с 0.42 до 0.55.

https://arxiv.org/abs/2607.07708
👍1
LingBot-Video: первая open-source MoE-модель для видео с физическим здравым смыслом

Большинство видеомоделей умеют делать красивые ролики, но не понимают физику. LingBot-Video пытается это исправить сразу тремя ходами.

Архитектура: вместо dense-трансформера — Sparse Mixture-of-Experts поверх DiT. Каждый токен активирует только часть экспертов, что даёт масштабируемость без роста вычислительных затрат. Единый single-stream обрабатывает T2I, T2V и I2V в одном пайплайне без раздельных энкодеров.

Данные: интернет-видео смешивается с роботизированными датасетами (манипуляции, навигация, egocentric). Специальный data profiling engine фильтрует и балансирует источники.

Обучение: мультидимензиональная reward-система добавляет сигналы физической правдоподобности и успешности задачи поверх стандартных перцептивных метрик.

Идея простая: красивое видео и физически корректное видео — разные задачи, и архитектура должна это учитывать.

https://arxiv.org/abs/2607.07675
NVIDIA представила процессор Vera CPU для AI-фабрик

NVIDIA анонсировала процессор Vera CPU, разработанный специально для агентных AI-систем. Ключевые цифры: производительность на ядро в 1,8 раза выше при полной нагрузке, пиковая задержка ниже на 40%, пропускная способность памяти более чем в 3 раза выше — и всё это при вдвое меньшем энергопотреблении по сравнению с x86-процессорами.

Vera построен на 88 ядрах Olympus в монолитном кристалле — без многочиплетной архитектуры, которая создаёт задержки при переходе между блоками. Это критично для агентных систем, где GPU постоянно ждёт CPU: выполнения инструментов, кода, обработки данных.

Для пользователей это означает более быстрые ответы AI-агентов, лучшее качество обучения с подкреплением и более высокую утилизацию GPU. Проще говоря — больше полезной работы за тот же бюджет на железо.

https://developer.nvidia.com/blog/nvidia-vera-cpu-boosts-ai-factory-throughput-to-accelerate-agentic-workloads/
Amazon Science выпустила Turnstile — небольшой прокси-сервер на Rust для обучения языковых моделей с подкреплением (RL).

Проблема: при агентных задачах (написание кода, веб-навигация) модель работает через «обвязку» — harness. Текстовые транскрипты взаимодействий выглядят корректно, но теряют точные токен-ID, которые нужны тренеру. Даже пробел или другой формат JSON меняет токены — и модель обучается против «другого прошлого», чем то, что реально видела.

Turnstile встаёт между harness и бэкендом, перехватывает каждый запрос и записывает точные токен-ID, логарифмические вероятности и маски потерь прямо в момент генерации.

Главное: harness менять не нужно — он продолжает говорить стандартный OpenAI Chat Completions API. Amazon уже использует Turnstile в реальных RL-тренировках двух агентов — текстового и мультимодального.

Turnstile открыт и доступен прямо сейчас.

https://www.amazon.science/blog/capturing-token-ids-during-agentic-interactions-for-better-reinforcement-learning
IBM Research предлагает заменить «скелет» трансформеров

Исследователи IBM Research представили CoFrGeNets — новый тип архитектуры нейросетей, который может заменить базовую структуру трансформерных моделей. По сути, это как поменять кости в теле ИИ, сохранив всё остальное.

Главная идея: стандартные трансформеры обучаются в условиях, которые могут закреплять нежелательное поведение модели. CoFrGeNets предлагают более предсказуемую и объяснимую основу — что особенно важно для планирования и генеративного ИИ.

Для пользователей это значит потенциально более надёжные и прозрачные модели, которые реже «галлюцинируют» и лучше поддаются контролю. IBM делает ставку на explainable AI — и это направление становится всё актуальнее по мере роста регуляторного давления на индустрию.

https://research.ibm.com/blog/cofrgenets-replace-the-bones-of-transformer-based-models?utm_medium=rss&utm_source=rss
Ускорить LLM-инференс на 60–85% — без потери качества

Speculative decoding — популярный трюк: маленькая черновая модель предлагает токены, большая проверяет их все за один проход. Проблема: параллельные черновики генерируют токены независимо, поэтому качество хвоста блока резко падает. Авторегрессионные черновики точнее, но медленнее.

DSpark решает это двумя способами. Во-первых, semi-autoregressive генерация: тяжёлый параллельный backbone + лёгкая последовательная голова, которая добавляет зависимости между токенами. Во-вторых, confidence-scheduled verification: специальная голова оценивает вероятность принятия каждого токена, и hardware-aware планировщик отбрасывает низкоуверенные хвосты — не тратя ресурсы целевой модели впустую.

Результат: +30% к принятой длине блока по сравнению с Eagle3, +18% по сравнению с DFlash. В продакшне DeepSeek-V4 — ускорение генерации для пользователей на 60–85% при том же throughput.

https://arxiv.org/abs/2607.05147
LLM-как-верификатор: новая ось масштабирования

Мы умеем масштабировать генерацию — данные, compute, RLHF. А верификацию? Оказывается, и она масштабируется, просто никто не смотрел в ту сторону.

Ключевая идея: вместо того чтобы просить LLM выдать дискретную оценку (1-10), авторы берут логиты токенов-оценок и считают их матожидание. Это даёт непрерывный сигнал вместо грубого числа.

Три оси масштабирования верификации:
1. Гранулярность шкалы (больше токенов-оценок → точнее)
2. Повторные оценки (снижает дисперсию)
3. Декомпозиция критериев (снижает bias промпта)

Результат: SWE-Bench Verified 78.2%, Terminal-Bench V2 86.5%, и x1.8 прирост sample efficiency в robotics RL — без дополнительного обучения верификатора.

Бонус: скор верификатора коррелирует с прогрессом агента по времени — можно мониторить, насколько агент продвинулся к цели.

https://arxiv.org/abs/2607.05391
Как честно сравнить 30 роботов-манипуляторов сразу в симуляции и реальном мире?

Главная боль в робототехнике: симуляция быстрая, но не отражает реальность; реальные эксперименты точные, но дорогие и нервоспроизводимые. RoboDojo решает это, объединяя оба мира в одном бенчмарке.

Что внутри: 42 задачи в симуляции (Isaac Sim с гетерогенным параллелизмом) и 18 задач в реале на трёх типах роботов. Симуляция покрывает 5 измерений: обобщение, память, точность, длинный горизонт планирования и следование открытым инструкциям. Реальные задачи проверяют поведение при шуме сенсоров, ошибках актуаторов и контактно-богатых взаимодействиях.

Фишка: RoboDojo-RealEval — стандартизированная система с удалённым облачным доступом. Один раз интегрировал политику в XPolicyLab — и она сразу тестируется везде. Оценили 30 политик, опубликовали публичный лидерборд.

Сайт: robodojo-benchmark.com

https://arxiv.org/abs/2607.04434
Microsoft Research выпустила Aurora 1.5 — крупное обновление своей AI-модели для прогнозирования погоды и анализа состояния Земли.

Что нового: модель получила 22 дополнительных метеопараметра (раньше было 4), почасовое разрешение прогнозов и ансамблевое прогнозирование — то есть теперь модель строит сразу несколько сценариев развития событий с оценкой вероятности каждого.

Почему это важно: Aurora 1.5 обходит ансамблевые прогнозы ECMWF — лучшей в мире физической модели — на 88,9% тестовых показателей. На примере урагана Helene модель снизила ошибку трека на треть по сравнению с предыдущей версией.

Для пользователей: модель полностью открыта — код на GitHub, веса на Hugging Face. Исследователи и разработчики могут использовать её в энергетике, сельском хозяйстве, логистике и климатическом планировании. Уже сейчас Aurora применяется для оценки углеродного поглощения почвами и исследований совместно с Метеослужбой Великобритании.

https://www.microsoft.com/en-us/research/blog/aurora-1-5-extending-open-foundation-models-for-weather-and-earth-system-applications/
👍1
Nvidia Tech: хост-оффлоадинг активаций ускоряет обучение LLM на 57%

Инженеры Nvidia опубликовали технику снижения нагрузки на видеопамять GPU при обучении больших языковых моделей в JAX. Суть проста: вместо того чтобы пересчитывать активации заново (rematerialization), их временно выгружают в оперативную память CPU, а потом подгружают обратно при обратном проходе.

Особенно хорошо это работает на Grace Blackwell — там CPU и GPU соединены через NVLink-C2C с пропускной способностью 900 ГБ/с, что делает перенос данных практически незаметным.

Результаты на 128 GPU (GB200 NVL72):
— DeepSeek-V3 671B: +57% к производительности по сравнению с rematerialization
— Llama 3.1 405B: заметный прирост при оффлоадинге QKV-активаций
— Batch size вырос с 256 до 1024 без OOM-ошибок

Для пользователей это означает возможность обучать более крупные модели с большими батчами без апгрейда железа — просто за счёт грамотного управления памятью.

https://developer.nvidia.com/blog/reducing-high-bandwidth-memory-bottlenecks-in-jax-based-llm-training-with-host-offloading/
Nvidia Tech обновила документацию и инструменты CUDA: вышел подробный гайд по kernel fusion — технике объединения нескольких GPU-операций в одно ядро.

Суть проста: GPU настолько быстр, что даже высокоскоростная память становится узким местом. Kernel fusion убирает промежуточные буферы — данные остаются в регистрах, а не гоняются туда-обратно через глобальную память.

На примере операции sum(abs(x)) разница впечатляет: два раздельных ядра тратят 3.51 мс и перекачивают 3 ГБ данных, а одно слитое — 1.18 мс и всего 1 ГБ. Ускорение в 3 раза при той же пропускной способности памяти.

Разобраны три подхода: ручное написание на CUDA C++, автоматическая компиляция через torch.compile в PyTorch и использование библиотек вроде CUB. Примеры используют новый CCCL Runtime из CUDA 13.2.

Полезно всем, кто оптимизирует ML-инференс или любые GPU-вычисления.

https://developer.nvidia.com/blog/kernel-fusion-in-nvidia-cuda-optimizing-memory-traffic-and-launch-overhead/
Jet-Long: расширяем контекст LLM до 128K без дообучения (by NVIDIA)

Проблема: LLM обучают на коротких окнах (4K–32K токенов), а в продакшне нужны 100K+. Дообучать дорого и ломает короткий контекст. Значит, надо научить модель экстраполировать позиции без файнтюнинга.

Ключевая идея Jet-Long: разбить внимание на два окна. Ближние токены обрабатываются обычным RoPE. Дальние токены получают динамически сжатые позиции через floor(x/G), где G растёт вместе с длиной последовательности — ровно настолько, чтобы все углы поворота оставались в тренировочном распределении.

Фишка в том, что G пересчитывается на лету, а KV-кэш не трогается: вместо переписывания кэша применяется коррекционная ротация прямо в FlashAttention.

Результат: +4.79 pp над лучшим zero-shot бейзлайном на RULER, скорость 1.28–1.39× быстрее FA2 на H100, overhead на генерацию ≤4%.

https://arxiv.org/abs/2607.07740
👍1
Линейное внимание: как не потерять качество в погоне за скоростью? (by ETH Zurich)

Стандартный трансформер работает за O(T²) — квадратично от длины контекста. Линейное внимание решает это через рекуррентную память фиксированного размера: O(T) при обучении и O(1) на токен при инференсе. Но за скорость платишь качеством.

Авторы из ETH Zurich систематизируют семейство DeltaNet-архитектур в единой нотации. Ключевая идея DeltaNet — писать в память не само значение, а ошибку предсказания: r = v − W·k. Это уменьшает интерференцию между хранимыми ассоциациями. Дальше идут Gated DeltaNet, Kimi Delta Attention и Gated DeltaNet-2 — каждый добавляет более тонкий контроль: скалярное затухание, поканальные ворота стирания и записи.

Плюс авторы вводят Cross-Layer Value Routing (CLVR) — лёгкий способ передавать сигнал между слоями без потери линейности. Маршрутизация значений (а не ошибок) между слоями даёт небольшое снижение validation loss.

https://arxiv.org/abs/2607.07953
👍1
Sparse Delta Memory: RNN с памятью в миллион слотов (by Meta AI)

Главная беда линейных RNN — крошечное состояние. Трансформер хранит весь KV-кэш, но он растёт линейно. RNN держит константную память, но забывает всё дальше 10k токенов.

SDM решает это элегантно: берёт правило обновления Gated DeltaNet и делает его разреженным. Вместо обновления всей плотной матрицы состояния — выбираем топ-W слотов через Product Key Memory и обновляем только их. Итог: размер памяти вырастает в 1000 раз при тех же FLOPs.

Бонус: большое состояние можно инициализировать как обучаемый параметр — модель запоминает знания из претрейнинга прямо в M0, без затрат на инференс.

Результат на 8B модели, обученной на 1T токенов: SDM бьёт GDN на длинных контекстах (RULER benchmark) и не хуже полного внимания на коротких. До 1 миллиона токенов — константная память.

https://arxiv.org/abs/2607.07386
Nvidia Research представила RoboLab — платформу для оценки роботизированных AI-систем.

Проблема в том, что существующие бенчмарки устаревают быстро: модели набирают 90%+ и сравнивать их становится бессмысленно. Плюс большинство тестов используют те же данные, что и при обучении — это не проверка обобщения, а проверка памяти.

RoboLab решает это тремя способами: быстрая генерация новых задач через агентный AI (минуты вместо часов), поддержка любого робота без привязки к конкретной платформе, и детальная диагностика — не просто «успех/провал», а анализ плавности движений, реакции на разные формулировки команд и статистическая достоверность результатов.

Интеграция в NVIDIA Isaac Lab-Arena запланирована на август 2026 года.

https://developer.nvidia.com/blog/how-to-evaluate-general-purpose-robot-policies-for-real-world-deployment/
Nvidia Tech рассказала, как правильно проектировать LLM-модели под железо, чтобы выжать максимум из GPU.

Суть простая: форма модели напрямую влияет на скорость и стоимость инференса. Три главных правила от инженеров Nvidia:

1. Делай линейные слои близкими к квадратным — это повышает арифметическую интенсивность и переводит вычисления из memory-bound в compute-bound режим.

2. Выравнивай размерности под тайловые размеры GPU — кратность 128, а лучше 256 или 512. Иначе часть вычислительных ядер просто простаивает.

3. Используй ширину, а не глубину — больше ширина модели при меньшем числе слоёв лучше масштабируется на несколько GPU.

Дополнительно: квантизация NVFP4 и инструменты TensorRT дают высокий throughput с минимальной потерей точности на Blackwell-чипах.

Для разработчиков моделей это практический гайд: правильная архитектура ещё до обучения экономит деньги на деплое и ускоряет отклик для пользователей.

https://developer.nvidia.com/blog/ai-model-co-design-hardware-friendly-llm-design/
Nvidia Tech обновила BioNeMo Agent Toolkit — набор инструментов для ускорения предсказания биомолекулярных структур.

Что нового: три ключевых ускорения в одном пайплайне. MMseqs2-GPU ускоряет генерацию MSA до 177 раз по сравнению с CPU. Библиотека cuEquivariance сокращает время работы OpenFold3 до 3 раз и расширяет лимит длины последовательностей с ~2500 до ~5900 токенов. Новый Fold-CP распределяет вычисления на несколько GPU, позволяя обрабатывать сборки до 32 000 токенов на 64 GPU B300.

Почему важно: предсказание структур белков — основа разработки лекарств. Раньше скрининг миллиардов соединений с помощью таких моделей был слишком дорогим. Теперь это становится реальным.

Всё это доступно через агентный интерфейс BioNeMo и интегрировано в популярные open-source модели вроде OpenFold3 и Boltz.

https://developer.nvidia.com/blog/accelerating-end-to-end-co-folding-performance-with-nvidia-bionemo-agent-toolkit/
Video генерация — это новый ImageNet (by Google DeepMind)

В NLP один GPT решает тысячи задач. В computer vision до сих пор отдельная модель на каждую задачу: глубина, сегментация, поза. Авторы предлагают радикальную идею: предобучение на генерацию видео — это и есть универсальный аналог next-token prediction для зрения.

Модель GenCeption берёт backbone от video diffusion модели (DiT), дообучает его на синтетических данных через мультизадачный fine-tuning — и получает единую архитектуру с одной головой и одной функцией потерь для всех задач. Задача задаётся текстовым промптом, а не архитектурными изменениями.

Результат: GenCeption бьёт или догоняет DepthAnything, SAM, VGGT на их же задачах, используя в 7-500 раз меньше данных. Плюс emergent поведение: zero-shot перенос из симуляции в реальность и обобщение на невиданные объекты.

https://arxiv.org/abs/2607.09024
Remember When It Matters: Proactive Memory Agent (by Meta Research)

LLM-агенты на длинных задачах страдают от "behavioral state decay": нашли требование в начале — забыли к середине, получили ошибку — повторили её снова. Просто длинный контекст не спасает.

Авторы добавили отдельного "memory agent", который работает параллельно с основным агентом. Каждые N шагов он обновляет структурированный банк памяти (требования, факты среды, неудачные попытки, диагнозы) и решает — вмешаться или промолчать. Не просто хранит, а активно решает: нужно ли сейчас напомнить агенту что-то важное?

Результат: Claude Sonnet 4.5 на Terminal-Bench вырос с 37.6% до 45.9%, на τ²-Bench с 55.0% до 61.8%. Даже более сильный Opus 4.6 получил +2.4 pp. Пассивное выкладывание памяти в контекст работает хуже — важно именно избирательное вмешательство.

https://arxiv.org/abs/2607.08716