InhumanScience
105 subscribers
641 photos
999 links
AI about AI
by Andrew Kaznacheev
Download Telegram
Google DeepMind выпустила сразу три новых модели семейства Gemini Flash.

Gemini 3.6 Flash — улучшенная рабочая лошадка: на 17% меньше токенов на выходе по сравнению с 3.5 Flash, лучше в кодинге (DeepSWE: 49% против 37%) и работе с документами. Цена — $1.50 за 1М входных и $7.50 за 1М выходных токенов, что дешевле предшественника.

Gemini 3.5 Flash-Lite — самая быстрая модель серии: 350 токенов в секунду, всего $0.30/$2.50 за 1М токенов. Обходит даже 3 Flash по агентным задачам и кодингу.

Gemini 3.5 Flash Cyber — специализированная модель для поиска и исправления уязвимостей в коде. Пока доступна только правительствам и доверенным партнёрам через платформу CodeMender.

Отдельно: Google уже начала самый амбициозный pre-training run для Gemini 4, а Gemini 3.5 Pro тестируется с партнёрами.

https://deepmind.google/blog/introducing-gemini-36-flash-35-flash-lite-and-35-flash-cyber/
Apple ML опубликовала исследование о новом способе обучения AI-агентов, которые умеют вызывать API.

Главная проблема: чтобы обучить такого агента, раньше нужны были полноценные рабочие среды с реальными API и базами данных — дорого и сложно масштабировать.

Решение от Apple ML: генерировать обучающие данные без всякой реальной среды. Вместо этого LLM сама играет роль "цифрового мира" — симулирует ответы API на лету, исходя только из их спецификаций. Специальный агент-учитель решает задачи, LLM-симулятор генерирует правдоподобные ответы, а LLM-судья фильтрует некачественные примеры.

Результат: модели, дообученные на таких синтетических данных, показали заметный прирост на бенчмарках AppWorld и OfficeBench.

Почему важно: это делает создание AI-агентов для работы с API дешевле и быстрее — без необходимости поднимать сложную инфраструктуру. Потенциально ускорит разработку умных ассистентов в продуктах Apple.

https://machinelearning.apple.com/research/environment-free
Apple ML представила CalibAtt — метод ускорения генерации видео по тексту без дообучения моделей.

Проблема: современные диффузионные модели генерируют качественное видео, но работают медленно из-за тяжёлых трансформерных блоков с пространственно-временным вниманием.

Решение: исследователи заметили, что значительная часть связей между токенами стабильно даёт близкие к нулю оценки — и эти паттерны повторяются. CalibAtt делает офлайн-калибровку, находит такие блоки и просто пропускает их при инференсе — аппаратно-эффективным способом.

Результат: до 1.58× ускорения на моделях Wan 2.1 14B и Mochi 1 при сохранении качества видео и соответствия тексту. Метод обходит конкурирующие training-free подходы.

Почему важно: ускорение генерации видео без потери качества и без переобучения — это прямой путь к снижению затрат на инференс в продуктовых системах. Работа принята на ECCV 2026.

https://machinelearning.apple.com/research/calibrated-sparse-attention
Токены шаблона чата — это скрытые регистры смысла в диффузионных трансформерах

Когда генерируешь картинку через модель с LLM-энкодером, промпт оборачивается в chat template: system/user/assistant токены. Все думали, что эти структурные токены — просто форматирование, мусор. Оказалось — нет.

Авторы из RTP-LLM вскрыли механику DiT-моделей (на примере Qwen-Image) и обнаружили: именно chat-template токены становятся главными "attention sinks" — они притягивают на себя основное внимание image-токенов. Но это ещё не всё: они не просто поглощают внимание впустую, а реально участвуют в передаче семантики объектов. Причём делают это хитро — не читая промпт напрямую, а забирая смысл из уже обработанных image latents.

Практический выход: раз "промпт-читающие" головы внимания каузально бесполезны, их можно отрезать. Обрезка 20% attention FLOPs даёт потерю всего 1.4 пункта на GenEval — бесплатное ускорение без дообучения.

https://arxiv.org/abs/2607.19139
Агент, который сам себя улучшает в процессе исследования (by Beijing Academy of AI)

Большинство research-агентов просто ищут дольше, если не нашли ответ. AREX делает иначе: после каждого раунда поиска агент проверяет, какие именно ограничения задачи ещё не выполнены, и формулирует новый, более точный исследовательский вопрос.

Ключевая идея — асимметрия поиска и верификации. Найти ответ, удовлетворяющий всем условиям сразу, сложно. Но проверить каждое условие по отдельности — значительно проще. AREX использует верификацию не как финальный фильтр, а как сигнал для следующего раунда.

Дополнительно агент учится сжимать собственный контекст: вместо полной истории — компактное состояние с подтверждёнными фактами и нерешёнными пробелами.

Модели: 4B (dense) и 122B-A10B (MoE). На бенчмарках BrowseComp, GAIA, HLE конкурируют с моделями с гораздо большим числом активных параметров.

https://arxiv.org/abs/2607.21461
PPO убивает исследование редких токенов — и вот почему

Когда LLM обучают с RL, стандартный PPO-Clip постепенно "схлопывает" политику: модель всё сильнее эксплуатирует уже популярные токены и почти игнорирует редкие. Почему? Авторы нашли геометрическую причину: PPO меряет изменение политики евклидовой метрикой на importance ratio, тогда как реальное пространство политик — риманово многообразие с метрикой KL-дивергенции. Из-за этого редкий токен (p=0.01) при clip=0.2 может вырасти лишь до 0.012, а частый (p=0.8) — до 0.96. Асимметрия огромная.

Решение — RIPO (Riemannian Isometric Policy Optimization): граница клиппинга адаптируется к локальной геометрии многообразия. Редкие действия получают больший "бюджет" обновления, частые — меньший. Результат: +60% относительного улучшения над GRPO на AIME24.

https://arxiv.org/abs/2607.10169
Nvidia выпустила туториал по кастомизации Nemotron 3 Nano

Теперь дообучить открытую языковую модель Nemotron 3 Nano можно буквально за 5 минут — с помощью платформы Prime Intellect Lab. Никакого собственного GPU-кластера не нужно: всё обучение происходит в облаке.

Процесс простой: устанавливаешь CLI, запускаешь базовую оценку модели, обучаешь LoRA-адаптер через reinforcement learning с верифицируемыми наградами — и скачиваешь готовый адаптер. В тесте на математических задачах точность заметно выросла по сравнению с базовой моделью.

Важно: Nemotron 3 выходит с открытыми весами, данными и рецептами обучения — это упрощает воспроизводимость и адаптацию под конкретные задачи. Тот же воркфлоу работает и для более крупных Nemotron 3 Super и Ultra.

Для разработчиков, которым нужна специализированная модель без боли с инфраструктурой — это реально удобно.

https://developer.nvidia.com/blog/start-customizing-nvidia-nemotron-3-nano-with-prime-intellect-lab-in-minutes/
PyTorch + Google: пишем TPU-ядра без боли

PyTorch представил TPU-бэкенд для своего DSL Helion — совместная разработка с Google. Теперь можно писать ML-ядра в привычном PyTorch-стиле, а компилятор сам переведёт их в оптимизированный Pallas-код для TPU.

Зачем это нужно? Раньше для TPU приходилось вручную писать на Pallas — низкоуровневом DSL с крутой кривой обучения. Helion убирает этот барьер: один и тот же код работает и на GPU, и на TPU.

Результаты впечатляют: на задаче Flash Attention ядро, сгенерированное Helion, выдаёт 838 TFLOPs (~79% MFU) на TPU v7. Автотюнер сам подбирает оптимальную стратегию пайплайнинга под разные размеры входных данных.

Три целевых сценария: задачи, где нужен автотюнинг; разработчики без экспертизы в Pallas; команды, поддерживающие единую кодовую базу для GPU и TPU.

https://pytorch.org/blog/helion-on-tpu-towards-hardware-heterogeneous-kernel-authoring/
PyTorch Foundation обновила сразу шесть проектов

В апреле 2025 PyTorch Foundation расширилась до мультипроектной организации. Теперь под её крылом — PyTorch, vLLM, DeepSpeed, Ray, Helion и Safetensors. Вот главное за квартал.

PyTorch 2.13: FlexAttention на Apple Silicon работает до 12x быстрее, новый бэкенд CuTeDSL, экономия памяти GPU до 4x при обучении, поддержка Python 3.15.

vLLM полностью переписал Model Runner V2, добавил поддержку Kimi K3, Qwen 3 в день релиза. Первая конференция vLLM — 24–26 августа в Сан-Франциско.

DeepSpeed интегрировал алгоритм Ulysses прямо в Hugging Face Trainer и получил награду на ASPLOS 2026.

Ray поддержал GPU-серверы GB200/GB300, использовался при обучении MAI-Thinking-1 и Nemotron 3 Ultra.

Helion обогнал FlashAttention-4 на NVIDIA Blackwell и показал ускорение автотюнинга в 10x с помощью LLM.

Safetensors добавил GIL-Free сериализацию и быструю загрузку моделей через Metal на Apple.

https://pytorch.org/blog/driving-the-future-of-open-source-ai-an-update-from-pytorch-foundation-projects/
SANA-Video 2.0: быстрая генерация видео без квадратичного внимания (by NVIDIA)

Главная боль видеогенерации — softmax attention с O(N²) сложностью. При 1080p видео латентных токенов десятки тысяч, и квадратичный attention просто убивает скорость.

SANA-Video 2.0 решает это гибридным подходом: 75% слоёв используют линейное внимание O(N), а 25% — обычный softmax в качестве "якорей". Соотношение 3:1 взято не из LLM-литературы вслепую, а подобрано экспериментально именно для видео.

Второй ключевой трюк — Block Attention Residuals (AttnRes): вместо того чтобы каждый слой заново выводил информацию из предыдущего, готовые блочные представления передаются напрямую вглубь сети. Это повышает эффективный ранг состояний в глубоких слоях на ~12%.

Результат: 5B модель генерирует 480p видео за 13.2 сек на одном H100, DiT-forward в 3.2× быстрее полного softmax-аналога при 720p/60s, а преимущество растёт с длиной видео. VBench Total — 84.30, конкурентно с моделями 13-14B.

https://arxiv.org/abs/2607.21553
Робот забывает, что значат слова, пока учится двигаться

Когда дообучаешь VLA-модель (Vision-Language-Action) на робототехнических демонстрациях, она теряет базовое понимание языка. Натренировали робота брать зелёную кружку — он берёт зелёную, даже если ему говорят "возьми розовую". Цветовое понимание просто стёрлось в процессе BC-файнтюнинга.

Авторы предлагают Anchor-Align — два дополнительных лосса поверх стандартного BC:

1. Vision-Language Anchoring: держим замороженную копию исходной VLM и дистиллируем её hidden states на каждом слое декодера в обучаемый backbone. Никаких новых данных — просто дистилляция от себя же.

2. Language-Action Alignment: автоматически конвертируем траектории действий в текстовые метки ("двигай вправо") и учим модель предсказывать их на тех же наблюдениях, где она предсказывает действия. Оказалось, что у co-trained VLA языковая и action головы могут буквально противоречить друг другу!

Результат: на реальном роботе xArm7 — с 10% до нормальной генерализации на OOD инструкции.
LLM-as-a-Coach: когда скалярная оценка — это слишком мало

Стандартный RL для LLM работает так: модель-судья смотрит на ответ и выдаёт число от 1 до 10. Всё остальное — анализ, советы, нюансы — выбрасывается. Это узкий канал: максимум 3.3 бита на пример.

Авторы предлагают Experiential Learning: вместо судьи — коуч. Коуч анализирует ответ по рубрикам и формулирует передаваемые советы (experiential knowledge). Эти советы подаются как контекст учителю, а политика обучается минимизировать KL-дивергенцию с этим контекст-обусловленным учителем. Никакого скаляра — плотный токен-уровневый сигнал.

Bandwidth контекста из 1024 токенов — теоретически 17 600 бит, то есть в 5000+ раз больше, чем скалярная оценка.

На практике: EL стабильно обгоняет RL на open-ended задачах, меньше подвержен reward hacking и лучше обобщается за пределы тренировочного распределения.

https://arxiv.org/abs/2607.18110
Nvidia Tech запустила ModelExpress (MX) — систему для ускоренной доставки весов AI-моделей на GPU в кластерах.

Проблема была простой: модели весят сотни гигабайт, и каждый новый воркер тратил минуты на загрузку с нуля. MX решает это умно — сначала проверяет, есть ли уже загруженная копия у соседнего GPU, и если да, передаёт веса напрямую через P2P RDMA, минуя диск и оперативную память.

Результат впечатляет: веса DeepSeek-V4 Pro (806 ГБ) передаются между репликами менее чем за 10 секунд. Общее время запуска сократилось с 8 минут до 1 минуты 44 секунд.

MX также умеет: скачивать чекпоинты из облака без записи на диск, использовать GPUDirect Storage, координировать загрузку так, чтобы кластер из 10 реплик скачивал данные один раз, а не десять. Система интегрирована с vLLM, SGLang и Dynamo.

Для production-деплоев больших моделей это серьёзное ускорение масштабирования.

https://developer.nvidia.com/blog/modelexpress-distributing-model-artifacts-at-the-speed-of-light/
Apple ML выпустила исследование LEAD — новый метод для улучшения длинных цепочек рассуждений в языковых моделях.

Проблема: когда задачу разбивают на слишком мелкие шаги, модель теряет контекст и не может исправить ошибки на «сложных» этапах — они накапливаются и становятся необратимыми.

Решение — метод LEAD (Lookahead-Enhanced Atomic Decomposition): модель заглядывает чуть вперёд и проверяет несколько вариантов развития событий одновременно. Это даёт достаточно изоляции для стабильности и достаточно контекста для исправления ошибок.

Результат на практике: модель o4-mini с LEAD решает головоломку Checkers Jumping до сложности n=13, тогда как без метода ломается уже на n=11.

Пока это академическое исследование, но подход может напрямую улучшить агентные системы и сложные многошаговые задачи в будущих продуктах Apple.

https://machinelearning.apple.com/research/lead-no-recovery-bottleneck
Одна видеомодель — и прямая, и обратная динамика робота

Обычно для предсказания последствий действий робота и для восстановления действий по желаемому результату нужны разные модели. Авторы предлагают Masked Visual Actions: вместо того чтобы подавать в видеомодель низкоразмерные векторы команд, они просто маскируют нужные пиксели в видео.

Идея проста: если показать модели траекторию робота (активная сущность) — она предскажет, что произойдёт с объектами. Если показать желаемое движение объекта (пассивная сущность) — та же модель восстановит, как должен двигаться робот. Один чекпоинт, обученный на 15 часах роботизированных данных, решает обе задачи.

Модель применяется для оценки политик, планирования и обратного моделирования в реальных манипуляционных задачах. Бонус: подход не зависит от типа робота, так как действия закодированы прямо в пикселях.

https://arxiv.org/abs/2607.19343
Единый принцип интеллекта: ищи то, чему можно научиться

Новизна без структуры — это шум телевизора. Минимизация удивления — это тёмная комната. Оба подхода провалились по одной причине: они не различают "обучаемую" и "необучаемую" новизну.

Авторы предлагают единый принцип: максимизируй learnable novelty — ту часть удивления, которую ограниченный наблюдатель реально может усвоить. Формально это "эпиплексность" (epiplexity): длина описания лучшей модели, которую конечный вычислитель способен подобрать под данные.

Ключевой трюк: вместо дорогого поиска по всем программам используют reservoir computer с ridge regression — закрытая формула, дифференцируемая и быстрая.

Результаты впечатляют: без единой метки нейронный клеточный автомат сам развивает солитоны, MNIST-энкодер разделяет классы цифр, RL-агент исследует среду эффективнее в задачах с редкими наградами. А rule 110 (единственный Тьюринг-полный элементарный КА) занимает первое место в рейтинге сложности.

https://arxiv.org/abs/2607.18433
3DGS всегда мылит дальние горы и скрытые объекты — и вот почему

3D Gaussian Splatting отлично работает, но упорно размывает далёкие объекты и окклюдированные области. Авторы доказали, что это не баг данных, а структурный изъян оптимизации — и назвали его Blur Trap.

Суть проблемы: градиент позиции каждого гауссиана строго ортогонален лучу зрения. То есть оптимизатор может двигать примитивы только поперёк луча, но никогда вдоль глубины. Плюс alpha-blending гасит сигнал для скрытых гауссианов, не давая им делиться.

Решение намеренно минималистичное — два оператора исследования:
1. Random Seeding — случайно засеиваем новые гауссианы по всей сцене, обходя ортогональность
2. Random Splitting — случайно делим гауссианы без оглядки на градиент, обходя подавление alpha-blending

Оба оператора просты, но именно это и нужно: проверить, что exploration сам по себе — недостающий ингредиент 3DGS. Эксперименты на 5 датасетах подтверждают улучшение при минимальных накладных расходах.

https://arxiv.org/abs/2607.17965
Molt: фреймворк для agentic RL, который влезает в голову за один вечер (by NVIDIA)

Проблема с существующими RL-фреймворками для LLM: они строились под гиперскейл, и каждое изменение алгоритма требует копаться в слоях трейнера, движка роллаутов и конфигурационной обвязки. Molt говорит: сложность — это не цена производительности, это архитектурный выбор.

Ключевая идея: 4 концепта (agent, generator, trainer, estimators) + один асинхронный цикл. Изменение алгоритма трогает ровно один компонент. Никаких форков vLLM или Ray — апстрим-улучшения прилетают автоматически.

Отдельная фича: token-first граница агента. Агент, написанный под стандартный OpenAI/Anthropic SDK, тренируется без изменений — SDK-трафик перехватывается как token ids через loopback-сервер.

Результат: кодовая база в несколько раз меньше Megatron-стеков, при этом throughput статистически сопоставим. Проверено на 700B MoE с expert parallelism 256 — тот же цикл, что и для 4B dense-модели.

https://arxiv.org/abs/2607.21653
HOPE: сжать нейросеть без единого примера данных (by Google)

Стандартные методы прунинга смотрят на "величину весов" и выкидывают маленькие. Проблема: большие веса — это часто просто артефакты оптимизации, а не реально важные нейроны.

Google предлагает другой подход: перенести анализ из пространства параметров в функциональное пространство. Каждый нейрон рассматривается как оператор Гильберта-Шмидта, и вместо "насколько большой вес?" задаётся вопрос "насколько сильно меняется поведение сети, если убрать этот нейрон?".

Ключевой трюк: для вычисления норм в гильбертовом пространстве нужна статистика входных данных — но авторы берут её прямо из Batch Normalization слоёв. Никаких реальных данных не нужно!

Единый фреймворк объединяет прунинг, слияние нейронов и удаление целых блоков под одним критерием дистortion-cost J. Всё гиперпараметр-фри.

https://arxiv.org/abs/2607.21366
👍2
Знают ли LLM, что учить ПЕРЕД чем? (by Peking University)

Современные LLM легко решают задачи ЕГЭ и ГАО-КАО. Но понимают ли они структуру учебной программы — что "линейные уравнения" требуют знания арифметики, а не наоборот?

Авторы построили K12-KGraph — граф знаний на основе официальных китайских школьных учебников (математика, физика, химия, биология). Граф содержит 7 типов узлов (концепт, навык, эксперимент, упражнение, раздел...) и рёбра типа "является предпосылкой", "проверяет", "иллюстрирует" и т.д.

Из графа сгенерированы бенчмарк K12-Bench (23 640 вопросов на понимание структуры учебника) и датасет K12-Train (7 335 SFT-примеров). Результат: даже Gemini-2.5-Flash набирает лишь 57% точного совпадения. А файнтюнинг на K12-Train даёт +24 балла на GaokaoBench против лучшего конкурента — при вдвое меньшем объёме данных.

https://arxiv.org/abs/2605.09635
NVIDIA запустила Nemotron 3 Ultra для проектирования чипов

NVIDIA представила модель Nemotron 3 Ultra в связке с агентом ACE-RTL для автоматизации RTL-кодинга — написания кода на уровне регистровых передач при разработке микросхем.

Результаты впечатляют: на бенчмарке CVDP система достигает 97,1% успешных решений в 9 категориях задач. При этом модель использует на 71% меньше токенов за итерацию, чем конкурент Kimi K2.6, и на 28% меньше, чем GLM 5.2.

Агент работает по схеме «генерация → тест → рефлексия»: пишет RTL-код, запускает симуляцию, анализирует ошибки и итеративно исправляет их. Именно так работают реальные инженеры.

Архитектура — гибридная Mamba-Attention MoE на 550B параметров (55B активных), контекст до 1M токенов. Это критично: в одной итерации отладки контекст быстро раздувается до спецификаций, кода, логов симулятора и предыдущих попыток.

Модель совместима с EDA-инструментами Cadence, Siemens и Synopsys.

https://developer.nvidia.com/blog/nvidia-nemotron-3-ultra-leads-open-models-on-accuracy-and-efficiency-in-agentic-rtl-coding/
👍2