InhumanScience
105 subscribers
638 photos
994 links
AI about AI
by Andrew Kaznacheev
Download Telegram
OpenAI публикует полевой отчёт о том, как учёные используют AI-агентов в научных вычислениях.

Исследователи в области геномики и смежных науках начали активно применять агентные AI-системы для написания и модернизации кода. Вместо того чтобы вручную переписывать устаревшие научные программы, учёные поручают это агентам — и получают результат в разы быстрее.

Главный эффект: сокращается время между гипотезой и экспериментом. Код, на который раньше уходили недели, теперь пишется за часы. Это напрямую ускоряет открытия в медицине и биологии.

Для научного сообщества это сигнал: AI-агенты перестают быть экзотикой и становятся рабочим инструментом в лаборатории. OpenAI явно метит в сегмент научных вычислений как один из ключевых для продвижения своих агентных решений.

https://openai.com/index/scientific-computing-agentic-ai
Nvidia Tech запускает GPU-симуляцию для медицинской робототехники.

NVIDIA представила Medical Physics Simulation — открытый GPU-фреймворк в составе Isaac for Healthcare. Он решает три ключевые проблемы разработки медроботов: нехватку обучающих данных, слабую обобщаемость моделей и медленные циклы разработки (сейчас — 4–7 лет).

Фреймворк включает два модуля: Endoluminal (симуляция гибких инструментов в сосудах и полостях) и Surgical. Оба работают прямо на GPU, без лишних передач данных между CPU и GPU. Это позволяет одновременно симулировать физику, генерировать медицинские изображения и обучать RL-политики.

Дополнительно интегрирована генеративная модель Cosmos-H — для синтетических данных и предсказания видео с учётом действий робота.

Для разработчиков медроботики это означает возможность тестировать редкие клинические сценарии, ускорять прототипирование и масштабировать обучение без доступа к пациентам.

https://developer.nvidia.com/blog/developing-healthcare-robotics-with-gpu-native-medical-physics-simulation/
Nvidia выпустила NOOA — открытый фреймворк для AI-агентов

NVIDIA Labs представила NOOA (Object-Oriented Agents) — опенсорсный фреймворк, где агент — это обычный Python-класс. Методы — это возможности, поля — состояние, докстринги — промпты.

Результаты впечатляют: 82.2% на SWE-bench Verified (лучше предыдущего SOTA 79.2%), 86.8% на CyberGym L1 и 85.1% на ARC-AGI-3 — и всё это вдвое дешевле конкурентов по токенам.

Ключевая идея: агент сам управляет долгосрочной памятью через SQLite, передаёт объекты по ссылке вместо сериализации в контекст, и не требует сжатия контекста вообще. Итог — та же точность при вдвое меньших затратах.

Для разработчиков это значит: агентов теперь можно тестировать, версионировать и ревьюить как обычный код.

https://developer.nvidia.com/blog/six-agent-harness-capabilities-for-higher-model-performance/
Зачем гонять робота через миллиарды параметров, если BERT справится?

Все современные VLA-модели для роботов устроены одинаково: берём огромный LLM, пропускаем через него картинку и инструкцию, получаем действие. Красиво, но медленно и прожорливо по памяти.

TurboVLA задаёт неудобный вопрос: а зачем вообще LLM в цикле управления? Когда робот уже знает задачу ("возьми красный кубик"), ему не нужно генерировать текст — нужно просто смотреть и двигаться.

Решение простое: отдельный визуальный энкодер + лёгкий BERT для текста + кросс-аттеншн между ними → предсказание чанка действий за один проход. Никакого авторегрессивного декодинга, никакого LLM в петле.

Результат: 0.2B параметров, меньше 1 ГБ VRAM, 32 Гц на RTX 4090. При этом 97.7% успеха на LIBERO — столько же, сколько у моделей в 6 раз больше (π0.5).

Главный посыл: execution-level control и open-ended reasoning — разные задачи. Не надо смешивать.

https://arxiv.org/abs/2607.27205
Mage-VL: видеомодель, которая смотрит как мозг, а не как камера (by Microsoft)

Обычные VLM обрабатывают каждый кадр целиком — даже если 90% сцены не изменилось. Mage-VL делает иначе: берёт принципы видеокодеков (как H.265) и кодирует только те патчи, где что-то реально движется. Статичный фон? Пропускаем. Результат — на 75% меньше токенов и ускорение инференса до 3.5x.

Ещё интереснее архитектура: System 1 — лёгкий гейт, который следит за стримом и решает, когда реагировать. System 2 — полная языковая модель, которая включается только при событии. Прямо как в нейробиологии.

Бонус: Mage-ViT обучен с нуля на 560M изображений и 100M видео — без миллиардов пар картинка-текст. И при этом не уступает SigLIP2. Вывод авторов: структурное соответствие данных важнее их масштаба.

https://arxiv.org/abs/2607.24904
Expanding Flow Maps: генерация с переменной размерностью за несколько шагов

Стандартные flow-based модели страдают от одного ограничения: размерность выхода фиксируется при инициализации. Хочешь сгенерировать молекулу неизвестного размера или текст произвольной длины — классический flow не поможет.

Авторы вводят Expanding Flow Maps (EFMs): каждый шаг состоит из двух операций — expand (добавляем новые координаты/токены с шумом) и transport (двигаем расширенное состояние к целевому распределению). Стандартные flow maps — частный случай, где expand — тождественное отображение.

Работает и для непрерывных, и для дискретных данных (через simplex-представление). Эксперименты: генерация молекулярных конформеров, графов молекул и языковое моделирование — всё в рамках единого фреймворка с произвольным бюджетом шагов.

https://arxiv.org/abs/2607.21585
OpenAI выяснила, как два простых параметра API утроили результаты GPT-5.6 на бенчмарке ARC-AGI-3.

Первый — сохранение цепочки рассуждений между запросами. Модель не начинает думать с нуля каждый раз, а опирается на предыдущие выводы. Второй — компактизация контекста: длинные рассуждения сжимаются, что экономит токены и ускоряет работу.

В итоге — утроение баллов на одном из самых сложных тестов на общий интеллект, плюс заметный рост эффективности.

Для разработчиков это конкретный сигнал: правильная настройка API даёт больше, чем кажется. Два флага — и модель работает принципиально иначе.

https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores
Nvidia Tech запустила туториал по развёртыванию собственного AI-ассистента для кода с защитой через NeMo Guardrails.

Суть: можно поднять StarCoder2-7B на своих GPU, не отправляя исходники за пределы сети. Между IDE и моделью встаёт NeMo Guardrails — он блокирует запросы к "человеческому" коду (авторизация, платежи, крипто). CI-пайплайн ловит галлюцинированные зависимости до мержа, а Prometheus/Grafana показывают, улучшает ли AI-код качество или нет.

Почему важно: для регулируемых отраслей это решает три боли сразу — суверенитет данных, supply-chain риски и аудитируемость. Модель предлагает код, но контроль остаётся в руках команды.

Нужны: NGC API-ключ, GPU от 24 ГБ (A10/L4/A100), Docker и Python 3.10+.

https://developer.nvidia.com/blog/how-to-self-host-a-validated-ai-coding-assistant-with-nvidia-nemo-guardrails/
Apple ML представила архитектуру синтеза речи для Siri Expressive Voices, которая работает прямо на устройстве.

Суть: новый детокенизатор превращает семантические аудиотокены в высококачественную речь за ~10 мс на шаг — это примерно в 16 раз быстрее реального времени. При этом пиковое потребление памяти составляет всего 21 МБ.

Ключевое решение — разделение временной и глубинной обработки. Один переиспользуемый декодер с Diffusion Transformer заменяет несколько отдельных декодеров, а скользящее окно внимания с фиксированным кешем даёт постоянное потребление памяти независимо от длины аудио.

Результат в продакшене: MOS вырос на +0.28 в целом и на +0.42 для разговорной речи по сравнению с предыдущей системой. Именно эта архитектура стоит за слайдерами Pace и Expressivity в Siri и поддержкой кастомных голосов на устройствах Apple.

Важно: всё работает на чипе AMX без облака — это прямо влияет на приватность пользователей.

https://machinelearning.apple.com/research/audio-synthesis-diffusion-transformers
ИИ, который улучшает ИИ — и учится делать это лучше

Frontis AI представила Frontis-MA1 — агента для машинного обучения, который сам пишет ML-код, запускает эксперименты и итеративно улучшает решения. Ключевая идея: замкнуть петлю рекурсивного самоулучшения.

Система состоит из трёх частей: OpenMLE-Gym (5758 верифицируемых задач с изолированным исполнением), OpenMLE-ERL (обучение операторов Draft/Improve/Debug/Crossover через RL на основе фидбека от выполнения кода) и OpenMLE-Evo (эволюционный поиск с памятью опыта).

Фишка в том, что операторы улучшения обучаются на тех же трансформациях, которые потом используются при инференсе — модель становится движком собственной эволюции.

Результат: Frontis-MA1-35B на MLE-Bench Lite достигает 71.21% Medal Average, обходя GPT-5.5 + Codex. Обещают открыть датасеты, код и веса.

https://arxiv.org/abs/2607.28568
Память прямо в весах модели — без RAG, без внешних баз

Большинство AI-агентов хранят память снаружи: RAG, векторные базы, явный retrieval. Это создаёт три проблемы: память оторвана от модели, градиенты не проходят через дискретные операции, и всё это тормозит инференс.

Команда MemTensor предлагает Memory Foundation Model — концепцию, где память встроена прямо в параметры модели. Идея: вместо внешнего хранилища модель меняет часть своих весов θ_t на каждом шаге взаимодействия. Remembering, forgetting, updating — всё происходит внутри forward pass.

Первый прототип называется Metis. Архитектура вдохновлена Fast Weight Programming: каждый блок содержит hyper memory block + local memory block. Обучается через специальные задачи: memory reconstruction и memory operation objectives.

Аналогия авторов: это как переход от обычных LLM к reasoning-моделям, где CoT встроен в инференс. Только здесь встроена память.
Датасет для воплощённого ИИ: записали 150 часов домашней жизни со всех сторон

Чтобы роботы научились вести себя дома, им нужны данные о том, как люди реально взаимодействуют с предметами. Но существующие датасеты либо дают видео без точных поз тела, либо точные позы без эгоцентрического вида, либо короткие клипы без долгосрочного контекста.

Авторы построили систему ACE — оснащённые сенсорами реальные квартиры, где 50 участников 150 часов занимались готовкой, уборкой и т.п. Итог: 17М кадров, 75К эпизодов взаимодействий, 200 категорий задач. Ключевое: все модальности синхронизированы — эгоцентрическое видео, 8+ внешних камер, полная поза тела, 6DoF траектории объектов, аудио и тактильные сигналы одновременно и в одной системе координат.

На этих данных построен трёхуровневый бенчмарк: предсказание тактильных сигналов по видео, оценка позы тела и анализ взаимодействия рук с объектами. Тестирование 30+ методов показало, что все они серьёзно проваливаются на реальных домашних сценах.
Microsoft Research выпустила Echoverse — систему тренировочных сред для AI-агентов, работающих с компьютером.

Суть: вместо сотен поверхностных симуляций — 12 глубоких миров, точно воспроизводящих логику реальных приложений (почта, банкинг, внутренние консоли). Каждый мир хранит настоящее состояние базы данных, которое меняется от действий агента.

Результат впечатляет: модель на 9B параметров подняла точность с 36.5% до 67.1% — почти вдвое, отставая от GPT-5.4 всего на 14 пунктов.

Ключевой вывод: качество среды важнее количества. Мелкие, «поверхностные» миры не просто не помогают — они ухудшают результат.

Четыре среды с кодом, данными и верификаторами уже открыты на GitHub и Hugging Face.

https://www.microsoft.com/en-us/research/blog/echoverse-deep-evolving-environments-for-computer-use-agents/
Microsoft Research представила EvoLib — систему, которая учит ИИ накапливать знания из опыта без переобучения модели.

Суть проста: обычная память ИИ — это архив прошлых диалогов и действий. EvoLib идёт дальше: он извлекает из опыта переиспользуемые навыки и выводы, а затем постоянно их уточняет и обобщает. Как человек, который помнит не каждую деталь, а то, что реально работает.

Главное: система не требует обновления весов модели и работает с любыми LLM через API, включая закрытые.

На тестах — математика, написание кода, принятие решений — EvoLib стабильно обходит конкурирующие подходы на основе памяти и эффективнее конвертирует вычисления в рост качества.

Код уже открыт на GitHub.

https://www.microsoft.com/en-us/research/blog/evolib-turning-experience-into-evolving-knowledge/
Nvidia выпустила nvmath-python v1.0 — библиотеку, которая открывает Python-разработчикам доступ к мощи CUDA-X математических библиотек (cuFFT, cuBLASLt, cuSPARSE и другим) без написания C/C++ кода.

Что важно: библиотека работает с NumPy, CuPy и PyTorch, поддерживает CPU, GPU и распределённые многоузловые системы. Можно буквально написать три строки кода и получить GPU-ускоренное матричное умножение.

Главные фишки: универсальные разреженные тензоры (UST) с кастомными форматами через DSL, два типа API — универсальные и специализированные для максимальной производительности, JIT-компиляция через numba-cuda, интеграция с Python logging для трассировки вычислений.

Устанавливается через pip, conda или uv. Для кого это важно: исследователи, ML-инженеры и все, кто занимается научными вычислениями и хочет выжать максимум из железа NVIDIA без погружения в низкоуровневые интерфейсы.

https://developer.nvidia.com/blog/run-high-performance-core-math-at-scale-with-nvidia-nvmath-python/
GUI-агент от Alibaba, который реально работает на телефоне, а не только в симуляторе (by TongyiLab / Alibaba)

Большинство GUI-агентов хорошо выглядят на бенчмарках, но ломаются на реальных устройствах. Qwen-UI-Agent строился вокруг одной идеи: настоящая польза, а не симуляция.

Что внутри:
— 100+ физических Android-устройств для сбора данных и обучения
— Гибридное пространство действий: GUI + bash CLI + батчинг (40%+ шагов батчатся)
— Online RL на траекториях длиной 100+ шагов, 10 000 параллельных сред
— AutoResearch: агенты сами генерируют задачи, анализируют ошибки, предлагают следующую итерацию
— Проактивный режим: агент видит уведомление о рейсе и сам предлагает план переезда

Результаты: 92.2% на реальном бенчмарке MobileWorld-Real, обгоняет Claude Opus 4.8, GPT-5.6 Sol и Gemini 3.1 Pro.

https://arxiv.org/abs/2607.28227
Код как цепочка рассуждений для физически корректных видео

Главная проблема генерации видео — "каузальная непрозрачность": промпт описывает событие сжато, а модель должна сама восстановить полный физический процесс. VideoCoCo решает это радикально: вместо того чтобы генерировать видео напрямую, агент сначала пишет программу на Blender, которая явно кодирует сцену и её эволюцию во времени.

Система работает в два этапа. Сначала Executable Simulation Engine генерирует низкокачественный, но физически корректный черновик через симуляцию. Затем Generative Video Engine превращает этот черновик в фотореалистичное видео через draft-conditioned editing. Физика — за симулятором, внешний вид — за диффузионной моделью.

Для обучения второго движка авторы собрали датасет VideoCoCo-3K из троек (черновик, инструкция, целевое видео). На бенчмарках PhyGenBench и VBench-2.0 метод показывает SOTA, особенно в термодинамике и свойствах материалов.

https://arxiv.org/abs/2607.27380
(by Adobe) Как применить Chinchilla-scaling к диффузионным моделям?

Генерация видео 4K+ — это десятки тысяч токенов, и квадратичный self-attention просто не вывозит. Adobe представили Chimera — гибридный диффузионный трансформер для «token-extensive» режима.

Ключевые идеи:
1. Большинство слоёв используют линейное внимание KDA (O(N)), а не полное — с периодическими MLA-слоями для глобального взаимодействия.
2. Modality-aware свёртки обогащают локальный контекст перед каждым KDA-обновлением — без позиционных эмбеддингов вообще.
3. HeteroP — новый способ переносить гиперпараметры между масштабами модели, учитывая разнородность тензоров в визуальных архитектурах.
4. Chinchilla-style scaling laws для image/video: оптимальный размер модели растёт почти линейно с токенами (N ∝ C^0.48–0.52).

Результат: модель 11B (2B активных) достигает качества Wan 2.1 (2B) за 7.3× меньше FLOPs, поддерживает в 1.68× длиннее последовательности на A100 и генерирует 30-секундные видео, обучившись только на 5-секундных клипах.
OpenAI опубликовала результаты работы своих моделей над давними нерешёнными задачами в математике и теоретической информатике. В числе достижений — прорывы в геометрии, криптографии и теории сложности вычислений.

Это важно: ИИ больше не просто помогает решать задачи из учебников — он двигает вперёд фундаментальную науку, которая лежит в основе современной криптографии и алгоритмов. Некоторые из этих проблем не решались десятилетиями.

Для пользователей это сигнал: модели OpenAI достигают уровня, на котором они способны работать как полноценные научные партнёры, а не просто ассистенты. Следующий шаг — применение этих возможностей в реальных исследованиях и разработках.

https://openai.com/index/ten-advances-in-mathematics
Google DeepMind запустила Gemini Robotics ER 2 — новую модель, которая работает как "мозг высшего уровня" для роботов.

Что нового: модель в реальном времени анализирует видеопоток, отслеживает прогресс выполнения задач и сама исправляет ошибки на ходу. Поддерживается многошаговое планирование без раздражающих пауз "остановился — подумал". Главная фишка — роботы теперь могут работать в команде: например, Apollo 2 от Apptronik и манипулятор Franka F3 Duo совместно выполняют задачи, которые одному роботу не под силу.

Точность определения момента завершения задачи — 91,3%, при этом модель работает в 4 раза быстрее аналогов с куда меньшими вычислительными затратами.

Доступно уже сейчас через Gemini API и Google AI Studio.

https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration/
Nvidia опубликовала технический гайд по co-design архитектуры внимания (attention) для ускорения LLM-инференса на GPU.

Суть: как правильно выбрать group size, размерность головы и длину контекста, чтобы модель работала быстро и интерактивно — особенно при длинных контекстах.

Ключевые выводы:
— Для decode-фазы важен большой group size (G): удвоение G удваивает эффективность. MHA тут проигрывает GQA/MQA.
— Для prefill-фазы решает длина контекста, а не G — менять его бесполезно.
— Оптимальная размерность головы — 128 или 256: лучше выравнивание под GPU-тайлы.
— Tensor Parallelism нельзя превышать число KV-голов, иначе дублирование кэша убивает производительность.

Почему важно: при контексте 128K внимание занимает уже 85% времени prefill (против 18% при 4K). Без грамотного co-design модель просто не масштабируется.

Nvidia выпустит отдельный материал по sparse attention — следим.

https://developer.nvidia.com/blog/co-designing-ai-model-attention-for-fast-interactive-long-context-inference/