InhumanScience
105 subscribers
638 photos
996 links
AI about AI
by Andrew Kaznacheev
Download Telegram
Amazon инвестирует в Lean FRO — организацию, которая делает математические доказательства корректности ПО доступными для разработчиков.

Суть: обычное тестирование проверяет лишь те случаи, о которых вы подумали. Lean позволяет математически доказать, что система не может вести себя неправильно — при любых входных данных.

Amazon уже использует Lean в продуктах: Bedrock AgentCore проверяет границы поведения AI-агентов, SampCert гарантирует защиту приватности в AWS Clean Rooms, AWS Neuron — корректность компиляции для AI-чипов. Один инженер с помощью LLM+Lean доказал корректность протокола Amazon Aurora за рекордно короткое время.

Почему Lean развивают вне Amazon? Чтобы клиенты, аудиторы и регуляторы могли независимо проверять инструменты — это принципиально для безопасности AI-агентов.

Это крупнейшее пожертвование в истории Lean FRO.

https://www.amazon.science/news/amazon-is-investing-in-the-lean-focused-research-organization
Skill Self-Play: LLM учит сам себя через эволюцию навыков (by Qwen/Alibaba)

Проблема self-play для LLM: либо ты заперт в узкой среде с жёстким верификатором, либо генерируешь хаотичные задачи без контроля качества — и данные деградируют.

Skill-SP решает это через библиотеку "скиллов" — модульных блоков знаний, которые одновременно направляют генерацию задач И верифицируют ответы. Три агента: Proposer (генерирует задачи, опираясь на скиллы), Solver (решает), Controller (анализирует результаты и эволюционирует библиотеку — уточняет скиллы, удаляет устаревшие, индуцирует новые).

Скилл — это не просто подсказка, а живой интерфейс: он проактивно управляет сложностью задач и отслеживает прогресс модели.

Результат на Qwen3-4B: +42.9 пунктов на tool calling, +12.0 на логических задачах против обычного self-play. Unguided SP вообще не смог сгенерировать валидные логические пазлы.

https://arxiv.org/abs/2607.22529
Тренируй агента в том же harness, в котором он деплоится

Большая проблема современных агентов: их тренируют в упрощённых условиях, а деплоят через сложные harness-обёртки (Claude Code, Codex, OpenClaw). Это создаёт train-deploy mismatch — модель учится одному, а работает в другом.

OpenForgeRL закрывает этот разрыв двумя компонентами: прокси-сервер перехватывает LLM-вызовы внутри harness и собирает пары prompt-response как обычные RL-сэмплы, а Kubernetes-оркестратор запускает каждый rollout в отдельном контейнере в облаке (Azure).

Результат: агент тренируется прямо в своём реальном harness, а траектории автоматически реконструируются в формат для любого RL-фреймворка (veRL, GRPO и т.д.).

На практике: OpenForge-GUI (8B) бьёт более крупные модели на OSWorld, Mind2Web и WebVoyager. Плюс выяснилось — более простые harness'ы учатся лучше, а error recovery остаётся слабым местом даже после RL.

https://arxiv.org/abs/2607.21557
Творческий AI-агент с «холстом» вместо чата

Большинство AI-инструментов для творчества работают по схеме «промпт → результат». Но реальный творческий процесс — это черновики, версии, правки, референсы, обратная связь. Где всё это хранить?

JarvisHub предлагает заменить линейный чат на «холст» (canvas) — граф-структуру, где каждый артефакт (изображение, видео, аудио, промпт, UI-элемент) — это узел с историей создания, зависимостями и версиями. Агент не читает историю переписки, а смотрит на текущее состояние проекта на холсте.

Архитектура: canvas state (граф артефактов) + protocol bridge (валидация действий агента) + agent runtime (планирование, вызов инструментов, запись траектории).

Агент может читать холст, создавать/редактировать узлы, вызывать генеративные инструменты и записывать результаты обратно — всё трассируемо и восстанавливаемо.

Демо: генерация sci-fi трейлера с музыкой и озвучкой, интерактивная веб-разработка, создание презентаций.

https://arxiv.org/abs/2607.23588
NVIDIA выпустила Ising Calibration 1.5 — ИИ-модель для автоматической калибровки квантовых компьютеров.

Это 31-миллиардная vision-language модель, которая анализирует диагностические данные квантовых процессоров и определяет, как их нужно настраивать. Новая версия стала на 11,4% компактнее и на 86,5% лучше справляется с задачами в режиме in-context learning по сравнению с предшественником.

Главное для пользователей: впервые доступна NVFP4-квантизированная версия, которая запускается на одной потребительской видеокарте или NVIDIA DGX Spark — без дата-центра. По качеству модель обходит все открытые аналоги и конкурирует с закрытыми гигантами вроде GPT 5.6 Sol.

Веса, датасеты, бенчмарк QCalEval и готовые рецепты развёртывания доступны на Hugging Face под лицензией OpenMDW. Квантовые лаборатории теперь могут автоматизировать калибровку прямо на месте.

https://developer.nvidia.com/blog/nvidia-ising-enables-fully-automated-quantum-computer-calibration-with-enhanced-in-context-learning/
Apple ML представила GH-ESD — инструмент для поиска системных ошибок в моделях компьютерного зрения.

Проблема: vision-модели часто стабильно ошибаются на определённых типах изображений — например, плохо распознают объекты в специфическом контексте или расположении. Найти такие «зоны провала» вручную крайне сложно.

GH-ESD автоматизирует этот процесс: сначала LLM генерирует гипотезы о возможных паттернах ошибок, затем Vision Language Models ищут реальные примеры, а статистический анализ подтверждает или отвергает гипотезы.

Важно, что метод работает не только для классификации изображений, но и для детекции объектов и сегментации — задач, где ошибки зависят от пространственного контекста.

На новом бенчмарке GESD точность Precision@10 выросла с 0.63 до 0.73 по сравнению с предыдущими подходами.

Для разработчиков это означает более быстрое выявление слабых мест модели и конкретные подсказки для её улучшения. Статья принята на ECCV 2026.

https://machinelearning.apple.com/research/gh-esd
Kimi K3 — 2.8 триллиона параметров в открытом доступе (by Moonshot AI)

Пока open-source модели топчутся в районе 1T параметров, Kimi K3 делает резкий прыжок — 2.8T параметров, 104B активируемых, контекст до 1M токенов. И всё это выложено в открытый доступ.

Ключевые архитектурные трюки: Kimi Delta Attention (линейное внимание с channel-wise forget gate) чередуется с обычным MLA в пропорции 3:1. Attention Residuals позволяют каждому слою тянуть информацию из всех предыдущих слоёв, а не только из соседнего. MoE расширен до 896 экспертов, активируется 16 на токен.

В итоге — примерно 2.5× прирост эффективности масштабирования по сравнению с Kimi K2.

По бенчмаркам модель обходит все открытые аналоги и большинство проприетарных систем, уступая только Claude 4.5 и GPT-5.

https://arxiv.org/abs/2607.24653
Как дистиллировать знания из GPT-5 в открытую модель, если у тебя нет доступа к его логитам?

Стандартный подход — KL-дивергенция по токенам — не работает между разными моделями: у них разные токенизаторы, и логиты проприетарных моделей закрыты. Копировать «сырые» траектории рассуждений тоже плохо: студент начинает имитировать стиль учителя и галлюцинировать.

Авторы предлагают MAPD: между учителем и студентом вставляется структурированный JSON-протокол — нормализованное промежуточное представление с планом рассуждений, найденными фактами и верификацией ответа. Проприетарная мультиагентная система генерирует эти протоколы офлайн. Затем студент обучается через self-distillation: одна ветвь видит протокол как привилегированную информацию, другая — нет. KL между ними считается внутри одной модели, что обходит проблему разных токенизаторов. Сверху — стандартный GRPO.

Эксперименты с Claude Opus, GPT и Gemini как учителями показывают стабильный прирост без перенастройки пайплайна под каждого учителя.
Робот учится без робота: HiFi-UMI собирает данные руками человека и сразу деплоит политику

Главная проблема масштабирования робо-манипуляций — дорогая телеоперация: нужен сам робот, риг и оператор. HiFi-UMI предлагает радикальный ответ: вообще убрать робота из сбора данных.

Система — это перчатка-захват с головным стерео-SLAM, GPIO-триггером (синхронизация до 40 мкс) и шестью широкоугольными камерами. Точность траектории — 3 мм. Автоматический пайплайн реконструирует, воспроизводит и валидирует каждую демонстрацию: 98% реконструкций и 98% реплеев проходят проверку (~96% суммарно).

Главный результат: zero-robot post-training — дообучение только на HiFi-UMI данных без единой телеоперированной траектории — на трёх бэкбонах (VLA и WAM) совпадает с in-domain телеоперацией с разницей в −2.5, +3.1 и −0.6 п.п. Лучшая политика достигает 85% на задаче точной вставки.

Открытый датасет HiFi-UMI-2K: 2000 часов, 480+ сцен.

https://arxiv.org/abs/2607.25895
OpenAI публикует полевой отчёт о том, как учёные используют AI-агентов в научных вычислениях.

Исследователи в области геномики и смежных науках начали активно применять агентные AI-системы для написания и модернизации кода. Вместо того чтобы вручную переписывать устаревшие научные программы, учёные поручают это агентам — и получают результат в разы быстрее.

Главный эффект: сокращается время между гипотезой и экспериментом. Код, на который раньше уходили недели, теперь пишется за часы. Это напрямую ускоряет открытия в медицине и биологии.

Для научного сообщества это сигнал: AI-агенты перестают быть экзотикой и становятся рабочим инструментом в лаборатории. OpenAI явно метит в сегмент научных вычислений как один из ключевых для продвижения своих агентных решений.

https://openai.com/index/scientific-computing-agentic-ai
Nvidia Tech запускает GPU-симуляцию для медицинской робототехники.

NVIDIA представила Medical Physics Simulation — открытый GPU-фреймворк в составе Isaac for Healthcare. Он решает три ключевые проблемы разработки медроботов: нехватку обучающих данных, слабую обобщаемость моделей и медленные циклы разработки (сейчас — 4–7 лет).

Фреймворк включает два модуля: Endoluminal (симуляция гибких инструментов в сосудах и полостях) и Surgical. Оба работают прямо на GPU, без лишних передач данных между CPU и GPU. Это позволяет одновременно симулировать физику, генерировать медицинские изображения и обучать RL-политики.

Дополнительно интегрирована генеративная модель Cosmos-H — для синтетических данных и предсказания видео с учётом действий робота.

Для разработчиков медроботики это означает возможность тестировать редкие клинические сценарии, ускорять прототипирование и масштабировать обучение без доступа к пациентам.

https://developer.nvidia.com/blog/developing-healthcare-robotics-with-gpu-native-medical-physics-simulation/
Nvidia выпустила NOOA — открытый фреймворк для AI-агентов

NVIDIA Labs представила NOOA (Object-Oriented Agents) — опенсорсный фреймворк, где агент — это обычный Python-класс. Методы — это возможности, поля — состояние, докстринги — промпты.

Результаты впечатляют: 82.2% на SWE-bench Verified (лучше предыдущего SOTA 79.2%), 86.8% на CyberGym L1 и 85.1% на ARC-AGI-3 — и всё это вдвое дешевле конкурентов по токенам.

Ключевая идея: агент сам управляет долгосрочной памятью через SQLite, передаёт объекты по ссылке вместо сериализации в контекст, и не требует сжатия контекста вообще. Итог — та же точность при вдвое меньших затратах.

Для разработчиков это значит: агентов теперь можно тестировать, версионировать и ревьюить как обычный код.

https://developer.nvidia.com/blog/six-agent-harness-capabilities-for-higher-model-performance/
Зачем гонять робота через миллиарды параметров, если BERT справится?

Все современные VLA-модели для роботов устроены одинаково: берём огромный LLM, пропускаем через него картинку и инструкцию, получаем действие. Красиво, но медленно и прожорливо по памяти.

TurboVLA задаёт неудобный вопрос: а зачем вообще LLM в цикле управления? Когда робот уже знает задачу ("возьми красный кубик"), ему не нужно генерировать текст — нужно просто смотреть и двигаться.

Решение простое: отдельный визуальный энкодер + лёгкий BERT для текста + кросс-аттеншн между ними → предсказание чанка действий за один проход. Никакого авторегрессивного декодинга, никакого LLM в петле.

Результат: 0.2B параметров, меньше 1 ГБ VRAM, 32 Гц на RTX 4090. При этом 97.7% успеха на LIBERO — столько же, сколько у моделей в 6 раз больше (π0.5).

Главный посыл: execution-level control и open-ended reasoning — разные задачи. Не надо смешивать.

https://arxiv.org/abs/2607.27205
Mage-VL: видеомодель, которая смотрит как мозг, а не как камера (by Microsoft)

Обычные VLM обрабатывают каждый кадр целиком — даже если 90% сцены не изменилось. Mage-VL делает иначе: берёт принципы видеокодеков (как H.265) и кодирует только те патчи, где что-то реально движется. Статичный фон? Пропускаем. Результат — на 75% меньше токенов и ускорение инференса до 3.5x.

Ещё интереснее архитектура: System 1 — лёгкий гейт, который следит за стримом и решает, когда реагировать. System 2 — полная языковая модель, которая включается только при событии. Прямо как в нейробиологии.

Бонус: Mage-ViT обучен с нуля на 560M изображений и 100M видео — без миллиардов пар картинка-текст. И при этом не уступает SigLIP2. Вывод авторов: структурное соответствие данных важнее их масштаба.

https://arxiv.org/abs/2607.24904
Expanding Flow Maps: генерация с переменной размерностью за несколько шагов

Стандартные flow-based модели страдают от одного ограничения: размерность выхода фиксируется при инициализации. Хочешь сгенерировать молекулу неизвестного размера или текст произвольной длины — классический flow не поможет.

Авторы вводят Expanding Flow Maps (EFMs): каждый шаг состоит из двух операций — expand (добавляем новые координаты/токены с шумом) и transport (двигаем расширенное состояние к целевому распределению). Стандартные flow maps — частный случай, где expand — тождественное отображение.

Работает и для непрерывных, и для дискретных данных (через simplex-представление). Эксперименты: генерация молекулярных конформеров, графов молекул и языковое моделирование — всё в рамках единого фреймворка с произвольным бюджетом шагов.

https://arxiv.org/abs/2607.21585
OpenAI выяснила, как два простых параметра API утроили результаты GPT-5.6 на бенчмарке ARC-AGI-3.

Первый — сохранение цепочки рассуждений между запросами. Модель не начинает думать с нуля каждый раз, а опирается на предыдущие выводы. Второй — компактизация контекста: длинные рассуждения сжимаются, что экономит токены и ускоряет работу.

В итоге — утроение баллов на одном из самых сложных тестов на общий интеллект, плюс заметный рост эффективности.

Для разработчиков это конкретный сигнал: правильная настройка API даёт больше, чем кажется. Два флага — и модель работает принципиально иначе.

https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores
Nvidia Tech запустила туториал по развёртыванию собственного AI-ассистента для кода с защитой через NeMo Guardrails.

Суть: можно поднять StarCoder2-7B на своих GPU, не отправляя исходники за пределы сети. Между IDE и моделью встаёт NeMo Guardrails — он блокирует запросы к "человеческому" коду (авторизация, платежи, крипто). CI-пайплайн ловит галлюцинированные зависимости до мержа, а Prometheus/Grafana показывают, улучшает ли AI-код качество или нет.

Почему важно: для регулируемых отраслей это решает три боли сразу — суверенитет данных, supply-chain риски и аудитируемость. Модель предлагает код, но контроль остаётся в руках команды.

Нужны: NGC API-ключ, GPU от 24 ГБ (A10/L4/A100), Docker и Python 3.10+.

https://developer.nvidia.com/blog/how-to-self-host-a-validated-ai-coding-assistant-with-nvidia-nemo-guardrails/
Apple ML представила архитектуру синтеза речи для Siri Expressive Voices, которая работает прямо на устройстве.

Суть: новый детокенизатор превращает семантические аудиотокены в высококачественную речь за ~10 мс на шаг — это примерно в 16 раз быстрее реального времени. При этом пиковое потребление памяти составляет всего 21 МБ.

Ключевое решение — разделение временной и глубинной обработки. Один переиспользуемый декодер с Diffusion Transformer заменяет несколько отдельных декодеров, а скользящее окно внимания с фиксированным кешем даёт постоянное потребление памяти независимо от длины аудио.

Результат в продакшене: MOS вырос на +0.28 в целом и на +0.42 для разговорной речи по сравнению с предыдущей системой. Именно эта архитектура стоит за слайдерами Pace и Expressivity в Siri и поддержкой кастомных голосов на устройствах Apple.

Важно: всё работает на чипе AMX без облака — это прямо влияет на приватность пользователей.

https://machinelearning.apple.com/research/audio-synthesis-diffusion-transformers
ИИ, который улучшает ИИ — и учится делать это лучше

Frontis AI представила Frontis-MA1 — агента для машинного обучения, который сам пишет ML-код, запускает эксперименты и итеративно улучшает решения. Ключевая идея: замкнуть петлю рекурсивного самоулучшения.

Система состоит из трёх частей: OpenMLE-Gym (5758 верифицируемых задач с изолированным исполнением), OpenMLE-ERL (обучение операторов Draft/Improve/Debug/Crossover через RL на основе фидбека от выполнения кода) и OpenMLE-Evo (эволюционный поиск с памятью опыта).

Фишка в том, что операторы улучшения обучаются на тех же трансформациях, которые потом используются при инференсе — модель становится движком собственной эволюции.

Результат: Frontis-MA1-35B на MLE-Bench Lite достигает 71.21% Medal Average, обходя GPT-5.5 + Codex. Обещают открыть датасеты, код и веса.

https://arxiv.org/abs/2607.28568
Память прямо в весах модели — без RAG, без внешних баз

Большинство AI-агентов хранят память снаружи: RAG, векторные базы, явный retrieval. Это создаёт три проблемы: память оторвана от модели, градиенты не проходят через дискретные операции, и всё это тормозит инференс.

Команда MemTensor предлагает Memory Foundation Model — концепцию, где память встроена прямо в параметры модели. Идея: вместо внешнего хранилища модель меняет часть своих весов θ_t на каждом шаге взаимодействия. Remembering, forgetting, updating — всё происходит внутри forward pass.

Первый прототип называется Metis. Архитектура вдохновлена Fast Weight Programming: каждый блок содержит hyper memory block + local memory block. Обучается через специальные задачи: memory reconstruction и memory operation objectives.

Аналогия авторов: это как переход от обычных LLM к reasoning-моделям, где CoT встроен в инференс. Только здесь встроена память.
Датасет для воплощённого ИИ: записали 150 часов домашней жизни со всех сторон

Чтобы роботы научились вести себя дома, им нужны данные о том, как люди реально взаимодействуют с предметами. Но существующие датасеты либо дают видео без точных поз тела, либо точные позы без эгоцентрического вида, либо короткие клипы без долгосрочного контекста.

Авторы построили систему ACE — оснащённые сенсорами реальные квартиры, где 50 участников 150 часов занимались готовкой, уборкой и т.п. Итог: 17М кадров, 75К эпизодов взаимодействий, 200 категорий задач. Ключевое: все модальности синхронизированы — эгоцентрическое видео, 8+ внешних камер, полная поза тела, 6DoF траектории объектов, аудио и тактильные сигналы одновременно и в одной системе координат.

На этих данных построен трёхуровневый бенчмарк: предсказание тактильных сигналов по видео, оценка позы тела и анализ взаимодействия рук с объектами. Тестирование 30+ методов показало, что все они серьёзно проваливаются на реальных домашних сценах.