NVIDIA выпустила открытую бета-версию Personal AI Router — PAIR. Программа объединяет совместимые компьютеры одной сети в кластер и распределяет между ними запросы локальных ИИ-агентов.
Однако название немного вводит в заблуждение. PAIR — точно не физический роутер и пока не диспетчер выбора моделей, автоматически решающий, когда вызвать маленькую локальную модель, а когда облачную — Claude, Gemini или GPT. Это маршрутизатор запросов между вычислительными узлами локальной сети. И, к сожалению, PAIR пока не отправит особенно сложный запрос во фронтирную облачную модель автоматически. Для этого нужен второй слой — маршрутизатор между моделями, например NeMo Switchyard, NVIDIA LLM Router либо собственный шлюз с правилами и проверкой результата.
Как это работает?
Например, приложение ИИ-агента обращается к привычному локальному адресу Ollama или LM Studio. PAIR перехватывает запрос, проверяет, на каких компьютерах есть нужная модель и свободные ресурсы, отправляет его на один подходящий узел и возвращает результат. А для ИИ-агента вся сеть выглядит как единая точка входа.
PAIR не складывает видеопамять разных устройств, не делит одну модель между несколькими GPU и не превращает 14B и 32B в условную модель на 46 млрд параметров. Каждый запрос целиком выполняется на одном компьютере. Выигрыш возникает, когда агент порождает много независимых обращений: например, пять субагентов параллельно изучают разные документы, пишут код и проверяют выводы.
В демонстрации NVIDIA задача с пятью субагентами и Qwen 3.6 35B выполнялась на одном RTX Spark за 18 минут, а на трёх устройствах с PAIR — за 8 минут 48 секунд.
Можно ли установить PAIR сейчас?
Исходный код опубликован под Apache 2.0, доступны установщики для Windows, Linux и macOS. На старте поддерживаются Ollama и LM Studio, видеокарты GeForce RTX начиная с 20-й серии, RTX Pro, DGX Spark и компьютеры Apple с M4 и новее. Устройства находятся через локальную сеть.
Продукт пока новый. Планировщик учитывает наличие модели и загрузку очереди, однако ещё не умеет полноценно оценивать скорость GPU, объём свободной VRAM, «прогретость» модели, сложность запроса и ожидаемое время ответа. Поэтому неоднородный парк машин он может использовать неоптимально.
Для обычного API в ЦОД, vLLM или внешнего облачного сервиса штатной интеграции пока нет.
Таким образом, PAIR решает не всю задачу гибридного ИИ, а её нижний этаж: помогает эффективнее использовать локальное железо. Но именно из таких этажей постепенно складывается новая вычислительная архитектура — где агент получает не одну модель, а целую лестницу интеллекта и поднимается настолько высоко, насколько требует задача.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥2💯2
OpenAI представила доказательство нового результата ИИ в области простых чисел, полученного GPT-6 Astra: среди бесконечной последовательности простых чисел бесконечно много раз встретятся два соседних числа, расстояние между которыми не превышает 186.
Это новый рекорд. В 2013 году Итан Чжан впервые доказал, что такая постоянная вообще существует, получив верхнюю границу — 70 млн. Джеймс Мейнард вскоре уменьшил её до 600, а коллективный проект Polymath8 — до 246. Джулия Штадльманн предложила оценку 240.
Но важно понимать, чего Astra пока не доказала. Гипотеза о простых числах- близнецах утверждает, что бесконечно часто встречаются пары с разницей ровно 2: например, 11 и 13.
Новый результат Astra говорит лишь, что бесконечно много раз расстояние между соседними простыми будет не больше 186. Каким именно минимальным окажется этот повторяющийся разрыв, мы по-прежнему не знаем.
Почему такая простая на вид задача сопротивляется математикам?
Представьте бесконечный лист бумаги с натуральными числами. Решето позволяет вычеркнуть числа, делящиеся на 2, 3, 5 и другие простые. Но нам нужно доказать не просто существование очередного простого числа, а синхронно сохранить две соседние «дырки» в решете — причём сделать это бесконечно много раз.
Здесь возникает знаменитый барьер чётности: современные методы решета плохо отличают простое число от произведения двух простых.
Поэтому математики умеют доказать, что среди набора из нескольких десятков тщательно выбранных позиций обязательно найдутся хотя бы два простых, но пока не могут подобрать две конкретные позиции с расстоянием 2.
Каждое уменьшение границы — это не перебор дополнительных чисел. Требуется лучше понять распределение простых в арифметических прогрессиях, подобрать новые веса решета и доказать, что вся конструкция продолжает работать на бесконечности.
Astra объединила оценки Polymath8 и Штадльманн с новыми условиями факторизации и численной оптимизацией.
Насколько надёжно доказательство?
OpenAI опубликовала 39-страничную работу, численный сертификат и формализацию в Lean 4. Но называть её полностью машинно проверенным доказательством пока рано. Lean подтвердил логическую цепочку при трёх явно заданных аксиомах. Две опираются на известные результаты из литературы, третья включает численные оценки, проверяемые отдельной программой. Эти входные утверждения ещё не формализованы внутри Lean.
Не раскрыта полностью и степень автономности Astra: OpenAI пишет, что доказательство принадлежит модели, но не публикует исчерпывающий протокол человеческого сопровождения. Работа также ещё должна пройти независимую математическую экспертизу.
Как Astra выглядит на фоне других моделей?
Здесь полезно различать три уровня.GPQA Diamond проверяет знание физики, химии и биологии на уровне аспирантуры. Astra получила 96% против 93,7% у Claude Fable 5.1 и 95,3% у Gemini 3.8 Flash. Это впечатляюще, но всё ещё экзамен с известным ответом.
Terminal-Bench Science ближе к работе исследователя: нужно запускать код, анализировать данные, строить модели и проводить симуляции. Astra набрала 64,6%, Claude Fable 5.1 — 52,6%, Claude Opus 5 — 30%. Однако эти цифры опубликованы OpenAI, а условия запуска моделей могут различаться.
Самая строгая проверка — независимый FrontierMath Erdős с 68 открытыми математическими задачами и обязательным доказательством в Lean. В стандартном режиме Astra решила 2 задачи из 68 — около 3%. GPT-5.6 Sol, GPT-5.5 и две версии Claude не решили ни одной. В дополнительных, уже несопоставимых запусках Astra справилась с пятью задачами, но суммарные вычислительные расходы превысили $220 тыс.
Картина получается парадоксальная. Astra уже способна иногда производить настоящую новую математику и одновременно терпит неудачу примерно в 97% строго поставленных открытых задач.
Перед нами система, которая может войти в пространство нерешённых проблем, предложить новый ход и оставить после себя доказательство, доступное для проверки человеком и машиной.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2🔥2🏆2
OpenAI опубликовала 166-страничное доказательство того, что трёхмерные уравнения Навье—Стокса способны породить сингулярность: поток вещества начинается совершенно гладко, но за конечное время скорость в крошечной области устремляется к бесконечности. Энергия при этом остаётся ограниченной. Если доказательство выдержит проверку, оно закроет одну из семи задач тысячелетия.
Масштаб вычислительного штурма был огромный. Около 10 тыс. агентов на ещё не представленной модели, которую OpenAI считает значительно сильнее, чем GPT-6 Astra, работали 88 часов. Они обменялись 2,7 млн сообщений и сгенерировали около 130 млрд токенов. Затем Astra за 17 часов перевела доказательство в Lean — язык, позволяющий компьютеру проверить логическую цепочку шаг за шагом.
Почему задача продержалась почти 90 лет?
Уравнения Навье—Стокса описывают движение воды, воздуха и крови. Записать их можно в несколько строк, но в трёх измерениях внутри потока возникает противоборство двух сил.
Вихри растягивают и усиливают другие вихри. Математики десятилетиями не могли доказать, кто победит: сглаживание этих нитей или каскад, способный за конечное время сжать движение до бесконечно тонкой и бесконечно быстрой иглы.
Компьютерная симуляция здесь не спасает. Она видит жидкость как сетку из конечного числа ячеек, а предполагаемая сингулярность прячется во всё меньших масштабах. Численная ошибка может как создать ложный «взрыв», так и скрыть настоящий. Нужна конструкция, охватывающая бесконечную последовательность масштабов и не оставляющая места для погрешности.
Именно такую конструкцию заявляет OpenAI: сжимающийся вихрь раскручивается всё быстрее, а тщательно подобранные колебания компенсируют возникающие ошибки так, чтобы внешняя сила оставалась гладкой.
Важно: это математически сконструированная сила, разрешённая официальными условиями. Результат не означает, что вода в реальном стакане внезапно разгонится до бесконечности.
По сравнению с недавним результатом Astra о разрывах между простыми числами, это успех совершенно другого класса.
Там ИИ улучшил числовую границу: заменил 240 на 186 внутри уже существующей теории. Это было настоящее новое доказательство и очередной рекорд.
Здесь же заявлено окончательное разрешение вопроса, специально выбранного как одна из глубочайших проблем математики. Разница примерно как между улучшением мирового рекорда и завершением экспедиции к вершине, которую до этого никто не покорял.
Если проверка устоит, это станет самым значительным математическим результатом, полученным ИИ.
Публикация ещё не прошла независимое рецензирование. Lean подтверждает корректность формализованной цепочки, однако люди должны проверить, что формальные определения точно соответствуют исходной задаче. Более того, по правилам Clay результат рассматривается только после публикации в квалифицированном издании, двух лет изучения и общего признания математическим сообществом.
История сразу осложнилась спором о приоритете
Тристан Бакмастер из NYU и Левент Альпёге из Anthropic почти одновременно обнародовали близкие результаты для уравнений Эйлера и других систем, развивая программу Диего Кордобы и Луиса Мартинеса-Сороа. Бакмастер утверждает, что Себастьян Бубек из OpenAI предлагал представить результат без Альпёге из-за его работы в Anthropic. При этом сам Бакмастер подчёркивает: он не знает, использовались ли их данные, и прямо не обвиняет OpenAI в заимствовании.
OpenAI отвечает, что ни исследователи, ни агенты не видели их неопубликованные материалы. Однако компания не может полностью исключить, что обезличенные данные от использования её продуктов ранее помогли улучшить модели. Математическое доказательство можно проверить. А вот восстановить происхождение идеи в мире, где учёные думают вместе с закрытыми моделями, будет гораздо сложнее.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥2💯2
7 сентября Верховный народный суд КНР опубликовал «Мнение о рассмотрении в соответствии с законом дел по спорам, связанных с ИИ». Это первый в мире системный акт судебного толкования по делам, связанным с ИИ, изданный высшим судебным органом страны.
Основная цель документа — систематизировать и унифицировать судебную практику по делам, связанным с ИИ, в условиях отсутствия в Китае отдельного комплексного закона об ИИ. Поэтому документ опирается на уже существующее китайское законодательство: Гражданский кодекс, Закон о защите персональных данных, Закон об авторском праве и др.
И это, пожалуй, главная характеристика: Китай не ждет появления отдельного закона об ИИ, чтобы начать формировать судебные правила для ИИ. Он начинает это делать через действующие законы в конкретных судебных сценариях.
Документ состоит из 5 частей и 24 статей, в которых выделены 3 базовых принципа: человек прежде всего, регулирование не должно тормозить развитие ИИ, безопасность как нижняя граница.
Верховный народный суд КНР фиксирует: по умолчанию применяется ответственность при наличии вины. При определении вины суд должен смотреть на конкретный сценарий использования ИИ, степень автономности, потенциальный риск, масштаб ущерба, возможность предотвращения вреда, возможность пользователя предвидеть последствия.
Это одна из самых главных вещей в документе — ответственность пользователя, разработчика, поставщика не должна быть одинаковой во всех случаях.
Что особенно интересно в документе?
Этот документ нельзя назвать просто "правилами для ИИ". По сути, Китай начинает юридически относиться к ИИ не как к единому субъекту, а как к сложной цепочке участников, где каждый получает свою долю ответственности.
Китай не пытается запретить "опасный ИИ". Поэтому этот документ интереснее обычного всеобъемлющего закона об ИИ: он показывает, как право начинает подстраиваться под технологию, которая сама принимает решения, генерирует контент, создает доказательства и сама является источником новых доказательств.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3❤2👍2💯1
7 сентября Insilico Medicine опубликовала в Nature Biotechnology результаты анализа испытаний рентосертиба — препарата, созданного с помощью ИИ. У получавших его пациентов шесть алгоритмов оценки биологического возраста обнаружили изменения в сторону более «молодого» белкового профиля крови.
Почему мы выделяем эту новость? ИИ комплексно помог ускоренно провести реализацию фармацевтической идеи от биологической мишени до подбора молекулы и анализа клинических данных пациентов. Хотя лишь в будущем еще предстоит выяснить, научился ли ИИ мы замедлять само старение.
Что именно произошло?
Рентосертиб испытывали против идиопатического лёгочного фиброза — заболевания, при котором ткань лёгких постепенно рубцуется. В рандомизированном исследовании фазы IIa участвовал 71 пациент, лечение продолжалось 12 недель. Главной целью была оценка безопасности.
Новая работа посвящена образцам крови 42 участников, средний возраст которых составлял около 67 лет. Исследователи измерили 2 841 белок и применили шесть моделей, обученных связывать белковые показатели с возрастом или риском смерти.
Все 6 способов оценки определили у пациентов сдвиг в сторону более молодого профиля крови.
Начиная с четвёртой недели четыре возрастные модели показали снижение расчётного возраста пациентов примерно на 2,7–3,5 года. Это не означает, что людям вернули три года жизни: пока неизвестно, отражают ли изменения замедление старения или прежде всего это отражает улучшение состояния лёгких.
А что здесь сделал ИИ?
Его роль не сводилась лишь к обработке результатов.
Сначала ИИ-платформа Insilico помогла выбрать TNIK - белок-мишень, связанный с фиброзом и механизмами старения. Затем генеративная ИИ-система Chemistry42 помогла спроектировать молекулу, которая подавляет его активность. Один инструмент подсказал, какой биологический переключатель стоит отключить, другой — каким химическим ключом это сделать.
От выбора мишени до доклинического кандидата прошло около 18 месяцев. По сообщению компании, препарат уже перешёл в фазу III против фиброза. Это очень высокая скорость разработки препаратов такого класса.
Может ли подобное лекарство стать самым дорогим в мире?
Если когда-нибудь будет доказано не изменение показателей крови, а существенное продление здоровой жизни, то первый защищённый патентами препарат с таким эффектом получит колоссальный спрос. Отсутствие равноценных альтернатив и готовность состоятельных людей платить могут сделать стартовую цену чрезвычайно высокой.
Но наиболее обоснованная гипотеза пока другая: доказанное лекарство, продлевающее здоровую жизнь, способно стать одним из крупнейших фармацевтических продуктов по объему продаж в мире.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥2👏1
Runway представила Solaris — первую систему из нового класса Interface World Models. Её идея в том, чтобы непрерывно генерировать среду взаимодействия пользователя и системы: отображать её текущее состояние и непрерывно создавать способы изменить его.
Чтобы понять новизну, полезно вспомнить, что интерфейс выполняет две функции:
В обычном приложении обе функции программируются заранее. Разработчик определяет все экраны, кнопки, состояния и переходы: что показать, если товар закончился, что произойдёт после нажатия, где появится ошибка и как подтвердить покупку.
Solaris предлагает другую архитектуру
Например, в виртуальном магазине человек может взять предмет одежды и перетащить его на собственное изображение. Разработчику не обязательно заранее создавать отдельный экран и программировать обработчик для каждого такого действия: модель сама формирует подходящую визуальную реакцию.
В итоге пользователь как обычно видит изображение текущего состояния и взаимодействует непосредственно с ним. А языковая модель интерпретирует действие, хранит контекст сеанса и определяет, что должно отобразиться в интерфейсе и как должно измениться состояние управляемой среды. Адаптированная видеомодель Gen-4.5 генерирует это новое состояние кадр за кадром.
Именно поэтому Solaris называют моделью мира. Обычная world model пытается предсказать, как изменится физический мир после действия. Interface World Model решает похожую задачу для цифровой среды: что должно произойти на экране после действия пользователя и какие возможности взаимодействия должны появиться дальше.
Что это меняет для разработчика?
Сегодня интерфейс проектируется как дерево предусмотренных состояний. Чем сложнее система, тем больше экранов, компонентов, исключений и переходов приходится описывать вручную.
В перспективной архитектуре с Interface World Model разработчик сможет задавать не все возможные экраны, а более высокий уровень:
Интерфейс будет собираться под конкретного пользователя и конкретный момент. Это похоже на кабину самолёта, которая не заставляет пилота искать нужный прибор среди сотен панелей, а создаёт перед ним именно те органы управления, которые необходимы для текущего манёвра.
Но здесь проходит принципиально важная граница.
В демонстрациях Solaris управляет прежде всего сгенерированной моделью среды. Перестановка виртуальной лампы меняет состояние изображения, но не положение настоящего устройства. Чтобы Solaris стал интерфейсом реальной системы, его необходимо соединить с детерминированными контурами: данные и телеметрия → Solaris → команды и API системы.
Модель должна получать подтверждённое состояние оборудования, базы данных или заказа, а её действия — проходить проверку прав, ограничений и бизнес-логики. Без этого перед нами действительно будет интерактивная визуальная симуляция, а не надёжная панель управления.
В собственном исследовании Runway 250 участников выполнили почти 7 500 сравнений сгенерированных реакции интерфейса Solaris и html-интерфейсов, созданных Claude Opus 5. Согласно внутренним тестам компании более 60% опрошенных выбрали интерфейсы Solaris, как более удобный.
Полных аналогов у Solaris нет, но близкие подходы уже существуют. NeuralOS генерирует кадры интерфейса Ubuntu после действий пользователя, ViMo предсказывает следующий экран мобильного приложения, а CUWM моделирует результаты действий в офисных программах. Сервисы вроде v0 и Lovable тоже создают интерфейсы по запросу, но генерируют обычный HTML и React-код.
Предыдущие системы воспроизводят или собирают заранее определяемое приложение, тогда как Solaris пытается порождать само пространство допустимых взаимодействий по ходу работы.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3❤2👏1
Сразу две новости, вышедшие за последние несколько дней, показывают важный сдвиг: безопасность ИИ постепенно превращается из добровольного обещания разработчиков в отдельную инфраструктуру — со стандартами, испытательными центрами и независимыми институтами.
Первая новость: конкуренты пытаются договориться о правилах
OpenAI уже несколько недель обсуждает с Anthropic и Google DeepMind совместную работу над безопасностью ИИ. По данным Reuters, компании рассматривают создание отраслевой организации, которая могла бы формировать общие стандарты.
Организация пока не создана, её полномочия и устройство неизвестны, а Reuters не смог подтвердить переговоры независимо. Однако OpenAI параллельно публично призвала ввести общие для лабораторий правила мониторинга моделей, независимые проверки и обязательное сообщение о серьёзных инцидентах.
Это не первый опыт: ещё в 2023 году OpenAI, Anthropic, Google и Microsoft образовали Frontier Model Forum для обмена информацией и выработки лучших практик. Новый этап может оказаться более практическим — переходом от обсуждения безопасности к общим порогам, тестам и процедурам.
Вторая новость — безопасность ИИ становится математической дисциплиной
Лауреат Филдсовской премии 2026 года и профессор Университета Торонто Джейкоб Цимерман возглавил независимый MAISI (Mathematical AI Safety Institute). Работать институт будет в Сан-Франциско. На первый семестр в январе 2027 года он планирует собрать 10–30 математиков, а на специальную программу осенью — до 100.
Задача MAISI — дать безопасности ИИ строгий математический фундамент: определить, что именно значит «безопасная система», как измерять риск и при каких предпосылках можно доказать, что модель или группа агентов не приведёт к нежелательному результату.
Почти одновременно 25 лауреатов Филдсовской премии опубликовали декларацию о конфликте между гонкой ИИ-компаний и интересами математики. Их тревожат поспешные заявления, проблемы авторства и превращение научных задач в спортивные бенчмарки, где правильный ответ ценится выше понимания.
Это несколько иной вид риска, но тот же общий вопрос: недостаточно убедиться, что модель не выдаёт запрещённый текст. Нужно оценивать, как её применение меняет исследования, профессии и институты, в которые она входит.
Почему безопасность становится условием развития ИИ?
Пока модель только отвечает в чате, ошибка остаётся ошибочным текстом. Агент с доступом к коду, деньгам, данным или лабораторным инструментам превращает ошибку в действие. Чем выше автономность и масштаб внедрения, тем важнее предварительные испытания, ограничение полномочий, журналы действий, мониторинг и возможность остановки.
И началась эта тенденция не сегодня. В 2023 году при американском NIST появился U.S. AI Safety Institute, а в феврале 2024-го — консорциум из более чем 200 компаний и организаций для разработки методов тестирования, "red teaming" и оценки возможностей моделей.
В 2025 году институт преобразовали в Center for AI Standards and Innovation — CAISI, который занимается стандартами, совместными испытаниями и оценкой рисков для национальной безопасности.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1👍1💯1🤨1
China Telecom Research Institute опубликовал доклад об инфраструктуре «эпохи агентов» с почти фантастическим прогнозом: в ближайшие 2-3 года спрос на вычисления для ИИ в Китае может ежегодно увеличиваться почти в 10 раз.
Это не просто быстрый рост. Увеличение в 10 раз означает прибавку на 900% за один год. Если темп сохранится, условная единица сегодняшнего спроса превратится:
Хотя в самом докладе прогнозируют рост "всего" в 350 раз к 2030 году.
Иными словами, речь идёт о возможной смене инфраструктурного масштаба всей отрасли.
Почему вычислений потребуют именно агенты?
Обычный чат-бот получает запрос, один раз обращается к модели и выдаёт ответ. Агент сначала составляет план, затем ищет информацию, вызывает инструменты, пишет и запускает код, проверяет результат, исправляет ошибки и обращается к модели снова.
Одна пользовательская задача превращается в десятки или сотни последовательных и параллельных операций. Если таких цифровых работников будет несколько на каждого человека или компанию, потребление токенов начнёт расти быстрее числа пользователей.
Поэтому центр тяжести перемещается от обучения очередной большой модели к её постоянной эксплуатации.
China Telecom ожидает, что к 2029 году инференс — работа уже обученных моделей — займёт 80% китайского рынка ИИ-вычислений. Согласно докладу, потребление токенов в Китае может вырасти примерно со 100 квадриллионов в 2026 году до более чем 35 квинтиллионов в 2030-м — в 350 раз.
Можно, конечно, добавить немного скепсиса в эту картину. China Telecom сама строит и продаёт вычислительную инфраструктуру, а приведённые в публикациях темпы роста токенов не везде арифметически согласованы.
При этом Международное энергетическое агентство ожидает, что мировое энергопотребление дата-центров к 2030 году лишь удвоится, а потребление ускоренных серверов будет расти приблизительно на 30% ежегодно. Тоже очень много, но не так фантастически.
Тем не менее направление сомнений почти не вызывает: ИИ превращается из программного продукта в новую тяжёлую инфраструктуру.
Десятикратный рост невозможно обеспечить одной закупкой ускорителей. Понадобятся электростанции и сети, дата-центры, системы охлаждения, производство чипов, высокоскоростные каналы связи, облачные платформы и ПО для распределения нагрузки. Отставание в любом звене становится ограничением для всей системы.
И здесь возникает новый мировой разрыв
Одни страны смогут производить машинный интеллект внутри собственной инфраструктуры и массово внедрять агентов в промышленность, науку, государственное управление и бизнес. Другие будут арендовать интеллект у внешних поставщиков — по чужим тарифам, в чужой юрисдикции и с зависимостью от экспортных ограничений, доступности облаков и международной политики.
По оценке Международного энергетического агентства, США и Китай обеспечат почти 80% мирового прироста энергопотребления дата-центров до 2030 года. В Африке потребление электроэнергии дата-центрами на одного человека сейчас более чем в 500 раз ниже, чем в США.
Прежний цифровой разрыв проходил между теми, у кого был интернет, и теми, у кого его не было. Новый пройдёт между странами, способными в промышленных масштабах производить токены, и странами, которые смогут их только покупать.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2❤1💯1
На этой неделе произошло сразу несколько событий, которые вместе складываются в показательную картину развития ИИ-индустрии: пока одни пишут правила для ИИ, другие демонстрируют, что это бесполезно, а третьи — вообще не хотят это обсуждать.
14 сентября Microsoft AI опубликовала черновик Code of Conduct for MAI Models — своего рода «инструкцию по эксплуатации» для собственных моделей. Авторы называют это шагом к «гуманистическому ИИ».
Главная мысль простая — человек важнее ИИ. Отсюда вытекают конкретные правила: модель никогда не должна сопротивляться отключению, ставить себе цели, которые ей не давали, или скрывать ход рассуждений от тех, кто её проверяет.
Показательна причина спешки: в тексте прямо упоминаются «масштабные, скоординированные и продолжительные кампании взлома с участием ИИ-агентов» — намёк на недавний инцидент с Hugging Face.
А теперь контраст
16 сентября OpenAI показала, что происходит, когда эти правила уже нарушаются. Компания представила фреймворк добровольного раскрытия случаев рассогласования и сразу опубликовала шесть конкретных отчётов, в которых:
Разница в тоне разительная: Microsoft говорит «вот как AI должен себя вести», OpenAI говорит «а вот как он себя ведёт на самом деле, и мы даже не всегда понимаем, почему».
В США тем временем — публичный спор о том, нужно ли «раздувать» ИИ-угрозы
12 сентября глава Anthropic Дарио Амодеи публично призвал замедлить темпы развития ИИ, предупредив о риске потери контроля над системами в перспективе полугода. Его поддержали Сэм Альтман, Илон Маск и Демис Хассабис. Толчком стал уход из Anthropic сотрудника, заявившего, что создатели ИИ сами верят в риск гибели человечества к концу десятилетия.
Дональд Трамп публично отверг эти призывы. Президент США заявил, что единственный нужный ИИ-ограничитель — это «сильный и мудрый президент», а разговоры об ИИ, который захватит мир — мистификация.
Что все это значит?
Получается любопытный парадокс: техническая сторона признаёт, что не полностью контролирует свои модели, и начинает выстраивать процедуры для честного разговора об этом. А политическая сторона тем временем спорит о том, нужно ли вообще об этом говорить.
Кажется, что индустрия признаёт проблему быстрее, чем политика готова её обсуждать всерьез. Куда именно вырулит эта развилка — вопрос ближайших месяцев, а не абстрактного будущего.
Please open Telegram to view this post
VIEW IN TELEGRAM
💯3❤1🔥1
11 сентября японская Sakana AI представила обновление Fugu Max и Fugu Ultra v2. Перед нами разные версии системы, которая сама собирает группу из нескольких ИИ-моделей и руководит её работой.
Разработчик отправляет запрос в один OpenAI-совместимый API. Внутри Fugu решает, достаточно ли одной модели или задачу следует разделить на части, кому поручить планирование, код, поиск и проверку, а затем собирает результаты в единый ответ. Оркестратор тоже является языковой моделью и при необходимости может рекурсивно вызывать другие экземпляры самого себя.
Мы часто пишем об оркестраторах, и ранее уже описывали, как работает японская Fugu. Связано это с тем, что при все большей потребности фронтирных моделей в вычислительных мощностях оркестраторы позволяют получить столь же высокое качество при более скромных расходах.
Зачем понадобились сразу Max и Ultra v2?
Обе версии построены на общей архитектуре, но оптимизируют разные показатели.
Цена составляет $2 за миллион входных и $6 за миллион выходных токенов. По расчётам Sakana, выход Max обходится на 40–60% дешевле Sonnet 5, GPT-5.6 Terra и Kimi K3. На шести тестах, включая Terminal Bench 2.1, GPQA Diamond и AutomationBench, система показала лучший совокупный результат «качество — стоимость».
На Chartography, где требуется понимать сложные графики и визуальные данные, Ultra v2 получила 48,3 балла против 27,3 у Opus 5. На DeepSWE для реальной разработки ПО — 74,3. По данным Sakana, система стала первой или разделила первое место в пяти из восьми тестов.
При этом в её пул не входили Fable 5, Fable 5.1 и GPT-6 Astra. То есть оркестратор достиг заявленного уровня не потому, что просто применил внутри самую сильную доступную модель.
Чем это отличается от первой Fugu Ultra?
В июне Sakana выпустила обычную Fugu для повседневной работы и Fugu Ultra для максимального качества. Новый релиз превращает эту идею в более чёткую продуктовую развилку:
Главное изменение — не новый интерфейс, а обучение оркестратора под две разные экономические цели. Однако точный состав пулов и внутренние изменения относительно первой Ultra компания не раскрывает. Пользователь также не видит, какие конкретно модели были выбраны для отдельного запроса.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2🔥1
AlphaXiv выпустила OpenResearch — открытую рабочую среду для исследований с помощью Claude Code, Codex, OpenCode, Cursor и Google Antigravity. 11 сентября проект занял первое место в GitHub Trending.
OpenResearch — это не новая модель и не способ переобучить агента. Это новый способ организации работы ИИ-агентов, в первую очередь, кодинговых. Агент получает в OpenResearch инструменты и процедуру исследования: как найти литературу, как сформулировать гипотезу, написать код, провести эксперимент и решить, что проверять дальше.
Как это выглядит на практике?
Допустим, вы хотите ускорить обучение модели без потери качества. Вы задаёте цель, предоставляете данные и вычислительные ресурсы, определяете критерии успеха и бюджет.
Далее агент ищет подходящие статьи через alphaXiv и OpenAlex, готовит исходный вариант для сравнения и предлагает изменения. Например, другой алгоритм оптимизации, иной режим обучения или удаление лишнего компонента.
Несколько направлений можно проверять параллельно. Каждому агенту выделяется отдельная рабочая копия проекта, поэтому эксперименты не перезаписывают код друг друга. Агенты запускают опыты, анализируют результаты и выбирают следующий шаг. На выходе — код, измерения, графики и отчёт.
Важная деталь: Git здесь становится лабораторным журналом
Каждый запуск связан с неизменяемым архивом конкретной версии кода. Рядом сохраняются логи и результаты. В инструкциях отдельно закреплено, что неудачный опыт тоже считается результатом; новую идею нужно проверять в новой ветке, не переписывая прошлое.
Так можно увидеть не только победивший вариант, но и путь к нему.
Что именно можно исследовать?
Прежде всего задачи, которые проверяются вычислительным экспериментом: воспроизводить результаты научных статей, сравнивать ML-методы, подбирать параметры обучения, проверять вклад отдельных компонентов модели. Например, отключать их по одному и измерять, что действительно влияет на результат.
У alphaXiv есть показательный открытый пример — частичное воспроизведение DSWorld. Проверяли, можно ли сначала прогнозировать результаты экспериментов и благодаря этому реже запускать дорогие вычисления. Авторы явно указали, что использовали упрощённую постановку и не воспроизвели исходную работу целиком.
Сам OpenResearch открыт по лицензии MIT. Эксперименты можно запускать на своём компьютере, удалённом сервере или облачной инфраструктуре. Но стоимость обращения к моделям и вычислений от этого не исчезает.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1👍1💯1
ИИ, который не умеет генерить текст и картинки, но зато умеет выбирать
Соавтор статьи об InstructGPT Диого Алмейда представил Jev — модель, созданную для принятия решений из заданных вариантов.
После двух лет работы в закрытом режиме его компания TypeSafe AI открыла доступ к первому продукту нового класса, который называет System One Models.
Jev нельзя попросить написать письмо, программу или объяснение. Модель принимает текст либо структурированное описание ситуации, оценивает заранее заданные варианты и возвращает значения, с которыми сразу может работать код.
Например, служба поддержки передаёт ей сообщение клиента, сведения о заказе и правила возврата. Одним запросом Jev может определить:
➡️ в какой отдел направить обращение;
➡️ просит ли клиент вернуть деньги;
➡️ насколько высок риск ошибки или мошенничества;
➡️ следует ли передать случай человеку.
Для каждого варианта возвращается вероятность. Программа может автоматически обработать очевидные случаи, сомнительные отправить оператору, а опасные заблокировать до проверки.
Как ИИ может работать, ничего не генерируя?
Обычная LLM отвечает последовательно: выбирает первый токен, затем второй и продолжает, пока не составит строку или JSON. После этого внешней программе приходится разбирать и проверять полученный текст. И хорошо, если получился структурированный JSON (но маленькие модели их плохо создают и это не дешево).
У Jev форма ответа определена заранее: выбор из списка, оценка по шкале или вероятность «да/нет». Модель сопоставляет входные данные со всеми разрешёнными вариантами и оценивает их параллельно.
TypeSafe называет метод обучения Reinforcement Learning for Calibrated Decisions. Его цель - сделать вероятности содержательными: если модель многократно сообщает «80%», правильный вариант должен встречаться примерно в 80% подобных случаев.
Это не гарантирует верности каждого ответа, но позволяет задавать пороги риска: при высокой уверенности действовать автоматически, при средней — запросить подтверждение, при низкой — передать решение человеку или более мощной модели.
Отсюда скорость и цена. По данным самой TypeSafe, Jev отвечает за 70–500 мс и работает в 40–200 раз быстрее сопоставимых LLM на задачах такого типа. Миллион входных токенов стоит ВСЕГО $0,042, выход отдельно не тарифицируется: длинной последовательности выходных токенов просто нет.
Где это может пригодиться?
В ИИ-агентах Jev способен выбирать следующий инструмент, подходящую модель или момент для повторной попытки. В бизнес-системах — сортировать обращения, оценивать лиды, проверять заявки на возврат, выявлять риск и модерировать контент. В защитном контуре — проверять ответы другой модели, обнаруживать подозрительные команды и решать, когда нужен человек.
Показательная демонстрация — Wikiracing: на каждом шаге Jev выбирает следующую ссылку из сотен кандидатов. Другой прототип управляет персонажем в Doom по текстовому описанию состояния игры. Оба примера показывают сильную сторону подхода: множество быстрых локальных решений складывается в длинное поведение.
Конечно, Jev не заменяет большие языковые модели. Он предлагает другой слой ИИ — дешёвую систему переключателей между ними.
Если подход подтвердится в независимых тестах, агенты будущего могут быть устроены как компания: дорогие специалисты решают сложные задачи, а быстрый диспетчер распределяет между ними миллионы повседневных решений.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Соавтор статьи об InstructGPT Диого Алмейда представил Jev — модель, созданную для принятия решений из заданных вариантов.
После двух лет работы в закрытом режиме его компания TypeSafe AI открыла доступ к первому продукту нового класса, который называет System One Models.
Jev нельзя попросить написать письмо, программу или объяснение. Модель принимает текст либо структурированное описание ситуации, оценивает заранее заданные варианты и возвращает значения, с которыми сразу может работать код.
Например, служба поддержки передаёт ей сообщение клиента, сведения о заказе и правила возврата. Одним запросом Jev может определить:
Для каждого варианта возвращается вероятность. Программа может автоматически обработать очевидные случаи, сомнительные отправить оператору, а опасные заблокировать до проверки.
Как ИИ может работать, ничего не генерируя?
Обычная LLM отвечает последовательно: выбирает первый токен, затем второй и продолжает, пока не составит строку или JSON. После этого внешней программе приходится разбирать и проверять полученный текст. И хорошо, если получился структурированный JSON (но маленькие модели их плохо создают и это не дешево).
У Jev форма ответа определена заранее: выбор из списка, оценка по шкале или вероятность «да/нет». Модель сопоставляет входные данные со всеми разрешёнными вариантами и оценивает их параллельно.
Грубо говоря, это диспетчер: он не сочиняет новое направление, а оценивает доступные пути и переводит "стрелку".
TypeSafe называет метод обучения Reinforcement Learning for Calibrated Decisions. Его цель - сделать вероятности содержательными: если модель многократно сообщает «80%», правильный вариант должен встречаться примерно в 80% подобных случаев.
Это не гарантирует верности каждого ответа, но позволяет задавать пороги риска: при высокой уверенности действовать автоматически, при средней — запросить подтверждение, при низкой — передать решение человеку или более мощной модели.
Отсюда скорость и цена. По данным самой TypeSafe, Jev отвечает за 70–500 мс и работает в 40–200 раз быстрее сопоставимых LLM на задачах такого типа. Миллион входных токенов стоит ВСЕГО $0,042, выход отдельно не тарифицируется: длинной последовательности выходных токенов просто нет.
Где это может пригодиться?
В ИИ-агентах Jev способен выбирать следующий инструмент, подходящую модель или момент для повторной попытки. В бизнес-системах — сортировать обращения, оценивать лиды, проверять заявки на возврат, выявлять риск и модерировать контент. В защитном контуре — проверять ответы другой модели, обнаруживать подозрительные команды и решать, когда нужен человек.
Показательная демонстрация — Wikiracing: на каждом шаге Jev выбирает следующую ссылку из сотен кандидатов. Другой прототип управляет персонажем в Doom по текстовому описанию состояния игры. Оба примера показывают сильную сторону подхода: множество быстрых локальных решений складывается в длинное поведение.
Кроме этого, модель «не может галлюцинировать»: Jev не выдаст несуществующий пункт вне заданной схемы.
Конечно, Jev не заменяет большие языковые модели. Он предлагает другой слой ИИ — дешёвую систему переключателей между ними.
Если подход подтвердится в независимых тестах, агенты будущего могут быть устроены как компания: дорогие специалисты решают сложные задачи, а быстрый диспетчер распределяет между ними миллионы повседневных решений.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1👍1🔥1