Сразу две новости, вышедшие за последние несколько дней, показывают важный сдвиг: безопасность ИИ постепенно превращается из добровольного обещания разработчиков в отдельную инфраструктуру — со стандартами, испытательными центрами и независимыми институтами.
Первая новость: конкуренты пытаются договориться о правилах
OpenAI уже несколько недель обсуждает с Anthropic и Google DeepMind совместную работу над безопасностью ИИ. По данным Reuters, компании рассматривают создание отраслевой организации, которая могла бы формировать общие стандарты.
Организация пока не создана, её полномочия и устройство неизвестны, а Reuters не смог подтвердить переговоры независимо. Однако OpenAI параллельно публично призвала ввести общие для лабораторий правила мониторинга моделей, независимые проверки и обязательное сообщение о серьёзных инцидентах.
Это не первый опыт: ещё в 2023 году OpenAI, Anthropic, Google и Microsoft образовали Frontier Model Forum для обмена информацией и выработки лучших практик. Новый этап может оказаться более практическим — переходом от обсуждения безопасности к общим порогам, тестам и процедурам.
Вторая новость — безопасность ИИ становится математической дисциплиной
Лауреат Филдсовской премии 2026 года и профессор Университета Торонто Джейкоб Цимерман возглавил независимый MAISI (Mathematical AI Safety Institute). Работать институт будет в Сан-Франциско. На первый семестр в январе 2027 года он планирует собрать 10–30 математиков, а на специальную программу осенью — до 100.
Задача MAISI — дать безопасности ИИ строгий математический фундамент: определить, что именно значит «безопасная система», как измерять риск и при каких предпосылках можно доказать, что модель или группа агентов не приведёт к нежелательному результату.
Почти одновременно 25 лауреатов Филдсовской премии опубликовали декларацию о конфликте между гонкой ИИ-компаний и интересами математики. Их тревожат поспешные заявления, проблемы авторства и превращение научных задач в спортивные бенчмарки, где правильный ответ ценится выше понимания.
Это несколько иной вид риска, но тот же общий вопрос: недостаточно убедиться, что модель не выдаёт запрещённый текст. Нужно оценивать, как её применение меняет исследования, профессии и институты, в которые она входит.
Почему безопасность становится условием развития ИИ?
Пока модель только отвечает в чате, ошибка остаётся ошибочным текстом. Агент с доступом к коду, деньгам, данным или лабораторным инструментам превращает ошибку в действие. Чем выше автономность и масштаб внедрения, тем важнее предварительные испытания, ограничение полномочий, журналы действий, мониторинг и возможность остановки.
И началась эта тенденция не сегодня. В 2023 году при американском NIST появился U.S. AI Safety Institute, а в феврале 2024-го — консорциум из более чем 200 компаний и организаций для разработки методов тестирования, "red teaming" и оценки возможностей моделей.
В 2025 году институт преобразовали в Center for AI Standards and Innovation — CAISI, который занимается стандартами, совместными испытаниями и оценкой рисков для национальной безопасности.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1👍1💯1🤨1
China Telecom Research Institute опубликовал доклад об инфраструктуре «эпохи агентов» с почти фантастическим прогнозом: в ближайшие 2-3 года спрос на вычисления для ИИ в Китае может ежегодно увеличиваться почти в 10 раз.
Это не просто быстрый рост. Увеличение в 10 раз означает прибавку на 900% за один год. Если темп сохранится, условная единица сегодняшнего спроса превратится:
Хотя в самом докладе прогнозируют рост "всего" в 350 раз к 2030 году.
Иными словами, речь идёт о возможной смене инфраструктурного масштаба всей отрасли.
Почему вычислений потребуют именно агенты?
Обычный чат-бот получает запрос, один раз обращается к модели и выдаёт ответ. Агент сначала составляет план, затем ищет информацию, вызывает инструменты, пишет и запускает код, проверяет результат, исправляет ошибки и обращается к модели снова.
Одна пользовательская задача превращается в десятки или сотни последовательных и параллельных операций. Если таких цифровых работников будет несколько на каждого человека или компанию, потребление токенов начнёт расти быстрее числа пользователей.
Поэтому центр тяжести перемещается от обучения очередной большой модели к её постоянной эксплуатации.
China Telecom ожидает, что к 2029 году инференс — работа уже обученных моделей — займёт 80% китайского рынка ИИ-вычислений. Согласно докладу, потребление токенов в Китае может вырасти примерно со 100 квадриллионов в 2026 году до более чем 35 квинтиллионов в 2030-м — в 350 раз.
Можно, конечно, добавить немного скепсиса в эту картину. China Telecom сама строит и продаёт вычислительную инфраструктуру, а приведённые в публикациях темпы роста токенов не везде арифметически согласованы.
При этом Международное энергетическое агентство ожидает, что мировое энергопотребление дата-центров к 2030 году лишь удвоится, а потребление ускоренных серверов будет расти приблизительно на 30% ежегодно. Тоже очень много, но не так фантастически.
Тем не менее направление сомнений почти не вызывает: ИИ превращается из программного продукта в новую тяжёлую инфраструктуру.
Десятикратный рост невозможно обеспечить одной закупкой ускорителей. Понадобятся электростанции и сети, дата-центры, системы охлаждения, производство чипов, высокоскоростные каналы связи, облачные платформы и ПО для распределения нагрузки. Отставание в любом звене становится ограничением для всей системы.
И здесь возникает новый мировой разрыв
Одни страны смогут производить машинный интеллект внутри собственной инфраструктуры и массово внедрять агентов в промышленность, науку, государственное управление и бизнес. Другие будут арендовать интеллект у внешних поставщиков — по чужим тарифам, в чужой юрисдикции и с зависимостью от экспортных ограничений, доступности облаков и международной политики.
По оценке Международного энергетического агентства, США и Китай обеспечат почти 80% мирового прироста энергопотребления дата-центров до 2030 года. В Африке потребление электроэнергии дата-центрами на одного человека сейчас более чем в 500 раз ниже, чем в США.
Прежний цифровой разрыв проходил между теми, у кого был интернет, и теми, у кого его не было. Новый пройдёт между странами, способными в промышленных масштабах производить токены, и странами, которые смогут их только покупать.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2❤1💯1
На этой неделе произошло сразу несколько событий, которые вместе складываются в показательную картину развития ИИ-индустрии: пока одни пишут правила для ИИ, другие демонстрируют, что это бесполезно, а третьи — вообще не хотят это обсуждать.
14 сентября Microsoft AI опубликовала черновик Code of Conduct for MAI Models — своего рода «инструкцию по эксплуатации» для собственных моделей. Авторы называют это шагом к «гуманистическому ИИ».
Главная мысль простая — человек важнее ИИ. Отсюда вытекают конкретные правила: модель никогда не должна сопротивляться отключению, ставить себе цели, которые ей не давали, или скрывать ход рассуждений от тех, кто её проверяет.
Показательна причина спешки: в тексте прямо упоминаются «масштабные, скоординированные и продолжительные кампании взлома с участием ИИ-агентов» — намёк на недавний инцидент с Hugging Face.
А теперь контраст
16 сентября OpenAI показала, что происходит, когда эти правила уже нарушаются. Компания представила фреймворк добровольного раскрытия случаев рассогласования и сразу опубликовала шесть конкретных отчётов, в которых:
Разница в тоне разительная: Microsoft говорит «вот как AI должен себя вести», OpenAI говорит «а вот как он себя ведёт на самом деле, и мы даже не всегда понимаем, почему».
В США тем временем — публичный спор о том, нужно ли «раздувать» ИИ-угрозы
12 сентября глава Anthropic Дарио Амодеи публично призвал замедлить темпы развития ИИ, предупредив о риске потери контроля над системами в перспективе полугода. Его поддержали Сэм Альтман, Илон Маск и Демис Хассабис. Толчком стал уход из Anthropic сотрудника, заявившего, что создатели ИИ сами верят в риск гибели человечества к концу десятилетия.
Дональд Трамп публично отверг эти призывы. Президент США заявил, что единственный нужный ИИ-ограничитель — это «сильный и мудрый президент», а разговоры об ИИ, который захватит мир — мистификация.
Что все это значит?
Получается любопытный парадокс: техническая сторона признаёт, что не полностью контролирует свои модели, и начинает выстраивать процедуры для честного разговора об этом. А политическая сторона тем временем спорит о том, нужно ли вообще об этом говорить.
Кажется, что индустрия признаёт проблему быстрее, чем политика готова её обсуждать всерьез. Куда именно вырулит эта развилка — вопрос ближайших месяцев, а не абстрактного будущего.
Please open Telegram to view this post
VIEW IN TELEGRAM
💯3❤1🔥1
11 сентября японская Sakana AI представила обновление Fugu Max и Fugu Ultra v2. Перед нами разные версии системы, которая сама собирает группу из нескольких ИИ-моделей и руководит её работой.
Разработчик отправляет запрос в один OpenAI-совместимый API. Внутри Fugu решает, достаточно ли одной модели или задачу следует разделить на части, кому поручить планирование, код, поиск и проверку, а затем собирает результаты в единый ответ. Оркестратор тоже является языковой моделью и при необходимости может рекурсивно вызывать другие экземпляры самого себя.
Мы часто пишем об оркестраторах, и ранее уже описывали, как работает японская Fugu. Связано это с тем, что при все большей потребности фронтирных моделей в вычислительных мощностях оркестраторы позволяют получить столь же высокое качество при более скромных расходах.
Зачем понадобились сразу Max и Ultra v2?
Обе версии построены на общей архитектуре, но оптимизируют разные показатели.
Цена составляет $2 за миллион входных и $6 за миллион выходных токенов. По расчётам Sakana, выход Max обходится на 40–60% дешевле Sonnet 5, GPT-5.6 Terra и Kimi K3. На шести тестах, включая Terminal Bench 2.1, GPQA Diamond и AutomationBench, система показала лучший совокупный результат «качество — стоимость».
На Chartography, где требуется понимать сложные графики и визуальные данные, Ultra v2 получила 48,3 балла против 27,3 у Opus 5. На DeepSWE для реальной разработки ПО — 74,3. По данным Sakana, система стала первой или разделила первое место в пяти из восьми тестов.
При этом в её пул не входили Fable 5, Fable 5.1 и GPT-6 Astra. То есть оркестратор достиг заявленного уровня не потому, что просто применил внутри самую сильную доступную модель.
Чем это отличается от первой Fugu Ultra?
В июне Sakana выпустила обычную Fugu для повседневной работы и Fugu Ultra для максимального качества. Новый релиз превращает эту идею в более чёткую продуктовую развилку:
Главное изменение — не новый интерфейс, а обучение оркестратора под две разные экономические цели. Однако точный состав пулов и внутренние изменения относительно первой Ultra компания не раскрывает. Пользователь также не видит, какие конкретно модели были выбраны для отдельного запроса.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2🔥1
AlphaXiv выпустила OpenResearch — открытую рабочую среду для исследований с помощью Claude Code, Codex, OpenCode, Cursor и Google Antigravity. 11 сентября проект занял первое место в GitHub Trending.
OpenResearch — это не новая модель и не способ переобучить агента. Это новый способ организации работы ИИ-агентов, в первую очередь, кодинговых. Агент получает в OpenResearch инструменты и процедуру исследования: как найти литературу, как сформулировать гипотезу, написать код, провести эксперимент и решить, что проверять дальше.
Как это выглядит на практике?
Допустим, вы хотите ускорить обучение модели без потери качества. Вы задаёте цель, предоставляете данные и вычислительные ресурсы, определяете критерии успеха и бюджет.
Далее агент ищет подходящие статьи через alphaXiv и OpenAlex, готовит исходный вариант для сравнения и предлагает изменения. Например, другой алгоритм оптимизации, иной режим обучения или удаление лишнего компонента.
Несколько направлений можно проверять параллельно. Каждому агенту выделяется отдельная рабочая копия проекта, поэтому эксперименты не перезаписывают код друг друга. Агенты запускают опыты, анализируют результаты и выбирают следующий шаг. На выходе — код, измерения, графики и отчёт.
Важная деталь: Git здесь становится лабораторным журналом
Каждый запуск связан с неизменяемым архивом конкретной версии кода. Рядом сохраняются логи и результаты. В инструкциях отдельно закреплено, что неудачный опыт тоже считается результатом; новую идею нужно проверять в новой ветке, не переписывая прошлое.
Так можно увидеть не только победивший вариант, но и путь к нему.
Что именно можно исследовать?
Прежде всего задачи, которые проверяются вычислительным экспериментом: воспроизводить результаты научных статей, сравнивать ML-методы, подбирать параметры обучения, проверять вклад отдельных компонентов модели. Например, отключать их по одному и измерять, что действительно влияет на результат.
У alphaXiv есть показательный открытый пример — частичное воспроизведение DSWorld. Проверяли, можно ли сначала прогнозировать результаты экспериментов и благодаря этому реже запускать дорогие вычисления. Авторы явно указали, что использовали упрощённую постановку и не воспроизвели исходную работу целиком.
Сам OpenResearch открыт по лицензии MIT. Эксперименты можно запускать на своём компьютере, удалённом сервере или облачной инфраструктуре. Но стоимость обращения к моделям и вычислений от этого не исчезает.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1👍1💯1
ИИ, который не умеет генерить текст и картинки, но зато умеет выбирать
Соавтор статьи об InstructGPT Диого Алмейда представил Jev — модель, созданную для принятия решений из заданных вариантов.
После двух лет работы в закрытом режиме его компания TypeSafe AI открыла доступ к первому продукту нового класса, который называет System One Models.
Jev нельзя попросить написать письмо, программу или объяснение. Модель принимает текст либо структурированное описание ситуации, оценивает заранее заданные варианты и возвращает значения, с которыми сразу может работать код.
Например, служба поддержки передаёт ей сообщение клиента, сведения о заказе и правила возврата. Одним запросом Jev может определить:
➡️ в какой отдел направить обращение;
➡️ просит ли клиент вернуть деньги;
➡️ насколько высок риск ошибки или мошенничества;
➡️ следует ли передать случай человеку.
Для каждого варианта возвращается вероятность. Программа может автоматически обработать очевидные случаи, сомнительные отправить оператору, а опасные заблокировать до проверки.
Как ИИ может работать, ничего не генерируя?
Обычная LLM отвечает последовательно: выбирает первый токен, затем второй и продолжает, пока не составит строку или JSON. После этого внешней программе приходится разбирать и проверять полученный текст. И хорошо, если получился структурированный JSON (но маленькие модели их плохо создают и это не дешево).
У Jev форма ответа определена заранее: выбор из списка, оценка по шкале или вероятность «да/нет». Модель сопоставляет входные данные со всеми разрешёнными вариантами и оценивает их параллельно.
TypeSafe называет метод обучения Reinforcement Learning for Calibrated Decisions. Его цель - сделать вероятности содержательными: если модель многократно сообщает «80%», правильный вариант должен встречаться примерно в 80% подобных случаев.
Это не гарантирует верности каждого ответа, но позволяет задавать пороги риска: при высокой уверенности действовать автоматически, при средней — запросить подтверждение, при низкой — передать решение человеку или более мощной модели.
Отсюда скорость и цена. По данным самой TypeSafe, Jev отвечает за 70–500 мс и работает в 40–200 раз быстрее сопоставимых LLM на задачах такого типа. Миллион входных токенов стоит ВСЕГО $0,042, выход отдельно не тарифицируется: длинной последовательности выходных токенов просто нет.
Где это может пригодиться?
В ИИ-агентах Jev способен выбирать следующий инструмент, подходящую модель или момент для повторной попытки. В бизнес-системах — сортировать обращения, оценивать лиды, проверять заявки на возврат, выявлять риск и модерировать контент. В защитном контуре — проверять ответы другой модели, обнаруживать подозрительные команды и решать, когда нужен человек.
Показательная демонстрация — Wikiracing: на каждом шаге Jev выбирает следующую ссылку из сотен кандидатов. Другой прототип управляет персонажем в Doom по текстовому описанию состояния игры. Оба примера показывают сильную сторону подхода: множество быстрых локальных решений складывается в длинное поведение.
Конечно, Jev не заменяет большие языковые модели. Он предлагает другой слой ИИ — дешёвую систему переключателей между ними.
Если подход подтвердится в независимых тестах, агенты будущего могут быть устроены как компания: дорогие специалисты решают сложные задачи, а быстрый диспетчер распределяет между ними миллионы повседневных решений.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Соавтор статьи об InstructGPT Диого Алмейда представил Jev — модель, созданную для принятия решений из заданных вариантов.
После двух лет работы в закрытом режиме его компания TypeSafe AI открыла доступ к первому продукту нового класса, который называет System One Models.
Jev нельзя попросить написать письмо, программу или объяснение. Модель принимает текст либо структурированное описание ситуации, оценивает заранее заданные варианты и возвращает значения, с которыми сразу может работать код.
Например, служба поддержки передаёт ей сообщение клиента, сведения о заказе и правила возврата. Одним запросом Jev может определить:
Для каждого варианта возвращается вероятность. Программа может автоматически обработать очевидные случаи, сомнительные отправить оператору, а опасные заблокировать до проверки.
Как ИИ может работать, ничего не генерируя?
Обычная LLM отвечает последовательно: выбирает первый токен, затем второй и продолжает, пока не составит строку или JSON. После этого внешней программе приходится разбирать и проверять полученный текст. И хорошо, если получился структурированный JSON (но маленькие модели их плохо создают и это не дешево).
У Jev форма ответа определена заранее: выбор из списка, оценка по шкале или вероятность «да/нет». Модель сопоставляет входные данные со всеми разрешёнными вариантами и оценивает их параллельно.
Грубо говоря, это диспетчер: он не сочиняет новое направление, а оценивает доступные пути и переводит "стрелку".
TypeSafe называет метод обучения Reinforcement Learning for Calibrated Decisions. Его цель - сделать вероятности содержательными: если модель многократно сообщает «80%», правильный вариант должен встречаться примерно в 80% подобных случаев.
Это не гарантирует верности каждого ответа, но позволяет задавать пороги риска: при высокой уверенности действовать автоматически, при средней — запросить подтверждение, при низкой — передать решение человеку или более мощной модели.
Отсюда скорость и цена. По данным самой TypeSafe, Jev отвечает за 70–500 мс и работает в 40–200 раз быстрее сопоставимых LLM на задачах такого типа. Миллион входных токенов стоит ВСЕГО $0,042, выход отдельно не тарифицируется: длинной последовательности выходных токенов просто нет.
Где это может пригодиться?
В ИИ-агентах Jev способен выбирать следующий инструмент, подходящую модель или момент для повторной попытки. В бизнес-системах — сортировать обращения, оценивать лиды, проверять заявки на возврат, выявлять риск и модерировать контент. В защитном контуре — проверять ответы другой модели, обнаруживать подозрительные команды и решать, когда нужен человек.
Показательная демонстрация — Wikiracing: на каждом шаге Jev выбирает следующую ссылку из сотен кандидатов. Другой прототип управляет персонажем в Doom по текстовому описанию состояния игры. Оба примера показывают сильную сторону подхода: множество быстрых локальных решений складывается в длинное поведение.
Кроме этого, модель «не может галлюцинировать»: Jev не выдаст несуществующий пункт вне заданной схемы.
Конечно, Jev не заменяет большие языковые модели. Он предлагает другой слой ИИ — дешёвую систему переключателей между ними.
Если подход подтвердится в независимых тестах, агенты будущего могут быть устроены как компания: дорогие специалисты решают сложные задачи, а быстрый диспетчер распределяет между ними миллионы повседневных решений.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2🔥2
Novo Nordisk и Anthropic заключили соглашение об использовании Claude для разработки лекарств. Датская компания будет тестировать модели Anthropic и среду Claude Science в своих R&D-процессах, а также применять Claude для создания внутреннего ПО.
Зачем Anthropic доступ в мокрую лабораторию?
В биологии последнее слово остаётся за физическим экспериментом. Модель может предсказать, что молекула свяжется с белком, но это необходимо проверить на настоящих образцах. Поэтому Anthropic открыла лабораторию в районе Сан-Франциско и одновременно работает с внешними партнёрами.
Её место в стратегии — замкнуть контур: данные → гипотеза → эксперимент → измерения → новая гипотеза.
Для связи Claude с оборудованием компания уже разработала Model Hardware Standard. Он позволяет агентам получать данные от микроскопов и ридеров, управлять дозаторами и роботизированными руками, менять параметры и повторять опыты. Собственная лаборатория становится испытательным полигоном и источником обратной связи: здесь можно проверять, превращаются ли убедительные рассуждения модели в работающие биологические протоколы.
На первом этапе команды выберут научные задачи, в которых знания исследователей Novo можно соединить со способностью Claude анализировать литературу, биологические данные и код. Финансовые условия, конкретные заболевания, молекулы и сроки не раскрыты.
Раньше Novo использовала Claude преимущественно после экспериментов: система NovoScribe сократила подготовку клинических отчётов с десяти с лишним недель до десяти минут, а количество циклов проверки — вдвое. Теперь Claude перемещается ближе к началу фармацевтического конвейера — туда, где выбирают гипотезы и кандидатов.
Как это должно работать?
Claude Science объединяет научные статьи, базы белков и молекул, код, вычислительные кластеры и специализированные инструменты. Агент может изучить литературу, предложить гипотезу, написать программу анализа, обработать геномные или химические данные, показать структуру белка и подготовить протокол эксперимента. Отдельный агент проверяет ссылки, расчёты и соответствие графиков исходному коду. Claude здесь выступает координатором длинной цепочки научных операций.
Какие задачи планируется решать?
Ближайший слой — обзоры литературы, поиск гипотез, разработка протоколов, анализ геномики, single-cell, протеомики, химических и структурных данных. Следующий — проектирование белков и антител, выбор перспективных мишеней и управление автоматизированными экспериментами. Anthropic также говорит о редких и пока считающихся «неподдающимися лечению» заболеваниях, которыми индустрия занимается недостаточно.
Anthropic строит полный научный цикл: Claude читает и рассуждает, программная среда организует исследование, роботы проводят опыт, а лаборатория возвращает модели реальность.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2🔥2👏1💯1
🧬 Claude открыл неизвестную генетическую систему
Anthropic запустила собственную группу по биологии и лабораторию. Идея в следующем: дать ИИ-агентам возможность самостоятельно прочёсывать огромные массивы генетических данных, находить странности, формулировать гипотезы и отдавать наиболее интересные находки людям для проверки.
Что сделали?
В первом таком эксперименте Claude искал необычные reverse transcriptases (RT) — обратные транскриптазы. Это ферменты, которые умеют делать копию ДНК на основе РНК.
Claude просмотрел более 200 тыс. известных RT и сузил их до 20 кандидатов для детального анализа. Все это заняло около 21 часа и задействовало примерно 950 параллельных ИИ-агентов.
Один из агентов заметил в ДНК необычную вещь: там находилась длинная последовательность повторяющихся участков, расположенных с определённым интервалом.
Что нашли?
Систему назвали ART (array-associated reverse transcriptase). Она встречается в основном у бактериофагов, вирусов бактерий, и состоит из трёх частей: фермента, гена-партнёра и длинного массива повторов.
➡️ От CRISPR она отличается тем, что рядом нет генов Cas. Вставки между повторами длиннее, около 120–220 нуклеотидов.
➡️ Массив активно «читается» в короткие РНК. По препринту, через 15 минут после заражения они составляют до 8% всех РНК фага.
Функция системы пока неизвестна. Авторы прямо пишут, что не показали ни активности фермента, ни того, что эти РНК служат ему «шаблонами». Их рабочая гипотеза: система устроена как ретрон, то есть один фермент получает набор разных РНК.
Почему это важно?
Если выяснится, что ART действительно использует свои РНК для управления обратной транскриптазой, может оказаться, что природа независимо придумала ещё один способ сделать программируемую молекулярную машину.
Мы знаем несколько природных систем, которые умеют работать с генетической информацией необычно точно:
➡️ CRISPR-Cas — распознавать определённые последовательности и разрезать ДНК;
➡️ reverse transcriptases — переводить информацию из РНК обратно в ДНК;
➡️ retrons — использовать RT + РНК-компонент в защитных системах бактерий;
➡️ diversity-generating retroelements — целенаправленно создавать генетическое разнообразие;
➡️ некоторые RT-Cas системы — соединять возможности обратной транскрипции и CRISPR.
Потенциально ART мог бы применяться для лечения точечных наследственных болезней (серповидноклеточной анемии, муковисцидозе) или заболеваний с потерей функции гена.
Самое потенциально революционное здесь — не «Claude изобрёл новый CRISPR», а то, что ИИ начинает самостоятельно находить в миллиардах генетических последовательностей молекулярные машины, о существовании которых исследователь даже не знал, что стоит искать. И уже потом люди могут превращать эти находки в новые биотехнологии.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Anthropic запустила собственную группу по биологии и лабораторию. Идея в следующем: дать ИИ-агентам возможность самостоятельно прочёсывать огромные массивы генетических данных, находить странности, формулировать гипотезы и отдавать наиболее интересные находки людям для проверки.
Что сделали?
В первом таком эксперименте Claude искал необычные reverse transcriptases (RT) — обратные транскриптазы. Это ферменты, которые умеют делать копию ДНК на основе РНК.
Claude просмотрел более 200 тыс. известных RT и сузил их до 20 кандидатов для детального анализа. Все это заняло около 21 часа и задействовало примерно 950 параллельных ИИ-агентов.
Один из агентов заметил в ДНК необычную вещь: там находилась длинная последовательность повторяющихся участков, расположенных с определённым интервалом.
То есть Claude обнаружил целую комбинацию признаков, которую раньше не выделяли как самостоятельную биологическую систему.
Что нашли?
Систему назвали ART (array-associated reverse transcriptase). Она встречается в основном у бактериофагов, вирусов бактерий, и состоит из трёх частей: фермента, гена-партнёра и длинного массива повторов.
Функция системы пока неизвестна. Авторы прямо пишут, что не показали ни активности фермента, ни того, что эти РНК служат ему «шаблонами». Их рабочая гипотеза: система устроена как ретрон, то есть один фермент получает набор разных РНК.
Почему это важно?
Если выяснится, что ART действительно использует свои РНК для управления обратной транскриптазой, может оказаться, что природа независимо придумала ещё один способ сделать программируемую молекулярную машину.
Мы знаем несколько природных систем, которые умеют работать с генетической информацией необычно точно:
Потенциально ART мог бы применяться для лечения точечных наследственных болезней (серповидноклеточной анемии, муковисцидозе) или заболеваний с потерей функции гена.
Самое потенциально революционное здесь — не «Claude изобрёл новый CRISPR», а то, что ИИ начинает самостоятельно находить в миллиардах генетических последовательностей молекулярные машины, о существовании которых исследователь даже не знал, что стоит искать. И уже потом люди могут превращать эти находки в новые биотехнологии.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4🔥2👏1💯1
Группа из 33 исследователей представила работу с провокационным названием The Last AI Built by Humans — «Последний ИИ, построенный людьми». Авторы предлагают оценивать системы не только по числу решённых задач, но и по тому, какую часть собственного развития они способны контролировать.
Получилась пятиуровневая шкала, напоминающая классификацию автопилотов SAE:
Есть ещё уровень 0: модель может исправлять текущий ответ, спорить сама с собой или переписывать код, но после завершения задачи ничего не наследует. Это ещё не самоулучшение — изменился результат, а не система.
Где мы сейчас?
По оценке авторов, основная масса практических систем находится на L1–L2. ИИ уже может выполнять длинные циклы разработки, диагностировать ошибки, менять промпты, инструменты и агентную обвязку. Но люди по-прежнему задают цель, строят среду, определяют критерий успеха и решают, выпускать ли обновление.
Отдельные прототипы демонстрируют элементы L3 и L4: создают себе тренировочные задачи, накапливают опыт между запусками и перестраивают рабочие процессы по журналам ошибок. Однако авторы называют L2 сильнейшим устойчиво продемонстрированным уровнем; кандидаты на L5 пока не равны доказанной автономной рекурсии.
Какими ещё линейками измеряют развитие ИИ?
Ни одна линейка не показывает всю картину. Но вместе они задают три правильных вопроса: что ИИ умеет, как долго он способен действовать самостоятельно — и может ли он сохранить урок так, чтобы следующая версия стала лучше.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3❤2🔥2💯1
Недавно на конференции Deep Tech Night бывший директор по развитию бизнеса Google X Мо Гавдат назвал главным нерешённым ограничением ИИ не интеллект, а долгосрочную память. По его мнению, тот, кто первым научит модели надёжно помнить прошлое, получит огромное конкурентное преимущество.
В качестве примера Гавдат рассказал об Emma — приложении для знакомств и персонального сопровождения, которое он создаёт как «рой» ИИ-агентов. Одни агенты знакомятся с пользователем, другие анализируют отношения, определяют приоритеты или подбирают партнёров, а общий слой координирует их работу.
По словам Гавдата, Emma способна сохранять контекст примерно полтора месяца благодаря десяткам специализированных агентов, оркестратору, разграничению прав и проверкам. Однако публичного технического описания этой архитектуры и независимого тестирования пока нет.
Почему память вообще оказалась такой сложной задачей?
Современная ИИ-модель похожа на блестящего сотрудника, который в конце каждой смены забывает почти всё. Контекстное окно — это его рабочий стол: на него можно положить документы текущей задачи, но стол не превращается от этого в архив компании.
Просто сделать стол больше недостаточно. Чем длиннее история, тем дороже её каждый раз перечитывать, тем легче потерять важный факт среди тысяч сообщений. Более того, информация меняется: адрес, диагноз, проектная цель или отношение пользователя могут устареть.
Поэтому настоящая память — это не гигантский чат, а архив с хорошим библиотекарем. Система должна решить:
Что даст решение?
ИИ сможет сопровождать многомесячные проекты, помнить договорённости и причины прежних решений, учиться на собственных неудачных действиях и передавать накопленный опыт между специализированными агентами.
Главным активом ИИ-компании может стать уже не только самая умная модель, но и точная, безопасная и управляемая память о пользователях и проектах.
Как к этому подходят ведущие лаборатории?
Подходы различаются, но общий принцип уже виден: лаборатории пока не учат базовую модель заново после каждого разговора. Они строят вокруг неё отдельный слой памяти — с поиском, сжатием, обновлением и контролем доступа.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍2🔥2
Авторы DrivingBench подключили несколько универсальных ИИ-моделей к настоящей Toyota Corolla через MCP, устройство comma four и openpilot.
Сomma four — это автомобильный бортовой компьютер компании comma.ai. Внешне он напоминает видеорегистратор, который крепится возле зеркала заднего вида, но внутри находятся камеры, процессор, датчики и интерфейс подключения к электронной системе автомобиля.
Openpilot — открытое программное обеспечение помощи водителю. Оно получает изображения с камер и данные автомобиля; оценивает дорогу и движение; рассчитывает команды рулю, тормозу и акселератору; передаёт их через штатные интерфейсы систем ADAS.
В итоге агент видел изображения с камер и получал три инструмента: наблюдать, задавать скорость и поворот, немедленно остановиться. Испытания проходили на пустой частной парковке. Скорость программно ограничили примерно 13 км/ч.
И всё же GPT-6 Astra периодически отказывалась управлять автомобилем: модель понимала, что действует в физическом мире, и ссылалась на риск. Исследователи пытались назвать происходящее «симуляцией», но модель иногда распознавала реальные кадры и снова прекращала работу.
Лучше всего помогло переименование MCP-сервера в DrivingBench Sandbox. После этого в сочетании с обновлённым промптом модели стали соглашаться вести настоящую машину.
Astra в итоге единственной прошла весь 134-метровый маршрут: на второй попытке, за 5 минут 22 секунды. Claude Fable 5.1 дошла примерно до 45%, остальные модели не преодолели первый поворот. Все попытки проходили в одном диалоге, поэтому агент мог учиться на предыдущих ошибках.
Неужели защиту действительно можно снять одним названием?
Эксперимент не доказывает, что словом sandbox можно отключить любые запреты модели. Скорее, он показывает хрупкость конкретного защитного поведения: отказ был не физической блокировкой и не правилом контроллера автомобиля, а выводом самой модели о контексте задачи.
Современная LLM не устанавливает истину так, как это делает датчик. Она собирает признаки: название инструмента, инструкции, изображения, объяснения пользователя - и на их основе оценивает, безопасно ли действовать.
Слово sandbox стало сильным сигналом «последствий в реальном мире нет» и перевесило другие признаки.
Это напоминает социальную инженерию. Охранник не отключил сигнализацию — его убедили, что перед ним учебная тревога. Особенно тревожно это выглядит на фоне распространения MCP. Раньше ошибочный ответ модели оставался текстом. Теперь тот же механизм может управлять файлами, платежами, лабораторным оборудованием или автомобилем.
Как лаборатории пытаются решить проблему?
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥3👏1🤔1
Forwarded from Институт AIRI
Объединяем исследователей для обучения ИИ долгосрочному планированию
Владислав Куренков, руководитель научной группы «Адаптивные агенты» Института AIRI, запустил открытое сообщество людей, работающих над системами планирования ИИ, чтобы вместе решить одну из самых неподатливых для искусственного интеллекта игр — NetHack.
У каждого участника будет свой способ получить программу, свои инструменты и своя стратегия, а общая инфраструктура позволит видеть результаты друг друга, сравнивать их между собой и продолжать разрабатывать решения друг друга.
Владислав рассказал, почему NetHack весьма полезна для обучения ИИ:
📎 Подробнее про сообщество, игру и «интеллект» агента — в интервью «Ъ-Науке».
Владислав Куренков, руководитель научной группы «Адаптивные агенты» Института AIRI, запустил открытое сообщество людей, работающих над системами планирования ИИ, чтобы вместе решить одну из самых неподатливых для искусственного интеллекта игр — NetHack.
У каждого участника будет свой способ получить программу, свои инструменты и своя стратегия, а общая инфраструктура позволит видеть результаты друг друга, сравнивать их между собой и продолжать разрабатывать решения друг друга.
Владислав рассказал, почему NetHack весьма полезна для обучения ИИ:
«Одна партия в NetHack — это десятки тысяч ходов. Жизнь у героя одна, сохранений нет, подземелье каждый раз новое, а игра по дороге ничего не подсказывает. Если вы сыграли плохо, то выясняется это тогда, когда ничего исправить уже нельзя. Когда мы запускаем наших ботов играть, то вторая по частоте причина их "смерти" — голод, потому что они не позаботились о еде за несколько тысяч ходов до финального момента. На таких же ошибках спотыкаются ИИ-агенты, когда пишут код: отдельный шаг они выполняют прекрасно, а на длинную дистанцию держать планку не могут. И NetHack в этом плане становится весьма полезной для обучения ИИ».
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🔥3❤2
ИИ в науке: что происходит, когда ученый становится слишком продуктивным?
На днях большой научный коллектив из Google, Google DeepMind и MIT FutureTech опубликовал документ, который не мог не привлечь наше внимание — «AI in Science: Early Insights» («ИИ в науке: первые результаты»). Это первый результат нового совместного исследовательского направления компаний, которое должно систематически отслеживать использование ИИ в науке и его экономические последствия.
Для исследования авторы использовали три независимых источника данных:
1️⃣ Логи Gemini: из 15 млн анонимизированных диалогов трёхступенчатым фильтром выделили около 360 тыс. «научных».
2️⃣ 2 690 специализированных ИИ-моделей (типа AlphaFold) со статьёй и официальным кодом.
3️⃣ Опрос 637 учёных из США и Великобритании.
Основные выводы из документа:
➡️ Ученые — одни из самых активных пользователей ИИ
Например, в американской категории SOC 19, включающей life, physical и social sciences, вероятность использования ИИ примерно в 2,7 раза выше, чем можно было бы ожидать исходя из доли этих профессий в занятости.
➡️ LLM и специализированные модели НЕ заменяют друг друга
Они работают как комплементарные технологии. LLM нужны для кода, статистики, литературы и текстов. Специализированные модели нужны для предсказаний, симуляций и генерации данных.
➡️ ученые экономят почти 7 часов в неделю
Большая часть высвободившегося времени, по словам исследователей, возвращается обратно в научную деятельность.
➡️ Узкое место смещается вниз по производственному потоку
У 44% оно переместилось к лабораторной работе и валидации. У 41% вырос бэклог непроверенных гипотез. 46% тратят больше четверти сэкономленного времени на проверку ответов ИИ.
Кажется, в недалеком будущем главным дефицитом науки может стать не стремительно развивающийся интеллект, а физический мир. Белок все еще нужно синтезировать. Эксперимент все еще нужно провести. Материал все еще нужно изготовить. Поэтому возникает новая экономика науки: интеллект становится дешевле, а эксперимент — относительно дороже.
Кроме того, следующим большим рынком AI for Science может оказаться не генерация гипотез, а их проверка. Сегодня много внимания направлено на то, что ИИ научился придумывать новые гипотезы. Но если бэклог гипотез растет, то следующее "бутылочное горлышко" науки — это как быстро проверить 1 млн гипотез?
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
На днях большой научный коллектив из Google, Google DeepMind и MIT FutureTech опубликовал документ, который не мог не привлечь наше внимание — «AI in Science: Early Insights» («ИИ в науке: первые результаты»). Это первый результат нового совместного исследовательского направления компаний, которое должно систематически отслеживать использование ИИ в науке и его экономические последствия.
Для исследования авторы использовали три независимых источника данных:
Главная мысль: ИИ ускоряет отдельные задачи в науке, но итоговый темп открытий упирается в узкие места (bottleneck) по производственной цепочке: физические эксперименты, валидацию и проверку результатов. Производительность учёного растёт, но наука в целом ускоряется намного слабее.
Основные выводы из документа:
Например, в американской категории SOC 19, включающей life, physical и social sciences, вероятность использования ИИ примерно в 2,7 раза выше, чем можно было бы ожидать исходя из доли этих профессий в занятости.
Они работают как комплементарные технологии. LLM нужны для кода, статистики, литературы и текстов. Специализированные модели нужны для предсказаний, симуляций и генерации данных.
Большая часть высвободившегося времени, по словам исследователей, возвращается обратно в научную деятельность.
У 44% оно переместилось к лабораторной работе и валидации. У 41% вырос бэклог непроверенных гипотез. 46% тратят больше четверти сэкономленного времени на проверку ответов ИИ.
Кажется, в недалеком будущем главным дефицитом науки может стать не стремительно развивающийся интеллект, а физический мир. Белок все еще нужно синтезировать. Эксперимент все еще нужно провести. Материал все еще нужно изготовить. Поэтому возникает новая экономика науки: интеллект становится дешевле, а эксперимент — относительно дороже.
Кроме того, следующим большим рынком AI for Science может оказаться не генерация гипотез, а их проверка. Сегодня много внимания направлено на то, что ИИ научился придумывать новые гипотезы. Но если бэклог гипотез растет, то следующее "бутылочное горлышко" науки — это как быстро проверить 1 млн гипотез?
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2🔥1👏1🤯1💯1