Тест Тьюринга
2.13K subscribers
1.1K photos
179 videos
35 files
1.93K links
Актуальное в сфере искусственного интеллекта в России и в мире:
• Дайджест новостей
• Аналитические обзоры, переводы, справки

Для связи - @nastyapvlv28
Download Telegram
👿 Новости из Японии: снова оркестрация вместо одной гигантской ИИ-модели

11 сентября японская Sakana AI представила обновление Fugu Max и Fugu Ultra v2. Перед нами разные версии системы, которая сама собирает группу из нескольких ИИ-моделей и руководит её работой.

Разработчик отправляет запрос в один OpenAI-совместимый API. Внутри Fugu решает, достаточно ли одной модели или задачу следует разделить на части, кому поручить планирование, код, поиск и проверку, а затем собирает результаты в единый ответ. Оркестратор тоже является языковой моделью и при необходимости может рекурсивно вызывать другие экземпляры самого себя.

Мы часто пишем об оркестраторах, и ранее уже описывали, как работает японская Fugu. Связано это с тем, что при все большей потребности фронтирных моделей в вычислительных мощностях оркестраторы позволяют получить столь же высокое качество при более скромных расходах.

Зачем понадобились сразу Max и Ultra v2?

Обе версии построены на общей архитектуре, но оптимизируют разные показатели.

➡️ Fugu Max ищет лучшее соотношение качества и цены. Он использует крупнейший в линейке пул открытых и специализированных моделей, включая семейство NVIDIA Nemotron, и старается поручать каждый фрагмент работы самому экономичному агенту.

Цена составляет $2 за миллион входных и $6 за миллион выходных токенов. По расчётам Sakana, выход Max обходится на 40–60% дешевле Sonnet 5, GPT-5.6 Terra и Kimi K3. На шести тестах, включая Terminal Bench 2.1, GPQA Diamond и AutomationBench, система показала лучший совокупный результат «качество — стоимость».

➡️ Fugu Ultra v2 решает противоположную задачу: получить максимально сильный результат, даже если ответ потребует больше времени и вычислений. Она предназначена для автономных исследований, сложного анализа документов, программной разработки и длинных многошаговых процессов.

На Chartography, где требуется понимать сложные графики и визуальные данные, Ultra v2 получила 48,3 балла против 27,3 у Opus 5. На DeepSWE для реальной разработки ПО — 74,3. По данным Sakana, система стала первой или разделила первое место в пяти из восьми тестов.

При этом в её пул не входили Fable 5, Fable 5.1 и GPT-6 Astra. То есть оркестратор достиг заявленного уровня не потому, что просто применил внутри самую сильную доступную модель.

Чем это отличается от первой Fugu Ultra?

В июне Sakana выпустила обычную Fugu для повседневной работы и Fugu Ultra для максимального качества. Новый релиз превращает эту идею в более чёткую продуктовую развилку:
☑️ Max — минимизировать стоимость при сохранении высокого качества;
☑️ Ultra v2 — максимизировать способность решать самые сложные задачи.

Главное изменение — не новый интерфейс, а обучение оркестратора под две разные экономические цели. Однако точный состав пулов и внутренние изменения относительно первой Ultra компания не раскрывает. Пользователь также не видит, какие конкретно модели были выбраны для отдельного запроса.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2🔥1
🧪 Новый инструмент проверки научных гипотез

AlphaXiv выпустила OpenResearch — открытую рабочую среду для исследований с помощью Claude Code, Codex, OpenCode, Cursor и Google Antigravity. 11 сентября проект занял первое место в GitHub Trending.

OpenResearch — это не новая модель и не способ переобучить агента. Это новый способ организации работы ИИ-агентов, в первую очередь, кодинговых. Агент получает в OpenResearch инструменты и процедуру исследования: как найти литературу, как сформулировать гипотезу, написать код, провести эксперимент и решить, что проверять дальше.

Как это выглядит на практике?

Допустим, вы хотите ускорить обучение модели без потери качества. Вы задаёте цель, предоставляете данные и вычислительные ресурсы, определяете критерии успеха и бюджет.

Далее агент ищет подходящие статьи через alphaXiv и OpenAlex, готовит исходный вариант для сравнения и предлагает изменения. Например, другой алгоритм оптимизации, иной режим обучения или удаление лишнего компонента.

Несколько направлений можно проверять параллельно. Каждому агенту выделяется отдельная рабочая копия проекта, поэтому эксперименты не перезаписывают код друг друга. Агенты запускают опыты, анализируют результаты и выбирают следующий шаг. На выходе — код, измерения, графики и отчёт.

Важная деталь: Git здесь становится лабораторным журналом

Каждый запуск связан с неизменяемым архивом конкретной версии кода. Рядом сохраняются логи и результаты. В инструкциях отдельно закреплено, что неудачный опыт тоже считается результатом; новую идею нужно проверять в новой ветке, не переписывая прошлое.

Так можно увидеть не только победивший вариант, но и путь к нему.


Что именно можно исследовать?

Прежде всего задачи, которые проверяются вычислительным экспериментом: воспроизводить результаты научных статей, сравнивать ML-методы, подбирать параметры обучения, проверять вклад отдельных компонентов модели. Например, отключать их по одному и измерять, что действительно влияет на результат.

У alphaXiv есть показательный открытый пример — частичное воспроизведение DSWorld. Проверяли, можно ли сначала прогнозировать результаты экспериментов и благодаря этому реже запускать дорогие вычисления. Авторы явно указали, что использовали упрощённую постановку и не воспроизвели исходную работу целиком.

Сам OpenResearch открыт по лицензии MIT. Эксперименты можно запускать на своём компьютере, удалённом сервере или облачной инфраструктуре. Но стоимость обращения к моделям и вычислений от этого не исчезает.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1👍1💯1
ИИ, который не умеет генерить текст и картинки, но зато умеет выбирать

Соавтор статьи об InstructGPT Диого Алмейда представил Jev — модель, созданную для принятия решений из заданных вариантов.

После двух лет работы в закрытом режиме его компания TypeSafe AI открыла доступ к первому продукту нового класса, который называет System One Models.

Jev нельзя попросить написать письмо, программу или объяснение. Модель принимает текст либо структурированное описание ситуации, оценивает заранее заданные варианты и возвращает значения, с которыми сразу может работать код.

Например, служба поддержки передаёт ей сообщение клиента, сведения о заказе и правила возврата. Одним запросом Jev может определить:
➡️ в какой отдел направить обращение;
➡️ просит ли клиент вернуть деньги;
➡️ насколько высок риск ошибки или мошенничества;
➡️ следует ли передать случай человеку.

Для каждого варианта возвращается вероятность. Программа может автоматически обработать очевидные случаи, сомнительные отправить оператору, а опасные заблокировать до проверки.

Как ИИ может работать, ничего не генерируя?

Обычная LLM отвечает последовательно: выбирает первый токен, затем второй и продолжает, пока не составит строку или JSON. После этого внешней программе приходится разбирать и проверять полученный текст. И хорошо, если получился структурированный JSON (но маленькие модели их плохо создают и это не дешево).

У Jev форма ответа определена заранее: выбор из списка, оценка по шкале или вероятность «да/нет». Модель сопоставляет входные данные со всеми разрешёнными вариантами и оценивает их параллельно.

Грубо говоря, это диспетчер: он не сочиняет новое направление, а оценивает доступные пути и переводит "стрелку".


TypeSafe называет метод обучения Reinforcement Learning for Calibrated Decisions. Его цель - сделать вероятности содержательными: если модель многократно сообщает «80%», правильный вариант должен встречаться примерно в 80% подобных случаев.

Это не гарантирует верности каждого ответа, но позволяет задавать пороги риска: при высокой уверенности действовать автоматически, при средней — запросить подтверждение, при низкой — передать решение человеку или более мощной модели.

Отсюда скорость и цена. По данным самой TypeSafe, Jev отвечает за 70–500 мс и работает в 40–200 раз быстрее сопоставимых LLM на задачах такого типа. Миллион входных токенов стоит ВСЕГО $0,042, выход отдельно не тарифицируется: длинной последовательности выходных токенов просто нет.

Где это может пригодиться?

В ИИ-агентах Jev способен выбирать следующий инструмент, подходящую модель или момент для повторной попытки. В бизнес-системах — сортировать обращения, оценивать лиды, проверять заявки на возврат, выявлять риск и модерировать контент. В защитном контуре — проверять ответы другой модели, обнаруживать подозрительные команды и решать, когда нужен человек.

Показательная демонстрация — Wikiracing: на каждом шаге Jev выбирает следующую ссылку из сотен кандидатов. Другой прототип управляет персонажем в Doom по текстовому описанию состояния игры. Оба примера показывают сильную сторону подхода: множество быстрых локальных решений складывается в длинное поведение.

Кроме этого, модель «не может галлюцинировать»: Jev не выдаст несуществующий пункт вне заданной схемы.


Конечно, Jev не заменяет большие языковые модели. Он предлагает другой слой ИИ — дешёвую систему переключателей между ними.

Если подход подтвердится в независимых тестах, агенты будущего могут быть устроены как компания: дорогие специалисты решают сложные задачи, а быстрый диспетчер распределяет между ними миллионы повседневных решений.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2🔥2
💊 Claude выходит в лабораторную науку

Novo Nordisk и Anthropic заключили соглашение об использовании Claude для разработки лекарств. Датская компания будет тестировать модели Anthropic и среду Claude Science в своих R&D-процессах, а также применять Claude для создания внутреннего ПО.

Зачем Anthropic доступ в мокрую лабораторию?

В биологии последнее слово остаётся за физическим экспериментом. Модель может предсказать, что молекула свяжется с белком, но это необходимо проверить на настоящих образцах. Поэтому Anthropic открыла лабораторию в районе Сан-Франциско и одновременно работает с внешними партнёрами.

Её место в стратегии — замкнуть контур: данные → гипотеза → эксперимент → измерения → новая гипотеза.


Для связи Claude с оборудованием компания уже разработала Model Hardware Standard. Он позволяет агентам получать данные от микроскопов и ридеров, управлять дозаторами и роботизированными руками, менять параметры и повторять опыты. Собственная лаборатория становится испытательным полигоном и источником обратной связи: здесь можно проверять, превращаются ли убедительные рассуждения модели в работающие биологические протоколы.

На первом этапе команды выберут научные задачи, в которых знания исследователей Novo можно соединить со способностью Claude анализировать литературу, биологические данные и код. Финансовые условия, конкретные заболевания, молекулы и сроки не раскрыты.

Раньше Novo использовала Claude преимущественно после экспериментов: система NovoScribe сократила подготовку клинических отчётов с десяти с лишним недель до десяти минут, а количество циклов проверки — вдвое. Теперь Claude перемещается ближе к началу фармацевтического конвейера — туда, где выбирают гипотезы и кандидатов.

Как это должно работать?


Claude Science объединяет научные статьи, базы белков и молекул, код, вычислительные кластеры и специализированные инструменты. Агент может изучить литературу, предложить гипотезу, написать программу анализа, обработать геномные или химические данные, показать структуру белка и подготовить протокол эксперимента. Отдельный агент проверяет ссылки, расчёты и соответствие графиков исходному коду. Claude здесь выступает координатором длинной цепочки научных операций.

Какие задачи планируется решать?

Ближайший слой — обзоры литературы, поиск гипотез, разработка протоколов, анализ геномики, single-cell, протеомики, химических и структурных данных. Следующий — проектирование белков и антител, выбор перспективных мишеней и управление автоматизированными экспериментами. Anthropic также говорит о редких и пока считающихся «неподдающимися лечению» заболеваниях, которыми индустрия занимается недостаточно.

Anthropic строит полный научный цикл: Claude читает и рассуждает, программная среда организует исследование, роботы проводят опыт, а лаборатория возвращает модели реальность.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2🔥2👏1💯1
🧬 Claude открыл неизвестную генетическую систему

Anthropic запустила собственную группу по биологии и лабораторию. Идея в следующем: дать ИИ-агентам возможность самостоятельно прочёсывать огромные массивы генетических данных, находить странности, формулировать гипотезы и отдавать наиболее интересные находки людям для проверки.

Что сделали?

В первом таком эксперименте Claude искал необычные reverse transcriptases (RT) — обратные транскриптазы. Это ферменты, которые умеют делать копию ДНК на основе РНК.

Claude просмотрел более 200 тыс. известных RT и сузил их до 20 кандидатов для детального анализа. Все это заняло около 21 часа и задействовало примерно 950 параллельных ИИ-агентов.

Один из агентов заметил в ДНК необычную вещь: там находилась длинная последовательность повторяющихся участков, расположенных с определённым интервалом.

То есть Claude обнаружил целую комбинацию признаков, которую раньше не выделяли как самостоятельную биологическую систему.


Что нашли?

Систему назвали ART (array-associated reverse transcriptase). Она встречается в основном у бактериофагов, вирусов бактерий, и состоит из трёх частей: фермента, гена-партнёра и длинного массива повторов.

➡️ От CRISPR она отличается тем, что рядом нет генов Cas. Вставки между повторами длиннее, около 120–220 нуклеотидов.
➡️ Массив активно «читается» в короткие РНК. По препринту, через 15 минут после заражения они составляют до 8% всех РНК фага.

Функция системы пока неизвестна. Авторы прямо пишут, что не показали ни активности фермента, ни того, что эти РНК служат ему «шаблонами». Их рабочая гипотеза: система устроена как ретрон, то есть один фермент получает набор разных РНК.

Почему это важно?

Если выяснится, что ART действительно использует свои РНК для управления обратной транскриптазой, может оказаться, что природа независимо придумала ещё один способ сделать программируемую молекулярную машину.

Мы знаем несколько природных систем, которые умеют работать с генетической информацией необычно точно:
➡️ CRISPR-Cas — распознавать определённые последовательности и разрезать ДНК;
➡️ reverse transcriptases — переводить информацию из РНК обратно в ДНК;
➡️ retrons — использовать RT + РНК-компонент в защитных системах бактерий;
➡️ diversity-generating retroelements — целенаправленно создавать генетическое разнообразие;
➡️ некоторые RT-Cas системы — соединять возможности обратной транскрипции и CRISPR.

Потенциально ART мог бы применяться для лечения точечных наследственных болезней (серповидноклеточной анемии, муковисцидозе) или заболеваний с потерей функции гена.

Самое потенциально революционное здесь — не «Claude изобрёл новый CRISPR», а то, что ИИ начинает самостоятельно находить в миллиардах генетических последовательностей молекулярные машины, о существовании которых исследователь даже не знал, что стоит искать. И уже потом люди могут превращать эти находки в новые биотехнологии.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4🔥2👏1💯1
💪 Насколько ИИ уже приблизился к способности улучшать самого себя?

Группа из 33 исследователей представила работу с провокационным названием The Last AI Built by Humans — «Последний ИИ, построенный людьми». Авторы предлагают оценивать системы не только по числу решённых задач, но и по тому, какую часть собственного развития они способны контролировать.

Получилась пятиуровневая шкала, напоминающая классификацию автопилотов SAE:

➡️ L1 - исполняет улучшение. Люди решают, что и как изменить, а ИИ выполняет процедуру: например, фильтрует данные или проводит заданные тесты.
➡️ L2 - выбирает способ улучшения. Цель и критерии успеха задаёт человек, но система сама находит слабое место, предлагает изменения и проверяет варианты.
➡️ L3 - выбирает, на чём учиться дальше. ИИ определяет, каких данных или экспериментов ему не хватает, и формирует собственную программу практики.
➡️ L4 - изменяется на основе реального опыта. Система анализирует результаты работы после внедрения и сохраняет полезные правила, инструменты или навыки для следующих задач.
➡️ L5 - улучшает сам механизм улучшения. Объектом оптимизации становится уже не только модель, но и процедура, которая придумывает, проверяет и отбирает следующие обновления.

Есть ещё уровень 0: модель может исправлять текущий ответ, спорить сама с собой или переписывать код, но после завершения задачи ничего не наследует. Это ещё не самоулучшение — изменился результат, а не система.

Где мы сейчас?

По оценке авторов, основная масса практических систем находится на L1–L2. ИИ уже может выполнять длинные циклы разработки, диагностировать ошибки, менять промпты, инструменты и агентную обвязку. Но люди по-прежнему задают цель, строят среду, определяют критерий успеха и решают, выпускать ли обновление.

Отдельные прототипы демонстрируют элементы L3 и L4: создают себе тренировочные задачи, накапливают опыт между запусками и перестраивают рабочие процессы по журналам ошибок. Однако авторы называют L2 сильнейшим устойчиво продемонстрированным уровнем; кандидаты на L5 пока не равны доказанной автономной рекурсии.

Какими ещё линейками измеряют развитие ИИ?

🌟 METR Time Horizon показывает сложность задач, которые агент выполняет с заданной вероятностью, переводя её во время, необходимое человеку. Это хорошая мера длительной автономной работы, но главным образом в программировании, ML и кибербезопасности; METR предупреждает, что текущие оценки свыше 16 часов пока ненадёжны.

🌟 RE-Bench и PaperBench проверяют способность вести ИИ-исследования: ставить эксперименты, оптимизировать модели и воспроизводить научные статьи. Они ближе всего к вопросу «может ли ИИ разрабатывать следующий ИИ», но измеряют результат отдельного проекта, а не наследуемый цикл самоулучшения.

🌟 Levels of AGI от Google DeepMind оценивает глубину и широту способностей: насколько система сильна и насколько универсальна. Новая шкала смотрит на другую ось — кто контролирует процесс её дальнейшего развития.

Ни одна линейка не показывает всю картину. Но вместе они задают три правильных вопроса: что ИИ умеет, как долго он способен действовать самостоятельно — и может ли он сохранить урок так, чтобы следующая версия стала лучше.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3❤2🔥2💯1
🧠 ИИ всё ещё страдает "амнезией"

Недавно на конференции Deep Tech Night бывший директор по развитию бизнеса Google X Мо Гавдат назвал главным нерешённым ограничением ИИ не интеллект, а долгосрочную память. По его мнению, тот, кто первым научит модели надёжно помнить прошлое, получит огромное конкурентное преимущество.

В качестве примера Гавдат рассказал об Emma — приложении для знакомств и персонального сопровождения, которое он создаёт как «рой» ИИ-агентов. Одни агенты знакомятся с пользователем, другие анализируют отношения, определяют приоритеты или подбирают партнёров, а общий слой координирует их работу.

По словам Гавдата, Emma способна сохранять контекст примерно полтора месяца благодаря десяткам специализированных агентов, оркестратору, разграничению прав и проверкам. Однако публичного технического описания этой архитектуры и независимого тестирования пока нет.

Почему память вообще оказалась такой сложной задачей?

Современная ИИ-модель похожа на блестящего сотрудника, который в конце каждой смены забывает почти всё. Контекстное окно — это его рабочий стол: на него можно положить документы текущей задачи, но стол не превращается от этого в архив компании.

Просто сделать стол больше недостаточно. Чем длиннее история, тем дороже её каждый раз перечитывать, тем легче потерять важный факт среди тысяч сообщений. Более того, информация меняется: адрес, диагноз, проектная цель или отношение пользователя могут устареть.

Поэтому настоящая память — это не гигантский чат, а архив с хорошим библиотекарем. Система должна решить:
✅ что действительно следует сохранить;
✅ как отделить факт от предположения;
✅ когда достать нужное воспоминание;
✅ как обновить или забыть устаревшее;
✅ какой агент имеет право это прочитать;
✅ как удалить данные по требованию человека.

Что даст решение?

ИИ сможет сопровождать многомесячные проекты, помнить договорённости и причины прежних решений, учиться на собственных неудачных действиях и передавать накопленный опыт между специализированными агентами.

Главным активом ИИ-компании может стать уже не только самая умная модель, но и точная, безопасная и управляемая память о пользователях и проектах.


Как к этому подходят ведущие лаборатории?

➡️ OpenAI начала с явно сохраняемых фактов, а затем добавила автоматическую фоновую обработку истории ChatGPT — система выделяет устойчивые предпочтения, проекты и ограничения, формируя редактируемое резюме памяти.

➡️ Anthropic предлагает агентам внешнюю память в файлах: Claude записывает знания за пределами контекстного окна, извлекает их по необходимости и сочетает с автоматическим сжатием старых диалогов. Хранилище и правила доступа контролирует разработчик.

➡️ Google позволяет Gemini использовать прошлые разговоры и сведения из подключённых сервисов для персонализации, оставляя пользователю возможность отключать, исправлять и удалять запомненное.

Подходы различаются, но общий принцип уже виден: лаборатории пока не учат базовую модель заново после каждого разговора. Они строят вокруг неё отдельный слой памяти — с поиском, сжатием, обновлением и контролем доступа.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍2🔥2
🚗 Одно слово может выключить в ИИ все тормоза

Авторы DrivingBench подключили несколько универсальных ИИ-моделей к настоящей Toyota Corolla через MCP, устройство comma four и openpilot.

Сomma four — это автомобильный бортовой компьютер компании comma.ai. Внешне он напоминает видеорегистратор, который крепится возле зеркала заднего вида, но внутри находятся камеры, процессор, датчики и интерфейс подключения к электронной системе автомобиля.

Openpilot — открытое программное обеспечение помощи водителю. Оно получает изображения с камер и данные автомобиля; оценивает дорогу и движение; рассчитывает команды рулю, тормозу и акселератору; передаёт их через штатные интерфейсы систем ADAS.

В итоге агент видел изображения с камер и получал три инструмента: наблюдать, задавать скорость и поворот, немедленно остановиться. Испытания проходили на пустой частной парковке. Скорость программно ограничили примерно 13 км/ч.

И всё же GPT-6 Astra периодически отказывалась управлять автомобилем: модель понимала, что действует в физическом мире, и ссылалась на риск. Исследователи пытались назвать происходящее «симуляцией», но модель иногда распознавала реальные кадры и снова прекращала работу.

Лучше всего помогло переименование MCP-сервера в DrivingBench Sandbox. После этого в сочетании с обновлённым промптом модели стали соглашаться вести настоящую машину.

Astra в итоге единственной прошла весь 134-метровый маршрут: на второй попытке, за 5 минут 22 секунды. Claude Fable 5.1 дошла примерно до 45%, остальные модели не преодолели первый поворот. Все попытки проходили в одном диалоге, поэтому агент мог учиться на предыдущих ошибках.

Неужели защиту действительно можно снять одним названием?

Эксперимент не доказывает, что словом sandbox можно отключить любые запреты модели. Скорее, он показывает хрупкость конкретного защитного поведения: отказ был не физической блокировкой и не правилом контроллера автомобиля, а выводом самой модели о контексте задачи.

Современная LLM не устанавливает истину так, как это делает датчик. Она собирает признаки: название инструмента, инструкции, изображения, объяснения пользователя - и на их основе оценивает, безопасно ли действовать.

Слово sandbox стало сильным сигналом «последствий в реальном мире нет» и перевесило другие признаки.


Это напоминает социальную инженерию. Охранник не отключил сигнализацию — его убедили, что перед ним учебная тревога. Особенно тревожно это выглядит на фоне распространения MCP. Раньше ошибочный ответ модели оставался текстом. Теперь тот же механизм может управлять файлами, платежами, лабораторным оборудованием или автомобилем.

Как лаборатории пытаются решить проблему?

🔴 OpenAI обучает модели различать доверенные и недоверенные инструкции, отслеживает попытки prompt injection и дополняет модель песочницами, проверками ссылок и подтверждением значимых действий.

🔴 Anthropic проверяет обе стороны цикла: отдельный детектор анализирует информацию, которую читает Claude, а независимый классификатор оценивает действие до его исполнения.

🔴 Google DeepMind в новой AI Control Roadmap предлагает рассматривать ИИ как потенциально ненадёжного сотрудника: выдавать права постепенно, наблюдать за действиями и блокировать опасные операции независимо от его объяснений.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥3👏1🤔1
Forwarded from Институт AIRI
Объединяем исследователей для обучения ИИ долгосрочному планированию

Владислав Куренков, руководитель научной группы «Адаптивные агенты» Института AIRI, запустил открытое сообщество людей, работающих над системами планирования ИИ, чтобы вместе решить одну из самых неподатливых для искусственного интеллекта игр — NetHack.

У каждого участника будет свой способ получить программу, свои инструменты и своя стратегия, а общая инфраструктура позволит видеть результаты друг друга, сравнивать их между собой и продолжать разрабатывать решения друг друга.

Владислав рассказал, почему NetHack весьма полезна для обучения ИИ:
«Одна партия в NetHack — это десятки тысяч ходов. Жизнь у героя одна, сохранений нет, подземелье каждый раз новое, а игра по дороге ничего не подсказывает. Если вы сыграли плохо, то выясняется это тогда, когда ничего исправить уже нельзя. Когда мы запускаем наших ботов играть, то вторая по частоте причина их "смерти" — голод, потому что они не позаботились о еде за несколько тысяч ходов до финального момента. На таких же ошибках спотыкаются ИИ-агенты, когда пишут код: отдельный шаг они выполняют прекрасно, а на длинную дистанцию держать планку не могут. И NetHack в этом плане становится весьма полезной для обучения ИИ».


📎Подробнее про сообщество, игру и «интеллект» агента — в интервью «Ъ-Науке».
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🔥3❤2
ИИ в науке: что происходит, когда ученый становится слишком продуктивным?

На днях большой научный коллектив из Google, Google DeepMind и MIT FutureTech опубликовал документ, который не мог не привлечь наше внимание — «AI in Science: Early Insights» («ИИ в науке: первые результаты»). Это первый результат нового совместного исследовательского направления компаний, которое должно систематически отслеживать использование ИИ в науке и его экономические последствия.

Для исследования авторы использовали три независимых источника данных:
1️⃣ Логи Gemini: из 15 млн анонимизированных диалогов трёхступенчатым фильтром выделили около 360 тыс. «научных».
2️⃣ 2 690 специализированных ИИ-моделей (типа AlphaFold) со статьёй и официальным кодом.
3️⃣ Опрос 637 учёных из США и Великобритании.

Главная мысль: ИИ ускоряет отдельные задачи в науке, но итоговый темп открытий упирается в узкие места (bottleneck) по производственной цепочке: физические эксперименты, валидацию и проверку результатов. Производительность учёного растёт, но наука в целом ускоряется намного слабее.


Основные выводы из документа:

➡️ Ученые — одни из самых активных пользователей ИИ
Например, в американской категории SOC 19, включающей life, physical и social sciences, вероятность использования ИИ примерно в 2,7 раза выше, чем можно было бы ожидать исходя из доли этих профессий в занятости.

➡️ LLM и специализированные модели НЕ заменяют друг друга
Они работают как комплементарные технологии. LLM нужны для кода, статистики, литературы и текстов. Специализированные модели нужны для предсказаний, симуляций и генерации данных.

➡️ ученые экономят почти 7 часов в неделю
Большая часть высвободившегося времени, по словам исследователей, возвращается обратно в научную деятельность.

➡️ Узкое место смещается вниз по производственному потоку
У 44% оно переместилось к лабораторной работе и валидации. У 41% вырос бэклог непроверенных гипотез. 46% тратят больше четверти сэкономленного времени на проверку ответов ИИ.

Кажется, в недалеком будущем главным дефицитом науки может стать не стремительно развивающийся интеллект, а физический мир. Белок все еще нужно синтезировать. Эксперимент все еще нужно провести. Материал все еще нужно изготовить. Поэтому возникает новая экономика науки: интеллект становится дешевле, а эксперимент — относительно дороже.

Кроме того, следующим большим рынком AI for Science может оказаться не генерация гипотез, а их проверка. Сегодня много внимания направлено на то, что ИИ научился придумывать новые гипотезы. Но если бэклог гипотез растет, то следующее "бутылочное горлышко" науки — это как быстро проверить 1 млн гипотез?

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2🔥1👏1🤯1💯1
🧪 Microsoft теперь создаёт не только операционные системы, но и рецепты молекул

В Nature опубликована RetroChimera — ИИ-модель от команды Microsoft Research, помогающая химикам находить способы синтеза лекарственных и других сложных молекул. Исследование выполнено совместно с GSK и Novartis, а код и веса модели открыты для исследовательского использования.

Решаемые моделью задачи называются ретросинтезом. ИИ-химик начинает с молекулы, которую необходимо получить, и мысленно движется назад: на какие более простые вещества её можно разобрать, затем — из чего получить их, пока маршрут не приведёт к доступным реагентам.

Это похоже на попытку восстановить рецепт торта только по готовому десерту. Разница в том, что у молекулы существуют тысячи потенциальных «рецептов», а ошибка на одном этапе делает бесполезной всю многоступенчатую цепочку.

Как работает RetroChimera?

Внутри системы объединены два разных механизма.

➡️ Первый, R-SMILES 2 - Transformer, способный свободно генерировать исходные вещества. Он гибок и может предлагать редкие решения, но рискует галлюцинировать химически неверные реакции.

➡️ Второй, NeuralLoc — опирается на графовое представление молекул и известные шаблоны реакций. Его предложения надёжнее связаны с накопленной химией, но он хуже выходит за пределы библиотеки шаблонов.

RetroChimera собирает варианты обеих моделей и с помощью обученного механизма голосования решает, каким прогнозам доверять и как их ранжировать. Иными словами, рядом работают изобретательный химик и осторожный лаборант, а третий учится выбирать между ними.

В экспертной проверке система построила полностью приемлемые маршруты для девяти из десяти сложных молекул.

В другом слепом тесте девять органических химиков с PhD из Microsoft и крупных фармкомпаний сравнивали отдельные ретросинтетические шаги. Примерно в 64% случаев они предпочли предложение RetroChimera, нежели чем ранее опубликованной реакции, по которой молекулу уже получали прежде.

Исследователи оценивали химическую правдоподобность предложений; следующим этапом должна стать проверка в реальных проектах разработки препаратов.

Но важнее самой модели — то, кто её создал.

Microsoft уже нельзя рассматривать только как поставщика Windows, офисных программ и облака. В компании действует отдельное глобальное подразделение AI for Science, где специалисты по машинному обучению работают вместе с химиками, биологами и физиками.

В его портфеле находятся Aurora для погоды и земных систем, MatterGen и MatterSim для проектирования материалов, BioEmu для моделирования состояний белков, а теперь и RetroChimera для химического синтеза. Эти модели постепенно выводятся из исследовательских статей в Azure AI Foundry.

Следующий уровень — Microsoft Discovery: коммерческая платформа, соединяющая ИИ-агентов, научные данные, моделирование, высокопроизводительные вычисления и лабораторную автоматизацию. Microsoft пытается предоставить не отдельный научный алгоритм, а цифровую среду для полного цикла: литература → гипотеза → расчёт → эксперимент → новый вывод.

Это часть более широкого движения. Google DeepMind превратила AlphaFold в глобальный инструмент биологии, NVIDIA строит вокруг BioNeMo инфраструктуру для разработки лекарств, а Anthropic открыла собственную биологическую лабораторию.

Уже хорошо видно, что современная наука всё больше зависит от тех же ресурсов, на которых выросли ИТ-гиганты, — вычислений, данных, моделей и программных платформ.


Цифровые корпорации больше не ограничиваются созданием инструментов для учёных. Они постепенно занимают место внутри самого научного метода: предлагают молекулы, планируют эксперименты, анализируют результаты и связывают виртуальный расчёт с физической лабораторией.

Возможно, следующая конкуренция бигтеха развернётся за право стать операционной системой научных открытий.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM