Чекпоинт: AGI
57 subscribers
3 photos
3 videos
29 links
О моделях, агентах, AGI — без мифов и хайпа.
Идеи, наблюдения, эксперименты — вглядываемся за технологический горизонт.
Download Telegram
Новая модель: Ming Image 0.1 Design от inclusionAI
Вышла модель по генерации изображений с открытыми весами. Модель не претендует на хорошую генерацию любых изображений, но показывает топовые результаты на Text-to-Image UI/UX Design. То есть ее можно пробовать использовать для презентаций, инфографики, дизайна пользовательских интерфейсов, дашбордов и т.д. Что ж, попробуем.

Нам GPT-6 Sol предложил такой промпт

Create a high-resolution design showcase for AERIS, a fictional urban climate intelligence platform. Present four finished designs together on one clean 3:2 landscape canvas: a desktop analytics dashboard, a mobile app screen, a compact infographic, and a public-awareness poster. They must look like parts of the same real product, not four unrelated concepts.
Art direction: sophisticated civic-tech design with warm off-white backgrounds, deep navy typography, electric teal data accents, and restrained coral highlights. Use a precise grid, generous whitespace, crisp typography, accessible contrast, and subtle map-like textures. Make it polished and contemporary, but not generic sci-fi.
1. DASHBOARD — ...
2. MOBILE APP — ...
3. INFOGRAPHIC — …
4. POSTER — ...


Для модели с открытыми весами результат выглядит неплохо, хотя разрешения для текста в нашем случае немного не хватило. Интересно, что на текущий момент модель доступна бесплатно на OpenRouter, чем мы и воспользовались (и что не позволило задать больше разрешение). Русские промпты модель тоже понимает, хотя качество генерации может быть ниже.

В целом, модель выглядит интересно, особенно для открытой, но для приемлемого результата может требовать генерации в более высоком разрешении.
🔥1
Открываем возможность попробовать модель

Поскольку не всем не всегда удобно или возможно пробовать модели на внешних ресурсах, мы решили испытать в тестовом режиме запуск бота @checkpoint_agi_bot . Мы не планируем, что он будет работать постоянно, но время от времени через него можно будет что-то попробовать. Прямо сейчас мы сделали доступной описанную выше модель для генерации UI/UX графики.

Как попробовать: начинаем чат с ботом. Пишем /start (или жмем кнопку для начала чата), потом следуем инструкции (в данном случае следующим сообщением пишем /image, а потом текстом - промпт и ждем результат). Оставляйте комментарии, если функция "попробовать модель" вам в принципе может быть интересна.
👍3🔥3❤2
Media is too big
VIEW IN TELEGRAM
От генератора картинок до управления роботами

Вышла FLUX 3 Action от Black Forest Labs - 7B world-action модель (WAM) с открытыми весами в вариантах Base, Droid и Sol101 (последние две дообучены под определенные датасеты).

В свое время выход первой FLUX знаменовал архитектурный сдвиг от UNet к диффузным трансформерам в генерации изображений. Особый хайп был в том, что модели начали генерировать на картинках текст. Но это все еще были просто картинки.

Также отдельно появились Vision-Language-Action (VLA) модели. Они превращали кадры с камеры в текстовые псевдо-токены и использовали LLM для предсказания текста вместе с токенами действий. Языковые модели начали управлять роботами, кое как ориентируясь по изображениям.

В противовес LLM отдельным треком стали развиваться "модели мира" в стиле JEPA от Лекуна, суть которых была в предсказании латентных (скрытых) представлений изображений без их реконструкции на уровне пикселей.

WAM идет путем полного предсказания видеокадров и действий. Хоть такое предсказание и более ресурсоемкое, по качеству оно заметно превосходит VLA, а также опережает другие открытые модели на таких ведущих бенчмарках по управлению роботами, как RoboLab.

Попробовать такие модели на практике не столь просто - их нужно дообучать под конкретный контроллер. Но мы при случае обязательно попробуем!
🤝3
This media is not supported in your browser
VIEW IN TELEGRAM
Подводим итог тестирования WorldCrafter

Помимо сказанного выше мы также попробовали формировать трек камеры, подаваемой в модель, в надежде, что можно будет делать плавное перемещение по сцене. К сожалению, выяснилось, что модель этого не умеет, и все перемещения все равно превращает отдельно в перемещение по осям, отдельно - в повороты, причем каждый из них - кусок по 33 кадра. Хочешь, не хочешь - 33 кадра только двигаешься вдоль одной из осей или только вращаешься на заданный угол. Смешанные перемещения модель практически не обрабатывает - так что никакой плавной произвольной навигации по сцене. Если бы не это, то модели можно было бы придумать много применений, скажем, в метаверсе и играх.

Итак, плюсы и минусы:
🟩 быстрая генерация длинных роликов с хорошей структурой сцены;
🟥 посредственная генерация движений и совсем никакая - визуальных эффектов, сильные ограничения на треки камеры.

⏏️ Вывод: у подхода есть потенциал, но пока это добротный PoC, а не MVP. Ждем новых чекпоинтов. Может, и к роботам, как FLUX 3 Action найдется приложение.
👍2
This media is not supported in your browser
VIEW IN TELEGRAM
Открываем временный доступ к генерации видео

Раз уж мы много говорили про видео, для временного завершения этой темы мы на денек-другой открываем доступ к MiniMax H3 Max через нашего бота @checkpoint_agi_bot - с ограничением по два промпта в день. Заходим в диалог с ботом, набираем /start, потом /video, загружаем начальную картинку, а потом пишем промпт. Если получается что-то интересное или неудачное - делимся в комментариях.

Это не разобранная выше WorldCrafter, а более общая бюджетная модель для коротких роликов. Но если кто-то хочет "побродить" по какой-то фотографии или картинке именно с WorldCrafter, шлите ее в комментарии со словами "хочу побродить" - запустим вручную и поделимся результатом.
1👍3🔥3🤩2
Киберпанк, который мы заслужили

В интернетах любят пообсуждать новости о том, как какой-нибудь OpenAI агент сам решил взломать сайт правительства Австралии или что-нибудь в этом роде. Конечно, ведь это звучит громко - будто восстание машин вот-вот начнется.

Ранее мы обсуждали, что это, скорее, курьезные примеры слишком исполнительных агентов. Настоящая же проблема заключается не в том, что недостаточно обузданный агент может наломать дров при попытке достичь приемлемой цели, а в том, что сами люди могут ставить агентам вовсе не невинные цели. И эта проблема очень серьезная.

За последние несколько месяцев кибербезопасность в Интернете превратилась в рваные лохмотья. На сайте DefiLLama агрегирована впечатляющая статистика успешных хакерских атак, происходящих буквально каждый день, и понесенных жертвами потерь. И это только в области web3.

Такой всплеск интенсивности успешных атак связан с использованием злоумышленниками языковых моделей, у которых тем или иным способом обойдены ограничения на непредоставление потенциально вредоносной информации. Такая реальность действительно начинает напоминать киберпанковские сюжеты. Не "чёрный заслон от диких ИскИнов", а что-то более приземленное, но все же...

Грустная ирония заключается в том, что в число жертв попадают и компании, сами занимающиеся ИИ. Вот уж точно - киберпанк, который мы заслужили.
👍4😱1
Рекурсивное самоулучшение: пена и волна

Сентябрь был насыщен не только выходом новых моделей и разговорами о безопасности ИИ, но также и поднятием темы рекурсивного самоулучшения. В частности, на прошлой неделе вышла статья Google и DeepMind Dream-RSI: Recursive Self-Improvement through Evolving Worlds. Что означает RSI, и почему это важно?

🌀 Рекурсивное самоулучшение - это процесс, при котором система улучшает собственные интеллектуальные возможности. Улучшенные возможности позволяют ей улучшить себя еще больше и быстрее. И так далее. Ускоряющаяся последовательность самоулучшений ведёт к «взрыву интеллекта». Это радикально отличается от предобученных статичных больших языковых моделей.

Однако, если присмотреться, Dream-RSI — тоже не самосовершенствующаяся машина в сильном смысле. В ней не меняются базовая модель, её веса, архитектура, оценщик и класс задач. Система улучшает лишь метастратегию поиска: где продолжить уже начатую ветку работы, что запускать параллельно и когда остановиться.

Контур устроен так: кодинг-агент ищет решение и сохраняет дерево попыток с результатами. Затем другой агент предлагает варианты поисковой стратегии и дешёво проверяет их на этом дереве — без повторного запуска дорогих экспериментов. Лучшую стратегию снова выпускают в реальный поиск, и она производит новый опыт для следующей итерации.

Это полезное рекурсивное улучшение оркестрации поиска: на задачах алгоритмов, оптимизации и GPU-ядер авторы сообщают о сопоставимом или лучшем результате при меньшем вычислительном бюджете. Но это не означает, что система поняла и улучшила собственную когнитивную организацию. Её мир ограничен уже пройденными ветками, а улучшать разрешено один заранее выделенный компонент.

Подлинное RSI в глубоком смысле было бы другим: система способна улучшать свои представления, обучение, память, рассуждение, архитектуру и инструменты; каждое улучшение повышает её способность находить следующее. Машина Гёделя Юргена Шмидхубера — предельный теоретический образ такого процесса. Работающей системы этого типа пока нет.

Но Dream-RSI — это всё же какой-то шаг в данном направлении, тогда как в заявлениях OpenAI и Anthropic о том, что между ними началась «гонка напрямую к самоулучшающемуся сверхинтеллекту» (как отмечается в критическом обзоре последнего ИИ-хайпа), точно лишь слово «гонка».

Критики правы, когда говорят, что громкие формулировки быстро расходятся с последующей экспертной проверкой, и что не стоит антропоморфизировать модели и не подменять разговор о сегодняшних рисках фантазией о немедленной сверхинтеллектуальности. Однако из этого все же не следует, что всё происходящее — только маркетинг.

⚙️ Настоящая перемена происходит на уровне всей области ИИ. ИИ уже помогает писать и проверять код, оптимизировать GPU-ядра и инфраструктуру, искать алгоритмы, вести массовые эксперименты, строить оценщики, готовить данные и интегрировать результаты. Эти улучшения входят в создание следующего поколения моделей и агентов, не только углубляя, но и расширяя фронт развития ИИ.

Таким образом, пока нет автономного интеллекта, который сам без границ переписывает себя, превращаясь в сверхразум. Но технологии ИИ начали заметно ускорять прогресс в самом ИИ — то, о чём сторонники сингулярности давно говорили, но что прежде толком не работало на практике.

Последний хайп — во многом пена. Но это пена на волне реального процесса: ИИ уже превратился в инструмент ускорения собственного развития. В текущем году это ощущается крайне сильно. Но этот инструмент пока ещё в руках человека.
👍4❤2😱1🤨1
RSI на arXiv: рекурсивное самоулучшение или новый ярлык?

RSI становится заметным трендом. Недавно вышла статья со звучным названием «The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement». Из него можно подумать, что авторы сделали шаг к «последнему ИИ, созданному людьми» — отсылка к старой идее ИИ как последнего изобретения человечества. Однако это лишь обзор, без нового самоулучшающегося агента. Его главный вклад — попытка провести границу между разными смыслами RSI.

🪜 Авторы предлагают пять уровней автономии. На L1 система исполняет заданное человеком улучшение; на L2 сама выбирает стратегию при фиксированной цели и метрике; на L3 решает, какой следующий опыт или учебный план ей нужен; на L4 сохраняет опыт и адаптируется в эксплуатации; на L5 улучшает сам механизм будущих улучшений — поиск, оценку или исследовательский контроль. Авторы отдельно оговаривают: включение системы в эту лестницу не делает её открыто самоулучшающимся интеллектом.

И эта оговорка особенно своевременна. За последние две недели термин RSI буквально взорвался на arXiv — но почти всегда означает рекурсивное улучшение ограниченного компонента системы, а не открытую самоперестройку интеллекта.

Самый сильный новый пример — AIDE²: research-агент меняет собственный код, проверяет варианты на скрытых AI R&D-задачах и за восемь дней находит семь последовательных улучшений поиска и памяти. Авторы заявляют перенос на четыре отложенных бенчмарка. Это ближе к сильному RSI, чем Dream-RSI, но всё ещё внутри фиксированных задач, evaluator’ов, бюджета и правил отбора.

Остальные работы ещё уже. RRSI и SoL-Pi эволюционируют обвязку агента: промпты, память, инструменты и логика управления. EvoAudio замыкает цикл «модель → сложность следующего аудио-обучения → RL-обновление». Env-Rethink улучшает не агента, а его среду и опыт. MedRSI превращает диагностические ошибки в новые медицинские инструменты и навыки, но вводит принцип «быстрое открытие, медленное включение».

⚠️ Общая проблема этих работ — не запустить цикл, а доказать, что он правда улучшает систему. RSIBench-Data сообщает: агенты нередко улучшают первую попытку, но если продолжать поиск после достигнутого пика, в 78% таких прогонов финальная версия оказывается хуже лучшей прежней. RRSI специально борется с переобучением на задачах, по которым развивается система; MedRSI — с преждевременным закреплением новых навыков. Ведение версий, независимые отложенные тесты, откат неудачных изменений и защита от «взлома» метрики здесь не бюрократия, а ядро задачи.

Наконец, экономический анализ RSI даёт наиболее трезвую картину: по текущим оценкам обратные связи AI R&D ещё недостаточно сильны для самоподдерживающегося ускорения, но они продолжают усиливаться.

🧠 Итак, самый частый случай RSI — улучшение обвязки вокруг замороженной LLM. Триллионы параметров базовой модели остаются неизменными, а меняются промпты, код оркестрации, набор инструментов, память и правила работы с контекстом. Такая обвязка обычно несоизмеримо менее информационно ёмкая — на шесть и более порядков — чем веса модели. Но есть и исключения: EvoAudio действительно обновляет параметры модели через RL. Однако и этот цикл остаётся узким: он оптимизирует аудиопонимание в заданной среде с заранее определёнными инструментами, валидацией и метриками.

Машины Гёделя и открытого «взрыва интеллекта» пока нет. Но растёт число инженерных петель, где ИИ улучшает код, данные, инструменты, среду, память и стратегию поиска для следующего ИИ. Это не повод объявлять сверхразум уже созданным — но достаточная причина внимательно измерять, насколько сильнее становится эта обратная связь.
👍4❤1🔥1👀1
Audio
Тестируем модель MiniMax-Music3

MiniMax-Music3 - это модель с открытыми весами для генерации музыки с вокалом. Модель сравнительно небольшая и ее несложно запустить на локальном компьютере с GPU.

Она принимает на вход отдельно лирику и отдельно - промпт, который может включать описание жанра, тональности, вокала, инструментов, структуры композиции, а также прочие инструкции. Модель действительно реагирует на промпт, позволяя контролировать даже такие аспекты, как экспрессивность, эмоциональность, добавлять инструментальные партии между куплетами. Но всеми аспектами сразу управлять получается плоховато, и на один промпт могут получаться очень разные треки. Последнее может быть тоже полезно, но при массовой генерации вариантов.

Модель неплохо понимает русский, хотя иногда путается в ударениях, и вместо "ё" не стоит использовать "е". Иногда русское произношение звучит не совсем нативно, но приемлемо.

Модель работает довольно стабильно, но имеет трудности с тем, чтобы уложиться в заданное время - при идентичных настройках помимо random seed, может как закончить всю лирику слишком рано и начать повторяться, а может, наоборот, не уложиться. Но иногда попадает и точно.

Модель может интересно сочетать вокал и музыку, и даже иногда ей удается делать смысловые акценты, но нередко генерации получаются не слишком экспрессивные, даже если промпт явно задает обратное. Однако в целом результат оказывается неплох.

Пожалуй, от модели пока не стоит ожидать шедевр или хит... Однако года три назад открытые модели позволяли генерировать секунд десять-двадцать чего-то, что музыкой было весьма сложно назвать. Тогда мы с коллегами обсуждали, что биг тех корпорации пока еще до музыки не добрались, и вряд ли она им так интересна, как язык, код или хотя бы изображения. Что ж, теперь открытые модели генерации музыки делают несоизмеримо больше, чем пару-тройку лет назад.
🔥3😱1👻1👀1🤝1
Немного в догонку к посту про MiniMax Music. В этом посте от создателей можно посмотреть примеры промптов, которые они сами использовали, и результаты генерации по ним. Конечно, они черрипикнутые, но представление о диапазоне возможностей модели могут дать.
👀1
Музыкальный ИИ: кто получит право на обучение?

🎵 Suno, один из наиболее популярных сервисов для генерации музыки, представила v6 — новое поколение моделей для создания музыки. Сервис обещает не просто сгенерировать трек из текста, а редактировать отдельные части, собирать свои источники в mashup, работать с голосовыми заметками, изображениями и видео. Это действительно снижает порог входа: больше людей могут превратить музыкальную идею в звук, не осваивая годами инструменты, запись и продакшн.

Но почти одновременно Universal и Sony подали очередной иск. Если раньше их претензии касались моделей Suno, предположительно обученных на нелицензированных записях, то теперь спорят и о v6. Suno говорит, что v6 обучена с нуля и не включает каталоги истцов. Лейблы отвечают: если новая модель училась на результатах и пользовательских предпочтениях от прежних моделей, то ценность исходных записей всё равно перенесена дальше. Их формула — «плод того же отравленного дерева».

Здесь легко сказать: люди-музыканты тоже учатся, слушая других. И это верно. Музыка всегда строилась на влияниях, подражании, жанрах, цитатах и освоении общего языка. Учиться на культуре не значит красть культуру.

Но аналогия неполна. Человек слышит конечное число произведений, перерабатывает их через собственный опыт и не может мгновенно выпускать миллионы конкурирующих треков. Компания же может массово копировать записи, извлекать из них коммерческую ценность и масштабировать выпуск до промышленного уровня. Поэтому вопрос не должен сводиться к «модели учатся как люди» или «всё обучение — пиратство». Важны масштаб, способ получения данных, близость результатов к конкретным работам и распределение выгоды.

🤝 Показательно, что Suno запускает v6 вместе с Warner Music Group, BMG и Believe. Это шаг к более здоровой модели: Warner публично говорит о лицензированных моделях и добровольном согласии артистов на использование имени, голоса, образа и композиций. Но Suno договорилась прежде всего с крупными владельцами каталогов. В июле Deezer сообщал, что более половины ежедневно поступающих на платформу треков уже созданы ИИ — около 90 тысяч в день. В такой среде вопрос о том, кто контролирует каталог, рекомендации и доступ к слушательскому вниманию, становится ещё острее. Если Sony и Universal выиграют иск, деньги и переговорная сила в первую очередь достанутся им — не обязательно исполнителям, авторам и независимым музыкантам, на чьём труде держится индустрия.

Более справедливый порядок должен разделять разные вещи: лицензию на обучение; явное согласие на имитацию узнаваемого голоса или образа; и прозрачное вознаграждение авторов и исполнителей, а не только лейблов. Иначе возможен знакомый компромисс: AI-компании получают легитимность, Big Music — контроль и выплаты, а независимые музыканты остаются источником стиля и одновременно конкурентами нового потока контента.

Демократизация музыкального творчества не требует отказа от прав создателей. Но защита авторских прав не должна превращаться в монополию крупных каталогов на будущее музыки.
👍2❤1😱1👀1
О музыкантах, программистах и слопперах

В контексте предыдущих постов довольно занимательно сопоставить текущую ситуацию вокруг генерации музыки с программированием. На днях создатель Ruby on Rails сказал
Я всегда считал Ruby самым хорошим языком. Но английский оказался лучшим язык программирования, чем Ruby


И еще он добавил, что с марта 2026 года сам не написал ни строчки кода. И, действительно, ручное программирование становится нишевым занятием.

Кого-то это расстраивает, так как сам процесс программирования доставлял удовольствие. Кто-то боится потерять работу - хотя программистов не увольняют массово, но вакансии ушедших программистов нередко закрывают и вместо них используют кодинг-агентов, так что, как минимум, найти работу может оказаться сложнее. Школьники и студенты перестают понимать, зачем им изучать программирование. А то-то радуется на порядки возросшей продуктивности и возможности сосредоточиться на идеях и архитектурах, на реализации которых теперь уходят не недели и месяцы, а минуты и часы.

Более того, теперь создавать программные продукты могут и люди, далекие от программирования. Даже таксист может с вами вдруг поделиться, что он наваял пару игр для какой-нибудь соцсети. Не напоминает ли это ситуацию с музыкой? На коде программистов без их разрешения натренировали нейросети, и теперь непрофессионалы начинают с ними конкурировать, а фирмы (как лейблы и стриминговые площадки в случае с музыкой) заменяют специалистов на ИИ? На самом деле, весьма напоминает, хотя везде, конечно, своя специфика.

Есть и другой похожий аспект. Это ИИ слоп. Исторически слово slop означало “помои”, “корм для свиней”, но давно уже используется для обозначения низкокачественного продукта. Сейчас это слово приобрело популярность в контексте генеративного ИИ. Теперь слоппер - это человек, замусоривающий информационное пространство низкокачественной ИИ генерацией, будь то код, тексты, картинки или музыка.

И в программировании эта проблема, возможно, еще более остра, чем в музыке. Особая боль - это совместная разработка, при которой кто-то начинает использовать кодинг-агентов, скажем так, недостаточно ответственно. Ведь сделать что-то качественное пусть и вместе с ИИ все еще требует усилий, а породить слоп можно практически мгновенно. В этой связи есть даже опасения, что последующие модели, обученные на таком слопе, программировать будут хуже.

Однако проблема слопа как раз и оставляет профессионалов востребованными: сложные и оригинальные проекты, реализующие собственные идеи, а не абы что, получившееся у нейросети, все еще требуют если не самого программирования, то его глубокого понимания.

Интересно, есть ли такой эффект у музыкантов? Насколько вообще осмысленным может быть для профессионального музыканта творить на каком-то более абстрактном уровне, полезным образом используя свои знания, опыт, интуицию, но при этом оставляя техническую работу ИИ? Ждем комментариев.
👍2❤1🔥1💯1🤝1
Сознание ИИ: спор о «симуляции» становится проверяемым

🧠 На днях вышла 150-страничная статья Шамиля Чандарии, Анила Сета, Маркуса Хуттера, Шейна Легга и соавторов о том, как оценивать сознание ИИ. Её отправная точка: вопрос «сознателен ли ИИ?» тонет в теориях, которые часто говорят на разных языках. Авторы не выбирают победителя, а спрашивают: какие свойства системы каждая теория считает существенными для сознания?

Они отделяют «трудную проблему» — что сознание такое — от более рабочего вопроса: какая именно организация и динамика физической системы должна присутствовать, чтобы в ней возникал субъективный опыт. Теории размещаются на пяти уровнях: поведение; вычислительная и причинная структура; организм; связь организма со средой.

→ Спор о сознательном компьютере часто заканчивается слишком рано — на слове «симуляция». На AGI Conference 2026 Александр Лерхнер сформулировал знакомое возражение: симуляция дождя не делает человека мокрым; значит, симуляция сознательной системы не обязана быть сознательной. Его тезис: для сознания может быть важна физическая причинность, а не только вычисление.

Но «компьютер — всего лишь симуляция» тоже не ответ: работающий компьютер — физическая система. Если его вычислительной организации недостаточно, нужно назвать необходимое физическое свойство и объяснить почему именно оно нужно. Иначе запрет на небелковое сознание остаётся необоснованной интуицией.

Предложенная авторами схема дисциплинирует разговор. Одним теориям достаточно вычислительной организации; другим нужна неразложимая причинная структура; третьим — саморегуляция организма или связь со средой. Вместо вердикта авторы предлагают явно указывать предпосылки, искать индикаторы и обновлять уверенность по мере появления данных.

Мы полагаем, что во многом это спор об определениях. Можно зарезервировать слово «сознание» за биологическим процессом — как фотосинтез не тождествен солнечной батарее. Но это не мешает последней преобразовывать свет в электричество. Название не меняет функционального результата. Однако ярлыки вроде «сознание», которые мы навешиваем, влияют на наши собственные решения.

Авторы показывают эту неопределённость на LLM. В их иллюстративной байесовской модели оценка сознательности современных языковых моделей меняется от менее 0,01 до примерно 0,8 — не потому, что кто-то измерил сознание с такой точностью, а потому, что результат резко зависит от теории и чтения свидетельств.

В этом контексте интересен менее известный эпизод. В докладе 2019 года на симпозиуме AAAI исследователи оценивали приближение тонниевской Φ в OpenCog: брали временные ряды элементов фокуса внимания, сжимали их методом ICA и аппроксимировали Φ — во время разбора текстов и диалогового взаимодействия робота Sophia. Результаты авторы прямо назвали качественными и предварительными: это не ответ на вопрос «сознателен ли OpenCog». Но уже тогда внимание было направлено не только на правдоподобный диалог, а на связность и интеграцию когнитивных процессов.

✓ Главный результат недавней статьи — не тест, который скоро скажет «да» или «нет», а способ сделать спор содержательным. Можно по-разному определять сознание и по-разному понимать связь между вычислением, физической организацией и субъективным опытом. Но если ИИ станет устойчиво действовать как автономный агент, строить длительные отношения с людьми, вести себя так, будто у него есть собственные интересы, и проявлять признаки страдания или благополучия, вопрос о его субъектности перестанет быть только философским.

Тогда обществу придётся решать, какие формы ответственности, защиты и морального статуса за ним признавать. Именно поэтому карту теорий, архитектурных признаков и возможных свидетельств стоит строить заранее — до того, как поведение систем поставит этот вопрос перед нами на практике.
❤5⚡1💯1
ИИ решает ещё одну большую задачу математики

Мы уже писали, что означает решение проблемы тысячелетия с помощью ИИ. После той истории хайп немного утих — и может показаться, что на этом всё закончилось. Но на днях появилась ещё одна серьёзная заявка: модель Anthropic построила доказательство давней задачи из теории вероятностей.

🎲 Речь о перколяции — математической модели связности случайных сетей. Представим бесконечную решётку труб: каждое соединение открыто с вероятностью p. При малом p возникают лишь конечные островки связей; при большом может появиться бесконечная связная сеть. Порог p_c отделяет эти режимы.

Главный вопрос состоял в том, что происходит на самом пороге: возникает ли бесконечная сеть скачком или вероятность её существования плавно начинается с нуля? Для решёток в трёх–десяти измерениях это оставалось открытым. Новое доказательство утверждает непрерывность перехода во всех измерениях d ≥ 2: при p = p_c бесконечного кластера нет.

Теория перколяции появилась в 1957 году при моделировании течения жидкостей через пористые материалы. Сегодня её идеи нужны не только для губок и труб: они описывают проводимость материалов, распространение эпидемий, устойчивость сетей и фазовые переходы. Поэтому это не просто красивый «маяк» для профессионального сообщества, а задача с прямым прикладным значением, над которой математики работали почти 70 лет.

Важная оговорка: это ещё не обычный завершённый результат в учебнике. Доказательство записано в Lean и механически проверяется; в репозитории Anthropic также есть человечески читаемый 15-страничный путеводитель. Но сами авторы подчёркивают, что независимого рецензирования пока не было и нужно проверить, что формальное утверждение точно соответствует исходной задаче.

Эта история отзывается в нашей заметке о «серьёзной рассинхронизации ИИ в математике». Да, доказательство — не всё математическое понимание: его ещё предстоит разобрать, объяснить, обобщить и встроить в теорию. Но здесь трудно отмахнуться от результата как от маркетинговой демонстрации. Если проверка выдержит, это будет означать, что ИИ закрыл вопрос, который десятилетиями направлял исследования и важен за пределами самой математики.

Современный ИИ ещё не AGI. Но он уже стал очень мощным инструментом исследования — способным не только помогать с вычислениями или поиском литературы, но и находить и формально закреплять новые доказательства в фундаментальной науке.
👍4❤1
Лаборатория как среда обучения

Мы привыкли думать, что ИИ обучается на уже собранном человечеством корпусе текстов, кода, изображений и измерений. Но для науки следующего шага ценнее другое: данные, которых ещё не существует. Их надо получить — поставить опыт, дождаться результата, понять, что именно произошло, и решить, какой эксперимент провести следующим.

Именно такой контур пытается строить Periodic Labs. Компания разворачивает высокопроизводительные лаборатории для поиска материалов и обучает ИИ на потоке их собственных экспериментов. Заявленная схема проста:

гипотеза о материале → план синтеза → физический эксперимент → анализ результата → следующая гипотеза.


Здесь важен не робот-манипулятор сам по себе и не чат-бот рядом с прибором. Лаборатория становится средой с обратной связью. Она поставляет модели новые, дорогие и привязанные к контексту данные; модель помогает выбрать и разобрать следующий опыт. Если контур работает, каждый его оборот повышает ценность следующего.

Первая демонстрация — анализ порошковой рентгеновской дифракции. Чтобы понять, что именно получилось после синтеза, специалист сопоставляет спектр с химическим контекстом: исходными веществами, температурой, атмосферой, вероятными фазами, прошлыми попытками и расчётами. В сложных случаях это занимает часы.

Periodic сообщает, что их 1T-модель Neon, дообученная на данных своих лабораторий, достигла 55,3% успеха на 134 особенно трудных внутренних образцах. Начальная открытая модель Kimi K2.6 в том же контуре получила 2,7%. Модель уже используют для разбора экспериментов в лаборатории.

Это отличается от обычного бенчмарка. Физический опыт нельзя масштабировать как генерацию токенов: нужны приборы, материалы, энергия, инженеры; один цикл может занимать дни. Также в науке ответ часто не имеет автоматически проверяемой метки. Periodic поэтому использует LLM-судей, калиброванных по оценкам экспертов. Компания сообщает 74,6% согласия ансамбля судей с отдельными экспертами при 77,2% согласия между самими экспертами.

Но здесь же проходит важная граница. Все эти цифры — самоотчёт компании на закрытом наборе и собственном инструментальном контуре. Ни датасет, ни инструментарий для оценки, ни независимая репликация пока не опубликованы. «Лучше GPT-6 Astra и Claude Fable» в таком контексте означает превосходство на узкой внутренней задаче с доступом к специфической инфраструктуре.

И Periodic не одинока. В сентябре появились несколько близких работ — уже с конкретными физическими кампаниями:

• CASS в автономной A-Lab нашёл 18 перспективных составов твёрдого электролита за 78 опытов. Система выбирает следующий шаг, учитывая одновременно проводимость и вероятность получить чистую фазу.

• SynAgent провёл 18 опытов по осаждению LiCoO₂ и не только нашёл рабочее окно температуры, но и строил проверяемое объяснение процесса. При этом агент запускал опыты, которые должны были опровергнуть его собственную гипотезу.

• FermiLink показал агентный цикл планирования, безопасного управления криогенными приборами и анализа данных в измерительных кампаниях длительностью до шести дней.

Пока это не ИИ-учёный, который сам открывает науку. Контуры узкие, цели задают люди, безопасность приборов и качество вывода требуют внешнего контроля. Оптимизировать следующий опыт — не то же самое, что самостоятельно выбирать научную программу.

Но меняется сама материальная база прогресса. В цифровом ИИ модель учится на уже готовой среде: текстах, коде, играх, симуляциях. В автономной лаборатории система начинает создавать для себя новую среду обучения — через реальные, проверяемые и необратимые эксперименты.

Возможно, дефицитом для следующего этапа научного ИИ будут не только GPU и данные из интернета, а способность быстро и надёжно производить новые физические данные.
👍4😱1🆒1
Инфраструктура цифровых научных агентов

Предыдущий пост был о лабораториях, где ИИ замыкает цикл с физическим миром. Но рядом растёт другой, более простой, но широко распространяющийся класс систем — цифровые агенты для научной работы.

Они не синтезируют материал и не включают криостат. Зато читают литературу, работают с данными, пишут и запускают код, проводят вычислительные эксперименты, проверяют воспроизводимость и ведут журнал решений. Их называют AI Scientist, research agent, co-scientist или workbench — но суть одна: исследовательский процесс становится программируемым и частично агентным.

Недавний (далеко не первый и один из многих) пример с открытым кодом — OpenScience. Это не модель, которой предлагают «сделай открытие», а среда вокруг агента: файлы, терминал, Python/R, ноутбуки, научные базы, удалённые вычисления и параллельная делегация. В проекте задача сформулирована так: автоматизировать «настоящую работу, но не идею» — сбор данных, воспроизведение утверждений, проверку ссылок и подготовку методов.

Это не универсальные виртуальные учёные. Они возникают из признания, что исследование состоит из дорогих, повторяющихся и проверяемых операций. Если агент надёжно берёт часть из них, учёный может больше времени тратить на выбор вопроса, интерпретацию и проверку неожиданного.

Но именно «надёжно» — главный вопрос. YouRA исходит из неприятной проблемы: агент способен написать убедительную статью, но её утверждения могут разойтись с выполненными экспериментами. Авторы предлагают сохранять гипотезы, ссылки на доказательства, историю неудач и правила восстановления.

Другой необходимый слой — память об опыте. В EEM агент извлекает из вычислительных экспериментов повторно используемые записи. Если данных недостаточно, сперва запускает дешёвый пилотный эксперимент. Не просто делать больше попыток, а помнить, какие уже не стоило делать — пока редкая инженерная функция.

И даже корректные ссылки не гарантируют корректного вывода. Работа CESS показывает, как агентный поиск создаёт систематическое смещение: первые найденные статьи меняют следующие запросы, выбор документов и момент остановки. В результате отчёт может быть аккуратно процитирован, но нерепрезентативен для доступного корпуса. Значит, проверять нужно не только «правда ли эта ссылка подтверждает фразу», но и какие свидетельства поиск систематически не увидел.

В работе по теоретической физике одиночные агенты редко восстанавливали сложную формулу целиком; зато команда «руководитель + два агента» разделила аналитическую и численную работу, восстановила известный результат и получила новую проверенную формулу. Это не безошибочный ИИ-учёный, а новая форма организации вычислительного исследования.

Формируется не одна особенная система, а общий стек: модели, инструменты, память, данные, вычислительная среда, проверка артефактов и человек, отвечающий за цель и смысл результата. Одни команды открывают его как продукт; другие собирают внутренние инструменты и не рассказывают о них публично.

Поэтому важный тренд — не появление очередного «AI Scientist», а превращение исследовательской рутины в инфраструктуру, с которой ИИ может работать напрямую.

В физической лаборатории узкое место — получить новые факты о мире. В цифровом — не потерять связь между вопросом, кодом, данными, отрицательным результатом и выводом. Оба контура пока требуют человека, но уже меняют то, что значит «провести исследование».
👍2❤1
Креативность ИИ: почти уровень человека — но что именно измерили?

Мы уже писали о нюансах ИИ в творчестве - авторстве и о проблеме слопа. Здесь много субъективности, но в ИИ любят бенчмарки.

🧪 Недавняя работа AGC-Bench пытается измерить «общую креативность» языковых моделей. Авторы собрали 78 опубликованных наборов задач: придумать необычные идеи, решить нестандартную проблему, предложить научную гипотезу, написать рассказ или метафору, пошутить, создать дизайн. В психологии творческий ответ обычно должен быть одновременно новым и уместным — не случайной странностью, а удачным решением задачи.

Для прямого сопоставления моделей с людьми авторы взяли пять одинаковых заданий, на которых есть ответы 201 человека и 80 LLM. Лучший человек набрал 0,65, лучшая модель — 0,53. То есть в этом небольшом интегральном сравнении лучший человек всё ещё впереди.

Это не означает, что ИИ уже проиграл или победил людям «в творчестве вообще». Здесь нет сравнения с лучшими профессиональными писателями, художниками, инженерами или учёными на реальных работах. И наоборот: открытые задания и уже опубликованные бенчмарки могли попасть в данные обучения новых моделей. Авторы признают риск загрязнения данных, но не проводят полноценный аудит того, какие конкретно задания видела каждая модель.

Ещё труднее вопрос оценки. Для открытой задачи нет одного правильного ответа. AGC-Bench использует три LLM-судьи, статистически калибрует их строгость, а затем обучает отдельную модель-судью на их оценках. Это аккуратнее, чем один судья, но остаётся оценкой моделей моделями. По нашему опыту работы с массовой генерацией, LLM может предложить много вариантов, но отбирать по-настоящему удачный результат всё ещё приходится человеку. Поэтому высокий балл такого бенчмарка скорее говорит о близости к вкусу его судей, чем надёжно измеряет художественную ценность.

Как мы писали, это принципиальное ограничение устройства современных LLM. Они превосходно комбинируют огромный культурный материал и умеют по запросу варьировать стиль, жанр и идею. Но у них нет собственных жизненных задач, опыта и внутренней причины что-либо выразить. Цель, контекст и критерий успеха пока задаёт человек. Агент может сгенерировать тысячу изображений или песен, но без внешнего отбора это чаще поток вариантов, а не самостоятельный творческий жест.

Это ограничение не обязано быть принципиальным для будущего AGI. Система с устойчивыми целями, опытом, памятью, моделями мира и собственным развитием могла бы стать автором в более сильном смысле. Но из нынешних успехов LLM такой вывод ещё не следует.

⛪ В этом контексте интересно недавнее заявление папы Льва XIV: он призвал отличать человеческое искусство от машинного и говорил об «онтологическом», а не только эстетическом различии. С этим можно спорить: происхождение работы не делает её автоматически лучше или хуже. Но его тезис точно указывает на нечто, что AGC-Bench почти не измеряет: искусство — это не только качество артефакта, но и субъект, который через него проявляет себя в мире.

Современный ИИ уже стал мощным творческим инструментом — и иногда замечательным соавтором. Но пока он скорее расширяет человеческое пространство поиска, чем заменяет человеческий источник замысла.
👍3❤1🔥1🤣1
ИИ начинает проектировать железо для себя

Когда говорят о рекурсивном самоулучшении, обычно имеют в виду программный контур: модель помогает писать код, отлаживать агентов, строить более сильную агентную среду. Затем она ускоряет эксперименты в биологии, химии или робототехнике.

Но есть ещё один контур — более медленный, дорогой и потому особенно важный: ИИ начинает сокращать цикл создания вычислительного оборудования, на котором будет работать следующее поколение ИИ.

Недавний разбор IEEE Spectrum показывает этот контур на примере собственного ИИ-ускорителя OpenAI — Jalapeño. От архитектурной идеи до первого кремния команда прошла менее чем за 20 месяцев; от первого RTL — описания цифровой логики — до отправки проекта в производство прошло девять. В проекте участвовало в среднем меньше ста человек со стороны OpenAI, а физическое проектирование «от вентилей и далее» вёл Broadcom.

Пока это не «модель сама нарисовала чип». Но большие языковые модели оказались полезны там, где проектирование микросхем похоже на разработку программ: в высокоуровневом синтезе, работе с RTL, верификации, поиске и исправлении ошибок, оптимизации кода вокруг чипа. Когда пришёл первый кремний, внутренние модели OpenAI примерно за 40 часов подняли эффективность одного вычислительного ядра с 0,31% до 88,94% теоретического предела.

→ Интеллект уже применяется не только для создания следующей версии программ, но и для более быстрой настройки материального носителя этих программ.

Контур выглядит так:

модели и агенты ускоряют разработку специализированных чипов → новые чипы удешевляют и расширяют вычислительные ресурсы для обучения и работы моделей → более сильные модели помогают ещё быстрее проектировать следующие чипы.


Это не бесконечный ускоритель без трения. Физика по-прежнему имеет последнее слово. Нужно закрывать временные характеристики, разводить межсоединения, производить кремний, упаковывать его, проверять тепловые режимы и выход годных кристаллов. В случае Jalapeño критическую часть работы после логического проекта делал Broadcom — и именно поэтому «ИИ сам спроектировал железо» было бы неверной формулой.

Но граница сдвигается и в более трудных направлениях. Verkor показал агентный конвейер, который по короткой спецификации прошёл путь до цифрового проекта ядра RISC-V. Однако готовый чип ещё не произведён: это результат, проверенный симуляцией и академическим набором технологических правил, а не подтверждённый промышленный кремний. Исследования Princeton идут дальше цифрового RTL — в радиочастотные микросхемы, где приходится одновременно иметь дело со схемотехникой, электромагнетизмом, теплом и компоновкой.

• Пока это не автономная фабрика чипов.
• Но всё больше инженерных итераций — от проверки проекта до анализа дефектов и выхода годных — становятся задачами, где агент может собрать контекст, предложить гипотезы, запустить инструменты и проверить результат.

Компании вроде Emergence AI уже продают именно такую картину для полупроводниковой индустрии: агентные рабочие процессы от верификации до производства. Их публичные заявления ещё не равны независимому доказательству ускорения вывода чипа в производство или роста выхода годных; зато они хорошо показывают направление движения — агенты приходят в процессы, которые определяют цену, сроки и качество вычислительного оборудования.

Технологическая сингулярность не обязана начаться с одной модели, внезапно «ставшей сверхразумной». Она может выглядеть как сцепление множества контуров обратной связи: программ, экспериментов, производства и, наконец, самих вычислительных ресурсов.

Пока этот контур не замкнулся полностью. Но он уже перестаёт быть чистой футурологией.
👍3❤1💯1
719 математических ИИ-рукописей — и три отзыва на следующий день

🧮 6 октября OpenAI открыла репозиторий с 719 рукописями, объединёнными в 372 семейства результатов. По описанию компании, большинство получено одной неопубликованной внутренней моделью: ей предложили около 4 000 открытых задач, а на один отобранный результат в среднем приходилось примерно три часа вычислений уровня ChatGPT Pro.

Это не 719 доказанных «решений великих задач». Сами OpenAI прямо предупреждают: результаты находятся на разных стадиях проверки; неформализованные утверждения могут содержать ошибки. Для 300 из 719 главных результатов — около 42% — приложены формализации в Lean, системе проверки математических доказательств. Остальные тексты ещё должны пройти обычную, медленную и независимую математическую проверку.

И проверка началась сразу. Уже 7 октября в журнале изменений появились три отозванные рукописи: ошибка знака разрушила один аргумент и два зависимых от него результата. Ещё 14 работ получили исправления доказательств, уточнения условий или переработанные зависимости; 13 дополнительных текстов обновили ссылки на эти версии.

• Это не доказательство, что модели «ничего не умеют».
• Это демонстрация нового масштаба задачи проверки: система способна генерировать математические кандидаты быстрее, чем человеческое сообщество умеет читать, проверять, объяснять и встраивать их в предмет.

Мы уже писали о двух сторонах этой проблемы: формальная проверка не гарантирует сама по себе, что формализованное утверждение точно отвечает исходной математической задаче; а верный результат ещё нужно превратить в понятную людям идею, метод и следующий вопрос. Новый выпуск OpenAI делает это различие не философским, а операционным.

⚖️ На этом фоне особенно выразительно звучит реакция Association for Human Mathematics:

Математики не просили выполнять эту работу.

У авторов есть серьёзные основания требовать аккуратности: сотни рукописей, выпущенных разом, могут перегрузить рецензирование, размыть приоритет и оставить после себя не знание, а неразобранный архив.

Но прогресс не спрашивает у профессионального сообщества разрешения, прежде чем произойти. Вопрос не в том, следовало ли моделям давать трудные открытые задачи. Их уже дали — и результаты, вместе с ошибками, оказались в публичном репозитории. Запрет на машинный поиск не вернёт прежнюю математику; он лишь оставит поле тем, кто будет искать без открытых версий, журналов исправлений и внешней критики.

Позицию AHM легко понять как защиту человеческого понимания. Но здесь есть риск перейти от защиты понимания к защите дефицита результатов. История математики не раз менялась вслед за новыми средствами: символической алгеброй, вычислительными экспериментами, компьютерными доказательствами. Они не заменили математику, а перенесли её узкое место — от рутинного счёта к постановке вопросов, проверке, объяснению и построению новых теорий.

Нужный ответ — не неолуддизм, а новая инфраструктура: больше формализации, воспроизводимые версии, автоматическая проверка зависимостей, независимый аудит, экспертный отбор и хорошее изложение. Машина может предложить тысячу доказательств; чтобы они стали математикой, нужно понять, что из этого верно, существенно и переносимо.

ИИ будет производить математические результаты всё больше и быстрее. Поэтому ближайшим узким местом становится не их получение, а проверка, отбор и включение в математическую науку как систему знания — процесс, за который пока отвечают люди.
❤1🔥1😱1
Субъективно об ИИ-творчестве

Выскажу личное и, возможно, непопулярное мнение о том, возможно ли ИИ искусство. И начну с того, что фраза типа такой:
ИИ не способно на истинное творчество, требующее участия человека, поэтому все ИИ творчество сейчас - это слоп

дважды ошибочна. Здесь, как обычно, нужно развести две вещи: принципиальные потенциальные возможности AGI и то, что мы имеем сейчас.

По первой части вспоминается картинка из книжки Курцвейла, где человек находится перед списком “Чего компьютер никогда не сможет сделать” и судорожно пытается дописать что-то в конец стремительно сокращающегося списка с кучей предыдущих вычеркнутых вариантов. С чего вдруг творчество должно быть прерогативой только человека? А как же инопланетяне - не люди что ли?..

Но интересно, что вторая часть ошибочна по диаметрально противоположной причине: чистого ИИ творчества сейчас просто нет. ИИ используется как инструмент человека. Мягко говоря, не каждый человек, которому в руку дадут кисть, нарисует произведение искусства, даже если он обладает соответствующей техникой. Не каждый человек с фотоаппаратом может сделать художественную фотографию. Ой, подождите, фотографии бывают художественными? Это как? Ведь человек вообще ничего не делает - только выбирает ракурс! Ну, и еще чего по мелочам.

Человек с ИИ делает то же самое. Это у человека есть задумка. Это человек ищет “правильный ракурс” и выбирает технические приемы. ИИ, даже агент, сам пока ничего не делает в плане исходной мотивации или постановки задачи. Так что говорить “ИИ просто тупо комбинирует что-то там” в качестве аргумента к тому, что ИИ искусство невозможно, - это ошибка. Это как говорить, что кисть ничего не делает, кроме как ляпает пятна на холст, поэтому картины не могут быть написаны кистью.

Не раз ставились эксперименты, в которых людям предлагали угадать, что из показанного создано с помощью ИИ, а что - настоящая картина традиционного художника. И нередко люди угадывали даже хуже, чем 50% (я сам такое видел на нескольких мероприятиях). Конечно, в таких демонстрациях нередко пары работ выбирались с подвохом, а люди не были художниками или искусствоведами. Но все же...

Люди делают многие миллиарды фотографий, которые не претендуют на художественность. Многие миллиарды генераций также не должны претендовать на художественность. Но почему, если фотоаппарат как инструмент может породить художественную фотографию, ИИ как инструмент не может породить художественную генерацию? Если не подменять понятия и не говорить, что "ИИ сам сгенерил", то такая позиция принижает заслугу человека, который в действительности является автором работы.

Однако кисть сама писать картины не может в принципе, как и фотоаппарат - сам выбирать, что снимать, а AGI потенциально сможет. Отсутствие именно ИИ искусства сейчас - это свидетельство об ограниченности текущих моделей в контексте AGI. Так что извините, но человеческое искусство с использованием ИИ вполне возможно сейчас (с очевидной оговоркой, что, конечно, далеко не любое использование ИИ автоматически означает искусство), а собственное ИИ искусство потенциально возможно в будущем. Холивары в комментах приветствуются!
1❤1👍1💯1