Forwarded from ARI DERK
GPT-5.6 Sol Ultra доказала 50-летнюю гипотезу о двойном покрытии циклами
Это одна из самых давних открытых проблем теории графов, сформулированная Дьердем Секерешем в 1973 году
В ней утверждается, что для любого графа без мостов найдется набор циклов, такой что каждое ребро графа входит ровно в два из этих циклов
Гипотеза, на самом деле, очень важная, потому что связана, в том числе, с теорией нигде-не-нулевых потоков – центральной темой структурной теории графов
Двойное покрытие пытались доказать много раз, но ни одна из попыток так и не была признана как окончательное решение
А пару часов назад сотрудник OpenAI заявил, что новая модель GPT-5.6 Sol сгенерировала доказательство этой гипотезы всего за час, используя 64 субагента!
Доказательство выложили, но оно пока не подтверждено математическим сообществом, идут обсуждения
Если его верифицируют, это будет одно из крупнейших и самых значимых AML-доказательств на данный момент
Это одна из самых давних открытых проблем теории графов, сформулированная Дьердем Секерешем в 1973 году
В ней утверждается, что для любого графа без мостов найдется набор циклов, такой что каждое ребро графа входит ровно в два из этих циклов
Гипотеза, на самом деле, очень важная, потому что связана, в том числе, с теорией нигде-не-нулевых потоков – центральной темой структурной теории графов
Двойное покрытие пытались доказать много раз, но ни одна из попыток так и не была признана как окончательное решение
А пару часов назад сотрудник OpenAI заявил, что новая модель GPT-5.6 Sol сгенерировала доказательство этой гипотезы всего за час, используя 64 субагента!
Доказательство выложили, но оно пока не подтверждено математическим сообществом, идут обсуждения
Если его верифицируют, это будет одно из крупнейших и самых значимых AML-доказательств на данный момент
X (formerly Twitter)
Ethan Knight (@__eknight__) on X
Yesterday, we made GPT-5.6 Sol Ultra generally available. Today, we're sharing that it produced a proof of the 50-year-old Cycle Double Cover Conjecture using 64 subagents in just under one hour. We're sharing the prompt and proof below. We're excited to…
Forwarded from ARI DERK
Чистая логика часто рассматривается как главный ключ к пониманию физической реальности. Математическая физика кажется удобным и простым путём что-то изучить и мы даже тут часто обращаемся именно к математическому поиску
Но в 1931 году 25-летний учёный математически доказал парадокс - даже совершенные логические системы содержат недоказуемые истины
В начале XX века, математики считали, что если им удастся сформулировать правильные основополагающие аксиомы, то каждое истинное утверждение можно будет логически доказать, не прибегая к изучению физического мира
Этим 25-летним человеком, который подпортил математику, был Курт Гёдель, и его теоремы о неполноте навсегда положили конец этим усилиям
Его первая теорема доказала, что любая непротиворечивая формальная система, способная к выполнению основных арифметических операций, неизбежно будет содержать истинные утверждения, которые нельзя доказать внутри самой системы
Его вторая теорема нанесла ещё более сильный удар - непротиворечивая система не может даже доказать свою собственную непротиворечивость, используя свои собственные правила
Гёдель продемонстрировал, что логика не является самодостаточным механизмом для генерации абсолютной истины
Если оставаться исключительно в жестких рамках формальной математической системы, рано или поздно столкнешься с препятствием, где утверждение, несомненно, истинно, но его нельзя логически вывести, используя только аксиомы системы
Для его проверки необходимо выйти за пределы системы и принять более широкую, внешнюю структуру
Это ограничение разрушает идею о том, что мы можем вывести физическую реальность, опираясь лишь на априорную логику
Если чистая математика не может гарантировать даже свою внутреннюю непротиворечивость без внешней помощи, она, безусловно, не сможет отобразить сложности физической вселенной без внешнего ориентира
Физики могут создавать бесчисленное множество прекрасных, совершенно непротиворечивых логических моделей — таких как одиннадцатимерные теории струн или гипотетические мультивселенные, - но одной лишь логики недостаточно, чтобы определить, какая из этих моделей действительно соответствует Вселенной
Во многом это портит и все надежды на голый AML в научном поиске
А ещё перечёркивает поиски теорий на голой математике, которые очень активно любят предлагать любители науки
Такая теория - первый шаг
Но в 1931 году 25-летний учёный математически доказал парадокс - даже совершенные логические системы содержат недоказуемые истины
В начале XX века, математики считали, что если им удастся сформулировать правильные основополагающие аксиомы, то каждое истинное утверждение можно будет логически доказать, не прибегая к изучению физического мира
Этим 25-летним человеком, который подпортил математику, был Курт Гёдель, и его теоремы о неполноте навсегда положили конец этим усилиям
Его первая теорема доказала, что любая непротиворечивая формальная система, способная к выполнению основных арифметических операций, неизбежно будет содержать истинные утверждения, которые нельзя доказать внутри самой системы
Его вторая теорема нанесла ещё более сильный удар - непротиворечивая система не может даже доказать свою собственную непротиворечивость, используя свои собственные правила
Гёдель продемонстрировал, что логика не является самодостаточным механизмом для генерации абсолютной истины
Если оставаться исключительно в жестких рамках формальной математической системы, рано или поздно столкнешься с препятствием, где утверждение, несомненно, истинно, но его нельзя логически вывести, используя только аксиомы системы
Для его проверки необходимо выйти за пределы системы и принять более широкую, внешнюю структуру
Это ограничение разрушает идею о том, что мы можем вывести физическую реальность, опираясь лишь на априорную логику
Если чистая математика не может гарантировать даже свою внутреннюю непротиворечивость без внешней помощи, она, безусловно, не сможет отобразить сложности физической вселенной без внешнего ориентира
Физики могут создавать бесчисленное множество прекрасных, совершенно непротиворечивых логических моделей — таких как одиннадцатимерные теории струн или гипотетические мультивселенные, - но одной лишь логики недостаточно, чтобы определить, какая из этих моделей действительно соответствует Вселенной
Во многом это портит и все надежды на голый AML в научном поиске
А ещё перечёркивает поиски теорий на голой математике, которые очень активно любят предлагать любители науки
Такая теория - первый шаг
История началась в IX столетии в Хорезме на территории современного Узбекистана, где математик Аль-Хорезми заложил основы науки о решении уравнений — алгебры
Ее название происходит от арабского термина «аль-джабр», означавшего перенос члена уравнения из левой части в правую с изменением знака.
Аль-Хорезми еще не использовал формул и записывал уравнения словами
Неизвестную величину он называл «шей», по-арабски — «вещь»
Например: три «вещи» составляют 15, значит, «вещь» равна пяти
В XII веке книга Аль-Хорезми попала в Испанию, где неизвестное стали записывать как xei, поскольку в староиспанском звук [ш] в начале слова обозначался буквой X
С развитием формульной записи слово сократилось до одной буквы
Ее название происходит от арабского термина «аль-джабр», означавшего перенос члена уравнения из левой части в правую с изменением знака.
Аль-Хорезми еще не использовал формул и записывал уравнения словами
Неизвестную величину он называл «шей», по-арабски — «вещь»
Например: три «вещи» составляют 15, значит, «вещь» равна пяти
В XII веке книга Аль-Хорезми попала в Испанию, где неизвестное стали записывать как xei, поскольку в староиспанском звук [ш] в начале слова обозначался буквой X
С развитием формульной записи слово сократилось до одной буквы
Перестаньте промптить, проектируйте цикл
Пространство для управления циклами, которое подключается к локальным агентам вашей команды:
- Создавайте каркасы контрактов циклов, состояний и логов
- Добавляйте программируемые триггеры
- Запускайте самоулучшающиеся циклы
- Начинайте с готовых шаблонов циклов
Пространство для управления циклами, которое подключается к локальным агентам вашей команды:
- Создавайте каркасы контрактов циклов, состояний и логов
- Добавляйте программируемые триггеры
- Запускайте самоулучшающиеся циклы
- Начинайте с готовых шаблонов циклов
ARI AML
Перестаньте промптить, проектируйте цикл Пространство для управления циклами, которое подключается к локальным агентам вашей команды: - Создавайте каркасы контрактов циклов, состояний и логов - Добавляйте программируемые триггеры - Запускайте самоулучшающиеся…
What I learnt after running loops for 1 month???.pdf
745.6 KB
Однажды все математики ушли из пункта А в пункт Б, и за этим следила вся общественность
Здесь только одна тонкость: они исходно не были в пункте А, а представляли из себя множество динамических координат: Xi(t), Yi(t); i=1, 2, ..., N
И эти координаты не изменились
И ни по пункту А, ни по пункту Б нельзя было определить это множество
Так в чем же смысл?
А смысл в том, что у множества обычно есть название
Было А, стало Б
Кстати, в программировании нет операции переименования, а в жизни — сплошь и рядом
Теперь представим, что А — это одно сознание, а Б — это другое сознание
Это уже аналитическая философия
Если переименовать А в Б, а Б в А, поменяет ли это что-то? Кажется, что нет
Но ведь А — это один физический субстрат, а Б — это совершенно другой
Теорема доказана
Сознание — это не ветер, а математики с распределенной локацией
Они приписаны к конкретному мозгу, но фактически они не в мозге, а в своих собственных координатах
Но координаты не классические, они описываются волновой функцией
Ну а как же квалия? — спросит пытливый читатель
Отвечаю: квалия — это коллапс волновой функции
Здесь только одна тонкость: они исходно не были в пункте А, а представляли из себя множество динамических координат: Xi(t), Yi(t); i=1, 2, ..., N
И эти координаты не изменились
И ни по пункту А, ни по пункту Б нельзя было определить это множество
Так в чем же смысл?
А смысл в том, что у множества обычно есть название
Было А, стало Б
Кстати, в программировании нет операции переименования, а в жизни — сплошь и рядом
Теперь представим, что А — это одно сознание, а Б — это другое сознание
Это уже аналитическая философия
Если переименовать А в Б, а Б в А, поменяет ли это что-то? Кажется, что нет
Но ведь А — это один физический субстрат, а Б — это совершенно другой
Теорема доказана
Сознание — это не ветер, а математики с распределенной локацией
Они приписаны к конкретному мозгу, но фактически они не в мозге, а в своих собственных координатах
Но координаты не классические, они описываются волновой функцией
Ну а как же квалия? — спросит пытливый читатель
Отвечаю: квалия — это коллапс волновой функции
OpenAI показала GPT-5.6 Sol — модель, которая по одной короткой команде исследователя сама дообучила меньшую модель Luna: подобрала настройки, выбрала GPU, запустила и проверила обучение без пошаговых указаний человека
На внутреннем тесте рекурсивного самоулучшения (RSI) Sol обошла GPT-5.5 на 16.2 балла
Anthropic ранее говорила, что полного самоулучшения пока нет, но оно «может наступить раньше, чем готово большинство институтов» — и что люди уже принимают лишь единицы процентов ключевых решений за Claude
На внутреннем тесте рекурсивного самоулучшения (RSI) Sol обошла GPT-5.5 на 16.2 балла
Anthropic ранее говорила, что полного самоулучшения пока нет, но оно «может наступить раньше, чем готово большинство институтов» — и что люди уже принимают лишь единицы процентов ключевых решений за Claude
Почему_нейросеть_пока_не_умеет_мыслить.pdf
2.9 MB
Есть довольно удобная иллюзия: если языковая модель выдала новую, логичную и технически убедительную идею, значит она уже почти сравнялась с человеком в научном мышлении
Авторы новой работы решили проверить не качество отдельных ответов, а сам «вкус» исследователя — то, какие проблемы человек и модель замечают в одной и той же литературе и каким способом пытаются их решить
Для этого взяли 11.683 опубликованные работы по машинному обучению и естественным наукам, восстановили набор предшествующих статей, из которых могла родиться каждая работа, а затем показали этот же контекст разным LLM
Человеческой идеей считалась реально опубликованная статья, модель должна была предложить собственное продолжение на основе тех же исходных материалов
Разрыв обнаружился не столько в том, способны ли модели придумать что-то разумное, сколько в том, насколько однообразно они это делают
Когда LLM видит рядом несколько работ, её любимый ход — найти между ними связь и предложить всё объединить: совместить два метода, связать разные направления, интегрировать данные, построить единую архитектуру
Среди человеческих идей только 12.1 % были построены вокруг такого «моста» между существующими подходами
У моделей этот показатель составлял от 47.1 до 64.2 %
Аналогичная картина с методами: синтез и объединение были главным приёмом лишь в 5.1 % человеческих работ, но в 22.5–38.7 % идей, созданных нейросетями
Получается, что модель часто действительно предлагает полезный проект, но делает это по одному и тому же рецепту: возьмём известную технологию, добавим к ней ещё одну известную технологию и объявим их соединение новым исследованием
Человеческие идеи устроены иначе
Исследователь гораздо чаще замечает конкретную трещину внутри уже существующего механизма: неверное допущение, смешение двух эффектов, плохо работающий модуль, отсутствие объяснения или способа измерения
Поэтому в человеческих работах чаще встречаются действия вроде «заменить», «разделить», «формализовать», а не просто «объединить»
Например, модель может предложить соединить мультимодальную систему с адаптацией во время тестирования и получить универсальную архитектуру
Человек скорее спросит, почему конкретный компонент перестаёт работать при изменении данных, отделит влияние одного фактора от другого и заменит наиболее хрупкую часть системы
В первом случае идея выглядит масштабно и современно, во втором — может звучать скромнее, но точнее попадает в настоящий научный тупик
Особенно интересно, что расширенное рассуждение не исправило проблему
В режиме thinking модели не стали ближе к человеческому распределению идей, а, наоборот, ещё сильнее закрепились в привычном шаблоне
У Qwen доля идей, построенных на соединении разных подходов, выросла с 49.7 до 71.1 %, а доля методов синтеза — с 38.7 до 52.2 %
То есть дополнительное «мышление» в данном случае не расширило пространство вариантов, а помогло модели убедительнее и последовательнее прийти к своему любимому ответу
Даже полный текст предыдущих исследований вместо одних аннотаций не решил проблему: больше контекста не обязательно означает другой способ видеть проблему
Из этого, конечно, не следует, что LLM бесполезны для науки
Они прекрасно ускоряют поиск связей, перебор комбинаций и упаковку ещё неоформленной мысли
Но пока модель скорее сильный комбинатор, чем носитель исследовательского вкуса
Она умеет быстро построить мост между уже известными объектами, но реже замечает, что один из этих объектов вообще нужно разобрать, переопределить или выбросить
Поэтому наиболее продуктивная работа с нейросетью начинается не с просьбы «придумай новую идею», а с человеческого указания на точный конфликт: что здесь не объяснено, какое допущение кажется ложным, где система ломается и какой механизм мы на самом деле хотим понять
Нейросеть может развить такую постановку гораздо быстрее человека, но сам выбор того, куда смотреть, пока остаётся главным человеческим преимуществом
Авторы новой работы решили проверить не качество отдельных ответов, а сам «вкус» исследователя — то, какие проблемы человек и модель замечают в одной и той же литературе и каким способом пытаются их решить
Для этого взяли 11.683 опубликованные работы по машинному обучению и естественным наукам, восстановили набор предшествующих статей, из которых могла родиться каждая работа, а затем показали этот же контекст разным LLM
Человеческой идеей считалась реально опубликованная статья, модель должна была предложить собственное продолжение на основе тех же исходных материалов
Разрыв обнаружился не столько в том, способны ли модели придумать что-то разумное, сколько в том, насколько однообразно они это делают
Когда LLM видит рядом несколько работ, её любимый ход — найти между ними связь и предложить всё объединить: совместить два метода, связать разные направления, интегрировать данные, построить единую архитектуру
Среди человеческих идей только 12.1 % были построены вокруг такого «моста» между существующими подходами
У моделей этот показатель составлял от 47.1 до 64.2 %
Аналогичная картина с методами: синтез и объединение были главным приёмом лишь в 5.1 % человеческих работ, но в 22.5–38.7 % идей, созданных нейросетями
Получается, что модель часто действительно предлагает полезный проект, но делает это по одному и тому же рецепту: возьмём известную технологию, добавим к ней ещё одну известную технологию и объявим их соединение новым исследованием
Человеческие идеи устроены иначе
Исследователь гораздо чаще замечает конкретную трещину внутри уже существующего механизма: неверное допущение, смешение двух эффектов, плохо работающий модуль, отсутствие объяснения или способа измерения
Поэтому в человеческих работах чаще встречаются действия вроде «заменить», «разделить», «формализовать», а не просто «объединить»
Например, модель может предложить соединить мультимодальную систему с адаптацией во время тестирования и получить универсальную архитектуру
Человек скорее спросит, почему конкретный компонент перестаёт работать при изменении данных, отделит влияние одного фактора от другого и заменит наиболее хрупкую часть системы
В первом случае идея выглядит масштабно и современно, во втором — может звучать скромнее, но точнее попадает в настоящий научный тупик
Особенно интересно, что расширенное рассуждение не исправило проблему
В режиме thinking модели не стали ближе к человеческому распределению идей, а, наоборот, ещё сильнее закрепились в привычном шаблоне
У Qwen доля идей, построенных на соединении разных подходов, выросла с 49.7 до 71.1 %, а доля методов синтеза — с 38.7 до 52.2 %
То есть дополнительное «мышление» в данном случае не расширило пространство вариантов, а помогло модели убедительнее и последовательнее прийти к своему любимому ответу
Даже полный текст предыдущих исследований вместо одних аннотаций не решил проблему: больше контекста не обязательно означает другой способ видеть проблему
Из этого, конечно, не следует, что LLM бесполезны для науки
Они прекрасно ускоряют поиск связей, перебор комбинаций и упаковку ещё неоформленной мысли
Но пока модель скорее сильный комбинатор, чем носитель исследовательского вкуса
Она умеет быстро построить мост между уже известными объектами, но реже замечает, что один из этих объектов вообще нужно разобрать, переопределить или выбросить
Поэтому наиболее продуктивная работа с нейросетью начинается не с просьбы «придумай новую идею», а с человеческого указания на точный конфликт: что здесь не объяснено, какое допущение кажется ложным, где система ломается и какой механизм мы на самом деле хотим понять
Нейросеть может развить такую постановку гораздо быстрее человека, но сам выбор того, куда смотреть, пока остаётся главным человеческим преимуществом