Частные заметки одного лица
250 subscribers
196 photos
29 videos
8 files
316 links
Статейки, мысли, заметки @shiryaeff
Download Telegram
Forwarded from Data Secrets
В будущем не будет продактов, инженеров и дизайнеров: создатель Claude Code Борис Черный сказал, что нас ждет всего 5 архетипов

1. Prototyper: генератор множества идей, только некоторые из которых будут реализованы.

2. Builder: быстро превращает прототипы и идеи в продукт.

3. Sweeper: чистит UX, упрощает код, оптимизирует систему.

4. Grower: берет продукт и итеративно улучшает его с точки зрения Product-Market Fit.

5. Maintainer: владеет зрелой системой и следит за ее безопасностью, надежностью и эффективностью.


При этом эти архетипы не будут зависеть от домена или специфического стека, как большинство современных ролей, и один человек сможет объединять в себе до трех статусов.

В новой системе не нашлось места только эйчарам 🤷‍♂️
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4
Forwarded from Data Secrets
Anthropic нашли внутри Claude внутреннее пространство, где хранятся его мысли

Стартап выпустил одну из самых интересных работ по интерпретируемости за последнее время. Они обнаружили, что в LLM есть отдельный небольшой внутренний набор нейронных активаций, который используется как рабочая память для сложного мышления: так называемый J-space.

Мы часто представляем LLM как огромную мешанину чисел, где знания и рассуждения размазаны по миллиардам параметров. Но похоже, что это не совсем так.

Любопытно, что человеческий мозг работает похожим образом. Есть когнитивная теория, утверждающая, что он состоит из множества специализированных подсистем, которые работают независимо; но иногда какая-то информация попадает в небольшой общий workspace, становится доступной сразу многим областям мозга и может использоваться для рассуждений и принятия решений. И вот именно такой механизм исследователи обнаружили в Claude.

Вот как работает J-space:

— Название происходит от разработанной учеными техники Jacobian Lens. Она позволяет по текущим активациям понимать, какие токены с большей вероятностью появятся в будущем. При этом то, что они появятся – далеко не факт, но это значит, что модель о них думает и держит их в J-space, чтобы использовать в рассуждениях. По сути, это чтение мыслей Claude.

— Если спросить Claude, о чем он думает, то содержимое J-space хорошо совпадает с ответом модели. Другие внутренние представления таким свойством не обладают. А еще модель умеет сознательно менять J-space. Например, если сказать ей «думай о слонах, пока решаешь задачу», то эта концепция появится в J-space. При решении сложной задачи промежуточные шаги тоже появляются именно внутри J-space, даже если их при этом нет в цепочках мыслей.

Если полностью отключить J-space, то у модели почти исчезают способности, требующие сложного мышления и многошагового рассуждения. Например, она больше не может сочинять стихи.

Самое важное во всем этом то, что J-space можно читать и менять. Anthropic приводят пример: исследователи специально внедряли модели скрытую цель во время обучения и затем наблюдали, как эта цель проявляется в J-space, хотя в ответах напрямую она ни разу не озвучивалась. При этом изменяя активации в J-space, они могли менять дальнейшие решения модели.

Потенциально это путь к тому, чтобы создавать (полностью?) безопасные и контролируемые модели. По крайней мере, сегодня Anthropic уже сделали черный ящик немного более прозрачным.

www.anthropic.com/research/global-workspace
🔥5👍2🤯2
Forwarded from Machinelearning
📌 Anthropic предлагает делать самоуправляемые циклы

Команда Claude Code опубликовала в X руководство по loops. Это паттерны, в которых агент повторяет рабочий цикл, пока не сработает условие остановки.

Главная мысль: уходить от ручного режима, где разработчик задаёт направление на каждом шаге, и передавать агенту контроль по нарастающей.


Всего выделяют 4 типа циклов, различая их по способу запуска, условию остановки и степени автономии. Логически получается некая лестница делегирования, где на каждой ступени вы отдаёте агенту очередное полномочие.

🟡Агентный цикл запускается промптом и завершается, когда Claude считает задачу выполненной.

Здесь вы отдаёте агенту проверку. Ручные шаги верификации заполняются вSKILL.md и чем более количественные критерии, тем точнее агент оценивает собственную работу.

🟡 Целевой цикл /goal забирает у вас условие прерывания

Вы описываете, что значит готово, а дальше при каждой попытке Claude завершить работу отдельная модель-оценщик сверяет результат с вашим критерием (скажем, долей пройденных тестов) и возвращает агента к работе, пока цель не достигнута или не исчерпан заданный лимит попыток.

🟡Временной цикл /loop или /schedule берёт на себя триггер запуска.

Это удобно для повторяющейся рутины и при работе с внешними системами (например, дайджест по таскам, реакция на новое ревью или упавший CI).

🟡Проактивный цикл убирает человека из контура.

Рутина срабатывает по событию или расписанию и живёт, пока вы её не выключите. В связке с динамическими воркфлоу агенту передаётся уже сам промпт. Вот этот сценарий уже ближе всего к полной автоматизации.

🟡Дополнительные советы

Не каждая задача требует сложного цикла, начинать стоит с простейшего решения.

Кодовую базу следует держать чистой, а для ревью подключать второй агент. Для этого есть встроенный /code-review.

Контролировать расход токенов чёткими границами: точные условия остановки, подбор модели под задачу (рутину - на модели поменьше и побыстрее, решения с ризонингом - на самой мощной).

Динамические воркфлоу способны породить сотни агентов, так что масштаб лучше проверять на небольшой выборке.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Журналисты позвонили владельцу заправки в Новосибирской области, вдвое повысившему цены. Бизнесмен, представившийся как "Слепой", пояснил, что это его земля и топливо, а значит, правила устанавливает сам, будут жаловаться - он ещё выше поставит, а если снизить цену, то бензин разберут за полдня. И вообще может закрыть точку в любой момент.

1.1. Давайте предположим, что сейчас реальная равновесная цена 92-го в стране - 100 или 120 рублей. Такой она была бы, если бы заправки крупных нефтяных компаний не пытались морозить цены. Что это означает? Что бензин могут покупать только сравнительно богатые и те, кому бензин очень нужен. Первая и вторая категории тесно пересекаются. В любом обществе, и в нашем тем более, среди богатых найдётся множество "социальных паразитов" - тех, кто наворовал, кто получил богатое наследство и ничего не делает, и так далее. Но в среднем люди с более высокой продуктивностью имеют более высокие доходы.

Представьте начальника важного отдела в крупной компании, который работает допоздна. Он много зарабатывает, и готов много заплатить за возможность быстро заправиться. Его отсутствие на работе может парализовать работу всего отдела и даже всей компании. И представьте деда-пенсионера, который на своей девятке едет на рыбалку. Рост цен на бензин заставит его поменять планы и провести день дома. Можно посочувствовать деду - он ни в чём не виноват, но никто кроме него самого от этого не пострадает.

1.2. Высокие цены создают мощный стимул увеличивать предложение бензина. Владельцы НПЗ будут всеми силами ремонтировать свои заводы, даже если будут знать, что вскоре после ремонта в них снова прилетит: один месяц работы уже даст такую прибыль, которая компенсирует все расходы на ремонт. Те же владельцы будут вкладываться в создание ПВО для своих заводов. Владельцы мелких НПЗ - "чайников" - будут всеми силами наращивать выпуск и пытаться создать новые мощности. Нефтеторговцы облазят весь мир в поисках партий бензина, которые можно привезти в обход санкций.

Побочным эффектом будет появление огромных сверхприбылей не у тех, кто умеет лучше организовывать производство, а у тех, кому просто повезло. НПЗ был сравнительно слабо повреждён, например. Или вообще находится вне зоны досягаемости дронов. (К сожалению, к востоку от Омска располагается всего четыре крупных нефтеперерабатывающих завода, общая мощность которых составляет около 10% от общероссийской). Гипотетически эти сверхприбыли, никак не связанные с действиями владельцев, можно частично изъять за счёт windfall tax - налога на внезапную прибыль.

Высокие цены на бензин - это очень, очень неприятно, особенно если бензин должны покупать вы лично. Но ничего катастрофичного в них нет. В большинстве стран мира 95-й бензин стоит больше 100 рублей (в некоторых под 200 и даже выше).

2.1. Рассмотрим очереди, вызванные попытками сохранять цены на прежнем уровне на заправках крупных нефтяных компаний. Высокая цена отсекает тех, кому бензин не особо нужен, и тех, у кого мало денег; очередь же является могучим средством перераспределения благ в пользу тех, кто мало ценит своё время. Это не значит, что в очереди стоят только бездельники - напротив, те, кому позарез нужен бензин, будут стоять в ней волей-неволей. Но давайте вспомним наш пример с дедом. Для него постоять в очереди - интересный способ провести время: можно пообщаться, обсудить новости, узнать, кто же виноват - Ротшильды или Рокфеллеры (а может, таинственные Барухи?) Время у деда бесплатное. А вот руководитель отдела скорее будет искать барыг, которые получают бензин благодаря обману или взяткам работникам нефтебаз. Он купит бензин уже по 200 за литр. Очередь, пожирающая самый ценный ресурс в мире - человеческое время, является мощнейшим инструментом перераспределения от более продуктивных членов общества к менее продуктивным.

2.2. Дополнительный эффект очереди - в ней самой сжигается бешеное количество топлива.

2.3. И, конечно, если пытаться сохранять цены на прежнем уровне, у владельцев нефтепереработки не появляется никаких стимулов в авральном порядке восстанавливать или расширять производство.

3.1. А что если бензин рационировать, то есть распределять по карточкам (QR-кодам в замечательном мессенджера Макс?) Ведь это ликвидирует очереди.

В войну по карточкам распределяли хлеб. Хлеб был нужен абсолютно всем. В брежневскую эпоху перед Новым годом всем раздавали продуктовый набор с чудным дефицитным фруктом - мандаринами. Мандарины на стол хотели все. В позднесоветские годы по карточкам начали распределять мясо. Мясо хотелось всем.

Но никому в советское время не приходило в голову распределять по карточкам рояли. Типа, раз в десять лет каждый имеет право купить рояль. Абсолютному большинству, 99% населения, рояль не нужен, и ставить его некуда.

Кто-то использует автомобиль, чтобы на выходные ездить на дачу. Кто-то не вылезает из авто весь день - ездит по деловым встречам, выезжает выполнять работы (сантехник или электрик). Кто-то ежедневно ездит из пригорода в центр на работу. У кого-то работа связана с междугородними поездками. Что будет, если раздавать бензин всем в одинаковом количестве? Чёрный рынок. Причём сложно устроенный: перекупам надо будет договариваться с массой мелких автовладельцев, чтобы они заправлялись, а потом сливали бензин.

3.2. Как и в случае с очередями, попытки заморозить цены при помощи карточек не создают мощных стимулов к увеличению предложения бензина.

4.1. Но если отпустить бензиновые цены - начнётся инфляция, ведь так? Это магическое мышление. Инфляция - это, в конечном счёте, снижение полезности денег. Если нельзя купить бензин в обмен на деньги, их ценность снижается гораздо сильнее, чем если бензин просто дорожает.

Кроме того, если раньше люди покупали X тонн бензина в день, а теперь покупают, к примеру, 0,6X по прежней цене (те, кто смог отстоять очередь), у них остаётся больше денег. Эти деньги они потратят на другие товары и услуги. Рост цен переносится из одной области во все другие области, попутно создаётся чудовищную неэффективность.

4.2. Самый яркий пример магии в головах - это то, что Сергей Вакуленко формулирует как "если бензин подорожает на 10%, молоко подорожает вдвое". Люди говорят: "топливо требуется на всех этапах производства" - и искренне думают, что сказали что-то очень умное. Волшебным образом издержки не суммируются, а перемножаются.

В прошлом году российский бизнес потребил примерно 10 млн тонн бензина, стоимость которого составила примерно 0,4% ВВП. (Дизеля потребили намного больше, но цены на него растут не так сильно). В каких-то ценах доля бензина выше, и они могут заметно измениться. Большинство товаров и услуг от бензина практически не зависят.

Что действительно может повлиять на цены - так это обрывы в логистике, связанные с невозможностью вовремя заправиться из-за многочасовых очередей.

4.3. Есть просвещённый аргумент в пользу ограничения цен на бензин: инфляционные ожидания. Людям проще всего отслеживать изменения общего уровня цен по изменениям цены на бензин. Нам сложно вспомнить, по какой цене мы покупали молоко или гречку на прошлой неделе. Квартиры, автомобили, бытовую технику покупают раз в несколько лет или несколько десятилетий. Но бензин люди покупают каждый день - и по ценам на бензин формирует свои инфляционные ожидания. А эти ожидания являются классическим примером самосбывающегося пророчества: все ждут роста цен - цены вырастут.

Выглядит убедительно. Но не работает. Отдельных работ по России я не знаю, а в США исследователи применили все возможные методики. Редкий случай консенсуса (ну почти консенсуса) среди экономистов: бензин не вносит аномального вклада в инфляционные ожидания. Вот свежие статьи: раз, два, три, четыре. Русские автомобилисты не глупее американских.

В Штатах на ярмарках есть такая забава: оценивать по внешнему виду вес быка-чемпиона. Тот, чья оценка будет ближе всего к истине, выигрывает. Часто среднее значение, полученное из всех оценок, оказывается точнее любой отдельной оценки. Люди ошибаются, но агрегирование ошибок создаёт чудо распределённой информации, лежащее в основе механизма рыночных цен.

...

Такие дела.
👍3
Интересная работа. Я её разбирал в англоязычном блоге год назад, но сюда кажется так и не запостил. Работа же дошла за это время до ICML.

Интересны для меня в ней по крайней мере три момента:
1. Оценена "ёмкость" каждого веса, сколько он добавляет к памяти — примерно 3.6 бита на параметр. Что отдельно интересно, что fp32 по сравнению с bf16 не очень много добавляет, 3.83 против 3.51, не в два раза.
2. Работа очень хорошо подтверждает теорию информационного боттлнека им. Нафтали Тишби, что у модели есть в обучении две фазы — в первой она всё запоминает что может, во второй ей приходится сжимать ибо уже не лезет. Неожиданно, это та самая точка, где наблюдается double descent.
3. Если отношение токенов к параметрам больше 100, то это статистически гарантирует невозможность membership inference атаки.

How much can language models memorize?

John X. Morris, Chawin Sitawarin, Chuan Guo, Narine Kokhlikyan, G. Edward Suh, Alexander M. Rush, Kamalika Chaudhuri, Saeed Mahloujifar
Paper: https://arxiv.org/abs/2505.24832, ICML SubmissionICLR Submission
Review: https://arxiviq.substack.com/p/icml-2026-how-much-can-language-models
Code: N/A
Model: https://huggingface.co/rhysjones/gpt2-774M-fineweb-150B

ICML 2026 Outstanding Paper Honorable Mention

# TL;DR

ЧТО сделали: Авторы разработали информационно-теоретический фреймворк на базе колмогоровской сложности, который позволяет строго отделить непреднамеренное запоминание от обобщения. Обучив и протестировав сотни моделей архитектуры GPT на синтетических и реальных данных, они оценили эмпирическую ёмкость памяти трансформеров примерно в 3.6 бита на параметр и вывели сигмоидальный закон масштабирования для атак восстановления членства (membership inference).

ПОЧЕМУ это важно: Эта работа даёт строгое физическое объяснение феномену двойного спуска (double descent). Она доказывает, что обобщение математически неизбежно, когда объём датасета в битах превышает ёмкость памяти модели. Кроме того, исследование показывает, что современные LLM, обученные на гигантских массивах данных, математически защищены от атак восстановления членства: вероятность успеха таких атак падает до уровня случайного угадывания, как только соотношение токенов и параметров превышает 10^2.

Для практиков: Полученные оценки ёмкости позволяют проектировать пайплайны обучения с гарантированной защитой от утечки данных. Теперь можно математически рассчитать размер модели и объём обучающей выборки так, чтобы полностью исключить возможность извлечения конфиденциальных тренировочных примеров.

Считать информацию тут: https://t.me/gonzo_ML_podcasts/4418
Forwarded from from:adam
У меня очень долго были плохие отношения с отпусками: брал редко, между поездками мог пройти год, а отдых был не vacation, а workation сводившийся к смене локации с ответами в рабочие чаты. Сейчас стало лучше: чаще хожу, на работу не отвлекаюсь. Решил разобраться, что об этом говорит наука. Для многих это банальные вещи, но мне мозги прочистило хорошо. Вот основное:

1. Восстановление — это пирамида восстановления, а не редкие события в жизни. Отпуск не чинит плохой режим и work/life balance. Вечера без работы → нормальные выходные → отпуск. Эффект отпуска выветривается за ~3 недели, а будни с нами остаются весь год.

2. Несколько коротких поездок лучше одной длинной. Память не вознаграждает за длительность, а длинный отпуск даёт больший пик, но падает быстрее. При этом годовой объём резать нельзя 1 2. Японцы, к примеру, при 12 днях отпуска реже всех чувствуют нехватку отдыха (опрос Expedia) — предположительно за счёт частых коротких поездок.

3. Планировать отпуск лучше заранее. Предвкушение работает, как отдельный источник счастья. Работает именно конкретика (даты, билеты, жильё), а «летом куда-нибудь». В идеале даже закончить один отпуск и иметь сразу следующий забуканый.

4. Полное отключение от работы — самый важный фактор, второй — физическая активность. «Только гляну почту» не даёт частичный отдых, а подтачивает механизм целиком — работа из отпуска ухудшает самочувствие после него. А вот популярное «смена деятельности = отдых» не работает: освоение новых навыков в отпуске значимого эффекта на восстановление не даёт. Трудоголикам тяжелее отключиться — им нужен отпуск длиннее и связь с работой, недоступная физически.

5. Отпуск не нужно превращать в проект с жестким расписанием досуга. Это делает его похожим на работу. Работает скелет: жильё, переезды, 1–2 якоря на день (локация, рестики, музеи и тд). Остальное оставлять пустотой, которую не надо оптимизировать.

6. Память о поездке определяется отсутствием провалов, а не яркими пиками. Часто людям кажется, что, воспоминание держится на ярком финале, но на многодневных событиях правило не работает: оценку определяет среднее по всем дням, а провалы весят больше пиков. К концу поездки настроение естественно снижается — тем важнее не ставить в конец какой-нибудь логистический ад, ибо испортит воспоминание сильнее, чем компенсирует любой вау эффект.

7. Нужен буфер с обеих концов отпуска. Перед вылетом — день свободы между работой и поездкой. Предотпускная неделя — пик стресса, иначе первые дни уйдут на разгрузку того, что привез с собой в поездку. При смене часовых поясов первые 1–2 дня — не для требовательных планов. После отпуска же требуется протекция первой недели, ибо эффект сгорает не от того, как прошёл отдых, а от того, во что человек возвращается. Оптимально: прилёт за день до выхода, первые 2–3 дня без встреч (ставить блокеры в календарь еще до отъезда), без дедлайнов на первую неделю.

8. Поездку стоит переработать в память. Возвращение к позитивному опыту — работающая интервенция. У меня, к примеру, это обработка фотографий с отпуска в лайтруме, к которой я периодически возращаюсь после поездки.
👍5🔥1
Forwarded from Адель и МЛь
Насколько же сильно меняется работа, когда есть ИИ агенты.

Мой коллега, биоинформатик, увидел статью, в которой хитрым образом находят специфичные гены в картошке. Понял, что это может быть полезно для нашего отдела по селекции клубники. Потому что и то, и другое распространяется вегетативно - то есть не через семена, а усы и клубни - они не родня, конечно, но в генетическом плане есть о чем поговорить, так сказать.

Он дал эту статью агенту, который вооружен до зубов скиллами нашего собственного приготовления, и поставил задачу воспроизвести методы из статьи на наших данных клубники.

Агент прочел работу, скачал с гита код, подтянул наши данные из бд, адаптировал что-то по мелочи, собрал контейнер, создал джобу на кластере и вот оно там бодро считается на нескольких Н100.

По сути это задача интерна/джуна - “вот тебе статья, вот данные, через неделю покажешь, не надо плакать, все будет хорошо, соберись уже”

Прогресс, как это часто бывает, выглядит немного несправедливо.

И это, заметьте, не задачи кодинга, это по сути своей - applied research. Ведь агент не просто пишет код (если вообше пишет), а таскает за собой весь исследовательский контекст, внутреннюю кухню по данным и инфре.

До сих пор не верится, что это все настолько хорошо работает. Ощущение, что оно где-то да вот вот зафейлится - но оно раз за разом хорошо отрабатывает. Магия 🤷‍♂️
🔥4👍2
#Прямая_речь
Учитель истории московской гимназии № 1543, заслуженный учитель РФ Леонид Кацва по поводу отказов зачислить школьников в 10-й класс:
 
«Наши школьники привыкли к тому, что можно не учиться и переходить из класса в класс: «тройка» устроит, а «двойку» не поставят, и можно продолжать готовить три предмета. С моей точки зрения, в школах у нас достаточно детей, которые должны заканчивать образование в 9-м классе, если не раньше, и переходить в те учебные заведения, где главное внимание будет уделяться подготовке к  профессии. Я никакой трагедии в том, что в 10-й класс стали принимать довольно жестко, не вижу».
👍10🤔2👎1🔥1💯1
https://t.me/sergeyvakulenko/228

То, о чём я писал недавно, но в развёрнутой форме, и от признанного отраслевого специалиста. Замечу только, что 3,7% от ВВП - это все расходы всех экономических агентов на все виды топлива. Если брать расходы только бизнеса только на бензин, доля будет почти в десять раз меньше.

Ну и главное. Настоящую угрозу существенного всплеска инфляции представляет не рост цен на 30-40 рублей за литр, а обрывы логистики, связанные с очередями и рационированием (карточки). Молоко действительно может подорожать вдвое, если молоковозы не смогут вовремя заправляться, и молоко будет скисать.
👍3💯1
В комнату входит состязательная психометрика. Забавно, что "персоны" моделей существенно разные — Клод кооперативен, а GPT склонна к обману.

Measuring Intelligence Beyond Human Scale
Jerry Han, Rafael Moschopoulos, Ella Colby, Vishrut Goyal, Andrew Tu, Kia Ghods, Mark Braverman, Elad Hazan / Princeton Superalignment
Paper: https://arxiv.org/abs/2607.07040
Review: https://arxiviq.substack.com/p/measuring-intelligence-beyond-human
Code: N/A
Model: N/A

# TL;DR

ЧТО сделали: Авторы представили SepaRank — теоретико-игровой фреймворк для оценки моделей, основанный на «состязательной психометрике». Вместо статичных бенчмарков, созданных людьми, модели оцениваются в двойных ролях: как авторы задач (пропозеры) и как их решатели (солверы). Пропозеры получают награду за генерацию публичных бинарных вопросов, которые максимизируют дисперсию (несогласие) в ответах пула моделей-солверов, в то время как солверы оцениваются по точности ответов с помощью Brier loss.

ПОЧЕМУ это важно: Когда возможности ИИ приближаются к уровню людей-экспертов и превосходят его, традиционные абсолютные бенчмарки быстро насыщаются. При этом людям-экспертам становится всё труднее придумывать или проверять сложные, дискриминирующие вопросы. Переходя от абсолютной оценки к относительной (по принципу «один ко многим»), SepaRank создаёт автоматический, самомасштабируемый лидерборд без участия судей. Он естественным образом нейтрализует популярные стратегии обхода правил, такие как запросы к скрытому состоянию или алгоритмические лазейки.

Для практиков: Для технических лидеров и исследователей ИИ эта работа предлагает сдвиг парадигмы (всё как мы любим!) в оценке LLM. Она доказывает, что мы можем надёжно ранжировать сверхчеловеческие системы, позволяя им самим нащупывать и вскрывать границы возможностей друг друга. Такое динамическое взаимодействие не только решает проблему насыщения бенчмарков, но и генерирует поток сложных out-of-distribution данных для обучения, которые можно напрямую использовать в RLHF и циклах пост-тренинга.

Состязательно измерять психов здесь: https://t.me/gonzo_ML_podcasts/4484
👍2
Forwarded from Data Secrets
Fable 5 опровергла известную гипотезу Якобиана

Она формулируется так: если у полиномиального отображения постоянный ненулевой якобиан, то у него должен существовать полиномиальный обратный. Надо понимать, что это не очередная узкая проблема математки, а буквально центральный вопрос обратимости полиномиального отображения, который с 30-х годов прошлого века оброс кучей литературы и споров.

До сегодняшнего дня были доказаны только некоторые частные случаи. Найденный Fable пример гипотезу окончательно опровергает.

О решении объявили математики Levent Alpöge и Akhil Mathew, его уже проверили в автоматических верификаторах и подтвердили некоторые независимые математики.

Math is solved?
💯5👍1
Forwarded from Data Secrets
Такими новостями уже никого не удивишь, но GPT-5.6 опровергла еще одну известную гипотезу, которая была открыта 30 лет

Гипотеза Диница - Гарга - Гоеманса – это теорема из теории графов и сетевых потоков, которая гласит, что из допустимого дробимого решения можно получить целочисленное по маршрутам решение без увеличения стоимости.

Подобные утверждения часто становятся основой для практических оптимизационных алгоритмов, поэтому гипотеза важная. Открыта она была с 1999.

Решение, к слову, обнаружил математик из Нижнего Тагила, выпускник ВШЭ. Вот чат с моделью. Промптинг на уровне «соверши прорыв», «опровергни общий случай», «продолжай исследовать» – то есть вообще никаких подсказок и даже серьезных инструкций. Сам автор называет чат «чистым мемом».

В итоге за несколько итераций и несколько часов модель нашла нужный контрпример. Вот такая математика в 2026.
🔥7🤔3👍1