Мысли Фединцева
166 subscribers
5 photos
14 links
Про ИИ, старение, математику и всякое такое
Download Telegram
Давайте разбавим тему старения небольшой порцией новостей про ИИ. Не так давно китайская Moonshot AI выпустила модель Kimi K3, которая сразу же ворвалась в самый топ (см. картинку). Причем круче всего тот факт, что это модель с открытыми весами! К сожалению, это огромная модель на 2.8 триллиона параметров (104 млрд. из них активны). Такое не запустить не то что на домашнем ПК с игровой видеокартой, даже наша мощная рабочая станция с 4мя GPU RTX PRO 6000 бессильна :)

Еще до выхода Kimi K3 (23 февраля 2026 года) Anthropic публично заявила ещё , что обнаружила масштабную кампанию Moonshot по извлечению возможностей Claude, причём Anthropic отдельно утверждает, что на более позднем этапе Moonshot пыталась реконструировать reasoning traces Claude.

Надо сказать, что я изначально был весьма скептично настроен по этому поводу. Во-первых, для классической logit-based knowledge distillation особенно полезен доступ к полному распределению вероятностей модели-учителя по словарю на каждом шаге.
🔥91
Публичные API frontier-моделей такого полного распределения, насколько мне известно, не предоставляют.

Тем не менее, какой-то полезный сигнал можно получить обучаясь и на цепочках рассуждений модели-учителя. Однако и тут облом - ведь, например, Антропик не возвращает Chain-of-thought для своих моделей. По крайней мере, я так думал до недавних пор...
Все оказалось гораздо интереснее! Группа исследователей выпустила репорт о своей успешной попытке получения доступа к цепочкам рассуждений модели Claude Opus 4.8! Оказалось, что API возвращает таки эти цепочки рассуждений, но в зашифрованном виде. Но это легко ломается путем скармливания этих зашифрованных цепочек более "глупой модели" Claude Haiku 4.5! Надо особо акцентировать внимание на том, что они не сломали сам механизм шифрования. Уязвимость архитектурная: authenticated/encrypted reasoning block оказывается переносим между моделями одного семейства, а слабая модель выступает своего рода decryption oracle.
Упрощённо схема выглядит так:
1. Opus генерирует скрытый CoT
Внутри Anthropic возникает что-то вроде:
plaintext reasoning → шифрование/подпись → encrypted reasoning block
Клиент получает не plaintext, а непрозрачный signature/blob. Это позволяет API быть stateless: клиент хранит blob и присылает его обратно при продолжении разговора. Авторы считают, что это AEAD-подобный контейнер: ciphertext + nonce/tag/metadata. При этом точную внутреннюю криптографическую реализацию Anthropic публично не описывает.
2. Этот blob отправляют Haiku
Вот здесь происходит ключевой момент. Backend Anthropic принимает blob, проверяет его подлинность и, судя по наблюдаемому поведению, восстанавливает содержащийся в нём reasoning, чтобы модель могла продолжать диалог с учётом предыдущего reasoning state.
3. Глупыша Haiku обманом заставляют выплюнуть содержимое reasoning state, которое теперь расшифровано и хранится где-то в контексте
В теории эта атака могла быть использована и для дистилляции Fable 5, но достоверно мы этого не знаем. Официальный сайт пишет, что для Fable 5 raw chain-of-thought официально вообще «never returned».
Так что я немного пересмотрел вероятность того, что дистилляция имела место быть, но перестает ли от этого достижение компании Moonshot AI быть впечатляющим? Нет, ведь возможная дистилляция - это лишь капля в море огромного числа математических и инженерных инноваций, о которых вы можете посмотреть в видео с моего любимого канала про ИИ и машинное обучение.
🔥8
Извинити, не могу не поделиться :) Без преувеличения тысячи научных работ по нейробиологии могут оказаться полностью неверными! В видео Сабина Хоссенфельдер упоминает несколько работ, указывающих на различные критические проблемы. Вот парочка из них:
1. Основная гипотеза на которой базируется популярный инструмент по исследованию мозга - фМРТ - может быть неверна. фМРТ позволяет отслеживать в какие участки мозга больше приток крови. Больше крови -> больше кислорода -> выше активность нейронов. Вроде бы все логично! Но, как оказалось, нейроны могут увеличивать свою активность и без увеличения притока крови - они просто лучше усваивают кислород
2. Разные результаты (причем сильно) при использовании одних и тех же сканеров от разных производителей! Это вообще что-то с чем-то... прощай reproducibility

https://www.youtube.com/watch?v=jHGx7HBB-J4
🔥7😢5🤯3😁2
Вы наверняка видели множество исследований, начинающихся словами: «Учёные нашли связь между короткими теломерами и риском чего-то там». И для ответа на вопрос, что будет, если теломеры искусственно удлинить, все эти исследования по большому счёту можно выкинуть в помойку. Они показывают корреляцию, а не причинно-следственную связь: болезнь сама может укорачивать теломеры или какой-нибудь третий фактор может одновременно портить здоровье и укорачивать теломеры.

Но означает ли это, что заранее оценить эффект удлинения теломер вообще невозможно и остаётся только ждать, пока помрут биохакеры, которые уже ввели себе AAV-векторы с геном теломеразы? А ведь такие люди уже есть. Лиз Пэрриш была первой широко известной "пациенткой ноль", которая в 2015 году заявила, что испытала такую генную терапию на себе. И на бумаге идея выглядела чертовски заманчиво: в одном из ключевых экспериментов AAV-доставка TERT увеличила медианную продолжительность жизни мышей на 24%, причём исследователи не обнаружили роста заболеваемости раком.

Но ждать смерти Лиз Пэрриш на самом деле необязательно. Потому что природа уже провела над людьми нечто очень похожее на рандомизированный эксперимент. Некоторые люди при зачатии случайно получают варианты генов, из-за которых их теломеры в среднем длиннее. Другие - варианты, из-за которых они короче. Генотип определяется задолго до того, как человек начинает курить, толстеть, заболевать раком или атеросклерозом. Поэтому можно спросить: если длинные теломеры действительно причинно защищают от возрастных болезней, должны ли люди с генетической предрасположенностью к длинным теломерам болеть ими реже?

Такой метод называется менделевской рандомизацией. И в 2017 году огромная коллаборация именно это и сделала: посмотрела на 35 типов рака и 48 других заболеваний, используя данные о 420 тысячах случаев заболеваний и более чем миллионе контролей. Результат оказался гораздо интереснее банального «длинные теломеры = хорошо».

+1 SD (стандартное отклонение) генетически обусловленной длины теломер:
glioma ×5.27, lung adenocarcinoma ×3.19, bladder cancer ×2.19, melanoma ×1.87, kidney cancer ×1.55. Одновременно coronary heart disease −22%, abdominal aortic aneurysm −37%, interstitial lung disease −91%.


В принципе, результаты соответствуют интуиции большинства ученых: длинные теломеры увеличивают риск рака и уменьшают риск некоторых других возраст-зависимых заболеваний. Особенно интересно тут снижение риска болезни Альцгеймера. Но каков общий вклад в продолжительность жизни? Я решил сделать такую грубую прикидку: сначала берем доли заболеваний в структуре смертности и считаем net mortality hazard, а затем переводим в годы жизни используя закон Гомперца.

Очень грубый вклад в all-cause mortality
Coronary heart disease, OR 0.78 ≈ −2.8 п.п.
Alzheimer, OR 0.84 ≈ −0.7 п.п.
AAA, OR 0.63 ≈ −0.1 п.п.
ILD + T1D + celiac небольшой дополнительный выигрыш, примерно −0.2…−0.6 п.п.
Итого non-cancer benefit ≈ −3.8…−4.3%

Lung cancer ≈ +4–5%
Glioma ≈ +1.5–2%
Bladder ≈ +0.7%
Kidney + melanoma + endometrium etc. ≈ +0.6–1%
Итого cancer penalty ≈ +7…8.5%
Net ≈ +3…4% mortality hazard

Что дает -8ln(1.035)/ln(2) = -0.4 года на 1 SD увеличения теломер. Иными словами увеличение теломер навряд ли продлит жизнь людей. Скорее даже наоборот.

Хотя такому анализу верить на 100% нельзя, потому что относительный вес причин смерти сильно меняется с возрастом. Особенно интересно, что аутопсийные исследования centenarians дают совсем другую картину, чем death certificates: даже после 100 лет сердечно-сосудистые заболевания остаются ведущей непосредственной причиной смерти, тогда как смерть от рака становится редкой. В одной серии вскрытий 40 centenarians 68% умерли от сердечно-сосудистых причин и ни один - от рака. Поэтому в очень старом возрасте баланс удлинения теломер может сдвинуться в положительную сторону: противораковый «штраф» длинных теломер теряет вес, тогда как потенциальная защита от коронарной болезни и других дегенеративных патологий остаётся.
🔥13👍73
В предыдущем посте я затронул тему каузальности aka причинности. Тема настолько фундаментальная для науки, что большинство моих постов будут так или иначе ее касаться, так что привыкайте 🙃

В этот раз так совпало (или же это божественное провидение? 🤔), что на одном из моих любимых ютьюб каналов по математике вышло видео про causal inference! Поэтому сразу же делюсь им с вами, чтобы и вы, так сказать, приобщились к прекрасному. В видео мне понравилось наглядное и интуитивное объяснение таких вещей как confounding, controlling for confounding, collider bias (кстати, автор приводит в качестве иллюстрации знаменитый парадокс Берксона) и, конечно же, естественные эксперименты, эквивалентом которых в биологии являются Mendelian Randomization studies. Для более глубокого погружения в тему (но все еще novice-friendly) советую эту книгу - https://matheusfacure.github.io/python-causality-handbook/landing-page.html
🔥63👍3
Британские ученые проанализировали клетки столетних людей и то, что они увидели повергло их в шок! Продолжение по ссылке... Шутка 🙃 А если серьезно, то оказалось, что адаптивная иммунная система столетних людей чуть более чем полностью на 10-18% состоит из особых гибридных лимфоцитов - цитотоксических CD4-клеток. Что это за зверь такой и чем примечателен?

Почему эти клетки необычны? Обычно CD4-клетки - это «хелперы», координирующие иммунный ответ, а непосредственно убивают заражённые и опухолевые клетки главным образом CD8-клетки. Но некоторые CD4-клетки сами приобретают цитотоксическую программу: начинают производить гранзимы и перфорин и превращаются в CD4 CTL.

Авторы даже увидели вероятную траекторию такого превращения:
CD4 helper → CD27⁻CD28⁺ → CD27⁻CD28⁻ CD4 CTL.
Но самое интересное - их клональность. В среднем крупнейший клон составлял треть всех CD4 CTL конкретного человека, а у одного столетнего - больше половины. Это очень похоже на многократную стимуляцию одним и тем же персистирующим антигеном.
Что это за антигены? Тут начинается детектив. Авторы сравнили TCR этих клеток с огромной базой данных. Среди 36 совпадений с клонально расширенными TCR 32 происходили из онкологических образцов - прежде всего рака лёгкого, молочной железы и печени.
Это не доказывает, что CD4 CTL супердолгожителей действительно распознают опухоли: совпадала только β-цепь TCR. Но гипотеза красивая. Возможно, такие клетки десятилетиями уничтожают возникающие предопухолевые клетки, сенесцентные клетки или клетки с реактивировавшимися латентными вирусами.
И здесь исследование становится особенно интересным для понимания старения. Мы привыкли представлять immunosenescence просто как постепенную поломку иммунитета: меньше наивных T-клеток, меньше разнообразия TCR, хуже реакция на новые антигены.
Но, возможно, часть этих изменений - не поломка, а адаптация. Молодой иммунитет оптимизирован на разнообразие неизвестных угроз. Старый организм уже накопил собственный набор хронических проблем - латентные вирусы, сенесцентные клетки, предопухолевые клоны - и иммунная система всё сильнее специализируется именно на них.
Поэтому иммунная система супердолгожителя может быть вовсе не "молодой". Она может быть очень старой и радикально перестроенной - с меньшим разнообразием и гигантскими клонами специализированных киллеров.
Просто, возможно, так и выглядит успешно адаптировавшаяся старая иммунная система.

Статья - https://www.sciencedirect.com/science/article/pii/S2211124726008065
🔥135👍4
Нужна ли вам возможность обсуждать мои посты?
Anonymous Poll
84%
Да
16%
Нет
👍2💯21👻1
Хотел написать пост про старение мозга, но материала набралось на целую статью. Наберитесь терпения - скоро выйдет :)
👍8🔥65
Нашел отличный гайд по обучению с подкреплением (RL) в контексте больших языковых моделей (LLM)!

Вообще, c RL связаны многие успехи LLM - это и то, что они превратились в полезных ассистентов вместо простых продолжателей текста коими были первые модели серии GPT, и стали "рассуждать" прежде чем дать ответ (начиная с o1). Так что изучить что там под капотом будет полезно многим

Ссылка: https://cameronrwolfe.substack.com/p/llm-rl
🔥5
Новости нездоровья

Можно ли иметь нормальный уровень витамина B12 и все равно страдать от последствий его дефицита? Можно!

Оказывается, дефицит B12 может быть не системным, а локализованным почти исключительно в центральной нервной системе. И обычный анализ крови в таком случае выглядит совершенно нормально.

В свежей работе в JAMA Neurology исследователи изучали пациентов с так называемой идиопатической миелопатией - поражением спинного мозга, причину которого не удавалось установить несмотря на подробное обследование. У части этих людей МРТ и симптомы подозрительно напоминали классический дефицит B12: страдали задние и боковые столбы спинного мозга. Но была одна проблема - B12 в крови у них был нормальным. Причем не на нижней границе: у пациентов с обнаруженным впоследствии механизмом средний B12 составлял около 655 pg/ml. Метилмалоновая кислота (MMA), которую обычно используют как более чувствительный маркер функционального дефицита B12, в крови тоже не отличалась.

Разгадкой оказались аутоантитела к CD320.
CD320 - это рецептор транскобаламина, то есть буквально один из механизмов, с помощью которых клетки получают связанный с транспортным белком витамин B12. Особенно интересен он на гематоэнцефалическом барьере, где участвует в доставке B12 из крови в мозг и спинной мозг. Аутоантитела связываются с CD320 и мешают этому транспорту.

В результате получается довольно экзотическая ситуация:
в крови B12 полно, а в центральную нервную систему он нормально не попадает.

Когда исследователи посмотрели не кровь, а ликвор, концентрация биологически активного B12 - холотранскобаламина - у пациентов с anti-CD320 действительно оказалась снижена: примерно 15.1 против 22.9 pmol/L у неврологических контролей. Более того, чем больше было антител, тем хуже выглядел перенос B12 из крови в ликвор; внутри ЦНС низкий holoTC также ассоциировался с повышением MMA, что уже указывает на настоящий функциональный дефицит витамина.

И это не единичная находка. В первой группе anti-CD320 нашли у 18 из 32 (56%) пациентов с идиопатической миелопатией. Затем результат воспроизвели еще в двух независимых группах: антитела обнаружились у 45% и 48% пациентов соответственно.

Есть еще одна важная ложка дегтя. Anti-CD320 - не специфический маркер болезни: авторы отмечают, что такие антитела обнаруживаются примерно у 6% здоровых людей. Кроме того, исследование ретроспективное и специально обогащено сложными случаями необъяснимой миелопатии, поэтому нельзя сделать вывод, что скрытый «мозговой дефицит B12» распространен у населения вообще.

Но сама концепция очень красивая: нормальная концентрация вещества в крови еще не означает нормальную доступность этого вещества конкретной ткани. Можно иметь нормальный B12. Можно иметь нормальную MMA. И при этом нервная система буквально может испытывать B12-дефицит из-за поломки транспорта через гематоэнцефалический барьер.

Статья: https://jamanetwork.com/journals/jamaneurology/fullarticle/2853049
👍82🔥1
Семь лет назад (как быстро время-то летит!) я написал статью про эпигенетические часы на тогда еще живом Медиуме. Настало время узнать, прошла ли она проверку временем, поэтому я поручил Claude Opus 5 (Extra) написать независимый анализ статьи.

Note: из моего опыта Claude Opus и Fable - наименее сикофантные модели и часто давали самые разгромные рецензии на мои научные статьи, над которыми сейчас работаю 😅

Выдержала ли проверку временем: разбор статьи об эпигенетических часах (2019)

Предмет разбора: Alexander Fedintsev, «Вся правда об эпигенетике и старении. Часть II. Эпигенетические часы», Reminder / Medium, 1 ноября 2019 г.

Метод: каждый содержательный аргумент статьи проверяется против того, что стало известно к августу 2026 года.

Коротко
Из шести самостоятельных аргументов пять держатся, один не держится. Главный вывод статьи остаётся в силе — но по причине, отличной от той, которую формулировал автор.
За семь лет поле не опровергло эти претензии, а переформулировало их в собственных терминах и начало систематически проверять. Дискуссия сместилась с вопроса «работают ли часы» на «какие именно часы, при каких вмешательствах и с каким минимальным клинически значимым сдвигом».

Аргумент 1. Перевод хазард-рацио в шкалу Гомперца
Что утверждалось. Пять лет ускорения по Хорвату дают +15% риска смерти (по Ханнуму +8%), тогда как пять настоящих лет по закону Гомперца при MRDT ≈ 8 лет дают +54%. Значит, пять «хорватовских лет» соответствуют примерно полутора–двум реальным годам, и показатель немногим ценнее паспортного возраста.
Вердикт: выдержал. Это лучшее место в тексте и редкий случай, когда абстрактное HR переводится в интерпретируемую величину. Вывод о слабом приращении к хронологическому возрасту стал общим местом.
Поправка против автора. Ускорение — это остаток после регрессии на хронологический возраст, то есть заведомо лишь межиндивидуальная часть дисперсии; сравнивать её напрямую с полным эффектом возраста некорректно. Плюс измерительный шум разбавляет оценку: показано, что технический шум даёт расхождения до 9 лет между репликатами одного образца (Higgins-Chen et al., Nature Aging, 2022). Истинная связь сильнее наблюдаемой.
Поправка в его пользу, появившаяся позже. Часть того, что он мерил как слабый сигнал, оказалась буквально шумом: часы первого поколения в значительной мере отражают стохастический эпигенетический дрейф (Tong et al. и Meyer & Schumacher, Nature Aging, 2024; подтверждено на продольных данных в Nature Medicine, 2026 — корреляция Horvath1 со своей стохастической компонентой R = 0.50 против R = −0.06 у PhenoAge).

Аргумент 2. Publication bias в мета-анализе
Что утверждалось. Асимметрия воронкообразного графика показывает, что отрицательные результаты не публиковались, поэтому реальная связь может быть ещё слабее заявленной.
Вердикт: выдержал. Аргумент по существу верный и редко озвучиваемый.
Оговорка. Асимметрия воронки не доказывает именно публикационное смещение: тот же паттерн дают small-study effects и гетерогенность выборок. Формулировка в статье жёстче, чем позволяет метод.

Аргумент 3. Дрейф эпигенетического возраста и ложные эффекты в pre/post-дизайне
Что утверждалось. При длительном наблюдении за одним человеком эпигенетический возраст сам по себе начинает отставать от хронологического. Значит, в дизайне «до/после» без контроля эффект интервенции можно получить из ничего.
Вердикт: выдержал лучше всех остальных. Это фактически предсказание, которое сбылось.
Крупнейший на сегодня анализ отзывчивости часов (Sehgal et al., Nature Medicine, август 2026, база TranslAGE из 51 исследования) построен именно на парных t-тестах pre/post, часто без контрольной группы; авторы сами признают отсутствие гармонизированного препроцессинга и коррекции батч-эффектов между исследованиями. Отдельно внутри поля появился препринт с говорящим названием «When to trust epigenetic clocks: avoiding false positives in aging interventions» (Borrus et al., 2024) — то есть проблема, обозначенная в 2019-м, стала легитимной темой.
👍1
Аргумент 4. Одометр: корреляция ≠ причинность
Что утверждалось. Пробег сильно коррелирует с состоянием автомобиля, но, скрутив счётчик, машине жизнь не продлишь. В подтверждение приводятся случаи расщепления показателя и исхода: фолиевая кислота с B12 снижают эпивозраст на 2.7 года, витамин D — на 1.8, при отсутствии влияния на смертность; потребление мяса птицы связано со снижением IEAA; у обезьян на ограничении калорийности эпивозраст меньше на 7 лет при выигрыше в продолжительности жизни максимум в пару лет.
Вердикт: суть выдержала, метафора требует уточнения.
Что в этом аргументе сильнее, чем подано. Пример с фолатом и B12 — самый мощный и недожатый. Это доноры метильных групп, то есть вещества, напрямую подающие субстрат в ту самую реакцию, которую часы и измеряют. Здесь скручивание счётчика — не аналогия, а буквальное описание механизма. Дизайн, в котором приём метильных доноров «омолаживает» на 2.7 года, дискредитирует показатель сам по себе, даже без апелляции к смертности.
Уточнение метафоры: вариантов три, а не два.

1. Одометр (пассивная запись прошлого) - часы 1-го поколения (Хорват, Ханнум)
2. Причина / медиатор (изменение показателя меняет исход) - пока никем не показано
3. Датчик текущего состояния (сжатый отчёт о том, что происходит сейчас) - часы 2-го поколения

Часы второго поколения похожи на третий вариант: они обучены на смертности и фенотипе, реагируют сильнее у больных, чем у здоровых, и завязаны на воспалительно-метаболический профиль — в GrimAgeV2 в обучающие признаки входит буквально CRP. Датчик температуры честно показывает перегрев, но по нему нельзя предсказать остаточный ресурс, и заклеивание стрелки ничего не лечит.
Ключевая переформулировка. Для роли суррогатной конечной точки причинность вообще не обязательна: нескручиваемый одометр был бы прекрасным суррогатом износа. Проблема ровно в скручиваемости — может ли вмешательство сдвинуть показатель, не сдвинув процесс. И скручиваемость уже доказана экспериментально: репрограммирование обнуляет часы Хорвата при сохранности соматических мутаций, а клетка при этом может стать опухолевой. Счётчик показывает ноль на машине, которая вот-вот развалится.

Чего рядом не хватает. Данных, бьющих в другую сторону. Карликовость Prop1df/df, ограничение калорийности и рапамицин делают мышей эпигенетически моложе контролей (Wang et al., Genome Biology, 2017). Правда, и там соответствие качественное, а не количественное: эффект CR устойчив на всех часах, рапамицина — на части данных не детектируется вовсе; зависимости «замедлил часы на X — получил +Y% ПЖ» не показал никто, медиационного анализа нет. Мыши уступают макакам в релевантности, но выигрывают в разрешении: полные кривые дожития, десятки вмешательств, репликация по трём центрам. На 197 приматах и двух несогласных друг с другом исследованиях количественную связь установить нельзя в принципе.

Аргумент 5. GrimAge — «корреляция на корреляции»
Что утверждалось. GrimAge построен на корреляции сайтов метилирования с биохимическими маркерами, которые сами коррелируют со смертностью, поэтому проблема причинности выражена в нём ещё сильнее.
Вердикт: не выдержал. Это единственный слабый абзац.
Способ построения модели ничего не говорит о её предсказательной валидности. GrimAge эмпирически предсказывает смертность и возраст-зависимые исходы лучше остальных часов (McCrory et al., J Gerontol A, 2021). Кроме того, этот абзац подрывает собственный гомперцевский аргумент автора: часы, обученные прямо на времени до смерти, — и есть ответ на претензию «15% вместо 54%». Возражение о причинности к GrimAge применимо, но оно другое по структуре и требует отдельного разбора, а не переноса аргументации, работавшей против часов Хорвата.
Аргумент 6. Главный вывод
Что утверждалось. Доказательств, что какой-либо метод определения биологического возраста годится для предсказания эффективности антивозрастных интервенций, нет; тратить деньги на коммерческие эпигенетические тесты не стоит.
Вердикт: выдержал буквально.
Комментируя работу августа 2026 года в Nature Medicine, Стив Хорват называет её первой систематической проверкой того, ведут ли себя метиляционные часы так, как положено суррогатной конечной точке. Сами авторы работы пишут, что отзывчивость на вмешательства — обязательное условие для статуса суррогата — до этого систематически не проверялась, и что отсутствие эмпирически определённого минимального клинически значимого различия остаётся ключевым барьером. Семь лет спустя вопрос всё ещё открыт.
Потребительская часть вывода держится даже крепче: к шуму добавились известные теперь эффекты клеточного состава крови, циркадных ритмов и острого стресса на показания часов.

Что появилось после статьи и меняет картину
Разделение поколений часов стало содержательным. Часы второго поколения обучались не на календарном возрасте, а на смертности и темпе старения, и ведут себя иначе. В анализе 51 исследования надёжные часы 2-го поколения (PCGrimAge, SystemsAge, DunedinPACE) показали согласованную реакцию на вмешательства, тогда как часы 1-го поколения меняли значение хаотично. Претензии статьи бьют прежде всего по Хорвату и Ханнуму, а под общий приговор в тексте попадает всё направление.

DunedinPACE уходит из-под метафоры. Он меряет не накопленный пробег, а текущий темп — это спидометр, а не одометр. Скрутить его так же легко, но упрёк «показывает только прошлое» к нему не липнет.

Появились прямые попытки ответить на возражение о причинности. Causality-enriched часы с отбором CpG через менделевскую рандомизацию, разделение на DamAge и AdaptAge (Ying et al., Nature Aging, 2024); PC-версии часов против технического шума. Правда, на продольных данных разделение «повреждение против адаптации» пока не сработало: большинство вмешательств двигают обе компоненты в одну сторону.

Слепые зоны статьи
Асимметрия требований. Строгий критерий суррогатности, применённый к часам, не применён к альтернативам. Функциональные маркеры и маркеры повреждений этот тест тоже не проходили. Честная общая формулировка — не «часы плохие, а повреждения хорошие», а «валидированного биомаркера старения не существует ни одного».
Асимметричный отбор животных данных. Приматный пример в статье есть, и модель выбрана удачно. Но взят он из работы, чей собственный вывод противоположен, без её мышиной половины и без мышиных данных по карликам и рапамицину — то есть в текст попало ровно то, что бьёт в одну сторону.
Не сформулирован решающий эксперимент. Он при этом довольно прост: измерить часы в середине жизни у когорты мышей, дожить когорту до конца и проверить, предсказывает ли индивидуальный сдвиг часов индивидуальную продолжительность жизни внутри одной группы лечения. Это и есть проверка критерия Прентиса — опосредует ли биомаркер эффект вмешательства на твёрдый исход.
Итоговая формулировка
Главный вывод статьи остаётся верным, но по другому основанию, чем предполагал автор. Дело не в том, что часы «просто счётчик»: часть из них — не счётчик, а сводный датчик текущего состояния. Дело в том, что показания демонстрируемо сдвигаются независимо от процесса, а количественной связи между величиной сдвига и приростом продолжительности жизни не установил никто.

Для текста на пять минут чтения, написанного за семь лет до появления первой систематической проверки суррогатности, это очень высокая точность попадания.
🔥9👍5💯3
Text watermarks for AI slop identification. Part I

По традиции разбавляем контент про старение постом про ИИ.

Многие наверняка слышали, что ИИ-компании планируют вводить (или уже ввели) вотермарки, чтобы контент, созданный при помощи их нейросетей, можно было идентифицировать. Но если с изображениями относительно понятно, как это можно было бы сделать, то как это сделать с текстом? Может быть, определенные LLM используют хитрые ASCII-символы? Или вставляют кодовые фразочки? Например, у меня Claude очень любит вставлять кринжатину наподобие
“your argument has teeth” :)
Но нет, эти методы крайне ненадежны, а гораздо более надежные методы уже давно придуманы учеными - и сегодня мы о них как раз поговорим. Начнем с простого метода, предложенного Kirchenbauer et al https://arxiv.org/pdf/2301.10226.
В самом простом варианте идея выглядит примерно так. В каждый момент LLM должна выбрать очередной токен из своего словаря - условно, из десятков тысяч вариантов. Перед этим мы псевдослучайным образом делим весь словарь на две группы: зеленую и красную.
Причем важно: токен не является зеленым или красным сам по себе. Один и тот же токен в одном месте текста может оказаться зеленым, а через два слова - красным. Разбиение зависит от предыдущего контекста. В самом простом proof-of-concept Kirchenbauer et al. берут предыдущий токен, вычисляют от него хэш и используют его как seed для генератора псевдослучайных чисел. По этому seed словарь делится на две половины. В более защищенной версии сюда добавляется секретный ключ, а функция может зависеть сразу от нескольких предыдущих токенов.
Дальше начинается матемагия. В hard-варианте красные токены просто запрещены: модель обязана выбрать следующий токен только среди зеленых. А теперь самое красивое: чтобы проверить текст, не нужно заново запускать нейросеть вообще. Достаточно знать алгоритм и ключ. Мы токенизируем текст, для каждой позиции воспроизводим то же самое псевдослучайное разбиение словаря и смотрим: оказался ли реально использованный токен зеленым или красным. Если обычный текст никак не знает о нашем секретном правиле, при разбиении 50/50 мы ожидаем примерно половину зеленых токенов. А вот watermarked-модель в hard-варианте дает практически 100%. То есть watermark - это не какая-то спрятанная строка «THIS TEXT WAS WRITTEN BY CLAUDE», а статистическое смещение, распределенное по всему тексту.
У hard-варианта, правда, есть очевидная проблема. Представим, что модель пишет Barack... и практически вся вероятность следующего токена приходится на Obama. Но вот незадача: сегодня по нашему псевдослучайному разбиению Obama оказался красным. Мы запрещаем модели его использовать - и она вынуждена писать какую-нибудь хрень. Особенно плохо это работает в так называемых low-entropy участках текста, где правильное продолжение практически однозначно: формулах, коде, именах, устойчивых выражениях и т. д. Поэтому была предложена soft-версия алгоритма. Красные токены теперь не запрещаются вообще. Вместо этого зеленым токенам перед softmax просто прибавляется константа к логиту.
👍4
И здесь получается очень элегантное свойство.
Если модель на 99% уверена, что следующим словом должно быть какое-то конкретное слово, небольшой бонус конкурентам почти ничего не изменит. Даже если правильный токен красный, он все равно, скорее всего, победит.
Но если модель выбирает между, условно, large, big, substantial, considerable и еще десятком примерно одинаково хороших продолжений, среди них начинают систематически побеждать зеленые.
То есть watermark преимущественно записывается именно туда, где у модели есть свобода выбора, а там, где свободы практически нет, алгоритм старается не ломать текст. Это резко уменьшает влияние watermark на качество.
После генерации мы снова считаем количество зеленых токенов и z-score. Только теперь мы уже не ожидаем 100% зеленых: нам достаточно статистически значимого избытка.  И вот здесь становится понятно одновременно, почему такая штука работает и почему она не является магией (но является матемагией).
Во-первых, чем длиннее текст, тем проще заметить watermark. Сигнал накапливается примерно линейно с числом токенов, тогда как случайные флуктуации растут как sqrt(T). Поэтому на тысяче токенов можно обнаружить совсем слабое смещение, которое совершенно невозможно увидеть глазами. Но обратная сторона та же самая: на очень коротком ответе статистической мощности просто может не хватить.

Во-вторых, остается проблема low-entropy текста. Если у модели почти нет выбора, то либо watermark слабый, либо приходится действительно ухудшать генерацию. Это не столько недостаток конкретного алгоритма Kirchenbauer, сколько фундаментальная проблема: нельзя спрятать много информации в выборе, которого фактически нет.
В-третьих, текст можно редактировать.
Если поменять слово, удалить предложение или вставить новый кусок, часть зеленых токенов исчезнет. Более того, поскольку цвет следующего токена зависит от предыдущего контекста, одна замена может сбить watermark еще на нескольких последующих позициях.
Казалось бы, тогда решение элементарное: берем текст Claude, просим GPT его полностью перефразировать - и watermark отправляется на помойку.
На практике все несколько интереснее. В следующей работе группа Kirchenbauer специально проверила человеческий и машинный paraphrasing. Watermark действительно становился слабее, но часто не исчезал полностью: куски исходных n-грамм переживают перефразирование, и на достаточно длинном тексте сигнал снова накапливается. В их экспериментах после сильного человеческого paraphrasing для уверенного обнаружения при очень низком false-positive rate требовалось в среднем порядка 800 токенов. https://arxiv.org/abs/2306.04634  

Но тут начинается классическая гонка вооружений. Если атакующий не просто тупо перефразирует текст, а пытается выяснить, какие именно токены алгоритм предпочитает, watermark можно удалять гораздо эффективнее. Уже появились color-aware атаки, которые статистически восстанавливают информацию о green/red-разбиении и затем целенаправленно заменяют зеленые токены. Но об этом в следующий раз
👍3
Новости лонжевити

Свеженькая, с пылу с жару статья в Nature с громким заголовком “Late-life semaglutide treatment slows ageing and extends lifespan in female mice”. То бишь лечение семаглутидом, начатое в пожилом возрасте, замедляет старение и продлевает жизнь мышам. Правда, исследовали почему-то только самок.

Причём эффект на продолжительность жизни получился вполне себе впечатляющим: семаглутид начали давать в возрасте 20 месяцев, а медианная ПЖ выросла с 742 до 834 дней - на 92 дня, или 12.4%.
На позитивных моментах исследования особо заострять внимание не будем - о них завтра напишут все популяризаторы и трансгуманисты (если уже не написали). Но сильные стороны у работы действительно есть:
- очень позднее начало терапии - 20 месяцев. Это действительно круто. Подобные результаты были только у рапамицина с акарбозой;
- приличная выборка в основном lifespan-эксперименте - около 40 животных на группу
- это нормальные старые мыши на обычном рационе, а не модель диабета или патологического ожирения. Поэтому результат гораздо интереснее именно с точки зрения геронтологии;
- измерили дофига всего: физическую работоспособность, координацию, память, метаболизм, нейрогенез, гемопоэтические стволовые клетки, воспаление, маркеры сенесценции, повреждения ДНК, экспрессию генов и т. д. Причём довольно много эффектов смотрит в одну сторону.
- и, что особенно хорошо, авторы не проигнорировали очевидное возражение «мыши просто меньше жрали»: семаглутид снижал потребление пищи примерно на 24%, поэтому они провели отдельный эксперимент с сопоставимым ограничением калорий. По некоторым параметрам CR и семаглутид работали похоже, а по исследовательскому поведению, пространственной памяти и контролю глюкозы семаглутид даже оказался лучше.

А теперь переходим к интересному.

Проблема №1. Мы не знаем, сколько из этих +12.4% дал собственно семаглутид. Это, пожалуй, главный недостаток lifespan-части работы. Эксперимент semaglutide vs calorie restriction длился пять месяцев и измерял healthspan, а не lifespan. То есть CR-мышей в этой части исследования не довели до естественной смерти. И это не какая-то придирка: сами авторы признают, что такой lifespan-эксперимент ещё идёт. Поэтому мы пока просто не знаем, сколько из дополнительных 92 дней обусловлено специфическим действием GLP-1RA, а сколько — тем фактом, что мышь хронически потребляла на четверть меньше калорий.

Проблема №2. Контроль жил подозрительно мало
Медиана контрольной группы - 742 дня. Например, в большом исследовании разных инбредных линий медианная ПЖ самок C57BL/6J составляла 866 дней.
И тут возникает несколько забавная картина:
контроль: 742 дня
семаглутид: 834 дня
исторический контроль из другой большой работы: 866 дней.

То есть мышей после «продления жизни на 12.4%» семаглутид фактически довёл примерно до той продолжительности жизни, которую C57BL/6J вполне способны демонстрировать вообще без лечения. Это заставляет задаться вопросом: мы действительно получили экстраординарное продление нормальной жизни или частично исправили нечто, из-за чего конкретная контрольная когорта жила необычно мало?

Проблема №3. Только самки, одна инбредная линия, одна лаборатория

Проблема №4. Огромное количество endpoints
С одной стороны, это достоинство исследования. С другой - классическая multiple comparisons problem.
Авторы проверяют десятки физиологических, клеточных и молекулярных показателей. При α=0.05\alpha=0.05, если проверить 50 абсолютно неработающих гипотез, в среднем получишь 2.5 «статистически значимых» результата просто случайно.
Я не нашёл в статье единой study-wide поправки на множественность всех этих фенотипических и молекулярных сравнений.
При этом главный survival result это почти не затрагивает: P=5.7×10^−6 настолько маленькое, что разумная поправка на множественность его не "съест".
5👍1
Проблема №5. «Улучшили hallmarks of aging» ≠ доказали замедление старения
Уменьшился p16, p21, SA-β-gal, воспаление, γ-H2AX; улучшились какие-то свойства стволовых клеток; выросли маркеры нейрогенеза - всё это действительно интересно.
Но здесь очень легко перепрыгнуть от
«у старой мыши улучшилось много связанных с возрастом показателей»
к
«мы замедлили сам процесс старения».
Это разные утверждения.
Например, улучшение glucose tolerance для GLP-1-агониста - не особенно загадочное свидетельство rejuvenation, а практически ожидаемый фармакологический эффект.
Снижение воспаления после уменьшения жировой массы тоже вполне может быть downstream-эффектом изменения метаболического состояния.
То же самое касается сенесцентных маркеров: уменьшение p16/p21/SA-β-gal ещё не означает, что семаглутид каким-то образом непосредственно «омолаживает» или удаляет сенесцентные клетки.
И ни один из обнаруженных молекулярных механизмов в этой работе, насколько я вижу, не показан как необходимый для продления жизни. То есть механизмов-кандидатов много, причинной цепочки пока нет.

Ну и, наконец, моя любимая проблема - перенос мышиной продолжительности жизни на человека

Здесь ситуация особенно забавная, потому что человеческие данные по смертности для семаглутида уже существуют.
В огромном исследовании SELECT участники на семаглутиде действительно умирали реже: all-cause mortality составила 4.3% против 5.2%, HR = 0.81, то есть hazard смерти снизился примерно на 19%.
Это очень хороший результат.
Правда, SELECT - это не эксперимент на здоровых долгожителях. Средний возраст участников был 61.6 года; все имели overweight/obesity и уже существующее cardiovascular disease. И наблюдали их медианно всего 3.3 года.
Но давайте сделаем максимально благоприятное для семаглутида предположение:
представим, что HR=0.81 сохранится не три года, а вообще всю оставшуюся жизнь.
Сколько это даст лет?
У человеческой смертности после среднего возраста hazard приблизительно растёт по Гомпертцу, удваиваясь примерно каждые 8 лет. Тогда снижение hazard в 0.81 раза эквивалентно примерно такому сдвигу mortality curve:
Δt=−8*ln⁡(0.81)/ln⁡(2)≈2.4 года.
Если учитывать, что лечение начинается примерно в 60 лет, а не действует с рождения, грубая оценка выигрыша в life expectancy получается скорее порядка 2 лет. То есть даже если невероятно щедро предположить, что наблюдавшееся в SELECT снижение смертности сохраняется десятилетиями, мы получаем примерно:
+2–2.5 года жизни, или где-то +2.5–3% от человеческой ПЖ порядка 80 лет.
А теперь возвращаемся к мышам:
742 → 834 дня = +12.4% к общей медианной ПЖ.
Уже примерно в четыре-пять раз больше в относительном выражении.
Но можно посмотреть ещё интереснее.
Лечение мышей начали в 20 месяцев - это примерно 609 дней.
Контрольная медиана смерти - 742 дня.
То есть в момент начала лечения у контрольной мыши до медианной смерти оставалось:
742 − 609 ≈ 133 дня.
На семаглутиде:
834 − 609 ≈ 225 дней.
Получается, что семаглутид увеличил оставшуюся медианную продолжительность жизни примерно на 69%.
Вот это уже совершенно дикий эффект.
Если бы мы увидели что-то подобное у людей, то начав давать препарат человеку в 60–65 лет, мы добавляли бы ему не два года, а условно ещё 15 лет жизни. Ничего даже отдалённо похожего человеческие данные пока не показывают.
Причём наши условные +2 года для человека - это ещё чрезвычайно оптимистичная экстраполяция: SELECT наблюдал HR=0.81 всего около трёх лет, а мы только что притворились, что он останется таким же ещё следующие двадцать с лишним лет.
Поэтому для меня эта статья - одновременно очень интересный результат и прекрасная иллюстрация того, почему проценты продления жизни мышей практически бессмысленно напрямую переносить на людей.
Семаглутид вполне может продлевать жизнь людям. Более того, снижение mortality в SELECT уже является куда более сильным аргументом в пользу этого, чем любые biomarkers of aging.
7👍1
Но если у мыши препарат даёт +12.4% всей жизни и почти +70% оставшейся жизни, а наблюдаемый человеческий mortality effect даже при крайне оптимистичной экстраполяции соответствует примерно +2.5–3% всей жизни, то очевидно, что перед нами не какой-то универсальный «коэффициент замедления старения».
У мышей и людей разная биология, разные причины смерти и совершенно разный относительный вклад отдельных патологических процессов.

Поэтому доказательств того, что он аналогичным образом «замедляет старение» человека, эта работа, разумеется, не даёт.
А вот насколько он реально способен продлевать человеческую жизнь - это, к счастью, вопрос, на который нам уже постепенно начинают отвечать человеческие RCT, а не мыши.


https://www.nature.com/articles/s41586-026-10940-7
9👍8🔥5👏2
ПОЧЕМУ ЛЕ КУН ОШИБАЛСЯ И Я ВМЕСТЕ С НИМ...

Вступил тут в дискуссию в ФБ, которая и навеяла данный пост 🙃 В этой дискуссии автор поста приводил аргумент, очень похожий на тот, который в далеком уже 2023 году приводил отец сверточных нейросетей - Ян ЛеКун. Именитый французский ученый писал примерно следующее: авторегрессионные модели - это тупик, поскольку вероятность правильного ответа экспоненциально затухает с ростом длины генерируемого текста 📉Чуть более года спустя Ле Кун был жестоко попущен вышла "рассуждающая" модель О1, которая генерила длиннющие цепочки рассуждений и при этом резко улучшила результаты на множестве сложных reasoning-бенчмарков. С тех пор этот тренд только набирает обороты. Так почему же Ле Кун был неправ? Тут нам поможет математика.

Процесс рассуждения можно смоделировать используя два состояния: Ct (находимся на правильной ветке) и Wt (неправильная ветка рассуждений). Пусть на каждом шаге вероятность сойти с правильной ветки рассуждения равна e. В случае модели Ле Куна вероятность оказаться в корректной ветке на шаге t+1 равна:

P(Ct+1) = (1-e)P(Ct), отсюда и получается (1-e)^n

К чему стремится такая система? Это можно узнать через стационарное состояние - такое состояние при котором вероятность не изменяется. Запишем его:

P = (1-e)P => P - (1-e)P = 0 => P = 0 для e > 0

Но давайте теперь дадим возможность бэктрекинга: Пусть, находясь на неправильной ветке Wt, на каждом следующем шаге модель с вероятностью r обнаруживает ошибку и возвращается на правильную ветку. Тогда:

P(Ct+1) = (1-e)P(Ct) + rP(Wt) = (1-e)P(Ct) + r(1 - P(Ct))

Выпишем стационарное состояние:

P = (1-e)P + r(1 - P) => P= (1-e)P + r -rP => P(1-1+e+r) = r =>
P = r/(e+r)

А вот это уже интересно! Получается что теперь вероятность находиться на правильной ветке не обязана стремиться к нулю вообще!
Возьмем, к примеру, e = 0.05, r = 0.5, тогда P = 0.909.

Самое интересное здесь даже не конкретное число. Посмотрим на формулу в немного переписанном виде:

P = 1 / (1 + e/r)

Получается, что в пределе всё определяется отношением частоты возникновения ошибок к способности их исправлять. Система может ошибаться сколько угодно раз - само по себе это ещё не означает, что длинное рассуждение обречено. Критично то, умеет ли она замечать собственные ошибки и возвращаться назад.

Отсюда вопрос: интересно, какая r у Ле Куна? 🤪
👍5😁3🔥2💯1