Если даже Карпаты говорит, что чувствует себя отстающим как программист - это хороший индикатор времени.
Профессия пересобирается. Мы больше не просто пишем код, а пытаемся связать воедино кучу стохастических, полупрозрачных систем: агенты, промпты, контексты, инструменты, интеграции. Новый слой появился очень быстро, и нормальной ментальной модели у него пока ни у кого нет.
Ощущение «я мог бы делать в разы больше, если бы правильно всё это связал» сейчас, кажется, общее. Это не про интеллект, а про скорость изменений.
https://x.com/karpathy/status/2004607146781278521
Профессия пересобирается. Мы больше не просто пишем код, а пытаемся связать воедино кучу стохастических, полупрозрачных систем: агенты, промпты, контексты, инструменты, интеграции. Новый слой появился очень быстро, и нормальной ментальной модели у него пока ни у кого нет.
Ощущение «я мог бы делать в разы больше, если бы правильно всё это связал» сейчас, кажется, общее. Это не про интеллект, а про скорость изменений.
https://x.com/karpathy/status/2004607146781278521
A curated directory of companies building the future.
https://www.buildlist.xyz/
https://www.buildlist.xyz/
AI stack:
--------------
Applications
--------------
Models
--------------
Infrastructure
--------------
Chips
--------------
Energy
--------------
--------------
Applications
--------------
Models
--------------
Infrastructure
--------------
Chips
--------------
Energy
--------------
Оптимизируй риск, а не доходность
Большинство инвесторов смотрят на потенциальную доходность. "Сколько я могу заработать?" - первый вопрос. Я бы сказал что это неправильный фокус.
На длинном горизонте risk/reward на рынках выровнен. Нет принципиальной разницы - инвестировать в недвижку или биткоин. Рынок всё выравнивает. Вопрос в другом: как именно ты понимаешь те или иные риски и какое у тебя есть преимущество в работе с ними.
Правильный подход - инвестировать туда, где у тебя есть преимущество в понимании рисков. Где ты видишь и знаешь больше чем остальные участники рынка.
Простой пример: инвестировать в российские компании для россиянина несёт меньше рисков чем для американца. Ты понимаешь контекст, читаешь новости на языке оригинала, чувствуешь настроения. Плюс у тебя нет инфраструктурных рисков - санкции, заморозка активов, проблемы с выводом средств. Для американского инвестора это реальные риски, для тебя их просто не существует. Это преимущество которым надо пользоваться.
То же работает в любой сфере:
• Если ты 10 лет в индустрии - ты видишь риски которые не видит новичок
• Если понимаешь технологию глубоко - можешь оценить реальную вероятность провала
• Если у тебя инсайд в рынок - ты знаешь то, чего не знают другие
Формула простая: ищи асимметрию в восприятии риска, а не в ожидаемой доходности. Инвестируй там, где твоя оценка рисков точнее чем у рынка.
Большинство инвесторов смотрят на потенциальную доходность. "Сколько я могу заработать?" - первый вопрос. Я бы сказал что это неправильный фокус.
На длинном горизонте risk/reward на рынках выровнен. Нет принципиальной разницы - инвестировать в недвижку или биткоин. Рынок всё выравнивает. Вопрос в другом: как именно ты понимаешь те или иные риски и какое у тебя есть преимущество в работе с ними.
Правильный подход - инвестировать туда, где у тебя есть преимущество в понимании рисков. Где ты видишь и знаешь больше чем остальные участники рынка.
Простой пример: инвестировать в российские компании для россиянина несёт меньше рисков чем для американца. Ты понимаешь контекст, читаешь новости на языке оригинала, чувствуешь настроения. Плюс у тебя нет инфраструктурных рисков - санкции, заморозка активов, проблемы с выводом средств. Для американского инвестора это реальные риски, для тебя их просто не существует. Это преимущество которым надо пользоваться.
То же работает в любой сфере:
• Если ты 10 лет в индустрии - ты видишь риски которые не видит новичок
• Если понимаешь технологию глубоко - можешь оценить реальную вероятность провала
• Если у тебя инсайд в рынок - ты знаешь то, чего не знают другие
Формула простая: ищи асимметрию в восприятии риска, а не в ожидаемой доходности. Инвестируй там, где твоя оценка рисков точнее чем у рынка.
Agent Teams в Claude Code - что реально изменилось
В Claude Code давно можно было запускать subagents - отдельные агенты на конкретные задачи. Работало просто: main агент даёт задачу, subagent делает, возвращает результат. Как начальник и исполнитель.
Agent Teams - это другая модель. Теперь агенты могут общаться друг с другом напрямую, спорить, координироваться сами без постоянного контроля сверху. По факту это переход от "я раздаю задачи" к "команда сама разбирается".
В чём конкретно разница
Subagents работают изолированно - сделал задачу, вернул результат, всё. Между собой они не общаются. Если один нашёл что-то важное для другого - никак это не передать напрямую.
В Agent Teams у каждого teammate свой контекст, но они видят общий task list и могут писать друг другу. Если security-агент нашёл проблему которая влияет на работу performance-агента - он ему напишет сам, без участия лида.
Где это реально полезно
Дебаг с неясной причиной. Запускаешь 5 агентов, каждый исследует свою гипотезу. Они не просто работают параллельно - они спорят между собой, пытаются опровергнуть теории друг друга. Это важно, потому что один агент склонен зацепиться за первую правдоподобную версию и не искать дальше.
Code review с разных углов. Три агента смотрят один PR: безопасность, перформанс, покрытие тестами. Каждый фокусируется на своём, но если security-агент видит что какой-то код влияет на перформанс - он сразу пингует коллегу.
Как использовать
Сначала включить в settings.json:
⠀
Потом описываешь задачу и команду:
⠀
Или для review:
⠀
Можно требовать план перед работой:
⠀
Что учитывать
Фича экспериментальная и жрёт токены - каждый teammate это отдельная сессия. Для простых последовательных задач обычный режим эффективнее. Agent Teams имеют смысл когда параллельная работа и общение между агентами реально добавляют ценность.
В Claude Code давно можно было запускать subagents - отдельные агенты на конкретные задачи. Работало просто: main агент даёт задачу, subagent делает, возвращает результат. Как начальник и исполнитель.
Agent Teams - это другая модель. Теперь агенты могут общаться друг с другом напрямую, спорить, координироваться сами без постоянного контроля сверху. По факту это переход от "я раздаю задачи" к "команда сама разбирается".
В чём конкретно разница
Subagents работают изолированно - сделал задачу, вернул результат, всё. Между собой они не общаются. Если один нашёл что-то важное для другого - никак это не передать напрямую.
В Agent Teams у каждого teammate свой контекст, но они видят общий task list и могут писать друг другу. Если security-агент нашёл проблему которая влияет на работу performance-агента - он ему напишет сам, без участия лида.
Где это реально полезно
Дебаг с неясной причиной. Запускаешь 5 агентов, каждый исследует свою гипотезу. Они не просто работают параллельно - они спорят между собой, пытаются опровергнуть теории друг друга. Это важно, потому что один агент склонен зацепиться за первую правдоподобную версию и не искать дальше.
Code review с разных углов. Три агента смотрят один PR: безопасность, перформанс, покрытие тестами. Каждый фокусируется на своём, но если security-агент видит что какой-то код влияет на перформанс - он сразу пингует коллегу.
Как использовать
Сначала включить в settings.json:
{
"env": {
"CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS": "1"
}
}
⠀
Потом описываешь задачу и команду:
Пользователи жалуются что приложение вылетает после первого сообщения.
Создай команду из 5 агентов - пусть каждый исследует свою гипотезу.
Они должны спорить друг с другом и пытаться опровергнуть теории друг друга.
⠀
Или для review:
Создай команду для review PR #142.
Один агент на безопасность, один на перформанс, один на тесты.
Пусть каждый сделает review и поделится находками с остальными.
⠀
Можно требовать план перед работой:
Создай architect teammate для рефакторинга auth модуля.
Требуй одобрения плана перед любыми изменениями.
⠀
Что учитывать
Фича экспериментальная и жрёт токены - каждый teammate это отдельная сессия. Для простых последовательных задач обычный режим эффективнее. Agent Teams имеют смысл когда параллельная работа и общение между агентами реально добавляют ценность.
Aggregation of uncertainties или iteration бьёт planning
Есть два типа систем.
Первые пытаются всё предсказать, спланировать, контролировать. Госплан. Пятилетние стратегии. Детальные бизнес-планы.
Вторые не притворяются что знают будущее. Рынки. Эволюция. Стартапы. Иммунная система.
Первые выглядят умнее. Вторые выигрывают.
Почему?
Каждое звено в цепочке решений содержит неопределённость. Неопределённости не складываются - они умножаются. 10 шагов по 90% уверенности = 35% в конце. Чем длиннее план, тем он бесполезнее.
Экономист Хайек писал в своё время: знание распределено. Его невозможно собрать в одной точке без потерь. Каждая передача информации вверх по иерархии - искажение. Поэтому госплан проиграл рынку - не потому что рынок умнее, а потому что он не врёт себе о том, что знает.
Стартапы бьют корпорации по той же причине. Не потому что основатели гениальнее менеджеров. А потому что стартап говорит "мы не знаем, давай проверим" - а корпорация говорит "мы провели исследование и знаем".
Эволюция работает без единого плана. Просто вариации + отбор. Иммунная система не знает какой вирус придёт - она готовится ко всему сразу.
Практический вывод: iteration > planning. Не потому что планировать плохо - а потому что реальность сложнее любой модели. Системы которые обнимают неопределённость, побеждают системы которые её отрицают.
И ещё одно следствие: чем выше неопределённость результата - тем меньше смысла в долгом планировании. Когда не знаешь что получится - лучше сделать и посмотреть.
Есть два типа систем.
Первые пытаются всё предсказать, спланировать, контролировать. Госплан. Пятилетние стратегии. Детальные бизнес-планы.
Вторые не притворяются что знают будущее. Рынки. Эволюция. Стартапы. Иммунная система.
Первые выглядят умнее. Вторые выигрывают.
Почему?
Каждое звено в цепочке решений содержит неопределённость. Неопределённости не складываются - они умножаются. 10 шагов по 90% уверенности = 35% в конце. Чем длиннее план, тем он бесполезнее.
Экономист Хайек писал в своё время: знание распределено. Его невозможно собрать в одной точке без потерь. Каждая передача информации вверх по иерархии - искажение. Поэтому госплан проиграл рынку - не потому что рынок умнее, а потому что он не врёт себе о том, что знает.
Стартапы бьют корпорации по той же причине. Не потому что основатели гениальнее менеджеров. А потому что стартап говорит "мы не знаем, давай проверим" - а корпорация говорит "мы провели исследование и знаем".
Эволюция работает без единого плана. Просто вариации + отбор. Иммунная система не знает какой вирус придёт - она готовится ко всему сразу.
Практический вывод: iteration > planning. Не потому что планировать плохо - а потому что реальность сложнее любой модели. Системы которые обнимают неопределённость, побеждают системы которые её отрицают.
И ещё одно следствие: чем выше неопределённость результата - тем меньше смысла в долгом планировании. Когда не знаешь что получится - лучше сделать и посмотреть.
Reinforcement learning у людей
Можно ли научиться чему-то, просто представляя это в голове?
В 1983 году психологи Фельц и Лэндерс собрали данные из 60 исследований на эту тему. Ответ: да. Ментальная практика реально улучшает навыки - от штрафных бросков до игры на фортепиано.
И это не магия. Когда ты представляешь движение, мозг активирует те же области что и при реальном действии. Просто сигнал не доходит до мышц. Но нейронные связи укрепляются.
По сути мозг - это симулятор с встроенным reinforcement learning:
• Строит модель мира
• Прогоняет сценарии
• Получает виртуальный фидбек
• Корректирует поведение
Я сам это использовал когда занимался борьбой. Лежишь вечером, глаза закрыты, и прокручиваешь в голове броски и как бы они получались при разных вводных. Не знал тогда что это называется motor imagery - просто чувствовал что помогает. Мой однокурсник Боря делал то же самое с ударами по мячу - прокручивал технику удара перед сном.
Шахматисты анализируют партии в уме, без доски. Пианисты "репетируют" пьесы не касаясь клавиш.
А осознанные сновидения - это вообще отдельный уровень. По сути это world model с которой можно взаимодействовать: полноценный симулятор реальности, где можно тренировать что угодно без последствий.
Почему это важно сейчас? Потому что AI идёт тем же путём.
В робототехнике давно поняли: тренировать робота в реальном мире - дорого, медленно, опасно. Поэтому сначала гоняют тысячи симуляций в Isaac Sim или MuJoCo, потом переносят на железо. Называется sim-to-real.
World models - одно из главных направлений в AI: научить модель предсказывать "что будет если" без реального взаимодействия со средой. По сути - построить внутренний симулятор мира.
Мы много лет думали что нейросетям нужны терабайты реального опыта. А оказывается достаточно хорошей модели мира и воображения.
Первый симулятор реальности появился не в Nvidia. Он появился в черепной коробке примерно 300 000 лет назад.
Можно ли научиться чему-то, просто представляя это в голове?
В 1983 году психологи Фельц и Лэндерс собрали данные из 60 исследований на эту тему. Ответ: да. Ментальная практика реально улучшает навыки - от штрафных бросков до игры на фортепиано.
И это не магия. Когда ты представляешь движение, мозг активирует те же области что и при реальном действии. Просто сигнал не доходит до мышц. Но нейронные связи укрепляются.
По сути мозг - это симулятор с встроенным reinforcement learning:
• Строит модель мира
• Прогоняет сценарии
• Получает виртуальный фидбек
• Корректирует поведение
Я сам это использовал когда занимался борьбой. Лежишь вечером, глаза закрыты, и прокручиваешь в голове броски и как бы они получались при разных вводных. Не знал тогда что это называется motor imagery - просто чувствовал что помогает. Мой однокурсник Боря делал то же самое с ударами по мячу - прокручивал технику удара перед сном.
Шахматисты анализируют партии в уме, без доски. Пианисты "репетируют" пьесы не касаясь клавиш.
А осознанные сновидения - это вообще отдельный уровень. По сути это world model с которой можно взаимодействовать: полноценный симулятор реальности, где можно тренировать что угодно без последствий.
Почему это важно сейчас? Потому что AI идёт тем же путём.
В робототехнике давно поняли: тренировать робота в реальном мире - дорого, медленно, опасно. Поэтому сначала гоняют тысячи симуляций в Isaac Sim или MuJoCo, потом переносят на железо. Называется sim-to-real.
World models - одно из главных направлений в AI: научить модель предсказывать "что будет если" без реального взаимодействия со средой. По сути - построить внутренний симулятор мира.
Мы много лет думали что нейросетям нужны терабайты реального опыта. А оказывается достаточно хорошей модели мира и воображения.
Первый симулятор реальности появился не в Nvidia. Он появился в черепной коробке примерно 300 000 лет назад.
Игра с нулевой суммой
Всё в мире уже кому-то принадлежит. Земля, ресурсы, рынки - всё поделено. Так было тысячу лет назад, так и сейчас.
Но раньше это означало одно: хочешь больше - отними у соседа.
Римляне строили империю не потому что были злыми. Просто другого способа расти не существовало. Нет технологий, нет роста производительности - значит богатство можно только перераспределять. Мечом.
Историки называют это мальтузианской ловушкой. Население растёт, ресурсы конечны, периодически случается война или эпидемия, население падает, цикл начинается заново. Тысячи лет одно и то же.
А потом что-то изменилось.
В Англии XVIII века люди начали строить машины. Ткацкие станки, паровые двигатели, железные дороги. Впервые производительность труда начала расти быстрее населения.
Это был момент, когда появился другой путь - не делить существующее, а создавать новое.
Твой прадед и его прадед жили примерно одинаково. А ты живёшь радикально иначе. Не потому что умнее - а потому что между вами несколько технологических революций. Каждая добавляла новые куски к общему пирогу.
Мы привыкли думать о мире как об арене конкуренции. Мой выигрыш - твой проигрыш. Но это не закон природы. Это следствие стагнации. Когда нового не появляется - остаётся только делить старое.
Проблема в том, что наш мозг эволюционировал именно в таком мире. Племя vs племя. Мы vs они. Ресурсы конечны, чужак опасен. Эти инстинкты никуда не делись.
Посмотри на риторику последних лет. Торговые войны. Протекционизм. Санкции. "Они крадут наши рабочие места". Это язык дефицита. Язык дележа. Когда рост замедляется - мы автоматически откатываемся к старым паттернам.
Но это временное помутнение.
AI, fusion, космос, биотех - следующая волна технологий уже здесь. Каждый прорыв создаёт новые куски пирога. Каждый скачок производительности делает конфликты менее привлекательными - проще создать, чем отнять.
Человечество всегда возвращается к росту. Иногда через кризисы, иногда через войны, но возвращается. Альтернатива - бесконечная дележка - слишком утомительна.
Всё в мире уже кому-то принадлежит. Земля, ресурсы, рынки - всё поделено. Так было тысячу лет назад, так и сейчас.
Но раньше это означало одно: хочешь больше - отними у соседа.
Римляне строили империю не потому что были злыми. Просто другого способа расти не существовало. Нет технологий, нет роста производительности - значит богатство можно только перераспределять. Мечом.
Историки называют это мальтузианской ловушкой. Население растёт, ресурсы конечны, периодически случается война или эпидемия, население падает, цикл начинается заново. Тысячи лет одно и то же.
А потом что-то изменилось.
В Англии XVIII века люди начали строить машины. Ткацкие станки, паровые двигатели, железные дороги. Впервые производительность труда начала расти быстрее населения.
Это был момент, когда появился другой путь - не делить существующее, а создавать новое.
Твой прадед и его прадед жили примерно одинаково. А ты живёшь радикально иначе. Не потому что умнее - а потому что между вами несколько технологических революций. Каждая добавляла новые куски к общему пирогу.
Мы привыкли думать о мире как об арене конкуренции. Мой выигрыш - твой проигрыш. Но это не закон природы. Это следствие стагнации. Когда нового не появляется - остаётся только делить старое.
Проблема в том, что наш мозг эволюционировал именно в таком мире. Племя vs племя. Мы vs они. Ресурсы конечны, чужак опасен. Эти инстинкты никуда не делись.
Посмотри на риторику последних лет. Торговые войны. Протекционизм. Санкции. "Они крадут наши рабочие места". Это язык дефицита. Язык дележа. Когда рост замедляется - мы автоматически откатываемся к старым паттернам.
Но это временное помутнение.
AI, fusion, космос, биотех - следующая волна технологий уже здесь. Каждый прорыв создаёт новые куски пирога. Каждый скачок производительности делает конфликты менее привлекательными - проще создать, чем отнять.
Человечество всегда возвращается к росту. Иногда через кризисы, иногда через войны, но возвращается. Альтернатива - бесконечная дележка - слишком утомительна.
Человек Ренессанса
Я заметил, что самые интересные люди вокруг - те, кого сложно описать одним словом. Спрашиваешь "чем занимаешься?" - и они мнутся, потому что честный ответ займёт минут пять.
Это раньше считалось проблемой. Не можешь сфокусироваться. Разбрасываешься. Шило в одном месте.
А сейчас я смотрю и думаю - может это и есть преимущество?
Система образования заточена под специализацию: выбери одно направление, копай глубоко, стань экспертом. Логика понятная - если ты знаешь одну вещь лучше всех, тебя наймут. Но по факту самые ценные решения появляются не в глубине одной области, а на пересечении нескольких.
Человек который понимает и код и дизайн строит продукты иначе, чем чистый разработчик. Кто-то с опытом в продажах и психологии видит клиента объёмнее, чем просто хороший сейлз. Странные комбинации навыков - это не баг, это фича.
Да Винчи занимался всем подряд - живопись, анатомия, инженерия, архитектура. Не потому что не мог выбрать, а потому что одно питало другое. Понимание анатомии делало его картины живыми. Художественный глаз помогал проектировать машины, которые были не только функциональными, но и красивыми.
Каждый интерес добавляет связей в голове. Чем больше связей - тем чаще замечаешь паттерны, которые другие пропускают. Это не про "знать всё по верхам" - это про способность видеть как вещи влияют друг на друга.
Если у тебя много разных интересов и ты всю жизнь чувствовал что с этим что-то не так - возможно, всё наоборот. Возможно, это и есть твой главный актив.
Я заметил, что самые интересные люди вокруг - те, кого сложно описать одним словом. Спрашиваешь "чем занимаешься?" - и они мнутся, потому что честный ответ займёт минут пять.
Это раньше считалось проблемой. Не можешь сфокусироваться. Разбрасываешься. Шило в одном месте.
А сейчас я смотрю и думаю - может это и есть преимущество?
Система образования заточена под специализацию: выбери одно направление, копай глубоко, стань экспертом. Логика понятная - если ты знаешь одну вещь лучше всех, тебя наймут. Но по факту самые ценные решения появляются не в глубине одной области, а на пересечении нескольких.
Человек который понимает и код и дизайн строит продукты иначе, чем чистый разработчик. Кто-то с опытом в продажах и психологии видит клиента объёмнее, чем просто хороший сейлз. Странные комбинации навыков - это не баг, это фича.
Да Винчи занимался всем подряд - живопись, анатомия, инженерия, архитектура. Не потому что не мог выбрать, а потому что одно питало другое. Понимание анатомии делало его картины живыми. Художественный глаз помогал проектировать машины, которые были не только функциональными, но и красивыми.
Каждый интерес добавляет связей в голове. Чем больше связей - тем чаще замечаешь паттерны, которые другие пропускают. Это не про "знать всё по верхам" - это про способность видеть как вещи влияют друг на друга.
Если у тебя много разных интересов и ты всю жизнь чувствовал что с этим что-то не так - возможно, всё наоборот. Возможно, это и есть твой главный актив.
World Models - следующий большой шаг
LLM понимают текст. Ты пишешь - они отвечают. Но спроси языковую модель что произойдёт если толкнуть стакан со стола - и она выдаст статистически вероятный ответ. Не потому что понимает физику, а потому что читала много текстов про падающие стаканы.
Это принципиальное ограничение. Языковые модели работают с токенами, не с реальностью.
World models - другой подход. Это AI который строит внутреннюю модель мира и может её симулировать. Не генерирует текст про физику, а понимает физику. Может предсказать что произойдёт если совершить действие X в контексте Y.
Кто этим занимается:
▫️ AMI Labs - Yann LeCun ушёл из Meta и поднимает €500M на стартап в Париже. Его тезис: LLM - тупиковая ветка для настоящего AI.
▫️ World Labs - Fei-Fei Li, "крёстная мать AI" из Стэнфорда. $230M от Andreessen Horowitz и Nvidia. Их продукт Marble генерирует интерактивные 3D миры.
▫️ DeepMind - Genie 3 создаёт интерактивные окружения, в которых можно тренировать AI-агентов.
▫️ Decart - израильский стартап, $21M от Sequoia. Их Oasis - полностью AI-сгенерированный Minecraft. Без кода, только нейросеть.
▫️ Odyssey - основатели из self-driving индустрии. Делают "интерактивное видео" - 3D миры из текста и картинок.
Практические применения уже видны. Sora от OpenAI учится понимать что объекты не исчезают когда выходят из кадра. Tesla FSD строит модель окружения и предсказывает поведение других машин. Роботам нужно понимать как предметы взаимодействуют в физическом мире.
Путь к AGI возможно лежит через комбинацию: LLM для общения на естественном языке, world models для понимания физического мира. Слои, не один универсальный алгоритм.
2026 - год когда world models перестают быть исследовательской темой и становятся продуктами.
LLM понимают текст. Ты пишешь - они отвечают. Но спроси языковую модель что произойдёт если толкнуть стакан со стола - и она выдаст статистически вероятный ответ. Не потому что понимает физику, а потому что читала много текстов про падающие стаканы.
Это принципиальное ограничение. Языковые модели работают с токенами, не с реальностью.
World models - другой подход. Это AI который строит внутреннюю модель мира и может её симулировать. Не генерирует текст про физику, а понимает физику. Может предсказать что произойдёт если совершить действие X в контексте Y.
Кто этим занимается:
▫️ AMI Labs - Yann LeCun ушёл из Meta и поднимает €500M на стартап в Париже. Его тезис: LLM - тупиковая ветка для настоящего AI.
▫️ World Labs - Fei-Fei Li, "крёстная мать AI" из Стэнфорда. $230M от Andreessen Horowitz и Nvidia. Их продукт Marble генерирует интерактивные 3D миры.
▫️ DeepMind - Genie 3 создаёт интерактивные окружения, в которых можно тренировать AI-агентов.
▫️ Decart - израильский стартап, $21M от Sequoia. Их Oasis - полностью AI-сгенерированный Minecraft. Без кода, только нейросеть.
▫️ Odyssey - основатели из self-driving индустрии. Делают "интерактивное видео" - 3D миры из текста и картинок.
Практические применения уже видны. Sora от OpenAI учится понимать что объекты не исчезают когда выходят из кадра. Tesla FSD строит модель окружения и предсказывает поведение других машин. Роботам нужно понимать как предметы взаимодействуют в физическом мире.
Путь к AGI возможно лежит через комбинацию: LLM для общения на естественном языке, world models для понимания физического мира. Слои, не один универсальный алгоритм.
2026 - год когда world models перестают быть исследовательской темой и становятся продуктами.
Как читать бенчмарки LLM
Каждую неделю кто-то выпускает новую модель, и каждая "побеждает на бенчмарках". OpenAI публикует таблицу где они впереди планеты всей, Anthropic - свою таблицу где лидируют они, Google - третью где побеждает Gemini. Маркетинговые войны в чистом виде. Но если копнуть глубже - бенчмарки реально полезная штука, просто нужно понимать что они измеряют и чему верить.
◾ Что вообще такое бенчмарк
Бенчмарк - это стандартизированный экзамен для AI-моделей. Набор задач с известными правильными ответами, по которым можно сравнивать разные модели между собой. Идея простая: дали 1000 вопросов, посчитали процент правильных - вот и результат.
Проблема в том, что бенчмарков развелось десятки, каждый измеряет что-то своё, и не все одинаково надёжны. Разберём что к чему.
⠀
◾ Главные категории
Все бенчмарки можно разбить на несколько больших групп:
• Общие знания - насколько модель "эрудированна" в разных областях
• Reasoning - способность к логическому рассуждению и выводам
• Код - умение писать работающий код
• Математика - решение задач от школьных до олимпиадных
• Мультимодальность - понимание изображений, диаграмм, графиков
• Человеческие предпочтения - нравятся ли ответы реальным пользователям
Каждую неделю кто-то выпускает новую модель, и каждая "побеждает на бенчмарках". OpenAI публикует таблицу где они впереди планеты всей, Anthropic - свою таблицу где лидируют они, Google - третью где побеждает Gemini. Маркетинговые войны в чистом виде. Но если копнуть глубже - бенчмарки реально полезная штука, просто нужно понимать что они измеряют и чему верить.
◾ Что вообще такое бенчмарк
Бенчмарк - это стандартизированный экзамен для AI-моделей. Набор задач с известными правильными ответами, по которым можно сравнивать разные модели между собой. Идея простая: дали 1000 вопросов, посчитали процент правильных - вот и результат.
Проблема в том, что бенчмарков развелось десятки, каждый измеряет что-то своё, и не все одинаково надёжны. Разберём что к чему.
⠀
◾ Главные категории
Все бенчмарки можно разбить на несколько больших групп:
• Общие знания - насколько модель "эрудированна" в разных областях
• Reasoning - способность к логическому рассуждению и выводам
• Код - умение писать работающий код
• Математика - решение задач от школьных до олимпиадных
• Мультимодальность - понимание изображений, диаграмм, графиков
• Человеческие предпочтения - нравятся ли ответы реальным пользователям
◾ Бенчмарки которые стоит знать
MMLU-Pro (Massive Multitask Language Understanding)
Тест на общую эрудицию: 57 предметов от элементарной математики до права, медицины и философии. Формат - multiple choice, но в Pro-версии не 4 варианта ответа, а 10, что сильно усложняет угадывание. Топовые модели сейчас набирают около 89-90% (лидирует Gemini 3 Pro с 90.1%). Полезен как базовый фильтр качества, но уже близок к насыщению - все сильные модели показывают похожие результаты в узком диапазоне.
GPQA Diamond (Graduate-Level Google-Proof Q&A)
Вопросы уровня аспирантуры по физике, химии и биологии. Название "Google-proof" означает что ответы нельзя просто нагуглить - нужно реально понимать материал на глубоком уровне. Важный контекст: эксперты с PhD в соответствующих областях набирают около 65%, а обычные люди с хорошим образованием - всего 34%. Когда бенчмарк только вышел, GPT-4 набирал 39%. Сейчас топовые модели перевалили за 78%. Один из лучших тестов на глубину понимания, а не просто запоминание фактов.
SWE-bench Verified
Пожалуй, самый практичный бенчмарк для тех кто работает с кодом. Это реальные GitHub issues из популярных open-source проектов - модель должна прочитать описание бага, разобраться в кодовой базе и сгенерировать патч который его фиксит. Не абстрактные алгоритмические задачки, а настоящая работа программиста с контекстом, зависимостями и легаси-кодом. Лидеры сейчас - Claude Opus 4.5 с 80.9% и GPT-5.2 с 80%. Интересно что на более сложной версии SWE-bench Pro те же модели набирают только ~23% - есть куда расти.
MATH
Математические задачи от школьного уровня до олимпиадного. Важно что это не просто "посчитай 2+2", а задачи требующие цепочки рассуждений: алгебра, геометрия, теория вероятностей, комбинаторика. Хороший индикатор reasoning-способностей модели.
MMLU-Pro (Massive Multitask Language Understanding)
Тест на общую эрудицию: 57 предметов от элементарной математики до права, медицины и философии. Формат - multiple choice, но в Pro-версии не 4 варианта ответа, а 10, что сильно усложняет угадывание. Топовые модели сейчас набирают около 89-90% (лидирует Gemini 3 Pro с 90.1%). Полезен как базовый фильтр качества, но уже близок к насыщению - все сильные модели показывают похожие результаты в узком диапазоне.
GPQA Diamond (Graduate-Level Google-Proof Q&A)
Вопросы уровня аспирантуры по физике, химии и биологии. Название "Google-proof" означает что ответы нельзя просто нагуглить - нужно реально понимать материал на глубоком уровне. Важный контекст: эксперты с PhD в соответствующих областях набирают около 65%, а обычные люди с хорошим образованием - всего 34%. Когда бенчмарк только вышел, GPT-4 набирал 39%. Сейчас топовые модели перевалили за 78%. Один из лучших тестов на глубину понимания, а не просто запоминание фактов.
SWE-bench Verified
Пожалуй, самый практичный бенчмарк для тех кто работает с кодом. Это реальные GitHub issues из популярных open-source проектов - модель должна прочитать описание бага, разобраться в кодовой базе и сгенерировать патч который его фиксит. Не абстрактные алгоритмические задачки, а настоящая работа программиста с контекстом, зависимостями и легаси-кодом. Лидеры сейчас - Claude Opus 4.5 с 80.9% и GPT-5.2 с 80%. Интересно что на более сложной версии SWE-bench Pro те же модели набирают только ~23% - есть куда расти.
MATH
Математические задачи от школьного уровня до олимпиадного. Важно что это не просто "посчитай 2+2", а задачи требующие цепочки рассуждений: алгебра, геометрия, теория вероятностей, комбинаторика. Хороший индикатор reasoning-способностей модели.
Chatbot Arena (LMSYS)
Отдельная история и, возможно, самый честный бенчмарк из всех. Работает просто: реальные пользователи задают вопрос двум анонимным моделям, видят оба ответа и выбирают какой лучше. Из миллионов таких голосов строится ELO-рейтинг как в шахматах. Сейчас на вершине Gemini 3 Pro с рейтингом 1492 и Claude Opus 4.6. Главное преимущество - этот бенчмарк нельзя "заоптимизировать", потому что это буквально предпочтения живых людей на реальных задачах.
ARC-AGI
Бенчмарк который AI до сих пор не может нормально решить. Это тесты на абстрактное мышление: показывают несколько примеров трансформации сетки (вход → выход), нужно понять паттерн и применить к новому входу. Звучит просто, но требует способности к обобщению которая у современных LLM пока слабая. Важен как индикатор фундаментальных ограничений текущих архитектур.
Humanity's Last Exam (HLE)
Новейший frontier-бенчмарк для по-настоящему сложных задач. Вопросы собраны от экспертов мирового уровня из разных областей - от квантовой физики до лингвистики древних языков. Идея в том, что если модель не может ответить на эти вопросы, её точно нельзя доверять для серьёзной экспертной работы без человеческого контроля.
Отдельная история и, возможно, самый честный бенчмарк из всех. Работает просто: реальные пользователи задают вопрос двум анонимным моделям, видят оба ответа и выбирают какой лучше. Из миллионов таких голосов строится ELO-рейтинг как в шахматах. Сейчас на вершине Gemini 3 Pro с рейтингом 1492 и Claude Opus 4.6. Главное преимущество - этот бенчмарк нельзя "заоптимизировать", потому что это буквально предпочтения живых людей на реальных задачах.
ARC-AGI
Бенчмарк который AI до сих пор не может нормально решить. Это тесты на абстрактное мышление: показывают несколько примеров трансформации сетки (вход → выход), нужно понять паттерн и применить к новому входу. Звучит просто, но требует способности к обобщению которая у современных LLM пока слабая. Важен как индикатор фундаментальных ограничений текущих архитектур.
Humanity's Last Exam (HLE)
Новейший frontier-бенчмарк для по-настоящему сложных задач. Вопросы собраны от экспертов мирового уровня из разных областей - от квантовой физики до лингвистики древних языков. Идея в том, что если модель не может ответить на эти вопросы, её точно нельзя доверять для серьёзной экспертной работы без человеческого контроля.
◾ Почему нельзя просто верить цифрам
Data contamination
Главная головная боль индустрии. Если тестовые вопросы случайно попали в обучающие данные, модель их просто "помнит", а не решает. Чем старше и популярнее бенчмарк, тем выше вероятность утечки в training data. Поэтому появляются обновлённые версии: MMLU → MMLU-Pro, LiveBench который обновляется каждый месяц свежими вопросами.
Оптимизация под метрики
Компании активно тюнят модели под конкретные бенчмарки - это факт жизни. 95% на каком-то тесте может означать что модель натаскали именно на этот формат задач, а на ваших реальных кейсах она будет работать хуже.
Разрыв между числами и практикой
Модель может блестяще решать задачки из бенчмарков, но при этом плохо следовать сложным инструкциям, генерировать странный текст или галлюцинировать факты. Стандартные бенчмарки не измеряют "вайб", удобство работы и практическую полезность для конкретных задач.
Data contamination
Главная головная боль индустрии. Если тестовые вопросы случайно попали в обучающие данные, модель их просто "помнит", а не решает. Чем старше и популярнее бенчмарк, тем выше вероятность утечки в training data. Поэтому появляются обновлённые версии: MMLU → MMLU-Pro, LiveBench который обновляется каждый месяц свежими вопросами.
Оптимизация под метрики
Компании активно тюнят модели под конкретные бенчмарки - это факт жизни. 95% на каком-то тесте может означать что модель натаскали именно на этот формат задач, а на ваших реальных кейсах она будет работать хуже.
Разрыв между числами и практикой
Модель может блестяще решать задачки из бенчмарков, но при этом плохо следовать сложным инструкциям, генерировать странный текст или галлюцинировать факты. Стандартные бенчмарки не измеряют "вайб", удобство работы и практическую полезность для конкретных задач.