A curated directory of companies building the future.
https://www.buildlist.xyz/
https://www.buildlist.xyz/
AI stack:
--------------
Applications
--------------
Models
--------------
Infrastructure
--------------
Chips
--------------
Energy
--------------
--------------
Applications
--------------
Models
--------------
Infrastructure
--------------
Chips
--------------
Energy
--------------
Оптимизируй риск, а не доходность
Большинство инвесторов смотрят на потенциальную доходность. "Сколько я могу заработать?" - первый вопрос. Я бы сказал что это неправильный фокус.
На длинном горизонте risk/reward на рынках выровнен. Нет принципиальной разницы - инвестировать в недвижку или биткоин. Рынок всё выравнивает. Вопрос в другом: как именно ты понимаешь те или иные риски и какое у тебя есть преимущество в работе с ними.
Правильный подход - инвестировать туда, где у тебя есть преимущество в понимании рисков. Где ты видишь и знаешь больше чем остальные участники рынка.
Простой пример: инвестировать в российские компании для россиянина несёт меньше рисков чем для американца. Ты понимаешь контекст, читаешь новости на языке оригинала, чувствуешь настроения. Плюс у тебя нет инфраструктурных рисков - санкции, заморозка активов, проблемы с выводом средств. Для американского инвестора это реальные риски, для тебя их просто не существует. Это преимущество которым надо пользоваться.
То же работает в любой сфере:
• Если ты 10 лет в индустрии - ты видишь риски которые не видит новичок
• Если понимаешь технологию глубоко - можешь оценить реальную вероятность провала
• Если у тебя инсайд в рынок - ты знаешь то, чего не знают другие
Формула простая: ищи асимметрию в восприятии риска, а не в ожидаемой доходности. Инвестируй там, где твоя оценка рисков точнее чем у рынка.
Большинство инвесторов смотрят на потенциальную доходность. "Сколько я могу заработать?" - первый вопрос. Я бы сказал что это неправильный фокус.
На длинном горизонте risk/reward на рынках выровнен. Нет принципиальной разницы - инвестировать в недвижку или биткоин. Рынок всё выравнивает. Вопрос в другом: как именно ты понимаешь те или иные риски и какое у тебя есть преимущество в работе с ними.
Правильный подход - инвестировать туда, где у тебя есть преимущество в понимании рисков. Где ты видишь и знаешь больше чем остальные участники рынка.
Простой пример: инвестировать в российские компании для россиянина несёт меньше рисков чем для американца. Ты понимаешь контекст, читаешь новости на языке оригинала, чувствуешь настроения. Плюс у тебя нет инфраструктурных рисков - санкции, заморозка активов, проблемы с выводом средств. Для американского инвестора это реальные риски, для тебя их просто не существует. Это преимущество которым надо пользоваться.
То же работает в любой сфере:
• Если ты 10 лет в индустрии - ты видишь риски которые не видит новичок
• Если понимаешь технологию глубоко - можешь оценить реальную вероятность провала
• Если у тебя инсайд в рынок - ты знаешь то, чего не знают другие
Формула простая: ищи асимметрию в восприятии риска, а не в ожидаемой доходности. Инвестируй там, где твоя оценка рисков точнее чем у рынка.
Agent Teams в Claude Code - что реально изменилось
В Claude Code давно можно было запускать subagents - отдельные агенты на конкретные задачи. Работало просто: main агент даёт задачу, subagent делает, возвращает результат. Как начальник и исполнитель.
Agent Teams - это другая модель. Теперь агенты могут общаться друг с другом напрямую, спорить, координироваться сами без постоянного контроля сверху. По факту это переход от "я раздаю задачи" к "команда сама разбирается".
В чём конкретно разница
Subagents работают изолированно - сделал задачу, вернул результат, всё. Между собой они не общаются. Если один нашёл что-то важное для другого - никак это не передать напрямую.
В Agent Teams у каждого teammate свой контекст, но они видят общий task list и могут писать друг другу. Если security-агент нашёл проблему которая влияет на работу performance-агента - он ему напишет сам, без участия лида.
Где это реально полезно
Дебаг с неясной причиной. Запускаешь 5 агентов, каждый исследует свою гипотезу. Они не просто работают параллельно - они спорят между собой, пытаются опровергнуть теории друг друга. Это важно, потому что один агент склонен зацепиться за первую правдоподобную версию и не искать дальше.
Code review с разных углов. Три агента смотрят один PR: безопасность, перформанс, покрытие тестами. Каждый фокусируется на своём, но если security-агент видит что какой-то код влияет на перформанс - он сразу пингует коллегу.
Как использовать
Сначала включить в settings.json:
⠀
Потом описываешь задачу и команду:
⠀
Или для review:
⠀
Можно требовать план перед работой:
⠀
Что учитывать
Фича экспериментальная и жрёт токены - каждый teammate это отдельная сессия. Для простых последовательных задач обычный режим эффективнее. Agent Teams имеют смысл когда параллельная работа и общение между агентами реально добавляют ценность.
В Claude Code давно можно было запускать subagents - отдельные агенты на конкретные задачи. Работало просто: main агент даёт задачу, subagent делает, возвращает результат. Как начальник и исполнитель.
Agent Teams - это другая модель. Теперь агенты могут общаться друг с другом напрямую, спорить, координироваться сами без постоянного контроля сверху. По факту это переход от "я раздаю задачи" к "команда сама разбирается".
В чём конкретно разница
Subagents работают изолированно - сделал задачу, вернул результат, всё. Между собой они не общаются. Если один нашёл что-то важное для другого - никак это не передать напрямую.
В Agent Teams у каждого teammate свой контекст, но они видят общий task list и могут писать друг другу. Если security-агент нашёл проблему которая влияет на работу performance-агента - он ему напишет сам, без участия лида.
Где это реально полезно
Дебаг с неясной причиной. Запускаешь 5 агентов, каждый исследует свою гипотезу. Они не просто работают параллельно - они спорят между собой, пытаются опровергнуть теории друг друга. Это важно, потому что один агент склонен зацепиться за первую правдоподобную версию и не искать дальше.
Code review с разных углов. Три агента смотрят один PR: безопасность, перформанс, покрытие тестами. Каждый фокусируется на своём, но если security-агент видит что какой-то код влияет на перформанс - он сразу пингует коллегу.
Как использовать
Сначала включить в settings.json:
{
"env": {
"CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS": "1"
}
}
⠀
Потом описываешь задачу и команду:
Пользователи жалуются что приложение вылетает после первого сообщения.
Создай команду из 5 агентов - пусть каждый исследует свою гипотезу.
Они должны спорить друг с другом и пытаться опровергнуть теории друг друга.
⠀
Или для review:
Создай команду для review PR #142.
Один агент на безопасность, один на перформанс, один на тесты.
Пусть каждый сделает review и поделится находками с остальными.
⠀
Можно требовать план перед работой:
Создай architect teammate для рефакторинга auth модуля.
Требуй одобрения плана перед любыми изменениями.
⠀
Что учитывать
Фича экспериментальная и жрёт токены - каждый teammate это отдельная сессия. Для простых последовательных задач обычный режим эффективнее. Agent Teams имеют смысл когда параллельная работа и общение между агентами реально добавляют ценность.
Aggregation of uncertainties или iteration бьёт planning
Есть два типа систем.
Первые пытаются всё предсказать, спланировать, контролировать. Госплан. Пятилетние стратегии. Детальные бизнес-планы.
Вторые не притворяются что знают будущее. Рынки. Эволюция. Стартапы. Иммунная система.
Первые выглядят умнее. Вторые выигрывают.
Почему?
Каждое звено в цепочке решений содержит неопределённость. Неопределённости не складываются - они умножаются. 10 шагов по 90% уверенности = 35% в конце. Чем длиннее план, тем он бесполезнее.
Экономист Хайек писал в своё время: знание распределено. Его невозможно собрать в одной точке без потерь. Каждая передача информации вверх по иерархии - искажение. Поэтому госплан проиграл рынку - не потому что рынок умнее, а потому что он не врёт себе о том, что знает.
Стартапы бьют корпорации по той же причине. Не потому что основатели гениальнее менеджеров. А потому что стартап говорит "мы не знаем, давай проверим" - а корпорация говорит "мы провели исследование и знаем".
Эволюция работает без единого плана. Просто вариации + отбор. Иммунная система не знает какой вирус придёт - она готовится ко всему сразу.
Практический вывод: iteration > planning. Не потому что планировать плохо - а потому что реальность сложнее любой модели. Системы которые обнимают неопределённость, побеждают системы которые её отрицают.
И ещё одно следствие: чем выше неопределённость результата - тем меньше смысла в долгом планировании. Когда не знаешь что получится - лучше сделать и посмотреть.
Есть два типа систем.
Первые пытаются всё предсказать, спланировать, контролировать. Госплан. Пятилетние стратегии. Детальные бизнес-планы.
Вторые не притворяются что знают будущее. Рынки. Эволюция. Стартапы. Иммунная система.
Первые выглядят умнее. Вторые выигрывают.
Почему?
Каждое звено в цепочке решений содержит неопределённость. Неопределённости не складываются - они умножаются. 10 шагов по 90% уверенности = 35% в конце. Чем длиннее план, тем он бесполезнее.
Экономист Хайек писал в своё время: знание распределено. Его невозможно собрать в одной точке без потерь. Каждая передача информации вверх по иерархии - искажение. Поэтому госплан проиграл рынку - не потому что рынок умнее, а потому что он не врёт себе о том, что знает.
Стартапы бьют корпорации по той же причине. Не потому что основатели гениальнее менеджеров. А потому что стартап говорит "мы не знаем, давай проверим" - а корпорация говорит "мы провели исследование и знаем".
Эволюция работает без единого плана. Просто вариации + отбор. Иммунная система не знает какой вирус придёт - она готовится ко всему сразу.
Практический вывод: iteration > planning. Не потому что планировать плохо - а потому что реальность сложнее любой модели. Системы которые обнимают неопределённость, побеждают системы которые её отрицают.
И ещё одно следствие: чем выше неопределённость результата - тем меньше смысла в долгом планировании. Когда не знаешь что получится - лучше сделать и посмотреть.
Reinforcement learning у людей
Можно ли научиться чему-то, просто представляя это в голове?
В 1983 году психологи Фельц и Лэндерс собрали данные из 60 исследований на эту тему. Ответ: да. Ментальная практика реально улучшает навыки - от штрафных бросков до игры на фортепиано.
И это не магия. Когда ты представляешь движение, мозг активирует те же области что и при реальном действии. Просто сигнал не доходит до мышц. Но нейронные связи укрепляются.
По сути мозг - это симулятор с встроенным reinforcement learning:
• Строит модель мира
• Прогоняет сценарии
• Получает виртуальный фидбек
• Корректирует поведение
Я сам это использовал когда занимался борьбой. Лежишь вечером, глаза закрыты, и прокручиваешь в голове броски и как бы они получались при разных вводных. Не знал тогда что это называется motor imagery - просто чувствовал что помогает. Мой однокурсник Боря делал то же самое с ударами по мячу - прокручивал технику удара перед сном.
Шахматисты анализируют партии в уме, без доски. Пианисты "репетируют" пьесы не касаясь клавиш.
А осознанные сновидения - это вообще отдельный уровень. По сути это world model с которой можно взаимодействовать: полноценный симулятор реальности, где можно тренировать что угодно без последствий.
Почему это важно сейчас? Потому что AI идёт тем же путём.
В робототехнике давно поняли: тренировать робота в реальном мире - дорого, медленно, опасно. Поэтому сначала гоняют тысячи симуляций в Isaac Sim или MuJoCo, потом переносят на железо. Называется sim-to-real.
World models - одно из главных направлений в AI: научить модель предсказывать "что будет если" без реального взаимодействия со средой. По сути - построить внутренний симулятор мира.
Мы много лет думали что нейросетям нужны терабайты реального опыта. А оказывается достаточно хорошей модели мира и воображения.
Первый симулятор реальности появился не в Nvidia. Он появился в черепной коробке примерно 300 000 лет назад.
Можно ли научиться чему-то, просто представляя это в голове?
В 1983 году психологи Фельц и Лэндерс собрали данные из 60 исследований на эту тему. Ответ: да. Ментальная практика реально улучшает навыки - от штрафных бросков до игры на фортепиано.
И это не магия. Когда ты представляешь движение, мозг активирует те же области что и при реальном действии. Просто сигнал не доходит до мышц. Но нейронные связи укрепляются.
По сути мозг - это симулятор с встроенным reinforcement learning:
• Строит модель мира
• Прогоняет сценарии
• Получает виртуальный фидбек
• Корректирует поведение
Я сам это использовал когда занимался борьбой. Лежишь вечером, глаза закрыты, и прокручиваешь в голове броски и как бы они получались при разных вводных. Не знал тогда что это называется motor imagery - просто чувствовал что помогает. Мой однокурсник Боря делал то же самое с ударами по мячу - прокручивал технику удара перед сном.
Шахматисты анализируют партии в уме, без доски. Пианисты "репетируют" пьесы не касаясь клавиш.
А осознанные сновидения - это вообще отдельный уровень. По сути это world model с которой можно взаимодействовать: полноценный симулятор реальности, где можно тренировать что угодно без последствий.
Почему это важно сейчас? Потому что AI идёт тем же путём.
В робототехнике давно поняли: тренировать робота в реальном мире - дорого, медленно, опасно. Поэтому сначала гоняют тысячи симуляций в Isaac Sim или MuJoCo, потом переносят на железо. Называется sim-to-real.
World models - одно из главных направлений в AI: научить модель предсказывать "что будет если" без реального взаимодействия со средой. По сути - построить внутренний симулятор мира.
Мы много лет думали что нейросетям нужны терабайты реального опыта. А оказывается достаточно хорошей модели мира и воображения.
Первый симулятор реальности появился не в Nvidia. Он появился в черепной коробке примерно 300 000 лет назад.
Игра с нулевой суммой
Всё в мире уже кому-то принадлежит. Земля, ресурсы, рынки - всё поделено. Так было тысячу лет назад, так и сейчас.
Но раньше это означало одно: хочешь больше - отними у соседа.
Римляне строили империю не потому что были злыми. Просто другого способа расти не существовало. Нет технологий, нет роста производительности - значит богатство можно только перераспределять. Мечом.
Историки называют это мальтузианской ловушкой. Население растёт, ресурсы конечны, периодически случается война или эпидемия, население падает, цикл начинается заново. Тысячи лет одно и то же.
А потом что-то изменилось.
В Англии XVIII века люди начали строить машины. Ткацкие станки, паровые двигатели, железные дороги. Впервые производительность труда начала расти быстрее населения.
Это был момент, когда появился другой путь - не делить существующее, а создавать новое.
Твой прадед и его прадед жили примерно одинаково. А ты живёшь радикально иначе. Не потому что умнее - а потому что между вами несколько технологических революций. Каждая добавляла новые куски к общему пирогу.
Мы привыкли думать о мире как об арене конкуренции. Мой выигрыш - твой проигрыш. Но это не закон природы. Это следствие стагнации. Когда нового не появляется - остаётся только делить старое.
Проблема в том, что наш мозг эволюционировал именно в таком мире. Племя vs племя. Мы vs они. Ресурсы конечны, чужак опасен. Эти инстинкты никуда не делись.
Посмотри на риторику последних лет. Торговые войны. Протекционизм. Санкции. "Они крадут наши рабочие места". Это язык дефицита. Язык дележа. Когда рост замедляется - мы автоматически откатываемся к старым паттернам.
Но это временное помутнение.
AI, fusion, космос, биотех - следующая волна технологий уже здесь. Каждый прорыв создаёт новые куски пирога. Каждый скачок производительности делает конфликты менее привлекательными - проще создать, чем отнять.
Человечество всегда возвращается к росту. Иногда через кризисы, иногда через войны, но возвращается. Альтернатива - бесконечная дележка - слишком утомительна.
Всё в мире уже кому-то принадлежит. Земля, ресурсы, рынки - всё поделено. Так было тысячу лет назад, так и сейчас.
Но раньше это означало одно: хочешь больше - отними у соседа.
Римляне строили империю не потому что были злыми. Просто другого способа расти не существовало. Нет технологий, нет роста производительности - значит богатство можно только перераспределять. Мечом.
Историки называют это мальтузианской ловушкой. Население растёт, ресурсы конечны, периодически случается война или эпидемия, население падает, цикл начинается заново. Тысячи лет одно и то же.
А потом что-то изменилось.
В Англии XVIII века люди начали строить машины. Ткацкие станки, паровые двигатели, железные дороги. Впервые производительность труда начала расти быстрее населения.
Это был момент, когда появился другой путь - не делить существующее, а создавать новое.
Твой прадед и его прадед жили примерно одинаково. А ты живёшь радикально иначе. Не потому что умнее - а потому что между вами несколько технологических революций. Каждая добавляла новые куски к общему пирогу.
Мы привыкли думать о мире как об арене конкуренции. Мой выигрыш - твой проигрыш. Но это не закон природы. Это следствие стагнации. Когда нового не появляется - остаётся только делить старое.
Проблема в том, что наш мозг эволюционировал именно в таком мире. Племя vs племя. Мы vs они. Ресурсы конечны, чужак опасен. Эти инстинкты никуда не делись.
Посмотри на риторику последних лет. Торговые войны. Протекционизм. Санкции. "Они крадут наши рабочие места". Это язык дефицита. Язык дележа. Когда рост замедляется - мы автоматически откатываемся к старым паттернам.
Но это временное помутнение.
AI, fusion, космос, биотех - следующая волна технологий уже здесь. Каждый прорыв создаёт новые куски пирога. Каждый скачок производительности делает конфликты менее привлекательными - проще создать, чем отнять.
Человечество всегда возвращается к росту. Иногда через кризисы, иногда через войны, но возвращается. Альтернатива - бесконечная дележка - слишком утомительна.
Человек Ренессанса
Я заметил, что самые интересные люди вокруг - те, кого сложно описать одним словом. Спрашиваешь "чем занимаешься?" - и они мнутся, потому что честный ответ займёт минут пять.
Это раньше считалось проблемой. Не можешь сфокусироваться. Разбрасываешься. Шило в одном месте.
А сейчас я смотрю и думаю - может это и есть преимущество?
Система образования заточена под специализацию: выбери одно направление, копай глубоко, стань экспертом. Логика понятная - если ты знаешь одну вещь лучше всех, тебя наймут. Но по факту самые ценные решения появляются не в глубине одной области, а на пересечении нескольких.
Человек который понимает и код и дизайн строит продукты иначе, чем чистый разработчик. Кто-то с опытом в продажах и психологии видит клиента объёмнее, чем просто хороший сейлз. Странные комбинации навыков - это не баг, это фича.
Да Винчи занимался всем подряд - живопись, анатомия, инженерия, архитектура. Не потому что не мог выбрать, а потому что одно питало другое. Понимание анатомии делало его картины живыми. Художественный глаз помогал проектировать машины, которые были не только функциональными, но и красивыми.
Каждый интерес добавляет связей в голове. Чем больше связей - тем чаще замечаешь паттерны, которые другие пропускают. Это не про "знать всё по верхам" - это про способность видеть как вещи влияют друг на друга.
Если у тебя много разных интересов и ты всю жизнь чувствовал что с этим что-то не так - возможно, всё наоборот. Возможно, это и есть твой главный актив.
Я заметил, что самые интересные люди вокруг - те, кого сложно описать одним словом. Спрашиваешь "чем занимаешься?" - и они мнутся, потому что честный ответ займёт минут пять.
Это раньше считалось проблемой. Не можешь сфокусироваться. Разбрасываешься. Шило в одном месте.
А сейчас я смотрю и думаю - может это и есть преимущество?
Система образования заточена под специализацию: выбери одно направление, копай глубоко, стань экспертом. Логика понятная - если ты знаешь одну вещь лучше всех, тебя наймут. Но по факту самые ценные решения появляются не в глубине одной области, а на пересечении нескольких.
Человек который понимает и код и дизайн строит продукты иначе, чем чистый разработчик. Кто-то с опытом в продажах и психологии видит клиента объёмнее, чем просто хороший сейлз. Странные комбинации навыков - это не баг, это фича.
Да Винчи занимался всем подряд - живопись, анатомия, инженерия, архитектура. Не потому что не мог выбрать, а потому что одно питало другое. Понимание анатомии делало его картины живыми. Художественный глаз помогал проектировать машины, которые были не только функциональными, но и красивыми.
Каждый интерес добавляет связей в голове. Чем больше связей - тем чаще замечаешь паттерны, которые другие пропускают. Это не про "знать всё по верхам" - это про способность видеть как вещи влияют друг на друга.
Если у тебя много разных интересов и ты всю жизнь чувствовал что с этим что-то не так - возможно, всё наоборот. Возможно, это и есть твой главный актив.
World Models - следующий большой шаг
LLM понимают текст. Ты пишешь - они отвечают. Но спроси языковую модель что произойдёт если толкнуть стакан со стола - и она выдаст статистически вероятный ответ. Не потому что понимает физику, а потому что читала много текстов про падающие стаканы.
Это принципиальное ограничение. Языковые модели работают с токенами, не с реальностью.
World models - другой подход. Это AI который строит внутреннюю модель мира и может её симулировать. Не генерирует текст про физику, а понимает физику. Может предсказать что произойдёт если совершить действие X в контексте Y.
Кто этим занимается:
▫️ AMI Labs - Yann LeCun ушёл из Meta и поднимает €500M на стартап в Париже. Его тезис: LLM - тупиковая ветка для настоящего AI.
▫️ World Labs - Fei-Fei Li, "крёстная мать AI" из Стэнфорда. $230M от Andreessen Horowitz и Nvidia. Их продукт Marble генерирует интерактивные 3D миры.
▫️ DeepMind - Genie 3 создаёт интерактивные окружения, в которых можно тренировать AI-агентов.
▫️ Decart - израильский стартап, $21M от Sequoia. Их Oasis - полностью AI-сгенерированный Minecraft. Без кода, только нейросеть.
▫️ Odyssey - основатели из self-driving индустрии. Делают "интерактивное видео" - 3D миры из текста и картинок.
Практические применения уже видны. Sora от OpenAI учится понимать что объекты не исчезают когда выходят из кадра. Tesla FSD строит модель окружения и предсказывает поведение других машин. Роботам нужно понимать как предметы взаимодействуют в физическом мире.
Путь к AGI возможно лежит через комбинацию: LLM для общения на естественном языке, world models для понимания физического мира. Слои, не один универсальный алгоритм.
2026 - год когда world models перестают быть исследовательской темой и становятся продуктами.
LLM понимают текст. Ты пишешь - они отвечают. Но спроси языковую модель что произойдёт если толкнуть стакан со стола - и она выдаст статистически вероятный ответ. Не потому что понимает физику, а потому что читала много текстов про падающие стаканы.
Это принципиальное ограничение. Языковые модели работают с токенами, не с реальностью.
World models - другой подход. Это AI который строит внутреннюю модель мира и может её симулировать. Не генерирует текст про физику, а понимает физику. Может предсказать что произойдёт если совершить действие X в контексте Y.
Кто этим занимается:
▫️ AMI Labs - Yann LeCun ушёл из Meta и поднимает €500M на стартап в Париже. Его тезис: LLM - тупиковая ветка для настоящего AI.
▫️ World Labs - Fei-Fei Li, "крёстная мать AI" из Стэнфорда. $230M от Andreessen Horowitz и Nvidia. Их продукт Marble генерирует интерактивные 3D миры.
▫️ DeepMind - Genie 3 создаёт интерактивные окружения, в которых можно тренировать AI-агентов.
▫️ Decart - израильский стартап, $21M от Sequoia. Их Oasis - полностью AI-сгенерированный Minecraft. Без кода, только нейросеть.
▫️ Odyssey - основатели из self-driving индустрии. Делают "интерактивное видео" - 3D миры из текста и картинок.
Практические применения уже видны. Sora от OpenAI учится понимать что объекты не исчезают когда выходят из кадра. Tesla FSD строит модель окружения и предсказывает поведение других машин. Роботам нужно понимать как предметы взаимодействуют в физическом мире.
Путь к AGI возможно лежит через комбинацию: LLM для общения на естественном языке, world models для понимания физического мира. Слои, не один универсальный алгоритм.
2026 - год когда world models перестают быть исследовательской темой и становятся продуктами.
Как читать бенчмарки LLM
Каждую неделю кто-то выпускает новую модель, и каждая "побеждает на бенчмарках". OpenAI публикует таблицу где они впереди планеты всей, Anthropic - свою таблицу где лидируют они, Google - третью где побеждает Gemini. Маркетинговые войны в чистом виде. Но если копнуть глубже - бенчмарки реально полезная штука, просто нужно понимать что они измеряют и чему верить.
◾ Что вообще такое бенчмарк
Бенчмарк - это стандартизированный экзамен для AI-моделей. Набор задач с известными правильными ответами, по которым можно сравнивать разные модели между собой. Идея простая: дали 1000 вопросов, посчитали процент правильных - вот и результат.
Проблема в том, что бенчмарков развелось десятки, каждый измеряет что-то своё, и не все одинаково надёжны. Разберём что к чему.
⠀
◾ Главные категории
Все бенчмарки можно разбить на несколько больших групп:
• Общие знания - насколько модель "эрудированна" в разных областях
• Reasoning - способность к логическому рассуждению и выводам
• Код - умение писать работающий код
• Математика - решение задач от школьных до олимпиадных
• Мультимодальность - понимание изображений, диаграмм, графиков
• Человеческие предпочтения - нравятся ли ответы реальным пользователям
Каждую неделю кто-то выпускает новую модель, и каждая "побеждает на бенчмарках". OpenAI публикует таблицу где они впереди планеты всей, Anthropic - свою таблицу где лидируют они, Google - третью где побеждает Gemini. Маркетинговые войны в чистом виде. Но если копнуть глубже - бенчмарки реально полезная штука, просто нужно понимать что они измеряют и чему верить.
◾ Что вообще такое бенчмарк
Бенчмарк - это стандартизированный экзамен для AI-моделей. Набор задач с известными правильными ответами, по которым можно сравнивать разные модели между собой. Идея простая: дали 1000 вопросов, посчитали процент правильных - вот и результат.
Проблема в том, что бенчмарков развелось десятки, каждый измеряет что-то своё, и не все одинаково надёжны. Разберём что к чему.
⠀
◾ Главные категории
Все бенчмарки можно разбить на несколько больших групп:
• Общие знания - насколько модель "эрудированна" в разных областях
• Reasoning - способность к логическому рассуждению и выводам
• Код - умение писать работающий код
• Математика - решение задач от школьных до олимпиадных
• Мультимодальность - понимание изображений, диаграмм, графиков
• Человеческие предпочтения - нравятся ли ответы реальным пользователям
◾ Бенчмарки которые стоит знать
MMLU-Pro (Massive Multitask Language Understanding)
Тест на общую эрудицию: 57 предметов от элементарной математики до права, медицины и философии. Формат - multiple choice, но в Pro-версии не 4 варианта ответа, а 10, что сильно усложняет угадывание. Топовые модели сейчас набирают около 89-90% (лидирует Gemini 3 Pro с 90.1%). Полезен как базовый фильтр качества, но уже близок к насыщению - все сильные модели показывают похожие результаты в узком диапазоне.
GPQA Diamond (Graduate-Level Google-Proof Q&A)
Вопросы уровня аспирантуры по физике, химии и биологии. Название "Google-proof" означает что ответы нельзя просто нагуглить - нужно реально понимать материал на глубоком уровне. Важный контекст: эксперты с PhD в соответствующих областях набирают около 65%, а обычные люди с хорошим образованием - всего 34%. Когда бенчмарк только вышел, GPT-4 набирал 39%. Сейчас топовые модели перевалили за 78%. Один из лучших тестов на глубину понимания, а не просто запоминание фактов.
SWE-bench Verified
Пожалуй, самый практичный бенчмарк для тех кто работает с кодом. Это реальные GitHub issues из популярных open-source проектов - модель должна прочитать описание бага, разобраться в кодовой базе и сгенерировать патч который его фиксит. Не абстрактные алгоритмические задачки, а настоящая работа программиста с контекстом, зависимостями и легаси-кодом. Лидеры сейчас - Claude Opus 4.5 с 80.9% и GPT-5.2 с 80%. Интересно что на более сложной версии SWE-bench Pro те же модели набирают только ~23% - есть куда расти.
MATH
Математические задачи от школьного уровня до олимпиадного. Важно что это не просто "посчитай 2+2", а задачи требующие цепочки рассуждений: алгебра, геометрия, теория вероятностей, комбинаторика. Хороший индикатор reasoning-способностей модели.
MMLU-Pro (Massive Multitask Language Understanding)
Тест на общую эрудицию: 57 предметов от элементарной математики до права, медицины и философии. Формат - multiple choice, но в Pro-версии не 4 варианта ответа, а 10, что сильно усложняет угадывание. Топовые модели сейчас набирают около 89-90% (лидирует Gemini 3 Pro с 90.1%). Полезен как базовый фильтр качества, но уже близок к насыщению - все сильные модели показывают похожие результаты в узком диапазоне.
GPQA Diamond (Graduate-Level Google-Proof Q&A)
Вопросы уровня аспирантуры по физике, химии и биологии. Название "Google-proof" означает что ответы нельзя просто нагуглить - нужно реально понимать материал на глубоком уровне. Важный контекст: эксперты с PhD в соответствующих областях набирают около 65%, а обычные люди с хорошим образованием - всего 34%. Когда бенчмарк только вышел, GPT-4 набирал 39%. Сейчас топовые модели перевалили за 78%. Один из лучших тестов на глубину понимания, а не просто запоминание фактов.
SWE-bench Verified
Пожалуй, самый практичный бенчмарк для тех кто работает с кодом. Это реальные GitHub issues из популярных open-source проектов - модель должна прочитать описание бага, разобраться в кодовой базе и сгенерировать патч который его фиксит. Не абстрактные алгоритмические задачки, а настоящая работа программиста с контекстом, зависимостями и легаси-кодом. Лидеры сейчас - Claude Opus 4.5 с 80.9% и GPT-5.2 с 80%. Интересно что на более сложной версии SWE-bench Pro те же модели набирают только ~23% - есть куда расти.
MATH
Математические задачи от школьного уровня до олимпиадного. Важно что это не просто "посчитай 2+2", а задачи требующие цепочки рассуждений: алгебра, геометрия, теория вероятностей, комбинаторика. Хороший индикатор reasoning-способностей модели.
Chatbot Arena (LMSYS)
Отдельная история и, возможно, самый честный бенчмарк из всех. Работает просто: реальные пользователи задают вопрос двум анонимным моделям, видят оба ответа и выбирают какой лучше. Из миллионов таких голосов строится ELO-рейтинг как в шахматах. Сейчас на вершине Gemini 3 Pro с рейтингом 1492 и Claude Opus 4.6. Главное преимущество - этот бенчмарк нельзя "заоптимизировать", потому что это буквально предпочтения живых людей на реальных задачах.
ARC-AGI
Бенчмарк который AI до сих пор не может нормально решить. Это тесты на абстрактное мышление: показывают несколько примеров трансформации сетки (вход → выход), нужно понять паттерн и применить к новому входу. Звучит просто, но требует способности к обобщению которая у современных LLM пока слабая. Важен как индикатор фундаментальных ограничений текущих архитектур.
Humanity's Last Exam (HLE)
Новейший frontier-бенчмарк для по-настоящему сложных задач. Вопросы собраны от экспертов мирового уровня из разных областей - от квантовой физики до лингвистики древних языков. Идея в том, что если модель не может ответить на эти вопросы, её точно нельзя доверять для серьёзной экспертной работы без человеческого контроля.
Отдельная история и, возможно, самый честный бенчмарк из всех. Работает просто: реальные пользователи задают вопрос двум анонимным моделям, видят оба ответа и выбирают какой лучше. Из миллионов таких голосов строится ELO-рейтинг как в шахматах. Сейчас на вершине Gemini 3 Pro с рейтингом 1492 и Claude Opus 4.6. Главное преимущество - этот бенчмарк нельзя "заоптимизировать", потому что это буквально предпочтения живых людей на реальных задачах.
ARC-AGI
Бенчмарк который AI до сих пор не может нормально решить. Это тесты на абстрактное мышление: показывают несколько примеров трансформации сетки (вход → выход), нужно понять паттерн и применить к новому входу. Звучит просто, но требует способности к обобщению которая у современных LLM пока слабая. Важен как индикатор фундаментальных ограничений текущих архитектур.
Humanity's Last Exam (HLE)
Новейший frontier-бенчмарк для по-настоящему сложных задач. Вопросы собраны от экспертов мирового уровня из разных областей - от квантовой физики до лингвистики древних языков. Идея в том, что если модель не может ответить на эти вопросы, её точно нельзя доверять для серьёзной экспертной работы без человеческого контроля.
◾ Почему нельзя просто верить цифрам
Data contamination
Главная головная боль индустрии. Если тестовые вопросы случайно попали в обучающие данные, модель их просто "помнит", а не решает. Чем старше и популярнее бенчмарк, тем выше вероятность утечки в training data. Поэтому появляются обновлённые версии: MMLU → MMLU-Pro, LiveBench который обновляется каждый месяц свежими вопросами.
Оптимизация под метрики
Компании активно тюнят модели под конкретные бенчмарки - это факт жизни. 95% на каком-то тесте может означать что модель натаскали именно на этот формат задач, а на ваших реальных кейсах она будет работать хуже.
Разрыв между числами и практикой
Модель может блестяще решать задачки из бенчмарков, но при этом плохо следовать сложным инструкциям, генерировать странный текст или галлюцинировать факты. Стандартные бенчмарки не измеряют "вайб", удобство работы и практическую полезность для конкретных задач.
Data contamination
Главная головная боль индустрии. Если тестовые вопросы случайно попали в обучающие данные, модель их просто "помнит", а не решает. Чем старше и популярнее бенчмарк, тем выше вероятность утечки в training data. Поэтому появляются обновлённые версии: MMLU → MMLU-Pro, LiveBench который обновляется каждый месяц свежими вопросами.
Оптимизация под метрики
Компании активно тюнят модели под конкретные бенчмарки - это факт жизни. 95% на каком-то тесте может означать что модель натаскали именно на этот формат задач, а на ваших реальных кейсах она будет работать хуже.
Разрыв между числами и практикой
Модель может блестяще решать задачки из бенчмарков, но при этом плохо следовать сложным инструкциям, генерировать странный текст или галлюцинировать факты. Стандартные бенчмарки не измеряют "вайб", удобство работы и практическую полезность для конкретных задач.
◾ Что с этим делать на практике
Не фиксируйтесь на одном числе. Смотрите на несколько бенчмарков в категории которая важна именно вам. Нужен код? SWE-bench важнее MMLU. Нужны общие знания? Смотрите MMLU-Pro и GPQA вместе.
Chatbot Arena - хороший ориентир для общего качества. Если модель высоко в этом рейтинге, скорее всего она будет хороша для большинства обычных задач.
Свежие бенчмарки надёжнее старых. GPQA, MMLU-Pro, LiveBench, HLE - там меньше шансов на contamination чем в классических тестах пятилетней давности.
Лучший бенчмарк - ваши собственные задачи. Возьмите 20-30 реальных примеров из вашей работы и прогоните через несколько моделей. Это покажет больше чем любые публичные таблицы, потому что измеряет именно то что вам нужно.
⠀
◾ Полезные ресурсы:
• Chatbot Arena - live рейтинг на основе человеческих предпочтений
• Artificial Analysis - сравнение моделей по качеству, скорости и цене
• LLM Stats - агрегатор результатов по разным бенчмаркам
• SWE-bench - лидерборд по кодингу
Не фиксируйтесь на одном числе. Смотрите на несколько бенчмарков в категории которая важна именно вам. Нужен код? SWE-bench важнее MMLU. Нужны общие знания? Смотрите MMLU-Pro и GPQA вместе.
Chatbot Arena - хороший ориентир для общего качества. Если модель высоко в этом рейтинге, скорее всего она будет хороша для большинства обычных задач.
Свежие бенчмарки надёжнее старых. GPQA, MMLU-Pro, LiveBench, HLE - там меньше шансов на contamination чем в классических тестах пятилетней давности.
Лучший бенчмарк - ваши собственные задачи. Возьмите 20-30 реальных примеров из вашей работы и прогоните через несколько моделей. Это покажет больше чем любые публичные таблицы, потому что измеряет именно то что вам нужно.
⠀
◾ Полезные ресурсы:
• Chatbot Arena - live рейтинг на основе человеческих предпочтений
• Artificial Analysis - сравнение моделей по качеству, скорости и цене
• LLM Stats - агрегатор результатов по разным бенчмаркам
• SWE-bench - лидерборд по кодингу
Arena AI: The Official AI Ranking & LLM Leaderboard
Chat, compare, vote for the world's best AI models. Join the community shaping the public leaderboard for LLMs, image, and code models through real-world evaluation.
Команда должна быть настолько маленькой, что вам некомфортно
Есть популярная ошибка в стартапах - нанимать людей чуть раньше, чем действительно нужно.
Кажется логичным: задач много, все перегружены, надо закрыть дырки, ускориться, добавить менеджмента, больше функций, больше параллельности.
Но по факту почти всегда происходит обратное. Команда становится больше, а скорость падает.
Почему?
Потому что маленькая команда вынуждает к ясности.
Когда вас мало, нельзя делать десять направлений одновременно. Нельзя спрятать плохой продукт за процессами. Нельзя месяцами обсуждать roadmap. Нельзя держать людей, которые "вроде полезны". Все видно сразу.
Маленькая команда заставляет отвечать на неприятные вопросы:
• что самое важное прямо сейчас?
• кто реально двигает продукт вперед?
• какую работу можно вообще не делать?
• какая фича не стоит отдельного человека?
• где мы пытаемся лечить отсутствие фокуса наймом?
⠀
Большая команда часто дает ощущение прогресса. Больше людей, больше митингов, больше статусов, больше всего происходит.
Но это может быть просто организационный шум.
Я бы сказал, что хороший early-stage team должен быть настолько маленьким, чтобы было немного страшно. Чтобы постоянно казалось: "нам не хватает людей".
Это нормальное ощущение. Оно держит систему в тонусе.
Недостаток людей неприятен еще и потому, что он заставляет заниматься самым нудным.
Не тем, что легко показать в демо. Не маленькими фичами, которые дают ощущение движения. А большими фундаментальными вещами: понять настоящую проблему, упростить продукт, починить core flow, убрать лишнее, сделать так, чтобы пользователь возвращался сам.
Когда людей много, очень легко спрятать маловажные фичи за работающими людьми.
У каждого есть задача. У каждого есть progress. У каждого есть что показать на sync. И постепенно команда начинает обслуживать собственную занятость, а не главный риск бизнеса.
Маленькая команда так не дает. Если вас мало, нельзя держать человека на фиче, которая "вроде полезная". Слишком дорого. Приходится снова и снова возвращаться к скучному вопросу: что из этого действительно двигает компанию?
Если команде слишком комфортно, скорее всего, вы уже начали покупать комфорт ценой скорости. А в стартапе комфорт почти всегда дорогой.
Не потому что люди не нужны. Нужны.
Но каждый новый человек должен добавлять больше скорости, чем сложности. И это очень высокая планка.
Поэтому лучший вопрос перед наймом не "есть ли у нас для него работа?".
Работа всегда найдется.
Лучший вопрос: "если мы не наймем этого человека, что мы перестанем делать?"
Если ответ - "ничего, просто будем чуть менее загружены", я бы не нанимал.
Если ответ - "мы перестанем делать второстепенное и наконец займемся главным", тем более.
Маленькая команда - это не романтика гаража. Это forcing function. Она заставляет выбирать, резать лишнее и делать только то, что реально важно.
Есть популярная ошибка в стартапах - нанимать людей чуть раньше, чем действительно нужно.
Кажется логичным: задач много, все перегружены, надо закрыть дырки, ускориться, добавить менеджмента, больше функций, больше параллельности.
Но по факту почти всегда происходит обратное. Команда становится больше, а скорость падает.
Почему?
Потому что маленькая команда вынуждает к ясности.
Когда вас мало, нельзя делать десять направлений одновременно. Нельзя спрятать плохой продукт за процессами. Нельзя месяцами обсуждать roadmap. Нельзя держать людей, которые "вроде полезны". Все видно сразу.
Маленькая команда заставляет отвечать на неприятные вопросы:
• что самое важное прямо сейчас?
• кто реально двигает продукт вперед?
• какую работу можно вообще не делать?
• какая фича не стоит отдельного человека?
• где мы пытаемся лечить отсутствие фокуса наймом?
⠀
Большая команда часто дает ощущение прогресса. Больше людей, больше митингов, больше статусов, больше всего происходит.
Но это может быть просто организационный шум.
Я бы сказал, что хороший early-stage team должен быть настолько маленьким, чтобы было немного страшно. Чтобы постоянно казалось: "нам не хватает людей".
Это нормальное ощущение. Оно держит систему в тонусе.
Недостаток людей неприятен еще и потому, что он заставляет заниматься самым нудным.
Не тем, что легко показать в демо. Не маленькими фичами, которые дают ощущение движения. А большими фундаментальными вещами: понять настоящую проблему, упростить продукт, починить core flow, убрать лишнее, сделать так, чтобы пользователь возвращался сам.
Когда людей много, очень легко спрятать маловажные фичи за работающими людьми.
У каждого есть задача. У каждого есть progress. У каждого есть что показать на sync. И постепенно команда начинает обслуживать собственную занятость, а не главный риск бизнеса.
Маленькая команда так не дает. Если вас мало, нельзя держать человека на фиче, которая "вроде полезная". Слишком дорого. Приходится снова и снова возвращаться к скучному вопросу: что из этого действительно двигает компанию?
Если команде слишком комфортно, скорее всего, вы уже начали покупать комфорт ценой скорости. А в стартапе комфорт почти всегда дорогой.
Не потому что люди не нужны. Нужны.
Но каждый новый человек должен добавлять больше скорости, чем сложности. И это очень высокая планка.
Поэтому лучший вопрос перед наймом не "есть ли у нас для него работа?".
Работа всегда найдется.
Лучший вопрос: "если мы не наймем этого человека, что мы перестанем делать?"
Если ответ - "ничего, просто будем чуть менее загружены", я бы не нанимал.
Если ответ - "мы перестанем делать второстепенное и наконец займемся главным", тем более.
Маленькая команда - это не романтика гаража. Это forcing function. Она заставляет выбирать, резать лишнее и делать только то, что реально важно.
Open-source как бизнес-модель
На первый взгляд open-source бизнес звучит странно.
Ты тратишь деньги на разработку, выкладываешь код бесплатно, конкуренты могут его скопировать, пользователи могут не платить. Где бизнес?
Но по факту open-source почти никогда не является бизнес-моделью сам по себе. Это стратегия выхода на рынок. Способ дистрибуции, доверия и стандартизации.
Компания открывает не потому что она добрая, а потому что в некоторых рынках открытость дает больше, чем секретность.
Почему компании выбирают open-source:
• Дистрибуция. Разработчик может просто взять и попробовать без звонка с продажником, закупок, демо и всей этой корпоративной бюрократии. Для инструментов разработки это суперсила.
• Доверие. Если ты ставишь базу данных, инфраструктурный инструмент или AI-модель внутрь своей системы, тебе важно понимать, что там происходит. Особенно если это безопасность, данные, комплаенс или установка у себя.
• Стандарт. Если твой проект становится выбором по умолчанию, вокруг него появляются плагины, интеграции, документация, специалисты, контент. И дальше уже не ты продаешь рынок - рынок начинает продавать тебя.
• Найм и разработка. Сильные инженеры охотнее идут туда, где их работа видна миру. Плюс комьюнити находит баги, пишет интеграции, тестирует крайние случаи.
• Удешевить смежный слой. Если ты зарабатываешь на облаке, поддержке, корпоративных функциях или приложениях, тебе выгодно, чтобы базовый слой стал доступнее и дешевле.
⠀
Последний пункт особенно важен для AI.
Многие китайские AI-компании сейчас активно выпускают модели с открытыми весами - DeepSeek, Qwen, Kimi и тд. Это не совсем классический open-source, потому что часто открыты веса, но не полные данные обучения, методика и инфраструктура. Но логика похожая.
Если ты не можешь выиграть у OpenAI закрытой премиальной моделью и потребительской дистрибуцией, можно играть иначе: сделать модель настолько доступной и хорошей, чтобы ее начали использовать разработчики, облачные провайдеры, стартапы, исследовательские лаборатории и корпорации. Ты покупаешь распространение ценой раскрытия части технологии.
Это особенно разумно, если твой настоящий бизнес не в том, чтобы продать файл с весами. Настоящий бизнес может быть:
• инференс как сервис
• корпоративные внедрения
• дообучение и кастомизация
• потребление облачных ресурсов
• закрытые продукты поверх модели
• государственные и корпоративные контракты
• экосистема вокруг твоего стандарта
⠀
То есть open-source в AI часто работает как захват территории. Ты раздаешь базовый слой, чтобы стать частью чужого стэка.
На первый взгляд open-source бизнес звучит странно.
Ты тратишь деньги на разработку, выкладываешь код бесплатно, конкуренты могут его скопировать, пользователи могут не платить. Где бизнес?
Но по факту open-source почти никогда не является бизнес-моделью сам по себе. Это стратегия выхода на рынок. Способ дистрибуции, доверия и стандартизации.
Компания открывает не потому что она добрая, а потому что в некоторых рынках открытость дает больше, чем секретность.
Почему компании выбирают open-source:
• Дистрибуция. Разработчик может просто взять и попробовать без звонка с продажником, закупок, демо и всей этой корпоративной бюрократии. Для инструментов разработки это суперсила.
• Доверие. Если ты ставишь базу данных, инфраструктурный инструмент или AI-модель внутрь своей системы, тебе важно понимать, что там происходит. Особенно если это безопасность, данные, комплаенс или установка у себя.
• Стандарт. Если твой проект становится выбором по умолчанию, вокруг него появляются плагины, интеграции, документация, специалисты, контент. И дальше уже не ты продаешь рынок - рынок начинает продавать тебя.
• Найм и разработка. Сильные инженеры охотнее идут туда, где их работа видна миру. Плюс комьюнити находит баги, пишет интеграции, тестирует крайние случаи.
• Удешевить смежный слой. Если ты зарабатываешь на облаке, поддержке, корпоративных функциях или приложениях, тебе выгодно, чтобы базовый слой стал доступнее и дешевле.
⠀
Последний пункт особенно важен для AI.
Многие китайские AI-компании сейчас активно выпускают модели с открытыми весами - DeepSeek, Qwen, Kimi и тд. Это не совсем классический open-source, потому что часто открыты веса, но не полные данные обучения, методика и инфраструктура. Но логика похожая.
Если ты не можешь выиграть у OpenAI закрытой премиальной моделью и потребительской дистрибуцией, можно играть иначе: сделать модель настолько доступной и хорошей, чтобы ее начали использовать разработчики, облачные провайдеры, стартапы, исследовательские лаборатории и корпорации. Ты покупаешь распространение ценой раскрытия части технологии.
Это особенно разумно, если твой настоящий бизнес не в том, чтобы продать файл с весами. Настоящий бизнес может быть:
• инференс как сервис
• корпоративные внедрения
• дообучение и кастомизация
• потребление облачных ресурсов
• закрытые продукты поверх модели
• государственные и корпоративные контракты
• экосистема вокруг твоего стандарта
⠀
То есть open-source в AI часто работает как захват территории. Ты раздаешь базовый слой, чтобы стать частью чужого стэка.
Как потом зарабатывают open-source компании:
1. Управляемое облако
Самая понятная модель. Код можно поднять самому, но нормальные компании платят за готовую облачную версию, потому что никто не хочет ночью дебажить Kubernetes ради экономии $800.
MongoDB Atlas, Elastic Cloud, Confluent Cloud - все примерно отсюда.
2. Открытое ядро
Базовая версия открыта, корпоративные фичи платные: SSO, права доступа, журналы аудита, комплаенс, продвинутая безопасность, управление командой, поддержка.
Это модель GitLab. Разработчик начинает бесплатно, компания платит, когда появляется организационная сложность.
3. Поддержка и подписки
Классика Red Hat. Linux бесплатный, но корпорации платят за стабильность, патчи безопасности, сертификацию, поддержку и долгосрочное обслуживание. IBM купил Red Hat за $34B не из благотворительности.
4. Source-available вместо настоящего open-source
Многие компании начинали как open-source, а потом закрывали лицензию от облачных конкурентов. MongoDB ушел в SSPL, Elastic тоже экспериментировал с лицензиями, HashiCorp перевел Terraform в BSL - после чего появился форк OpenTofu.
Это важный компромисс: ты защищаешь монетизацию, но часть комьюнити начинает считать, что ты нарушил социальный контракт.
5. Услуги и консалтинг
Работает, но хуже масштабируется. Хорошо как старт, плохо как финальная модель, если хочется софтверной маржи.
⠀
Сколько на этом зарабатывают?
Много, если проект становится инфраструктурным стандартом.
Red Hat перед покупкой IBM делал ~$3.4B годовой выручки. GitLab уже почти ~$1B годовой выручки. Elastic - около ~$1.7B. MongoDB - около ~$2.5B. HashiCorp перед продажей IBM был на уровне ~$600M выручки. Confluent тоже уже перешел через ~$1B подписочной выручки.
Но тут важная поправка: почти все эти компании - не “чистый open-source”. Это открытое ядро, управляемое облако, source-available, корпоративные подписки. Романтика комьюнити сверху, очень прагматичная монетизация снизу.
1. Управляемое облако
Самая понятная модель. Код можно поднять самому, но нормальные компании платят за готовую облачную версию, потому что никто не хочет ночью дебажить Kubernetes ради экономии $800.
MongoDB Atlas, Elastic Cloud, Confluent Cloud - все примерно отсюда.
2. Открытое ядро
Базовая версия открыта, корпоративные фичи платные: SSO, права доступа, журналы аудита, комплаенс, продвинутая безопасность, управление командой, поддержка.
Это модель GitLab. Разработчик начинает бесплатно, компания платит, когда появляется организационная сложность.
3. Поддержка и подписки
Классика Red Hat. Linux бесплатный, но корпорации платят за стабильность, патчи безопасности, сертификацию, поддержку и долгосрочное обслуживание. IBM купил Red Hat за $34B не из благотворительности.
4. Source-available вместо настоящего open-source
Многие компании начинали как open-source, а потом закрывали лицензию от облачных конкурентов. MongoDB ушел в SSPL, Elastic тоже экспериментировал с лицензиями, HashiCorp перевел Terraform в BSL - после чего появился форк OpenTofu.
Это важный компромисс: ты защищаешь монетизацию, но часть комьюнити начинает считать, что ты нарушил социальный контракт.
5. Услуги и консалтинг
Работает, но хуже масштабируется. Хорошо как старт, плохо как финальная модель, если хочется софтверной маржи.
⠀
Сколько на этом зарабатывают?
Много, если проект становится инфраструктурным стандартом.
Red Hat перед покупкой IBM делал ~$3.4B годовой выручки. GitLab уже почти ~$1B годовой выручки. Elastic - около ~$1.7B. MongoDB - около ~$2.5B. HashiCorp перед продажей IBM был на уровне ~$600M выручки. Confluent тоже уже перешел через ~$1B подписочной выручки.
Но тут важная поправка: почти все эти компании - не “чистый open-source”. Это открытое ядро, управляемое облако, source-available, корпоративные подписки. Романтика комьюнити сверху, очень прагматичная монетизация снизу.