Технодинамизм
104 subscribers
34 photos
4 videos
23 links
Когда-то работал в большом IT (Uber, Yandex), сейчас строю новую AI-driven компанию в healthcare секторе в США.

Размышляю тут о бытие, бизнесе и технологиях.
Download Telegram
Игра с нулевой суммой

Всё в мире уже кому-то принадлежит. Земля, ресурсы, рынки - всё поделено. Так было тысячу лет назад, так и сейчас.

Но раньше это означало одно: хочешь больше - отними у соседа.

Римляне строили империю не потому что были злыми. Просто другого способа расти не существовало. Нет технологий, нет роста производительности - значит богатство можно только перераспределять. Мечом.

Историки называют это мальтузианской ловушкой. Население растёт, ресурсы конечны, периодически случается война или эпидемия, население падает, цикл начинается заново. Тысячи лет одно и то же.

А потом что-то изменилось.

В Англии XVIII века люди начали строить машины. Ткацкие станки, паровые двигатели, железные дороги. Впервые производительность труда начала расти быстрее населения.

Это был момент, когда появился другой путь - не делить существующее, а создавать новое.

Твой прадед и его прадед жили примерно одинаково. А ты живёшь радикально иначе. Не потому что умнее - а потому что между вами несколько технологических революций. Каждая добавляла новые куски к общему пирогу.

Мы привыкли думать о мире как об арене конкуренции. Мой выигрыш - твой проигрыш. Но это не закон природы. Это следствие стагнации. Когда нового не появляется - остаётся только делить старое.

Проблема в том, что наш мозг эволюционировал именно в таком мире. Племя vs племя. Мы vs они. Ресурсы конечны, чужак опасен. Эти инстинкты никуда не делись.

Посмотри на риторику последних лет. Торговые войны. Протекционизм. Санкции. "Они крадут наши рабочие места". Это язык дефицита. Язык дележа. Когда рост замедляется - мы автоматически откатываемся к старым паттернам.

Но это временное помутнение.

AI, fusion, космос, биотех - следующая волна технологий уже здесь. Каждый прорыв создаёт новые куски пирога. Каждый скачок производительности делает конфликты менее привлекательными - проще создать, чем отнять.

Человечество всегда возвращается к росту. Иногда через кризисы, иногда через войны, но возвращается. Альтернатива - бесконечная дележка - слишком утомительна.
Человек Ренессанса

Я заметил, что самые интересные люди вокруг - те, кого сложно описать одним словом. Спрашиваешь "чем занимаешься?" - и они мнутся, потому что честный ответ займёт минут пять.

Это раньше считалось проблемой. Не можешь сфокусироваться. Разбрасываешься. Шило в одном месте.

А сейчас я смотрю и думаю - может это и есть преимущество?

Система образования заточена под специализацию: выбери одно направление, копай глубоко, стань экспертом. Логика понятная - если ты знаешь одну вещь лучше всех, тебя наймут. Но по факту самые ценные решения появляются не в глубине одной области, а на пересечении нескольких.

Человек который понимает и код и дизайн строит продукты иначе, чем чистый разработчик. Кто-то с опытом в продажах и психологии видит клиента объёмнее, чем просто хороший сейлз. Странные комбинации навыков - это не баг, это фича.

Да Винчи занимался всем подряд - живопись, анатомия, инженерия, архитектура. Не потому что не мог выбрать, а потому что одно питало другое. Понимание анатомии делало его картины живыми. Художественный глаз помогал проектировать машины, которые были не только функциональными, но и красивыми.

Каждый интерес добавляет связей в голове. Чем больше связей - тем чаще замечаешь паттерны, которые другие пропускают. Это не про "знать всё по верхам" - это про способность видеть как вещи влияют друг на друга.

Если у тебя много разных интересов и ты всю жизнь чувствовал что с этим что-то не так - возможно, всё наоборот. Возможно, это и есть твой главный актив.
World Models - следующий большой шаг

LLM понимают текст. Ты пишешь - они отвечают. Но спроси языковую модель что произойдёт если толкнуть стакан со стола - и она выдаст статистически вероятный ответ. Не потому что понимает физику, а потому что читала много текстов про падающие стаканы.

Это принципиальное ограничение. Языковые модели работают с токенами, не с реальностью.

World models - другой подход. Это AI который строит внутреннюю модель мира и может её симулировать. Не генерирует текст про физику, а понимает физику. Может предсказать что произойдёт если совершить действие X в контексте Y.

Кто этим занимается:

▫️ AMI Labs - Yann LeCun ушёл из Meta и поднимает €500M на стартап в Париже. Его тезис: LLM - тупиковая ветка для настоящего AI.

▫️ World Labs - Fei-Fei Li, "крёстная мать AI" из Стэнфорда. $230M от Andreessen Horowitz и Nvidia. Их продукт Marble генерирует интерактивные 3D миры.

▫️ DeepMind - Genie 3 создаёт интерактивные окружения, в которых можно тренировать AI-агентов.

▫️ Decart - израильский стартап, $21M от Sequoia. Их Oasis - полностью AI-сгенерированный Minecraft. Без кода, только нейросеть.

▫️ Odyssey - основатели из self-driving индустрии. Делают "интерактивное видео" - 3D миры из текста и картинок.

Практические применения уже видны. Sora от OpenAI учится понимать что объекты не исчезают когда выходят из кадра. Tesla FSD строит модель окружения и предсказывает поведение других машин. Роботам нужно понимать как предметы взаимодействуют в физическом мире.

Путь к AGI возможно лежит через комбинацию: LLM для общения на естественном языке, world models для понимания физического мира. Слои, не один универсальный алгоритм.

2026 - год когда world models перестают быть исследовательской темой и становятся продуктами.
Как читать бенчмарки LLM

Каждую неделю кто-то выпускает новую модель, и каждая "побеждает на бенчмарках". OpenAI публикует таблицу где они впереди планеты всей, Anthropic - свою таблицу где лидируют они, Google - третью где побеждает Gemini. Маркетинговые войны в чистом виде. Но если копнуть глубже - бенчмарки реально полезная штука, просто нужно понимать что они измеряют и чему верить.

◾ Что вообще такое бенчмарк

Бенчмарк - это стандартизированный экзамен для AI-моделей. Набор задач с известными правильными ответами, по которым можно сравнивать разные модели между собой. Идея простая: дали 1000 вопросов, посчитали процент правильных - вот и результат.

Проблема в том, что бенчмарков развелось десятки, каждый измеряет что-то своё, и не все одинаково надёжны. Разберём что к чему.
⠀
◾ Главные категории

Все бенчмарки можно разбить на несколько больших групп:

• Общие знания - насколько модель "эрудированна" в разных областях
• Reasoning - способность к логическому рассуждению и выводам
• Код - умение писать работающий код
• Математика - решение задач от школьных до олимпиадных
• Мультимодальность - понимание изображений, диаграмм, графиков
• Человеческие предпочтения - нравятся ли ответы реальным пользователям
◾ Бенчмарки которые стоит знать

MMLU-Pro (Massive Multitask Language Understanding)
Тест на общую эрудицию: 57 предметов от элементарной математики до права, медицины и философии. Формат - multiple choice, но в Pro-версии не 4 варианта ответа, а 10, что сильно усложняет угадывание. Топовые модели сейчас набирают около 89-90% (лидирует Gemini 3 Pro с 90.1%). Полезен как базовый фильтр качества, но уже близок к насыщению - все сильные модели показывают похожие результаты в узком диапазоне.

GPQA Diamond (Graduate-Level Google-Proof Q&A)
Вопросы уровня аспирантуры по физике, химии и биологии. Название "Google-proof" означает что ответы нельзя просто нагуглить - нужно реально понимать материал на глубоком уровне. Важный контекст: эксперты с PhD в соответствующих областях набирают около 65%, а обычные люди с хорошим образованием - всего 34%. Когда бенчмарк только вышел, GPT-4 набирал 39%. Сейчас топовые модели перевалили за 78%. Один из лучших тестов на глубину понимания, а не просто запоминание фактов.

SWE-bench Verified
Пожалуй, самый практичный бенчмарк для тех кто работает с кодом. Это реальные GitHub issues из популярных open-source проектов - модель должна прочитать описание бага, разобраться в кодовой базе и сгенерировать патч который его фиксит. Не абстрактные алгоритмические задачки, а настоящая работа программиста с контекстом, зависимостями и легаси-кодом. Лидеры сейчас - Claude Opus 4.5 с 80.9% и GPT-5.2 с 80%. Интересно что на более сложной версии SWE-bench Pro те же модели набирают только ~23% - есть куда расти.

MATH
Математические задачи от школьного уровня до олимпиадного. Важно что это не просто "посчитай 2+2", а задачи требующие цепочки рассуждений: алгебра, геометрия, теория вероятностей, комбинаторика. Хороший индикатор reasoning-способностей модели.
Chatbot Arena (LMSYS)
Отдельная история и, возможно, самый честный бенчмарк из всех. Работает просто: реальные пользователи задают вопрос двум анонимным моделям, видят оба ответа и выбирают какой лучше. Из миллионов таких голосов строится ELO-рейтинг как в шахматах. Сейчас на вершине Gemini 3 Pro с рейтингом 1492 и Claude Opus 4.6. Главное преимущество - этот бенчмарк нельзя "заоптимизировать", потому что это буквально предпочтения живых людей на реальных задачах.

ARC-AGI
Бенчмарк который AI до сих пор не может нормально решить. Это тесты на абстрактное мышление: показывают несколько примеров трансформации сетки (вход → выход), нужно понять паттерн и применить к новому входу. Звучит просто, но требует способности к обобщению которая у современных LLM пока слабая. Важен как индикатор фундаментальных ограничений текущих архитектур.

Humanity's Last Exam (HLE)
Новейший frontier-бенчмарк для по-настоящему сложных задач. Вопросы собраны от экспертов мирового уровня из разных областей - от квантовой физики до лингвистики древних языков. Идея в том, что если модель не может ответить на эти вопросы, её точно нельзя доверять для серьёзной экспертной работы без человеческого контроля.
◾ Почему нельзя просто верить цифрам

Data contamination
Главная головная боль индустрии. Если тестовые вопросы случайно попали в обучающие данные, модель их просто "помнит", а не решает. Чем старше и популярнее бенчмарк, тем выше вероятность утечки в training data. Поэтому появляются обновлённые версии: MMLU → MMLU-Pro, LiveBench который обновляется каждый месяц свежими вопросами.

Оптимизация под метрики
Компании активно тюнят модели под конкретные бенчмарки - это факт жизни. 95% на каком-то тесте может означать что модель натаскали именно на этот формат задач, а на ваших реальных кейсах она будет работать хуже.

Разрыв между числами и практикой
Модель может блестяще решать задачки из бенчмарков, но при этом плохо следовать сложным инструкциям, генерировать странный текст или галлюцинировать факты. Стандартные бенчмарки не измеряют "вайб", удобство работы и практическую полезность для конкретных задач.
◾ Что с этим делать на практике

Не фиксируйтесь на одном числе. Смотрите на несколько бенчмарков в категории которая важна именно вам. Нужен код? SWE-bench важнее MMLU. Нужны общие знания? Смотрите MMLU-Pro и GPQA вместе.

Chatbot Arena - хороший ориентир для общего качества. Если модель высоко в этом рейтинге, скорее всего она будет хороша для большинства обычных задач.

Свежие бенчмарки надёжнее старых. GPQA, MMLU-Pro, LiveBench, HLE - там меньше шансов на contamination чем в классических тестах пятилетней давности.

Лучший бенчмарк - ваши собственные задачи. Возьмите 20-30 реальных примеров из вашей работы и прогоните через несколько моделей. Это покажет больше чем любые публичные таблицы, потому что измеряет именно то что вам нужно.
⠀
◾ Полезные ресурсы:

• Chatbot Arena - live рейтинг на основе человеческих предпочтений
• Artificial Analysis - сравнение моделей по качеству, скорости и цене
• LLM Stats - агрегатор результатов по разным бенчмаркам
• SWE-bench - лидерборд по кодингу
Команда должна быть настолько маленькой, что вам некомфортно

Есть популярная ошибка в стартапах - нанимать людей чуть раньше, чем действительно нужно.

Кажется логичным: задач много, все перегружены, надо закрыть дырки, ускориться, добавить менеджмента, больше функций, больше параллельности.

Но по факту почти всегда происходит обратное. Команда становится больше, а скорость падает.

Почему?

Потому что маленькая команда вынуждает к ясности.

Когда вас мало, нельзя делать десять направлений одновременно. Нельзя спрятать плохой продукт за процессами. Нельзя месяцами обсуждать roadmap. Нельзя держать людей, которые "вроде полезны". Все видно сразу.

Маленькая команда заставляет отвечать на неприятные вопросы:

• что самое важное прямо сейчас?
• кто реально двигает продукт вперед?
• какую работу можно вообще не делать?
• какая фича не стоит отдельного человека?
• где мы пытаемся лечить отсутствие фокуса наймом?
⠀
Большая команда часто дает ощущение прогресса. Больше людей, больше митингов, больше статусов, больше всего происходит.

Но это может быть просто организационный шум.

Я бы сказал, что хороший early-stage team должен быть настолько маленьким, чтобы было немного страшно. Чтобы постоянно казалось: "нам не хватает людей".

Это нормальное ощущение. Оно держит систему в тонусе.

Недостаток людей неприятен еще и потому, что он заставляет заниматься самым нудным.

Не тем, что легко показать в демо. Не маленькими фичами, которые дают ощущение движения. А большими фундаментальными вещами: понять настоящую проблему, упростить продукт, починить core flow, убрать лишнее, сделать так, чтобы пользователь возвращался сам.

Когда людей много, очень легко спрятать маловажные фичи за работающими людьми.

У каждого есть задача. У каждого есть progress. У каждого есть что показать на sync. И постепенно команда начинает обслуживать собственную занятость, а не главный риск бизнеса.

Маленькая команда так не дает. Если вас мало, нельзя держать человека на фиче, которая "вроде полезная". Слишком дорого. Приходится снова и снова возвращаться к скучному вопросу: что из этого действительно двигает компанию?

Если команде слишком комфортно, скорее всего, вы уже начали покупать комфорт ценой скорости. А в стартапе комфорт почти всегда дорогой.

Не потому что люди не нужны. Нужны.

Но каждый новый человек должен добавлять больше скорости, чем сложности. И это очень высокая планка.

Поэтому лучший вопрос перед наймом не "есть ли у нас для него работа?".

Работа всегда найдется.

Лучший вопрос: "если мы не наймем этого человека, что мы перестанем делать?"

Если ответ - "ничего, просто будем чуть менее загружены", я бы не нанимал.

Если ответ - "мы перестанем делать второстепенное и наконец займемся главным", тем более.

Маленькая команда - это не романтика гаража. Это forcing function. Она заставляет выбирать, резать лишнее и делать только то, что реально важно.
Open-source как бизнес-модель

На первый взгляд open-source бизнес звучит странно.

Ты тратишь деньги на разработку, выкладываешь код бесплатно, конкуренты могут его скопировать, пользователи могут не платить. Где бизнес?

Но по факту open-source почти никогда не является бизнес-моделью сам по себе. Это стратегия выхода на рынок. Способ дистрибуции, доверия и стандартизации.

Компания открывает не потому что она добрая, а потому что в некоторых рынках открытость дает больше, чем секретность.

Почему компании выбирают open-source:

• Дистрибуция. Разработчик может просто взять и попробовать без звонка с продажником, закупок, демо и всей этой корпоративной бюрократии. Для инструментов разработки это суперсила.

• Доверие. Если ты ставишь базу данных, инфраструктурный инструмент или AI-модель внутрь своей системы, тебе важно понимать, что там происходит. Особенно если это безопасность, данные, комплаенс или установка у себя.

• Стандарт. Если твой проект становится выбором по умолчанию, вокруг него появляются плагины, интеграции, документация, специалисты, контент. И дальше уже не ты продаешь рынок - рынок начинает продавать тебя.

• Найм и разработка. Сильные инженеры охотнее идут туда, где их работа видна миру. Плюс комьюнити находит баги, пишет интеграции, тестирует крайние случаи.

• Удешевить смежный слой. Если ты зарабатываешь на облаке, поддержке, корпоративных функциях или приложениях, тебе выгодно, чтобы базовый слой стал доступнее и дешевле.
⠀
Последний пункт особенно важен для AI.

Многие китайские AI-компании сейчас активно выпускают модели с открытыми весами - DeepSeek, Qwen, Kimi и тд. Это не совсем классический open-source, потому что часто открыты веса, но не полные данные обучения, методика и инфраструктура. Но логика похожая.

Если ты не можешь выиграть у OpenAI закрытой премиальной моделью и потребительской дистрибуцией, можно играть иначе: сделать модель настолько доступной и хорошей, чтобы ее начали использовать разработчики, облачные провайдеры, стартапы, исследовательские лаборатории и корпорации. Ты покупаешь распространение ценой раскрытия части технологии.

Это особенно разумно, если твой настоящий бизнес не в том, чтобы продать файл с весами. Настоящий бизнес может быть:

• инференс как сервис
• корпоративные внедрения
• дообучение и кастомизация
• потребление облачных ресурсов
• закрытые продукты поверх модели
• государственные и корпоративные контракты
• экосистема вокруг твоего стандарта
⠀
То есть open-source в AI часто работает как захват территории. Ты раздаешь базовый слой, чтобы стать частью чужого стэка.
Как потом зарабатывают open-source компании:

1. Управляемое облако

Самая понятная модель. Код можно поднять самому, но нормальные компании платят за готовую облачную версию, потому что никто не хочет ночью дебажить Kubernetes ради экономии $800.

MongoDB Atlas, Elastic Cloud, Confluent Cloud - все примерно отсюда.

2. Открытое ядро

Базовая версия открыта, корпоративные фичи платные: SSO, права доступа, журналы аудита, комплаенс, продвинутая безопасность, управление командой, поддержка.

Это модель GitLab. Разработчик начинает бесплатно, компания платит, когда появляется организационная сложность.

3. Поддержка и подписки

Классика Red Hat. Linux бесплатный, но корпорации платят за стабильность, патчи безопасности, сертификацию, поддержку и долгосрочное обслуживание. IBM купил Red Hat за $34B не из благотворительности.

4. Source-available вместо настоящего open-source

Многие компании начинали как open-source, а потом закрывали лицензию от облачных конкурентов. MongoDB ушел в SSPL, Elastic тоже экспериментировал с лицензиями, HashiCorp перевел Terraform в BSL - после чего появился форк OpenTofu.

Это важный компромисс: ты защищаешь монетизацию, но часть комьюнити начинает считать, что ты нарушил социальный контракт.

5. Услуги и консалтинг

Работает, но хуже масштабируется. Хорошо как старт, плохо как финальная модель, если хочется софтверной маржи.
⠀
Сколько на этом зарабатывают?

Много, если проект становится инфраструктурным стандартом.

Red Hat перед покупкой IBM делал ~$3.4B годовой выручки. GitLab уже почти ~$1B годовой выручки. Elastic - около ~$1.7B. MongoDB - около ~$2.5B. HashiCorp перед продажей IBM был на уровне ~$600M выручки. Confluent тоже уже перешел через ~$1B подписочной выручки.

Но тут важная поправка: почти все эти компании - не “чистый open-source”. Это открытое ядро, управляемое облако, source-available, корпоративные подписки. Романтика комьюнити сверху, очень прагматичная монетизация снизу.
Как принимать решение: открывать или закрывать?

Я бы смотрел не идеологически, а через вопрос: где у тебя настоящий moat?

Если moat в коде как секрете - закрывай.

Если moat в дистрибуции, облаке, данных, бренде, отношениях с корпорациями, UX, экосистеме или скорости исполнения - можно открывать часть стэка.

Open-source хорошо работает, когда:

• продукт для разработчиков, инфраструктуры или AI-продуктов
• распространение важнее быстрой монетизации
• рынок работает по принципу “победитель становится стандартом”
• пользователю важно доверие, самостоятельный хостинг или установка у себя
• вокруг продукта могут появиться плагины, интеграции и комьюнити
• ты умеешь монетизировать смежный слой - облако, корпоративные функции, поддержку, приложения
⠀
Закрытый код лучше, когда:

• код и модель - главный секрет
• продукт легко скопировать без твоей дистрибуции
• нет понятного платного слоя
• безопасность, злоупотребления и регулирование слишком важны
• потребительский UX и бренд важнее принятия среди разработчиков
⠀
Мой текущий вывод: open-source - это не про “быть добрым” и не про “не уметь зарабатывать”.

Это способ сказать рынку: “пусть базовый слой станет коммодити, потому что я собираюсь заработать на том, что выше, надежнее, удобнее или ближе к корпоративному бюджету”.

И если это получилось, бизнес может быть огромным.

Но если ты открыл единственное, что было твоим moat, а дальше не построил облако, корпоративный слой, дистрибуцию или продукт поверх - ты не сделал open-source бизнес.

Ты просто подарил миру хороший репозиторий.