Технодинамизм
104 subscribers
34 photos
4 videos
23 links
Когда-то работал в большом IT (Uber, Yandex), сейчас строю новую AI-driven компанию в healthcare секторе в США.

Размышляю тут о бытие, бизнесе и технологиях.
Download Telegram
Потом был опять планомерный прогресс по всем дисциплинам внутри машин лернинга в течение следующих 5 лет - хорошее распознавание изображений, распознавание и синтез речи, перенос стилей изображений и тд. Появились очень хайповые приложения - такие как Prisma или MSQRD. Был основан OpenAI, где-то на стыке 2015/2016 годов.

Но при всем при этом принципиального прорыва не случалось, как так нейронки тогда (по сегодняшним временам довольно маленькие), требовали много GPU для тренинга и инференса (так называют уже фактическую работу натренированной нейронки).
Все как бы хотели еще больше нейронки, понимали что чем больше, тем будут лучше результаты, но больше не было возможности особо.

Так было пока в 2017 году ребята из Гугла не написали, теперь уже историческую работу - Attention is all you need (https://en.wikipedia.org/wiki/Attention_Is_All_You_Need). Где они представили сразу несколько прорывных идей по архитектурам нейронных сетей, а именно архитектуру которую сейчас называют Transformer. Одной из главных идей было “внимание” которое позволяло сетке лучше понимать контекст, а другой как технически можно лучше работать на уровне операций на GPU.

Это была прорывная работа. Тем не менее, несмотря на то, что эта работа была написана в Гугле, основным бенефициаром в скором времени оказались OpenAI. А человеком, который помог им в этом преуспеть - Илья Суцкевер. Слушал его интервью где он говорит, что когда увидел пейпер по трансформерам сразу понял, что это то что позволит им заскейлить их нейронки в OpenAI.
Эра трансформеров

После появления трансформеров началась настоящая гонка. В 2018 году Гугл выкатил BERT (Bidirectional Encoder Representations from Transformers) - модель, которая научилась понимать контекст слов с обеих сторон предложения. Это был прорыв для задач понимания языка - классификации, ответов на вопросы и т.д. BERT побил все рекорды на бенчмарках и показал, что предобучение на огромных корпусах текста дает невероятные результаты.

OpenAI работал долгое время над генерацией текста, а точнее над предсказанием какое слово будет следующим в наборе слов, которые подаются на импут в модель. Они применили там “трансформеры” и качество предсказаний существенно выросло, был прорыв. Так появились GPT-модели - Generative Pre-trained Transformer (https://en.wikipedia.org/wiki/Generative_pre-trained_transformer). OpenAI сначала GPT-модели предоставлял через API для разработчиков, а потом они сделали уже консьюмерский продукт ChatGPT.
В 2018 выпустили GPT-1. Это была относительно небольшая модель на порядка 100 миллионов параметров, но она уже показывала, что можно взять трансформер, натренировать его предсказывать следующее слово на куче текста из интернета, а потом дообучить на конкретные задачи.

В 2019 они выпустили GPT-2 с 1.5 миллиардами параметров. И тут случилось интересное - OpenAI сначала отказались публиковать полную модель, заявив что она слишком опасна, может генерировать фейк-ньюс и т.д. Народ посмеялся, но когда модель все-таки выложили, оказалось что она реально умеет генерировать очень убедительные тексты. Это был первый звоночек что мы приближаемся к чему-то серьезному.

Все так и вышло как предсказывал Суцкевер. Сейчас “трансформеры” по факту везде под капотом у ML-приложений, которые теперь уже называются AI-приложения. Почти все улучшения в генерации видео, картинок, текста и тд сегодня это применения архитектуры, которую опубликовали в 2017 году ребята из Гугла.

Более того. За последние 3-4 года почти все крупные вендоры железа стали проектировать GPU/TPU/AI-чипы именно под потребности трансформеров.
Революция ChatGPT

В 2020 году OpenAI выпустили GPT-3 с 175 миллиардами параметров - монстр по сравнению с предыдущими версиями. Но настоящая революция случилась когда OpenAI придумали как сделать эти модели полезными для обычных людей.

Дело в том, что если просто брать пре-трейн модель, такую какой например была GPT-3 и попробовать с ней говорить так, как ты привык сейчас с современными чат-ботами, но никакого долгого диалога не получится. Это будет скорее набор логичных, но не очень связанных текстов. Неплохо для, того чтобы получить короткий ответ, но точно не AI-собеседник. До прохождения теста Тьюринга еще далеко.
Секретным соусом стал RLHF - Reinforcement Learning from Human Feedback.
Идея RLHF простая: берем кучу людей, они оценивают какие ответы модели хорошие, а какие плохие. На основе этих оценок тренируем еще одну модель (reward model), которая учится предсказывать что людям понравится. А потом используем reinforcement learning чтобы основная модель генерировала ответы, которые понравятся этой reward model. По сути, учим AI быть helpful, harmless и honest через человеческую обратную связь.

Именно RLHF превратил сырую GPT-3.5 в ChatGPT, который в ноябре 2022 взорвал интернет. Это был самый быстрорастущий консьюмерский продукт в истории.

Этот прорыв, который получился в первую очередь у OpenAI году в 2021/2022, уже подстегнул всех остальных - стартапы, венчурных инвесторов, больших техно-гигантов, к инвестированию денег и времени в эту индустрию. В частности акции Nvidia выросли в 10 раз на бешеном спросе на свои чипы, так как они являются дефолтным выбором для всех кто хочет обучать и инференсить нейронки.
LLM

LLM - это Large Language Models, в целом название класса, но по факту сегодня часть трансформеров работающих с текстом.

Если говорить чисто о тексте, то можно разбить происходящее сегодня на два этапа:
- Сначала все улучшали качество за счет увеличения количества GPU и данных (например GPT-1/2/3/4/4o модели OpenAI)
- Потом все уперлись в некий потолок по компьюту/данным и начали делать активную пост-трейн оптимизацию, так называемый reasoning - если упрощать, то улучшение ответов за счет того, что сеть прогоняет сгенеренный ответ через себя опять и оценивает его качество. Потом отдает улучшенный ответ (например o1, o3, o3-mini модели OpenAI)

Сейчас у каждого провайдера LLM есть куча разных моделек, для разных целей - какие-то быстрее и дешевле, какие-то подороже и дольше думают, какие-то лучше для общих задач, какие-то лучше для кодинга и тд.
На рынке сейчас огромное количество разных LLM моделей - проприетарных и опенсорсных. Выбрать есть из чего. Перечислю лишь некоторые из тех что на слуху на весну-лето 2025:

OpenAI
- Много разных моделей, хорошее качество в среднем по многим задачам
- Есть ChatGPT - с огромным отрывом самый популярный консьюмерсий AI продукт, у них сотни миллионов пользователей

Anthropic
- Наверное можно официально назвать номер 2 после OpenAI по совокупности факторов
- Мой фаворит, мы их юзаем очень много
- Их модель Claude-Sonnet 3.5/3.7 отличная для почти всех задач, в частности для генерации кода и копирайтинга
- Апдейт сейчас уже появились модели 4

Gemini
- Гугловский продукт
- Последние модели очень хорошие
- Главная фишка огромное контекстное окно, то есть можно загружать много материалов в чат или просто очень долго есть вести без прерывания
- Гугл вообще должны быть лидерами в этом учитывая что почти всем занимаются, и те же трансформеры придумали и свои чипы делают (TPU, конкуренты nvidia), но пока отстают в гонке за разработчиками и консьюмерами. Но думаю имею шансы наверстать

Gemma
- Тоже гугл, но опенсорс
- Последние модели довольно неплохие по бенчмаркам

Meta
- Делают главную опенсорс модель в мире сейчас - LLama
- Неплохая базовая LLMка, используется много где как основа для файн-тюна и дообучения

Mistral
- Французская AI компания делающая одноименные модели, многие из которых выкладывает в опен-сорс
- Как Тоттенхэм, "Говном ты не был, но и до вершин не добрался"

Grok
- Продукт xAI
- Вроде неплохой API
- Их последняя модель натренирована на самом большой кластере на сегодняшний день
- При всем маркетинге от Маска они пока не набрали большой популярности за пределами Twitter/X
- Но время покажет - все-таки против Маска лучше не ставить

Deepseek
- Это те китайцы, которые взорвали рынок своей оперсорсной моделью по качеству почти не уступающей лучшей модели OpenAI, и потратили на это они сильно меньше денег (но и сделали это на годы позже, что важно)
- Заняли понятную нишу с дешевой и относительно хорошей моделью (их модель можно использовать на куче платформ как правило дешевле всего остального)

Qwen
- Целое семейство моделей на любой вкус и цвет от Алибабы
- Некоторые модели являются лидерами в мире open-weight опережая те же лламу и дипсик
Second layer apps

Самое интересное что происходит сейчас, в первой половине 2025 года, это Layer 2 приложения, которые строятся на Foundation model API продуктах от гигантов выше. Есть очень много очень прикольных штук.

Их тысячи, но я просто парочку от себя выделю и которыми пользуюсь:
- ChatGPT или Claude - ну тут понятно. Классические second layer продуктs, так как на базовый собственный API ребята навесили кучу логики, которая превращает не самый человеко-ориентированный API, в продукт, которым вы пользуетесь каждый день для разных целей.
- Perplexity - от части конкурент ChatGPT, но больше про поиск информации и ричерчи. Если упрощать, то ребята переосмысляют весь продуктовый стек гугла (от поиска по покупок) с помощью AI. Где-то успешно, где-то нет. Но их поиск точно нашел свою нишу и стоит внимания.
- Cursor - AI IDE на базе VS Code. Пишет код за тебя по твоим инструкциям. В скором времени планируется автономный агент.
- Supermaven - плагин к VSCode, который делает примерно то же самое что и Cursor но в рамках VSCode. Основная фишка скорее в автодополнении кода.
- Cline - еще один девелоперский продукт. Работает тоже как плагин к VSCode, но лучше умеет работать с полной документацией по проекту, поэтмоу лучше понимает контекст.
- Ollama - SDK, который позволяет себе локально поставить веса опенсорс моделей и по факту на собственной видео-карте (условно бесплатно) гонять LLM-ки для своих целей у себя на ноуте.
- OpenAI Operator - пока закрыт вроде, но это заход на территорию агентов.
- Browser Use - фреймворк, который позволяет с помощью промпта автоматизировать работу в браузере. Топ вещь для скрейпинга данных, автоматизации простых задач в бразуере и тд.
- Browserbase - сторонняя инфраструктура для автоматизации работы браузера. Следующий шаг по сравнению с Browser Use, где похожую вещь можно запустить на сторонних серверах и не заниматься инфраструктурными проблемами.
- Replit Agent - они сделали агента, который по твоему описанию создает полноценный проект (не один файл с кодом, а все нужные файлы в проекте). Написал про надо и получил приложение работающее. Очень прикольный тул. Как правило проще для освоения по сравнению с Cursor.
- ElevenLabs - API для работы с голосом, супер тул, мы делаем много вещей на нем. Например, AI-продажника, который в офисы звонит по нашему скрипту и учитывает риал-тайм данные которые мы ему даем.
- Claude Code - агент работающий локально на вашей машине и автономно пишуший код. В целом использовать можно не только для работы с кодом. Пользуюсь пока редко, но выглядит очень перспективно.

Повторюсь продуктов море, я перечислил тут лишь немногие, которыми я пользовался недавно или которых вижу ценность. В Долине сейчас ренессанс, айтишники вернулись из Техаса чтобы делать AI-приложения. Успевать следить за всем невозможно.

Сейчас больше приложений вокруг текстового GenAI. Но совсем скоро мы увидим массовые продукты в области генерации изображений, генерации видео и даже 3D-миров.
Agents

Агентов описывают по-разному, но я бы сказал что это AI-приложение, которое может автономно принимать решения и работать "долго" без интервенций человека. То есть и генерация решения и ее валидация согласно заложенным правилам происходят внутри приложения.

Популярные сценарии для агентов:
- Агент службы поддержки
- SDR (продажник)
- Программист

В принципе вы можете взять список профессий где есть повторяющиеся задачи, большое количество работников и относительно дорогой час работы - и это будет хороший список профессий/сценариев для автоматизации агентами. Все три примера выше будут в топе такого списка.

В основном агенты все же пишутся напрямую используя foundation model APIs и накручивая сложную логику для reliable работы поверх. Но это фронтирная область, поэтому лучшие практики формируются прямо сейчас. Я буду об этом писать отдельно.

Посмотрите для примера на Replit Agent (программирование), Claude Code (программирование), Sierra (служба поддержки), чтобы понять куда движется рынок.

Хочу также отметить как область - автоматизацию рутинных задач в браузере.
Есть тулы для автоматизации браузеров (что по факту тоже автономный агент) - типа Browser Use или Computer Use от Anthropic. Это тулы, которые позволяют тебе прям сказать иди на тот сайт, вбей такой логин/пароль, потом найди такую кнопку, нажми на нее, скачай результаты как pdf, и тд. Пока сыровато для массового использования, но уже виден мастшаб будущих применений. И он огромен.
Некоторые материалы к самоизучению

Все материалы ниже я считаю отличными для ознакомления по теме.

Про LLM лучше всего - https://karpathy.ai/
У него там есть цикл лекций на ютубе про то как они работают.

Смотрите блоги OpenAI и Anthropic, там много хорошей информации по последнему прогрессу фронтирных моделей.

Некоторые видео которые очень рекомендую к просмотру:
- The moment we stopped understanding AI [AlexNet]
- Ilya Sutskever: "Sequence to sequence learning with neural networks: what a decade"
- Visualizing transformers and attention | Talk for TNG Big Tech Day '24
- Attention in transformers, step-by-step | DL6
- A Survey of Techniques for Maximizing LLM Performance
- The New Stack and Ops for AI
- How do Graphics Cards Work? Exploring GPU Architecture
- AI Semiconductor Landscape feat. Dylan Patel | BG2 w/ Bill Gurley & Brad Gerstner
Не могу не согласиться с Алексеем в выводах.
Нашел на выходных, наконец, время изучить проект бюджета на 2026-2028, а также дискуссии вокруг него. Разумеется, я смотрел на документ глазами предпринимателя и инвестора. Поэтому модернизацию инфраструктуры, подъем демографии, и прочие государственные задачи оставим за скобками.

В бизнес-сообществе, в основном, все сосредоточились на стенаниях по поводу увеличения НДС на 10% (до 22%).

Это, безусловно, невдохновляющий для бизнеса и людей (чуть было не написал, "населения") шаг. Тем более, что буквально несколько месяцев назад с самых высоких трибун рекомендовалось обойтись без увеличения налогового давления. В условиях жестокого кризиса, который проходит сейчас большинство бизнесов в условиях высокой ставки и сжимания спроса, повышение налогов - это апперкот после двоечки.

Неприятным ударом стало малозаметное в общей массе изменений, но чрезвычайно чувствительное для малого бизнеса снижение порога, с которого исчисляется НДС. В 6 раз. От НДС будут освобождены компании с выручкой 800 тыс. руб. в месяц. Когда я слышу такие цифры, то представляю сервис по замене батареек в часах и изготовлению ключей.

Все, что зарабатывает больше 10 млн. рублей в год, не только сокращает прибыль за счет нового налога, но и получает новые затраты в виде ведения бухгалтерии. Если УСН предприниматель может платить самостоятельно, то работа с НДС однозначно требует бухгалтера.

В то же больное место бьет пересмотр льготных тарифов для МСП. Поддержка государства теперь фокусируется на нескольких приоритетных отраслях, оставляя за бортом потребительские сектора, в том числе сотни тысяч селлеров маркетплейсов.

Если же посмотреть глазами инвестора на бюджет, то выводы можно сделать следующие:

▪️ по налоговому бремени бизнеса наша страна выравнивается с развитыми (читай, стагнирующими) европейскими экономиками. Это не сочетается с очевидной, не раз озвученной задачей опережающего роста.
▪️при этом стоимость привлекаемого капитала у нас кратно выше тех же бенчмарков. Топливо для роста бизнеса стоит так дорого, что проще никуда не ехать.
▪️малый бизнес - точно не то, на что делает ставку государство. Возможно, в его понимании, это люди, занятые малопродуктивной деятельностью. Которую лучше направить в производительные сектора экономики.
▪️повышение НДС подстегнет инфляцию, с которой мы так самоотверженно боремся. Рост налогов переложат на потребителя.
▪️если смотреть по секторам, наиболее уязвимыми оказывается ритейл, включая маркеплейсы, а также теряющие льготы IT-компании и не связанные с госзакупками промышленность. Наиболее обласканными - экспортеры.
▪️приемлемая ставка, доступные кредиты, рост бизнеса и широкого фондового рынка - отодвигаются еще дальше.
▪️ну и главное - рост налогов приносит в жертву долгосрочное развитие экономики. Расти будем труднее и медленнее. .

💰ЧТО С ЭТОГО НАМ. Нам нужно становится еще консервативнее в инвестициях. Еще меньше надежд на органический рост, не связанный с геополитикой. Еще меньше места для ярких историй успеха, венчурной модели. И все обоснованней - ставка на PE-инвестиции, дивидендные модели, инструменты фиксированной доходности, отказ бизнесов от развития в пользу выживания. Даже если после обсуждения какие-то экстремальные моменты бюджета будут смягчены, вектор и образ экономического будущего понятен. НЭП заканчивается.

#Россия #макро
Please open Telegram to view this post
VIEW IN TELEGRAM
В России короткое время присутствовал рынок венчурного капитала, что безусловно было хорошей опцией для некоторых крайне высокорисковых типов бизнеса.

Сейчас это время прошло, по крайней мере для массового предпринимателя. Быть может венчур вернется в Россию, но пока местным предпринимателям нужно научиться строить технологические компании без него.

По причине того, что в России отсутствует большой пласт инфраструктурных сервисов, которые уже показывают эффективность и возврат инвестиций в других странах, кажется есть хорошие шансы все-таки найти финансирование на начальных этапах даже в текущих российских реалиях.

На более же поздних этапах, отсуствующих венчурных инвесторов позних стадий, вполне бы мог заменить фондовый рынок.
Как, например, это и было еще совсем недавно в 70-80-90е в США.

Microsoft или Amazon выходили на фондовый рынок очень рано по меркам сегодняшних американских компаний. Что уж ходить далеко - даже относительно современная Tesla выходила в паблик на довольно ранней стадии развития. Microsoft с капитализацией ~$800M (~$2B в сегодняшних долларах) на момент выхода, Amazon ~$450M (~$850M в сегодняшних долларах), Tesla ~$1.6B (~$2B в сегодняшних долларах).

Причиной тому было, как раз относительно слабое состояние венчурной индустрии.

И это позвонило заработать очень хорошие деньги обычным ритейл инвесторам.
Чего кстати практически не происходит сейчас в тех же США. Посмотрите по каким оценкам выходили Airbnb или Uber и какой рост капитализации они смогли обеспечить за эти годы.

Хотелось бы верить что в России получится повторить тот успех. Деньги у ритейл инвесторов в России есть. Чего нет, так это среды, которая бы не создавала столько неопределенности и недоверия, которое мы имеем сейчас.

В России президентом поставлена значительная цель по увеличению доли фондового рынка от ВВП - с текущих ~25% до 66% к 2030 году. Надеюсь, предпосылки для ее выполнения все-таки будут созданы правительством и профильными ведомствами.
Ведь потенциал действительно есть. Стране нужны своя развитая космическая промышленность, электроника, робототехника и ИИ.
Согласен с автором, что в текущей ситуации мы имеем что-то очень похожее на пузырь, когда одни и те же деньги учитываются много раз по кругу.
Forwarded from kyrillic
Про AI пузырь (который мы пока называем "AI инфраструктурой").

В публичное поле начали выходить схемы, которые уже 2+ года использует бигтех и большие инвесторы для финансирования AI индустрии. Темой можно обгуглиться, я опишу кратко и по возможности просто:

1️⃣ Миллиарды ходят по кругу, все участники растят свои капитализации, а долги оказываются на балансах SPV-компаний, созданных именно для этого.

Можно сказать, что Nvidia сама финансирует спрос на свои GPUs через инвестиции и партнёров. Выручка компании - это частично чужие долги, и их не видно на балансе Nvidia.

2️⃣ Еще упрощая: Nvidia - это "ЦБ", эмитирует ликвидность в виде GPUs. Мы такое видели до 2008-го, когда американский банки "печатали" ликвидность под недвижимость. А до этого был пузырь телекома в США, когда ликвидностью было телеком оборудование.

3️⃣ Кстати Nebius Аркадия Воложа непосредственный участник схемы: "европейский представитель" Nvidia, который нужен из-за экспортных ограничений + получает деньги под залог GPUs, строит дата-центры и сдает мощности.

Проще говоря такие компании гоняют ликвидность между Nvidia, фондами и AI компаниями.

4️⃣ Объём GPU-залогового долга превысил $20–25 млрд (!), под 14% годовых (!) большим фондам. Все сделки завязаны на цене GPU Nvidia - если она падает, залоги обесцениваются.

5️⃣ На картинке к посту видна круговая финансовая порука. А очередная новость, что Nvidia инвестирует миллиарды в OpenAI или другую AI компанию означает, что будет, кому отгружать GPUs. И будет расти выручка Nvidia - в этом и есть смысл инвестиций.

6️⃣ Вот например экономист из Гарварда твитнул с графиками, что рост ВВП США без инвестиций в AI на 92% обусловлен инвестициями в датацентры. И без них рост составил бы 0,1%.

7️⃣ S&P 500 слишком зависит от AI индустрии, фондовый рынок США на 7-8% определяется самочувствием Nvidia. Кто-то скажет too big to fail! А другой с большей осторожностью будет смотреть на беспрецедентный фондовый рынок США.

8️⃣ Самое главное: спрос на GPUs во многом искусственный. То есть у genAI нет хорошего адопшена - я об этом писал с разных сторон: и что доля API в usage слишком низкая (пост), и что разработчики не так уж эффективны с genAI (раз, два, три), и через личную продуктивность (пост), и что genAI малоприменим в простых задачах бизнеса (пост).

Теперь мы все это отчетливо видим на микроуровне. Что не отменяет кучи возможностей!

9️⃣ GenAI с нами навсегда, просто это не революция, а очередной скучный инструмент. Использование (и изучение) которого будет обязательно для всех. Но жить мы лучше или богаче благодаря genAI не станем 🥲

@kyrillic
Существует два типа разрушения.

Разрушение силами идущими изнутри субъекта и разрушение субъекта силами внешними.

Первое происходит гораздо медленнее и реже, чем второе. Но первое при этом форма устойвивого развития, а второе неустойчивого.

При внешнем разрушении практически всегда происходит возврат субъекта к предыдущему состоянию, так как внутренняя структура все-таки остается прежней. Настоящий разлом и переход происходят только после внутренней работы по переформатированию.

Поэтому важно не форсировать изменения снаружи. Нужно помогать происходить им изнутри.

Это касается всего - от простых микроорганизмов до сложных социальных структур как государства.
Если даже Карпаты говорит, что чувствует себя отстающим как программист - это хороший индикатор времени.

Профессия пересобирается. Мы больше не просто пишем код, а пытаемся связать воедино кучу стохастических, полупрозрачных систем: агенты, промпты, контексты, инструменты, интеграции. Новый слой появился очень быстро, и нормальной ментальной модели у него пока ни у кого нет.

Ощущение «я мог бы делать в разы больше, если бы правильно всё это связал» сейчас, кажется, общее. Это не про интеллект, а про скорость изменений.

https://x.com/karpathy/status/2004607146781278521
Есть ли фильмы визульно более красивые чем Лоуренс Аравийский?