Буквально за последние 2 месяца было большое количество релизов как коммерческих моделей (GPT, Claude, Gemini), так и открытых (GLM, Kimi) и по бенчмаркам все модели уже очень близки друг к другу.
Можно следить за изменениями и держать все в голове — да. Но понимать с такой динамикой все нюансы происходящего и уж тем более пробовать все на практике — практически нереально.
И вот вчера у нас была встреча закрытого комьюнити нашей ИИ-Академии, обсуждали последние изменения из мира frontier нейросетей и делились опытом.
Поделились друг с другом своими наблюдениями про модели и ценовую политику - кто чем пользуется, какие инсайты есть. Я рассказал про свой опыт с Codex, с новыми модельками gpt-5.6-*, про свое разочарование Terra, про фестиваль ресетов от OpenAI. Ребята делились своими наблюдениями про участившееся баны аккаунтов и зависимость этого от способов оплаты, про опыт перехода с Cursor на Claude Code, наблюдениями про реальную разницу между Fable и Opus, немного про опыт использования опен-сорса через OpenCode поговорили, еще обменялись актуальным опытом и сделанными открытиями в плане разного харнесса и и того как это дружит с обновленными моделями. У всех очень разный опыт, как в плане компаний, их процессов и решаемых задач, так и в плане используемых инструментов.
И вот такие закрытые встречи в узком кругу — на мой взгляд, просто must have сегодня. Помогает держать руку на пульсе и расширять кругозор!
Можно следить за изменениями и держать все в голове — да. Но понимать с такой динамикой все нюансы происходящего и уж тем более пробовать все на практике — практически нереально.
И вот вчера у нас была встреча закрытого комьюнити нашей ИИ-Академии, обсуждали последние изменения из мира frontier нейросетей и делились опытом.
Поделились друг с другом своими наблюдениями про модели и ценовую политику - кто чем пользуется, какие инсайты есть. Я рассказал про свой опыт с Codex, с новыми модельками gpt-5.6-*, про свое разочарование Terra, про фестиваль ресетов от OpenAI. Ребята делились своими наблюдениями про участившееся баны аккаунтов и зависимость этого от способов оплаты, про опыт перехода с Cursor на Claude Code, наблюдениями про реальную разницу между Fable и Opus, немного про опыт использования опен-сорса через OpenCode поговорили, еще обменялись актуальным опытом и сделанными открытиями в плане разного харнесса и и того как это дружит с обновленными моделями. У всех очень разный опыт, как в плане компаний, их процессов и решаемых задач, так и в плане используемых инструментов.
И вот такие закрытые встречи в узком кругу — на мой взгляд, просто must have сегодня. Помогает держать руку на пульсе и расширять кругозор!
Слышали про релиз модели Kimi K3? Хочу накинуть несколько полезных фактов про железо под эту модель
Главная особенность релиза в том, что Kimi K3 — это самый большой (2.8T параметров) Open Souce, который по бенч-маркам в одной лиге с Fable 5, GPT-5.6 Sol, Opus 4.8 и стабильно обгоняет тот же GPT-5.5.
Т.е. эту модельку можно развернуть на своем железе в своем контуре и это будет полноценный frontier-уровень, будет круто и безопасно.
Но чтобы запустить это чудо в своем контуре — надо около 1.5+ терабайт VRAM. Таких видео-карт в природе не существует и тут нужен целый их кластер, при чем очень хороших и много. Для понимания: у самой топовой потребительской видеокарты RTX 5090 — всего 32 ГБ VRAM, а у топой серверной B300 - 288 ГБ VRAM.
В общем, я задался вопросом — можно ли вообще найти у РФ-провайдеров подходящие конфигурации в аренду и сколько будет стоить. Нашел готовые серверы HGX™ B300 у Selectel — абсолютно топовый сервер, которого уверенно хватит на инференс Kimi K3.
Я посчитал, если этот сервер использовать под кодинг-агентов, то он стабильно будет держать и обслуживать примерно 10-12 кодиговых сессий (людям будет работать комфортно). 13-30 кодинговых сессий будут уже заметно тормозить, но какая-то вменяемая скорость разработки еще будет сохраняться. После 30 - думаю, что работать станет невозможно.
А теперь цена. Аренда такого сервера, если верить калькулятору Селектела будет стоить ~8 млн/месяц. Если покупать, то ~110 млн разово + 3-5млн опекса ежегодно.
Такой вот «доступный Open Source» :)
Главная особенность релиза в том, что Kimi K3 — это самый большой (2.8T параметров) Open Souce, который по бенч-маркам в одной лиге с Fable 5, GPT-5.6 Sol, Opus 4.8 и стабильно обгоняет тот же GPT-5.5.
Т.е. эту модельку можно развернуть на своем железе в своем контуре и это будет полноценный frontier-уровень, будет круто и безопасно.
Но чтобы запустить это чудо в своем контуре — надо около 1.5+ терабайт VRAM. Таких видео-карт в природе не существует и тут нужен целый их кластер, при чем очень хороших и много. Для понимания: у самой топовой потребительской видеокарты RTX 5090 — всего 32 ГБ VRAM, а у топой серверной B300 - 288 ГБ VRAM.
В общем, я задался вопросом — можно ли вообще найти у РФ-провайдеров подходящие конфигурации в аренду и сколько будет стоить. Нашел готовые серверы HGX™ B300 у Selectel — абсолютно топовый сервер, которого уверенно хватит на инференс Kimi K3.
Я посчитал, если этот сервер использовать под кодинг-агентов, то он стабильно будет держать и обслуживать примерно 10-12 кодиговых сессий (людям будет работать комфортно). 13-30 кодинговых сессий будут уже заметно тормозить, но какая-то вменяемая скорость разработки еще будет сохраняться. После 30 - думаю, что работать станет невозможно.
А теперь цена. Аренда такого сервера, если верить калькулятору Селектела будет стоить ~8 млн/месяц. Если покупать, то ~110 млн разово + 3-5млн опекса ежегодно.
Такой вот «доступный Open Source» :)
Какие интересные «совпадения» случаются
Буквально сегодня по одному из наших продуктов обсуждали, под какие SLA мы готовы коммититься перед клиентами. Продукт — API-шлюз для доступа к frontier LLM моделям (без VPN, с адекватными ценами,с оплатой в рублях и вот это вот все).
Сделали кучу замеров, посмотрели нагрузку, все посчитали и начали наши внутренние «торги».
Начали с 99.9% доступности. Тут быстро поняли, что к такому мы в моменте физически не готовы и не хотим быть готовыми для нового продукта без нормального кешфлоу.
Опустиилсь до 99%. К этому готовы и морально и физически, но объем инфраструктурной работы необходимой для нашей же уверенности в этой цифре заставил торговаться дальше.
В итоге остановились на 98%, которые готовы гарантировать клиентам и в которых уверены. Все-таки это продукт, где ты балансируешь между 2 огней: с одной стороны РКН с его блокировками, с другой стороны ограничения LLM-вендоров — много неконтролируемых факторов, которые сложно предвидеть.
Все. Договорились, зафиксировали, работаем.
И вот буквально через несколько часов начинается деградация в работе сервиса. Часть запросов на отдельных нодах без видимой системы начинает валиться где-то на сетевом уровне между узлами. Локализовали до WireGuard (популярный VPN протокол) — часть запросов протокола просто не доходит и режется где-то на уровне провайдера, даже не доходя до наших сетевых интерфейсов. И тут меня догоняют свежие новости, что именно сегодня РКН ужесточил блокировки VPN-сервисов и все становится на свои места 🙁
Очень быстро получили подтверждание того, что наш трезвый расчет и перестраховка были не напрасными 😅
Буквально сегодня по одному из наших продуктов обсуждали, под какие SLA мы готовы коммититься перед клиентами. Продукт — API-шлюз для доступа к frontier LLM моделям (без VPN, с адекватными ценами,с оплатой в рублях и вот это вот все).
Сделали кучу замеров, посмотрели нагрузку, все посчитали и начали наши внутренние «торги».
Начали с 99.9% доступности. Тут быстро поняли, что к такому мы в моменте физически не готовы и не хотим быть готовыми для нового продукта без нормального кешфлоу.
Опустиилсь до 99%. К этому готовы и морально и физически, но объем инфраструктурной работы необходимой для нашей же уверенности в этой цифре заставил торговаться дальше.
В итоге остановились на 98%, которые готовы гарантировать клиентам и в которых уверены. Все-таки это продукт, где ты балансируешь между 2 огней: с одной стороны РКН с его блокировками, с другой стороны ограничения LLM-вендоров — много неконтролируемых факторов, которые сложно предвидеть.
Все. Договорились, зафиксировали, работаем.
И вот буквально через несколько часов начинается деградация в работе сервиса. Часть запросов на отдельных нодах без видимой системы начинает валиться где-то на сетевом уровне между узлами. Локализовали до WireGuard (популярный VPN протокол) — часть запросов протокола просто не доходит и режется где-то на уровне провайдера, даже не доходя до наших сетевых интерфейсов. И тут меня догоняют свежие новости, что именно сегодня РКН ужесточил блокировки VPN-сервисов и все становится на свои места 🙁
Очень быстро получили подтверждание того, что наш трезвый расчет и перестраховка были не напрасными 😅
❤3😁2👍1
Вайб-кодинг VS AI-driven
Вычитываю сейчас лонгриды в рамках курса и наткнулся на хорошие формулировки различия двух подходов. Оставлю тут 🙂
Вайб-кодинг
Разработчик примерно описывает, что хочет, AI генерирует код, а архитектура, требования, процессы и правила остаются в стороне. На практике это действительно работает и можно быстро собрать автоматизацию, написать фичу, сделать прототип, закрыть маленькую бизнес-задачу. Сначала складывается впечатление, что произошел скачок производительности: один человек делает то, для чего раньше требовались аналитик, frontend-разработчик, backend-разработчик и иногда еще несколько специалистов. AI быстро генерирует большие объемы кода, помогает собрать интерфейс, backend, интеграции, скрипты и инфраструктурные файлы. Но у этого подхода есть предел.
Проблемы начинаются, когда проект нужно сопровождать, развивать, масштабировать и передавать другим людям или агентам. Код, который быстро сгенерирован без проектирования, начинает вести себя как снежный ком. Фичи накладываются друг на друга, решения становятся менее понятными, агентам все сложнее ориентироваться в проекте, а разработчик тратит все больше времени на устранение последствий.
В итоге наступает провал эффективности. AI продолжает генерировать код быстро, но скорость генерации перестает быть преимуществом, потому что каждый новый слой кода увеличивает хаос. Если процесс не управляем, AI не сокращает технический долг, а ускоряет его накопление.
AI-driven подход
AI-driven подход отличается от вайб-кодинг не тем, что в нем меньше AI. Наоборот, AI все так же используется для генерации кода, проектирования, анализа, отладки и review. Разница в том, что AI используется внутри системного инженерного workflow и не пытается его заменить.
AI-driven разработка не отменяет жизненный цикл создания софта, напротив, она требует еще более аккуратной организации контекста, потому что чем понятнее окружение, тем лучше работают кодинговые агенты.
В зрелом подходе AI должен быть встроен во все этапы разработки: от формулирования задачи до релиза.
Вычитываю сейчас лонгриды в рамках курса и наткнулся на хорошие формулировки различия двух подходов. Оставлю тут 🙂
Вайб-кодинг
Разработчик примерно описывает, что хочет, AI генерирует код, а архитектура, требования, процессы и правила остаются в стороне. На практике это действительно работает и можно быстро собрать автоматизацию, написать фичу, сделать прототип, закрыть маленькую бизнес-задачу. Сначала складывается впечатление, что произошел скачок производительности: один человек делает то, для чего раньше требовались аналитик, frontend-разработчик, backend-разработчик и иногда еще несколько специалистов. AI быстро генерирует большие объемы кода, помогает собрать интерфейс, backend, интеграции, скрипты и инфраструктурные файлы. Но у этого подхода есть предел.
Проблемы начинаются, когда проект нужно сопровождать, развивать, масштабировать и передавать другим людям или агентам. Код, который быстро сгенерирован без проектирования, начинает вести себя как снежный ком. Фичи накладываются друг на друга, решения становятся менее понятными, агентам все сложнее ориентироваться в проекте, а разработчик тратит все больше времени на устранение последствий.
В итоге наступает провал эффективности. AI продолжает генерировать код быстро, но скорость генерации перестает быть преимуществом, потому что каждый новый слой кода увеличивает хаос. Если процесс не управляем, AI не сокращает технический долг, а ускоряет его накопление.
AI-driven подход
AI-driven подход отличается от вайб-кодинг не тем, что в нем меньше AI. Наоборот, AI все так же используется для генерации кода, проектирования, анализа, отладки и review. Разница в том, что AI используется внутри системного инженерного workflow и не пытается его заменить.
AI-driven разработка не отменяет жизненный цикл создания софта, напротив, она требует еще более аккуратной организации контекста, потому что чем понятнее окружение, тем лучше работают кодинговые агенты.
В зрелом подходе AI должен быть встроен во все этапы разработки: от формулирования задачи до релиза.
❤3
На скрине статистика расхода токенов за неделю при полном выжигании подписки Codex, которая стоит 200$. Большая часть расхода — GPT 5.6 Sol. 26 млрд (!!!!) токенов
По этой статистике нет детализации, сколько токенов было input, сколько output, сколько кеша. Но давайте предположим, что соотношение такое, что 75% - кешированный input, 20% - input без кеша, 5% - output.
Если этот расход пеерсчитать на цены по API, то получается 75 тысяч $. Это только за неделю. За месяц ~300к $
Получается, что покупая подписку за $200 в месяц вы покупаете ~$300к реального потребления
По этой статистике нет детализации, сколько токенов было input, сколько output, сколько кеша. Но давайте предположим, что соотношение такое, что 75% - кешированный input, 20% - input без кеша, 5% - output.
Если этот расход пеерсчитать на цены по API, то получается 75 тысяч $. Это только за неделю. За месяц ~300к $
Получается, что покупая подписку за $200 в месяц вы покупаете ~$300к реального потребления
🤯3🤔1
Динамика рынка ИТ-аутстаффинга за май 2025 - июль 2026
Июль кончился, делюсь обновленным графиком динамики спроса на рынке ИТ-аутстаффинга.
Июль просел на 30% по отношению к прошлому году🤯
Про методику и данные для аналитики — в оригинальном посте
—
Кстати, активно расширяем партнерскую сеть, чтобы быстрей закрывать прямые запросы клиентов — пишите Кате, если хотите вступить
Июль кончился, делюсь обновленным графиком динамики спроса на рынке ИТ-аутстаффинга.
Июль просел на 30% по отношению к прошлому году
Про методику и данные для аналитики — в оригинальном посте
—
Кстати, активно расширяем партнерскую сеть, чтобы быстрей закрывать прямые запросы клиентов — пишите Кате, если хотите вступить
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯1
Ходил сегодня в новый зал после перерыва.
Смотрю, в дальнем углу зала стоит небольшая группа людей и все плачут.
Сначала думал: предприниматели. Оказалось — кроссфитеры
Смотрю, в дальнем углу зала стоит небольшая группа людей и все плачут.
Сначала думал: предприниматели. Оказалось — кроссфитеры
😁6
Динамика рынка ИТ-аутстаффинга за май 2025 - август 2026
Август давно кончился, делюсь обновленным графиком динамики спроса на рынке ИТ-аутстаффинга.
Август, как и Июль просел почти на 30% по отношению к прошлому году🤯
Про методику и данные для аналитики — в оригинальном посте
Показалось странным такое падение на 30% уже второй месяц подряд, проверил достоверность данных — они достоверны. В ряде каналов существено (у кого-то прямо в разы!!!) сократилось кол-во запросов начиная с весны этого года, а пик сокращения как раз выпал на июль-август
—
Кстати, несмотря ни на что, мы активно расширяем партнерскую сеть, чтобы быстрей закрывать прямые запросы клиентов — пишите Кате, если хотите вступить
Август давно кончился, делюсь обновленным графиком динамики спроса на рынке ИТ-аутстаффинга.
Август, как и Июль просел почти на 30% по отношению к прошлому году
Про методику и данные для аналитики — в оригинальном посте
Показалось странным такое падение на 30% уже второй месяц подряд, проверил достоверность данных — они достоверны. В ряде каналов существено (у кого-то прямо в разы!!!) сократилось кол-во запросов начиная с весны этого года, а пик сокращения как раз выпал на июль-август
—
Кстати, несмотря ни на что, мы активно расширяем партнерскую сеть, чтобы быстрей закрывать прямые запросы клиентов — пишите Кате, если хотите вступить
Please open Telegram to view this post
VIEW IN TELEGRAM