Лидерство и ИИ [Артем Бондарь]
Services: the new software Пора поговорить про программную статью секвойи, про которую вы и так скорее всего слышали. Как вы могли догадаться из поста про стиль, я неравнодушен к этим ребятам, и внимательно слежу за их ходом мысли. Очень четкие институциональные…
Я тут писал, что если хочешь строить классные gen-ai продукты/компании, то надо брать на себя ответственность за закрытие джобов end2end. Но когда практически этим занимаешься, основной блокер таких инициатив - это пропасть между экспертизой AI-чуваков и чуваками реально разбирающимися в этой джобе. Это и культурная пропасть: «да это просто смузехлебы-фантазеры», «да это просто отсталые деды», и пропасть в самой экспертизе, которую надо аккуратно преодолевать. Без двух этих компонентов, шансов за разумное время построить что-то полезное - мало.
Если пообщаться с ключевыми людьми в gen-ai b2b в России, то стратегически они все двигаются очень похоже: «мы классно сделали внедрение внутри себя, давайте дистрибутировать вовне». При этом дистрибьюция идет на плечах уже существующего продукта, который заехал во внутрянку других компаний. На западе, к слову, то же самое: Microsoft, oracle, salesforce строят агентизацию поверх джобов, которые полностью живут под зонтиком их продукта (а значит они эту джобу понимают вдоль и поперек).
Продукты, которые строят без этого союза глубокой экспертизы в процессе и технологии получаются убогими. Над очередным стартапом который сделал суммаризацию чего-то уже даже не смеются. Классный контрпример тут - это стартап моего бывшего руководителя из Самсунга gitlaw. Чувак - серийный предприниматель, и legal вопросы всегда были болью в жопе. Прорешав их N раз, с помощью генеративок он придумал как эту экспертизу масштабировать. Если бы он решил делать ии-юриста без своего опыта, то 100% сделал бы очередной RAG.
Практически это дает понятную наводку, чем заниматься. Если хочется идти соло, то надо понять какую собственную экспертизу есть смысл масштабировать с помощью генеративок, и этим заниматься. В Энтерпрайзе - понять, что Энтерпрайз уже научился делать классно и эффективно, и пытаться этот опыт масштабировать с помощью генеративок. Остальные подходы, кажутся мало жизнеспособными: пока ты будешь приобретать экспертизу в процессах, которые ты хочешь ген-аизировать, все терпение 10 раз потеряют.
Если пообщаться с ключевыми людьми в gen-ai b2b в России, то стратегически они все двигаются очень похоже: «мы классно сделали внедрение внутри себя, давайте дистрибутировать вовне». При этом дистрибьюция идет на плечах уже существующего продукта, который заехал во внутрянку других компаний. На западе, к слову, то же самое: Microsoft, oracle, salesforce строят агентизацию поверх джобов, которые полностью живут под зонтиком их продукта (а значит они эту джобу понимают вдоль и поперек).
Продукты, которые строят без этого союза глубокой экспертизы в процессе и технологии получаются убогими. Над очередным стартапом который сделал суммаризацию чего-то уже даже не смеются. Классный контрпример тут - это стартап моего бывшего руководителя из Самсунга gitlaw. Чувак - серийный предприниматель, и legal вопросы всегда были болью в жопе. Прорешав их N раз, с помощью генеративок он придумал как эту экспертизу масштабировать. Если бы он решил делать ии-юриста без своего опыта, то 100% сделал бы очередной RAG.
Практически это дает понятную наводку, чем заниматься. Если хочется идти соло, то надо понять какую собственную экспертизу есть смысл масштабировать с помощью генеративок, и этим заниматься. В Энтерпрайзе - понять, что Энтерпрайз уже научился делать классно и эффективно, и пытаться этот опыт масштабировать с помощью генеративок. Остальные подходы, кажутся мало жизнеспособными: пока ты будешь приобретать экспертизу в процессах, которые ты хочешь ген-аизировать, все терпение 10 раз потеряют.
GitLaw
GitLaw - The AI agent for contracts
GitLaw is the AI agent for contracts. Draft, review, redline, and sign legal agreements in one place — built with practicing lawyers and free to start.
👍6💯6❤2
У нас в команде млизации операционки за агентов в поддержке отвечает MLE, построивший Яндекс Нейро (сейчас Алиса AI). И с переодичностью раз в пол года я прихожу к нему и спрашиваю «нет, ну ты скажи, все-таки как попасть в выдачу Нейро своими товарами». И он каждый раз стоически повторяет «делай SEO, попадай в SERP на обычном поиске по релевантным запросам и попадешь в выдачу генеративки». Я говорю угу, и ухожу еще на пол года, пока у меня снова не созреет мысль «ну нет, должно быть что-то еще».
И видимо в гугле это «что-то еще» уже произошло. Чуваки проанализировали выдачу классического поиска и AI-mode и обнаружили что последний рекомендуют существенно более дорогие (на 21%) товары, чем классический поиск. Оч рекомендую почитать анализ, если вы как-то связанные с еком, выглядит убедительно.
Но и печально при этом. Генеративки в В2С типично продаются под соусом «мы сделаем выбор за вас, и он будет оптимальным». А выходит, что нет, причем, на 20% нет. Я и бы понял, если бы это было проплаченные позиции, но сравнивали органику с органикой.
Уверен, что это со временем поправят, но мне кажется это интересный сигнал: даже Google в GenAI продуктах пока не научился встать, на сторону пользователя. И несмотря на средний скепсис в индустрии про возможность сделать конкурента гигантам в В2С, хочется думать, что все-таки эта opportunity еще вполне себе есть и жива.
И видимо в гугле это «что-то еще» уже произошло. Чуваки проанализировали выдачу классического поиска и AI-mode и обнаружили что последний рекомендуют существенно более дорогие (на 21%) товары, чем классический поиск. Оч рекомендую почитать анализ, если вы как-то связанные с еком, выглядит убедительно.
Но и печально при этом. Генеративки в В2С типично продаются под соусом «мы сделаем выбор за вас, и он будет оптимальным». А выходит, что нет, причем, на 20% нет. Я и бы понял, если бы это было проплаченные позиции, но сравнивали органику с органикой.
Уверен, что это со временем поправят, но мне кажется это интересный сигнал: даже Google в GenAI продуктах пока не научился встать, на сторону пользователя. И несмотря на средний скепсис в индустрии про возможность сделать конкурента гигантам в В2С, хочется думать, что все-таки эта opportunity еще вполне себе есть и жива.
Productrise
Google AI Mode shows the same products 21.6% more expensive than traditional search [Data Study] | Productrise
A US and UK data study: when the same product ranks in both Google AI Mode and traditional search, the AI Mode price is about 21.6% higher.
❤5👍4
Лидерство и ИИ [Артем Бондарь]
Я тут писал, что если хочешь строить классные gen-ai продукты/компании, то надо брать на себя ответственность за закрытие джобов end2end. Но когда практически этим занимаешься, основной блокер таких инициатив - это пропасть между экспертизой AI-чуваков и чуваками…
ИИ-зация и культура
Когда организация начинает процесс стратегической ии-зации в точке ноль есть две слабосмешанные фракции: продвинутые технари и продвинутые ребята от бизнеса/продукта. Эти два племени по умолчанию не очень хорошо понимают друг друга, и на некоторых уровнях их мотивы явно конфликтуют. Если вы автоматизируете функцию, которую сейчас делают на руках - по сути это угроза чьему-то стабильному положению в компании. Так что задача нетривиальная.
Есть простой рецепт, когда это сращивание невозможно в принципе: когда целеполагание всей бизнес вертикали ортогонально задачам ии-зации. Все будут кивать головами/предлагать еще пообсуждать/активно файтиться, а решения приниматься не будут. Поэтому предполагаю, что шагом ноль целеполагание между этими фракциями выровнено, и у бизнес лидеров есть мотивация ии-зироваться, а этот интерес пролит вниз по организации.
По опыту дальше происходит попытка «неинвазивного внедрения». Технари не особо погружаются в бизнес и начинают клепать инструменты и отдавать их в бизнес. Бизнес зовет делать неважные для общего успеха вещи, и не спешит открываться в принципиальных процессах. Это та сила, которая рождает сотни саммарищаций и рагов, которые остаются демками, еавнгелизм и платформы без единого пользователя. Задача лидера пресекать такую попытку ии-зации и фокусировать команду на принципиальных вещах.
Вот в этот момент и вскрывается взаимное недоверие и непонимание. Обоснованное. Инженеры реально ничерта не понимают в процессах, за которые берутся, и это ок. Ребята от бизнеса ничего не понимают в мл и не спешат менять свои процессы ради рискованных инициатив (и это тоже ок). Тут нужно взаимное опыление: команда на самом деле поедет только тогда, когда млщики будут разбираться хотя бы на базовом уровне в бизнесе, который автоматизируют, а ключевые люди процесса будут понимать, что такое «разметка», «эвал», «согласованность». И тут нет никаких читкодов, это взаимное опыление требует времени. Как его провести с пользой? Сузить скоуп. Такой команде очень нужен опыт общего успеха. Беремся за небольшой проект с низкими рисками, вместе получаем дофамин и взаимный опыт, берем вес тяжелее. Чем больше люди друг с другом работают, тем больше доверия. Здесь опытный лидер займется опразрачиванием этой стратегии наверх, чтоб было понятно «почему они занялись такой мелочевкой» и помогает организовать настоящую кроссфункционпльную команду, где все участники вовлечены в проблемы друг друга, а не перекидываются залачками через забор.
По результату такой активности у вас есть мафия взаимного доверия. И на плечах этой сыгранной команды можно двигаться дальше, транзитивно вовлекая в секту свидетелей ии-зации все новых союзников. Но важно, что все это требует времени, терпения и фокуса: в прошлой каденции с бумажек на эксель не один десяток лет пересаживались.
Когда организация начинает процесс стратегической ии-зации в точке ноль есть две слабосмешанные фракции: продвинутые технари и продвинутые ребята от бизнеса/продукта. Эти два племени по умолчанию не очень хорошо понимают друг друга, и на некоторых уровнях их мотивы явно конфликтуют. Если вы автоматизируете функцию, которую сейчас делают на руках - по сути это угроза чьему-то стабильному положению в компании. Так что задача нетривиальная.
Есть простой рецепт, когда это сращивание невозможно в принципе: когда целеполагание всей бизнес вертикали ортогонально задачам ии-зации. Все будут кивать головами/предлагать еще пообсуждать/активно файтиться, а решения приниматься не будут. Поэтому предполагаю, что шагом ноль целеполагание между этими фракциями выровнено, и у бизнес лидеров есть мотивация ии-зироваться, а этот интерес пролит вниз по организации.
По опыту дальше происходит попытка «неинвазивного внедрения». Технари не особо погружаются в бизнес и начинают клепать инструменты и отдавать их в бизнес. Бизнес зовет делать неважные для общего успеха вещи, и не спешит открываться в принципиальных процессах. Это та сила, которая рождает сотни саммарищаций и рагов, которые остаются демками, еавнгелизм и платформы без единого пользователя. Задача лидера пресекать такую попытку ии-зации и фокусировать команду на принципиальных вещах.
Вот в этот момент и вскрывается взаимное недоверие и непонимание. Обоснованное. Инженеры реально ничерта не понимают в процессах, за которые берутся, и это ок. Ребята от бизнеса ничего не понимают в мл и не спешат менять свои процессы ради рискованных инициатив (и это тоже ок). Тут нужно взаимное опыление: команда на самом деле поедет только тогда, когда млщики будут разбираться хотя бы на базовом уровне в бизнесе, который автоматизируют, а ключевые люди процесса будут понимать, что такое «разметка», «эвал», «согласованность». И тут нет никаких читкодов, это взаимное опыление требует времени. Как его провести с пользой? Сузить скоуп. Такой команде очень нужен опыт общего успеха. Беремся за небольшой проект с низкими рисками, вместе получаем дофамин и взаимный опыт, берем вес тяжелее. Чем больше люди друг с другом работают, тем больше доверия. Здесь опытный лидер займется опразрачиванием этой стратегии наверх, чтоб было понятно «почему они занялись такой мелочевкой» и помогает организовать настоящую кроссфункционпльную команду, где все участники вовлечены в проблемы друг друга, а не перекидываются залачками через забор.
По результату такой активности у вас есть мафия взаимного доверия. И на плечах этой сыгранной команды можно двигаться дальше, транзитивно вовлекая в секту свидетелей ии-зации все новых союзников. Но важно, что все это требует времени, терпения и фокуса: в прошлой каденции с бумажек на эксель не один десяток лет пересаживались.
❤16👍7💯3
Я про это не задумывался, но тут на панельной дискуссии прямо прочувствовал, насколько же SME терпеть не могут маркетплейсы. Раньте я про это догадывался: штрафы, произвольные комиссии за логистику, короче все то, что в сми регулярно фигурирует. А кажется гораздо более фундаментальная проблема - это потеря прямого контакта с клиентом. Ты, все таки, не бренд, который лежит на полках офлайн ритейла и крутит бюджеты, которыми можно маркетироваться через массовые каналы типо телека. Ты обычно работаешь точечно по своей клиентской базе, а тут у тебя контакт к базе отбирают. Мрак короче.
Но кажется, пока условный сималенд везет все барахло мира в маркетпоейсы, а клиенты довольны, селлерам остается скрипеть зубами и брать ту дистрибьюцию, что дают.
Или же у нас все-таки кто-то построит свой Shopify. В Штатах топ-3 маркетпоейсов держат 50% рынка еком. У нас 60%. Не в последнюю очередь потому, что у нас нет независимой мерчант платформы, а есть пачка решений, из которых свой Shopify надо собирать самостоятельно. Кажется, что как минимум на словах запрос на это есть, но появится ли независимая альтернатива маркетплейсам - увидим.
Но кажется, пока условный сималенд везет все барахло мира в маркетпоейсы, а клиенты довольны, селлерам остается скрипеть зубами и брать ту дистрибьюцию, что дают.
Или же у нас все-таки кто-то построит свой Shopify. В Штатах топ-3 маркетпоейсов держат 50% рынка еком. У нас 60%. Не в последнюю очередь потому, что у нас нет независимой мерчант платформы, а есть пачка решений, из которых свой Shopify надо собирать самостоятельно. Кажется, что как минимум на словах запрос на это есть, но появится ли независимая альтернатива маркетплейсам - увидим.
❤12
Ну и для пропустивших айти пикник прилетели записи выступлений, где я в частности делился мыслями на тему «как не заниматься фигней в ген-аи». Хэв фан и хороших выходных ✌️
YouTube
GenAI: как не стать частью пузыря — Артём Бондарь
В преддверии IPO ключевых вендоров LLM особенно громко звучат два противоположных взгляда. У финансистов-скептиков не сходится экономика технологической волны, а технооптимисты уверены, что GenAI даст беспрецедентный рост продуктивности. Кажется, мы приближаемся…
❤9😎4
Я думал, что буду писать «обо всём», но оказалось, что глубоко занимают меня на деле только две вещи: кусочки кремния, делающие вид, что они что-то понимают и люди, за которыми идут другие. Об этом дальше и поговорим
❤11😁9👍2
Попугая научили говорить «эскалация» и он стал senior engineering manager’ом
Какое-то время назад я отпустил в свободное плавание мл руководителя, с которым вместе прошли огонь и воду. Недавно пересеклись в коридоре, стали обсуждать, как у него дела в новой роли. И погружаясь в его сложности с огромным неудовольствием понял, что отправил я его в это свободное плавание недостаточно экипированным. На то, конечно, были причины: мы в последнем совместном проекте фокусно осушали болото, где не оставалось других инструментов, кроме как агрессивная война до победного. Но в другом контексте эта тактика может оказаться наоборот контрпродуктивной.
Воевать начинающие менеджеры любят (знаю по себе). Делают это со страха или от бунтарства, и делают это через край. Другая крайность - полная пассивность, случается гораздо реже - такие ребята в управление и не лезут, так что чаще всего это горящие глаза, метрики наперевес, и готовность вытаскивать на свет божий и душить каждую неэффективность и угрозу своим целям, попадающуюся на пути.
Вообще такой энергичный настрой - это классно. Гораздо лучше, чем потухшие глаза и унылое «просто оставьте меня в покое, я жду бонуса». Но такие ребята часто сами себя закапывают по двум причинам:
А/ они могут быть просто не правы, и игнорируют какие-то важные ньюансы, о которых их пытаются предупредить
Б/ Они игнорируют фактическое положение вещей и свои реальные возможности повлиять на ситуацию.
Так что напор может лишить менеджера важной информации, и не дать отличать ситуацию «да они просто не хотят» от «они объективно не могут». А если, все же «не хотят», то понять а чего «хотят». Может показаться, что через эскалацию можно сломить чью то мотивацию - но это большая иллюзия. Если у вас системный конфликт интересов, то разовые пиздюли не помогут: нужно искать взаимную выгоду. Иногда эта взаимная выгода «ты мне помогаешь, или будешь регулярно огребать», но это невероятно дорогой процесс для всех участников. Чаще полезно искать более системный взаимный интерес. А для этого надо сначала понять, а чего человек хочет, и сделать это невозможно, если ты в состоянии войны.
Это, кстати, работает и с подчиненными: можно давить на человека и выжимать то, что вам от него нужно, но это не может быть прочным и долгосрочным фундаментов успешной совместной работы.
Вообще, главное, что я понял про работу в коммерческих компаниях: вся управленческая работа - это ежедневные взаимовыгодные сделки. И талант менеджера - расширять поле возможных опций, чтоб чаще находить win-win. Этот win-win не обязан быть приятным (ты мне результаты - я тебе возможность спокойно работать), но он должен быть реалистичен и взаимно куплен. Ну иногда и эскалировать, конечно, надо, просто, чтоб вашим любимым коллегам жизнь медом не казалась.
Какое-то время назад я отпустил в свободное плавание мл руководителя, с которым вместе прошли огонь и воду. Недавно пересеклись в коридоре, стали обсуждать, как у него дела в новой роли. И погружаясь в его сложности с огромным неудовольствием понял, что отправил я его в это свободное плавание недостаточно экипированным. На то, конечно, были причины: мы в последнем совместном проекте фокусно осушали болото, где не оставалось других инструментов, кроме как агрессивная война до победного. Но в другом контексте эта тактика может оказаться наоборот контрпродуктивной.
Воевать начинающие менеджеры любят (знаю по себе). Делают это со страха или от бунтарства, и делают это через край. Другая крайность - полная пассивность, случается гораздо реже - такие ребята в управление и не лезут, так что чаще всего это горящие глаза, метрики наперевес, и готовность вытаскивать на свет божий и душить каждую неэффективность и угрозу своим целям, попадающуюся на пути.
Вообще такой энергичный настрой - это классно. Гораздо лучше, чем потухшие глаза и унылое «просто оставьте меня в покое, я жду бонуса». Но такие ребята часто сами себя закапывают по двум причинам:
А/ они могут быть просто не правы, и игнорируют какие-то важные ньюансы, о которых их пытаются предупредить
Б/ Они игнорируют фактическое положение вещей и свои реальные возможности повлиять на ситуацию.
Я тут пишу «они», но важно, что я себя от абстрактных «них» не отделяю - у меня какое-то время назад 360 опрос выдал мне чудовищную обратную связь, с которой я потом годами работал.
Так что напор может лишить менеджера важной информации, и не дать отличать ситуацию «да они просто не хотят» от «они объективно не могут». А если, все же «не хотят», то понять а чего «хотят». Может показаться, что через эскалацию можно сломить чью то мотивацию - но это большая иллюзия. Если у вас системный конфликт интересов, то разовые пиздюли не помогут: нужно искать взаимную выгоду. Иногда эта взаимная выгода «ты мне помогаешь, или будешь регулярно огребать», но это невероятно дорогой процесс для всех участников. Чаще полезно искать более системный взаимный интерес. А для этого надо сначала понять, а чего человек хочет, и сделать это невозможно, если ты в состоянии войны.
Это, кстати, работает и с подчиненными: можно давить на человека и выжимать то, что вам от него нужно, но это не может быть прочным и долгосрочным фундаментов успешной совместной работы.
Вообще, главное, что я понял про работу в коммерческих компаниях: вся управленческая работа - это ежедневные взаимовыгодные сделки. И талант менеджера - расширять поле возможных опций, чтоб чаще находить win-win. Этот win-win не обязан быть приятным (ты мне результаты - я тебе возможность спокойно работать), но он должен быть реалистичен и взаимно куплен. Ну иногда и эскалировать, конечно, надо, просто, чтоб вашим любимым коллегам жизнь медом не казалась.
💯10❤7👍5
А зачем вообще вести тг канал? Иногда меня про это спрашивают знакомые, но чаще я сам задаюсь этим вопросом. На поверхности ответ простой: потому что мне нравится. Я легко могу провалиться в состояние потока, набирая очередной пост, и получаю много эмоций, когда вижу что мои мысли вызывают отклик. Но ради этого канал заводить не обязательно: в разговоре с интересным человеком или публичных выступлениях эту потребность можно тоже закрыть.
Легко сказать, какие причины точно меня не драйвят. Монетизация, даже если раскачать канал, будет копеечная, а рекламу вставлять не хочется определенно - это точно поломаем все доверие. Сделать канал джампстартом для инфобиза тоже идея сомнительная - основная работа принесет гораздо больше. Личный бренд гораздо лучше качается через профильные СМИ на интересующую аудиторию. Бизнесом тут и не пахнет.
Но пользу в ведении канала я все равно вижу.
Когда я первый раз пришел на прямой эфир на радио, нацепил наушники и увидел сигнал, что мы полетели, я неожиданно понял, что в моей голове полная пустота и я через ватную стену слышу голоса ведущих, слабо понимая, о чем они говорят. И вытащил я себя из этого ступора простым рычагом: про все темы, что мы обсуждали я уже несколько раз подумал, набирая тот или иной пост сюда. Оставалось в духе постмодерна склеивать собственные готовые тезисы в складное повествование, иногда импровизируя. Но важно, что 80% мыслительной работы было проделано в офлайне, чтоб в онлайне сфокусироваться на форме, а не содержании. Та же история с панельными дискуссиями, где тебе есть что сказать на свои темы, и ты можешь внимательнее слушать других участников дискуссии, делать к нам отсылки, спорить, не опасаясь того, что забудешь собственную нить рассказа. Очень полезно, очень рекомендую.
Но отрабатывать публичные выступления можно и в стол, почему же канал? А тут мне нравится не-помню-чей-совет, что в жизни надо «найти своих людей и успокоиться». И так уж вышло, что самых близких по духу людей я встретил на стыке бизнеса, управления и AI. Именно с этими ребятами у меня выработалась самая крепкая цеховая солидарность и взаимный интерес. И канал - это возможность послать сигнал своим, мол «ребят, мы одно дело делаем, и живем одними же и теми проблемами». И вот эта сеть взаимного доверия, опирающегося на общие интересы и ценности, на мой взгляд самый классный выхлоп из всей этой затеи.
Легко сказать, какие причины точно меня не драйвят. Монетизация, даже если раскачать канал, будет копеечная, а рекламу вставлять не хочется определенно - это точно поломаем все доверие. Сделать канал джампстартом для инфобиза тоже идея сомнительная - основная работа принесет гораздо больше. Личный бренд гораздо лучше качается через профильные СМИ на интересующую аудиторию. Бизнесом тут и не пахнет.
Но пользу в ведении канала я все равно вижу.
Когда я первый раз пришел на прямой эфир на радио, нацепил наушники и увидел сигнал, что мы полетели, я неожиданно понял, что в моей голове полная пустота и я через ватную стену слышу голоса ведущих, слабо понимая, о чем они говорят. И вытащил я себя из этого ступора простым рычагом: про все темы, что мы обсуждали я уже несколько раз подумал, набирая тот или иной пост сюда. Оставалось в духе постмодерна склеивать собственные готовые тезисы в складное повествование, иногда импровизируя. Но важно, что 80% мыслительной работы было проделано в офлайне, чтоб в онлайне сфокусироваться на форме, а не содержании. Та же история с панельными дискуссиями, где тебе есть что сказать на свои темы, и ты можешь внимательнее слушать других участников дискуссии, делать к нам отсылки, спорить, не опасаясь того, что забудешь собственную нить рассказа. Очень полезно, очень рекомендую.
Но отрабатывать публичные выступления можно и в стол, почему же канал? А тут мне нравится не-помню-чей-совет, что в жизни надо «найти своих людей и успокоиться». И так уж вышло, что самых близких по духу людей я встретил на стыке бизнеса, управления и AI. Именно с этими ребятами у меня выработалась самая крепкая цеховая солидарность и взаимный интерес. И канал - это возможность послать сигнал своим, мол «ребят, мы одно дело делаем, и живем одними же и теми проблемами». И вот эта сеть взаимного доверия, опирающегося на общие интересы и ценности, на мой взгляд самый классный выхлоп из всей этой затеи.
❤37
Я сначала кринжевал с Барсика, купившего автомобиль в тбанке, а потом осознал весь постмодерн ситуации. Ведь раньше как было: случался инфоповод, вирусился в соцсетях, и потом пиарщики крупных компаний его обыгрывали широкой коммуникацией. А тут и инфоповод выдумали, и вириальную реакцию медиа нарисовали, только финальный ролик сами реально сделали. Ну просто Generation П с нарисованным правительством. Абсолют синема.
Когда мы придумывали брендинг для нашей линейки генеративных ассистентов, наш главный пиарщик Т настаивал на названии «горыныч». Мы его не послушали и назвали низкотестостеронным gen-t. А теперь, думаю, зря, возможно совсем по-другому бы все поехало. Гений виден на расстоянии, что уж.
Когда мы придумывали брендинг для нашей линейки генеративных ассистентов, наш главный пиарщик Т настаивал на названии «горыныч». Мы его не послушали и назвали низкотестостеронным gen-t. А теперь, думаю, зря, возможно совсем по-другому бы все поехало. Гений виден на расстоянии, что уж.
😎12😁7💯2💅2🤡1
Очень смущают регулярные статьи вида «опенсорс всего на пол шага отстают от проприетарных моделей». Для меня это очень больная тема, потому что у нас в Т работает очень крутая фундаментальная команда, которая регулярно вытаскивает продуктовые инициативы из задницы, когда оказывается что опенсорс работает далеко не так радужно, как хочется.
И если раньше проблема скорее была в сатурированых и оверфитнутых бенчах, то сейчас с усложнением агентских сценариев, кажется проблема чуть тоньше. Вот мы делали агентов поддержки. Жирный хвост запросов в полностью цифровом саппорте - невероятно сложная вещь. И после того, как ребята проделали огромную работу: оцифровали и стандартизировали эти регламенты с точностью до самого галимого edge-case, оказалось, что GPT-5 в такой среде дает галлюцинаций как средний сотрудник поддержки (абсолют увы раскрыть не могу), а всё самое современное поколение квенов Кими дипсиков и прочих - отбитые 20% галлюцинаций. Очевидно, это в прод не поедет.
Хотя по бенчам все достаточно близко. И моя гипотеза, что тут две проблемы:
а/ подавляющее количество бенчей предполагает существование правильного ответа. Как в ЕГЭ - написать хоть что-то лучше чем не писать ничего. Вот модели и подхватывают это поведение фундаментально от целеполагания. Все, включая китайские, но те, как более агрессивные оверфитеры серьезнее от этого страдают
б/ китайцы жестко дистиллятся и мы видим артефакты сильной опоры на SFT / шумного реворда от LLM-критика. Живая RL среда в этом смысле меньше спихивает политику в режим «отвечай любой ценой»
Можно еще поспекулировать на эту тему, но факт остается: как бы нам продуктово не было удобно забить на дообучение, но на опенсорсе в действительно сложных задачах все еще невозможно бежать без тюнов. И это сильно усложняет агентизацию рф компаний: нет так много ребят могут позволить себе заводить онлайн рл на огромном кластере и имеют процессы, автоматизация которых финансово это упражнение оправдывает.
И если раньше проблема скорее была в сатурированых и оверфитнутых бенчах, то сейчас с усложнением агентских сценариев, кажется проблема чуть тоньше. Вот мы делали агентов поддержки. Жирный хвост запросов в полностью цифровом саппорте - невероятно сложная вещь. И после того, как ребята проделали огромную работу: оцифровали и стандартизировали эти регламенты с точностью до самого галимого edge-case, оказалось, что GPT-5 в такой среде дает галлюцинаций как средний сотрудник поддержки (абсолют увы раскрыть не могу), а всё самое современное поколение квенов Кими дипсиков и прочих - отбитые 20% галлюцинаций. Очевидно, это в прод не поедет.
Хотя по бенчам все достаточно близко. И моя гипотеза, что тут две проблемы:
а/ подавляющее количество бенчей предполагает существование правильного ответа. Как в ЕГЭ - написать хоть что-то лучше чем не писать ничего. Вот модели и подхватывают это поведение фундаментально от целеполагания. Все, включая китайские, но те, как более агрессивные оверфитеры серьезнее от этого страдают
б/ китайцы жестко дистиллятся и мы видим артефакты сильной опоры на SFT / шумного реворда от LLM-критика. Живая RL среда в этом смысле меньше спихивает политику в режим «отвечай любой ценой»
Можно еще поспекулировать на эту тему, но факт остается: как бы нам продуктово не было удобно забить на дообучение, но на опенсорсе в действительно сложных задачах все еще невозможно бежать без тюнов. И это сильно усложняет агентизацию рф компаний: нет так много ребят могут позволить себе заводить онлайн рл на огромном кластере и имеют процессы, автоматизация которых финансово это упражнение оправдывает.
👍10❤7
Появилось немного времени и наконец погрузился в вопросы агентизации SDLC.
У нас в Т есть некоторый водораздел, где за агентизацию SDE отвечает один большой департмент, а остальных профессий - другой (мой). Поэтому я долгое время не слишком погружался в вопросы автоматизации кодинга, играясь в основном с гринфилд проектами в кодексе. А в автоматизации энтерпрайза последние три года стабильно приносили эффекты только разного рода workflows. Так что это был ноубрейнер: основные усилия в ре-дизайн процессов и их последующую автоматизацию, и 20% тратим на ебаные идеи для рисеча 🥴.
Последний год все сильно поменялось: модели, за рл-енные на харнессы стали реально круто работать, и ебаные идеи стали проще заводиться и приносить больше эффектов. Так что я вижу, как естественным образом в ключевых проектах мы забрасываем workflows, и перелазим на харнесс инжениринг (даже там, где сам процесс вполне себе описывается стройной BPM схемой). А фундаментальная команда всё больше занимается тюнами под харнессы, нежели дистиллами отдельных кубиков: именно поэтому мы перестали развивать линейку general моделей T-Pro и инвестировали в развитие экспертизы по тюнам под конкретные харнессы (T-Search).
Но все, кто занимался агентизацией, знает про классическую проблему размена автономности (эффекта) на качество (риски). Делаещь фабрику кода на агентах, убираешь код ревью и умираешь от отложенных эффектов в виде инцидентов и засранной нейрослопом кодовой базы. Я, как MLE, в этом вопросе придерживаюсь простого принципа: делай сильный контроль качества с оцифровкой всех необходимых тебе свойств, и тогда ты можешь позволить себе любую автономную систему под капотом. Тюнишь ее, пока тебя не начинает устраивать цифра на дашике, или деградируешь на более простую и предсказуемую автоматизацию. Благо в массовых операционных процессах такие контроли качества все равно приходится строить: без контура контроля люди начнут страдать фигней и без всяких ллм.
В инженерных задачах это проблематичнее: иногда отревьюить код более трудозатратно, чем его написать. Поэтому все так и бегут в отключение контура контроля в кодинге: без этого эффектов не видать. Так что поиск альтернативных подходов к контролю качества тут стоит остро. И тут мне и попался видос чувака, который предлагает альтернативу: давайте оставим код ревью, но перенесем часть усилий на шаг верхнеуровневого дизайна решения. Не будем отдавать агенту тикет, а сначала проработаем архитектуру, колстек и даже сигнатуры ключевых функций. Не будем отдавать агенту ту часть, в которой они сейчас объективно плохи. Тогда и само ревью будет проходить гораздо проще: не нужно разбираться в вермишели логики, а достаточно будет понять, что содержание PR соответствует архитектурному плану. И в таком сетапе хотя полной автоматизации не происходит - общее ускорение случается.
Я не уверен на 100%, что это универсально рабочая схема, но я точно беру себе на заметку идею, что выбор точки делегирования агенту задачи - это важный фактор успеха. Если общеизвестно, что агент в чем то плох, то возможно и не нужно страдать, пытаясь оцифровать ваши ожидания, а просто найти удобный промежуточный язык оцифровки ваших ожиданий, и общаться с агентом на нем, а не заставлять агента ваши ожидания угадывать.
У нас в Т есть некоторый водораздел, где за агентизацию SDE отвечает один большой департмент, а остальных профессий - другой (мой). Поэтому я долгое время не слишком погружался в вопросы автоматизации кодинга, играясь в основном с гринфилд проектами в кодексе. А в автоматизации энтерпрайза последние три года стабильно приносили эффекты только разного рода workflows. Так что это был ноубрейнер: основные усилия в ре-дизайн процессов и их последующую автоматизацию, и 20% тратим на ебаные идеи для рисеча 🥴.
Последний год все сильно поменялось: модели, за рл-енные на харнессы стали реально круто работать, и ебаные идеи стали проще заводиться и приносить больше эффектов. Так что я вижу, как естественным образом в ключевых проектах мы забрасываем workflows, и перелазим на харнесс инжениринг (даже там, где сам процесс вполне себе описывается стройной BPM схемой). А фундаментальная команда всё больше занимается тюнами под харнессы, нежели дистиллами отдельных кубиков: именно поэтому мы перестали развивать линейку general моделей T-Pro и инвестировали в развитие экспертизы по тюнам под конкретные харнессы (T-Search).
Но все, кто занимался агентизацией, знает про классическую проблему размена автономности (эффекта) на качество (риски). Делаещь фабрику кода на агентах, убираешь код ревью и умираешь от отложенных эффектов в виде инцидентов и засранной нейрослопом кодовой базы. Я, как MLE, в этом вопросе придерживаюсь простого принципа: делай сильный контроль качества с оцифровкой всех необходимых тебе свойств, и тогда ты можешь позволить себе любую автономную систему под капотом. Тюнишь ее, пока тебя не начинает устраивать цифра на дашике, или деградируешь на более простую и предсказуемую автоматизацию. Благо в массовых операционных процессах такие контроли качества все равно приходится строить: без контура контроля люди начнут страдать фигней и без всяких ллм.
В инженерных задачах это проблематичнее: иногда отревьюить код более трудозатратно, чем его написать. Поэтому все так и бегут в отключение контура контроля в кодинге: без этого эффектов не видать. Так что поиск альтернативных подходов к контролю качества тут стоит остро. И тут мне и попался видос чувака, который предлагает альтернативу: давайте оставим код ревью, но перенесем часть усилий на шаг верхнеуровневого дизайна решения. Не будем отдавать агенту тикет, а сначала проработаем архитектуру, колстек и даже сигнатуры ключевых функций. Не будем отдавать агенту ту часть, в которой они сейчас объективно плохи. Тогда и само ревью будет проходить гораздо проще: не нужно разбираться в вермишели логики, а достаточно будет понять, что содержание PR соответствует архитектурному плану. И в таком сетапе хотя полной автоматизации не происходит - общее ускорение случается.
Я не уверен на 100%, что это универсально рабочая схема, но я точно беру себе на заметку идею, что выбор точки делегирования агенту задачи - это важный фактор успеха. Если общеизвестно, что агент в чем то плох, то возможно и не нужно страдать, пытаясь оцифровать ваши ожидания, а просто найти удобный промежуточный язык оцифровки ваших ожиданий, и общаться с агентом на нем, а не заставлять агента ваши ожидания угадывать.
YouTube
Why Software Factories Fail
In July 2025 Dex Horthy turned the lights off: an agent software factory where nobody read the code. It fell apart. An issue appeared that no amount of prompting could fix, the site was down, users were furious, and he was digging through a codebase he had…
👍7❤4