Артём обо всём
786 subscribers
25 photos
2 videos
23 links
Head of NLP в Т. Пишу про все то, о чем не могу не писать.
Download Telegram
Что мне с этого вашего AlphaEvolve

Мои любимые МЛ трюки и концепции - это те, про которые тебе независимо и увлеченно рассказывают несколько незнакомых друг с другом инженеров. Я тут поймал себя на мысли, что самые талантливые ребята из моего окружения все чаще стали ссылаться на гугловый AlphaEvolve.

В чем его суть: мы берём задачу с автоматически верифицируемым ревордом (например: написать оптимальный алгоритм. Реворд - скорость и корректность исполнения на тесткейсах). Для нее пишем затравочное решение и просим LLM сгенерировать несколько более оптимальных решений. Эти решения скорим и укладываем в базу экспериментов. Дальше семплируем из этой базы несколько экспов с результатами и просим LLM сделать следующую модификацию. И так, пока не найдем перебором более эффективное решение.

Самый сок - это семлировние. Алгоритм строит некоторую метрику в пространстве решений, и вдохновляясь генетическими алгоритмами берет не жадно самое лучшее, как новую базу, а набирает диверсифицированный сет из «островов» этого пространства. Очень красиво, автоматизировано и накинуло много пользы во внутренних гугловских задачах: https://deepmind.google/blog/alphaevolve-impact/

Но тут есть загвоздка: не во всех задачах можно легко найти верифицируемый реворд. И не все задачи можно решать изолированно без контекста (как математические задачки).

Но если подумать, то все же многие полезные энтерпрайз задачи можно загнать в этот сетап. Например если мы автоматизируем какой-то процесс, то реворд - это попадание в поведение живых людей, проверенное llm-as-a-judge. А в шаг эволюции может включать не только думание в вакууме, но и походы во внешние базы знаний в поиске правильного граундинга под наблюдаемое поведение. И получается, что любую задачу по автоматизации существующего процесса можно загнать в этот сетап. Не писать промты руками, а дать алгоритму самому собирать правильный контекст из всех возможных источников.

Что делать с этой мыслью - думаю. Это точно сработало «на руках», где шаг эволюции мы проводили вручную, но возможно этот процесс автоматизируется еще сильнее.
👍11
Как понять, чем заниматься в корпорации

Какое-то время назад, я решил обновить свой CV, чтоб оглянуться назад и оценить результаты десятилетия своих усилий на мл поприще свежим взглядом. Свежим, потому что моя оптика в тот момент заметно обновилась: позиция уже давно предполагала непосредственную близость к бизнесу, поэтому результаты хотелось оценить через созданную долгосрочную ценность, а не через заковыристость моделек и ощущение сложности проекта.

И результаты были интересные. По многим прошлым проектам я вообще не знал, как они повлияли в итоге на бизнес в долгосроке. Некоторые активности, казавшиеся невероятно важными и отъедавшие уйму времени, в конечном итоге не раскрывались в виде твердых результатов. А задачи, от которых я воротил нос - лежали внятной и внушительной цифрой. После этого упражнения я скорректировал свое отношение к работе: стал на любую задачу смотреть через призму вопроса «а как я положу это в итоге себе в резюме?».

Это серьезно перекроило подход к выбору активностей, за которые я берусь. Меня стали интересовать только два вопроса: какой здесь endgame с точки зрения эффекта для компании (в индустриально понятных метриках) и достаточно ли у меня ресурсов для реализации. Сложно забрать в CV абстрактное «прокачал платформы». Легко взять «обеспечили инфрой запуск инициатив на Х ярдов». Сложно - 20 небольших проектов с зоопарком метрик и эффектов. Просто забрать факт напрямую из отчета для инвесторов компании.

И если первое время я больше интересовался вопросом эффекта, предполагая что «умрем, но достигнем» доступными ресурсами, то со временем второй вопрос меня стал волновать больше. Что вцелом немудрено: на линейных позициях основной доступный ресурс - это собственная энергия и навыки. И особенно после 4 лет стартаперства, где ты занимаешься в-с-е-м, кажется, что имея достаточно денег любой критический вопрос проекта можно плюс минус закрыть собой (надо научиться мобильной разработке? Дайте ночь и методичку). Но увы это крайне ограниченный ресурс, поэтому даже в эпоху ллм амбициозные проекты надо делать командами и не всегда под прямым управлением. И вот тут оказывается, что помимо непосредствннной работы для успеха крупного проекта надо заниматься еще и кучей сопутствующих активностей: сидеть в комитетах корпы, чтоб повлиять на важные тебе решения по распределению ресурсов. Ходить на ивенты, чтобы качать технобренд и привлекать лучших. Приводить в чувства найм и внутренние эйчар процессы, чтоб иметь возможность завести внутрь и замотивировать на результат сотрудников. Планировать закупки, проводить реорги, искать возможности объединиться с другими тимами, влиять на целеполагание команд от которых ты зависишь. Короче много-много далекой от фактической продуктовой работы. Ее невозможно положить результатами в CV, и она может легко сожрать ВСЕ ваше время и энергию, если не подходить к ней осознанно, как к необходимой, но по сути вторичной по отношению к созданию прямой ценности.

Чтобы ловить баланс между этими активностями я обычно размышляю про свои проекты деревом зависимостей. Чего мне не хватает, чтобы проект доехал до конкретного CV-пригодного результата? И как дешевле всего снять блокер на пути проекта? Со временем горизонт планирования растет, и блокеры становятся все интереснее: мотивация сотрудников, заинтересованность стейкхолдеров, согласованность с целями соседних команд. Но суть та же: что я должен сделать сегодня, чтобы через год-три-пять я смог бы записать себе простой и очевидно классный результат. Классный в тех попугаях, которые ценятся на интересном мне уровне управления. Вот это и ответ на вопрос «чем же тут надо заниматься», иначе ваш задор с легкостью прожует и переварит корпоративная машина.
22👍16
Как делать классные доклады

Как вы уже поняли по количеству постов в этом канале - меня хлебом не корми, дай что-то рассказать. И одна из вещей, которой я искренне горжусь - это то, как хорошо мои ребята инженеры начинают делать доклады, после того как я плотно ими позанимаюсь. Без лишней скромности: мои потоки на конфах/точечные доклады ребят всегда в топе, и есть несколько простых механик, исполнения которых этому способствует.

1/ у любого рассказа должна быть цель
Что должны сделать слушатели, по выходу из зала. Они должны пойти и добиться успеха в своей компании используя ваш подход? Они должны восхититься вашей классностью и прислать резюме? Нужно, чтобы они предпочли ваше решение другому? Нужно чтоб вас загрейдапили в ближайшем ревью? А почему они без вашего доклада этого не делают? Отвечая на этот вопрос раз за разом по методу Сократа вы и поймете, какие ключевые тезисы должны быть раскрыты и проданы. Чем лучше вы проработаете этот вопрос - тем интереснее ваш доклад будет (или вы поймете что его делать и не надо).

2/ тезисный план
Любой доклад можно и нужно уметь рассказать за минуту/5 минут/45 минут. Для этого вам нужна иерархическая структура повествования, где вы сначала выписываете ключевые тезисы текстом, а потом начиняете рассказ уточнениями и деталями 2-го, 3-го и более уровней. Так что сначала пишем одностраничник с планом рассказа, а потом уже возимся с красотой на слайдах.

3/ на слайдах не должно быть текста
Люди читают быстро, и не будут вас слушать а будут читать и скучать. На слайд выносим то, что плохо воспринимается с голоса: таблицы, графики, схемы, иллюстрации. Если пишем текст, то только ключевую мысль, которую вы раскрываете голосом. Если на одном слайде несколько буллетов - добавляете их по одному через смену слайда. Слайды - бесплатные, делайте их хоть 500. А вот текст полезно считать платным: по сто рублей за слово, например.

4/ репетируйте
Если вы уже набили себе руку, можно импровизировать прямо на сцене - иначе с таймером репетируйте, пока не станет хорошо. Записываете себя на диктофон и слушаете. Убираете эээ, мэээ, так, ну, типа. Сложно, но очень облегчает восприятие. Золотое правило: лучше помолчать, чем навалить словесной каши. Хорошие ораторы работают паузами не хуже, чем словами.

5/ волнуйтесь
На самом деле если вы не волнуетесь перед выступлением - это плохой знак. Аудитория читает эмоции очень хорошо, и раз вы не волнуетесь, то вам ваш рассказ не кажется важным, а значит и аудитория будет следить с меньшим интересом. Волнение через край тоже плохо, но тут аудитория может быть вашим другом: честно скажите, что волнуетесь, не пытайтесь задавить эмоцию. Вы удивитесь, сколько поддержки вы можете получить, просто честно сказав вслух, что волнуетесь.

6/ не шутите, но расскажите личное
Матожидание эффекта от шутки в неизвестной аудитории - строго отрицательно. Если вы опытный спикер, и знаете, что ваши приколы залетают, а цена ошибки невысока - вперед. Иначе не надо этого делать. Такие трюки обычно выполняются профессионалами. А поделиться личным - это супер. Спикер всегда в невыгодном и уязвимом положении, и сделать себя еще уязвимее - универсально вызывает симпатию.

7/ будьте собой
Ваша история и опыт ценны сами по себе. Даже если они не уникальны. Мы любим слушать истории, когда в них есть Человек. Лучше найти свою небольшую аудиторию, рассказав то, что вам важно, чем вещать в массы то, что не трогает вас. Так что добавьте в свою историю побольше себя. И я сейчас не про публичные выступления.
28👍5🥴2💯2
T-Search - наша открытая AgenticRAG модель 👽

Выкладываем специализированную 35B-A3B Agentic search модель, заточенную на multi-hop ретрив контекста из классических поисковых индексов. Выкладываем вместе с харнессом, который несложно прикрутить к вашему существующему поиску. Модель на базе Qwen3.6 влазит в H100, а собирает контекст частно круче, чем взрослые диприсеч модели. Drop-in replacement вашего ретривала в раге с качеством ретрива уровня диприсеч+ по цене в пять раз ниже, чем у моделей-бегемотов. Не привязан к определенному алгоритму ретрива: будет работать и с bm25 и с эмбедами не теряя в качестве.

Пробенчить такую способность модели оказалась не менее интересная задача: помимо стандартных BrowseComp и SealQA мы собрали свой бенч TRuST. И выкладываем его тоже.

Фронтирные опенсорс модельки уже достаточно классно справляются с бизнесовыми задачами, если собрать им правильный контекст, и T-Search это наша попытка уйти от ручного context-engineering’а в сторону автоматического и эффективного по костам решения.

И если хотите узнать подробности, приходите завтра на турбомл послушать/поспрашивать ребят непосредственно. А если не получится дойти ногами, то скоро скинем подробный отчет на хабру.
Please open Telegram to view this post
VIEW IN TELEGRAM
30👍15💅7🌚1💯1😎1
А 3-го августа в 17:00 залетайте на прямой эфир: иду в гости к Саше Поломодову разгонять про агентизацию не-айти энтерпрайза. Что по другому, а что ровно так же, как в агентизации инженерии. Приходите 😎
17👍7💅5
Чеклист здоровья среды успешного МЛ проекта

Какое-то время назад я написал очерк про "чеклист здоровья МЛ проекта". Он описывает набор необходимых условий с точки зрения чистой техники, но перестает быть достаточным, когда проект опускается в конкретную среду и на плечи конкретных людей. Поэтому сегодня хотелось бы чуть больше сфокусироваться на взаимоотношениях ключевых участников проекта - именно то, за чем пристальнее всего наблюдают em/directing ребята:

1/ проект не попадает в "инверсию приоритетов" по всей массе задействованных команд
Если для вашего стейкхолдера проект - это приоритет номер 1, а для команды, от которой вы зависите - это десятый приоритет, то успех либо не случится, либо будет стоить вам мотивации ключевых людей команды. Желательно бы такое обнаруживать на берегу и сводить стейкхолдеров договариваться о ресурсах. Ну а если такое вскрывается по дороге и не решается переговорами - то полезно пивотить команду, чтоб она не билась головой о стену. В такой ситуации очень важна изобретательность и для переговоров и для поиска фолбека, если переговоры зашли в тупик.

2/ команда смогла поделить роли
Типичный пример - ты очень хочешь позаниматься задачей, на нее высаживают кого-то еще, а тебя назначают "помогать". Помощь тогда будет такой, что лучше бы и не помогали (очевидно). Такие конфликты невероятно важно выводить на свет из под ковра, чтобы они не превращались в хроническую вялотекущую политическую возню. Для этого важно, чтоб в компании был лидер или группа лидеров, которому доверяют все участники сабантуя, и кто поможет выстроить внятные границы отвественности. На первому этапе в storming стадии абсолютно окей, что участники притираются друг к другу и примеряют роли в команде, но если притирка затягивается и не модерируется, то это может превратиться в вялотекущий ад, выбивающий из команды лучших людей.

3/ все принципиальные роли закрыты замотивированными людьми
Вообще на работе нормально делать не "то что хочется", а "то что надо". Но есть ньюанс. Если это "надо" все время идет в разрез с "хочется", но рано или поздно неудовлетворенность перельется через край и человек (даже самый отвественный) забьет на свои обязательства, причем на все сразу, а не только те, что бесят. Нереалистично раздать всем задачи, которые им нравятся. Но очень важно работать над поиском правильных людей в команду. "Лягушка" для одного чувака - это возможность для другого.

4/ у ключевых участников нет конфликтов интересов
По этому пункту добиться идеала практически невозможно: процитирую одного успешного бизнес лидера "хорошо, если цели сотрудика и организации хотя-бы сонаправлены". Но бывают очевидные ситуаци, где ключевой челвоек приследует личные цели. Либо удовлетворяет амбиции в ущерб результату, либо пытается занять удобную для себя, но вредную для прогресса роль. Тут талант менеджера в том, чтобы понимать мотивацию всех участников квартета, и вовремя выводить тех, чья польза перестает перевешивать вред. И в этом вопросе доверие - снова ваш друг и товарищ. Конечно можно вывыести на чистую воду просто насев на сотрудника - но будьте уверены, в этом случае это ваш последний продуктивный совместный проект.

5/ у лидеров продукта есть внятный ответ на вопрос "а что дальше"
Где-то на пол пути к победе даже в самом классном продукте у любого нормального лидера будет вопрос "хорошо, ну вот сделаю я все это - а дальше что?". И худший ответ тут "посмотрим". Потому что нормальные лидеры с высокой агентностью "посмотрят" и сами. И найдут. И найдут еще до того, как вы доделали текущий проект. Поэтому критчиески важно, чтобы люди понимали общую картину, и куда вы их ведете, и ради чего усилия прямо сейчас. Худшее, что может случиться тут - это лидер, который не понимает куда двигаться дальше. Такой начнет сильно тормозить и команду и себя.

Вообще когда осознаешь, как много звезд должно сложиться, чтобы проект доехал до успеха начинаешь понимать, что любая организация держится на скотче и молитвах. И конечно же таланте хороших управленцев, которых надеюсь со временем будет становиться все больше.
👍9💯4
А 8-го августа приходите на айти-пикник! Там я буду открывать поток GenAI своими рассуждениями на тему «а кому в gen-ai жить хорошо?». Какими проверочными вопросами отсекать откровенный скам, и как нанести непоправимую финансовую пользу организациям, внедряя эти ваши генеративки. До встречи!
💅8😎74👍3
Я «отпилил» себе две ноги, чтобы стать senior tech manager’ом

Мой руководитель в одном из интервью очень точно подметил динамику карьерного роста в корпорации: «чтобы перейти на новый уровень управления тебе нужно отпилить себе любимую ногу, которая тебя делает успешным на текущем уровне, и отрастить новую». Я очень люблю эту метафору именно за точность ощущений в процессе.

В инженерных профессиях подавляющее большинство руководителей начинают линейными инженерами. Ты набираешь экспертизу, все ловчее справляешься со все более сложными проблемами, и вот однажды, тебе предлагают (или ты сам принимаешь решение) стать тимлидом. И в этот момент очень важно не обманывать себя: тебе предлагают много денег за то, что ты начнешь постепенно терять свою хардовую экспертизу, все больше погружаясь в организационные вопросы. Взамен ты получаешь проявленность в организации и больше власти.

Худшее, что можно сделать в этой ситуации: это попытаться усидеть на двух стульях. Именно в таком сетапе рождаются микроменеджеры с пачкой джунов, которые «в соло держат небо на плечах». Не буду расписывать к чему это приводит, думаю вы и так таких ребят встречали. В крупных технологических компаниях это отлично понимают, и там есть понятие «терминального грейда», выше которого расти не обязательно - можно работать и заниматься любимым делом. А иногда и полезно вернуться на этот уровень из менеджмента, чтоб освежить тех скиллы (сам такое практиковал - жив здоров).

Этот фазовый переход с отпиливанием инженерной ноги оканчивается примерно на уровне мидл-менеджмента, где ты уже ведешь группу команд. Ты уже окончательно попрощался с чисто-инженерными вопросами. Ты гораздо более силен в управлении людьми и проектам, становишься лицом крупных инициатив и на контакте с ключевыми бизнес лидерами. И после нескольких крупных побед в полный рост встает новая развилка.

Выход в senior-level менеджмент предполагает очень важный сдвиг роли: тебе нужно уйти на вторые роли в конкретных проектах, и дать дорогу новому поколению лидеров. Теперь у тебя нет никакой возможности схватить штурвал инициативы и вытащить ее из канавы (потому что в это время на твоем уровне начнут решать вопросы без тебя). Твоя цель здесь - это сводить капитал с людьми, которые в состоянии его приумножить. Создавать для этого условия и управлять рисками. Уходить от ручного управления талантами в сторону создания систем, которые сами подымают талантливых людей вверх. Теперь нет никакого «твоего» успеха. Есть только успех твоих ребят.

Это на самом деле очень сложная перестройка, от которой иногда нужно осознанно отказываться. Например, когда ты еще чувсьвуешь, что ты хочешь побыть на первых ролях в интересных тебе проектах ради опыта/портфолио. Или ты в принципе чувствуешь в себе драйв быть на острие классных продуктов и инициатив с возможностью сказать «я это сделал». Причин может быть много, но как и в прошлый раз попытка усидеть на двух стульях приведет к полному разочарованию.

На мой взгляд правильная мотивация здесь - это искреннее желание поделиться опытом и взрастить людей, которые через какое-то время могли бы занять твою текущую позицию. Тогда новый уровень дохода поможет закрыть бытовые вопросы и даст больше уверенности в будущем, а сложности политики, стратегии и бюрократии будут понятной ценой, которую ты платишь, чтобы вырастить крутых лидеров.
25👍11😎9
Разогреваясь перед айти пикником заехал в гости на эфир Радио РБК к Аркадию Глушенкову тезисно поразгонять про трудности внедрения ИИ в Энтерпрайз. А углубимся мы в эти темы уже в субботу на айти пикнике! Расскажу про это в генеративном шатре в 13:00 и на панельке Норникеля в 15:00 в шатре «бигтех в каске». До встречи!

На фото обозреваю ситуацию на рынках.
20😎4👍2😁1
У меня дома варят трубы из-за протечки, так что я сижу в коридоре и изучаю B2B рынок GenAI

Делюсь наблюдениями. Какие модели дистрибьюции AI решений разной степени упакованности я вижу на рынке.

1 - продаем сырые токены
OAI, Antropic, Google, китайцы, Яндексы и сберы. Предполагается, что вы внутри продвинутые ребята, сами займетесь продуктизацией, либо компании высадят forward deploy engineers. А компании дадут фронтирные модели, заоптимизируют инференс и возьмут свои 50-100% маржи. Честный бизнес, но сильно опирается на силу экспертизы на стороне Энтерпрайзов. Дистрибьюция - через B2C, проф комьюнити и пиар вокруг силы фронтирныэ моделей и опенсорса. Далее - через консалтинг и мелких интеграторов. Рычаг - цена и свойства моделей. Короче база, но большая часть добавочной ценности дальше по цепочке

2 - продавать general-purpose ассистентов
Это Энтерпрайз версии B2C ассистентов. Из плюшек - управление доступами и бюджетами и разной степени интеграция с хранилищами данных. От готовой интеграции с экосистемой Microsoft 365, до возможности подключать кастомные MCP у Claude. Дистрибьюция через B2C клиентов, которые уже подсели на инструмент, или через enterprise бандловые подписки. Рычаг - популярность в В2С против машины корпоративных продаж. Пока побеждает народная любовь, но посмотрим, как будет. Там кажется будет тяни-толкай с ценами, потому что эффекты таких внедрений слабозаметны, хоть и стали гигиеническим минимумом

3 - платформы агентов для операций
Тут может показаться, что я про конструкторы типо langflow, но самые прикольные и настоящие платформы - это апсейл к текущим платформам данных. Классный пример - agentsforce от salesforce. Там уже есть все интегры и ручек и данных, останется только наклепать самих агентов. Туда же движется Microsoft со своим копайлотом. Дистрибьюция - через экосистемы, где уже есть все данные. Кто продает CRM/ERP, тот держит этот рынок имхо

4 - копилоты для офисных чуваков
Ребята, которые продают инструменты офисной продуктивности встраивают туда ai-фичи. Офисные пакеты, таск трекеры, видеозвонки. Дистрибьюция поверх существующей экосистемы инструментов. Тут естественно Microsoft 360 и все их подражатели. Все, кто пытается строить поверх чужой экосистемы рискуют быть съеденимы экосистемой

5 - копилоты/среды агентов для SDLC
Это наш любимый Claude code и прочие. Продаются, как платформа для стандартизированной среды разработки. Дистрибутируется через среду power-user’ов. Кажется, что даже нечего объяснять, мы сами их дистрибьюцией по сути занимались последний год

6 - вертикальные утилиты под конкретные профессии
Те самые «компания-промпт поверх чат гпт». Самые широко представленные по абсолютному количеству, но самые несчастные по масштабам рынков и оседающей добавочной ценности. Дистрибьюция как и у классических вертикальных SaaS. Сложный и болезненный путь самураев

7 - вертикальные е2е сервисы на базе GenAI
Самые любопытные и слабо представленные в этом паноптикуме ребята. При этом, вероятно, самые перспективные с точки зрения возврата капитала. Но про них хочется поговорить отдельным будущим постом.
9😁4💅3👍2😎2