Agentic World
1.21K subscribers
50 photos
7 videos
2 files
37 links
Про AI, LLM, агентов, продукты и людей
Download Telegram
Привет! Еду в Питер, чтобы завтра с утра выступать на Saint Highload++ с докладом про AI-команды будущего и необходимые для них навыки. Упахался готовиться, должно получиться хорошо.

Хайлод для меня - культовая конференция.

Во-первых, за все время ее существования я оттуда почерпнул массу крутейшей инфы из выступлений, планочка для них очень высокая. Во-вторых, эта конференция совсем не про доклады - она про концентрацию очень умных людей в одном месте, где самое интересное рождается после докладов в кулуарах, в техно холиварах и в классных знакомствах.

Да, очень многое теперь можно достать из ллмок, но ни одна ллмка не заменит тот инженерный непередаваемый вайб в воздухе, который случается, когда заряженные люди собираются обсуждать технологии. Пока я готовился, я понял что из моего доклада при желании можно собрать 5-6 отдельных на самые разные темы вокруг AI. И я безумно рад, что любимый Highload становится площадкой, где такой опыт можно обсуждать с теми, кто на самом фронтире нового технологического уклада.

Санкт-Петербург, 22-23 июня, будет круто!
(я 22ого в 11:40 в зеленом зале)
https://highload.ru/spb/2026/abstracts/18292

И еще одна важная вещь. Как вы знаете, я поехавший на агентах. Но есть отдельный их вид, который требует к себе ещё больше пристального внимания - агенты для кодинга. Революция с кодом уже прошла - это, кажется, уже очевидно, но как именно будет происходить трансформация всех других процессов вокруг и что с этим делать - пока не знает никто.

Но команда, сделавшая Highload, пытается разобраться и в этом и предоставляет новую площадку, посвященную исключительно AI в разработке. Это новая конфа - Agentic Dev Conf, на которой будем обсуждать всё - метрики, экономку, роли разработчиков, выстраивание процессов и всю внутрянку агентологии. Я в программном комитете и могу заверить, что будет очень круто - холивар и зарубы из-за взглядов на процессы возникают даже на внутренних созвонах ПК для отбора докладов.

MCP или скиллы? Hermes или не очень? Codex ВСЁ? Пачечка мак мини или облака? Как теперь денежки-то считать?

Если волнует будущее наших профессий, то лучше быть, потому что будем все горячо обсуждать вживую!

3 июля, Москва, Лофт Холл
https://agenticdevconf.ru

Участвую в формировании повесточки, буду там сам, вообщем - горячо рекомендую! 🔥
👍6🔥6🎉2😁1
Мемасик из завтра 😀
😁14💯8👍5🤣1
Последний пост был написан больше месяца назад - и это потому что я...отдыхал 🤩👍

Отпуск в 3 недели это страшная штука - с одной стороны ты токенмаксишь по полной с пивасиком на море, с другой - после выхода сразу пришлось нырнуть в работку, подзабив на канал. Крутого контента - вагон, отписываться рано! 🤙

Исправляюсь 🫡

Краткий пост про вечное - про OCR или по-простому - распознавание документов. Мне казалось, что этот вопрос давно решен, но оказалось, что нет - в мире слишком много упоротых и абсолютно проклятых сканов и фоточек самых странных документов.

Для построения хорошего OCR есть два подхода - классика и VLM (то есть, vision-ллмка). Оба подхода хороши, но механизмы работы у них разные и оттого природа ошибок - тоже.

Классический OCR обычно разделяет задачу на несколько этапов: предобработка, поиск областей текста, выделение строк и распознавание последовательности символов. На последней стадии движок преобразует изображение строки в последовательность символов, опираясь прежде всего на их визуальную форму. Любой символ (типа буквы "А") - это на самом деле абстракция, у которой есть конкретное написание в разных шрифтах, и вот конкретное написание, состоящее из разных черточек-палочек, называется глифом. l, 1 и I, а также 0 и О - могут быть слабоотличимы в разных шрифтах, и движок распределяет вероятность между несколькими похожими вариантами.

И главный плюс OCR - он говорит, "бро, я тут вижу плохо". Вокруг этого появилась куча всего - словари, эвристики, координаты и многое другое. Но главный принцип - классика не понимает документ, а аккуратно его замеряет и оцифровывает. Дальше - сами.

У VLMки механика совершенно другая.

Изображение превращается в сетку патчей, каждый из которых кодируется в вектор — визуальный токен. Для трансформера слово и кусок изображения - объекты одного типа. Все эти патчики отправляются в трансформер и вот здесь благодаря механизму внимания открывается самая большая магия.

Когда мы дописываем промпт "посмотри в шапку документа", то это может сузить задачу и модель действительно может справиться с этим лучше. При этом, на выходе по-прежнему генерация - а значит, вероятностное распределение того, что МОЖЕТ здесь быть. Как следствие - периодическая уверенная ложь, которую не отличить от правды.

Если попытаться свести к выводу, то:

- OCR не видит документ в привычном понимании, он в первую очередь считывает визуальные признаки текста и выдает локальную уверенность в результате

- VLM "видит" документ целиком - может учитывать раскладку, структуру, соседние поля и смысл - но ей не всегда хватает силенок увидеть все идеально. А когда чего-то не увидит - МОЖЕТ исказить реальность ̶т̶.̶е̶.̶ ̶н̶а̶п̶и̶з̶д̶и̶т̶ ̶к̶а̶к̶ ̶л̶ю̶б̶а̶я̶ ̶л̶л̶м̶к̶а̶. И это главная проблема VLM в распознавании документов - ее уверенность не отвечает на вопрос "насколько хорошо документ был обработан".

Ну а в реальной жизни - из-за разной природы ошибок, они отлично дополняют друг друга в сложных пайплайнах. VLM разбирает структуру документа и находит нужные поля, а OCR дополнительно за ней перепроверяет все критичное 👍🤩🤩
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11🔥6👏2🍾1👾1
Киллер фичи и безумный восторг

Две главные AI-лабы планеты делают какой-то космос: сначала нужна была очень умная модель, и как только она появилась, developer experience начал меняться с какой-то космической скоростью. Фича последних дней - полное погружение при сложном выборе и сборка вариантов налету.

Вы делаете фичу Х, но в процессе ваш харнесс понимает, что можно сделать это тремя разными вариантами - с разным UX и разной архитектурой. И как оно реально будет лучше - да вот вообще непонятно.

"А давай я просто соберу тебе это все в UI вместо текста?" - вжух - у нас отдельно собранная страница с каждым собранным интерактивным вариантом на потыкать. Вот верстка, вот варианты кнопочек, вот нотис на ошибке вылетает. Сидишь, тыкаешь, понимаешь что воооот этот вариант хорош, но надо еще докрутить.

Возвращаешься, говоришь хочу вариант Б, добавь только вот такую штуку и погнали. 10 минут и все готово.

Не знаю как вас, но я каждый день получаю огромное удовольствие от тех инструментов, которыми мы сейчас обладаем. Перетряхивает все стандартные процессы, но меня как забрало, так и не отпускает. Каждый день! Бесконечная эйфория и бесконечные возможности 🤩👍🤩
Please open Telegram to view this post
VIEW IN TELEGRAM
16👍4👎1🔥1🤔1
Media is too big
VIEW IN TELEGRAM
В корпоративной библиотеке Сберуниверситета нашел вот такой клад 🔥🚀
 
Надо брать!
😁10🤣8🔥4👀2
Про сам СберУниверситет. Он крутой!

На самом деле, в этой библиотеке из предыдущего поста немалое количество классных книг на самые разные тематики. И всё сделано ну очень приятно. 

Книжечки - лишь маленькая часть огромной махины под названием СберУниверситет - корпоративного университета Сбера. Я был в нем однажды на курсе по лидерству, а сейчас два дня читал лекцию про агентов для топ-менеджмента одного из дивизионов.

Университет прямо хорош: потрясающе красивый, все очень круто, атмосфера такого, как бы, курорта, но в то же время за каждым из столиков не потягивают мохито, а обсуждают какие-то дела по бизнесу, фасилитации с финтехами, эйяй и что-то про менеджмент. В ощущении курортности, конечно, сыграла свою роль погода, но все равно.

Шведский столик, за завтраком все уже обсуждают дела, какие-то встречи, созвончики и вот это все. Номера чистые аккуратные, есть басик и многое для спортактивности, но ландшафтный дизайн заслуживает просто космической оценки (как владелец загородного поместья, знаю как это дорого и требовательно) - за ландшафтку снимаю шляпу 🎩🌳

Но вот контент на курсе так себе - кто-то из спикеров путает дистилляцию и прунинг или считает, что в мире всего 6 фундаментальных моделей, у кого-то просто зашкаливающее самомнение или устаревший контент. Собственно, подправлять его меня и вызвали. Справился! 🤙
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7👍3🐳1🤓1
Агенты, терпение и презентации директорам

Агентов сейчас делают все. Проблема тут в том, что между этими "агентами" часто лежит инженерная пропасть: у одних - эвалы, скиллы, оптимизации kv-кэша и хорошее понимание лупов и тд, другие до сих пор кидают zip с документами в ллмку (реальный случай), получают ничего и потом жалуются начальству, что "им бы claude, без него не заведется, тогда-то заживем!".

Но по факту снаружи - и там и там агенты. И там и там - "ну, конечно у нас агенты, ребята занимаются".

И вот эту пропасть часто средним и большим начальникам объяснять сложно, ведь у них уже есть агенты. Причем забавно, что это не объяснишь именно средним-большим начальникам: обычному директору по чему-нибудь или человеку с должностью CPO или даже CTO. Самые большие боссы (если там не самодур, что тоже часто бывает) при этом могут понимать ллмки и процесс получше многих инженеров.

Есть главный лайфхак: если не просят, то и не надо 💁

Если тебе хвастаются мультиагентной системой (или просят такую сделать), которая раскладывает почту по простым правилам, и не спрашивают при этом твоего мнения про архитектуру/целеполагание - да и не надо его высказывать. Даже если там полная херня и даже если ты будешь чертовски прав, а они нет. Это никому не нужно, никому ничего не докажешь, а людей придется расстроить. Это никто не любит.

У меня есть любимый пример: к нам пришли за АГЕНТОМ, чтобы он наконец-то убрал очень старую боль по небольшой задаче юристов. По факту там завелись подряд 15+ регулярок, но это "решение" у них получило кодовое имя "AI-агента".

- У вас есть AI-агенты?
- Дада, у нас уже во всю работает, мы довольны

Это был первый в мире AI-АГЕНТ, который работает вообще без ллмки! 🤩

Если вы говорите с человеком на другом уровне понимания, а человек не пытается разобраться и не челленджит конкретным функционалом и требованиями, просто окните и все. Боль ушла? Ушла. Все довольны? Все. Агент? Агент! 🥹🦾🤖
Please open Telegram to view this post
VIEW IN TELEGRAM
😁14👍6🔥6💯3
This media is not supported in your browser
VIEW IN TELEGRAM
Сегодня пятница, но вечером и на выходных мы будем делать то же, что с блеском делаем каждый день после ноября 2025 года 😄
🤣10💯6🔥3
Сейчас немалую часть времени я живу за городом, и у этого бесконечное количество плюсов, но последние три недели появился совсем жирный минус.

Это внезапно - KV-кэш! 🤩

Я сейчас всё объясню.

Когда я отдыхал на Карибах на Maho Beach (это пляж в 5 метрах от аэропорта с самым низким заходом на посадку больших самолетов в мире) я в своем тревел-бложике писал, что мне нравится просыпаться от звука моторов над головой. В 2026 году могу сказать, что надо быть поточнее в своих желаниях 🤩🙂

От того, что вокруг летает всякое разное, здесь, хоть это и ближайшее Подмосковье в 50 мин езды от центра, периодически глушат не просто связь, а ВСЁ. Звонки, смски от банков, мобильный интернет целиком, а недавно начали пороть даже проводной интернет - причем самым неприятным способом, например, подавляя лишь часть трафика UDP случайным образом. Не работает периодически, волнами, с нулевым пониманием когда это случится и когда отпустит.

С тем, что пропадает доступ (или целиком надолго отваливается) к AI-инструментам, можно справляться следующим образом: правильнее формировать приоритеты, писать хорошие спеки/PRD и пускать /goal (здоровья и счастливой жизни тем, кто это придумал и зарелизил!) в tmux на своем барике или квм. Работает как родное!

Но мой харнесс настроен таким образом, что после goal-задач (или просто продолжительных), он делает глубокий рекап - и детально расписывает что сделал, почему так, какие решения принял, что увидел по дорожке и так далее. Я все это внимательно читаю, и потом где-то возникают доделки, вопросики или уточнения.

И вот тут-то и вылезает KV-проблема. Как мы прекрасно знаем, любая ллмка - стейтлесс, а то, что она понимает продолжающийся диалог - держится на пересылке ей всей истории каждый раз. Это было бы очень дорого, если бы не KV, который каждый раз кэшит уже отправленную часть, поэтому при отправке новой фразы мы получаем кэш-хит, фактически платим только за нее и это стоит нам дешево.

Но чтобы случился кэш-хит, нам надо чтобы этот кэш был. А живет он очень непродолжительное время. Гораздо меньшее, чем успевает восстановиться тот самый коннект, который периодически отваливается 🥹 И получается, что у меня есть несколько сессий на 400-500k токенов, мне в них надо что-то немножко поправить, но дальше случается вот что:
• 500k токенов
- пишу новое сообщение
- оно не долетает и уходит в ретрай
- когда долетает ретрай - кэша уже нет и чарджат по полной стоимости
- ответ начинает генериться, но я не успеваю получить потому что связь пропадает снова, все снова уходит в ретрай
- ретрай снова влетает в кэш-мисс
....
Please wait for your weekly limit reset.

Вот это прям по настоящему бесит! 🤣🤣 Ну а в остальном - AI Agents At Work и Show Must Go On!

С пятницей! 👍🤩🤩
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
😁10🔥62👏2🌚2
Стартуем неделю с крутейшей темы: глубокий разбор того, как работает текстовый вотермарк в Claude и ллмках вообще 🤩

Написал (тире перевел статью от Себастьяна Рашки) на тему того, как под капотом работает вотермаркинг контента. Упахался 🥹 Честно говоря, когда я про такое услышал год назад, мне показалось что это нереально. Но нет, великие умы придумали красивое и элегантное инженерное решение.

Если кратко, то работает оно вот так:

В текстах полно взаимозаменяемых слов: во фразе «завтра первый день осени и это грустно» вместо «грустно» модель с почти равной вероятностью могла бы поставить «тоскливо» или «печально» или целый набор нецензурных аналогов👺 - для читающего смысл не меняется.

Вотермаркинг делает выбор между такими равнозначными вариантами не чисто случайным, а подкрученным секретным ключом. И благодаря ему же потом можно сделать детекцию - без вызова ллмки.

Но я очень рекомендую прочитать (форвардить и шарить!) целиком статью, вотермаркинг скоро будет, судя по всему, у всех фронтирный моделей 🤩🤩

https://habr.com/ru/articles/1076018/
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7👍6👏2👾1
Когда все-таки приехал в офис на встречу государственной важности, а там…
(кручу назад, потому что вперед накрутился, а из переговорок вид круче - прям на башни сити)

Кстати, езжу я обычно вот как на фотке 🤩🤩И мой любимый «индекс приоткрытых ноутбуков» в общественных местах не просто низкий, он равен нулю. Люди что, не знают про агентов?? 🤩
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
😁5👀4👾2👍1