Agentic World
1.21K subscribers
50 photos
7 videos
2 files
37 links
Про AI, LLM, агентов, продукты и людей
Download Telegram
Последний пост был написан больше месяца назад - и это потому что я...отдыхал 🤩👍

Отпуск в 3 недели это страшная штука - с одной стороны ты токенмаксишь по полной с пивасиком на море, с другой - после выхода сразу пришлось нырнуть в работку, подзабив на канал. Крутого контента - вагон, отписываться рано! 🤙

Исправляюсь 🫡

Краткий пост про вечное - про OCR или по-простому - распознавание документов. Мне казалось, что этот вопрос давно решен, но оказалось, что нет - в мире слишком много упоротых и абсолютно проклятых сканов и фоточек самых странных документов.

Для построения хорошего OCR есть два подхода - классика и VLM (то есть, vision-ллмка). Оба подхода хороши, но механизмы работы у них разные и оттого природа ошибок - тоже.

Классический OCR обычно разделяет задачу на несколько этапов: предобработка, поиск областей текста, выделение строк и распознавание последовательности символов. На последней стадии движок преобразует изображение строки в последовательность символов, опираясь прежде всего на их визуальную форму. Любой символ (типа буквы "А") - это на самом деле абстракция, у которой есть конкретное написание в разных шрифтах, и вот конкретное написание, состоящее из разных черточек-палочек, называется глифом. l, 1 и I, а также 0 и О - могут быть слабоотличимы в разных шрифтах, и движок распределяет вероятность между несколькими похожими вариантами.

И главный плюс OCR - он говорит, "бро, я тут вижу плохо". Вокруг этого появилась куча всего - словари, эвристики, координаты и многое другое. Но главный принцип - классика не понимает документ, а аккуратно его замеряет и оцифровывает. Дальше - сами.

У VLMки механика совершенно другая.

Изображение превращается в сетку патчей, каждый из которых кодируется в вектор — визуальный токен. Для трансформера слово и кусок изображения - объекты одного типа. Все эти патчики отправляются в трансформер и вот здесь благодаря механизму внимания открывается самая большая магия.

Когда мы дописываем промпт "посмотри в шапку документа", то это может сузить задачу и модель действительно может справиться с этим лучше. При этом, на выходе по-прежнему генерация - а значит, вероятностное распределение того, что МОЖЕТ здесь быть. Как следствие - периодическая уверенная ложь, которую не отличить от правды.

Если попытаться свести к выводу, то:

- OCR не видит документ в привычном понимании, он в первую очередь считывает визуальные признаки текста и выдает локальную уверенность в результате

- VLM "видит" документ целиком - может учитывать раскладку, структуру, соседние поля и смысл - но ей не всегда хватает силенок увидеть все идеально. А когда чего-то не увидит - МОЖЕТ исказить реальность ̶т̶.̶е̶.̶ ̶н̶а̶п̶и̶з̶д̶и̶т̶ ̶к̶а̶к̶ ̶л̶ю̶б̶а̶я̶ ̶л̶л̶м̶к̶а̶. И это главная проблема VLM в распознавании документов - ее уверенность не отвечает на вопрос "насколько хорошо документ был обработан".

Ну а в реальной жизни - из-за разной природы ошибок, они отлично дополняют друг друга в сложных пайплайнах. VLM разбирает структуру документа и находит нужные поля, а OCR дополнительно за ней перепроверяет все критичное 👍🤩🤩
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11🔥6👏2🍾1👾1
Киллер фичи и безумный восторг

Две главные AI-лабы планеты делают какой-то космос: сначала нужна была очень умная модель, и как только она появилась, developer experience начал меняться с какой-то космической скоростью. Фича последних дней - полное погружение при сложном выборе и сборка вариантов налету.

Вы делаете фичу Х, но в процессе ваш харнесс понимает, что можно сделать это тремя разными вариантами - с разным UX и разной архитектурой. И как оно реально будет лучше - да вот вообще непонятно.

"А давай я просто соберу тебе это все в UI вместо текста?" - вжух - у нас отдельно собранная страница с каждым собранным интерактивным вариантом на потыкать. Вот верстка, вот варианты кнопочек, вот нотис на ошибке вылетает. Сидишь, тыкаешь, понимаешь что воооот этот вариант хорош, но надо еще докрутить.

Возвращаешься, говоришь хочу вариант Б, добавь только вот такую штуку и погнали. 10 минут и все готово.

Не знаю как вас, но я каждый день получаю огромное удовольствие от тех инструментов, которыми мы сейчас обладаем. Перетряхивает все стандартные процессы, но меня как забрало, так и не отпускает. Каждый день! Бесконечная эйфория и бесконечные возможности 🤩👍🤩
Please open Telegram to view this post
VIEW IN TELEGRAM
16👍4👎1🔥1🤔1
Media is too big
VIEW IN TELEGRAM
В корпоративной библиотеке Сберуниверситета нашел вот такой клад 🔥🚀
 
Надо брать!
😁10🤣8🔥4👀2
Про сам СберУниверситет. Он крутой!

На самом деле, в этой библиотеке из предыдущего поста немалое количество классных книг на самые разные тематики. И всё сделано ну очень приятно. 

Книжечки - лишь маленькая часть огромной махины под названием СберУниверситет - корпоративного университета Сбера. Я был в нем однажды на курсе по лидерству, а сейчас два дня читал лекцию про агентов для топ-менеджмента одного из дивизионов.

Университет прямо хорош: потрясающе красивый, все очень круто, атмосфера такого, как бы, курорта, но в то же время за каждым из столиков не потягивают мохито, а обсуждают какие-то дела по бизнесу, фасилитации с финтехами, эйяй и что-то про менеджмент. В ощущении курортности, конечно, сыграла свою роль погода, но все равно.

Шведский столик, за завтраком все уже обсуждают дела, какие-то встречи, созвончики и вот это все. Номера чистые аккуратные, есть басик и многое для спортактивности, но ландшафтный дизайн заслуживает просто космической оценки (как владелец загородного поместья, знаю как это дорого и требовательно) - за ландшафтку снимаю шляпу 🎩🌳

Но вот контент на курсе так себе - кто-то из спикеров путает дистилляцию и прунинг или считает, что в мире всего 6 фундаментальных моделей, у кого-то просто зашкаливающее самомнение или устаревший контент. Собственно, подправлять его меня и вызвали. Справился! 🤙
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7👍3🐳1🤓1
Агенты, терпение и презентации директорам

Агентов сейчас делают все. Проблема тут в том, что между этими "агентами" часто лежит инженерная пропасть: у одних - эвалы, скиллы, оптимизации kv-кэша и хорошее понимание лупов и тд, другие до сих пор кидают zip с документами в ллмку (реальный случай), получают ничего и потом жалуются начальству, что "им бы claude, без него не заведется, тогда-то заживем!".

Но по факту снаружи - и там и там агенты. И там и там - "ну, конечно у нас агенты, ребята занимаются".

И вот эту пропасть часто средним и большим начальникам объяснять сложно, ведь у них уже есть агенты. Причем забавно, что это не объяснишь именно средним-большим начальникам: обычному директору по чему-нибудь или человеку с должностью CPO или даже CTO. Самые большие боссы (если там не самодур, что тоже часто бывает) при этом могут понимать ллмки и процесс получше многих инженеров.

Есть главный лайфхак: если не просят, то и не надо 💁

Если тебе хвастаются мультиагентной системой (или просят такую сделать), которая раскладывает почту по простым правилам, и не спрашивают при этом твоего мнения про архитектуру/целеполагание - да и не надо его высказывать. Даже если там полная херня и даже если ты будешь чертовски прав, а они нет. Это никому не нужно, никому ничего не докажешь, а людей придется расстроить. Это никто не любит.

У меня есть любимый пример: к нам пришли за АГЕНТОМ, чтобы он наконец-то убрал очень старую боль по небольшой задаче юристов. По факту там завелись подряд 15+ регулярок, но это "решение" у них получило кодовое имя "AI-агента".

- У вас есть AI-агенты?
- Дада, у нас уже во всю работает, мы довольны

Это был первый в мире AI-АГЕНТ, который работает вообще без ллмки! 🤩

Если вы говорите с человеком на другом уровне понимания, а человек не пытается разобраться и не челленджит конкретным функционалом и требованиями, просто окните и все. Боль ушла? Ушла. Все довольны? Все. Агент? Агент! 🥹🦾🤖
Please open Telegram to view this post
VIEW IN TELEGRAM
😁14👍6🔥6💯3
This media is not supported in your browser
VIEW IN TELEGRAM
Сегодня пятница, но вечером и на выходных мы будем делать то же, что с блеском делаем каждый день после ноября 2025 года 😄
🤣10💯6🔥3
Сейчас немалую часть времени я живу за городом, и у этого бесконечное количество плюсов, но последние три недели появился совсем жирный минус.

Это внезапно - KV-кэш! 🤩

Я сейчас всё объясню.

Когда я отдыхал на Карибах на Maho Beach (это пляж в 5 метрах от аэропорта с самым низким заходом на посадку больших самолетов в мире) я в своем тревел-бложике писал, что мне нравится просыпаться от звука моторов над головой. В 2026 году могу сказать, что надо быть поточнее в своих желаниях 🤩🙂

От того, что вокруг летает всякое разное, здесь, хоть это и ближайшее Подмосковье в 50 мин езды от центра, периодически глушат не просто связь, а ВСЁ. Звонки, смски от банков, мобильный интернет целиком, а недавно начали пороть даже проводной интернет - причем самым неприятным способом, например, подавляя лишь часть трафика UDP случайным образом. Не работает периодически, волнами, с нулевым пониманием когда это случится и когда отпустит.

С тем, что пропадает доступ (или целиком надолго отваливается) к AI-инструментам, можно справляться следующим образом: правильнее формировать приоритеты, писать хорошие спеки/PRD и пускать /goal (здоровья и счастливой жизни тем, кто это придумал и зарелизил!) в tmux на своем барике или квм. Работает как родное!

Но мой харнесс настроен таким образом, что после goal-задач (или просто продолжительных), он делает глубокий рекап - и детально расписывает что сделал, почему так, какие решения принял, что увидел по дорожке и так далее. Я все это внимательно читаю, и потом где-то возникают доделки, вопросики или уточнения.

И вот тут-то и вылезает KV-проблема. Как мы прекрасно знаем, любая ллмка - стейтлесс, а то, что она понимает продолжающийся диалог - держится на пересылке ей всей истории каждый раз. Это было бы очень дорого, если бы не KV, который каждый раз кэшит уже отправленную часть, поэтому при отправке новой фразы мы получаем кэш-хит, фактически платим только за нее и это стоит нам дешево.

Но чтобы случился кэш-хит, нам надо чтобы этот кэш был. А живет он очень непродолжительное время. Гораздо меньшее, чем успевает восстановиться тот самый коннект, который периодически отваливается 🥹 И получается, что у меня есть несколько сессий на 400-500k токенов, мне в них надо что-то немножко поправить, но дальше случается вот что:
• 500k токенов
- пишу новое сообщение
- оно не долетает и уходит в ретрай
- когда долетает ретрай - кэша уже нет и чарджат по полной стоимости
- ответ начинает генериться, но я не успеваю получить потому что связь пропадает снова, все снова уходит в ретрай
- ретрай снова влетает в кэш-мисс
....
Please wait for your weekly limit reset.

Вот это прям по настоящему бесит! 🤣🤣 Ну а в остальном - AI Agents At Work и Show Must Go On!

С пятницей! 👍🤩🤩
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
😁10🔥62👏2🌚2
Стартуем неделю с крутейшей темы: глубокий разбор того, как работает текстовый вотермарк в Claude и ллмках вообще 🤩

Написал (тире перевел статью от Себастьяна Рашки) на тему того, как под капотом работает вотермаркинг контента. Упахался 🥹 Честно говоря, когда я про такое услышал год назад, мне показалось что это нереально. Но нет, великие умы придумали красивое и элегантное инженерное решение.

Если кратко, то работает оно вот так:

В текстах полно взаимозаменяемых слов: во фразе «завтра первый день осени и это грустно» вместо «грустно» модель с почти равной вероятностью могла бы поставить «тоскливо» или «печально» или целый набор нецензурных аналогов👺 - для читающего смысл не меняется.

Вотермаркинг делает выбор между такими равнозначными вариантами не чисто случайным, а подкрученным секретным ключом. И благодаря ему же потом можно сделать детекцию - без вызова ллмки.

Но я очень рекомендую прочитать (форвардить и шарить!) целиком статью, вотермаркинг скоро будет, судя по всему, у всех фронтирный моделей 🤩🤩

https://habr.com/ru/articles/1076018/
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7👍6👏2👾1
Когда все-таки приехал в офис на встречу государственной важности, а там…
(кручу назад, потому что вперед накрутился, а из переговорок вид круче - прям на башни сити)

Кстати, езжу я обычно вот как на фотке 🤩🤩И мой любимый «индекс приоткрытых ноутбуков» в общественных местах не просто низкий, он равен нулю. Люди что, не знают про агентов?? 🤩
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
😁5👀4👾2👍1
Это я еду на «главную tech-конференцию Яндекса» (они сами в рекламе так писали) deep tech night. Она только по приглашениям, но меня позвали, и я в деле 😎

На конфу еду - правда, но фотка старая - сегодня как и всегда агенты пашут как не в себя, но в tmux+goal, поэтому можно будет спокойно покурить кальянчик и поесть паэльи на крутом мероприятии 😄

А если нет паэльи и кальянов, то зачем тогда ехать? Доклады чтоли слушать? 🧐

Это шутейка, конечно. Доклады бывают оч крутые! Один из таких крутых докладов я готовлю сейчас - для другой конфы Яндекса, которая называется «Я про бэкенд». Готовлю красоту про устройство поиска в кодовых агентах и планируется разъёб очень интересно. Бесплатно и без смс, паэлья в прошлый раз была!

У Яндекса, к слову, мероприятия очень крутые, 2 из 3 моих любимых - яндексовые. Посмотрим, что будет сегодня. Если в реакциях наберется 5 дельфинчиков - поделаю фоток внутри диптехнайта 🐳
🐳17😁6👀4🗿2🔥1
Про deep tech night

Конфа крутая! Собственно, как все tech-конфы Яндекса. Организация во всех смыслах топовая (на неработающее приложение, из-за которого я пропустил иммерсивную экскурсию, можно закрыть глаза). Очень крутой вайб, а экстраполису - гораздо круче быть развернутым во всю стену, нежели как обычно 😄

Однажды меня случайно занесло на чисто бизнесовую Я-конфу, и вот там-то я взгрустул, потому что со сцены спикеры со всей страны рассказывали про бороздящие космические просторы, а в кулуарах на вопросы о минимальных деталях под капотом отвечали «ой ну надо у наших инженеров спросить». Но без технички умудрялись насыпать такого, что хотелось восклицать «да что ж ты п%здишь-то» 🤣 Но там это привычная атмосфера 💼🕶️

А здесь - все было хорошо! Мы обязательно встретимся!

(для масштаба все фотки на 0.5)
4🔥4🐳2👾1