Agentic World
1.21K subscribers
50 photos
7 videos
2 files
37 links
Про AI, LLM, агентов, продукты и людей
Download Telegram
Вчера вышла OpenAI Privacy Filter - локальная опенсорсная моделька, которая ищет и маскирует персональные данные. Сделал бенчик на русском и обзор архитектуры. На русской синтетике у них в репорте все неплохо, а в жизни - беда. Но, к слову, они открыто пишут, что под себя ее стоит файнтюнить (я пока нет, но штука интересная, потестю).

Но как феномен - локальная 1.5B MoEшка, которая работает на любом чайнике без GPU, быстрая и специализированная под конкретную задачу, которая упакована в cli - кажется, это наше ближайшее будущее, которое окажет нормальное такое влияние на архитектуру наших агентиков и систем.


https://habr.com/ru/articles/1027266/
👍8👏53👎1🔥1🥰1
Провел стрим на тему "Как выбрать LLM для приложения или AI-агента"

Я постоянно сталкиваюсь с вопросами какую же ллмку себе выбрать и как именно. Постарался впихнуть наиболее частые ответы и в целом максимум структурированной инфы в видосик на час с небольшим. Вышло, на мой вкус, очень неплохо.

В видосике - про свою инфру, народный кластер, характеристики моделей, что общего у контекстного окна и алкоголя, квантизацию, целеполагание, ну и итоговый чеклист, конечно.

Рекомендую. Приятного просмотра!

https://www.youtube.com/watch?v=IYfEd_nIfGM
9🔥4👏3👍1
"LLMка вызвала инструмент". Нет, не вызывала 🤩🪚

Мы ежедневно употребляем фразы про вызов тулов ллмками, но по факту это лишь инженерная абстракция, давайте разбираться почему 🤔

Шаг 1: инъекция тулов в промпт
Модель ничего не вызывает, у LLM нет рантайма, она не ходит в сеть и даже не исполняет код. Единственное, что она умеет (и этого хватило для AI-революции) - предсказывать следующий токен. Тулы - это просто текст в контексте: раннер движка инференса собирает описания инструментов и кладет их в промпт. Для самой модели "системное описание тулов" не является какой-то сущностью и ничем не отличается от "привет, как дела?" - все это тот же самый тензор input_ids.

Шаг 2: попадание в "нужный режим"
А вот способность "вызвать тул" - результат файнтюна, а не архитектуры. Чтобы модель умела такое делать - ее специально обучают на примерах таких диалогов. То есть, собирают обучающий пример "контекст->задача->вызов тула->результат". Скормив модели тысячи таких диалогов, мы добиваемся, что она статистически выучивает закономерность: при наличии <tools> в контексте и подходящем запросе высоковероятны токены вызова, а не какой-либо текст.

И здесь есть важный момент про гарантию правильности всей схемы. Есть вариант доверия - мы просто ждем от модели, что она вернет правильную схему вызова тула, но здесь начинаются галлюцинации, битый json и прочие нерадости. Вариант так себе.

Второй вариант - насильное ограничение, именуемое так же "constrained decoding". В этом подходе на каждом шаге сэмплинга выбираются только подходящие под грамматику токены, а логиты, ведущие в невалидное состояние, обнуляются до -inf еще до софтмакса и json schema инструмента компилируется в автомат, который на каждом шаге допускает только валидные продолжения. Условно, если мы ожидаем закрытие кавычки, то модель физически не может выдать что-то другое.

Шаг 3: момент остановки
Модель генерирует вызовы и в какой-то момент ей надо остановиться. И это так же делается через stop-токен (условный "<|tool_call_end|>"), после которого декодирование завершается. Инференс-раннер должен это распознать и прекратить генерацию, то есть мы просто сгенерировали моделью блочок с намерением что-то вызвать, а дальше все передается на слой выше.

Шаг 4: оркестратор выполняет тул
Раннер выполняет намерение, получает результат, а затем просто точно так же весь вывод подает в модель. С точки зрения модели, здесь нет никакого "вызова" функции, она видит текст намерения, потом текст результата, а затем продолжает только то, что умеет хорошо - предсказывает следующий токен.

Здесь есть важный нюанс. Каждый тул-кол - это новый префилл - результаты добавляются в конец контекста и его надо прогонять через все слои. KV-cache предыдущих токенов переиспользуется, но новые токены результат требуют полноценного префилла для дельты - а значит чем короче будет ответ тула (и сам диалог перед ним!), тем лучше.

Ну вот и все!

Поэтому фраза "LLM вызвала инструмент" на самом расшифровывается так: модель, дообученная на соответствующих траекториях, сгенерировала и, возможно, под жестким контролем грамматики — последовательность токенов, похожую на структурированный вызов; затем выдала стоп-токен; затем внешний оркестратор распарсил эти токены, нашел реальную функцию, исполнил ее и закинул результат обратно в контекст новой пачкой токенов.

Но мы, конечно, будем продолжать говорить как говорили 🤩🙂
Please open Telegram to view this post
VIEW IN TELEGRAM
👍18🐳321👏1🤯1🙏1
Сегодня выступаю на ДатаФесте в Сбере - буду рассказывать как мы сделали агента для понимания данных - первый агентизированный шаг к семантическому слою и хорошо работающей AI-first аналитике 🤙

Расскажу про агентиков и как оно устроено, как мы этл все сделали (понятно как 🤖). с̶л̶ё̶з̶ы̶ ̶в̶о̶с̶т̶о̶р̶г̶а̶ ̶C̶D̶O̶ ̶-̶ ̶в̶ ̶п̶о̶д̶а̶р̶о̶к̶

16:30, главный зал - приходите, если тут, ну и трансляция имеется
Please open Telegram to view this post
VIEW IN TELEGRAM
👍8🔥2🐳1👻1
Смотрел вчера подкаст с Джейсеном Хуангом - хотелось понять железячный вайб и состояние дел, а кто как не глава Nvidia знает это лучше всех. Дослушав где-то под середину, я уже хотел выключить и послушать что-то более интересное, как в какой-то момент произнесли слово "Китай" и вечер перестал быть томным. Честно говоря, не помню интервью топ-уровня, в котором в прямом эфире начался чуть ли не срач из-за разных пониманий и взглядов на ситуацию. Даже если срежиссировано, то прям свежо 😀

Самое важное: Хуанг подтверждает, что игла зависимости и суперсила Nvidia не в железе как таковом, а во всех слоях вокруг - весь ML стек последних 10+ лет намертво завязан на стек Nvidia. Из-за cuda, из-за того что в любом облаке железо Nvidia, миллионы инженерочасов потрачены на обучение и обсуждение стека Nvidia на форумах, внутренних документах, легаси-кодах и тд. Сколько карьер и состояний сколочено именно на Nvidia, этот маховик просто так не остановить просто более эффективным TPU.

Проблема не в том, что никто не может сделать новое железо - есть как минимум несколько крупных игроков, кто может и даже сделал, проблема в том чтобы попереписать весь остальной низкоуровневый стек, переучить всех инженеров и построить дата-центров. Хуанг всячески пытается доказать, что запрещать поставки железа Nvidia в Китай недальновидно - все это форсирует развитие всех остальных слоев. А пока железо едет - show must go on - все остальные слои стека намертво завязаны на американские технологии и можно пылесосить кадры в том числе.

Три цитаты, которые особенно зашли:
- Наша цель - превращать электричество в токены
- Мы хотим делать ровно то, что нужно и как можно меньше
- Ты разговариваешь не с тем, кто родился неудачником 🤩

Горячо рекомендовать не готов, но про железо - хорошо:
https://www.youtube.com/watch?v=Hrbq66XqtCo

P.S.: смотреть как индус и китаец обсуждают как "снова сделать НАШУ Америку великой" - это, конечно, уникальное комбо самого великого котла человеческих судеб и талантов под названием USA 😀
Please open Telegram to view this post
VIEW IN TELEGRAM
😁9👍42🐳1
Привет! Еду в Питер, чтобы завтра с утра выступать на Saint Highload++ с докладом про AI-команды будущего и необходимые для них навыки. Упахался готовиться, должно получиться хорошо.

Хайлод для меня - культовая конференция.

Во-первых, за все время ее существования я оттуда почерпнул массу крутейшей инфы из выступлений, планочка для них очень высокая. Во-вторых, эта конференция совсем не про доклады - она про концентрацию очень умных людей в одном месте, где самое интересное рождается после докладов в кулуарах, в техно холиварах и в классных знакомствах.

Да, очень многое теперь можно достать из ллмок, но ни одна ллмка не заменит тот инженерный непередаваемый вайб в воздухе, который случается, когда заряженные люди собираются обсуждать технологии. Пока я готовился, я понял что из моего доклада при желании можно собрать 5-6 отдельных на самые разные темы вокруг AI. И я безумно рад, что любимый Highload становится площадкой, где такой опыт можно обсуждать с теми, кто на самом фронтире нового технологического уклада.

Санкт-Петербург, 22-23 июня, будет круто!
(я 22ого в 11:40 в зеленом зале)
https://highload.ru/spb/2026/abstracts/18292

И еще одна важная вещь. Как вы знаете, я поехавший на агентах. Но есть отдельный их вид, который требует к себе ещё больше пристального внимания - агенты для кодинга. Революция с кодом уже прошла - это, кажется, уже очевидно, но как именно будет происходить трансформация всех других процессов вокруг и что с этим делать - пока не знает никто.

Но команда, сделавшая Highload, пытается разобраться и в этом и предоставляет новую площадку, посвященную исключительно AI в разработке. Это новая конфа - Agentic Dev Conf, на которой будем обсуждать всё - метрики, экономку, роли разработчиков, выстраивание процессов и всю внутрянку агентологии. Я в программном комитете и могу заверить, что будет очень круто - холивар и зарубы из-за взглядов на процессы возникают даже на внутренних созвонах ПК для отбора докладов.

MCP или скиллы? Hermes или не очень? Codex ВСЁ? Пачечка мак мини или облака? Как теперь денежки-то считать?

Если волнует будущее наших профессий, то лучше быть, потому что будем все горячо обсуждать вживую!

3 июля, Москва, Лофт Холл
https://agenticdevconf.ru

Участвую в формировании повесточки, буду там сам, вообщем - горячо рекомендую! 🔥
👍6🔥6🎉2😁1
Мемасик из завтра 😀
😁14💯8👍5🤣1
Последний пост был написан больше месяца назад - и это потому что я...отдыхал 🤩👍

Отпуск в 3 недели это страшная штука - с одной стороны ты токенмаксишь по полной с пивасиком на море, с другой - после выхода сразу пришлось нырнуть в работку, подзабив на канал. Крутого контента - вагон, отписываться рано! 🤙

Исправляюсь 🫡

Краткий пост про вечное - про OCR или по-простому - распознавание документов. Мне казалось, что этот вопрос давно решен, но оказалось, что нет - в мире слишком много упоротых и абсолютно проклятых сканов и фоточек самых странных документов.

Для построения хорошего OCR есть два подхода - классика и VLM (то есть, vision-ллмка). Оба подхода хороши, но механизмы работы у них разные и оттого природа ошибок - тоже.

Классический OCR обычно разделяет задачу на несколько этапов: предобработка, поиск областей текста, выделение строк и распознавание последовательности символов. На последней стадии движок преобразует изображение строки в последовательность символов, опираясь прежде всего на их визуальную форму. Любой символ (типа буквы "А") - это на самом деле абстракция, у которой есть конкретное написание в разных шрифтах, и вот конкретное написание, состоящее из разных черточек-палочек, называется глифом. l, 1 и I, а также 0 и О - могут быть слабоотличимы в разных шрифтах, и движок распределяет вероятность между несколькими похожими вариантами.

И главный плюс OCR - он говорит, "бро, я тут вижу плохо". Вокруг этого появилась куча всего - словари, эвристики, координаты и многое другое. Но главный принцип - классика не понимает документ, а аккуратно его замеряет и оцифровывает. Дальше - сами.

У VLMки механика совершенно другая.

Изображение превращается в сетку патчей, каждый из которых кодируется в вектор — визуальный токен. Для трансформера слово и кусок изображения - объекты одного типа. Все эти патчики отправляются в трансформер и вот здесь благодаря механизму внимания открывается самая большая магия.

Когда мы дописываем промпт "посмотри в шапку документа", то это может сузить задачу и модель действительно может справиться с этим лучше. При этом, на выходе по-прежнему генерация - а значит, вероятностное распределение того, что МОЖЕТ здесь быть. Как следствие - периодическая уверенная ложь, которую не отличить от правды.

Если попытаться свести к выводу, то:

- OCR не видит документ в привычном понимании, он в первую очередь считывает визуальные признаки текста и выдает локальную уверенность в результате

- VLM "видит" документ целиком - может учитывать раскладку, структуру, соседние поля и смысл - но ей не всегда хватает силенок увидеть все идеально. А когда чего-то не увидит - МОЖЕТ исказить реальность ̶т̶.̶е̶.̶ ̶н̶а̶п̶и̶з̶д̶и̶т̶ ̶к̶а̶к̶ ̶л̶ю̶б̶а̶я̶ ̶л̶л̶м̶к̶а̶. И это главная проблема VLM в распознавании документов - ее уверенность не отвечает на вопрос "насколько хорошо документ был обработан".

Ну а в реальной жизни - из-за разной природы ошибок, они отлично дополняют друг друга в сложных пайплайнах. VLM разбирает структуру документа и находит нужные поля, а OCR дополнительно за ней перепроверяет все критичное 👍🤩🤩
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11🔥6👏2🍾1👾1
Киллер фичи и безумный восторг

Две главные AI-лабы планеты делают какой-то космос: сначала нужна была очень умная модель, и как только она появилась, developer experience начал меняться с какой-то космической скоростью. Фича последних дней - полное погружение при сложном выборе и сборка вариантов налету.

Вы делаете фичу Х, но в процессе ваш харнесс понимает, что можно сделать это тремя разными вариантами - с разным UX и разной архитектурой. И как оно реально будет лучше - да вот вообще непонятно.

"А давай я просто соберу тебе это все в UI вместо текста?" - вжух - у нас отдельно собранная страница с каждым собранным интерактивным вариантом на потыкать. Вот верстка, вот варианты кнопочек, вот нотис на ошибке вылетает. Сидишь, тыкаешь, понимаешь что воооот этот вариант хорош, но надо еще докрутить.

Возвращаешься, говоришь хочу вариант Б, добавь только вот такую штуку и погнали. 10 минут и все готово.

Не знаю как вас, но я каждый день получаю огромное удовольствие от тех инструментов, которыми мы сейчас обладаем. Перетряхивает все стандартные процессы, но меня как забрало, так и не отпускает. Каждый день! Бесконечная эйфория и бесконечные возможности 🤩👍🤩
Please open Telegram to view this post
VIEW IN TELEGRAM
16👍4👎1🔥1🤔1
Media is too big
VIEW IN TELEGRAM
В корпоративной библиотеке Сберуниверситета нашел вот такой клад 🔥🚀
 
Надо брать!
😁10🤣8🔥4👀2
Про сам СберУниверситет. Он крутой!

На самом деле, в этой библиотеке из предыдущего поста немалое количество классных книг на самые разные тематики. И всё сделано ну очень приятно. 

Книжечки - лишь маленькая часть огромной махины под названием СберУниверситет - корпоративного университета Сбера. Я был в нем однажды на курсе по лидерству, а сейчас два дня читал лекцию про агентов для топ-менеджмента одного из дивизионов.

Университет прямо хорош: потрясающе красивый, все очень круто, атмосфера такого, как бы, курорта, но в то же время за каждым из столиков не потягивают мохито, а обсуждают какие-то дела по бизнесу, фасилитации с финтехами, эйяй и что-то про менеджмент. В ощущении курортности, конечно, сыграла свою роль погода, но все равно.

Шведский столик, за завтраком все уже обсуждают дела, какие-то встречи, созвончики и вот это все. Номера чистые аккуратные, есть басик и многое для спортактивности, но ландшафтный дизайн заслуживает просто космической оценки (как владелец загородного поместья, знаю как это дорого и требовательно) - за ландшафтку снимаю шляпу 🎩🌳

Но вот контент на курсе так себе - кто-то из спикеров путает дистилляцию и прунинг или считает, что в мире всего 6 фундаментальных моделей, у кого-то просто зашкаливающее самомнение или устаревший контент. Собственно, подправлять его меня и вызвали. Справился! 🤙
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7👍3🐳1🤓1
Агенты, терпение и презентации директорам

Агентов сейчас делают все. Проблема тут в том, что между этими "агентами" часто лежит инженерная пропасть: у одних - эвалы, скиллы, оптимизации kv-кэша и хорошее понимание лупов и тд, другие до сих пор кидают zip с документами в ллмку (реальный случай), получают ничего и потом жалуются начальству, что "им бы claude, без него не заведется, тогда-то заживем!".

Но по факту снаружи - и там и там агенты. И там и там - "ну, конечно у нас агенты, ребята занимаются".

И вот эту пропасть часто средним и большим начальникам объяснять сложно, ведь у них уже есть агенты. Причем забавно, что это не объяснишь именно средним-большим начальникам: обычному директору по чему-нибудь или человеку с должностью CPO или даже CTO. Самые большие боссы (если там не самодур, что тоже часто бывает) при этом могут понимать ллмки и процесс получше многих инженеров.

Есть главный лайфхак: если не просят, то и не надо 💁

Если тебе хвастаются мультиагентной системой (или просят такую сделать), которая раскладывает почту по простым правилам, и не спрашивают при этом твоего мнения про архитектуру/целеполагание - да и не надо его высказывать. Даже если там полная херня и даже если ты будешь чертовски прав, а они нет. Это никому не нужно, никому ничего не докажешь, а людей придется расстроить. Это никто не любит.

У меня есть любимый пример: к нам пришли за АГЕНТОМ, чтобы он наконец-то убрал очень старую боль по небольшой задаче юристов. По факту там завелись подряд 15+ регулярок, но это "решение" у них получило кодовое имя "AI-агента".

- У вас есть AI-агенты?
- Дада, у нас уже во всю работает, мы довольны

Это был первый в мире AI-АГЕНТ, который работает вообще без ллмки! 🤩

Если вы говорите с человеком на другом уровне понимания, а человек не пытается разобраться и не челленджит конкретным функционалом и требованиями, просто окните и все. Боль ушла? Ушла. Все довольны? Все. Агент? Агент! 🥹🦾🤖
Please open Telegram to view this post
VIEW IN TELEGRAM
😁14👍6🔥6💯3
This media is not supported in your browser
VIEW IN TELEGRAM
Сегодня пятница, но вечером и на выходных мы будем делать то же, что с блеском делаем каждый день после ноября 2025 года 😄
🤣10💯6🔥3