Agentic World
1.1K subscribers
30 photos
3 videos
2 files
33 links
Про AI, LLM, агентов, продукты и людей
Download Telegram
Channel photo updated
Написал крайне залипательный пост про генерацию русского культурного нейрослопа, много гифок и просто крутых картиночек, читается очень легко.

Nano Banana по прежнему непревзойденный лидер, но многие топовые модели очень хорошо понимают наш культурный код и способны генерировать нереальные по своему качеству картинки.

Приятного чтения!

https://habr.com/ru/articles/1011192/
🔥7👍42
This media is not supported in your browser
VIEW IN TELEGRAM
Terminal POWER |

Всю жизнь я был терминальщиком - безумно люблю консольку большой любовью, и когда вел классическую жизнь управления разработкой, у части моих пацанов это постоянно вызывало вопросы вида "А ЧЕГО НЕ В IDE?". Ну типа, выдели функцию, нажми комбо клавиш, вжух и - вот ваш код, пожалуйста. Но зачем все это нужно, если grep -nirh "func_name" --include="*.py" -A 30 дает тебе ответ прямо вот здесь и сейчас?

Когда приходилось что-то вместе раздебаживать странное, до нужного куска кода я добирался чаще быстрее, потому что терминал безумно эффективен. И составить некую картинку про происходящее в терминале гораздо проще. Потому что ты не тратишь время на смену контекста - всякие вкладки, интерфейсы и прочий обвес. Еще у консольки есть просто невероятная суперсила - все, что ты можешь сделать в консольке - можно переиспользовать автономно, скрыв за любым интерфейсом (вот я сильно верю в будущее voice-first).

Единственное, что я в консольке делать не любил - это писать код (хотя vimовцы это каким-то образом делают успешно). Но большая часть кодинга уже мертва, именно писать код больше не нужно, а вот все остальное вокруг кода стало еще сильнее живее всех живых. И здесь с моим terminal-mind кажется, что революция уже произошла.

Claude Code своим выходом показал, что в терминале можно делать дела. И дело тут не в том, что внутри можно теперь делать почти все, и не в том что можно держать параллельно открытыми 20 вкладок (зачем, кстати?), а в том что любая консольная команда это in, out и PID. Когда эта консольная команда внутри себя может делать все что угодно и писать любой код, а ее stdin/stdout/stderr/PID мы можем перехватить и до их содержимого дотянуться, то значит вокруг них можно пробовать построить все что угодно.

Например, весь классический флоу разработки целиком и весь SDLC вообще. Я не зря писал, что вокруг кода в консольке можно было делать многое еще до появления агентов, а магию пайплайнов в никсах придумали задолго до первой версии ленгчейна. Не нравится код, который агенты пишут? А как мы раньше его убивали еще до прода? Кто сказал "жесткая стейт-машина и тикеты в jira?" 🤔

Пока я провожу этот безумно интересный эксперимент, узнал что для консольки есть целые фреймворки, в которых можно наколупать вообще интерфейсы любой сложности. Например, good old times лоадер: сначала танцуем, потом лунная походка, потом нижний брейк, потом колесо в сторону 🤩🤩🕺👯‍♀️

Ну какой кайф!
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6🐳3😁2👨‍💻2🔥1
Сделал перевод статьи про устройство кодинг-агентов от Себастьна Рашки, чьи статьи и обзоры я очень люблю. Для тех кто уже протер до дыр исходники клод кода нового ничего не будет, но как стартовая статья, на которую можно сослаться, чтобы самому не объяснять про харнесс и почему в консольке все круче, чем в чатике - хорошо.

Приятного чтения!

Как кодинг-агенты используют инструменты, память и контекст репозитория, чтобы писать код лучше
https://habr.com/ru/articles/1021168/
👍8👏3🐳2🔥1
💁‍♂️ Это просто перевод

Я сделал достаточно много переводов различных статей на хабре и там регулярно прилетает несколько минусов или даже комментов, что это "всего лишь перевод". Казалось бы, иди просто дальше, но нет. И, мне кажется, это супер классная тема для отдельного поста.

Задача перевода подарила нам архитектуру трансформера, при этом сам перевод является отличным прокси-примером на весь AI.

У нас у всех есть кнопочка автоперевода для всех типов контента и качества этой кнопочки хватает для большинства быстрых задач. По условной аналогии с Канеманом, у нас есть быстрый контент и медленный контент: первый мы потребляем автоматически и нам его абсолютно достаточно. В первый год после выхода ChatGPT в видео-переводах он часто переводился как "чичипт". Это было забавно, но этого хватало, чтобы послушать интервью, все понять и тем самым решить задачу - тут все ок.

Но есть как бы медленный контент, который мы потребляем по другому и где нюансов слишком много и автоперевод превращается в карикатурный. Игра слов, непереводимые или устоявшиеся термины, культурные различия и много всякого разного, что руинит смысл или даже повышает когнитивную нагрузку от прочтения.

Я говорю, пишу и думаю на русском, весь мой трейсинг и внутренний ризонинг происходят на русском, и несмотря на то, что с английским у меня нет никаких проблем, статьи на английском я читаю гораздо медленнее и откладываю их на дольше, поэтому наличие хорошего перевода меня всегда радует. Читать оригинал техрепорта квена без погружения сложно, но читать его в автопереводе невозможно в принципе, потому что конструкции вида "off‑policy sequence masking when they reuse rollout data" превращаются в бебебе мумуму.

Чем проще задача перевода сводится к общечеловеческой, тем лучше она закрывается автопереводом. Но сериальчик мы лучше посмотрим от профессиональной студии озвучки, а комментировать футбол любимой команды лучше тому, кто знает наш менталитет.

И так везде про весь AI. У нас у всех профессиональные камеры в руках, но на важное событие мы позовем фотографа с большим фотоаппаратом, у нас есть дорогие и оочень умные роботы-пылесосы (которые на самом деле такие тупые, что даже хуже алисы), но все равно иногда хочется заказать клининг, побазарить за анализы можно и с клодом, но если он что-то найдет, то только дорогой врач и без вариантов.

AI заберет всю работу, которую можно свести к общечеловеческой, но нюансы и специфика вообще беспощадны, к ним он тоже будет подбираться, но на несколько порядков медленее. А "просто перевод" - он вообще нифига не "просто" 🤩
Please open Telegram to view this post
VIEW IN TELEGRAM
👍13🔥3👏31
Стрррррраайк! 🤩

Вчера забанили мой 200$ акк. Когда банят разовые, то пропускаешь мимо себя, а здесь был хороший качественный акк с историей в полтора года платной подписки. Но claude -p не щадит никого! Пришлось рефлексировать 🤔

Поделал выводы как с этим жить на хабре, приятного чтения 🤗
https://habr.com/ru/articles/1021936/
Please open Telegram to view this post
VIEW IN TELEGRAM
👍8😁4🌚3😱2😢2🔥1
Ушла эпоха 🤩
13 октября 2012 года я арендовал себе свой первый bare metall хостить маленький сайтик, вообще не понимая какую махину я себе арендовал, что это вообще такое и зачем. Это была рабочая лошадка, которой с запасом хватило на следующий 10+ лет и которая беспрекословно вывозила любую нагрузку всех моих пет-проектов и экспериментов с чем угодно.

За это время с ним чего только не происходило - горели диски, память, отказывали все компоненты по частям. Потом были мягкие апгрейды железок - докидывалось немного тут и там. За это время через этот барик прошла, наверное, половина техрадара всего интернета - если мне надо было что-то поизучать, будь это либа для плюсов или миникубер, то я разворачивался там и тыкал, или же если нужно было поднять новый проектик на сокетах на новой нодежс или что-то еще.

За это время на нем накопилось столько всего, что я уже несколько лет хотел переехать на другой - потому что технологии беспощадны, новые поколения железа быстрее - там больше ядер, скорости и всего, они за меньшую стоимость выдают буст в 2-3 раза просто за счет своего существования.

Но меня безумно тяготило, что нужно разворачивать несколько проектов на совершенно разных стеках, большинство из которых было сделано в додокерную эпоху, вот эти все конфиги, чарты, базы, кроны, нжинксы с уникорнами и прочей радостью. У одного только вот этого проекта было 230гб офлайн-карт. По прикидам переезд не мог занять никак меньше недели полного погружения ̶а̶ ̶з̶а̶ ̶н̶е̶д̶е̶л̶ю̶ ̶в̶ ̶A̶I̶ ̶в̶с̶е̶ ̶м̶е̶н̶я̶е̶т̶с̶я̶ ̶и̶ ̶я̶ ̶в̶с̶е̶ ̶п̶р̶о̶п̶у̶щ̶у̶ ̶(̶ш̶у̶т̶к̶а̶)̶

На этих выходных я заказал новый барик, подключился, установил claude code, попросил прокинуть ssh ключ на тот хост, дальше просто "тут rsync всей папки", "забери вот этот конфиг", "развернись на поддомене", "забери базу и конвертни ее попутно в utf8mb" и тд. Два вечера на лайте с перерывом на посидеть у костра, три бутылочки бельгийского пива, и все готово🍺 Он сам ходил с одного хоста на другой, чекал дифф чего надо, устанавливал зависимости типа конкретной версии ffmpeg, изолировал проекты, сам создал unix юзеров под каждый проект, раскидал прав и ВООБЩЕ СДЕЛАЛ ВСЕ. Я писал командочки и потом менял A-записи.

Мир изменился. Я безвозвратно потушил свой любимый сервачок - ушла эпоха не просто моего барика, ушла эпоха вот этого низкоуровнего ВСЕГО. Тебе не нужно полвечера читать про lua, чтобы написать хитрый перехват-обработчик в nginx, это теперь вопрос одной минуты и 1 команды. И так - со всем.

При этом, вокруг все еще полно людей, который не верят и не хотят верить в то, что сейчас происходит. Да этот ваш AI галлюцинировывает, да это стохастический попугай, да это вообще и не интеллект вовсе и вообще сначала докажи мне, а потом я, может быть, соглашусь. После этого переезда я просто больше не буду спорить с этими людьми - не работает, окей, не просите потом отзыв после поездки оставить 🥹🤣

Могу за них лишь поднять бокальчик - не чокаясь и не сочувствуя, всем остальным - добро пожаловать в новый мир 🤩👍
Please open Telegram to view this post
VIEW IN TELEGRAM
💯14🔥104🤡2🤯1
Вчера вышла OpenAI Privacy Filter - локальная опенсорсная моделька, которая ищет и маскирует персональные данные. Сделал бенчик на русском и обзор архитектуры. На русской синтетике у них в репорте все неплохо, а в жизни - беда. Но, к слову, они открыто пишут, что под себя ее стоит файнтюнить (я пока нет, но штука интересная, потестю).

Но как феномен - локальная 1.5B MoEшка, которая работает на любом чайнике без GPU, быстрая и специализированная под конкретную задачу, которая упакована в cli - кажется, это наше ближайшее будущее, которое окажет нормальное такое влияние на архитектуру наших агентиков и систем.


https://habr.com/ru/articles/1027266/
👍8👏53👎1🔥1🥰1
Провел стрим на тему "Как выбрать LLM для приложения или AI-агента"

Я постоянно сталкиваюсь с вопросами какую же ллмку себе выбрать и как именно. Постарался впихнуть наиболее частые ответы и в целом максимум структурированной инфы в видосик на час с небольшим. Вышло, на мой вкус, очень неплохо.

В видосике - про свою инфру, народный кластер, характеристики моделей, что общего у контекстного окна и алкоголя, квантизацию, целеполагание, ну и итоговый чеклист, конечно.

Рекомендую. Приятного просмотра!

https://www.youtube.com/watch?v=IYfEd_nIfGM
9🔥4👏3👍1
"LLMка вызвала инструмент". Нет, не вызывала 🤩🪚

Мы ежедневно употребляем фразы про вызов тулов ллмками, но по факту это лишь инженерная абстракция, давайте разбираться почему 🤔

Шаг 1: инъекция тулов в промпт
Модель ничего не вызывает, у LLM нет рантайма, она не ходит в сеть и даже не исполняет код. Единственное, что она умеет (и этого хватило для AI-революции) - предсказывать следующий токен. Тулы - это просто текст в контексте: раннер движка инференса собирает описания инструментов и кладет их в промпт. Для самой модели "системное описание тулов" не является какой-то сущностью и ничем не отличается от "привет, как дела?" - все это тот же самый тензор input_ids.

Шаг 2: попадание в "нужный режим"
А вот способность "вызвать тул" - результат файнтюна, а не архитектуры. Чтобы модель умела такое делать - ее специально обучают на примерах таких диалогов. То есть, собирают обучающий пример "контекст->задача->вызов тула->результат". Скормив модели тысячи таких диалогов, мы добиваемся, что она статистически выучивает закономерность: при наличии <tools> в контексте и подходящем запросе высоковероятны токены вызова, а не какой-либо текст.

И здесь есть важный момент про гарантию правильности всей схемы. Есть вариант доверия - мы просто ждем от модели, что она вернет правильную схему вызова тула, но здесь начинаются галлюцинации, битый json и прочие нерадости. Вариант так себе.

Второй вариант - насильное ограничение, именуемое так же "constrained decoding". В этом подходе на каждом шаге сэмплинга выбираются только подходящие под грамматику токены, а логиты, ведущие в невалидное состояние, обнуляются до -inf еще до софтмакса и json schema инструмента компилируется в автомат, который на каждом шаге допускает только валидные продолжения. Условно, если мы ожидаем закрытие кавычки, то модель физически не может выдать что-то другое.

Шаг 3: момент остановки
Модель генерирует вызовы и в какой-то момент ей надо остановиться. И это так же делается через stop-токен (условный "<|tool_call_end|>"), после которого декодирование завершается. Инференс-раннер должен это распознать и прекратить генерацию, то есть мы просто сгенерировали моделью блочок с намерением что-то вызвать, а дальше все передается на слой выше.

Шаг 4: оркестратор выполняет тул
Раннер выполняет намерение, получает результат, а затем просто точно так же весь вывод подает в модель. С точки зрения модели, здесь нет никакого "вызова" функции, она видит текст намерения, потом текст результата, а затем продолжает только то, что умеет хорошо - предсказывает следующий токен.

Здесь есть важный нюанс. Каждый тул-кол - это новый префилл - результаты добавляются в конец контекста и его надо прогонять через все слои. KV-cache предыдущих токенов переиспользуется, но новые токены результат требуют полноценного префилла для дельты - а значит чем короче будет ответ тула (и сам диалог перед ним!), тем лучше.

Ну вот и все!

Поэтому фраза "LLM вызвала инструмент" на самом расшифровывается так: модель, дообученная на соответствующих траекториях, сгенерировала и, возможно, под жестким контролем грамматики — последовательность токенов, похожую на структурированный вызов; затем выдала стоп-токен; затем внешний оркестратор распарсил эти токены, нашел реальную функцию, исполнил ее и закинул результат обратно в контекст новой пачкой токенов.

Но мы, конечно, будем продолжать говорить как говорили 🤩🙂
Please open Telegram to view this post
VIEW IN TELEGRAM
👍18🐳321👏1🤯1🙏1
Сегодня выступаю на ДатаФесте в Сбере - буду рассказывать как мы сделали агента для понимания данных - первый агентизированный шаг к семантическому слою и хорошо работающей AI-first аналитике 🤙

Расскажу про агентиков и как оно устроено, как мы этл все сделали (понятно как 🤖). с̶л̶ё̶з̶ы̶ ̶в̶о̶с̶т̶о̶р̶г̶а̶ ̶C̶D̶O̶ ̶-̶ ̶в̶ ̶п̶о̶д̶а̶р̶о̶к̶

16:30, главный зал - приходите, если тут, ну и трансляция имеется
Please open Telegram to view this post
VIEW IN TELEGRAM
👍8🔥2🐳1👻1
Смотрел вчера подкаст с Джейсеном Хуангом - хотелось понять железячный вайб и состояние дел, а кто как не глава Nvidia знает это лучше всех. Дослушав где-то под середину, я уже хотел выключить и послушать что-то более интересное, как в какой-то момент произнесли слово "Китай" и вечер перестал быть томным. Честно говоря, не помню интервью топ-уровня, в котором в прямом эфире начался чуть ли не срач из-за разных пониманий и взглядов на ситуацию. Даже если срежиссировано, то прям свежо 😀

Самое важное: Хуанг подтверждает, что игла зависимости и суперсила Nvidia не в железе как таковом, а во всех слоях вокруг - весь ML стек последних 10+ лет намертво завязан на стек Nvidia. Из-за cuda, из-за того что в любом облаке железо Nvidia, миллионы инженерочасов потрачены на обучение и обсуждение стека Nvidia на форумах, внутренних документах, легаси-кодах и тд. Сколько карьер и состояний сколочено именно на Nvidia, этот маховик просто так не остановить просто более эффективным TPU.

Проблема не в том, что никто не может сделать новое железо - есть как минимум несколько крупных игроков, кто может и даже сделал, проблема в том чтобы попереписать весь остальной низкоуровневый стек, переучить всех инженеров и построить дата-центров. Хуанг всячески пытается доказать, что запрещать поставки железа Nvidia в Китай недальновидно - все это форсирует развитие всех остальных слоев. А пока железо едет - show must go on - все остальные слои стека намертво завязаны на американские технологии и можно пылесосить кадры в том числе.

Три цитаты, которые особенно зашли:
- Наша цель - превращать электричество в токены
- Мы хотим делать ровно то, что нужно и как можно меньше
- Ты разговариваешь не с тем, кто родился неудачником 🤩

Горячо рекомендовать не готов, но про железо - хорошо:
https://www.youtube.com/watch?v=Hrbq66XqtCo

P.S.: смотреть как индус и китаец обсуждают как "снова сделать НАШУ Америку великой" - это, конечно, уникальное комбо самого великого котла человеческих судеб и талантов под названием USA 😀
Please open Telegram to view this post
VIEW IN TELEGRAM
😁9👍42🐳1
Привет! Еду в Питер, чтобы завтра с утра выступать на Saint Highload++ с докладом про AI-команды будущего и необходимые для них навыки. Упахался готовиться, должно получиться хорошо.

Хайлод для меня - культовая конференция.

Во-первых, за все время ее существования я оттуда почерпнул массу крутейшей инфы из выступлений, планочка для них очень высокая. Во-вторых, эта конференция совсем не про доклады - она про концентрацию очень умных людей в одном месте, где самое интересное рождается после докладов в кулуарах, в техно холиварах и в классных знакомствах.

Да, очень многое теперь можно достать из ллмок, но ни одна ллмка не заменит тот инженерный непередаваемый вайб в воздухе, который случается, когда заряженные люди собираются обсуждать технологии. Пока я готовился, я понял что из моего доклада при желании можно собрать 5-6 отдельных на самые разные темы вокруг AI. И я безумно рад, что любимый Highload становится площадкой, где такой опыт можно обсуждать с теми, кто на самом фронтире нового технологического уклада.

Санкт-Петербург, 22-23 июня, будет круто!
(я 22ого в 11:40 в зеленом зале)
https://highload.ru/spb/2026/abstracts/18292

И еще одна важная вещь. Как вы знаете, я поехавший на агентах. Но есть отдельный их вид, который требует к себе ещё больше пристального внимания - агенты для кодинга. Революция с кодом уже прошла - это, кажется, уже очевидно, но как именно будет происходить трансформация всех других процессов вокруг и что с этим делать - пока не знает никто.

Но команда, сделавшая Highload, пытается разобраться и в этом и предоставляет новую площадку, посвященную исключительно AI в разработке. Это новая конфа - Agentic Dev Conf, на которой будем обсуждать всё - метрики, экономку, роли разработчиков, выстраивание процессов и всю внутрянку агентологии. Я в программном комитете и могу заверить, что будет очень круто - холивар и зарубы из-за взглядов на процессы возникают даже на внутренних созвонах ПК для отбора докладов.

MCP или скиллы? Hermes или не очень? Codex ВСЁ? Пачечка мак мини или облака? Как теперь денежки-то считать?

Если волнует будущее наших профессий, то лучше быть, потому что будем все горячо обсуждать вживую!

3 июля, Москва, Лофт Холл
https://agenticdevconf.ru

Участвую в формировании повесточки, буду там сам, вообщем - горячо рекомендую! 🔥
👍6🔥6🎉2😁1
Мемасик из завтра 😀
😁14💯8👍5🤣1