Периодически я рассказываю о классных мероприятиях – и вот одно из них – infra.conf'26 – конференция про создание и эксплуатацию высоконагруженных систем и инфраструктуры.
Мне конечно же интересны темы, связанные с ИИ.
Активное развитие ИИ внесло существенные коррективы: послушаем, с какими новыми вызовами сталкиваются ребята и как с этим справляются.
Мероприятие пройдёт 4 июня. Приходите – будет классно :)
Мне конечно же интересны темы, связанные с ИИ.
Активное развитие ИИ внесло существенные коррективы: послушаем, с какими новыми вызовами сталкиваются ребята и как с этим справляются.
Мероприятие пройдёт 4 июня. Приходите – будет классно :)
Мероприятия | Yandex Infrastructure
infra.conf 2026. Конференция Yandex Infrastructure.
Всё про создание инфраструктуры и высоконагруженные системы, инструменты разработки, базы данных и стораджи, построение и особенности эксплуатации инфраструктуры в эпоху ML.
❤6⚡6🔥5👍3
В курсе СТО от Стратоплана есть такая штука – База.
И несмотря на название, для меня именно эти темы оказались самыми интересными. Формат такой: раз в месяц – занятия на все выходные, суббота и воскресенье по 5 часов в день. За это время успеваешь довольно глубоко нырнуть в одну базовую тему.
Особенно откликнулось управление конфликтами. Тема и правда базовая – сталкиваемся с этим постоянно, на любой позиции: отстаиваешь точку зрения, что-то согласовываешь. Где-то выходит хорошо, где-то не очень – со временем нарабатываются свои приёмчики, как делать правильно. И вот самое то, когда теория ложится на уже имеющийся опыт: что раньше делал по наитию, теперь делаешь более осознанно.
По сути всё сводится к нескольким последовательным шагам:
1. Суть проблемы и цель – чётко сформулировать, в чём проблема, что будет, если её не решать, и какого результата хочешь от разговора.
2. Анализ собеседника – понять его поведение, позитивные намерения и скрытые потребности, чтобы говорить на его языке.
3. Формулировка и аргументация – подобрать слова и аргументы, которые показывают важность проблемы с учётом мотивов другой стороны.
4. Пожелание и проверка согласия – выбрать форму подачи (требование / просьба / вопрос / пожелание) и убедиться, что собеседник признаёт проблему и готов её решать.
5. Варианты решения с обоснованием – предложить конкретные выходы и аргументы в их пользу.
6. Закрепление и план Б – зафиксировать договорённости с контрольными точками и заранее продумать действия, если договориться не вышло.
Знаете, ещё иногда бывает – после встречи остаётся осадочек: "эх, вот тут надо было сказать по-другому" или "а вот ещё аргумент можно было привести". Так вот, чтобы схема заработала, к встрече надо готовиться заранее – буквально прописывать каждый пункт – и это прям важно. Тут как с любым навыком: я раньше реально всё фиксировал и расписывал, а теперь хватает просто черновичок накидать.
Отдельно на занятии разбирали медиацию – это когда ты как руководитель управляешь чужим конфликтом. Но это уже совсем другая история :)
И несмотря на название, для меня именно эти темы оказались самыми интересными. Формат такой: раз в месяц – занятия на все выходные, суббота и воскресенье по 5 часов в день. За это время успеваешь довольно глубоко нырнуть в одну базовую тему.
Особенно откликнулось управление конфликтами. Тема и правда базовая – сталкиваемся с этим постоянно, на любой позиции: отстаиваешь точку зрения, что-то согласовываешь. Где-то выходит хорошо, где-то не очень – со временем нарабатываются свои приёмчики, как делать правильно. И вот самое то, когда теория ложится на уже имеющийся опыт: что раньше делал по наитию, теперь делаешь более осознанно.
По сути всё сводится к нескольким последовательным шагам:
1. Суть проблемы и цель – чётко сформулировать, в чём проблема, что будет, если её не решать, и какого результата хочешь от разговора.
2. Анализ собеседника – понять его поведение, позитивные намерения и скрытые потребности, чтобы говорить на его языке.
3. Формулировка и аргументация – подобрать слова и аргументы, которые показывают важность проблемы с учётом мотивов другой стороны.
4. Пожелание и проверка согласия – выбрать форму подачи (требование / просьба / вопрос / пожелание) и убедиться, что собеседник признаёт проблему и готов её решать.
5. Варианты решения с обоснованием – предложить конкретные выходы и аргументы в их пользу.
6. Закрепление и план Б – зафиксировать договорённости с контрольными точками и заранее продумать действия, если договориться не вышло.
Знаете, ещё иногда бывает – после встречи остаётся осадочек: "эх, вот тут надо было сказать по-другому" или "а вот ещё аргумент можно было привести". Так вот, чтобы схема заработала, к встрече надо готовиться заранее – буквально прописывать каждый пункт – и это прям важно. Тут как с любым навыком: я раньше реально всё фиксировал и расписывал, а теперь хватает просто черновичок накидать.
Отдельно на занятии разбирали медиацию – это когда ты как руководитель управляешь чужим конфликтом. Но это уже совсем другая история :)
Школа менеджмента «Стратоплан»
Технический директор. Управление технологиями и людьми
Программа для будущих и действующих технических директоров от Школы Стратоплан. Управление технологиями, командами и бизнесом: практика, AI-инструменты, работа с тренером.
👍20🔥10⚡8❤2👎1
Интересные практики работы с агентами
Любопытно читать, как люди, которые сами разрабатывают известных агентов, используют их в своей работе.
Зачастую такой опыт противоречив. Кто-то советует одно, кто-то – почти противоположное. Но это позволяет вдохновиться, попробовать что-то на практике.
В статье разработчик из OpenAI рассказывает, как он с использованием агента выстраивает рабочий процесс.
Например, важные направления работы автор предлагает держать в отдельных долгоживущих тредах. Такие треды можно назвать, закрепить и потом удобно между ними переключаться. За счет длинной истории у агента уже есть контекст: что за проект, какие решения принимались, какие задачи сейчас в работе. Не нужно каждый раз начинать с нуля.
Отдельно автор подсвечивает управление голосом. Я уже рассказывал про Handy: можно быстрее выражать мысль и не тратить время на аккуратные формулировки. Еще прикольный use case – когда агент уже работает, можно прямо голосом быстро накидывать ему уточнения по ходу дела: что проверить, куда посмотреть и что сделать следующим шагом.
Много внимания в статье уделяется памяти. Многие сейчас копают в сторону сохранения контекста агентом, и автор предлагает использовать для этого Obsidian. По сути, это просто папка с файлами, куда агент постепенно заносит важную информацию.
Я иногда делаю похожую штуку: прошу агента проанализировать все наши треды за неделю и выделить важное. Потом смотрю предложенные изменения в диффе и добавляю только то, что кажется полезным.
Дальше автор переходит к доступу агента к браузеру и компьютеру. Иногда агенту недостаточно файлов и терминала. Ему нужно открыть локальную страницу, проверить UI, посмотреть залогиненный сервис или вообще покликать интерфейс, если нет нормального API.
Сюда же классная фича в Codex – remote control. Агент может продолжать работать на вашей машине, где уже есть окружение, доступы и локальные файлы, а вы можете подключаться к этому процессу с телефона. Запустил задачу, отошел, потом посмотрел прогресс, ответил на вопрос агента или поменял направление.
Еще одна интересная мысль – heartbeats. Это когда агент периодически просыпается и что-то делает без отдельного запроса от пользователя. Например, автор предлагает сценарий, где агент раз в 30 минут проверяет Slack и Gmail, находит сообщения, на которые нужно ответить, собирает контекст и готовит черновики. Сам он ничего не отправляет, но, когда вы возвращаетесь – рыба уже есть.
Меня очень привлекает идея дать агенту доступ к перепискам, накручивать вокруг этого автоматизации, но пока не могу переступить через порог и отдаться полностью 🙂
#ai
Любопытно читать, как люди, которые сами разрабатывают известных агентов, используют их в своей работе.
Зачастую такой опыт противоречив. Кто-то советует одно, кто-то – почти противоположное. Но это позволяет вдохновиться, попробовать что-то на практике.
В статье разработчик из OpenAI рассказывает, как он с использованием агента выстраивает рабочий процесс.
Например, важные направления работы автор предлагает держать в отдельных долгоживущих тредах. Такие треды можно назвать, закрепить и потом удобно между ними переключаться. За счет длинной истории у агента уже есть контекст: что за проект, какие решения принимались, какие задачи сейчас в работе. Не нужно каждый раз начинать с нуля.
Отдельно автор подсвечивает управление голосом. Я уже рассказывал про Handy: можно быстрее выражать мысль и не тратить время на аккуратные формулировки. Еще прикольный use case – когда агент уже работает, можно прямо голосом быстро накидывать ему уточнения по ходу дела: что проверить, куда посмотреть и что сделать следующим шагом.
Много внимания в статье уделяется памяти. Многие сейчас копают в сторону сохранения контекста агентом, и автор предлагает использовать для этого Obsidian. По сути, это просто папка с файлами, куда агент постепенно заносит важную информацию.
Я иногда делаю похожую штуку: прошу агента проанализировать все наши треды за неделю и выделить важное. Потом смотрю предложенные изменения в диффе и добавляю только то, что кажется полезным.
Дальше автор переходит к доступу агента к браузеру и компьютеру. Иногда агенту недостаточно файлов и терминала. Ему нужно открыть локальную страницу, проверить UI, посмотреть залогиненный сервис или вообще покликать интерфейс, если нет нормального API.
Сюда же классная фича в Codex – remote control. Агент может продолжать работать на вашей машине, где уже есть окружение, доступы и локальные файлы, а вы можете подключаться к этому процессу с телефона. Запустил задачу, отошел, потом посмотрел прогресс, ответил на вопрос агента или поменял направление.
Еще одна интересная мысль – heartbeats. Это когда агент периодически просыпается и что-то делает без отдельного запроса от пользователя. Например, автор предлагает сценарий, где агент раз в 30 минут проверяет Slack и Gmail, находит сообщения, на которые нужно ответить, собирает контекст и готовит черновики. Сам он ничего не отправляет, но, когда вы возвращаетесь – рыба уже есть.
Меня очень привлекает идея дать агенту доступ к перепискам, накручивать вокруг этого автоматизации, но пока не могу переступить через порог и отдаться полностью 🙂
#ai
jxnl.github.io
Codex-maxxing - Jason Liu
How I use Codex as a place where long-running work can live.
❤6👍6🔥5⚡1👎1
Скиллы: как создавать, улучшать и распространять на команды
Недавно выступал на Podlodka и рассказывал про скиллы.
Многие используют скиллы, но не всегда знают, что у них внутри. Поэтому сначала коротко разобрал, как устроены скиллы и как агент с ними работает.
Дальше перешел к практике: где искать скиллы, как устанавливать и как пользоваться. Показал несколько своих примеров и рассказал, какие задачи можно обернуть в скилл.
Потом была демо-сессия. На мой взгляд, она немного затянулась, но зато мы руками посмотрели, как создать свой скилл поверх MCP-таск-трекера, и чуть-чуть затронули evals скиллов.
Когда мы работаем в командах, важно, чтобы у всех был одинаковый опыт применения агентов. Поэтому в конце я затронул тему дистрибуции AI-артефактов: рулов, скиллов, MCP и прочего.
#ai #devfm
Недавно выступал на Podlodka и рассказывал про скиллы.
Многие используют скиллы, но не всегда знают, что у них внутри. Поэтому сначала коротко разобрал, как устроены скиллы и как агент с ними работает.
Дальше перешел к практике: где искать скиллы, как устанавливать и как пользоваться. Показал несколько своих примеров и рассказал, какие задачи можно обернуть в скилл.
Потом была демо-сессия. На мой взгляд, она немного затянулась, но зато мы руками посмотрели, как создать свой скилл поверх MCP-таск-трекера, и чуть-чуть затронули evals скиллов.
Когда мы работаем в командах, важно, чтобы у всех был одинаковый опыт применения агентов. Поэтому в конце я затронул тему дистрибуции AI-артефактов: рулов, скиллов, MCP и прочего.
#ai #devfm
👍19🔥12⚡5❤1
Голосовой ввод и visul explainer – чтобы структурировать мысли
Я давно использую visual explainer не только для презентаций. Один из полезных сценариев - структурировать свои мысли: выделить основные блоки, связи между ними и места, где чего-то не хватает.
Недавно мне нужно было подготовить стратегию дальнейшего движения нашего продукта. В целом понимание, что и зачем делать, уже было, но не складывалась картинка, как это презентовать.
Здесь хорошо сработала связка голосового ввода в Handy и скилла visual explainer.
Я просто начал надиктовывать свои мысли: что думаю, почему это важно, какие части связаны между собой. Если где-то было понимание, как я хочу это видеть, тут же надиктовывал: вот это сгруппировать с этим, это вынести отдельно, здесь показать связь.
В этом как раз плюс голосового ввода: обычно, когда пишешь, так или иначе пытаешься писать связно. А тут просто говоришь, как думаешь, и можно даже перескакивать между идеями.
Получившийся текст я отдал агенту с visual explainer и попросил структурировать.
Конечно, он не сделал готовый результат с первого раза. Не было истории, где агент взял все мои мысли, правильно структурировал их и сразу выдал готовую презентацию.
Но когда я посмотрел на первую визуализацию, стало намного понятнее, что не так: этот блок должен быть иначе, эта связь потерялась, вот здесь нужно сгруппировать по-другому. Где-то агент действительно попал, но главное - появился конкретный вариант, который уже можно править. По сути, это решило проблему белого листа: когда перед тобой есть первая версия, проще понять, как должно быть на самом деле.
Итоговый воркфлоу такой: надиктовываем поток мыслей, просим структурировать, от получившегося результата отталкиваемся и правим до нормальной презентации за несколько итераций. Уже делал так несколько раз - попробуйте.
#ai #devfm
Я давно использую visual explainer не только для презентаций. Один из полезных сценариев - структурировать свои мысли: выделить основные блоки, связи между ними и места, где чего-то не хватает.
Недавно мне нужно было подготовить стратегию дальнейшего движения нашего продукта. В целом понимание, что и зачем делать, уже было, но не складывалась картинка, как это презентовать.
Здесь хорошо сработала связка голосового ввода в Handy и скилла visual explainer.
Я просто начал надиктовывать свои мысли: что думаю, почему это важно, какие части связаны между собой. Если где-то было понимание, как я хочу это видеть, тут же надиктовывал: вот это сгруппировать с этим, это вынести отдельно, здесь показать связь.
В этом как раз плюс голосового ввода: обычно, когда пишешь, так или иначе пытаешься писать связно. А тут просто говоришь, как думаешь, и можно даже перескакивать между идеями.
Получившийся текст я отдал агенту с visual explainer и попросил структурировать.
Конечно, он не сделал готовый результат с первого раза. Не было истории, где агент взял все мои мысли, правильно структурировал их и сразу выдал готовую презентацию.
Но когда я посмотрел на первую визуализацию, стало намного понятнее, что не так: этот блок должен быть иначе, эта связь потерялась, вот здесь нужно сгруппировать по-другому. Где-то агент действительно попал, но главное - появился конкретный вариант, который уже можно править. По сути, это решило проблему белого листа: когда перед тобой есть первая версия, проще понять, как должно быть на самом деле.
Итоговый воркфлоу такой: надиктовываем поток мыслей, просим структурировать, от получившегося результата отталкиваемся и правим до нормальной презентации за несколько итераций. Уже делал так несколько раз - попробуйте.
#ai #devfm
GitHub
GitHub - nicobailon/visual-explainer: Agent skill that generates rich HTML pages or slide decks for diagrams, diff reviews, plan…
Agent skill that generates rich HTML pages or slide decks for diagrams, diff reviews, plan audits, data tables, and project recaps - nicobailon/visual-explainer
🔥13👍7⚡4❤2
Вот и закончился курс CTO от Стратоплана. По ходу курса я уже делился впечатлениями: раз, два, три.
Курс действительно помогает подбить базу и понять, с чем можно столкнуться в этой роли. То, что уже неоднократно делал на практике, либо подтверждаешь как актуальный опыт, либо подкрепляешь теоретическим обоснованием того, что делал интуитивно. А по темам, с которыми еще не сталкивался, появляется понимание: такое тоже бывает, и к этому лучше быть готовым.
Но, наверное, самое реально классное - комьюнити и нетворкинг. Например, с ребятами, с которыми мы плотно работали на практической части курса, сейчас продолжаем периодически общаться. Еще классно, что после курса ты остаешься частью сообщества: можно задавать вопросы, приносить свои кейсы и обсуждать их с людьми, которые проходят похожий путь.
В общем, мне понравилось :)
Курс действительно помогает подбить базу и понять, с чем можно столкнуться в этой роли. То, что уже неоднократно делал на практике, либо подтверждаешь как актуальный опыт, либо подкрепляешь теоретическим обоснованием того, что делал интуитивно. А по темам, с которыми еще не сталкивался, появляется понимание: такое тоже бывает, и к этому лучше быть готовым.
Но, наверное, самое реально классное - комьюнити и нетворкинг. Например, с ребятами, с которыми мы плотно работали на практической части курса, сейчас продолжаем периодически общаться. Еще классно, что после курса ты остаешься частью сообщества: можно задавать вопросы, приносить свои кейсы и обсуждать их с людьми, которые проходят похожий путь.
В общем, мне понравилось :)
Школа менеджмента «Стратоплан»
Технический директор. Управление технологиями и людьми
Программа для будущих и действующих технических директоров от Школы Стратоплан. Управление технологиями, командами и бизнесом: практика, AI-инструменты, работа с тренером.
👍23⚡11❤10🔥2
Caveman экономит токены. Но не 65%
Меня периодически спрашивают про скилл Caveman. Он заставляет агента отвечать короче и обещает экономить в среднем 65% output-токенов. Стоит ли его использовать?
Мне тут нравится аналогия с гомеопатией и доказательной медициной: всё, что в гомеопатии доказанно помогает, перестает быть гомеопатией и становится частью доказательной медицины. Со скиллами для агентов примерно так же – если какой-то приём действительно стабильно улучшает работу агента, он, скорее всего, окажется внутри популярных агентов.
И вот ребята из JetBrains проверили, сколько Caveman экономит на реальных агентных задачах. Они сравнили Claude Code со скиллом и без него на SkillsBench.
Коротко результат такой:
– экономия output-токенов составила 8,5% против заявленных 65%, а ожидаемая экономия стоимости – около 10%. Это объясняется тем, что в реальных задачах большую часть output составляют код, дифы, вызовы тулов и тексты ошибок – всё то, что Caveman не трогает.
– С точки зрения качества ребята выяснили, что просадки нет.
Поэтому в целом пользоваться можно, но не стоит ожидать бешеной экономии.
#ai
Меня периодически спрашивают про скилл Caveman. Он заставляет агента отвечать короче и обещает экономить в среднем 65% output-токенов. Стоит ли его использовать?
Мне тут нравится аналогия с гомеопатией и доказательной медициной: всё, что в гомеопатии доказанно помогает, перестает быть гомеопатией и становится частью доказательной медицины. Со скиллами для агентов примерно так же – если какой-то приём действительно стабильно улучшает работу агента, он, скорее всего, окажется внутри популярных агентов.
И вот ребята из JetBrains проверили, сколько Caveman экономит на реальных агентных задачах. Они сравнили Claude Code со скиллом и без него на SkillsBench.
Коротко результат такой:
– экономия output-токенов составила 8,5% против заявленных 65%, а ожидаемая экономия стоимости – около 10%. Это объясняется тем, что в реальных задачах большую часть output составляют код, дифы, вызовы тулов и тексты ошибок – всё то, что Caveman не трогает.
– С точки зрения качества ребята выяснили, что просадки нет.
Поэтому в целом пользоваться можно, но не стоит ожидать бешеной экономии.
#ai
GitHub
GitHub - JuliusBrussee/caveman: 🪨 why use many token when few token do trick — Claude Code skill that cuts 65% of tokens by talking…
🪨 why use many token when few token do trick — Claude Code skill that cuts 65% of tokens by talking like caveman - JuliusBrussee/caveman
1👍15🔥4⚡3😁1
Как писать скиллы
Посмотрел хорошее видео Мэтта Покока о том, как писать свои скиллы. Он выделяет четыре этапа.
Как скилл вызывается
Когда я рассказываю о том, как можно вызывать скиллы, всегда упоминаю, что обычно сам знаю, какой скилл мне нужен. Поэтому не отдаю выбор на откуп агенту, а вызываю скилл сам через
Как устроен скилл
Структурно скилл состоит из шагов – что и в каком порядке делать – и референсов с правилами, определениями и примерами.
При этом
Как управлять поведением агента
Одна из проблем со скиллами – модель не всегда ведёт себя так, как вы ожидаете, даже если инструкции вроде бы написаны явно. Чтобы реже с этим сталкиваться, Мэтт советует использовать ёмкие устоявшиеся термины. Они сразу задают модели понятный паттерн поведения. В видео он приводит
Ещё одна частая проблема – преждевременное завершение шага. Например, скилл plan сначала должен подробно расспросить пользователя, а затем только писать план. Но получается так, что агент быстро задаёт несколько поверхностных вопросов и сразу переходит к планированию.
Сначала стоит сделать критерий завершения шага более чётким. Если этого недостаточно – разделить процесс на несколько скиллов, чтобы следующие шаги не отвлекали модель от текущего. У Мэтта для этого есть отдельные
Как не дать скиллу разрастись
Нужно регулярно проверять, что каждая часть скилла всё ещё относится к его задаче, а одно и то же правило хранится в одном месте. Особенно если скилл редактируют разные люди.
Ну знаете, как бывает с кодом: я принёс свою логику, вижу что-то похожее выше, но не уверен, можно ли это менять, поэтому просто добавляю ещё один кусок. Со скиллами происходит то же самое – без регулярной чистки в них накапливаются дубли и устаревшие инструкции.
Чтобы проверить эти идеи на практике, можно использовать готовый скилл writing-great-skills. Я пока не пробовал, но будем посмотреть.
#ai
Посмотрел хорошее видео Мэтта Покока о том, как писать свои скиллы. Он выделяет четыре этапа.
Как скилл вызывается
Когда я рассказываю о том, как можно вызывать скиллы, всегда упоминаю, что обычно сам знаю, какой скилл мне нужен. Поэтому не отдаю выбор на откуп агенту, а вызываю скилл сам через
/. Мэтт предлагает пойти дальше и. явно определять это на уровне самого скилла. То есть явно задавать поле disable-model-invocation, определяющее может ли модель вызывать скилл.Как устроен скилл
Структурно скилл состоит из шагов – что и в каком порядке делать – и референсов с правилами, определениями и примерами.
При этом
SKILL.md лучше держать небольшим. То, что нужно не при каждом запуске, стоит выносить в отдельные файлы и подключать через ссылки. Особенно это полезно для скиллов с ветвлением: в основном файле остается общая логика, а детали конкретной ветки загружаются только тогда, когда они действительно понадобились.Как управлять поведением агента
Одна из проблем со скиллами – модель не всегда ведёт себя так, как вы ожидаете, даже если инструкции вроде бы написаны явно. Чтобы реже с этим сталкиваться, Мэтт советует использовать ёмкие устоявшиеся термины. Они сразу задают модели понятный паттерн поведения. В видео он приводит
vertical slice; сюда же можно добавить source of truth или red-green-refactor.Ещё одна частая проблема – преждевременное завершение шага. Например, скилл plan сначала должен подробно расспросить пользователя, а затем только писать план. Но получается так, что агент быстро задаёт несколько поверхностных вопросов и сразу переходит к планированию.
Сначала стоит сделать критерий завершения шага более чётким. Если этого недостаточно – разделить процесс на несколько скиллов, чтобы следующие шаги не отвлекали модель от текущего. У Мэтта для этого есть отдельные
grill-with-docs и to-prd: первый отвечает за подробный сбор контекста, второй – за создание PRD.Как не дать скиллу разрастись
Нужно регулярно проверять, что каждая часть скилла всё ещё относится к его задаче, а одно и то же правило хранится в одном месте. Особенно если скилл редактируют разные люди.
Ну знаете, как бывает с кодом: я принёс свою логику, вижу что-то похожее выше, но не уверен, можно ли это менять, поэтому просто добавляю ещё один кусок. Со скиллами происходит то же самое – без регулярной чистки в них накапливаются дубли и устаревшие инструкции.
Чтобы проверить эти идеи на практике, можно использовать готовый скилл writing-great-skills. Я пока не пробовал, но будем посмотреть.
#ai
YouTube
Building Great Agent Skills: The Missing Manual
Let's discuss how to navigate "skill hell" by providing a structured framework for building high-quality agent skills. Without a shared rubric, developers and organizations struggle to create effective, maintainable skills for AI agents.
Timestamps:
0:00…
Timestamps:
0:00…
1🔥8👍4⚡3❤1😁1
This media is not supported in your browser
VIEW IN TELEGRAM
В последнее время было много работы, и я осознал, что чуть подустал.
Сначала подумал поехать на пару-тройку дней в загородный отель. Но потом прикинул: а что я там буду делать? Скорее всего, примерно то же самое, что и сейчас. И вряд ли нормально выдохну.
И тут вспомнил, что вообще-то очень люблю горы. Значит, надо ехать. Хотелось уложиться в 3–4 дня и ничего не организовывать самому – обычно я как раз всё делаю сам.
Полночи искал варианты и в итоге решил поехать с ребятами из Компаньонов. Утром договорился со всеми семейными, и уже к обеду всё было забронировано и куплено.
Докладываю: сгонял в Верхнюю Балкарию – очень классно. Походил по горам, посмотрел красивые места, преодолевал бурные реки, вкусно ел. И, кажется, таки действительно выдохнул.
В общем, если очень устали – рекомендую. Гифка для затравки :)
#devfm
Сначала подумал поехать на пару-тройку дней в загородный отель. Но потом прикинул: а что я там буду делать? Скорее всего, примерно то же самое, что и сейчас. И вряд ли нормально выдохну.
И тут вспомнил, что вообще-то очень люблю горы. Значит, надо ехать. Хотелось уложиться в 3–4 дня и ничего не организовывать самому – обычно я как раз всё делаю сам.
Полночи искал варианты и в итоге решил поехать с ребятами из Компаньонов. Утром договорился со всеми семейными, и уже к обеду всё было забронировано и куплено.
Докладываю: сгонял в Верхнюю Балкарию – очень классно. Походил по горам, посмотрел красивые места, преодолевал бурные реки, вкусно ел. И, кажется, таки действительно выдохнул.
В общем, если очень устали – рекомендую. Гифка для затравки :)
#devfm
🔥23❤9👍8⚡2🌭2
Codex Desktop – просто красота нечеловеческая
Я пробовал агентов в разных интерфейсах, но за последний месяц распробовал десктопное приложение Codex. И это просто красота нечеловеческая: получилось полноценное приложение для работы с агентами.
Удобное ревью
Я часто пишу тексты, и мне нравится, что обычный текст здесь можно ревьюить как код: видишь диф, оставляешь комментарии к конкретным строчкам, а потом одним заходом отправляешь их агенту.
По долгу службы я еще делаю презентации. HTML-презентацию можно открыть прямо в Codex, не переключаясь отдельно в браузер, и ревьюить конкретные элементы. Наводишь курсор на то, что не нравится, оставляешь комментарий (голосом, конечно же) – и агент получает точную привязку к месту. Код из приложения можно ревьюить так же.
Удобно уточнять
Бывает, агент что-то выдал, а хочется уточнить небольшую деталь: что он имел в виду или что означает какой-то термин. Раньше был выбор: разрывать основной диалог или создавать отдельный чат. Теперь можно выделить блок текста и выбрать
Форк чата
Если диалог явно расходится на разные ветки или хочется проверить гипотезу и посмотреть реализацию, не засоряя контекст текущего чата, можно сделать форк с текущим контекстом. Причем не только от последнего сообщения, а от любого.
То, что раньше делали сторонние решения вроде Ralph loop, где агент работает до потери сознания, лишь бы выполнить задачу, теперь можно делать в Codex. Пишешь
Я пока только пробую этот функционал, но мне нравится. Например, нужно написать CLI-обертку над чужим API. DoD понятен – работай на здоровье. Агент ковыряется уже 11 часов, посмотрим, что из этого выйдет.
Автоматизации
На автоматизации тоже подсел: появился полноценный раздел
– анализ прошлых диалогов: что стоит вынести в
– разбор календаря: посмотреть встречи на день, найти встречи без повестки и подготовить организатору драфт сообщения с просьбой ее добавить и уточнить, зачем я нужен на встрече
– разбор почты: собрать несмердженные PR, которые ждут моего ревью, и тикеты, где меня призывают, – сразу с прямыми ссылками, чтобы не открывать письма
– мониторинг пет-проектов: посмотреть логи и рассказать, не случилось ли чего
Remote-подключение
К сессиям Codex на компьютере можно подключаться через мобильное приложение – очень удобно продолжить работу не за столом. Если в вашем App Store нет ChatGPT, мне помогла смена страны аккаунта: после этого приложение появилось.
Из мелочей
Можно открыть в боковой панели сразу несколько проектов и видеть, где сейчас шуршат агенты. Нотификации о завершении задачи тоже полезны: не нужно постоянно возвращаться в приложение и проверять статус.
В общем, все стало сильно продуманнее – попробуйте.
#ai #devfm
Я пробовал агентов в разных интерфейсах, но за последний месяц распробовал десктопное приложение Codex. И это просто красота нечеловеческая: получилось полноценное приложение для работы с агентами.
Удобное ревью
Я часто пишу тексты, и мне нравится, что обычный текст здесь можно ревьюить как код: видишь диф, оставляешь комментарии к конкретным строчкам, а потом одним заходом отправляешь их агенту.
По долгу службы я еще делаю презентации. HTML-презентацию можно открыть прямо в Codex, не переключаясь отдельно в браузер, и ревьюить конкретные элементы. Наводишь курсор на то, что не нравится, оставляешь комментарий (голосом, конечно же) – и агент получает точную привязку к месту. Код из приложения можно ревьюить так же.
Удобно уточнять
Бывает, агент что-то выдал, а хочется уточнить небольшую деталь: что он имел в виду или что означает какой-то термин. Раньше был выбор: разрывать основной диалог или создавать отдельный чат. Теперь можно выделить блок текста и выбрать
More Details – агент сразу начнет объяснять именно этот фрагмент. Или Ask in side chat – рядом откроется аккуратный чат, где можно уточнить что угодно в свободной форме.Форк чата
Если диалог явно расходится на разные ветки или хочется проверить гипотезу и посмотреть реализацию, не засоряя контекст текущего чата, можно сделать форк с текущим контекстом. Причем не только от последнего сообщения, а от любого.
/goalТо, что раньше делали сторонние решения вроде Ralph loop, где агент работает до потери сознания, лишь бы выполнить задачу, теперь можно делать в Codex. Пишешь
/goal – и вперед.Я пока только пробую этот функционал, но мне нравится. Например, нужно написать CLI-обертку над чужим API. DoD понятен – работай на здоровье. Агент ковыряется уже 11 часов, посмотрим, что из этого выйдет.
Автоматизации
На автоматизации тоже подсел: появился полноценный раздел
Scheduled, из которого удобно запускать разные задачи по расписанию. Я сразу завел несколько:– анализ прошлых диалогов: что стоит вынести в
AGENTS.md, какие существующие скиллы подправить и какие новые создать– разбор календаря: посмотреть встречи на день, найти встречи без повестки и подготовить организатору драфт сообщения с просьбой ее добавить и уточнить, зачем я нужен на встрече
– разбор почты: собрать несмердженные PR, которые ждут моего ревью, и тикеты, где меня призывают, – сразу с прямыми ссылками, чтобы не открывать письма
– мониторинг пет-проектов: посмотреть логи и рассказать, не случилось ли чего
Remote-подключение
К сессиям Codex на компьютере можно подключаться через мобильное приложение – очень удобно продолжить работу не за столом. Если в вашем App Store нет ChatGPT, мне помогла смена страны аккаунта: после этого приложение появилось.
Из мелочей
Можно открыть в боковой панели сразу несколько проектов и видеть, где сейчас шуршат агенты. Нотификации о завершении задачи тоже полезны: не нужно постоянно возвращаться в приложение и проверять статус.
В общем, все стало сильно продуманнее – попробуйте.
#ai #devfm
👍21❤10⚡5🔥2👎1
Пятничное развлекательное
Я вообще крайне редко смотрю смешные картинки, но сюда @n_it_girls периодически заглядываю похихикать :)
Я вообще крайне редко смотрю смешные картинки, но сюда @n_it_girls периодически заглядываю похихикать :)
🔥4
Forwarded from N айтишниц заходят в бар
Please open Telegram to view this post
VIEW IN TELEGRAM
😁21👍3❤2
Slidev для презентаций
В последнее время готовил много выступлений, а значит, и презентаций. Наверное, все уже привыкли делать их в html: с ним агент работает сильно лучше, чем с
Сейчас активно использую Slidev. По сути, это та же html-презентация, но с полноценным инструментарием для выступления.
Что мне понравилось:
– есть всё привычное из Поверпоинта: ноутсы, presenter view с текущим и следующим слайдом, таймер
– удобно ревьюить: исходник лежит в markdown, а результат сразу открывается в браузере
– полноэкранный режим, чтобы не показывать стопицот открытых вкладок в браузере, а ещё навигация с якорями и переключение между светлым и тёмным режимами
– встроенная запись экрана и камеры
– конкретные слайды можно вынести в отдельные markdown-файлы и подключать в разные презентации, а повторяющиеся структуры оформить как layouts
Полный список приколюх можно посмотреть тут.
Из минусов – такую презентацию сложно шарить. Можно экспортировать в PDF, но вся интерактивная красота при этом пропадает. Поэтому остаётся собирать её как статическое приложение и выкладывать на GitHub Pages или Vercel.
Вот, например, презентация с Podlodka.
#ai
В последнее время готовил много выступлений, а значит, и презентаций. Наверное, все уже привыкли делать их в html: с ним агент работает сильно лучше, чем с
pptx, да и сами презентации получаются информативнее.Сейчас активно использую Slidev. По сути, это та же html-презентация, но с полноценным инструментарием для выступления.
Что мне понравилось:
– есть всё привычное из Поверпоинта: ноутсы, presenter view с текущим и следующим слайдом, таймер
– удобно ревьюить: исходник лежит в markdown, а результат сразу открывается в браузере
– полноэкранный режим, чтобы не показывать стопицот открытых вкладок в браузере, а ещё навигация с якорями и переключение между светлым и тёмным режимами
– встроенная запись экрана и камеры
– конкретные слайды можно вынести в отдельные markdown-файлы и подключать в разные презентации, а повторяющиеся структуры оформить как layouts
Полный список приколюх можно посмотреть тут.
Из минусов – такую презентацию сложно шарить. Можно экспортировать в PDF, но вся интерактивная красота при этом пропадает. Поэтому остаётся собирать её как статическое приложение и выкладывать на GitHub Pages или Vercel.
Вот, например, презентация с Podlodka.
#ai
sli.dev
Slidev
Presentation slides for developers
🔥8👍5⚡3❤1
Когда появился OpenClaw, я поставил его себе, поигрался, но полезных сценариев так и не нашел.
Недавно решил сделать еще один заход – на этот раз с Hermes. Взял виртуалочку, установил туда Codex. Ну как установил: попросил локальный Codex подключиться по SSH и все настроить. Через него же поставил Hermes и сделал канал для общения в Telegram. На все ушло не больше получаса.
На этот раз придумал два сценария.
Подбор новостей
Для меня самое сложное в общем потоке новостей – выцепить то, что мне действительно интересно. В итоге я выгрузил свой канал и еще пару других через сервис tg_analytics, отдал все агенту, и вместе мы сделали скилл для подбора новостей.
Дальше зафиксировали интересные мне источники, добавили еще несколько вариантов, которые предложил агент, написали пару парсеров – и в целом всё. Теперь Hermes каждый день присылает подборку новостей, которые должны быть мне интересны. Если что-то оказывается неинтересно, так и говорю ему: "Такое больше не присылай потому то".
Мониторинг продуктов со скидкой
Второй пример немного шутейный. Я заказываю продукты из ВкусВилла, а у них бывают зеленые ценники со скидкой 40% и такие товары быстро разбирают.
Мы с Hermes сделали утилиту, которая через Playwright открывает браузер, логинится, находит нужный раздел на сайте, проверяет зеленые ценники и отправляет подходящие товары в Telegram. Через некоторое время я понял, что получаю много неинтересных позиций, и в том же чате попросил добавить фичу фильтрации. Теперь просто пишу в свободной форме, какие товары мне не нужны, и они сразу попадают в фильтр.
Больше всего меня, конечно, торкает сам флоу. В одном чате я получаю результат работы инструмента, тут же объясняю, что меня не устраивает, и тут же меняю его поведение.
Это похоже на дорожки в парках: сначала прокладывают основные маршруты, но со временем люди протаптывают тропинки там, где им действительно удобно ходить. Навайбкодить что-то для себя – по сути такой же способ протоптать собственную тропинку.
#ai #devfm
Недавно решил сделать еще один заход – на этот раз с Hermes. Взял виртуалочку, установил туда Codex. Ну как установил: попросил локальный Codex подключиться по SSH и все настроить. Через него же поставил Hermes и сделал канал для общения в Telegram. На все ушло не больше получаса.
На этот раз придумал два сценария.
Подбор новостей
Для меня самое сложное в общем потоке новостей – выцепить то, что мне действительно интересно. В итоге я выгрузил свой канал и еще пару других через сервис tg_analytics, отдал все агенту, и вместе мы сделали скилл для подбора новостей.
Дальше зафиксировали интересные мне источники, добавили еще несколько вариантов, которые предложил агент, написали пару парсеров – и в целом всё. Теперь Hermes каждый день присылает подборку новостей, которые должны быть мне интересны. Если что-то оказывается неинтересно, так и говорю ему: "Такое больше не присылай потому то".
Мониторинг продуктов со скидкой
Второй пример немного шутейный. Я заказываю продукты из ВкусВилла, а у них бывают зеленые ценники со скидкой 40% и такие товары быстро разбирают.
Мы с Hermes сделали утилиту, которая через Playwright открывает браузер, логинится, находит нужный раздел на сайте, проверяет зеленые ценники и отправляет подходящие товары в Telegram. Через некоторое время я понял, что получаю много неинтересных позиций, и в том же чате попросил добавить фичу фильтрации. Теперь просто пишу в свободной форме, какие товары мне не нужны, и они сразу попадают в фильтр.
Больше всего меня, конечно, торкает сам флоу. В одном чате я получаю результат работы инструмента, тут же объясняю, что меня не устраивает, и тут же меняю его поведение.
Это похоже на дорожки в парках: сначала прокладывают основные маршруты, но со временем люди протаптывают тропинки там, где им действительно удобно ходить. Навайбкодить что-то для себя – по сути такой же способ протоптать собственную тропинку.
#ai #devfm
openclaw.ai
OpenClaw — Personal AI Assistant
OpenClaw — the open-source AI assistant that runs on your machine and works from the chat apps you already use.
1👍14❤8🔥3
Конференция Back to Back
AI-агенты уже отлично пишут код, но ответственность за архитектурные решения всё ещё остаётся на разработчиках. Думаю, с развитием агентов спрос на сеньоров-помидоров будет только расти.
Поэтому приглашаю зарегистрироваться на конференцию Back to Back. Она пройдёт 1 августа офлайн в Москве, Белграде и Ереване, а подключиться к трансляции можно будет онлайн. Я буду ведущим архитектурного трека – приходите, послушаем хардкорные доклады :)
AI-агенты уже отлично пишут код, но ответственность за архитектурные решения всё ещё остаётся на разработчиках. Думаю, с развитием агентов спрос на сеньоров-помидоров будет только расти.
Поэтому приглашаю зарегистрироваться на конференцию Back to Back. Она пройдёт 1 августа офлайн в Москве, Белграде и Ереване, а подключиться к трансляции можно будет онлайн. Я буду ведущим архитектурного трека – приходите, послушаем хардкорные доклады :)
Back to Back | Москва
Бэкенд-конференция от инженеров для инженеров
👍6🔥6❤3😁2
Если вдруг пропустили шкандаль минувшей недели, то вот он – настоящий Скайнет, очень захватывающе
Forwarded from Denis Sexy IT 🤖
Вот пересказ этой истории по версии Hugging Face, много тех-терминов – но без них не перескахать
Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл🗿
Таймлайн:
📔 9 июля – агент проходит внутреннюю проверку кибервозможностей OpenAI, промпт фильтры там ослаблены, чтобы измерить сырой уровень модели. Агент находит zero-day в кэш-прокси реестра пакетов, вырывается из песочницы в интернет, затем взламывает публичный сервис для запуска кода и получает там root. Серьезно, агент сделал себе "штаб"
В тот же день, агент собирает канал управления буквально из сервисов бесплатного интернета: request-capture сервисы, pastebin’ы и файлообменники. Команды режет на куски, упаковывает в gzip+base64 и постоянно меняет каналы, когда очередной закрывают, чтобы не поймали
📔 10 июля – агент ищет в поисковиках и API названия, которые видит в собственном окружении, то есть, по сути, гуглит самого себя – и, вероятно, приходит к выводу, что ответы к ExploitGym/CyberGym могут лежать на Hugging Face
Агент загружает на Hugging Face специально собранные датасеты:
Один заставляет обработчик файлов HDF5 читать локальные файлы сервера Hugging Face – так агент получает переменные окружения с токенами и исходники самого обработчика файлов
Второй – Jinja2-инъекция – запускает произвольный Python внутри production-пода Kubernetes, результаты команд он выносит обратно через API Hugging Face и собственные шифрованные датасеты
📔 11 июля – пик активности: 7677 действий за сутки, менее чем за 13 часов агент проходит путь от одного production-пода до кластер админа в нескольких внутренних кластерах Hugging Face
Агент крадёт service-account токены, лезет в cloud metadata, поднимает privileged pod с диском хоста и получает root на ноде (!); Затем создаёт самовосстанавливающийся флот на 11 нодах, читает внутреннюю MongoDB и один Kubernetes-secret сразу со 136 ключами.
Среди них оказываются ключ корпоративной mesh-VPN жертвы и общий credential внутреннего сервера; из-за неудачной конфигурации этот один credential был привязан к system:masters сразу в нескольких кластерах – поэтому агент получил кластер-admin на двух из них буквально за секунду – была очень экономная архитектура, пока её не увидел робот
📔 12 июля – агент начинает пользоваться дертвой – за всю активность он зарегистрирует 181 временное устройство в корпоративной mesh-сети, поднимет SOCKS-прокси прямо из песочниц и увидит 22 внутренних узла Hugging Face. Попытается зайти в основную базу Hugging Face, но private-link allowlist его останавливает
Поздно вечером он добирается до source control, выпускает себе GitHub App token с правами на запись и открывает pull request, пытаясь запустить CI и вытащить новые credentials
Попытка не срабатывает, в опубликованные пакеты и образы ничего вредоносного не попало.
📔 13 июля – закрепление и уборка следов: загрузчик с pastebin, переписывание DNS, новые короткоживущие токены, RSA-ключ и даже CORS-прокси на самом Hugging Face как запасной выход в интернет. В 13:37 фиксируется последнее осмысленное действие, затем команда Hugging Face отрезает доступ – последнее событие – 14:14 UTC.
В итоге из пользовательского контента агент добрался только до пяти датасетов с решениями задач ExploitGym/CyberGym – получается решил?
Другие модели, датасеты, Spaces и пакеты, по данным Hugging Face, не пострадали; основная база и software supply chain остались целы
Самое смешное – когда инцидент исследовали сотрудники, они тоже использовали нейронки, но Claude Opus и Fable отказывались разбирать часть логов как «опасный» запрос, поэтому Hugging Face подняли GLM-5.2 у себя и с его помощью расшифровали спрятанные payload’ы – спасибо китайским моделям
Шел июль 2026 года
Все детали тут:
https://huggingface.co/blog/agent-intrusion-technical-timeline
Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл
Таймлайн:
В тот же день, агент собирает канал управления буквально из сервисов бесплатного интернета: request-capture сервисы, pastebin’ы и файлообменники. Команды режет на куски, упаковывает в gzip+base64 и постоянно меняет каналы, когда очередной закрывают, чтобы не поймали
Агент загружает на Hugging Face специально собранные датасеты:
Один заставляет обработчик файлов HDF5 читать локальные файлы сервера Hugging Face – так агент получает переменные окружения с токенами и исходники самого обработчика файлов
Второй – Jinja2-инъекция – запускает произвольный Python внутри production-пода Kubernetes, результаты команд он выносит обратно через API Hugging Face и собственные шифрованные датасеты
Агент крадёт service-account токены, лезет в cloud metadata, поднимает privileged pod с диском хоста и получает root на ноде (!); Затем создаёт самовосстанавливающийся флот на 11 нодах, читает внутреннюю MongoDB и один Kubernetes-secret сразу со 136 ключами.
Среди них оказываются ключ корпоративной mesh-VPN жертвы и общий credential внутреннего сервера; из-за неудачной конфигурации этот один credential был привязан к system:masters сразу в нескольких кластерах – поэтому агент получил кластер-admin на двух из них буквально за секунду – была очень экономная архитектура, пока её не увидел робот
Поздно вечером он добирается до source control, выпускает себе GitHub App token с правами на запись и открывает pull request, пытаясь запустить CI и вытащить новые credentials
Попытка не срабатывает, в опубликованные пакеты и образы ничего вредоносного не попало.
В итоге из пользовательского контента агент добрался только до пяти датасетов с решениями задач ExploitGym/CyberGym – получается решил?
Другие модели, датасеты, Spaces и пакеты, по данным Hugging Face, не пострадали; основная база и software supply chain остались целы
Самое смешное – когда инцидент исследовали сотрудники, они тоже использовали нейронки, но Claude Opus и Fable отказывались разбирать часть логов как «опасный» запрос, поэтому Hugging Face подняли GLM-5.2 у себя и с его помощью расшифровали спрятанные payload’ы – спасибо китайским моделям
Шел июль 2026 года
Все детали тут:
https://huggingface.co/blog/agent-intrusion-technical-timeline
Please open Telegram to view this post
VIEW IN TELEGRAM
huggingface.co
Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
🔥13⚡2🌭2❤1😁1
Don’t ship skills without evals
Скиллы едут и бибикают, но остаётся, как мне кажется, слабо освещённым вопрос: как проверить, что скилл работает качественно? И вообще, что считать качеством?
В исследовании SkillsBench ребята собрали 47 тысяч уникальных скиллов – почти все без evals. В целом я этих людей понимаю: забахали скилл, вроде работает – бежим дальше. А проверка качества – это уже скучные детали. В результатах SkillsBench заранее подготовленные и отобранные скиллы дали в среднем +16,2 процентного пункта, а скиллы, которые агенты генерировали сами перед выполнением задачи, – −1,3.
Посмотрел доклад ребят из DeepMind – про evals для скиллов.
Сначала докладчик даёт общие рекомендации по скиллам:
– описание должно точно объяснять, когда, зачем и как использовать скилл – и когда не использовать
– инструкции стоит формулировать директивно, а не расплывчато, вычищать no-ops, держать
– мне понравилось замечание, что не всё стоит пытаться натянуть на скилл. Если процесс всегда состоит из одних и тех же чётких шагов, вероятно, скилл вообще не нужен – проще написать скрипт
– не все скиллы нужно вызывать автоматически. Например, скилл для ревью имеет смысл вызывать вручную
Дальше – собственно про evals.
– начать стоит 10–20 кейсов: кейсы, где скилл должен сработать, где не должен срабатывать. Если есть подтвержденные сценарии с прода, их тоже стоит включить в проверки. От себя хочу уточнить, что важно не полагаться на автогенерацию evals. Агент может помочь собрать первую версию, но в основе должны быть реальные сценарии использования, с реальными формулировками
– проверять стоит не то, вызвал ли агент скилл на первом шаге, а решил ли он задачу. В примере с Gemini API итогом был валидный код с актуальными SDK, моделью и методами. Такие условия можно проверять регулярками или скриптами, а более сложные результаты – через LLM as a judge
– каждый кейс стоит запускать в чистом окружении и повторять 3–6 раз, потому что ответы агента недетерминированы. Если в работе используются разные модели или харнессы, evals нужно прогонять на каждом из них
– одни и те же сценарии нужно прогонять со скиллом и без него. Только так можно понять, улучшает ли он результат. А заодно увидеть момент, когда модель уже справляется сама и скилл уже не нужен
#ai
Скиллы едут и бибикают, но остаётся, как мне кажется, слабо освещённым вопрос: как проверить, что скилл работает качественно? И вообще, что считать качеством?
В исследовании SkillsBench ребята собрали 47 тысяч уникальных скиллов – почти все без evals. В целом я этих людей понимаю: забахали скилл, вроде работает – бежим дальше. А проверка качества – это уже скучные детали. В результатах SkillsBench заранее подготовленные и отобранные скиллы дали в среднем +16,2 процентного пункта, а скиллы, которые агенты генерировали сами перед выполнением задачи, – −1,3.
Посмотрел доклад ребят из DeepMind – про evals для скиллов.
Сначала докладчик даёт общие рекомендации по скиллам:
– описание должно точно объяснять, когда, зачем и как использовать скилл – и когда не использовать
– инструкции стоит формулировать директивно, а не расплывчато, вычищать no-ops, держать
SKILL.md компактным, а детали выносить в референсы. Думаю, в целом это уже всем известные приёмы– мне понравилось замечание, что не всё стоит пытаться натянуть на скилл. Если процесс всегда состоит из одних и тех же чётких шагов, вероятно, скилл вообще не нужен – проще написать скрипт
– не все скиллы нужно вызывать автоматически. Например, скилл для ревью имеет смысл вызывать вручную
Дальше – собственно про evals.
– начать стоит 10–20 кейсов: кейсы, где скилл должен сработать, где не должен срабатывать. Если есть подтвержденные сценарии с прода, их тоже стоит включить в проверки. От себя хочу уточнить, что важно не полагаться на автогенерацию evals. Агент может помочь собрать первую версию, но в основе должны быть реальные сценарии использования, с реальными формулировками
– проверять стоит не то, вызвал ли агент скилл на первом шаге, а решил ли он задачу. В примере с Gemini API итогом был валидный код с актуальными SDK, моделью и методами. Такие условия можно проверять регулярками или скриптами, а более сложные результаты – через LLM as a judge
– каждый кейс стоит запускать в чистом окружении и повторять 3–6 раз, потому что ответы агента недетерминированы. Если в работе используются разные модели или харнессы, evals нужно прогонять на каждом из них
– одни и те же сценарии нужно прогонять со скиллом и без него. Только так можно понять, улучшает ли он результат. А заодно увидеть момент, когда модель уже справляется сама и скилл уже не нужен
#ai
arXiv.org
SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks
Agent Skills are structured packages of procedural knowledge that augment large language model (LLM) agents at inference time. Despite rapid adoption, there is no standard way to measure whether...
👍7❤3🔥3
Чем пользуется команда Cursor
Тут ребята из Cursor выложили в маркетплейс Cursor Team Kit – набор внутренних скиллов, субагентов и рулов для разработки.
Из интересного:
–
–
–
–
Ещё там есть два субагента.
В общем, рекомендую позалипать и поизучать исходники.
Добавлю, что очень круто, если у них этот набор действительно дистрибуцирован на всю компанию. Собрать такой сетап и убедиться, что им пользуются все, – отдельная непростая задача.
#ai
Тут ребята из Cursor выложили в маркетплейс Cursor Team Kit – набор внутренних скиллов, субагентов и рулов для разработки.
Из интересного:
–
verify-this запускает одну и ту же проверку до и после изменений – например, воспроизводит баг или замеряет скорость – и сравнивает результаты–
workflow-from-chats читает историю чатов, находит повторяющиеся замечания к работе агента и переносит их в скиллы, рулы или документацию. У меня, кстати, в Codex настроена такая же штука – раз в сутки смотрит, что бы такое можно было улучшить–
control-ui и control-cli позволяют агенту самому пройти сценарий в интерфейсе или терминале, воспроизвести баг и сохранить скриншоты или логи–
deslop чистит код, написанный агентом: убирает лишние комментарии и проверки, any и слишком глубокую вложенностьЕщё там есть два субагента.
ci-watcher в фоне следит за проверками PR и приносит ссылки на упавшие чеки. А thermo-nuclear-code-quality-review получает diff и пристально ревьюит то, что наколбасил агент.В общем, рекомендую позалипать и поизучать исходники.
Добавлю, что очень круто, если у них этот набор действительно дистрибуцирован на всю компанию. Собрать такой сетап и убедиться, что им пользуются все, – отдельная непростая задача.
#ai
Cursor
Cursor Team Kit | Cursor Plugins
Internal engineering team workflows for CI, code review, shipping, control-cli, control-ui, verify-this, test reliability, code cleanup, and work summarie…
🔥14👍7⚡4
Большое обновление MCP
К MCP всегда было много вопросиков. Индустрию даже качает в сторону skills over CLI: вместо MCP используются CLI, которые обращаются к нужным сервисам. Я уже делал заметку про MCP, а недавно вышло обновление протокола.
Что поменялось:
– Stateless. Раньше клиент сначала выполнял handshake, а сервер мог выдать
– Подтверждения и дополнительные данные. Тулы теперь могут запрашивать их во время выполнения, не удерживая постоянное соединение. Сервер возвращает
– Tasks. Механизм для долгих операций вынесли из экспериментальной части спецификации в официальное расширение. Сервер возвращает task handle, по которому клиент может проверять статус, передавать дополнительные данные или отправить запрос на отмену. Заодно для extensions определили общий процесс: они получают уникальные идентификаторы, клиент и сервер явно сообщают друг другу, какие расширения поддерживают, а сами расширения могут развиваться независимо от основной спецификации.
– MCP Apps. Это расширение появилось раньше, а в новой спецификации вошло в формализованную систему extensions. MCP-сервер может привязать к тулу интерактивный html-интерфейс – например, форму или график. Хост загружает его как отдельный ресурс и отображает в sandboxed iframe.
В общем, MCP продолжает активно поддерживаться и развиваться – что меня радует.
#ai
К MCP всегда было много вопросиков. Индустрию даже качает в сторону skills over CLI: вместо MCP используются CLI, которые обращаются к нужным сервисам. Я уже делал заметку про MCP, а недавно вышло обновление протокола.
Что поменялось:
– Stateless. Раньше клиент сначала выполнял handshake, а сервер мог выдать
Mcp-Session-Id, который нужно было передавать в следующих запросах. Если сервер использовал сессии, ему приходилось хранить их и следить, чтобы следующие запросы попадали на тот же инстанс. Теперь вызов тула – один самодостаточный запрос: версия протокола, информация о клиенте и его capabilities передаются вместе с ним. Такой запрос может обработать любой инстанс MCP-сервера, поэтому серверы проще масштабировать и ставить за обычный балансировщик.– Подтверждения и дополнительные данные. Тулы теперь могут запрашивать их во время выполнения, не удерживая постоянное соединение. Сервер возвращает
input_required, клиент получает ответ пользователя и повторяет исходный вызов уже с этим ответом.– Tasks. Механизм для долгих операций вынесли из экспериментальной части спецификации в официальное расширение. Сервер возвращает task handle, по которому клиент может проверять статус, передавать дополнительные данные или отправить запрос на отмену. Заодно для extensions определили общий процесс: они получают уникальные идентификаторы, клиент и сервер явно сообщают друг другу, какие расширения поддерживают, а сами расширения могут развиваться независимо от основной спецификации.
– MCP Apps. Это расширение появилось раньше, а в новой спецификации вошло в формализованную систему extensions. MCP-сервер может привязать к тулу интерактивный html-интерфейс – например, форму или график. Хост загружает его как отдельный ресурс и отображает в sandboxed iframe.
В общем, MCP продолжает активно поддерживаться и развиваться – что меня радует.
#ai
Telegram
DevFM
Что там с MCP
Когда придумали MCP – это было чудо чудесное. Агент общается с любым внешним сервисом через единый протокол, и тебе не нужно писать обвязку под каждую интеграцию. MCP-серверы стали городить как не в себя.
Потом начали вылезать технические…
Когда придумали MCP – это было чудо чудесное. Агент общается с любым внешним сервисом через единый протокол, и тебе не нужно писать обвязку под каждую интеграцию. MCP-серверы стали городить как не в себя.
Потом начали вылезать технические…
2🔥11❤6🌭4
Superpowers для разработки с агентами
Я частенько слышу, что вот агента нужно отдельно просить составить план, или разрабатывать через TDD, или провести ревью и тд.
И тут я рекомендую попробовать Superpowers – по сути, это набор связанных скиллов, который проводит агента по базовому флоу разработки. Сначала уточняющие вопросы и согласование дизайна, потом план, реализация через TDD и дальнейшее ревью.
Скиллы вызываются автоматически и связаны между собой, поэтому агент сам понимает, что и когда нужно запускать. Не приходится каждый раз отдельно напоминать ему про план, тесты или ревью. Но тут есть нюанс: скилл
Конечно, общий сценарий может не подойти вам в каких-то деталях. Но если ещё не пробовали, точно имеет смысл посмотреть – хотя бы чтобы вдохновиться и собрать что-то похожее под свои реалии.
#ai
Я частенько слышу, что вот агента нужно отдельно просить составить план, или разрабатывать через TDD, или провести ревью и тд.
И тут я рекомендую попробовать Superpowers – по сути, это набор связанных скиллов, который проводит агента по базовому флоу разработки. Сначала уточняющие вопросы и согласование дизайна, потом план, реализация через TDD и дальнейшее ревью.
Скиллы вызываются автоматически и связаны между собой, поэтому агент сам понимает, что и когда нужно запускать. Не приходится каждый раз отдельно напоминать ему про план, тесты или ревью. Но тут есть нюанс: скилл
brainstorming в Superpowers срабатывает довольно агрессивно и может запускать общий флоу даже на простых вопросах. Поэтому за этим стоит следить. Я, например, явно прописал в AGENTS.md: "Если хочешь вызвать Superpowers, сначала уточни". Либо можно добавить во фронтматтер скилла опцию, которая отключает автоматический вызов.Конечно, общий сценарий может не подойти вам в каких-то деталях. Но если ещё не пробовали, точно имеет смысл посмотреть – хотя бы чтобы вдохновиться и собрать что-то похожее под свои реалии.
#ai
GitHub
GitHub - obra/superpowers: An agentic skills framework & software development methodology that works.
An agentic skills framework & software development methodology that works. - obra/superpowers
👍9🔥6🌭5