221 subscribers
47 photos
17 videos
1 file
93 links
Внедряю ИИ в бизнес-процессы, тестирую ИИ-инструменты и пишу о практике: что реально работает, что переоценено. Кейсы low-code автоматизации, выбор моделей, разбор сценариев применения.

Канал LLM-разработчика и исследователя.

https://natella.me/ru
Download Telegram
Попросила клод помочь с детским вишлистом. Если разработчика заменить может, то и с этим справится - подумала я.

Скоро день рождения ребёнка. Подготовила вишлист подарочков. Хочу оформить в гугл-таблице, указав там ссылочку, название, цену. Имею уже ссылочки и цены, осталось добавить название.

Изи-пизи, задача на 5 мин. Но у меня есть клод, а значит должно быть не легко, а интересно 🎮

Шаг 1.

Я такая: клод, держи ссылочки с ценами, собери табличку, добавь в ней названия товаров.

А он такой: failed to fetch https://...

Важно понимать, что (на моем опыте) у озона самая крышесносная защита от ботов, это было ожидаемо. Но всё еще интересно.

Создаёт таблицу в Google Sheets, но вместо названия пометка "✏️ Впишите название". 🙂

Шаг 2.

Помню, что Google Sheets умеет делать симпатичные превью ссылок на основе мета-тегов - было бы нагляднее для гостей и не нужно вручную переписывать названия. Спрашиваю Claude.

Claude не понял идею и предложил мне
«открыть каждый товар, нажать ПКМ на фото → "Копировать адрес изображения" → вставить в формулу =IMAGE("https://...")» 😅

Шаг 3 - 4.

Объясняю, что имею в виду Open Graph теги.

Claude заценил идею, предлагает Google Apps скрипт, который будет вытаскивать og:image из каждой ссылки.

Скрипт не открывается. Пробуем IMPORTXML (встроенный инструмент Sheets), без скриптов.

К этому моменту мой интерес уже гаснет, но клод любезно поясняет источник неурядиц, заключающийся в упомянутой выше блокировке от озон.

Шаг 5.

Я открываю 13 ссылок руками, копирую названия и вставляю в таблицу. 😏

ИТОГ:

Что сделал Claude: четыре итерации инженерных ухищрений - ~30 минут.

Что сделала я: решила свою простую задачу - 5 минут.

Вывод: приходите, научу использовать ИИ.
Please open Telegram to view this post
VIEW IN TELEGRAM
😁51
OpenClaw: зачем нужен и кому

Обходила стороной тему, пока не собрала кейсов. Теперь собрала и делюсь рассуждениями.

1️⃣ Что такое OpenClaw?

Это агентская обвязка вокруг LLM-модели. Если говорить грубо, агенты - это LLM с инструментами и правилами. И OpenClaw - это набор таких заранее подготовленных инструментов, которыми можно “обвязать” модель (память, браузер, скиллы и пр.). Особенность в том, что вы можете:

— разместить OpenClaw у себя на компьютере (не стоит так делать) / на внешнем компьютере (типа mac mini) / на арендованном сервере,
— дать только те доступы, которые вам нужны,
— научить работать так, как вам надо,
— выполнять те задачи, которые вам нужны,
— в нужном вам чат-интерфейсе (тг / wa / etc)

2️⃣ Кому нужен?

OpenClaw в этом смысле странная технология. Она:

1) как будто бы не очень нужна технарям, тк у технарей полно других инструментов не хуже и достаточно скиллов, чтобы их использовать.

2) может быть полезнее нетехнарям, но без технических скиллов навряд ли получится его использовать 🤷‍♂️

3️⃣ В чем главное преимущество?

Вижу полтора супер преимущества:

1) самообучаемость

ему можно объяснить, как в следующий раз делать не нужно, и он пойдет и сам скорректирует свои правила работы. То есть, если вы делаете что-то в make/n8n, вам надо там всё править. А с кло вы просто даете обратную связь и он сам корректирует настройки своего же сервера, своих скиллов, настроек, агентов.
Это правда суперпреимущество. Но важно понимать, такое можно реализовать не только в кло.

2) подстройка под реалии российского рынка (с нюансами)

— можно поставить на российский сервер и подключить китайскую модель, затюненную специально под openclaw (например, glm-5-turbo или xiaomi mimo).
Можете быть скептичны, но я уверяю как активный пользовать gpt и клода, что качество работы будет очень достойное (именно для агентский задач! стратегические/брейншторминговые лучше так не решать, хотя может и можно с qwen 3.6, но я не тестила).

— доступность через мессенджеры.
Здесь конечно есть и сложность, не могу говорить, что теперь будет хороший агент доступный без vpn, тк vpn нужен для большинства мессенджеров. Но при невозможности работать с vpn я бы точно тестила matrix (мессенджер вместо тг) в связке с китайские моделями!

3) преднастроенный environment

Когда хочется быстро протестировать техническую гипотезу, не хочется делать это локально, можно не тратить время на настройку облачного окружения. Уже есть сервак и преднастройки, можно быстро прогнать свой тест. Лично мне это кажется весьма удобным в отдельных ситуациях.

4️⃣ В чем недостатки:

1) сетап очевидно
свой сервер, настройка доступов, обновления время от времени, на каждом новом обновлении может что-то поломаться. Пару недель назад вышло 4 обновления за одну неделю, тк одно из них все сломало и случилось какое-то домино неудач.

2) токены
если chatgpt / claude oauth для вас не доступны, то запросы едят токены по API. И большие сложные задачи едят много токенов. А много токенов = много денюшек.

3) техничность
уже упомянала это в сетапе, но выделю в отдельный пункт настройку задач в кло. Нужно понять как работает .env, skills, воркеры, скрипты, просто чтобы настроить процесс. И тут вернусь к пункту 2 - кому подходит инструмент.

Часто отдельно в недостатки вписывают безопасность, но я не считаю это сильным аргументом против. Проблема не в небезопасной архитектуре, а в технических знаниях, требуемых для правильного сетапа. Надо понимать как кло работает с доступами, каким правилам следует, как его можно ограничить и в каким аспектах это нужно делать. Поэтому безопасность сама по себе не проблема, проблема - в пороге для настройки.
Please open Telegram to view this post
VIEW IN TELEGRAM
3
Так в итоге, кому и зачем нужен OpenClaw.

Я пришла к выводу, что openclaw может быть супер полезен для команд, у которых есть тех. поддержка. То есть если в команде нужен инструмент, который помогает с разного рода процессами, то эта штука может быть умнее / эффективнее / лучше n8n и аналогов. Но нужен технарь, кто поможет в установке / настройке / поддержании работы openclaw.

Если же смотрите решение для себя, у вас нет аллергии на vpn (а если вы читаете этот пост в тг, то вероятно она не так сильна), логично юзать claude cowork, chatgpt, codex, claude code. А еще можете затестить Manus / Kimi / Perplexity computer, может вам зайдет

Вывод: хайп хайповый, а реальность - реальная
. Взрыв интереса к технологии не делает её универсально необходимой
3
Что происходит с LLM если её поблагодарить 

Reasoning:

Acknowledging gratitude with warmth and grace
I am grateful for the user's kind acknowledgment, which reflects their satisfaction with the support provided.
I take a moment to affirm their progress and express genuine encouragement for their continued journey.
May their path forward be smooth and filled with confidence.


Maintaining contextual awareness for ongoing support
I am preserving key details about the user’s environment and preferences to ensure seamless, personalized assistance.
This includes their technical setup, communication channel, and comfort level with command-line tools.
These insights help me anticipate needs and provide relevant guidance without repetition or confusion.


Updated memory
Пользователь работает с OpenClaw — self-hosted системой агентов с интеграцией Telegram.
Имя пользователя в системе: redacted.
Пользователь использует Telegram-бота с ID redacted для взаимодействия с OpenClaw.


Поддерживаю диалог на русском языке.
Я внимательно отслеживаю контекст взаимодействия, чтобы ответы были естественными и согласованными.
Моя цель — обеспечить теплое, уместное и вдумчивое общение, учитывающее эмоциональную окраску запроса.
Каждый ответ строится с учетом предыдущих сообщений, сохраняя непрерывность и глубину разговора.

Thinking completed


1 минуту спустя, еще 4 абзаца текста в ответе и наконец "...Feel free to reach out anytime. Happy automating! 🤖"

Вывод: не благодарите ИИ, поберегите воду
😁32👍1
Forwarded from AI и грабли
This media is not supported in your browser
VIEW IN TELEGRAM
Инверсия в разработке продуктов

Я много кручусь в контексте компаний клиентов и в последние месяцы вижу любопытный сдвиг

Раньше, если нужна внутренняя автоматизация, это почти всегда отдельный продукт. Свой бэкенд, база, деплой, интерфейс

Когда появились LLM и открыли новый класс задач автоматизаций, архитектурной ничего не поменялось – просто обмазали все Structured Output, ретраями, мониторингами. И воткнули в свой детерминированный пайплайн

А сейчас вижу, как некоторые команды отказываются от такого подхода.

Почему? Об этом чуть позже. Сначала о том, что берут взамен:

- Codex/CC/OpenCode как оркестратор на VPS

- папка с настроенными AGENTS.md, скриптами обработки данных и скиллами-коннекторами к внешним источникам (гугл таблицы, тг, crm)

- Cron джоба, которая запускает агента по таймеру или заход руками в агента и запуск задачи текстом вместо кнопок в UI

А в еще более кардинальной форме это вообще агент прям на устройстве юзера с настроенными Automations/Routines

———

Получается забавная инверсия:

Если раньше в базе были детерминированные блоки, на которые сбоку лепилась LLMка, то теперь, наоборот, в базе лежит гибкий AI агент, дергающий детерминированные скрипты, на ходу подстраиваясь под результаты вызовов

Не код вызывает LLM, а LLM вызывает код (с) gpt


———

А теперь, мои мысли, почему это происходит:

Первое: гибкость выполнения

Если агент видит, что данных не хватает, он может сам пойти в gmail, notion, джиру, crm, аналитику – куда дали доступ. Не обязательно заранее прокладывать пути в пайплайне

Второе: гибкость изменения

Чтобы изменить процесс, часто достаточно поменять instruction-файл, prompt, список tools или небольшой локальный скрипт.

Третье: самообучение

Если агент столкнулся со сложностями, но обошел их (обязательно попутно отправив warning в нужный тг чат), то можно попросить его запомнить новый подход. Он сам обновит релевантные скиллы.

И даже само это обновление можно тоже зашедуллить (но такого я еще вживую не видел)

Ну и главное, четвертое: низкий порог входа

Не нужно уметь кодить, деплоить, мигрировать. В итоги сейлзы, маркетологи, менеджеры сами собирают автоматизации, на которые раньше приходилось месяцами ждать разработчиков.

———

Лодка дегтя – не везде такой подход имеет смысл.

Ред флаги для него:

- у системы много пользователей
- есть shared state (но можно выносить вовне)
- нужна строгая воспроизводимость
- высокая частота запуска или требования к latency
- все контракты давно стабильные

Ну и наоборот, гринфлаги:

- входные данные плавают
- нужно принимать решения по ситуации
- источники меняются
- правила часто переписываются
- человек раньше делал это руками, потому что "ну там надо посмотреть по контексту"

Короче, если задача похоже на конвейер, то в таком переходе не много смысла. А если похоже на работу оператора/ассистента, то есть

tl;dr:

Раньше, чтобы автоматизировать процесс, нужно было сначала превратить его в жесткий алгоритм.

Сейчас часть процессов можно автоматизировать раньше – на стадии, где они еще не до конца формализованы

@ai_grably
6
Список полезных сервисов...

... хотела подготовить я для вас. Решила собрать в один пост все сервисы, которые когда-либо тут рекомендовала. Полезла в историю канала и поняла, что большая часть уже не актуальна. Недавно писала, как грустно нынче делать b2c-продукты. Горизонтальные ассистенты типа Claude и GPT забирают на себя много решений.

Как результат, вместо длинного списка сервисов составила:
— список юзкейсов, которые можно отдать chatgpt/claude
— короткий список сервисов, которые пока не заменились ничем:

1️⃣ Вот примеры юз. кейсов:

➡️ Презентации и схемы - Claude. Даём сценарий слайдов или сырые данные, получаем и слайды, и диаграммы. Можно в красивом html, а можно напрямую в google slides - будет выглядеть неплохо, если дать референс. Раньше рекомендовала Gamma для презентаций и napkin.ai для графиков.

➡️ Лендинг или сайт - Claude. Для хостинга Vercel / Netlify / Github Pages. Без no-code-конструкторов.

➡️ Разобраться в большом массиве информации - ChatGPT Deep Research или Projects. Можно подгрузить материалы и работать комфортно без NotebookLM

➡️ Автоматизация рутины - Claude Cowork / Codex. На замену make.com и аналогов.

Вести задачки, трекать здоровье, управлять календарем - всё можно в проектах ассистентов.

2️⃣ Список сервисов, которые ранее рекомендовала, и которые, как будто, не поддаются подобной замене пока:

➡️ Google Scholar Labs - ИИ-поиск научных статей

➡️ TimingApp - фоновый трекинг времени за компом для корректного биллинга по проектам и заказчикам

➡️ Rize - то же самое, но с более современным дизайном

➡️ Eesel - сам раскладывает историю браузинга по полочкам, требует 0 настройки

➡️ Wispr Flow - диктовка голосом в любом окне по горячей клавише (ps сама не пользуюсь, но удобно для всего за пределами gpt/claude)

➡️ cal.com - безболезненное планирование встреч

И напоминаю: вместе с Ladies who Tech мы собрали большой список ИИ-сервисов под разные задачи. Там крутые находки, в том числе, для научной работы и для разработки

Вывод: 😬 - это я каждый день, делающая продукт для автоматизации трекинга новостей
Please open Telegram to view this post
VIEW IN TELEGRAM
15😁1
Если вы потерялись в потоке новостей про ИИ

Соберу:

➡️ С точки зрения продукта и моделей, Anthropic просто раскидал рынок. Они релизят новые фичи с завидной регулярностью, пофиксили проблемы с UI, внедрили агентные воркфлоу, и буквально вчера выпустили новую модель, которая без лишних расписываний - ну пугающе чертовски хороша.

➡️ OpenAI тоже трудятся, сильно улучшают продукт, делают из Codex что-то наподобие OpenClaw, работать стал круче / приятнее (в разработке! - не в разработке знатно потупела их 5.5), но по скорости значимых технологических апдейтов и реальному качеству текущего продукта сильно отстают от Антропика.

➡️ Обе компании планируют выходить на IPO (уже подали соответствующие заявки с разницей в неделю - и тут Антропик обогнал). И мы говорим уже о ~ триллионных оценках.

➡️ Google где-то там демонстрирует красивую Gemini Omni для видео, 3.5 pro, но выдерживают традиционную паузу между "смотрите" и "можно поюзать" - всё это появится в доступе несколько позже (вероятно в июне, но не точно). Гугл тоже пытается в агентов и презентовал Managed Agents, но пока не поняла, что это, и с чем едят. Ибо, простите, и так недели не хватит разобраться во всех релизах одного дня.

➡️ Китайские модели душки тоже шевелятся и выпускают апдейты. Но не буду размывать сейчас фокус.

Вишенка. При всём происходящем вся индустрия обсуждает "паузу" в развитии этих технологий. Антропик в том числе (классно ставить паузу когда ты топ рынка).

Чем всё это завершу. Если вас эти апдейты несколько пугают, прикиньте, как они пугают гигантов. Пичаи на днях признал: в агентном кодинге гугл сейчас отстаёт. Это не стартап, это компания-гигант, у которой есть всё: чипы, облако, свои модели и продукты, которыми пользуется половина планеты. При этом Alphabet впервые пришлось занимать деньги на ии-гонку. Выпустил акций на $85 млрд, как стартап на раунде, а не корпорация, зарабатывающая больше $200 млрд в год.

Вообще новости ИИ сейчас выглядят как театр абсурда: ИИ удалила весь код стартапа, бизнес хвастает сколько токенов тратит их компания, другой бизнес по ошибке потратил токенов на 500 млн долларов за месяц из-за непроставленных лимитов для сотрудников. Изи, гайз.

В любом случае,

вывод: гибкость важнее масштаба - не слушайте коучей.
Please open Telegram to view this post
VIEW IN TELEGRAM
3
Разработка в 2026

Клод, вот идея, помоги продумать архитектуру, использую <стек>, задай вопросы
Класс, опиши теперь всё в документ
Класс, собери план работ
Класс, раздели какие задачи сделаешь сам, какие надо мне
Класс, напиши промпты
Класс, вот промпт, сделай
Класс, сделай ревью кода

deploy
😁7🌚1
ИИ, нац. безопасность и умение выкручиваться

Продолжаю предыдущие размышления по мотивам ИИ-новостей.

Что произошло.

⏺️9 июня Anthropic выкатила в claude Fable 5 - мощную, чертовски умную модель. Через 4 дня вмешалось правительство США с экспортным контролем и наложило ограничения на использование модели для иностранных граждан. Так как не было механизмов у компании обеспечить эти ограничения, модель, как и предшествующую фейблу Mythos, прикрыли для всех.

⏺️Великобритания попросила исключение для своих граждан. США отказали.
Тут немного остановлюсь. Великобритания и США состоят в одном разведальянсе Five Eyes. Это та самая киношная связка, где страны делятся друг с другом разведданными, ЦРУ / MI6 и все дела. И вот в доступе к языковой модели Штаты отказывают ближайшему разведпартнёру.

⏺️Затем случился G7, все ИИ-топы там участвовали. О чем договорились, точно не известно, да и договорились ли. В целом всё равно, ибо в наши дни договоренности всё равно все игнорят. Упоминаю это, только чтобы подчеркнуть масштаб внимания к теме.

Так что дальше будет с доступами?

❇️ С одной стороны, Anthropic вернул доступ к Mythos ключевым партнерам. То есть переговоры с правительством несут плоды.

❇️ При этом Anthropic обновила privacy policy для claude.ai: с 8 июля вводится частичный и не совсем прозрачный KYC (проверка личности). Это не супер инновация для рынка: для использования некоторых моделей OpenAI по API тоже нужна верификация. Но то - профессиональное, программное использование моделей.
Хотя, как оказалось, и b2c'шные эппы тоже можно поюзать профессионально: поговаривают, что Alibaba создавала тысячи и даже десятки тысяч аккаунтов в claude для улучшения своих моделей.

❇️ 26 июня OpenAI выпустила GPT-5.6 - линейку моделей под совершенно угарными для криптана названиями Sol / Terra / Luna (Luna/Terra— один из крупнейших крипто-крахов, случился в 2022 и нормально так приложил рынок. Нехороший это знак для суеверных, скажу я вам). Раскатывать модели OpenAI тоже будут плавно: сначала ограниченному кругу партнеров, далее обещают дать доступ широкой публике в течение недель, но не понятно как это будет реализовано на деле и с какими ограничениями.

А что в других частях мира Китай?

⏺️ DeepSeek закрыл раунд ~$7,4 млрд.

⏺️ Z.ai выпустили GLM 5.2. После релиза акции торгующейся структуры, связанной с Zhipu AI, подскочили на ~30%. GLM 5.2 - не аналог Fable, но это хорошая, умная модель.

И наконец! Технология.

Эта индустрия регулярно учит нас, что ограничения не останавливают, а заставляют изобретать обходные тропинки. А русского человека этому учит не только индустрия, а сама жизнь-судьбинушка. Но вернемся к делу:

❇️ Sakana AI показала Fugu. Это не модель уровня mythos, а скорее архитектура с умным подбором моделей под капотом.

❇️ Подобное сделал и OpenRouter со своим продуктом Fusion - тоже умная архитектурная обвязка моделей.

Подобные архитектуры позволяют достигать результатов, сопостовимых с Fable, используя модели подешевле. Если доверять бенчмаркам. Видимо именно подобного рода технические и архитектурные ухищрения и останутся весьма актуальны для части мира.

Вывод: вы почитали пролог к тому, как проблемы нац. безопасности лишают вас возможности билдить SaaS на 10000 MAU, делать таблички начальству и генерить мемасики в партнерстве с топовым мозгом.
Please open Telegram to view this post
VIEW IN TELEGRAM
5
Дружественный проект ищет разработчика-стажера

Проект:
Гайз, ну это супер уникальный проект в medtech, зарегистрированный в Китае, участник классного китайского инкубатора. Ищет к себе frontend-разработчика на неоплачиваемую стажировку.

Проект планирует привлечение инвестиций. В России занял тертье место по итогам акселератора Сеченовского университета и третье место на конкурсе инноваций ШОС.

Команда междисциплинарная: в коре сейчас 10 человек: разработчики, реабилитологи и киношники (которые делают отменный визуальный контент). Разработкой занимаются два бэкендера и специалист по компьютерному зрению и ИИ.

Что нужно будет делать:
— Разрабатывать новые компоненты и экраны в существующем Vue-приложении (онбординг, экраны тренировок, настройки профиля)
— Интегрировать фронтенд с REST API бэкенда (сбор данных пользователя, получение планов тренировок)
— Адаптировать интерфейсы под мобильные устройства (большинство наших пользователей заходят с телефонов)

Стек:
— Основа: Vue 3, Composition API, <script setup>, Vue Router, Pinia, Vite, JavaScript ES6+, адаптивный дизайн
— Стилизация и UI: Tailwind CSS, Scoped CSS; в планах переход на Material UI
— Работа с данными: REST API, localStorage, composables
— Дополнительно: Git 

Необходимый минимум:
Vue, HTML, JavaScript, CSS + SCSS

Писать можно проджекту Саше
2👍2
Я, когда вижу баг в своем сервисе за 10-15 баксом = 😥
Тем временем anthropic, продающий подписки за 200 = 💳
Please open Telegram to view this post
VIEW IN TELEGRAM
😁7
Это что за гениальный онбординг
😁41
А я говорила - так себе идея называть модели как крипту 😏
Please open Telegram to view this post
VIEW IN TELEGRAM
2😁2
Сервисы для веб-скрейпинга

Чем пользуюсь на проектах:

1. ScraperAPI - база.
Вытаскивает HTML, json или текст страницы. Работает надежно, справляется с ~95 задачами из 100 с первого раза. Подходит когда нужно на потоке скрейпить.

2. Firecrawl - база с допами.
Вытаскивает HTML и markdown страниц. В целом делает то же самое, что и первый, но функциональностей больше: например, структурирование содержания страниц в определенной структуре на потоке (встроенная LLM со structured output) или мониторинг изменений на странице. Сервис - классная находка. Выбор сюда, если нужны шире функциональности или если прайс подходит больше.

3. Browserless - когда другие сервисы бессильны.
На сложных кейсах лучше обходит защиты. Через browserql настраивается пошаговое прохождение поп-апов и прочего, что мешает дойти до контента. Муторно, но иногда безальтернативно.

Раньше базой был Apify. Прости дружище…
На данный момент он остался в каких-то старых сценариях и в тестах, когда нужно скрейпить какой-то конкретный источник, типа телеграма, гугла или линкедина. Но стал систематически проигрывать альтернативам.

Резюмирую: ScraperAPI / Firecrawl - дефолт, Browserless - fallback
4
Крутой практический бесплатный образовательный ресурс про ИИ

https://aiforactualwork.com/

Начинается с супер базы, но потом идут прямо инженерные объяснения: ветки, коммиты, harness, engineering loop и пр. Думаю разным уровням будет полезно чтобы либо узнать, либо систематизировать знания.

Чудесно подходит для не технарей - поможет перестать переживать, что не вайбкодите, а может и поможет начать 👨‍💻

Сделала команда компании Remote. Ресурс бесплатный и довольно крутой. Уже получила позитивную обратную связь от друзей, кому рекомендовала до того, как написать сюда.

Если попробуете - делитесь обратной связью!
Please open Telegram to view this post
VIEW IN TELEGRAM
👍32
Невероятная находка, либо я чего-то не понимаю

https://www.lennysproductpass.com/ - Product Pass идёт бонусом к подписке на Lenny's Newsletter и дает годовые подписки на довольно крутые продукты: Supabase, Higgsfield, Runway и пр.

$400/год за тариф Insider (34 инструмента)
$200/год за тариф Annual (21 инструмент без трёх перечисленных).

Поясню:
Higgsfield Pro — $348/год,
Supabase Pro — $300/год.
Вместе $648 против $400 за подписку.
Выгода $248 на двух сервисах.

Супер выгодно, если пользуетесь систематически хотя бы двумя сервисами из списка + появляется возможность затестить кучу других.

Смущает только парочка моментов.
- Первый - «Codes are limited — claim yours now!». Купить подписку и не получить выгоду обидненько.
- Второй в terms: existing customers и prior paid users могут быть ineligible. То есть если вы уже платите за Supabase - оффер вероятно не для вас. Ну или если не лень делать миграцию...

Сам ньюзлеттер судя по отзывам довольно хорош. Так что не буду говорить, что настолько обидно купить и не получить выгоду. 1 выгода допом к ньюзлеттеру - уже приятно.
Разница между Claude и ChatGPT на конкретных примерах

Кейс 1. Claude.

Разрабатываем решение на базе модели Gemini 3.1 flash-lite. Opus планирует разработку, опираясь на мои вводные данные о модели / логике работы и пр. В какой-то момент в ходе рассуждений Opus решает, что я ошиблась, ведь модели 3.1 flash lite не существует
Последний известный опусу релиз gemini был 2.5. Opus с таким убеждением и завершает работу, вкручивает в архитектуру не ту модель, и уже в результатах я вижу ошибку. Он ни в интернет не сходил, ни меня не переспросил, чтобы перепроверить несостыковку. Просто решил и сделал. Такой он, высокомерный, бесящий, но часто полезный клод.

Кейс 2. Codex.

Хочу продумать интерфейс страницы, чтобы показывать пользователю много-много источников в dailyn. Ставлю задачу Sol, прошу подумать как всё отобразить и сгенерить пример страницы. После этого в рассуждениях он выбирает несколько моих конкурентов, ходит к ним, делает competitive research по UI и в итоге генерит html на основе собранного исследования, о котором я не просила. Wow.

Это иллюстрации к одному глобальному отличию, которое я из раза в раз наблюдаю за моделями: Claude замкнут на задаче, на контексте, GPT много смотрит вовне.
Плюсы второго по изложению очевидны (тк первый кейс негативный), но я подсвечу и плюсы первого:

1. Замкнутость может быть хороша для безопасности - не сделает лишнего, не лезет в другую папку на всякий случай.

2. Замкнутость заставляет быть креативнее в условиях ограниченных ресурсов. GPT сильнее “усредняет”.

Да, звучит как требующая эмпатии разница между интроверотом/экстравертом.

Вывод
: и с обращением к llm вместо человека иметь дело с тонким устройством души разработчика всё равно придется
Please open Telegram to view this post
VIEW IN TELEGRAM
👍42
Что я поняла о разработке с агентами

Мой основной инструмент для разработки - Codex. Есть много задач, которые решаются клодом или обоими инструментами вместе, но где пишется основная часть кода - это кодекс. Поэтому опираюсь на его особенности и функциональности.
* Пост применим не только к разработке - а к любой задаче при организации работы с агентами

1️⃣ Доки

В папке проекта / репозитории должны быть очень хорошо организованные и всегда актуальные файлы, описывающие логику продукта и работы с кодом. Я видела кучу разных схем разработчиков, как они организуют свою работу с агентами, и всё сводится к одному:

1) должен быть единый не слишком длинный центр навигации со сводом правил, в каких случаях куда идти, где и как писать код,
2) чтобы этот центр навигации не был избыточным, добавляются кастомные, по-разному устроенные, детализирующие проект пояснения.

Центральный док модель читает каждый раз. На основе него принимает решения, какие еще детали ей нужны для выполнения конкретной задачи. Так даётся вся нужная инфа и не перегружается контекст.

Должно быть конкретно, без противоречий и повторов. За актуальностью доков важно следить. Это базовая база организации работы с агентами.

Примеры доков:

1. agents.md / claude.md - центр, который описывает что вообще происходит на проекте и как устроен репо. Тот самый центр навигации
2. продуктовые доки, описывающие как работает продукт, путь пользователя и пр.
3. технические доки, описывающие архитектуру, стек, деплои и пр.
4. ревью доки, описывающие правила ревью кода,
5. командные вики, чтобы не писать вручную,
6. доки с бэклогом задач с чеклистом, в идеале разбитые на этапы. Модель берет последовательно этапы и проставляет галочки в чеклисте, всегда есть актуальный статус разработки и куда движется проект.
7. док со стилем кода, описывающий вкусовые предпочтения и правила написания кода с примерами, и пр.


2️⃣ Ценность планирования

Если нужна автономия - нужна детальнейшая декомпозиция плана. Более того, модель должна понимать цели работы, границы, критерии приёмки. Можно потратить дни на это планирование еще до начала разработки, если хочется потом отдать агенту самостоятельно работать с минимальным личным участием. И этого все равно бывает недостаточно. Где-то чуть-чуть недодуманная деталь = простор для самостоятельного принятия кодексом отстойного решения. А кодекс в отличие от клодика, очень даже любит принимать решения и не упоминать об этом. Так 6 итераций спустя становится понятно, что дом горит.

Истории "ночного сотрудника" очень воодушевляют, но не всегда кажутся реалистичными. Я так оставляю только те задачи, которые ну максимально понятны и декомпозированы. То есть совсем не так часто, как хотелось бы. И оставляю с надсмотрщиком (об этом в конце)

3️⃣ Ценность контроля

Как ни пыталась распланировать всё в деталях, всё равно в процессе разработки вылазят новые нюансы и непредвиденные обстоятельства. Нужны контроль и корректировки/уточнения плана по ходу. Есть точки контроля, которые требуют человека, а есть то, что верифицирует модель.

1) Контроль человеком:

Повторю уже упомянутый контроль человеком плана, описания ожидаемых результатов, критериев приёмки.

При этом при планировании разработка должна биться на части, между которыми требуется человеческий инпут: чаще всего проверка через человекочитаемый интерфейс, например, проверка пути пользователя. А так ли работает, как задумывалось? Тут человек лучше модели может оценить соответствие результата своим ожиданиям.

2) Контроль моделью:

Тесты! Модель пишет код и тут же тесты для проверки написанного куска кода, написанной функции и пр. Тут чатик лучше меня сформулировал, какие уровни автономной проверки нужны для четкой разработки и могут быть выполнены им самим:

dry run — пройти сценарий без реальных изменений;
static checks — проверить типы, линтер и сборку;
smoke — убедиться, что приложение запускается и основные функции работают;
unit — проверить отдельные функции;
integration — проверить взаимодействие компонентов;
E2E — пройти пользовательский сценарий целиком;
regression — убедиться, что исправленные ошибки не вернулись;
edge cases — проверить границы и нештатные ситуации.


🙌 И бонусом про надсмотрщика

Считаю супер фичей кодекса то, что он может из одного чата контролить другие. Вот вы уже хотите пойти спать, и хочется оставить работу, но под присмотром. Просим кодекс из соседнего чата поставить себе таймер, раз в час просыпаться и проверять - ок ли идет работа.

Но опять же - нужно сильно подумать над критериями, а что есть “ок”? Где тот момент, когда кодекс должен вмешаться и прервать работу. И, наоборот, каковы критерии запуска следующего этапа разработки.

Резюмирую: для разработки, да и любой работы с агентами, нужны: актуальный контекст, план и контроль.

Вывод: очевидно, но в любой сфере жизни, чтобы получить желаемый результат, надо очень, ОЧЕНЬ, хорошо формулировать хотелки.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍21💯1
Про экспертные объяснения здравого смысла

Забавно, как эксперты дают объяснения понятных всем вещей, но под новым углом.

Помните, во временя распространения ковида гулял мем, что он сниспослан человечеству, чтобы научить гигиене. Врачи в своих рекомендациях, распространяемых СМИ, рассказывали как важно, и как правильно, мыть руки: 20 секунд, тщательно протирая их друг об друга 😁

Видимо AI нам послан, чтобы напомнить, как правильно думать и делать: хорошо определить реальную решаемую задачу → составить план решения → прогнать тест на набольшой объем → проверить → скорректировать план → перезапустить тест итд. И только затем финализировать решение. Эксперт назовет это engineering loop. Хотя вроде здравый смысл.

Хорошо врачи деньги не брали за рекомендацию соблюдать правила гигиены, с ИИ совсем другая история.

Вывод: не могу сказать, что ковид со своей задачей справился, посмотрим как будет с ИИ.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍21
Astra + Remotion + 11 итераций = продуктовое демо 😌
This media is not supported in your browser
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2