Гриненко про ИИ, бизнес и образование
3.1K subscribers
111 photos
7 videos
1 file
172 links
Владимир Гриненко — ex-CTO Яндекс ID про переход из найма в свое дело и про то, как ИИ меняет правила игры. https://grinenko.pro
Download Telegram
OpenAI будет начислять по одному ресету за каждый день, пока не появится доступ к Астре. Ресет можно будет потратить в любой момент на свое усмотрение.

Что ж, может быть, мне не так уж и нужна эта Астра... Хотя доступ к Астре с накопленными ресетами звучит еще более заманчиво!

@devspotting
🔥8👍1
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥259👍3😁2😱2
Кусочек моего глобального AGENTS.md


## Clarify Before Execution

If the task wording raises any questions, or if strange, unexpected, or ambiguous details arise while working, pause before taking action and ask the user for clarification. When applicable, present the possible answers as explicit options to choose from.


Вчера записывали с Киром @geekylog демо его SDD-пайплана на основе сворма агентов поверх кастомного набора шаблонов для OpenSpec. Видео скоро выйдет на канале, а пока поделюсь одним своим наблюдением.

Классический Spec-driven development (если такая формулировка вообще может быть применима, конечно) предполагает, что пользователь формулирует задачу, модель придумывает вариант решения в виде какого-то документа, который пользователь проверяет и при необходимости корректирует до того, как начнется генерация кода.

Если пользователь действительно знает, чего хочет и готов это подробно описать — подход работает.

Но, во-первых, далеко не всегда сразу понятно, что нужно, а во-вторых, можно забыть (или полениться) расписать все детали. В таком случае модель сгенерирует кучу очевидных решений, среди которых нужно будет найти и исправить то, что противоречит чувству прекрасного пользователя.

Мне гораздо ближе подход grill-me, когда агент, получив максимально лаконичное описание того, что и зачем я делаю, сам задает уточняющие вопросы с подготовленными вариантами ответов и объяснением последствий выбора.

Это позволяет «вспомнить» и принять решения по всем важным вопросам. Причем вместо написания длинного текста с пожеланиями достаточно просто указать номера выбранных вариантов. Более того, иногда предложенные варианты оказываются лучше, чем то, что я представлял в голове до начала работы. А если по какому-то пункту не хватает экспертизы, то можно прямо отсюда отбранчеваться в отдельную сессию и разобраться перед тем, как давать ответ.

Остается только зафиксировать все ответы в документе, и это почти и будет готовая спека. При желании еще можно отправить агента-ревьювера убедиться, что действительно не осталось белых пятен, а в ответах нет взаимоисключающих параграфов.

Конечно, если вы работаете в команде, вам все равно потребуется OpenSpec или что-то подобное, чтобы иметь общий стандарт и удобно мерджить изменения от всех участников. Но вычитывать галюцинации модели уже не придется — все решения приняты.

На следующем этапе мы с Киром нарвались еще на один кейс, где мой промпт был бы полезен — уже в процессе генерации кода.

Исполнитель объявил выполненным требование про ручную проверку функциональности. Ревьювер закономерно спросил: «А руками-то кто проверял?» — и завернул его на доработку.

А так как цикл предполагал, что замечания ревьювера исполнитель должен устранять без участия пользователя, агент пустился во все тяжкие.

Вероятно «if strange, unexpected, or ambiguous details arise while working, pause before taking action and ask the user for clarification» могло здесь сэкономить приличное количество времени и токенов.

В общем, хороший агент, конечно, должен уметь работать автономно, но и при этом понимать, когда пора позвать кожаного.

@devspotting
👍11🔥61😁1
Ну что ж, посмотрим, что этот ваш AGI такое...
👍11🔥4👎2
Tibo (Thibault Sottiaux), руководитель ChatGPT и Codex, утверждает, что Астра в режиме минимального ризонинга лучше, чем Sol на high (и в ~2 раза дешевле на задачу).

Так что с точки зрения эффективности на токен Астру нужно выбирать почти для всего, а из 5.6-моделей смысл остаётся только у Луны (доступной даже без подписки) для простых задач.

Причин использовать Sol как будто не осталось. А Terra и раньше была сомнительным выбором.

Правда в комментах к треду народ жалуется, что при всей своей эффективности, Астра неистово жрет токены.

@devspotting
👍10🔥4
Мультиагентный пайплайн
1😁25👍3
Боб Мартин, автор «Чистого кода», уже несколько месяцев не проверяет код за агентами.

Объяснял он это тем, что умеет в автоматические ограничения и проверки: спеки, линтеры, измерение цикломатической сложности, разные виды автотестов, вот это вот всё.

Теперь он засомневался, нужны ли современным агентам такие строгие ограничения вообще. Говорит, модели стали астрономически лучше.

Если уже и дядя Боб (вслед за Андреем Мелиховым) движется от SDD к вайбкодингу, не пора ли готовиться к тому, что через полгодика будем разбирать мультиагентные пайплайны, которые сейчас многие активно строят?

@devspotting
👍16
OpenAI дропнули новенькую ChatGPT Images 2.5

Лучше сохраняет исходники (например, лица людей), лучшее умеет в логотипы и прочий дизайн, а заодно в 4 раза быстрее.

Ну что, дизайнеры, добро пожаловать в клуб? :)

@devspotting
🔥12😁31
В новом выпуске «ИИ — не новостей» с Сергеем @veged Бережным разбирались, как так вышло, что исследователи ИИ-агентов приходят к противоположным выводам (и почему оба правы).

А еще:

— Почему одна и та же нейронка сначала уверенно говорит, что задача не решается, а потом сама чинит её за 20 минут — и почему иногда «сделай хорошо» работает лучше подробной инструкции?
— Когда высокий reasoning помогает, а когда модель начинает сомневаться, ходить кругами и просто жечь токены?
— Почему AI-разработку почти невозможно нормально забенчмаркать и как работать в мире, где сегодняшняя best practice через две недели может оказаться анти-паттерном?
— И заодно: неужели нейронки всё-таки научились шутить?

Поставьте лайк, поделитесь видео с друзьями!

Приятного просмотра (или прослушивания, если вы слушаете нас на вашем любимом стриминге)!

@devspotting
👍11🔥3
Разработка будущего

15 октября выступаю в Питере на Разработке будущего (отдельный день в рамках Joker).

Расскажу, как заставить агентов создавать интерфейсы по гайдам, как разработать дизайн-систему, если в команде нет дизайнера и как сохранить консистентность на больших проектах.

Организаторы констатируют, что эпоха конференций про «лучшие практики» закончилась и перепридумывают подход. Мы как раз обсуждали это с Лешей Федеровым в свежем выпуске «Гриненко про».

Разработка будущего — это конференция для тех, кто уже прошёл восторг от агентов и понял, что узкое место не в моделях и не тулинге вокруг них, а в человеке по эту сторону промпта.


Состав участников получился достаточно непохожим на конференции, где я обычно выступаю — см. скриншот в посте.
Конференция платная, но ребята подогнали промокод на персональные билеты для читателей моего канала: devspotting

Так что определенно будет интересно, буду рад встретиться!

@devspotting
👍11🔥3
Недавно рассказывал, что указание агенту задавать недостающие вопросы может сильно повысить эффективность работы со спецификациями.

Но тут вышла статья IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications, где исследователи проверили способность моделей устранять критичные неоднозначности.

TL;DR для тех, кто не пойдет читать статью: пока что LLM с этим справляются так себе.

Агент может бесконечно задавать вопросы (иногда очень хорошие), но плохо понимает, какие из них действительно важны. Тогда как устранение неопределенностей принципиально влияет на результат — доля готовых к реализации спецификаций растет с 14% до 98% (в статье есть еще несколько подтверждающих тезис метрик).

Поэтому там, где важно получить полную спеку, есть смысл вместо «если постановка неоднозначна — сначала задай уточняющий вопрос» использовать что-то в духе:

Перечисли методологические решения, которые придётся принять при реализации. Для каждого укажи, следует ли решение однозначно из доступных требований. Если нет — укажи, какой информации не хватает и каким вопросом или поиском её можно получить. Не приступай к реализации, пока все пробелы не устранены.


И, возможно, стоит выделять на эту проверку отдельную роль рисерчера, чтобы избежать байаса у агента-исполнителя.

@devspotting
1👍11🔥31