AI: Грешно не пробовать
112 subscribers
24 photos
4 videos
32 links
Личный черновик о нейросетях, галлюцинациях и цифровом будущем. Пока без структуры
https://t.me/schors
Download Telegram
Прошу fable5/xhight сделать дизайн и спланировать простую задачу — выявить, что в удалённом и в локальном git репозитории тег стоит на данных, которые идентичны друг другу. Задача как часть уже написанного с использованием go-git, коммитами, пушами и так далее. Прошу сделать простой эффективный дизайн. Запустить несколько субагентов, которые с разных углов посмотрят на эту задачу и выдадут простейшее достаточное решение. Сожрав 50 зелёных президентов fable мне строит go-код с тестами, который делает локальные рабочие копии из обоих репозиториев и целую библиотеку рекурсивного обхода и сравнения. У меня конечно правило про использование сторонних библиотек осторожное. Но не до такой же степени

Ещё ситуация. fable5/xhight . В CLAUDE.md стоит правило, что записанное в CR'ку поле является достаточным для проверки такого-то состояния. Прошу в каком-то месте "и проверить состояние". Библиотека на пять файлов с пограничными случаями и обработкой ошибок. НО ПОЧЕМУ? "А, я решил, что это не важное правило", — отвечает мне клод код

gpt 5.6 sol гонит 115 фазу декомпиляции с одной и той же ошибкой "ой, а этот bool оказывается int32, потому что берётся их EAX", при том, что я на второй фазе попросил его записать это в правила

Я боюсь кода, который пишется итерационными схождениями без ревью мясных
💯1
С ИИ тоже работает "пока объяснял - сам все понял"

Если я чего-то не понял, или недопонял в плане, который предоставил ИИ, я занудно прошу пояснить с едкими комментариями:
– А сейчас клюёт?
– А как клюёт?
– А почему клюёт?
– А кто клюёт?

В ряде случаев ИИ вдруг отвечает: "А чего-то лажу я гоню, давай по другому"
👍2
Сейчас нахожусь на стадии, когда пытаюсь соблюсти баланс между скоростью и ошибками. Начал планировать на самых мощных моделях в несколько проходов, каждый раз прося подобрать модель для следующего прохода и для реализации. Скорость увеличил - у меня год строчит соннет медиум. Но, зараза, весь этот SDD (спек драйвен) начал выедать токены как медведь малину
1
Forwarded from do...while...ai (Gregory is typing...)
Типовые косяки агентов (август 2026)

У меня есть сложный проект, в котором 99% кода написано AI (код уровня подсистем ядра Linux и секурити: eBPF LSM, TPROXY, fanotify). На нём отлично видно, как кодинговые агенты лажают.

Наиболее типичные ошибки, которые я замечаю:

- Автоматические тесты через агента тестируют не реальные сценарии. Например, у юзера стартует один сервис, а в плейбуке в момент тестирования создается другой сервис. После чего, какие-то сценарии начинают валиться с ошибками и агент маркирует это как "Critical", заводит задачу "на серьезных щах" и даже порывается пофиксить.
- Агенты переусложняют реализацию. Если дать им полную свободу продуктового мышления, то они навертят кучу сложностей, которые вообще не нужны (или не нужны в ближайшие пару лет точно)
- Агенты всегда находят ошибки в ревью кода. То есть можно запускать на сложной кодовой базе ревьюер, потом фиксить его находки, запускать ещё раз, фиксить... и каждый раз получать новую порцию "проблем". После ревью агент обычно ещё делает триаж найденных задач, и часть из них становится Critical/Major ошибочно. Потому что если разбираться в продукте и его архитектуре, там из 23 найденных проблем, ну, может, три Major, остальные — можно смело засунуть в бэклог и никогда до них не дойти.
- Сложные планы агенты реализуют неэффективно. Ну то есть человек смотрит на объем работ из плана и начинает отмечать кластеры работы, группировать изменения, делать сначала code complete, точечно проверять в реальных сценариях на реальных сервера, а потом уже тестить всё полными e2e. Агент (без специальных инструкций) послушно выполняет план и постоянно сползает в сторону "после каждого изменения запустить тесты".

Сначала я думал, что проблема в моём харнессе вокруг проекта, но потом у меня появилось ещё три других проекта, где всё было совсем по-другому, а проблемы те же.

Противоядие от этих проблем есть. Нужно понимать проект (как с технической, так и с продуктовой стороны). И иногда проваливаться очень глубоко в реализацию (когда начинается очевидный булщит вместо фикса кода). Это раздражает, но пока по-другому никак.

Если что, у меня gpt-5.6-sol xhigh и Fable 5 xhigh. Другие модели работают ещё хуже (отдельная подстава с Opus 5 на который иногда делает авто-фолбэк Fable 5).



Если у вас нет таких проблем, скорее всего проект не сильно сложный. Ну или вы — чертов гений! Хочу с вами познакомиться, чтобы вы меня научили.
👍1
Please open Telegram to view this post
VIEW IN TELEGRAM
Поспорьте со мной: вайбкодинг это не про скорость. На коротких задачах это всегда медленнее. Иногда даже кратно
👍1
Media is too big
VIEW IN TELEGRAM
Галя, у нас отмена! Ребят, решил по нашей старой доброй традиции проверить, как Gemini 3.7 Flash соберет мне DOOM с одного промпта.

Нарамблил задачку, нажал «Отправить». Через десять секунд выплевывает код. Я сначала подумал, что Флешик глюканул. Открываю в браузере - это реально игра. Чет я немного шокео...

Игрульку в комменты скину
Мне тоже нравится, как с приходом агентов мы все внезапно открыли для себя канонический процесс разработки. Который все эти годы тихо лежал на полочке, в ожидании когда его пееизобретут заново.

(c) Grigoriy Dobryakov
Это прямо настолько плохо, что даже прекрасно. Я за всякое диверсити, инклюзивность, блаблаблабла. Честно. Но вот это уже слишком. Прямо как белого рыцаря в MTG заканселили
Forwarded from Путь Golang
🏳️Filipp Kulin:
Но вообще хорошая тема - собеседование с нейронкой

Ну в смысле - а как ты будешь писать с нейронкой. Что напишешь, какой простой флоу, что поверишь, что не дащь сделать, что дашь

Ну например "как ты скажешь, что в этой задаче надо использовать дженерики". Или "составь промпт, чтобы нейронка использовала в каких-то случаях интерфейсы"

Кажется собес даже легче стал. Кандидат в промпте вынужден дать область действия и триггеры. А это от него вообще и требуется на собесе
1
Моя школьная книга. Буду перечитывать на досуге
3🔥2
Ощущения от агентов/моделей by Teo
Один умный человек сказал, что работа с ИИ-инструментами - это про то, чтобы брать на себя ответственность.
Как было раньше? Нужен сайт? Берем Колю на фронтенд, мы ему доверяем, он хорошо сделает, Костяна на бэк, с ним работали, не подведет. А дизайнером возьмем Тему, человек новый, но вроде адекватный. С одной стороны, мы им доверяем, а с другой стороны, снимаем с себя ответственность за результат. Да, если парни накосячат, придется кого-то еще искать, а этих выгнать и больше им не доверять.

А как сейчас? Вайбкодим сайт. Коли, Кости и Темы уже нет, а зачем они? Есть же Клод, Кодекс и другие ребята. И каждые пять минут наш любимый ИИ-агент ставит нас перед выбором: «я развернул окружение на сервере, перехожу к следующему этапу?», «вот такой дизайн получился, тебе нравится или что-то исправить?», «да, моя вина, забыл убрать торчащий инстанс, и базу увели. Хочешь, закроем его прямо сейчас?». И всегда ты берешь ответственность на себя, хотя не дизайнер, не бэкендер и даже не фронтендер, но кто-то должен.

Я это к чему? Две недели уже копаюсь со своим личным сайтом, и меня просто бесит все, что Клод предлагает в качестве UI-решений или компонентов интерфейса, но я не могу объяснить ему, почему. Я же не дизайнер и не юиксер. Но ответственность за эти домены знаний вынужден брать на себя, принимая или отклоняя предложения моего агента.

И знаете, мне пришлось учиться. Я полез читать статьи, смотреть примеры решений, консультироваться с настоящими дизайнерами. Все ради того, чтобы принимать правильные решения, потому что я тут единственный взрослый. И кожаный.

Кстати, если интересно, могу накидать прикольные штуки для веб-дизайна и UX, которые наресерчил и применял. Подкиньте 🔥 под пост, чтобы понял
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7
Старый советский анекдот.

Встречаются два приятеля:
— Ты, я слышал, машину купил?
— Да, хорошая вещь, теперь везде успеваю. Сегодня за день успел сменить масло в двигателе, купить новые покрышки, съездить на авторынок за крыльями, сгонять в автосервис, заехать в автомагазин за тосолом... И как бы я все это без машины успел?

Стал снова актуален в мире вайбкодинга.
😁5💯1
Во. Видимо тоже сделаю. А то он дичь творит. ДИЧЬ
Forwarded from do...while...ai (Gregory is typing...)
Please open Telegram to view this post
VIEW IN TELEGRAM
👏1🎉1
Media is too big
VIEW IN TELEGRAM
Так, давайте с doodledoom закончим и пойдём в сингулярность. Мне все выходные писали в личку с требованием переделать пистолет, дуло которого смотрит назад. Ещё просили выложить игру в паблик, чтобы поиграть. Выполняю всё сразу. Пистолет переделал. Поиграть можно тут (только с компьютера)
У кого CodexBar на MacOS (это такая утилита, показывающая использование AI) — выкидывайте его. Ставьте https://github.com/adxd-og/usage-checker
* заточен под CLI Claude Code / Codex / AntiGravity
* не просит никаких лишних разрешений
* ловит сообщения cli и бросает в терминал на iTerm2 (cmux пока в разработке)
* не такой кошмарный
* в активной разработке
* имеет всякие дополнительные тулзы и mcp, типа монитора, который сообщает агентам, что они слишком много кушать

Ещё из интересного — разработчик не разработчик ни разу. Пишет AI (где тут Гриша Добряков?)

Пробуйте!!!
🔥1
Кстати о терминалах. Я немного разочаровался в cmux. Картинки я всё равно прямо в терминале не смотрю, а вот свои собственные клавиши и перехват всего и вся... я вообще не оценил.
Вот Чистяков дело говорит.
Forwarded from L'homme qui pleure
Интересно девки пляшут
Во-первых, я и без агентов так же жил, как этот господин с агентами (добро пожаловать в мой мир!)
Во-вторых, никто толком не умеет оценивать сходимость - но, повторюсь, сроки и раньше были нереалистичными (и не только по вине менеджеров, которым нужно вчера, тут я с ними солидарен, мне тоже нужно вчера)
В-третьих, достаточно знания о том, что сходимость есть, попуститесь, скатайтесь в Турцию, tamam