Айтигребец
докупить подпискочку за 20$ и "запрячь" все три модели - является отличной идеей.
Ai-Review механизм
Так и вышло, подписка за 20$ получилась прекрасным дополнением к клоду за сотку.
sol покрывает найденных 58% проблем, а всё семейство в сумме - 79%.
3.1 pro норм, но будто бы того не так чтобы стоит того если рядом есть опус, фейбл и sol с братьями поменьше. Получается 300 прогонов = 17$ по API.
Модели клода клодом не оцениваю по понятной причине (судья напомню у меня Fable).
Хотя ладно, добавлю ради спортивного интереса...🤟
Так и вышло, подписка за 20$ получилась прекрасным дополнением к клоду за сотку.
sol покрывает найденных 58% проблем, а всё семейство в сумме - 79%.
3.1 pro норм, но будто бы того не так чтобы стоит того если рядом есть опус, фейбл и sol с братьями поменьше. Получается 300 прогонов = 17$ по API.
Модели клода клодом не оцениваю по понятной причине (судья напомню у меня Fable).
Хотя ладно, добавлю ради спортивного интереса...
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3❤1
Если вы уже работаете с ИИ-агентами, вы примерно среди 0,14% людей на планете.
По июльским оценкам ourworldindata, около 71% трудоспособного населения мира ещё не использовали ИИ. Платные подписки занимают ещё меньшую долю. Даже Codex, один из крупнейших агентных продуктов, насчитывает чуть больше 5 млн активных пользователей в неделю. Пока разработчики делегируют агентам рефакторинг, тесты и многочасовые задачи, большая часть человечества ещё ни разу не открывала ChatGPT или его аналоги.
Выводы даже и не знаю какие тут можно сделать😐
По июльским оценкам ourworldindata, около 71% трудоспособного населения мира ещё не использовали ИИ. Платные подписки занимают ещё меньшую долю. Даже Codex, один из крупнейших агентных продуктов, насчитывает чуть больше 5 млн активных пользователей в неделю. Пока разработчики делегируют агентам рефакторинг, тесты и многочасовые задачи, большая часть человечества ещё ни разу не открывала ChatGPT или его аналоги.
Выводы даже и не знаю какие тут можно сделать
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4
AI-инженерия с нуля — Полный гайд для разработчика [2026] 🐸
https://youtu.be/WT0yDhfOjaA
Минин наскрябал видосик на час про разработку агентов в 2026 и в целом базу по "как работает сегодня AI в прикладном смысле".
За пол года ничего не изменилось - всё это описывал вот тут в пяти частях. Кому интересно почитать - вэлкам. Ну или к Минину в видосик по ссылке выше если так нагляднее.
начало можно скипать если инфа для вас очевидна. с 14-ой минуты плюс минус по делу.
https://youtu.be/WT0yDhfOjaA
Минин наскрябал видосик на час про разработку агентов в 2026 и в целом базу по "как работает сегодня AI в прикладном смысле".
За пол года ничего не изменилось - всё это описывал вот тут в пяти частях. Кому интересно почитать - вэлкам. Ну или к Минину в видосик по ссылке выше если так нагляднее.
начало можно скипать если инфа для вас очевидна. с 14-ой минуты плюс минус по делу.
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥3👎2
МурМур хэш?
Наткнулся в IOS-клиенте Telegram на вызов murmurHash. Оказалось, что реально такой существует🐱 🐱
Наткнулся в IOS-клиенте Telegram на вызов murmurHash. Оказалось, что реально такой существует
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1❤5😁4🤔2
Forwarded from Neural Shit
This media is not supported in your browser
VIEW IN TELEGRAM
когда в 40 лет решил заняться спортом
1😁13💯3
Айтигребец
Люто бомбит от того как @durov сломал @gif
Замена @gif уже тут - @gifer 🥳
Увидел, что это не только моя боль и решил создать inline телеграм бота для нормального поиска гифок - таким каков был @gif до момента поломки.
Как пользоваться?
и выберите котика. Он сохраняется в ваши личные гифки. Всё просто ❤️
Что под капотом
Я пошёл немного дальше и предобрабатываю поисковой запрос фокусом на русский язык. Я замечал явную деградацию выдачи даже в старом нативном боте. Опечатки, сложные русские слова, аббревиатуры - оно часто ломало поиск и нужно было придумывать какой-то синоним или вспоминать как это на английском пишется = трата времени.
В техническом плане - довольно "дефолтный" для всех моих пет-проектов стек - тайпскрипт, серверлесс на aws, dynamodb, s3, cloudfront, cloudflare, lamdas, sqs.
В общем, должно быть удобно для тех, кто пользовался @gif'ом
Буду рад фидбеку и распространению по друзьям ^^🤟
Увидел, что это не только моя боль и решил создать inline телеграм бота для нормального поиска гифок - таким каков был @gif до момента поломки.
Как пользоваться?
В любом чате напишите "@gifer кот"
и выберите котика. Он сохраняется в ваши личные гифки. Всё просто ❤️
Что под капотом
Я пошёл немного дальше и предобрабатываю поисковой запрос фокусом на русский язык. Я замечал явную деградацию выдачи даже в старом нативном боте. Опечатки, сложные русские слова, аббревиатуры - оно часто ломало поиск и нужно было придумывать какой-то синоним или вспоминать как это на английском пишется = трата времени.
В техническом плане - довольно "дефолтный" для всех моих пет-проектов стек - тайпскрипт, серверлесс на aws, dynamodb, s3, cloudfront, cloudflare, lamdas, sqs.
В общем, должно быть удобно для тех, кто пользовался @gif'ом
Буду рад фидбеку и распространению по друзьям ^^
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥15❤4👍1
Forwarded from Вайб-кодинг
— OpenAI решила задачу Навье — Стокса. Математика решена!
— Нет, не решена. Ты вообще знаешь, что такое Навье — Стокс?
— Нет. А ты?
— Нет.
— Нет, не решена. Ты вообще знаешь, что такое Навье — Стокс?
— Нет. А ты?
— Нет.
❤8😁8
Вышел Suno 6 😞
Вас тоже убивает то, что сейчас слушают таксисты, да?😢
Не так я думал ai будет менять мою жизнь...
Так что качество нейротреков соссмыслом про пацанских волков и любовную любовь в такси чуть подрастет.
Вас тоже убивает то, что сейчас слушают таксисты, да?
Не так я думал ai будет менять мою жизнь...
Please open Telegram to view this post
VIEW IN TELEGRAM
Suno
Introducing v6
A New Generation of Music Models, in Partnership with the Music Industry
😁5👍2🔥2😱1
Forwarded from Neural Shit
Антропики выкатили жирнющий отчёт о использовании Клода с декабря 2025 по август 2026.
Если вкратце: восемь месяцев они отслеживали, кто и как пытается абузить Клода в обход их фильтров. И судя по отчёту фильтры местами держатся на честном слове и изоленте.
Выбрал самое интересное:
1. Китайские ИИ-лаборатории доили Claude
Alibaba, DeepSeek, Moonshot/Kimi, Xiaomi и другие китайские компании в библейских масштабах вытаскивали из Claude данные для обучения своих моделей.
Alibaba, например, выкачала больше 150 млн диалогов и специально заставляла Claude выплёвывать цепочку рассуждений, чтобы потом скармливать эти рассуждения Qwen для дистиляции. Moonshot и DeepSeek пошли путём ещё веселее: часть запросов своих пользователей они втихую пересылали в Claude Opus, а ответ возвращали как свой. Таким макаром DeepSeek однажды случайно отправил Anthropic действующие доступы от базы российского госведомства, связанного с Минобороны. Таким же образом утекал и внутренний софт китайской полиции для отслеживания людей.
2. Йеменцы и ракеты
Группа из северного Йемена решила, что незачем нанимать программистов, есть же Клод, ёпта. Claude Code запрягли писать софт управления и наведения для разных вариантов ракет и прочих взрывных ништяков. Самое прекрасное: у одной ракеты бортовой компьютер был уровня обычного смартфона и её даже реально запустили. Антропики пишут, что испытание закончилось хуёво: спустя несколько часов разработчики вернулись к Клоду уже с телеметрией разбираться, почему эта хуйня упала.
3. Дейтинг-фермы
Китайская студия сделала 20+ скамных приложений для знакомств и заселила их виртуальными барышнями на базе Claude. За две недели более 4700 ИИ-персонажей успели пообщаться минимум с 25 тысячами человек.
Чтобы мамонты не заподозрили неладное, наняли ещё и живых людей (примерно одного кожаного на трёх ботов). Они подключались к видеозвонкам, подписывались в соцсетях и прочими способами подтверждали, что "девушка настоящая". После этого общение снова брал на себя Клод, а пользователь продолжал покупать внутри приложения монетки для переписки.
4. Самопересобирающаяся малварь
Русскоязычная кибершпионская группа, которую Антропики связывает с Midnight Blizzard, собрала почти идеальный конвейер: ИИ-агенты проверяли, палятся ли их трояны антивирусами. Если да, то агенты сами лезли в исходники, правили вирусы, пересобирали и снова проверяли. И так по кругу, пока антивирусы не переставали замечать малварь. После этого свежая версия вируса сама отправлялась на боевые серверы.
5. Автономный рой FPV-камикадзе
В России небольшая команда пилила проект DronDoc/Serafim. Это автономный рой FPV-дронов-камикадзе. Claude помогал писать почти весь софт: координацию роя, наведение по камере, поиск операторов противника, прошивку и логику атаки. На борту предполагалась маленькая локальная модель, которая решала, атаковать, наблюдать или возвращаться. Отдельный компьютерный классификатор обучали на реальных фронтовых видео. До подтверждённого применения в бою вроде как дело не дошло, но код уже заливали на реальные платы и гоняли вместе с железом.
6. Иранские спецслужбы тоже не отстают: эти клепали вредоносные расширения для Firefox под видом утилит для проверки времени намаза, чтобы массово собирать данные о пользователях соцсетей. Параллельно строилась система Arman, где на человека можно было собрать досье с национальным ID, убеждениями, судимостями, соцсетями и дальнейшими "действиями". Через Claude они прогнали анализ 155 тысяч твитов.
7. Вайб-хакинг
Один из связанных с ShinyHunters чуваков скачал 1,8 млн Android APK, автоматически декомпилировал их и сканировал на предмет забытых API-ключей, токенов и прочих подарков от криворуких разработчиков. Найденные ключи потом использовали для взломов. А если попадался ключ от Claude, то вообще красота: он использовался уже для следующих атак. Anthropic называет такой подход vibe hacking. Т.е. мамкиным хакерам уже ненужно разбираться в инфраструктуре компании. Он просто тыкает агента палкой и говорит: "Вот тебе доступ, найди что-нибудь ценное и спизди". А дальше нейронка сама изучает систему, пишет и запускает скрипты, ковыряет API и базы и повторяет всё это, пока не доберётся до результата.
Ну и в итоге, получается, что "РЯЯЯЯЯЯ!!! ИИ УНИЧТОЖИТ ЧЕЛОВЕЧЕСТВО" пока не случилось. Зато стадия "ИИ помогает человечеству уничтожать друг друга быстрее и дешевле" уже во всю идёт по плану.
Если вкратце: восемь месяцев они отслеживали, кто и как пытается абузить Клода в обход их фильтров. И судя по отчёту фильтры местами держатся на честном слове и изоленте.
Выбрал самое интересное:
1. Китайские ИИ-лаборатории доили Claude
Alibaba, DeepSeek, Moonshot/Kimi, Xiaomi и другие китайские компании в библейских масштабах вытаскивали из Claude данные для обучения своих моделей.
Alibaba, например, выкачала больше 150 млн диалогов и специально заставляла Claude выплёвывать цепочку рассуждений, чтобы потом скармливать эти рассуждения Qwen для дистиляции. Moonshot и DeepSeek пошли путём ещё веселее: часть запросов своих пользователей они втихую пересылали в Claude Opus, а ответ возвращали как свой. Таким макаром DeepSeek однажды случайно отправил Anthropic действующие доступы от базы российского госведомства, связанного с Минобороны. Таким же образом утекал и внутренний софт китайской полиции для отслеживания людей.
2. Йеменцы и ракеты
Группа из северного Йемена решила, что незачем нанимать программистов, есть же Клод, ёпта. Claude Code запрягли писать софт управления и наведения для разных вариантов ракет и прочих взрывных ништяков. Самое прекрасное: у одной ракеты бортовой компьютер был уровня обычного смартфона и её даже реально запустили. Антропики пишут, что испытание закончилось хуёво: спустя несколько часов разработчики вернулись к Клоду уже с телеметрией разбираться, почему эта хуйня упала.
3. Дейтинг-фермы
Китайская студия сделала 20+ скамных приложений для знакомств и заселила их виртуальными барышнями на базе Claude. За две недели более 4700 ИИ-персонажей успели пообщаться минимум с 25 тысячами человек.
Чтобы мамонты не заподозрили неладное, наняли ещё и живых людей (примерно одного кожаного на трёх ботов). Они подключались к видеозвонкам, подписывались в соцсетях и прочими способами подтверждали, что "девушка настоящая". После этого общение снова брал на себя Клод, а пользователь продолжал покупать внутри приложения монетки для переписки.
4. Самопересобирающаяся малварь
Русскоязычная кибершпионская группа, которую Антропики связывает с Midnight Blizzard, собрала почти идеальный конвейер: ИИ-агенты проверяли, палятся ли их трояны антивирусами. Если да, то агенты сами лезли в исходники, правили вирусы, пересобирали и снова проверяли. И так по кругу, пока антивирусы не переставали замечать малварь. После этого свежая версия вируса сама отправлялась на боевые серверы.
5. Автономный рой FPV-камикадзе
В России небольшая команда пилила проект DronDoc/Serafim. Это автономный рой FPV-дронов-камикадзе. Claude помогал писать почти весь софт: координацию роя, наведение по камере, поиск операторов противника, прошивку и логику атаки. На борту предполагалась маленькая локальная модель, которая решала, атаковать, наблюдать или возвращаться. Отдельный компьютерный классификатор обучали на реальных фронтовых видео. До подтверждённого применения в бою вроде как дело не дошло, но код уже заливали на реальные платы и гоняли вместе с железом.
6. Иранские спецслужбы тоже не отстают: эти клепали вредоносные расширения для Firefox под видом утилит для проверки времени намаза, чтобы массово собирать данные о пользователях соцсетей. Параллельно строилась система Arman, где на человека можно было собрать досье с национальным ID, убеждениями, судимостями, соцсетями и дальнейшими "действиями". Через Claude они прогнали анализ 155 тысяч твитов.
7. Вайб-хакинг
Один из связанных с ShinyHunters чуваков скачал 1,8 млн Android APK, автоматически декомпилировал их и сканировал на предмет забытых API-ключей, токенов и прочих подарков от криворуких разработчиков. Найденные ключи потом использовали для взломов. А если попадался ключ от Claude, то вообще красота: он использовался уже для следующих атак. Anthropic называет такой подход vibe hacking. Т.е. мамкиным хакерам уже ненужно разбираться в инфраструктуре компании. Он просто тыкает агента палкой и говорит: "Вот тебе доступ, найди что-нибудь ценное и спизди". А дальше нейронка сама изучает систему, пишет и запускает скрипты, ковыряет API и базы и повторяет всё это, пока не доберётся до результата.
Ну и в итоге, получается, что "РЯЯЯЯЯЯ!!! ИИ УНИЧТОЖИТ ЧЕЛОВЕЧЕСТВО" пока не случилось. Зато стадия "ИИ помогает человечеству уничтожать друг друга быстрее и дешевле" уже во всю идёт по плану.
Anthropic
Countering misuse of AI: September 2026 / Anthropic
Case studies from threat actors disrupted between December 2025 and August 2026 across seven areas of harm, from cyber operations to biological misuse.
❤6🤔5🫡3
Вайбкодинг добрался и до моего телевизора 🤠
Если у вас относительно свежий тв(у меня 4х летний xiaomi), то высока вероятность, что у вас внутри стоит Android, а это значит что?
Правильно - let's build somethingshit great🥳
Через меню разработчика можно открыть доступ к апи телевизора (и даже по вайваю, главное чтобы в одной сети были) и ...
Во-первых, я удалил весь предустановленный шлак, который шёл с телевизором🥳 Какую-то оболочку с рф каналами на главной, какие-то пуш уведомления с новыми сериалами кинопоиска - всё вот это вот предустановленное, которое раз в какое-то время при включении тв вылезало, игнорировалось, но тем не менее на фоне отъедало ресурсы и так не сказать что шустрого телевизора.
По итогу : х2 свободной памяти, ушли фризы (уже около 3 недель тестирую). Ось очистилась.
А вот на выходных я подумал - последняя убунту же начала нормально виртуальные мониторы поддерживать, дай-ка прикручу тв. Ну и конечно, первым что я попробовал эт миракаст и хромкаст. И какое же было моё разочарование, когда я увидел лишь фризы и задержку 500-1000мс.
МЫ с клодом сделали 150мс. Этот чугунный написал мне на СИ кодер и декодер и для андроида на жаве апп-клиент и через 10-20 итераций улучшения и ресёрчей мы вышли на уровень, который уже достоен звания "третий монитор" с управлением коннектом из трея🤟
Кроме всего прочего - он мне написал отдельный слой визуализации мышки, т.е. он на отдающей стороне вырезает её, и отдельно шлёт с приоритетом на тв чтобы латенси курсора был минимальный - чёрт, и это работает🥳
На фото вы видите кстати один из тестов - клод не мог понять где теряет 50мс и попросил меня на каком-то из этапов вывести оба counter'а и сфотографировать чтобы из внешнего источника понять latency ))
Отдельный улучшайзинг улыбнул - использование UDP вместо TCP. Шутку, которую я знал уже 15 лет про дойдёт/не дойдёт я наконец вижу в реализации🤪 (кто не понял - udp протокол не заморачивается с подтверждением доставки пакета на клиент = улучшенный latency, условный fire and forget)
В общем, рекомендую. Шанс окирпичивания минимальный, но бекапы системы всё же делайте перед тем как что-то меняете🧃
Удивительное время.Скоро все на улицу пойдём мётлами махать
Если у вас относительно свежий тв(у меня 4х летний xiaomi), то высока вероятность, что у вас внутри стоит Android, а это значит что?
Правильно - let's build something
Через меню разработчика можно открыть доступ к апи телевизора (и даже по вайваю, главное чтобы в одной сети были) и ...
Во-первых, я удалил весь предустановленный шлак, который шёл с телевизором
По итогу : х2 свободной памяти, ушли фризы (уже около 3 недель тестирую). Ось очистилась.
А вот на выходных я подумал - последняя убунту же начала нормально виртуальные мониторы поддерживать, дай-ка прикручу тв. Ну и конечно, первым что я попробовал эт миракаст и хромкаст. И какое же было моё разочарование, когда я увидел лишь фризы и задержку 500-1000мс.
МЫ с клодом сделали 150мс. Этот чугунный написал мне на СИ кодер и декодер и для андроида на жаве апп-клиент и через 10-20 итераций улучшения и ресёрчей мы вышли на уровень, который уже достоен звания "третий монитор" с управлением коннектом из трея
Кроме всего прочего - он мне написал отдельный слой визуализации мышки, т.е. он на отдающей стороне вырезает её, и отдельно шлёт с приоритетом на тв чтобы латенси курсора был минимальный - чёрт, и это работает
На фото вы видите кстати один из тестов - клод не мог понять где теряет 50мс и попросил меня на каком-то из этапов вывести оба counter'а и сфотографировать чтобы из внешнего источника понять latency ))
Отдельный улучшайзинг улыбнул - использование UDP вместо TCP. Шутку, которую я знал уже 15 лет про дойдёт/не дойдёт я наконец вижу в реализации
В общем, рекомендую. Шанс окирпичивания минимальный, но бекапы системы всё же делайте перед тем как что-то меняете
Удивительное время.
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥17
Айтигребец
Video
Что, не смешно? чего вы не смеётесь. смейтесь! 😕
Please open Telegram to view this post
VIEW IN TELEGRAM
😁12🔥2
RDP на Ubuntu?
Линукс это - просто, линукс - это счастье🥳 ай-ай, не бейте
Проблема : можно вытащить человека из windows, но windows из человека никогда
Скучаю по Teamviewer...
Раз в 10 лет нужно c телефона пару кнопок тыкнуть на ноутбуке во время прогулки. Нужен тул.
В общем, как оказалось в целом есть связка - Tailscale + Windows App (RDP)
Я не знаю что смешнее... то что аббревиатура - WAR, или то что этот "стек" можно назвать TWARь...😁
Ну так вот, он не поддерживает физические мониторы. Ну т.е. вот ты видишь как бы экран. главный. ну и хватит тебе, брат. Ну или по ssh забегай
Пришлось как всегда вайбкодить тул, который чекает RDP коннекшн и выводит окошечко с кнопочкой, по клику на которую - режим отображения мониторов меняется на "Built-in only"😆 . И тогда все аппы на одном появляются. Ну а на дисконнекте всё возвращает на место.
🧠
Ааа... при локе системы... тоже не зайти. Но ничего, прикручиваем Allow Locked Remote Desktop extension и можно жить.
Как вам новое лого и loading icon у 26.04 (на скрине выше оно в статике). Это же [censored]😕
Линукс это - просто, линукс - это счастье
Проблема : можно вытащить человека из windows, но windows из человека никогда
Скучаю по Teamviewer...
Раз в 10 лет нужно c телефона пару кнопок тыкнуть на ноутбуке во время прогулки. Нужен тул.
В общем, как оказалось в целом есть связка - Tailscale + Windows App (RDP)
Я не знаю что смешнее... то что аббревиатура - WAR, или то что этот "стек" можно назвать TWARь...
Ну так вот, он не поддерживает физические мониторы. Ну т.е. вот ты видишь как бы экран. главный. ну и хватит тебе, брат. Ну или по ssh забегай
Пришлось как всегда вайбкодить тул, который чекает RDP коннекшн и выводит окошечко с кнопочкой, по клику на которую - режим отображения мониторов меняется на "Built-in only"
Ааа... при локе системы... тоже не зайти. Но ничего, прикручиваем Allow Locked Remote Desktop extension и можно жить.
Как вам новое лого и loading icon у 26.04 (на скрине выше оно в статике). Это же [censored]
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3😁1
👏1
This media is not supported in your browser
VIEW IN TELEGRAM
Визуализатор на основе UML? 🐸
Анкл Боб (помните еще такого мужика? автор Clean Code) закинул в репу визуализатор логики - UML viewer.
Суть в том, что а архитектуру и связность компонентов и сам бизнес-процесс хорошо описывается UML диаграммами, которые если докрутить - смогут позволить эффективно смотреть на сгенерированный год как на "часть системы", нежели как на конкретные строчки кода. Кликаешь - проваливаешься глубже по слоям.
https://github.com/unclebob/uml-viewer
Мне лично тоже такого инструмента не хватает, я вайбкодил ровно такую же штуку месяца два назад, но закинул. На гифке выше промежуточный результат. Тяжело было динамически заставить модель найти границы для блоков. Но я уверен, что это возможно, нужно просто посидеть концептуально это всё описать грамотно и посидеть над этим больше пары дней. Возможно, Астра отлично справится.
Анкл Боб (помните еще такого мужика? автор Clean Code) закинул в репу визуализатор логики - UML viewer.
Суть в том, что а архитектуру и связность компонентов и сам бизнес-процесс хорошо описывается UML диаграммами, которые если докрутить - смогут позволить эффективно смотреть на сгенерированный год как на "часть системы", нежели как на конкретные строчки кода. Кликаешь - проваливаешься глубже по слоям.
https://github.com/unclebob/uml-viewer
Мне лично тоже такого инструмента не хватает, я вайбкодил ровно такую же штуку месяца два назад, но закинул. На гифке выше промежуточный результат. Тяжело было динамически заставить модель найти границы для блоков. Но я уверен, что это возможно, нужно просто посидеть концептуально это всё описать грамотно и посидеть над этим больше пары дней. Возможно, Астра отлично справится.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3
Forwarded from Борис опять
Постоянная рубрика: "блекпилл недели (и как с ним быть)"
После предыдущего болезненного опыта, где я обнаружил, что агенты ужасно пишут код и за ними потом надо неделями разгребать слоп, я задумался как быть. Это новая реальность разработки софта и мне как СТО нужно придумать как жить.
Изучая, что придумали более умные люди, я понял: ничего. Никто не знает как жить в новом мире, когда один разработчик производит столько кода, сколько в прошлом мог производить целый отдел. За пределами твиттера проблема известная (т.е. большие компании вроде Cloudflare и GitLab уже написали блог-посты), но решения никто не нашел.
На основе своего и чужого опыта придумал гайдлайны по AI разработке для нашей команды.
Основные предположения:
1. Код важен. Код это то, что действительно исполняется, а значит единственный источник истины. Все спеки это в лучшем случае искаженные описания кода, а чаще всего просто слоп-эссе на тему.
2. AI агенты это мультипликаторы скорости генерации кода. При наивном применении они перекладывают работу с автора кода на меинтейнера.
3. Главный ограничивающий ресурс это понимание кодовой базы разработчиками.
4. Деградация кода неизбежна и поддержание его качества это необходимая работа.
5. Агенты для кода ненадежны и непостоянны. Результат зависит от множества постоянно меняющихся факторов: модели меняются, сетап у всех разный, и так далее. Если что-то работает сейчас, нельзя гарантировать, что оно будет так же работать завтра.
6. Агенты для кода быстро производят техдолг и не могут самостоятельно его уменьшать.
Отсюда следующие принципы того, как может работать адекватная система:
1. Необходимо перенести работу по поддержанию качества назад с мейнтейнера на автора.
2. Люди отвечают за дизайн и архитектуру.
3. Люди отвечают за систему верификации: pre-commit, CI чеки, документация и принципы. Только люди редактируют AGENTS.md и постоянные доки.
4. Все правила, которые можно, нужно превращать в механические чеки, потому что промптинг не гарантирует, что агенты будут их соблюдать.
5. Борьба со слопом закладывается в бюджет.
6. Минимизируем человеческие затраты на ревью, максимально автоматизируем проверки и контроль качества.
Первый пункт самый главный: можно вайбкодить как угодно, если в результате у тебя рабочий код который ты понимаешь.
И конкретные практики:
1. Каждый PR не более +2к строк кода. Эмпирически найдено, что больше отревьюить невозможно.
2. Автор каждого PR сам пишет его описание по шаблону и указывает какие сущности за что отвечают.
3. Очень жесткие pre-commit и CI чеки.
4. Кастомный код-ревью бот в CI, который отсматривает каждый дифф и весь PR в целом с целью доказать, что он сломан. Промптится логом прошлых инцидентов, который пополняется только людьми.
5. Люди дизайнят скелет своих изменений в AI-assisted режиме, агенты заполняют пропуски.
6. Доки пишутся людьми, агентам запрещено их редактировать.
7. Разгребание слопа закладывается в планирование.
Всю карьеру (в эру кожаного кодинга) я считал pre-commit чеки очень бесячими и не особо полезными. Теперь же у нас самые жесткие чеки и линтеры в моей жизни. Там как базовые вещи вроде ruff и black, так и кастомные правила import linter, и многое другое. Я постоянно завожу что-то новое. Например, недавно добавил проверки на вложенность и цикломатическую сложность функций из SlopCodeBench. На днях появилась проверка всех диффов с помощью Jev.
Это более-менее сработало. Pre-commit с механически забитыми правилами позволяет видеть не совсем слоп на этапе ревью. Очень жесткий CI обеспечивает то, что слоп обнаруживается до мержа, а не после. Но появились новые проблемы.
Самая главная: актор с критиком могут очень долго итерироваться над PR без видимого прогресса. Агент делает изменения, ревьюер находит блокирующие проблемы, агент делает заплатку, ревьюер находит следующую дыру и так далее. Я видел как это происходило буквально днями, до тех пор, пока я не погружусь и не разберусь: в чем же корень проблемы? Ни одна модель (вклюбчая Fable и Astra) пока ни разу не смогла сама выбраться из этой спирали.
Вытекающая проблема: медленно. Теперь беклог PR разгребается гораздо медленнее, чем пополняется. У агентов как будто появляется новый инструмент: защита (своего кода) заебыванием. Когда ревьюер в десятый раз находит ошибку в каком-то PR возникает очень сильное желание вмержить его, чтобы просто больше не видеть. Парадоксальным образом я чувствую будто никогда в жизни столько не читал код, как в 2026.
Что иронично: ускорение от вайбкода как будто целиком компенсируется или замедлением на этапе ревью, или, если вы на вайбах, разгребанием проблем в проде спустя пару недель.
После предыдущего болезненного опыта, где я обнаружил, что агенты ужасно пишут код и за ними потом надо неделями разгребать слоп, я задумался как быть. Это новая реальность разработки софта и мне как СТО нужно придумать как жить.
Изучая, что придумали более умные люди, я понял: ничего. Никто не знает как жить в новом мире, когда один разработчик производит столько кода, сколько в прошлом мог производить целый отдел. За пределами твиттера проблема известная (т.е. большие компании вроде Cloudflare и GitLab уже написали блог-посты), но решения никто не нашел.
На основе своего и чужого опыта придумал гайдлайны по AI разработке для нашей команды.
Основные предположения:
1. Код важен. Код это то, что действительно исполняется, а значит единственный источник истины. Все спеки это в лучшем случае искаженные описания кода, а чаще всего просто слоп-эссе на тему.
2. AI агенты это мультипликаторы скорости генерации кода. При наивном применении они перекладывают работу с автора кода на меинтейнера.
3. Главный ограничивающий ресурс это понимание кодовой базы разработчиками.
4. Деградация кода неизбежна и поддержание его качества это необходимая работа.
5. Агенты для кода ненадежны и непостоянны. Результат зависит от множества постоянно меняющихся факторов: модели меняются, сетап у всех разный, и так далее. Если что-то работает сейчас, нельзя гарантировать, что оно будет так же работать завтра.
6. Агенты для кода быстро производят техдолг и не могут самостоятельно его уменьшать.
Отсюда следующие принципы того, как может работать адекватная система:
1. Необходимо перенести работу по поддержанию качества назад с мейнтейнера на автора.
2. Люди отвечают за дизайн и архитектуру.
3. Люди отвечают за систему верификации: pre-commit, CI чеки, документация и принципы. Только люди редактируют AGENTS.md и постоянные доки.
4. Все правила, которые можно, нужно превращать в механические чеки, потому что промптинг не гарантирует, что агенты будут их соблюдать.
5. Борьба со слопом закладывается в бюджет.
6. Минимизируем человеческие затраты на ревью, максимально автоматизируем проверки и контроль качества.
Первый пункт самый главный: можно вайбкодить как угодно, если в результате у тебя рабочий код который ты понимаешь.
И конкретные практики:
1. Каждый PR не более +2к строк кода. Эмпирически найдено, что больше отревьюить невозможно.
2. Автор каждого PR сам пишет его описание по шаблону и указывает какие сущности за что отвечают.
3. Очень жесткие pre-commit и CI чеки.
4. Кастомный код-ревью бот в CI, который отсматривает каждый дифф и весь PR в целом с целью доказать, что он сломан. Промптится логом прошлых инцидентов, который пополняется только людьми.
5. Люди дизайнят скелет своих изменений в AI-assisted режиме, агенты заполняют пропуски.
6. Доки пишутся людьми, агентам запрещено их редактировать.
7. Разгребание слопа закладывается в планирование.
Всю карьеру (в эру кожаного кодинга) я считал pre-commit чеки очень бесячими и не особо полезными. Теперь же у нас самые жесткие чеки и линтеры в моей жизни. Там как базовые вещи вроде ruff и black, так и кастомные правила import linter, и многое другое. Я постоянно завожу что-то новое. Например, недавно добавил проверки на вложенность и цикломатическую сложность функций из SlopCodeBench. На днях появилась проверка всех диффов с помощью Jev.
Это более-менее сработало. Pre-commit с механически забитыми правилами позволяет видеть не совсем слоп на этапе ревью. Очень жесткий CI обеспечивает то, что слоп обнаруживается до мержа, а не после. Но появились новые проблемы.
Самая главная: актор с критиком могут очень долго итерироваться над PR без видимого прогресса. Агент делает изменения, ревьюер находит блокирующие проблемы, агент делает заплатку, ревьюер находит следующую дыру и так далее. Я видел как это происходило буквально днями, до тех пор, пока я не погружусь и не разберусь: в чем же корень проблемы? Ни одна модель (вклюбчая Fable и Astra) пока ни разу не смогла сама выбраться из этой спирали.
Вытекающая проблема: медленно. Теперь беклог PR разгребается гораздо медленнее, чем пополняется. У агентов как будто появляется новый инструмент: защита (своего кода) заебыванием. Когда ревьюер в десятый раз находит ошибку в каком-то PR возникает очень сильное желание вмержить его, чтобы просто больше не видеть. Парадоксальным образом я чувствую будто никогда в жизни столько не читал код, как в 2026.
Что иронично: ускорение от вайбкода как будто целиком компенсируется или замедлением на этапе ревью, или, если вы на вайбах, разгребанием проблем в проде спустя пару недель.
👍5