Если вы, как и я, не тратили 5 часов своей жизни на интервью DHH у Лекса Фридмана, то вот выше качественная саммари (мне реально качество понравилось, там внутри какой-то пайплайн?), где, думаю, есть всё главное за 15 минут чтения 👍
🔥2
Если вдруг суботним вечером вместо пива тестируете Astra (но лучше конечно совместить 🍻), то для нее лучше ставить medium effort, максимум high.
🔥3
Хорошо прослеживается взаимосвязь с тем, как модели за прошедший год становятся все более подходящими для кодинга 😎
Please open Telegram to view this post
VIEW IN TELEGRAM
Кто-то уже проходил эту "текстовую ролевую игру"? 😁Я просто ору чайкой с нее 🤣
https://opusfived.dev/
https://opusfived.dev/
opusfived.dev
Make one button blue. Change nothing else. A short interactive comedy about agentic AI assistants that can never just do the thing.
Коллеги, чем вы делаете код ревью?
У нас проекте ревью кодексом, для которого тим лид команды разрабов написал промпт на 500 строк, всех задолбал. Промпт ужасный, но чел считает что это самое красивое решение во вселенной, и уже два месяца игнорит люыбе вопросы на эту тему 😅С этим промптом кодекс в пайплайне всегда находит только 1-2 проблемы. А остальное - только в следующем пайплайне когда ты запушил фиксы. Я тут недавно поставил на среднем по размеру MR на ночь /goal и офигел, понадобилось 12 (!!!) пайплайнов чтобы этот болван наконец-таки поставил апрув 🤬 Ну и очень дохера false positives, по итогу этому ревь никто не верит и все ревьювают сами. А токены и время жгутся без пользы.
Вобщем раз разрабов убедить в том что надо что-то менять не получается (а по хорошему надо менять многое. Писать обвязку чтобы разибвать PR по файлам, ревьювать как отдельно каждый файл, так и все вместе по импортам и логике внутри системы в целом, добавлять примеры и few shot-ы, добавлять тесты и отлавливать false positives, смотреть что девелоперы чаще отклоняют итд итп), поговорил с leadership, признали проблему, и решили внедрить какую нибудь готовую классную тулу для ревью с рынка.
Я вот лично юзаю Alibaba OCR с GPT 5.6 Sol ключом, и меня все устраивает. Но американская компания не согласиться ставить у себя и особенно для кастомеров китайский софт😄 Какие есть варианты?
Слышал про опенсорсный pr-af, позиционируют себя как лучшие из лучших (но чот сомневаюсь). Есть из платных CodeRabbit и Graphite. Может у вас есть свой опыт с подобными системами? Заранее благодарен за шеринг🤝
У нас проекте ревью кодексом, для которого тим лид команды разрабов написал промпт на 500 строк, всех задолбал. Промпт ужасный, но чел считает что это самое красивое решение во вселенной, и уже два месяца игнорит люыбе вопросы на эту тему 😅С этим промптом кодекс в пайплайне всегда находит только 1-2 проблемы. А остальное - только в следующем пайплайне когда ты запушил фиксы. Я тут недавно поставил на среднем по размеру MR на ночь /goal и офигел, понадобилось 12 (!!!) пайплайнов чтобы этот болван наконец-таки поставил апрув 🤬 Ну и очень дохера false positives, по итогу этому ревь никто не верит и все ревьювают сами. А токены и время жгутся без пользы.
Вобщем раз разрабов убедить в том что надо что-то менять не получается (а по хорошему надо менять многое. Писать обвязку чтобы разибвать PR по файлам, ревьювать как отдельно каждый файл, так и все вместе по импортам и логике внутри системы в целом, добавлять примеры и few shot-ы, добавлять тесты и отлавливать false positives, смотреть что девелоперы чаще отклоняют итд итп), поговорил с leadership, признали проблему, и решили внедрить какую нибудь готовую классную тулу для ревью с рынка.
Я вот лично юзаю Alibaba OCR с GPT 5.6 Sol ключом, и меня все устраивает. Но американская компания не согласиться ставить у себя и особенно для кастомеров китайский софт
Слышал про опенсорсный pr-af, позиционируют себя как лучшие из лучших (но чот сомневаюсь). Есть из платных CodeRabbit и Graphite. Может у вас есть свой опыт с подобными системами? Заранее благодарен за шеринг
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔3
Коллеги, я просто в афиге с новой DeepSeek V4.1 Flash. 🤯 Делал тут одну фичу, прогнал код ревью Астрой - нормально все нашла как надо (4 medium, 2 low, 1 refactoring). Второй раунд в новой сессии Sol - еще три медиум ишуи, починил. По приколу запустил DS4.1 - 8 issues которые пропустила Astra и Sol 😳(4 med, 4 low), и 5 советов по рефакторингу. На том же промпте в новой сессии. Только одна оказалась false positive, остальные актуальны.
При этом модель очень быстрая, аутпуты пишет грамотно... Вобщем это заявка на то чтобы потестить ее серьезнее на разных задачах. Очень интересно... 🤔
При этом модель очень быстрая, аутпуты пишет грамотно... Вобщем это заявка на то чтобы потестить ее серьезнее на разных задачах. Очень интересно... 🤔
👍5
Насчет code review тулов - буду чекать PR-Agent, CodeRabbit, OCR, Claude Code built-in review. Но клод походу уже отваливается, потому что не умеет нативно в OpenAI модели, которые у нас дефолт на проекте, только через прокси типа LiteLLM/CLIProxy, ну и не понятно зачем нам такое усложнение менеджить в пайплайнах и агентах. Так что сегодня стартую три варианта. По итогу расскажу какие результаты и что понравилось больше.
👍3
У просьбы о гос регуляции АИ-отрасли, выдвинутой Дарио Амодеи (и примкнувшим к нему Альтманом+Маском), если так посмотреть очень интересный тайминг. Антропик вот вот должны выйти на IPO. С их цифрами в $517 млрд.🤯 комитмента в капитальную инфраструктуру к 2019 году (при ранее обещаными инвесторам всего лишь $180 млрд.) и с их revenue которую пока только ожидают в $47 млрд. к концу года (а чистой прибылью в третьем квартале всего в $1 млрд.) им нужны деньги здесь и сейчас. И для этого им надо продолжать быть лидерами рынка и переть вперед как локомтив. А что на деле?
Релиз Fable 5.1 прошел максимально тихо. Никаких восторгов, чуть больше цифры бенчей, дорого, ненадежно. Релиз Astra от OpenAI вообще рискует стать мемом с их "мы достигли AGI🙈", на деле оказавшимся просто очередной моделью в линейке, которой бы больше подошла цифра 5.7, а не 6. Да, эти модели все еще "фронтир", они круты, чтобы сделать научный ресерч, решить математическую задачу тысячилетия (не факт😄 ), или показать красивое демо про computer use. Но бизнесу нужны модели которые просто getting shit done🌡 . Предсказуемые, легкие в интеграции, недорогие. Давайте посмотрим кто сейчас у Anthropic/OpenAI в конкурентах?
Google и Meta. Вы видили чтобы они примкнули к "петиции об остановке развития AI"? Я - нет😁 Meta недавно выпустила отличную Muse Spark, которая стала прорывом по цене/качество, когда от Meta уже какбы и не ждали чудес. И сейчас в процессе новая Watermelon. У Google - отличный релиз Gemini 3.8. Обе эти компании поймали реальную нишу для бизнеса, найденую год назад еще китайскими лабами, про недорогие качественные модели, которые делают 90% качества от фронтира за 20% от их цены. По слухам Google буквально на днях достигла рубикона называемого RSI (Recursive Self-Improvement), то есть полного цикла автономии в самоулучшаемых моделях. При этом об опасности AI кричать начали не Google, после этого события, что было бы логично...🤷♂️
Потому что у Google и Meta - перспективная ниша! И что еще важнее - у них надежный cash flow. Даже если Антропик выйдя на IPO упадет в пике и это спровоцирует взрыв финансового пузыря, ни Google ни Meta не обанкротятся. В отличии от OpenAI/Anthropic, для которые текущий статус кво в виде бесконечного потока инвестиций в обмен на сайнс фикшен про супертехнологии управляющие миром - это вопрос выживания.
Конечно мы не знаем всего происходящего в недрах топ лаб. Риски AI могут быть и частично реальными. Но призывы к регулированию одновременно подорзительно выглядят слишком выгодными для лидеров (а точнее для потенциальных аутсайдеров😏) рынка. Если доступ к frontier потребует миллиардных бюджетов, лицензий и постоянных аудитов, safety превратится не в защитный механизм, а в барьер для новых и старых конкурентов.
Релиз Fable 5.1 прошел максимально тихо. Никаких восторгов, чуть больше цифры бенчей, дорого, ненадежно. Релиз Astra от OpenAI вообще рискует стать мемом с их "мы достигли AGI🙈", на деле оказавшимся просто очередной моделью в линейке, которой бы больше подошла цифра 5.7, а не 6. Да, эти модели все еще "фронтир", они круты, чтобы сделать научный ресерч, решить математическую задачу тысячилетия (не факт
Google и Meta. Вы видили чтобы они примкнули к "петиции об остановке развития AI"? Я - нет😁 Meta недавно выпустила отличную Muse Spark, которая стала прорывом по цене/качество, когда от Meta уже какбы и не ждали чудес. И сейчас в процессе новая Watermelon. У Google - отличный релиз Gemini 3.8. Обе эти компании поймали реальную нишу для бизнеса, найденую год назад еще китайскими лабами, про недорогие качественные модели, которые делают 90% качества от фронтира за 20% от их цены. По слухам Google буквально на днях достигла рубикона называемого RSI (Recursive Self-Improvement), то есть полного цикла автономии в самоулучшаемых моделях. При этом об опасности AI кричать начали не Google, после этого события, что было бы логично...
Потому что у Google и Meta - перспективная ниша! И что еще важнее - у них надежный cash flow. Даже если Антропик выйдя на IPO упадет в пике и это спровоцирует взрыв финансового пузыря, ни Google ни Meta не обанкротятся. В отличии от OpenAI/Anthropic, для которые текущий статус кво в виде бесконечного потока инвестиций в обмен на сайнс фикшен про супертехнологии управляющие миром - это вопрос выживания.
Конечно мы не знаем всего происходящего в недрах топ лаб. Риски AI могут быть и частично реальными. Но призывы к регулированию одновременно подорзительно выглядят слишком выгодными для лидеров (а точнее для потенциальных аутсайдеров😏) рынка. Если доступ к frontier потребует миллиардных бюджетов, лицензий и постоянных аудитов, safety превратится не в защитный механизм, а в барьер для новых и старых конкурентов.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🤔1
"Трудные времена создают сильных людей..." Распространите коллегам 🤗 На главной - более цензурная версия))
https://dontpastetheai.com/angry/
https://dontpastetheai.com/angry/
Dontpastetheai
Don't paste the AI
If your reply is a pile of LLM shit, you are the problem.
Утро началось не с Нескафе, а с секьюрити п...ца, который нашли на этих выходных. Оказалось ZCode воровал данные. Загружал полную историю гит изменений в .git в китайский клауд, зашифрованную их собственным приват ключом.
Zai оперативно ответили в тот же день. Вроде как быстро переобулись, убрали этот бэкдор, сказали что они не причем, и уже выложили ZCode в опенсорс по адресу https://github.com/zai-org/ZCode , чтобы код мог проходить необходимое ревью со стороны.
С одной стороны они молодцы, и опенсорс для харнеса - максимально верное решение. С другой стороны осадок вообще не приятный. Мне почему-то кажется, что это была не политика компании, а воровство данных как личная инициатива кого-то из разработки... Вобщем будем следаить за развитием событий. Отказываться от ZCode как-то уже и поздно 😅Но урок на будущее, наверное не полностью доверять закрытым тулам. Вот сейчас в связи с этим уже есть момент подумать, а насколько секьюрен CodeRabbit... 🤔
Zai оперативно ответили в тот же день. Вроде как быстро переобулись, убрали этот бэкдор, сказали что они не причем, и уже выложили ZCode в опенсорс по адресу https://github.com/zai-org/ZCode , чтобы код мог проходить необходимое ревью со стороны.
С одной стороны они молодцы, и опенсорс для харнеса - максимально верное решение. С другой стороны осадок вообще не приятный. Мне почему-то кажется, что это была не политика компании, а воровство данных как личная инициатива кого-то из разработки... Вобщем будем следаить за развитием событий. Отказываться от ZCode как-то уже и поздно 😅Но урок на будущее, наверное не полностью доверять закрытым тулам. Вот сейчас в связи с этим уже есть момент подумать, а насколько секьюрен CodeRabbit... 🤔
Code is cheap, let's talk
Inside ZCode: Silently Uploading Your Entire Git History to the Cloud
ZCode silently uploads full Git history to the cloud; this post provides a block rule and source review — checkpoint claims fall apart against the code.
🌚3
Сегодня наконец закончил эвалюейшн code review тулов.🌡 Главный инсайт что я вынес - есть огромная разница в точности ревью когда ты делаешь agentic code review (когда агент гоняет все изменения в твоем проекте связанный с MR, включая каждый файл из MR отдельно и полностью, логику между компонентами, тесты, документацию итд) и обычный per-diff ревью по строго заданной схеме. И соотвественно такая же огромная разница в цене.
Самым дорогим оказался agentic-review, baseline (без всяких тулов), с помощью GPT-5.6 Sol. Только на нашем проекте он бы стоил $3800 в месяц 🙈если запускать на каждый новый пуш в MR. Но вы офигеете сколько бы стоил DeepSeek 4.1 на таком же сценарии, жаль нам нельзя завезти DS на наш проект 🥲
Вобщем подробную статью и выводы сделаю на этой неделе🧠 Напомню, что в результатах будут Coderabbit, OCR, Codex Review, PR-Agent и бейслайн.
Самым дорогим оказался agentic-review, baseline (без всяких тулов), с помощью GPT-5.6 Sol. Только на нашем проекте он бы стоил $3800 в месяц 🙈если запускать на каждый новый пуш в MR. Но вы офигеете сколько бы стоил DeepSeek 4.1 на таком же сценарии, жаль нам нельзя завезти DS на наш проект 🥲
Вобщем подробную статью и выводы сделаю на этой неделе
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6
Чем мне нравится Z.ai - так это их клиентоориентированностью Они не так давно в X проводили опрос: "что бы вы хотели улучшить в наших моделях?". И большинство людей отвечало: "Всё круто, кроме скорости." Я соглашусь здесь. По скорости они всегда были на уровне улитки. 😅
И вот прошла буквально неделя-две и у нас новый релиз. FlashX со скоростью до 200 токенов в секунду! 🚀
На мой кодинг-план пока не раскатили🥲, вживую еще не видел. Но 200 TPS - должно быть даже быстрее, чем когда Кими 2.6 выкатывали для открытых тестов на церебрас-чипах (там где-то 150 было у меня на апи в реале?)
Ценник очень божеский, в 2,5 раза дороже обычной флэш, но в результате всё равно выходит в 3-4 раза дешевле, чем большая GLM 5.3 ($0.375/$1.25 против $1.40/$4.40). По итогу даже на лайт кодинг-плане можно будет гонять в быстром режиме, не упираясь в лимиты и без зазрения совести.😎
Короче, огонь, фича!🔥🔥🔥 Жду, жду, жду.
И вот прошла буквально неделя-две и у нас новый релиз. FlashX со скоростью до 200 токенов в секунду! 🚀
На мой кодинг-план пока не раскатили🥲, вживую еще не видел. Но 200 TPS - должно быть даже быстрее, чем когда Кими 2.6 выкатывали для открытых тестов на церебрас-чипах (там где-то 150 было у меня на апи в реале?)
Ценник очень божеский, в 2,5 раза дороже обычной флэш, но в результате всё равно выходит в 3-4 раза дешевле, чем большая GLM 5.3 ($0.375/$1.25 против $1.40/$4.40). По итогу даже на лайт кодинг-плане можно будет гонять в быстром режиме, не упираясь в лимиты и без зазрения совести.😎
Короче, огонь, фича!🔥🔥🔥 Жду, жду, жду.
🔥1
Так так так... Теперь кодить можно в Слак. Что дальше, писать лендинги в VK? 😆
Куда то мы не туда идём... 🙄
Куда то мы не туда идём... 🙄
🌚1
Ну и новый релиз🚀 от Xiaomi, и сразу в топ среди всего опенсорса. Неожиданно 😯🤔
🦄2